UCO: A Multi-Turn Interactive Reinforcement Learning Method for Adaptive Teaching with Large Lang...

发布时间:2026/8/7 12:37:02
UCO: A Multi-Turn Interactive Reinforcement Learning Method for Adaptive Teaching with Large Lang... 文章总结与翻译一、主要内容本文针对大型语言模型(LLMs)在教育场景中从"答案提供者"向"智能导师"转型时存在的动态适应能力不足问题,提出了一种基于多轮交互式强化学习的单向认知优化(UCO)方法。核心背景与问题现有方法存在两大关键缺陷:一是仅以学生输出正确性作为教学效果评估标准,无法区分学生是真正理解还是机械复述;二是不能通过交互式对话实时感知学生认知状态演变,难以动态调整教学策略以匹配学生认知水平。核心方法UCO 采用多轮交互式强化学习范式,通过师生模型持续交互生成在线训练轨迹,核心创新在于设计了两个协同作用的奖励函数:进度奖励(Progress Reward):基于信息论中的熵减过程,通过潜在能力得分(学生模型对正确答案的置信度)和语义质量得分(学生输出与正确答案的语义相似度),量化学生从困惑到理解的认知进阶;支架奖励(Scaffold Reward):基于维果茨基的最近发展区(ZPD)理论,将教学行为按认知负荷分为五个层级(元认知提示、策略提示、概念提示、分步提示、示例演示提示),动态定位学生的最近发展区,鼓励教师在该区域内提供有效教学。通过分组相对策略优化(GRPO)算法更新教师模型策略,实现以认知为导向的自适应教学优化。实验结果在 BigMath 和 MathTutorBench 两大基准数据集上