这批练习,做得怎样?
默认展示每道任务多次尝试的平均成功比例;切换“平均奖励”可查看训练系统的评分。两者不是同一个指标。
训练在继续吗?
等待核验最近训练状态
练习表现变好了吗?
需要比较同口径的前后记录
实际能力也提高了吗?
还要看外部测验的证据
正在读取证据。教学内容可先行浏览。
先看模型在训练中拿到了什么反馈,再看这些变化是否出现在相同条件的外部测验里。
默认展示每道任务多次尝试的平均成功比例;切换“平均奖励”可查看训练系统的评分。两者不是同一个指标。
优先观察相同测验版本、工具配置和统计方式下,不同训练轮次的成绩变化。
一次训练循环的简化示意。只有取得明确状态才高亮阶段;这里不是内部操作的实时直播。
正在读取训练阶段…
不需要先懂公式。换一种结果分布,看看训练系统从中能得到什么。
正在读取观察记录…
先知道它在回答什么问题,再看原始名字。没有公布的口径,明确保留不确定性。
通常指一轮经验收集与参数更新的计数;具体边界以训练系统定义为准。“正在第 11 轮”和“已完成 11 轮”不同。总计划未知时,不能计算完成百分比。
模型为完成任务生成的执行过程,可以包含多轮工具调用。收集尝试还不等于已经用这些尝试更新了参数。
评分可能来自测试、规则或模型评审,也可能是多项奖励的组合。0.6 不一定意味着 60% 正确。指标名中的 critic 也不能单独证明有独立 Critic 网络。
根据尝试的结果选择训练样本。例如有的方法过滤全部成功或全部失败的题组。小米已将 avg@n 定义为:先计算每题 n 次尝试的成功比例,再对题目取平均;这不代表任务完全相同或难度恒定。
小米官方将此字段定义为策略的平均逐 token 熵,与输出分布的多样性有关。需要结合历史走势解释,不能把一个较小数值直接判成“停止探索”。
小米官方定义:梯度是裁剪前的全局梯度范数;此处 KL 比较同一批 token 在推理引擎与训练器中的 log-prob,不是相对参考模型的 KL。一个读数不足以诊断崩溃。
Tokens 是文本等输入输出的计量单位,不等于汉字数;Context 和轮数反映任务执行长度。更长可能意味着更难,也可能意味着低效,不能默认越长越聪明。
环境或基础设施错误与模型没有解决任务是两类问题。分母和重试规则也会影响错误率,因此应结合系统日志与连续观测解释。