不是多看数字,是看懂变化。正在读取观察记录

它正在练习,
我们一起看懂进步。

从一次尝试,到一次模型更新。这里把训练进展、外部测验和仍待验证的判断分开讲清楚。

01

训练在继续吗?

等待核验最近训练状态

02

练习表现变好了吗?

需要比较同口径的前后记录

03

实际能力也提高了吗?

还要看外部测验的证据

最近检查:尚未加载最近成功取数:尚未加载计划每小时分析 · 页面每分钟检查更新
这次观察依据什么?

正在读取证据。教学内容可先行浏览。

01 / 进步,需要两种证据

练习分数,不是能力判决。

先看模型在训练中拿到了什么反馈,再看这些变化是否出现在相同条件的外部测验里。

TRAINING · 训练内表现

这批练习,做得怎样?

默认展示每道任务多次尝试的平均成功比例;切换“平均奖励”可查看训练系统的评分。两者不是同一个指标。

正在读取训练记录…
为什么分数涨了,也要谨慎?

任务难度、任务构成、评分规则都可能变化。训练内曲线描述的是这些练习上的表现,不能单凭它证明模型变得更聪明。

原理参考:奖励可以由多个评分函数组成 ↗

EVALUATION · 外部能力测验

换到测验里,还能做好吗?

优先观察相同测验版本、工具配置和统计方式下,不同训练轮次的成绩变化。

正在读取测验记录…
如何把变化翻译成人话?

只有确认指标是通过率,且测验条件相同,才能说“从 60% 到 64%,相当于平均每 100 次尝试多成功 4 次”。这是表达示例,不是小米的新成绩。

测验没有更新 ≠ 能力没有进步。不同统计方式也不能直接排高下;例如 avg@3 不等于 pass@3。

读图提醒不把训练轮次当成完成百分比,不把旧测验当成本轮成绩,也不把一个奖励数字当作“智商”。
02 / 训练在做什么

不是只读书,而是尝试把事做成。

一次训练循环的简化示意。只有取得明确状态才高亮阶段;这里不是内部操作的实时直播。

正在读取训练阶段…

03 / 动手理解强化学习

一道任务,为什么要试很多次?

不需要先懂公式。换一种结果分布,看看训练系统从中能得到什么。

ONE TASK. MANY ATTEMPTS.

16 次尝试,哪一组更有比较价值?

点选情境,再点击任意小方块查看一条操作示例。

教学示意 · 非真实训练数据
假设的编程任务修复登录程序:输入正确密码后,仍然无法登录。

    展开看一个简单计算

    这里只演示“奖励减去组内平均奖励”,省略标准差归一化、裁剪、正则项等。它不是小米训练损失的复现。

    在仅用成功 / 失败评分的组内比较里,结果有差异才有相对奖励信号。全对不代表任务永远没价值,全错也不代表模型永远做不到。DAPO 动态采样GRPO 原理可作参考;本演示不宣称小米采用相同实现。
    04 / 每小时观察札记

    留下变化,不堆流水账。

    正在读取观察记录…

    旧版记录归档 · 不用于新趋势判断

    原有文字和数据完整保留。早期记录未附可回溯的官方快照,下列内容是历史归档,不是本次重新确认的事实。

    05 / 想再懂一点

    术语,放回它该在的位置。

    先知道它在回答什么问题,再看原始名字。没有公布的口径,明确保留不确定性。

    一轮训练 Step

    通常指一轮经验收集与参数更新的计数;具体边界以训练系统定义为准。“正在第 11 轮”和“已完成 11 轮”不同。总计划未知时,不能计算完成百分比。

    一次尝试 Rollout

    模型为完成任务生成的执行过程,可以包含多轮工具调用。收集尝试还不等于已经用这些尝试更新了参数。

    练习得到的反馈 Reward

    评分可能来自测试、规则或模型评审,也可能是多项奖励的组合。0.6 不一定意味着 60% 正确。指标名中的 critic 也不能单独证明有独立 Critic 网络。

    挑选有价值的练习 Dynamic sampling

    根据尝试的结果选择训练样本。例如有的方法过滤全部成功或全部失败的题组。小米已将 avg@n 定义为:先计算每题 n 次尝试的成功比例,再对题目取平均;这不代表任务完全相同或难度恒定。

    尝试有没有变得单一 Entropy

    小米官方将此字段定义为策略的平均逐 token 熵,与输出分布的多样性有关。需要结合历史走势解释,不能把一个较小数值直接判成“停止探索”。

    更新有没有异常 Gradient · KL

    小米官方定义:梯度是裁剪前的全局梯度范数;此处 KL 比较同一批 token 在推理引擎与训练器中的 log-prob,不是相对参考模型的 KL。一个读数不足以诊断崩溃。

    一次任务有多长 Context · Turns · Tokens

    Tokens 是文本等输入输出的计量单位,不等于汉字数;Context 和轮数反映任务执行长度。更长可能意味着更难,也可能意味着低效,不能默认越长越聪明。

    失败是谁造成的 Infra error

    环境或基础设施错误与模型没有解决任务是两类问题。分母和重试规则也会影响错误率,因此应结合系统日志与连续观测解释。

    查看原始指标与可回溯快照

    展开最近一份已核验快照
    尚无已核验快照。