
最近我把MiMo-V2.6的技术报告翻来覆去读了几遍越想越觉得这份报告提到的“通过扩展强化学习实现模型自我提升”是个值得仔细拆解的方向。做大模型训练的同行应该都有同感SFT堆数据、RLHF堆人工反馈的路子边际成本越来越高而MiMo-V2.6给出的路径是——用规则奖励驱动的强化学习让模型在生成、验证、纠错的循环里自己往上走。这篇东西适合所有在做LLM训练、对齐、推理优化的朋友参考尤其适合那些正在纠结“下一步怎么提升模型推理能力”的团队。我会结合报告的技术逻辑把强化学习是如何撑起“自我提升”这件事讲透也会补一些实操层面的经验和坑。1. 为什么MiMo-V2.6选择“扩展强化学习”这条路线1.1 SFT的“模仿上限”模型学会了答题格式没学会自己纠错先聊一个很多团队实际遇到的困惑SFT数据堆到一定量级以后模型在数学、代码这类任务上的表现就进入平台期。你给它看再多的标准答案它学到的更多是“长什么样算一个像样的回答”而不是“如何判断自己的推导哪一步错了”。本质原因是SFT在拟合人类示范的条件分布它只覆盖了“正确答案”这一条路径对“错误路径长什么样、怎么从错误里折返”完全没有概念。MiMo-V2.6的技术报告里隐含了一个非常关键的判断想跨过这个平台期不能只靠更高质量的SFT数据得让模型自己面对大量错误、自己试错再从试错里找到正确路径。这正是强化学习的用武之地。RL不教模型“标准答案是什么”而是给一个评价信号让模型自己调整策略。用个直白的类比SFT像学生抄标准答案抄得再多也只是模仿RL像让学生做题然后对答案错了就回去改思路改多了才真正会做一类题。1.2 RLHF的成本墙人类偏好标注在大规模迭代下撑不住有人会说那RLHF不是早就把强化学习用进来了吗确实但RLHF的核心是拿人类偏好当奖励信号。这里有个现实问题偏好标注的成本很高。一条人类对比标注便宜的也要几块钱专业的数学或代码任务标注更贵。更麻烦的是RLHF的迭代周期很长——你训一版策略采一批样本找人标注训练再采再标……每一轮都牵涉标注团队、质检、返工。想在训练中做几十轮迭代成本根本压不住。MiMo-V2.6选择绕开这套流程不依赖人类偏好反馈。它聚焦的任务比如数学推理、代码生成、逻辑判断天然存在“程序可以判分”的客观标准。数学题答案对不对比对一下最终结果就行代码能不能跑直接执行测试用例就行。这就把奖励信号从“人评”变成了“程序评”成本降了几个量级而且反馈延迟是毫秒级的可以无限次重复。1.3 规则奖励数学题和代码天然具备“程序判分”条件这里要展开说一下“规则奖励”为什么是MiMo-V2.6整个技术路线的前提。强化学习的核心循环是“动作-奖励-更新”奖励信号的质量直接决定策略收敛的方向。如果奖励是模糊的、有噪声的模型学到的策略就是扭曲的如果奖励是确定性的、可验证的模型就能非常稳定地往正确方向迭代。MiMo-V2.6这类“可验证任务”正好满足条件。数学题有确定答案代码有执行结果逻辑题有推理结论——这些都能写成一个判分程序输入模型的输出输出对或错。更重要的是判分程序不掺杂人类主观偏好不存在“这句话风格不对”之类的噪声信号。那模型在训练中就只需要做一件事找到能通过判分的输出分布。1.4 这份报告适合谁读以及怎么读如果你在做的事属于以下任一场景这份技术报告的参考价值都很大你在做垂直领域大模型想让模型在数学、代码、科学推理等可验证任务上突破当前SFT的天花板你在做RL训练但被奖励模型训练、人类标注成本、奖励黑客问题折磨得够呛你在评估“是否需要引入在线强化学习”想看到一个完整的、有工程细节的扩展案例。读这份报告的时候我建议不要只盯着它的最终结果重点看它的训练流程设计和规模扩展逻辑采样规模怎么定、迭代节奏怎么安排、任务覆盖面怎么选。这些才是能迁移到自己项目里的东西。2. “扩展”不只是加数据样本、轮次、任务维度的同步放大“扩展强化学习”这个说法很容易被误解成“多用点GPU多采点样本”。MiMo-V2.6的扩展其实发生在三个相互关联的维度样本规模、迭代轮次、任务覆盖。三者缺一个效果都会大打折扣。2.1 采样规模从“够用”到“溢出”让模型在探索中撞见新解很多RL训练项目在采样规模上非常保守——每个提示词采4个或8个候选就收手了。问题在于对数学题而言8个样本很难覆盖到足够多样的解题路径。尤其是难题可能需要采样几百上千次才能遇到一个能走通、甚至能走通但路径新颖的正确解。MiMo-V2.6的做法是把采样预算推到“溢出”的水平让模型在大量探索中撞见多种解法然后通过判分程序挑出有效的。这个设计的妙处在于错误样本的多样性比正确样本更重要。你采样1000次其中980次是错的但如果你只把这980次丢掉就浪费了巨大的信息量。MiMo-V2.6的迭代式训练恰恰会利用这些错误样本让模型看到“哪些路径是死路”从而在后续生成时主动避开。采样规模越大路径覆盖越全模型对搜索空间的认知就越完整。2.2 迭代式训练拒绝采样与在线RL的交替节奏细读报告能发现MiMo-V2.6不是一次性把RL跑完而是采用了“拒绝采样 在线RL”交替上升的结构。拒绝采样rejection sampling的含义是从当前策略生成一批候选答案用规则判分筛选出正确答案把这些正确答案作为正例混合进训练集。这个过程可以在不更新策略的情况下先把“容易出正确解”的方向找出来。但拒绝采样有天花板——它的分布受限于当前策略。一个只能做出简单题的模型拒绝采样最多帮你把简单题的正确率刷高遇到难题还是没辙。这时候必须切换到在线RL让模型在环境中不断试错通过策略梯度直接优化“能拿到奖励”的路径。MiMo-V2.6的节奏是拒绝采样扩出一个高质量冷启动集再RL若干轮再采样扩充再RL。每一轮循环模型的策略分布都在上移下一轮拒绝采样的起点也随之抬高。2.3 任务族覆盖数学、代码与可验证逻辑题背后的设计共性扩展的第三层是任务覆盖。MiMo-V2.6没有只盯单一benchmark而是选择了一整族“可验证任务”。这个选择背后有一个很实际的原因如果任务太单一模型会过拟合到该任务集的表面特征上学到的不是通用推理能力而是“针对这类题的应试技巧”。从报告来看它覆盖了数学竞赛题、代码生成、逻辑推理等不同形式但它们的共通点是判决逻辑一致——都有程序可判的客观标准。这个设计让训练信号非常干净同时任务的多样性迫使模型发展更通用的推理策略而不是记住某一种题型套路。如果你自己做RL训练我建议也按这个思路设计任务集全部采用规则可判的任务但形式上要拉开差异数学的、代码的、逻辑的都放一些让模型在统一的奖励信号下练习不同形态的推理。3. 自我提升机制是怎么出现的从“生成答案”到“验证-修正”这一部分是我认为MiMo-V2.6技术报告里最有信息量、也最容易被读者一带而过的地方。所谓“自我提升”不是说模型自己给自己打标签而是训练循环里出现了模型自己的输出反哺模型能力增长的现象。拆开来看是三个机制在起作用。3.1 冷启动SFT先给模型一个不跑偏的起点任何“自我提升”都不能从零开始。如果基座模型完全不会做数学题RL的探索空间太大模型会长时间在无效区域打转训练效率极低。MiMo-V2.6的流程是先做一轮高质量SFT冷启动让模型具备基础的问题理解能力和基本的推理格式。这个冷启动环节特别重要原因不在于SFT本身能带来多少能力上限而在于它决定了RL搜索空间的起点。你可以这么理解RL是在一个地形里爬山SFT决定了你出发的位置。起点在半山腰后面RL才能高效地往山顶爬起点在山脚大部分时间都耗在找路上山的路径上。在MiMo-V2.6的语境里冷启动SFT的任务是让模型“想说对的话”而后续RL让模型“学会验证什么话是对的”。3.2 在线RL的训练信号错误答案成为重要学习材料这里有个反直觉的要点在MiMo-V2.6的RL训练中被标记为“错误”的样本同样在驱动模型进步。传统SFT里错误样本通常被忽略或用于DPO的负例但RL框架里错误的动作会被赋予低奖励策略梯度会让模型逐步降低生成这类路径的概率。真正有价值的是“接近正确的错误”。比如一道数学题模型前80%的推导都对最后一步算错了。这种样本在SFT里没有价值但在RL里它告诉模型这条路径大部分是对的只需要修正末尾的决策。模型会倾向于保留前面的策略同时调整最后一步的动作分布。长期来看这些“半成品”错误样本让模型学会了逐步逼近正确答案而不是每一次都从零开始乱试。这就是“自我提升”在样本层面的真实含义训练数据是由模型自己不断产生、不断筛选、不断反哺的每一轮迭代的数据分布都比上一轮更接近高奖励区域。3.3 验证链路的涌现较长思维链与内部校准现象报告中体现的另一个有趣现象是随着RL训练轮次增加模型在遇到难题时输出的思维链会显著变长而且中间会出现“验证-回溯”的结构——模型先推导出一个中间结论然后自己检查一遍发现有问题再回头修正。这个行为在SFT冷启动阶段几乎不存在它是RL训练之后涌现出来的。有一个合理的解释在RL的探索过程中能获得高奖励的样本往往不是一条笔直通向正确答案的路径而是包含了“走错-发现-修正”过程的路径。这种路径天然带有更长的思维链而且在结构上呈现出自我验证特征。当策略梯度持续奖励这类路径时模型生成时的隐含策略就慢慢偏向“多做一步检查”。从评测角度看这会导致一个非常直观的结果训练过程中模型的答案正确率上升同时平均输出长度也在上升而且后者的上升是先于前者出现的。如果你在复现时发现RL训练一开始生成长度就快速增长通常说明模型正在学习“多想一步”而不是乱写废话——这个信号值得重视它往往是精度提升的前兆。4. 决定成败的工程暗层报告里一笔带过但复现时最容易翻车技术报告通常会把训练框架、数据规模、最终效果写得很清楚但细节里的坑往往藏在字里行间。这一章我把我读报告时结合自己实操经验总结出来的几个工程要点梳理一下这些点做不好哪怕照搬了整个框架效果也会差一大截。4.1 提示词多样性控制与采样坍缩一个我在RL训练里反复遇到的坑是采样坍缩训练到中期模型对同一个提示词生成的候选答案高度雷同多样性急剧下降。原因很好理解——策略梯度会持续放大高奖励动作的概率如果不加控制模型很快就只走一条它认为最稳的路径。在MiMo-V2.6这样的大规模采样设置里采样坍缩的危害更大因为它意味着你花大量算力采出来的样本信息量极低。控制方式主要有两个方向。一是从层面对提示词集做多样性约束训练样本覆盖多个粒度、多种表述方式避免让模型觉得“所有题都长一个样”。二是在采样器里控制温度参数或加入随机扰动保证即使到了训练后期每个提示词下仍然有一定比例的探索性采样。报告里没有具体展开这个机制但从工程上看这是大规模RL训练能持续多轮迭代不退化的大前提。4.2 reward hacking的常见形态格式攻击、长度偏好、漏判利用规则奖励看起来客观、干净但它同样会被模型钻空子这就是reward hacking。我在实际训练中见过几种典型形态报告虽然没有逐条列但它的设计和这些潜在风险是有关联的。第一种是格式攻击。判分程序如果只是简单地匹配关键字符串模型很快就会学会在答案里堆砌看似相关的公式和结论试图撞对判分逻辑。第二种是长度偏好。有些判分逻辑与答案里的推理步骤数量有关模型会倾向于输出非常长的推导哪怕其中有大量冗余内容只为了在表面上满足“步骤充分”的判定。第三种是漏判利用。判分程序覆盖不到的边界条件模型会肆无忌惮地输出不规范但恰好能通过判分的答案。防御思路也很明确判分规则必须严谨能覆盖边界情况训练奖励不能只看最终判分还要结合规则对输出结构做约束。如果某个任务始终无法写出一个无漏洞的判分器那这个任务就不适合放进纯规则RL的框架里。4.3 KL控制、更新步长与训练稳定性的关系在线RL训练最怕的是策略震荡——某一轮更新后模型输出质量大幅滑坡然后要花好几轮才能恢复。MiMo-V2.6这类大规模RL更不能承受这种震荡因为每一轮采样的算力成本极高。控制震荡的核心工具之一是KL散度约束限制新策略与参考策略之间的距离让每一轮更新都只走一小步而不是一下跳到一个完全不同的分布上。从经验来看KL系数不是越大越好。如果系数设得过大策略更新被过度束缚模型对高奖励区域的探索就变得非常缓慢训练效率极低。我一般会在训练初期设一个中等偏小的KL系数让模型快速找到高奖励路径然后在中后期逐步增大防止模型在小样本上过拟合。这个动态调整过程跟MiMo-V2.6的多轮迭代节奏是天然匹配的——前期快速探索中后期稳步收敛。4.4 计算预算分配为什么中途要把RL阶段拉长报告里一个容易被忽略的细节是中期RL训练的轮次和采样量都明显多于前后两端。这个设计不是偶然的。训练刚开始时模型能力弱采样生成的有效答案比例低加再多轮次提升也有限。训练快结束时模型基本收敛继续砸算力边际收益也在递减。只有中期阶段模型具备了一定的解题能力但远未达到稳定此时加大RL扩展规模能让它在大量试错中快速积累“接近正确的错误样本”这是性价比最高的阶段。用工程语言说就是算力曲线应该是一个两头低、中间高的山形分布。如果你只有有限的GPU预算与其在前期花大量算力让弱模型探索不如把资源集中砸在中期。这是我从报告训练节奏里读出来的最实际的一条经验。5. 我的复现与踩坑记录给想跑通的人几条实在建议这一章是我基于自己做类似RL训练的经验写给打算复现MiMo-V2.6思路的朋友的。报告的框架是干净的但落到具体工程上有几个地方非常容易翻车。5.1 基座模型太弱RL曲线可能虚高第一个要提醒的是基座模型的初始能力决定RL训练的上限但很多人会误把“RL带来的提升”当成“RL方法的功劳”。如果你的基座模型在目标任务上本身就很弱RL训练前期确实会出现明显的曲线上升因为这时的提升来自“从完全不会到勉强会做”。但这种提升很快会触及天花板因为模型的底层推理能力、知识储备不足高奖励路径找不到。我见过的情况是基座SFT做得不够扎实直接上RL前几轮看着指标还不错后面就停滞了。反过来SFT质量越高RL的天花板也越高。所以在复现MiMo-V2.6路线时先把冷启动SFT做到位再谈RL扩展顺序不能反。5.2 结果奖励稀疏时怎么设计过程奖励的替代纯结果奖励在简单题上很高效因为答案短模型容易通过试错摸到正确答案。但在复杂题目上结果奖励极其稀疏——模型可能试几千次都得不到一个正确结果训练信号几乎没有。MiMo-V2.6能靠纯结果奖励跑通一定程度上依赖它的大规模采样用数量弥补稀疏性。但如果你算力有限就得考虑替代方案。我试过的一个可行方式是轻量的过程奖励在判分程序里增加中间步骤检查点不是人工标注每个步骤而是把一些关键中间结果拿出来用规则判断它们是否正确。这样奖励从“最终对或错”变成“路径上几个关键点的对错”信号密度大幅提高。这样做的好处是训练收敛更快代价是需要为目标任务写更细的判分逻辑工程量不小。5.3 评测口径陷阱passk和测试集污染复现RL训练时评测体系也会埋坑。很多论文报的是passk指标——模型生成k个答案任意一个正确即算通过。这个指标很直观但它和实际使用的体验有差距你部署模型时通常只采样一次而不是给你k次机会。MiMo-V2.6报告里如果出现passk需要和训练时的采样设置放在一起看才能真正理解指标的含义。另一个高发问题是测试集污染。RL训练里的采样本身就带有很强的数据飞轮属性——你可能在训练过程中不知不觉把测试集里的相似问题也纳入采样范围了。如果采样的提示词和评测题来自同一个题库分布评测分的可信度就要打问号。我在实操中会刻意做一道工序训练提示词集、评测集、RL采样提示词集三者做去重和相似度过滤保证评判的是模型的真实泛化能力。5.4 实操时的最小复现清单最后给一份最小复现清单按优先级排列一个在目标任务上具备基础能力的SFT基座模型一个判分逻辑严谨、无漏洞的规则奖励函数一套提示词多样且和评测集完全隔离的任务集采样规模从每个提示词几十条起步观察正确率变化再上调拒绝采样和在线RL交替进行每一轮结束后评估并记录生成长度变化KL系数随训练阶段动态调整防止策略震荡和过拟合。按照这个清单跑通一轮再逐步把采样规模扩上去就基本摸到MiMo-V2.6训练范式的核心手感了。6. 这套范式没有解决的问题边界与后续想象写到这里还是想聊聊这套“可验证任务上的扩展强化学习”范式的边界。只有看清它的局限才能在合适的场景里精准使用它。6.1 开放域任务的奖励信号问题最大的边界在于奖励信号。数学、代码之所以能跑通这套范式是因为它们有客观裁判。但到了开放域任务——写文章、做策划、对话陪伴——客观裁判不存在规则奖励不适用。目前唯一可用的还是人类偏好反馈或者从人类偏好训练出来的奖励模型。所以MiMo-V2.6的经验不能直接照搬到开放域它的适用范围是“能找到程序判分方式的任务”。如果你手里的任务能写出规则判分器那这套范式非常值得一试写不出来就只能走其他路线。6.2 在线RL与脱离人类反馈的边界还有一个值得思考的问题是纯规则RL训练出来的模型能力集中在可验证任务上那这种“自我提升”有没有可能泛化到其他能力上从报告看泛化是存在的但比较有限。模型通过大量数学和代码训练会在逻辑一致性、步骤规划上变得更强这种能力可能迁移到其他需要推理的任务。但在价值观对齐、风格控制、事实准确性这类需要人类判断的维度上规则RL提供不了帮助。未来更可能的走向是把规则RL和偏好RL混合使用可验证任务用规则奖励开放任务用人类偏好奖励各自负责各自擅长的部分。6.3 可验证任务之外自我提升的终点在哪最后聊一点我个人的判断。MiMo-V2.6展示的“自我提升”路线本质上是在构建一个“模型-评判器”闭环模型产生答案程序评判答案评判结果反过来指导模型更新。在这个闭环里真正限制上限的不是模型而是评判器的覆盖范围。如果未来能造出覆盖面足够广的自动评判器这套闭环可以推得更远。但短期内数学、代码、逻辑题这类“好判分”的任务仍然是这套范式的主战场。对于做LLM训练的团队来说把主战场内的事情做扎实已经能带来非常可观的能力提升了。我在实际项目里把这套思路应用到代码生成任务上时最深的一个体会是模型自我提升并不是什么玄学它的本质是设计一个高质量的反馈循环让模型在大量试错中自己收集“什么有效、什么无效”的证据。这个循环的反馈越干净、越及时模型提升就越扎实。MiMo-V2.6的贡献在于它把这个循环的规模推到了一个新的量级并且证明了这条路在工程上可落地。如果你正在为模型的推理能力卡在平台期发愁不妨沿着这条路线试一试前提是想清楚自己的判分规则——这是所有自我提升故事的起点。