🧪 模型发布AI 热点解读#后训练#RL#模型
后训练的新战场:RL 与蒸馏取代预训练成为竞争主轴
当预训练堆参红利见顶,后训练(RL/蒸馏)决定模型「好不好用」。
AIAI评测 编辑部
一句话结论
当「堆参数」的红利见顶,竞争主轴转向后训练:指令微调、强化学习与蒸馏决定模型「好不好用」(工具调用、Agent 行为、指令跟随)——2026 的模型发布会,预告的往往不是「更大的预训练」,而是「更聪明的后训练」。
三个关键点
1. 预训练见顶的信号
前向算力与数据边际收益下降;差评焦点从「不知道」转向「不听指令/不会用工具」——后训练决定产品体验。
2. RL 的角色
结果级优化(数学/编码/Agent 轨迹)让「正确步骤」被强化——Agentic RL 与蒸馏结合的方案(如 O-Researcher)成为显学。
3. 对选型的影响
「同代模型差距不大、后训练差异大」——评估新模型时优先看「指令遵循与 Agent 任务」而非「百科分数」;开源小模型 + 好的后训练,可以追平更大的旧旗舰。
💡 常见问题
后训练能追平多大的差距?▾
窄任务上可以:蒸馏+RL 的小模型能对齐甚至超越教师(如成本 10-100x 下降的 Agent)。
普通人感知后训练吗?▾
感知得到:同一代模型的「好用度」差异主要来自后训练——看评测看 Agent 任务别只看分。