🧪 模型发布AI 热点解读#后训练#RL#模型

后训练的新战场:RL 与蒸馏取代预训练成为竞争主轴

当预训练堆参红利见顶,后训练(RL/蒸馏)决定模型「好不好用」。

AIAI评测 编辑部

一句话结论

当「堆参数」的红利见顶,竞争主轴转向后训练:指令微调、强化学习与蒸馏决定模型「好不好用」(工具调用、Agent 行为、指令跟随)——2026 的模型发布会,预告的往往不是「更大的预训练」,而是「更聪明的后训练」

三个关键点

1. 预训练见顶的信号

前向算力与数据边际收益下降;差评焦点从「不知道」转向「不听指令/不会用工具」——后训练决定产品体验

2. RL 的角色

结果级优化(数学/编码/Agent 轨迹)让「正确步骤」被强化——Agentic RL 与蒸馏结合的方案(如 O-Researcher)成为显学。

3. 对选型的影响

「同代模型差距不大、后训练差异大」——评估新模型时优先看「指令遵循与 Agent 任务」而非「百科分数」;开源小模型 + 好的后训练,可以追平更大的旧旗舰

分享:🐦 X📣 微博

💡 常见问题

后训练能追平多大的差距?

窄任务上可以:蒸馏+RL 的小模型能对齐甚至超越教师(如成本 10-100x 下降的 Agent)。

普通人感知后训练吗?

感知得到:同一代模型的「好用度」差异主要来自后训练——看评测看 Agent 任务别只看分。

📌 更多热点解读