🧪 模型发布AI 热点解读#深度研究#开源#RL
O-Researcher:用「多智能体蒸馏 + Agentic RL」把深度研究开源
端到端深研数据合成,让可扩展的开源深度研究模型成为现实。
AIAI评测 编辑部
一句话结论
O-Researcher 用「多智能体蒸馏 + Agentic RL」打通了开源深度研究模型的端到端路径:多 Agent 协作(分解-辩论-验证)自动合成深度研究数据,再蒸馏成开源模型——「深度研究」这一高端能力开始从闭源走下开源。
三个关键点
1. 数据合成是核心
深度研究最贵的是高质量数据;多 Agent 工作流自动「分解-辩论-验证」产出端到端数据——把数据瓶颈变成自动化流水线。
2. 与 RL 的结合
蒸馏后叠加基于结果的强化学习(sparse reward 场景由蒸馏提供密指导)——两阶段组合是「快而稳」的路线。
3. 意义
若开源深研模型质量追平旗舰,Depp Research/研究报告类场景的成本结构将剧变——企业级研究自动化的门槛进一步下探。
💡 常见问题
和 Perplexity Deep Research 什么关系?▾
前者是产品(闭源),O-Researcher 是开源模型与训练配方——你可以自托管/微调出自己的深研模型。
普通人能用上吗?▾
落地早期偏开发者向;等模型与工具链成熟后才会进入消费场景。