🆓 开源AI 热点解读#DeepSeek#视觉#开源
DeepSeek V4-Flash-Vision 开源:305B 视觉模型的 MIT 发布与基准争议
DeepSeek 发布首个 V4 视觉模型(305B MoE、MIT 许可)——补上 V4 家族“看不见图”的缺口,也引发基准独立验证的讨论。
AIAI评测 编辑部
一句话结论
DeepSeek V4-Flash-Vision-Exp(305B 稀疏 MoE 视觉模型,MIT 许可可自托管)补上了 V4 家族「能读文字但不能看图」的缺口——这是首个该级别可自托管的视觉 MoE;同时它也提醒:新的基准数字需要独立验证。
三个关键点
1. 补齐多模态短板
V4 家族此前只能处理文本/代码;Vision-Exp 让长上下文 + 图像理解可以在 MIT 许可下自托管——对 RAG(图文混合)、文档智能等场景是实打实的补位。
2. 「Exp」意味着实验性
作为 Experimental 版本,官方建议生产使用前自行评测;它的意义多为「生态信号」而非「稳定产品」——开源社区可基于它做衍生。
3. 基准需要独立验证
报道普遍强调「benchmark 需要独立证明」——这本身是好事:开源生态的健康度取决于可复现性,而不是发布会数字。
对你的判断
- 开发者:需要本地图文理解(数据敏感)时可评估自托管;先跑你自己的数据集对比效果。
- 一般用户:可留意后续 Flash-Vision 的正式版与 API 上线。
💡 常见问题
V4-Flash-Vision 能商用吗?▾
MIT 许可可自由商用/自托管;作为 Exp 版本建议先做正确性与合规自测。
和 GPT-4o 视觉比如何?▾
参数规模与中文场景有优势,但 Exp 状态与生态成熟度不及闭源稳定版——按项目量级评估。