DeepSeek V4-Flash 补上视觉,多模态 Agent 逼近 Opus 4.8
视觉能力补齐,V4-Flash 从纯文本走向多模态
DeepSeek 今天给 V4-Flash 补上了视觉能力。新模型叫 DeepSeek-V4-Flash-Vision-Exp,一个实验性质的版本,已通过 deepseek-v4-flash-vision-exp 这个 model id 在 DeepSeek API 平台上开放调用。这意味着,此前以纯文本能力见长的 V4-Flash 系列,现在可以处理图像输入,进入多模态领域。
据官方介绍,V4-Flash-Vision-Exp 在各类 Agent 框架内展现出了较好的多模态适配能力,能够有效支持借助多样化的 Agent 工具解锁更多实用的工作场景。这标志着 DeepSeek 在视觉语言模型上迈出了重要一步,也为开发者提供了新的选择。
纯文本不降级,视觉能力大幅跃升
最关键的指标是:在纯文本能力(Agent、推理、世界知识等)上,Vision-Exp 与 V4-Flash 正式版持平,没有因为加入视觉而牺牲原有性能。同时,视觉能力大幅跃升,使得该模型在多模态任务上表现突出。
这种平衡设计对开发者尤为重要。很多模型在升级多模态后,文本能力会有所下降,但 DeepSeek 这次保持了文本能力的稳定,让开发者无需担心迁移成本。视觉能力的加入,则让模型可以处理截图、文档扫描、图像理解等任务,扩展了应用场景。
多模态 Agent 能力接近 Opus 4.8
在 Agent 能力上,V4-Flash-Vision-Exp 的多模态表现接近 Opus 4.8。Opus 4.8 是 Anthropic 的旗舰模型,在多模态 Agent 领域一直处于领先地位。DeepSeek 这次能够接近这一水平,说明其在多模态 Agent 技术上取得了显著进展。
对于国内开发者而言,这意味着在构建多模态 Agent 应用时,有了一个性能接近国际顶尖模型、但可能更具成本优势的国产替代方案。不过,具体差距和适用场景还需要实际测试验证。
实验性质模型,API 开放调用
需要注意的是,这是一个实验性质的模型。用户可以通过设置 model=‘deepseek-v4-flash-vision-exp’ 访问该模型。实验性质意味着它可能不稳定,功能可能随时调整,不适合直接用于生产环境,但非常适合开发者进行测试和原型开发。
DeepSeek 选择以实验模型的形式发布,一方面可以快速收集反馈,另一方面也降低了用户的期望门槛。开发者可以在真实场景中测试其能力,为后续正式版提供改进方向。
对国内 AI 应用生态的影响
V4-Flash-Vision-Exp 的发布,对国内 AI 应用生态有积极影响。多模态能力是当前 AI 应用的重要方向,从智能客服到内容审核,从教育辅导到医疗辅助,都需要模型能够理解图像和文本的混合信息。DeepSeek 补齐视觉能力,让国内开发者有了更多选择,不必完全依赖国外模型。
此外,DeepSeek 的 API 定价通常较为亲民,这有助于降低多模态应用的开发成本,推动更多创新应用落地。对于中文读者和开发者来说,这意味着可以更便捷地构建多模态 Agent,探索新的商业模式。
尚未定论的部分
尽管官方给出了性能对比,但 V4-Flash-Vision-Exp 的实际表现仍需更多第三方评测。实验模型可能在某些任务上表现不稳定,视觉能力的边界(如复杂图表理解、低分辨率图像处理)也尚未明确。此外,与 Opus 4.8 的对比是在特定基准上,实际应用中的差距可能因场景而异。
开发者在使用时,应充分测试其在自己业务场景下的表现,并关注 DeepSeek 后续的更新。多模态 Agent 领域竞争激烈,DeepSeek 能否持续保持优势,还需观察。
参考来源
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/gpt/post/20260821/DeepSeek-V4-Flash-%E8%A1%A5%E4%B8%8A%E8%A7%86%E8%A7%89%E5%A4%9A%E6%A8%A1%E6%80%81-Agent-%E9%80%BC%E8%BF%91-Opus-4.8/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com