
8月21日,DeepSeek 终于为 V4 Flash 产品线装上了"眼睛",推出了一个实验性多模态模型:
DeepSeek-V4-Flash-Vision-Exp。
在此之前,V4 Flash 系列以高吞吐量和低成本著称——但它只能处理文本、代码、日志和文档。视觉能力明显缺失。过去一周,DeepSeek Harness GitHub 讨论中最常见的问题是"我如何让 DeepSeek 看到图像?"开发者们甚至编写自己的视觉桥接插件,将图像转换为文本后再输入模型。

现在这个差距已经弥合。DeepSeek 已经将这一能力直接集成到其主线 V4 模型和代理工作流中。
DeepSeek-V4-Flash-Vision-Exp 的定位很明确:文本能力基本上保持在稳定版 V4-Flash 发布的水平(代理、推理、世界知识),而视觉是主要增量。
在纯文本任务上——代理工作流、推理、世界知识——V4-Flash-Vision-Exp 的表现与稳定版 V4-Flash 大致相当,在 Terminal Bench 2.1 和 DeepSWE 等编码代理基准测试上有轻微提升。更大的变化出现在视觉信息进入代理任务时:官方数据显示在 Chartography 等视觉理解基准测试上得分很高,DeepSeek 声称其多模态代理能力正在接近 Claude Opus 4.8。
关键是,DeepSeek 没有因为添加了视觉功能而提高价格。图像按 token 计费,每张图像上限 384 个 token,整体定价与 V4-Flash 保持一致。API 支持 Chat Completions、Messages 和 Responses 格式,图像可通过 Base64、URL 或 Files API 传递——对于已经在 DeepSeek 生态系统中构建的开发者来说,集成门槛很低。
排行榜排名:

目前在 Artificial Analysis 排名第 32。
当然,"Exp" 后缀提醒我们这仍然是一个实验性模型。基准测试无法回答它在实际工作负载中如何处理截图识别、UI 理解或图表分析。因此,302.AI 这次让它通过几个实际场景测试,看看真实性能是否符合预期。

是的,你没看错——峰值输出价格大约是 Claude Opus 5 的 1/19,非峰值接近 1/38。这就是在不重新定价的情况下为 Flash 系列添加视觉功能后的成本结构。
提示:根据插图,猜测六张图片分别代表哪部著名电影。
答案:1. 杀死比尔 2. 回到未来 3. 美国派 4. 百万美元宝贝 5. 黑客帝国 6. 老无所依

DeepSeek-V4-Flash-Vision-Exp:6 个中答对 5 个。

Claude Opus 5:6 个中答对 4 个。

第二个测试——时间排序:
提示:按逻辑顺序排列四个漫画面板。
正确答案:C → A → D → B

DeepSeek-V4-Flash-Vision-Exp:顺序错误。它提供了解释,但推理很牵强——它难以同时结合视觉线索、序列关系和多步推理。

Claude Opus 5:顺序正确,解释合理。

要点:在简单的视觉识别 + 知识检索方面,DeepSeek 在这里实际上优于 Opus 5。但当任务需要链式多模态推理时,稳定性明显下降。
提示:将参考图像中显示的场景重现为动画 SVG。
参考 1:



快速判断:两个模型都准确理解并重现了参考图像的场景逻辑,但在复杂构图和动画执行方面各有缺陷。
Opus 5 构建了更丰富、更复杂的图形;DeepSeek 在意义对意义的重现方面表现完美。
提示:重新创建截图中显示的网页。

两个模型都产生了相当完整的重建,差异在于风格而非失败:


值得注意的是,DeepSeek 在原始布局保真度上略胜 Opus 5——对于一个预算级实验模型来说,这令人印象深刻。
原文链接:
DeepSeek-V4-Flash-Vision-Exp - 汇智网
更新时间:2026-08-31
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302034903号