DeepSeek-V4系列迎重大升级 性能追平旗舰模型 Agent能力大幅增强

《科创板日报》8月2日讯(编辑 宋子乔)DeepSeek-V4系列模型迎来重大升级。抢在7月最后一天(31日),DeepSeek-V4-Flash正式版上线。

根据官方消息,DeepSeek-V4-Flash正式版的模型架构、大小和与预览版相同,即MoE(混合专家)架构、2840亿总参数、130亿激活参数、1M上下文,在此基础上,正式版仅重新进行了后训练,Agent能力便大幅增强,基准测试得分远超V4-Pro-Preview。

官方性能对比的是国产编程代表GLM-5.2及美国的Opus 4.8。DeepSeek-V4-Flash正式版的整体性能超过了GLM-5.2,逼近Opus 4.8。相比对标模型,V4 Flash只是个小参数模型,GLM-5.2总参数高达7440亿,激活参数为400亿,均远高于V4 Flash。

具体来看官方给出的9项Agent基准测试得分,在考察终端操作能力的Terminal Bench2.1上,DeepSeek-V4-Flash正式版的得分从61.8涨到了82.7;在代码仓库理解与修改任务NL2Repo、DeepSWE上,分别得分54.2和54.4,而其前身Flash Preview在DeepSWE项目上的得分仅为7.3。

另外,其指向网络安全任务的Cybergym得分为76.7,反映工具调用能力的Toolathlon-Verified达到70.3。

在更综合的智能体评测中,DeepSeek-V4-Flash正式版在Agent Last Exam和 Automation Bench Public上的得分分别为25.2和25.1,这两个项目都是2026年新推出、面向AI智能体的现实任务评测基准,用来检验大模型Agent能不能真正完成真实工作,区别于MMLU、Humanity’s Last Exam这类纯问答测试。

在内部全栈开发测试DSBench-FullStack与高难度编码测试DSBench-Hard上,得分则达到68.7和59.6。多项指标远超今年4月上线的V4-Pro预览版。

新版本上线后,Artificial Analysis和Arena.ai两大AI评测平台同步更新了该模型的基准测试结果。

Artificial Analysis智能指数显示,DeepSeek-V4-Flash获得50分,比4月发布的Flash版本高出10分,仅比OpenAI的GPT-5.6 Luna(51分)低1分。该平台发文称,即使OpenAI将GPT-5.6 Luna的价格下调了80%,DeepSeek-V4-Flash正式版在其自有API上的单任务成本仍然比GPT-5.6 Luna低约60%

Arena.ai的报告称,DeepSeek-V4-Flash正式版以1586分的成绩重塑了Frontend Code Arena跑分榜单。每MToken的价格为0.14美元/0.28美元,是同类产品中性价比最高的

申万宏源证券最新研报称,DeepSeek-V4-Flash继续展现国产模型超高性价比;国联民生证券称,DeepSeek-V4-Flash轻量模型追平旗舰性能,利好AI应用产业链

展开阅读全文

更新时间:2026-08-04

标签:科技   旗舰   大幅   模型   性能   能力   系列   正式版   得分   测试   基准   参数   上线   智能

1 2 3 4 5

上滑加载更多 ↓
推荐阅读:
友情链接:
更多:

本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828  

© CopyRight All Rights Reserved.
Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034903号

Top