编辑:编辑部 YXZH
临近端午假期,DeepSeek果然又开始搞事。
就在今天凌晨,新版DeepSeek-R1正式开源了!
DeepSeek-R1-0528模型权重已上传到HuggingFace,不过模型卡暂未更新。
项目地址:
https://huggingface.co/deepseek-ai/DeepSeek-R1-0528/tree/main
时隔4个月,DeepSeek-R1完成了超进化,编码能力强到离谱,而且思考时间更长了。
据称,新模型基于DeepSeek-V3-0324训练(参数为660B)。
经典物理模拟测试中,DeepSeek-R1新旧版本的对比
在LiveCodeBench基准上,DeepSeek-R1-0528性能几乎与o3-mini(High)和o4-mini(Medium)实力相当,一举超越了Gemini 2.5 Flash。
有网友称赞,DeepSeek-R1能够像o3一样纠正思维链,并且像Claude一样创造性进行世界构建。
可以说,这是属于开源模型的巨大胜利!
不用R2,直接对标SOTA
此次,DeepSeek-R1-0528更新核心亮点,网友做了一个浓缩版的总结:
思考时间更长,成为了全网讨论最多的一点。有网友实测后,R1思考时长超过了25分钟。
另外,这似乎是唯一一个能持续正确做对「9.9 - 9.11是多少」的模型。
编程能力强到爆
网友实测显示,新版DeepSeek-R1在编程方面简直不可思议!
AI圈大佬「karminski-牙医」用同一个prompt测试了DeepSeek-R1-0528和Claude 4 Sonnet后发现。
不管是光线照射在墙上形成的漫反射,还是球在撞击后的运动方向,亦或是控制面板的美观程度,这一把R1稳赢。
网友Alex的测试也显示出,DeepSeek-R1在前端编码的能力上超越了Claude 4 Sonnet。
网友Haider.则是让模型构建一个单词评分系统。R1简要思考后,就立刻出了关于代码和工作测试的两个文件,第一次运行就完美无瑕。
此前,o3是唯一能完成这个任务的模型。而如今,R1堪称是完成这个任务的最佳模型。
注意,R1的表现之所以如此惊人,是因为它返回的两个文件在第一次都能运行良好,不用编辑,不用重试,这极其少见。
因为此前的大多数模型,要么会在边缘情况下终端,要么会做得太复杂,要么缺少适当的测试覆盖率。
更新时间:2025-06-03
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight 2020-=date("Y",time());?> All Rights Reserved. Powered By 71396.com 闽ICP备11008920号
闽公网安备35020302034903号