掘金 人工智能 05月29日 11:33
刚刚,新版DeepSeek-R1正式开源!直逼o3编程强到离谱,一手实测来了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_guoji1.html

 

DeepSeek开源了新版R1模型,本次更新性能显著提升,几乎与o4-mini相当,在编程方面甚至超越了Claude 4 Sonnet。新模型基于DeepSeek-V3-0324训练,具备更强的编码能力和更长的思考时间。实测表明,DeepSeek-R1在复杂推理和代码生成任务中表现出色,能够一次性完成高质量的任务,无需debug。此外,模型在处理复杂族谱问题时展现了惊人的分析能力,能够通过数学符号进行思考并得出正确结论,思考过程稳定且算力充足。

🚀DeepSeek-R1-0528模型权重已上传HuggingFace,编码能力大幅提升,思考时间更长,在LiveCodeBench基准测试中,性能媲美o4-mini,超越Gemini 2.5 Flash。

🧠DeepSeek-R1具备深度推理能力,文本生成更自然,格式更佳,推理风格独特,快速且缜密,支持长时思考,单任务处理时长可达30-60分钟,能够像o3一样纠正思维链,像Claude一样创造性地进行世界构建。

💻实测表明,DeepSeek-R1在编程能力上媲美Claude 4和Gemini 2.5 Pro,能够一次性完成高质量的代码生成任务,例如制作3D动画、设计网站、模拟太阳系运行和篮球弹跳等,无需debug。

👨‍🏫DeepSeek-R1在复杂推理问题(如华容道和农夫过河问题)中表现出色,能够给出核心问题所在,甚至能够解决无厘头的族谱问题,通过数学符号化方式进行思考并得出正确结论。

【新智元导读】新版 DeepSeek-R1 重磅开源,凌晨已放出权重!此次模型性能几乎与 o4-mini(Medium)相当,编程实测超越 Claude 4 Sonnet。网友纷纷惊叹:开源又一次胜利了。

临近端午假期,DeepSeek 果然又开始搞事。

就在今天凌晨,新版 DeepSeek-R1 正式开源了!

DeepSeek-R1-0528 模型权重已上传到 HuggingFace,不过模型卡暂未更新。

项目地址:huggingface.co/deepseek-ai…

时隔 4 个月,DeepSeek-R1 完成了超进化,编码能力强到离谱,而且思考时间更长了。

据称,新模型基于 DeepSeek-V3-0324 训练(参数为 660B)。

经典物理模拟测试中,DeepSeek-R1 新旧版本的对比

在 LiveCodeBench 基准上,DeepSeek-R1-0528 性能几乎与 o3-mini(High)和 o4-mini(Medium) 实力相当,一举超越了 Gemini 2.5 Flash。

有网友称赞,DeepSeek-R1 能够像 o3 一样纠正思维链,并且像 Claude 一样创造性进行世界构建。

可以说,这是属于开源模型的巨大胜利!

不用 R2,直接对标 SOTA

此次,DeepSeek-R1-0528 更新核心亮点,网友做了一个浓缩版的总结:

思考时间更长,成为了全网讨论最多的一点。有网友实测后,R1 思考时长超过了 25 分钟。

另外,这似乎是唯一一个能持续正确做对「9.9 - 9.11 是多少」的模型。

由此,大家对 DeepSeek-R2 的期待值也是拉满了。

一手实测来了

新版 DeepSeek-R1 的能力经过我们实测,虽然是一次「小版本」更新,但是性能得到了「史诗级」的加强。

尤其是编程能力,感觉已经超过或者足以媲美 Claude 4 和 Gemini 2.5 Pro,可以说所有提示都是「一把过」,不需要任何修改!并且可以在网页端直接运行,展示效果。

首先是制作一个「新智元」字体在宇宙中旋转的 3D 动画,完成度相当之高。

对于简单任务,DeepSeek-R1 的思考时间明显缩短,不再像以前对简单任务也疯狂思考。

设计一个新智元的官方网站,对于这种相对容易的任务,DeepSeek-R1-0528 只需要 10s 的思考时间。

能够明显感觉到,这次 DeepSeek-R1 新版本的思考过程更加稳定。

以模拟一个太阳系运行为例,还要求行星比例大小与实际相同,能看到 DeepSeek-R1-0528 的思考过程已经趋近于「完美」。

最后,再给 DeepSeek-R1-0528 上点强度,要求演示篮球落地后的弹跳过程,并且要完美遵循现实中物理规律。

最终 DeepSeek 的成果还贴心的设计了参数控制面板,以及速度方向指示,是真的很强,以上所有代码都是提示之后一遍过,没有任何的 Debug 过程。

对于类似「华容道」的多步骤思考问题,DeepSeek-R1-0528 的表现也非常完美,

比如「一位农夫要带一只狐狸、一只鹅和一袋豆子过河。船每次只能载他和一样物品。如果农夫不在场,狐狸会吃掉鹅,鹅会吃掉豆子。请问农夫该如何安排过河,才能确保所有物品安全?」这种复杂推理问题,DeepSeek-R1 还可以给出核心问题所在。

最令我感到震惊的是,这次的「思考」能力似乎进行了秘密加强。

我给他了一个非常无厘头的族谱问题:「我的妈妈的爸爸的儿子的侄女的孙子的爷爷的舅舅的外孙女的姑姑,是我的谁,你能画出关系族谱图吗?」

以下过程经过 3 倍加速,可以看到 DeepSeek-R1 真的在通过数学的符号化方式在进行思考。

并且最后还真让他分析出了结果,简直震惊!这么长的思考链条都没有断。

另外值得一提的是,这次的思考过程并没有遇到服务算力不够的情况,看来 DeepSeek 有针对性的提高了算力,毕竟现在是模型刚发布后的高峰「测评」期。

参考资料:

chat.deepseek.com/

x.com/i/status/19…

x.com/Yuchenj_UW/…

x.com/chetaslua/s…

x.com/AiBattle_/s…

huggingface.co/deepseek-ai…

Fish AI Reader

Fish AI Reader

AI辅助创作,多种专业模板,深度分析,高质量内容生成。从观点提取到深度思考,FishAI为您提供全方位的创作支持。新版本引入自定义参数,让您的创作更加个性化和精准。

FishAI

FishAI

鱼阅,AI 时代的下一个智能信息助手,助你摆脱信息焦虑

联系邮箱 441953276@qq.com

相关标签

DeepSeek-R1 开源模型 AI 编程 推理
相关文章