新版DeepSeek-R1正式开源编程能力强到离谱一手实测来了

Cnbeta 前天 14:52

新版DeepSeek-R1正式开源编程能力强到离谱一手实测来了

DeepSeek在端午假期前夕发布了新版DeepSeek-R1，该模型已在Hugging Face上开源。DeepSeek-R1-0528基于DeepSeek-V3-0324训练，在编程能力和推理能力上实现了显著提升。在LiveCodeBench基准测试中，DeepSeek-R1的性能接近o3-mini和o4-mini，超越了Gemini 2.5 Flash。新模型在文本生成、推理风格和思考时长方面都有优化，尤其在编程能力方面表现出色，甚至超越了Claude 4 Sonnet，引发了广泛关注。

🧠 模型升级与开源：DeepSeek-R1-0528已于今日凌晨正式开源，模型权重已上传至Hugging Face，标志着DeepSeek在开源领域的新进展。该模型基于DeepSeek-V3-0324训练，参数达到660B。

🚀 性能对比与超越：DeepSeek-R1在LiveCodeBench基准测试中，性能接近o3-mini (High)和o4-mini (Medium)，超越了Gemini 2.5 Flash。网友称赞其能像o3一样纠正思维链，并像Claude一样进行创造性世界构建。

💡 核心亮点：新版DeepSeek-R1在多个方面进行了优化，包括更自然的文本生成、更缜密的推理风格以及更长的思考时间。有网友实测表明，R1的思考时长超过了25分钟，并且在解决特定数学问题上表现出色。

💻 编程能力：DeepSeek-R1在编程能力方面表现突出，超越了Claude 4 Sonnet。在光线、物体运动模拟以及代码构建等任务中，DeepSeek-R1展现出强大的实力，甚至能够首次运行就生成完美无瑕的代码文件，无需编辑或重试。

临近端午假期，DeepSeek果然又开始搞事。就在今天凌晨，新版DeepSeek-R1正式开源了！DeepSeek-R1-0528模型权重已上传到HuggingFace，不过模型卡暂未更新。

项目地址：https://huggingface.co/deepseek-ai/DeepSeek-R1-0528/tree/main

时隔4个月，DeepSeek-R1完成了超进化，编程能力强到离谱，而且思考时间更长了。

据称，新模型基于DeepSeek-V3-0324训练（参数为660B）。

经典物理模拟测试中，DeepSeek-R1新旧版本的对比

在LiveCodeBench基准上，DeepSeek-R1-0528性能几乎与o3-mini（High）和o4-mini（Medium)实力相当，一举超越了Gemini 2.5 Flash。

有网友称赞，DeepSeek-R1能够像o3一样纠正思维链，并且像Claude一样创造性进行世界构建。

可以说，这是属于开源模型的巨大胜利！

不用R2，直接对标SOTA

此次，DeepSeek-R1-0528更新核心亮点，网友做了一个浓缩版的总结：

能像谷歌模型一样深度推理

文本生成优化：更自然，格式更佳

独特的推理风格：不仅快，而且更缜密

支持长时思考：单任务处理时长可达30-60分钟

思考时间更长，成为了全网讨论最多的一点。有网友实测后，R1思考时长超过了25分钟。

另外，这似乎是唯一一个能持续正确做对「9.9 - 9.11是多少」的模型。

编程能力强到爆

网友实测显示，新版DeepSeek-R1在编程方面简直不可思议！

AI圈大佬「karminski-牙医」用同一个prompt测试了DeepSeek-R1-0528和Claude 4 Sonnet后发现。

不管是光线照射在墙上形成的漫反射，还是球在撞击后的运动方向，亦或是控制面板的美观程度，这一把R1稳赢。

网友Alex的测试也显示出，DeepSeek-R1在前端编码的能力上超越了Claude 4 Sonnet。

网友Haider.则是让模型构建一个单词评分系统。R1简要思考后，就立刻出了关于代码和工作测试的两个文件，第一次运行就完美无瑕。

此前，o3是唯一能完成这个任务的模型。而如今，R1堪称是完成这个任务的最佳模型。

注意，R1的表现之所以如此惊人，是因为它返回的两个文件在第一次都能运行良好，不用编辑，不用重试，这极其少见。

因为此前的大多数模型，要么会在边缘情况下终端，要么会做得太复杂，要么缺少适当的测试覆盖率。

Fish AI Reader

AI辅助创作，多种专业模板，深度分析，高质量内容生成。从观点提取到深度思考，FishAI为您提供全方位的创作支持。新版本引入自定义参数，让您的创作更加个性化和精准。

FishAI

鱼阅，AI 时代的下一个智能信息助手，助你摆脱信息焦虑

联系邮箱 441953276@qq.com

相关标签

DeepSeek-R1 开源编程能力模型性能

相关文章

Meet HPT 1.5 Air: A New Open-Sourced 8B Multimodal LLM with Llama 3

This AI newsletter is all you need #98

Gemma: Introducing new state-of-the-art open models

Open Source Generative AI at Hugging Face with Jeff Boudier - #624

Exploring the FastAI Tooling Ecosystem with Hamel Husain - #532

周鸿祎：留给谷歌的时间不多了，建议把所有产品都开源

腾讯副总裁蒋杰：混元文生文大模型将在三季度开源

MARKLLM: An Open-Source Toolkit for LLM Watermarking

Hugging Face Releases LeRobot: An Open-Source Machine Learning (ML) Model Created for Robotics

IBM開源程式開發專用Granite語言模型，效能超越當前多數開源模型