IT之家 04月16日 08:33
初探 OpenAI GPT-4.1 性能:AI 编程能力大增,但谷歌 Gemini 依然称王
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_guoji1.html

 

OpenAI 最新发布的 GPT-4.1 系列模型在编程能力上实现了显著提升,但根据多项测试结果,其性能未能全面超越谷歌的 Gemini 系列。虽然 GPT-4.1 在 SWE-bench Verified 跑分中表现出色,优于 GPT-4o,但在错误率、成本和编码专项测试中,Gemini 2.0 Flash 均表现更佳。此外,多位专家指出 GPT-4.1 的性价比不及 Gemini 2.0 Flash 等竞品。尽管如此,GPT-4.1 的编码能力仍属行业顶尖水平。

💻 在 SWE-bench Verified 跑分中,GPT-4.1 的得分为 54.6%,远超 GPT-4o 的 21.4% 和 GPT-4o mini 的成绩,显示其在编程方面的能力有显著提升。

📊 Stagehand 发布的基准数据显示,Gemini 2.0 Flash 的错误率仅为 6.67%,精确匹配率高达 90%,且价格低廉、速度更快,而 GPT-4.1 的错误率高达 16.67%,成本更是 Gemini 2.0 Flash 的 10 倍以上。

🔬 哈佛大学 RNA 科学家 Pierre Bongrand 的数据表明,GPT-4.1 的性价比不及 Gemini 2.0 Flash、Gemini 2.5 Pro 及 DeepSeek 等竞品,表明其在实际应用中的成本效益相对较低。

💡 在编码专项测试中,GPT-4.1 的编码得分为 52%,而 Gemini 2.5 则以 73% 的成绩遥遥领先,说明在特定任务中,GPT-4.1 的表现不如 Gemini 系列。

⚠️ 虽然 GPT-4.1 被归类为非推理模型,但其编码能力依然处于行业顶尖水平,体现了其在人工智能领域的强大实力。

IT之家 4 月 16 日消息,科技媒体 bleepingcomputer 昨日(4 月 15 日)发布博文,报道称 OpenAI 最新发布的 GPT-4.1 系列模型,其性能相比 GPT-4o 虽然实现重大飞跃,但多项跑分未能超越谷歌的 Gemini 系列。

IT之家昨日报道,OpenAI 公司发布 GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano,官方公布的跑分数据来看,这些模型在编程方面的能力,远超 GPT-4o 及 GPT-4o mini。

例如在 SWE-bench Verified 跑分中,GPT-4o 的得分为 21.4%,GPT-4.5 的得分为 26.6%,而 GPT-4.1 的得分为 54.6%。

尽管性能有较大提升,不过根据多位专家测试,相比较谷歌的 Gemini 系列,GPT-4.1 对比中却显露劣势。

根据 Stagehand(一款生产级浏览器自动化框架)发布的基准数据,Gemini 2.0 Flash 的错误率仅为 6.67%,精确匹配率高达 90%,且价格低廉、速度更快。相比之下,GPT-4.1 的错误率高达 16.67%,成本更是 Gemini 2.0 Flash 的 10 倍以上。

此外,哈佛大学 RNA 科学家 Pierre Bongrand 提供的数据也指出,GPT-4.1 的性价比不及 Gemini 2.0 Flash、Gemini 2.5 Pro 及 DeepSeek 等竞品。

在编码专项测试中,GPT-4.1 同样未能占据上风。Aider Polyglot 的测试结果显示,GPT-4.1 的编码得分仅为 52%,而 Gemini 2.5 则以 73% 的成绩遥遥领先。

值得注意的是,GPT-4.1 被归类为非推理模型(non-reasoning model),但其编码能力仍属行业顶尖。

Fish AI Reader

Fish AI Reader

AI辅助创作,多种专业模板,深度分析,高质量内容生成。从观点提取到深度思考,FishAI为您提供全方位的创作支持。新版本引入自定义参数,让您的创作更加个性化和精准。

FishAI

FishAI

鱼阅,AI 时代的下一个智能信息助手,助你摆脱信息焦虑

联系邮箱 441953276@qq.com

相关标签

GPT-4.1 Gemini 人工智能 性能评估 OpenAI
相关文章