AI三巨头惨遭滑铁卢：最新编程测试正确率全线跌破25%，GPT-5也难逃厄运

舞夢輝影

发布时间：2025-09-23 16:06:17

535人浏览过

来源于php中文网

原创

ai三巨头惨遭滑铁卢：最新编程测试正确率全线跌破25%，gpt-5也难逃厄运

AI三巨头集体受挫：在Scale AI最新推出的SWE-BENCH PRO编程测评中，GPT-5、Claude Opus 4.1与Gemini 2.5均未能突破25%的解决率门槛，遭遇了前所未有的挑战。GPT-5以23.3%的成绩位列第一，Claude Opus 4.1紧随其后为22.7%，而Google Gemini 2.5则仅得13.5%，表现低迷。

这一结果震动业界，似乎揭示出当前顶尖大模型在真实复杂编程任务面前仍显乏力。然而，深入数据背后，故事远非表面那般简单。

AI三巨头惨遭滑铁卢：最新编程测试正确率全线跌破25%，GPT-5也难逃厄运

前OpenAI研究员Neil Chowdhury指出，若仅统计模型实际提交的任务，GPT-5的准确率高达63%，几乎是Claude Opus 4.1同期31%的两倍。这说明，在它决定介入的问题上，GPT-5依然具备强大实力。相比之下，其他模型不仅整体得分低，且在已尝试任务中的成功率也明显落后。

问题的关键在于——SWE-BENCH PRO本身就是一场“地狱级”考验。该测试集由OpenAI于2024年8月发布，旨在彻底规避传统基准的数据污染风险。不同于旧版SWE-Bench-Verified中大量存在的一两行简单修改题（500题中有161题属此类），SWE-BENCH PRO聚焦工业级现实场景，涵盖跨文件、多模块、数百行代码变更的真实项目难题。

AI三巨头惨遭滑铁卢：最新编程测试正确率全线跌破25%，GPT-5也难逃厄运

Evoker

一站式AI创作平台

下载

测试库包含1865个来自商业应用、B2B服务和开发者工具的多样化问题，并特别设置保留集，使用活跃的开源代码库防止过拟合。同时引入人工增强机制，确保任务复杂度逼近真实开发环境。正是这种严苛设计，使得以往“刷榜式”的优化策略失效，迫使模型展现真正的工程理解能力。

更引人深思的是GPT-5高达63.1%的未回答率。这意味着超过六成的任务，模型选择不作答，而非冒险出错。这种高度保守的行为反映出先进AI系统正具备某种形式的自我判断力，但也暴露了其泛化能力的局限。

AI三巨头惨遭滑铁卢：最新编程测试正确率全线跌破25%，GPT-5也难逃厄运

尤其在JavaScript和TypeScript等主流语言上，各模型表现波动剧烈，显示出技术路线差异带来的不均衡性。这场测评不仅是对模型能力的检验，更是对整个AI评估体系的反思：当旧基准逐渐饱和，唯有像SWE-BENCH PRO这样贴近实战的新标准，才能真正推动技术向实用化迈进。

Anthropic 宣布收购开源 JavaScript 运行时 Bun

Electron 39.2.4 发布，跨平台桌面应用开发工具

Kubewarden 推出 JavaScript/TypeScript SDK

微信小程序官宣将在 iOS 端支持接入虚拟支付，苹果抽成 15%

微软宣布 Aspire 走向多语言化

编程速学教程(入门课程)

编程怎么学习？编程怎么入门？编程在哪学？编程怎么学才快？不用担心，这里为大家提供了编程速学教程(入门课程)，有需要的小伙伴保存下载就能学习啦！

下载

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：腾讯元宝全量上线微信公众号及视频号评论区，化身内容速读专家下一篇：OpenAI 与立讯精密达成协议，后者将负责组装至少一款OpenAI的新设备

作者最新文章

荣耀500 Pro MOLLY 20 周年限定版开启预约潮玩与科技的跨界天花板

2026-01-16 09:49

苹果手机没有消息提示怎么办_苹果通知消息提示设置

2026-01-16 10:01

个人所得税申报系统官方入口_自然人电子税务局扣缴端官网地址

2026-01-16 10:19

字幕格式转换器官网_在线字幕格式转换官方平台

2026-01-16 10:41

菜鸟包裹查询订单单号_实时物流信息与寄件状态更新

2026-01-16 11:02

中国执行信息公开网官方入口_失信被执行人名单查询官网

2026-01-16 11:08

抖音极速版红包雨怎么涨金币

2026-01-16 11:10

红米redmi官网入口地址_红米官方网站手机首页入口网址

2026-01-16 11:11

当 Windows 无法找到 PowerShell 时该怎么办

2026-01-16 11:24

红米手机价格表大全最新_红米全系列手机价格一览表

2026-01-16 11:27

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI大模型

开放平台

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI大模型

通义千问

阿里巴巴推出的全能AI助手

AI大模型

腾讯元宝

腾讯混元平台推出的AI助手

文档处理

Excel 表格

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI大模型

中文写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

中文写作

写作工具

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接

图画生成

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI大模型

中文写作

智谱清言 - 免费全能的AI助手

AI大模型

PDF 文档

相关专题

js获取数组长度的方法

在js中，可以利用array对象的length属性来获取数组长度，该属性可设置或返回数组中元素的数目，只需要使用“array.length”语句即可返回表示数组对象的元素个数的数值，也就是长度值。php中文网还提供JavaScript数组的相关下载、相关课程等内容，供大家免费下载使用。

554

2023.06.20

js刷新当前页面

js刷新当前页面的方法：1、reload方法，该方法强迫浏览器刷新当前页面，语法为“location.reload([bForceGet]) ”；2、replace方法，该方法通过指定URL替换当前缓存在历史里（客户端）的项目，因此当使用replace方法之后，不能通过“前进”和“后退”来访问已经被替换的URL，语法为“location.replace(URL) ”。php中文网为大家带来了js刷新当前页面的相关知识、以及相关文章等内容

374

2023.07.04

js四舍五入

js四舍五入的方法：1、tofixed方法，可把 Number 四舍五入为指定小数位数的数字；2、round() 方法，可把一个数字舍入为最接近的整数。php中文网为大家带来了js四舍五入的相关知识、以及相关文章等内容

731

2023.07.04

js删除节点的方法

js删除节点的方法有：1、removeChild()方法，用于从父节点中移除指定的子节点，它需要两个参数，第一个参数是要删除的子节点，第二个参数是父节点；2、parentNode.removeChild()方法，可以直接通过父节点调用来删除子节点；3、remove()方法，可以直接删除节点，而无需指定父节点；4、innerHTML属性，用于删除节点的内容。

477

2023.09.01

JavaScript转义字符

JavaScript中的转义字符是反斜杠和引号，可以在字符串中表示特殊字符或改变字符的含义。本专题为大家提供转义字符相关的文章、下载、课程内容，供大家免费下载体验。

394

2023.09.04

js生成随机数的方法

js生成随机数的方法有：1、使用random函数生成0-1之间的随机数；2、使用random函数和特定范围来生成随机整数；3、使用random函数和round函数生成0-99之间的随机整数；4、使用random函数和其他函数生成更复杂的随机数；5、使用random函数和其他函数生成范围内的随机小数；6、使用random函数和其他函数生成范围内的随机整数或小数。

991

2023.09.04

如何启用JavaScript

JavaScript启用方法有内联脚本、内部脚本、外部脚本和异步加载。详细介绍：1、内联脚本是将JavaScript代码直接嵌入到HTML标签中；2、内部脚本是将JavaScript代码放置在HTML文件的`<script>`标签中；3、外部脚本是将JavaScript代码放置在一个独立的文件；4、外部脚本是将JavaScript代码放置在一个独立的文件。

657

2023.09.12

Js中Symbol类详解

javascript中的Symbol数据类型是一种基本数据类型，用于表示独一无二的值。Symbol的特点：1、独一无二，每个Symbol值都是唯一的，不会与其他任何值相等；2、不可变性，Symbol值一旦创建，就不能修改或者重新赋值；3、隐藏性，Symbol值不会被隐式转换为其他类型；4、无法枚举，Symbol值作为对象的属性名时，默认是不可枚举的。

551

2023.09.20