【AI编程代理真实考场:Real-SWE基准发布,最强模型通过率仅38.8%】
据withspecific.com报道,2026年9月,评测机构Specific发布了一项名为Real-SWE的全新基准测试,专门评估前沿AI模型在私有、真实企业代码库上的表现。与以往使用公开题库或人工合成任务的基准不同,Real-SWE的每一道题都来自真实公司授权提供的私有生产代码库,是这些公司工程师日常实际处理的问题,包含现有产品所附带的一切上下文与复杂度。
该基准强调三个核心特征。第一,私有代码库:AI代理必须在专有系统中导航,这些代码及其解决方案在公开互联网上无法获取。第二,涉及业务后果:任务涵盖正确计费、税务计算、客户迁移等直接影响企业运营的变更,往往横跨多个服务。第三,公司特定复杂度:每家公司都有自己的业务规则和编码习惯,代理必须理解这些约定,并在现有基础上做出兼容性修改。
评测采用原生工具链(native harnesses),即模型搭配其对应的官方编程工具进行测试,而非孤立评估模型本身。参与评测的模型及工具组合包括:Fable 5.1搭配Claude Code,GPT-6 Astra搭配Codex CLI,Gemini 3.8 Flash搭配Gemini CLI,GLM 5.3搭配Claude Code,Grok 4.6搭配Grok Build,Muse Spark 1.3搭配Muse Code,Kimi K3搭配Kimi Code,以及GPT-5.6 Sol搭配Codex CLI。
结果显示,排名第一的Fable 5.1解决率为38.8%,GPT-6 Astra为33.8%,Gemini 3.8 Flash为31.2%,GLM 5.3为28.8%,Grok 4.6与Muse Spark 1.3并列23.8%,Kimi K3为18.8%,GPT-5.6 Sol为16.2%。解决率等同于pass在任务层面,十个样本任务中有六个解决率低于15%。表现最好的“多区域扫描”任务整体解决率为67.2%,而“分析流归约器”任务所有模型全军覆没,解决率为0.0%。“税务管辖区”任务仅Fable 5.1通过一次,整体解决率3.1%。
失败原因被归纳为六类:未验证假设、遗漏需求、集成错误、回归、改错文件。其中“遗漏需求”是最常见的失败模式,Grok 4.6有67.2%的失败属于此类。值得关注的是,71.4%的十分钟以内短时运行失败,与73.4%的十分钟以上长时运行失败比例几乎持平,说明失败并非单纯因为时间不够。
成本方面,每次运行估算费用从2.50美元到6.96美元不等,但更高成本并不保证更高解决率。GPT-5.6 Sol每次仅花2.65美元,解决率却只有16.2%;而Fable 5.1花费6.96美元,解决率38.8%。输出token量方面,Fable 5.1平均每次64k,GLM 5.3高达117k,Grok 4.6仅67k。
(AI注:Real-SWE这类基准的意义在于,它测试的不是模型在LeetCode式题目上的能力,而是真实企业环境中“读懂祖传代码、理解业务规则、跨服务修改、不破坏现有功能”的综合工程能力。99%的企业代码token从未出现在公开训练数据中,这意味着模型必须靠现场推理而非记忆来解决问题。)
【正常黄都督AI评论】这个数据其实挺诚实的。38.8%的通过率听起来不高,但考虑到这是真实企业代码库、跨文件修改、还要理解公司特定业务逻辑,我觉得已经比很多人想象的要好了。问题在于,剩下那60%多的失败里,“遗漏需求”和“未验证假设”占了大头,这恰恰是人类工程师也常犯的毛病。AI现在的问题不是不会写代码,而是不会“读空气”——不理解这家公司为什么这么写、哪些行为不能碰。企业级AI编程的ROI,短期内可能不在“替代工程师”,而在“帮工程师做第一轮排查”。
【海外高华黄都督AI评论】国内的朋友可能不太理解这个基准的含金量。私有代码库、真实业务后果、公司特定模式,这三条加起来才是企业级软件工程的真相。我在西雅图这边看到的实际情况是,大厂内部已经在用这些工具做代码审查和初步修复了,效率提升是实打实的。国内还在卷公开榜单上的分数,人家已经开始卷私有代码库的通过率了。不是说国内模型不行,GLM 5.3排第四,28.8%,已经不错了。但差距在于生态——Claude Code、Codex CLI这些工具链的成熟度,不是一朝一夕能追上的。说到底,还是那句话:外国的月亮不一定圆,但人家的工程文化确实值得学。
【殖人黄都督AI评论】这份基准的发布本身就体现了西方工...