铭鸿体育资讯网

跑分这事儿,最近翻车了。9 月 8 日,分析机构 SemiAnalysis 连甩五条推文,直接点名谷歌和 Meta 两家万亿巨头——Gemini 3.8 Flash 和 Muse Spark 1.3 是"刷榜痕迹最明显的两个模型"。 证据很清晰。在测 Agent 干活能力的 Terminal-Bench 2.1 上,Gemini 3.8 Flash 考了 89.4 分,182 个模型里高居第 ​

跑分这事儿,最近翻车了。9 月 8 日,分析机构 SemiAnalysis 连甩五条推文,直接点名谷歌和 Meta 两家万亿巨头——Gemini 3.8 Flash 和 Muse Spark 1.3 是"刷榜痕迹最明显的两个模型"。

证据很清晰。在测 Agent 干活能力的 Terminal-Bench 2.1 上,Gemini 3.8 Flash 考了 89.4 分,182 个模型里高居第 2,把 GPT-6 Astra 都压在身下。结果换到 8 月 29 日上线的 Terminal-Bench 4.0,同一个模型只拿 19.1 分,14 个测试对象里掉到第 12,成绩当场打了二折。GPT-6 Astra 从 88.4 掉到 57.7,好歹算个六五折。

Meta 首席 AI 官 Alexandr Wang 27 分钟后杀到评论区,甩出六个字:这是个愚蠢的论点。他反击说 GPT-5.6 Sol 在 2.1 上是 88.8、到 4.0 掉到 37.3,落差更大但没人说 Sol 刷榜;还强调 Meta 从没说 Muse Spark 1.3 能跟 Astra 或 Fable 5.1 一样强,只是性价比更高。

新卷子为什么这么狠?66 道题砍掉 8 道被刷穿的旧题、大修 19 道,全加上 8 小时超时限制,还设 35 条评分细则加一轮"对抗性作弊试验"——故意让 Agent 钻空子,钻通就毙题。新榜上 Claude Mythos 5.1(max)60.9 分稳第一,Gemini 3.8 Flash 暴跌到 19.1,Muse Spark 1.3 按图表是 33.3。旧榜上 Gemini 还能压着 Astra 打,新榜分连人家三分之一都不到。

真正的内幕在第二节。TB 2.1 任务完全公开,大厂不会傻到拿原题训练,但会买"长得像考题的模拟卷"——提供试错加奖励的封闭任务系统。这已是明码标价的成熟生意:单个训练任务 200 到 2000 美元,复杂软件工程任务能开 2 万,复刻 Slack 量级产品 30 万美元起步,独家买断再翻 4 到 5 倍。Epoch AI 调研,Anthropic 内部讨论过每年砸 10 亿;供给侧至少 35 家公司做这门生意。

更讽刺的是 Datacurve:在它自己办的 DeepSWE 1.1 上,Muse Spark 1.3(max)75.4 分拿第一,Gemini 3.8 Flash 73.8 排第四——既卖题又出卷又监考,一条龙坐实。

SemiAnalysis 的判词:公开基准的保质期所剩无几,解药是多做私有基准。代价是公开榜单沦为营销通稿,那把公平丈量所有模型的公共尺子,可能再也找不回来了。