铭鸿体育资讯网

榜一,但没用。谷歌这次又是"跑分狂欢"

Gemini 4 Argon 昨晚发布,直接空降 LMArena 文本榜第一(1525 分),WebDev 榜第八。
听着挺炸对吧?但我扒了一圈,三件事得给你降降温🔥
1️⃣ 这个第一,样本只有 256 票 榜上标着"初步结果",误差范围 ±35 分。意思是——它领先第二名那点差距,可能纯属投票波动。
2️⃣ 你大概率用不上 首批只给通过审核的网安防御方,还是无护栏版。API 付费用户和 AI Ultra 订阅者都得排队,时间未定。谷歌的逻辑是:先让白帽用,收集安全反馈,再放大众。
3️⃣ 谷歌自己人都在吐槽 彭博当天就报道:有谷歌员工说跑分明显高于实际体验,前端设计尤其拉胯。AI 圈已经在传一个词——benchmaxxing,翻译过来就是"刷榜"。谷歌官方否认了,说"编程表现不佳"不准确。
便宜的倒是真的。促销 $2/$10,缓存输入 0.1 刀,最高能力档里性价比第一。输出上限拉到 100 万 token(之前 6.4 万),业内目前最高。
但 Artificial Analysis 那组数据我觉得最有意思👇 幻觉率 15%,Astra 是 51%。它不是变聪明了,是变诚实了——宁可说不知道。代价是答题准确率也掉到 50%,比 Astra 低 13 分。
你要的是"答得快"还是"不乱说",看场景。
谷歌这次憋了 7 个月才放旗舰,3.5 Pro 项目黄了,DeepMind 换了掌门,Jeff Dean 走了。牌桌上追回来了,但离"稳"还远。
你们会为了等它续 Google 会员吗?评论区吵一下👇
#Ai #Gemini4 #大模型 #AIGC #科技咨询