国产大模型期中成绩单:GLM-5.3和Kimi K3并列第一
如果把2026年上半年的AI大模型比作一场考试,那这轮"期中成绩单"已经全部出分了。跟咱们上学时一样,有人考了第一,有人原地踏步,还有人干脆缺考。今天这份榜单,直接决定你下半年该用哪家模型、该关注谁。
正文:
一、第一梯队:国产模型第一次坐得这么实
智谱GLM-5.3和月之暗面Kimi K3都拿了60分,并列第一,是中国唯二挤进全球T1阵营的模型,离GPT-5.6和Claude Opus 5只差一口气。最扎眼的不是"谁赢了",而是国产模型第一次把头部位置坐得这么实。尤其Kimi K3,发布已经一个多月,还能压住位置——就像考试过了一个月,卷面分数依然没被人超过,说明是真本事,不是考前突击。
二、第二梯队:有人闷声发财,有人跌出预期
58分的Qwen3.8-Max、53分的DeepSeek-V4-Pro、52分的Qwen3.8-27B组成了第二梯队。阿里千问这代口碑本来就好,Max版本重新开源,27B版本亲民,HuggingFace上Qwen全系列今年被下载了20亿次以上,比第二名到第五名加起来还多——它已经成了很多开发者绕不开的"底座"。反倒是DeepSeek-V4-Pro这次有点微妙,分数没跑出预期。模型圈最怕的不是偶尔失手,而是明明有名气,却拿不出能稳住预期的版本。
三、看懂榜单,比记住分数更重要
公开榜单最残酷的地方,是它只认分数、不认解释。但换个角度想,它也能把话说得很实在:谁在往上冲,谁靠老本撑着,谁在开源和下载量上有优势,谁更适合特定场景。智谱这次刻意"只做后训练、不动基座",结果推得不差,这比分数本身更值得注意——它说明国产模型的上限还没被锁死,后续抠细节的空间还在。
如果只给"性价比"打分,你觉得国产模型里谁最值得普通用户日常使用?是免费够用的千问,还是价格更低的DeepSeek,或者是别的?说说你的理由。