清华教授唐杰:万亿参数是弯路,后训练才是关键
这两年"参数"两个字快被吹成神话了——谁家模型参数多,谁就显得更牛。但清华大学教授唐杰最近直接泼了一盆冷水:万亿参数大模型,是行业走过的一段弯路。这话放在"越大越好"的赛道里,分量可不轻。
正文:
一、为什么说"堆参数"是弯路?
唐杰的核心判断是:单纯堆砌参数规模,不是一条可持续的技术路径。这话不是拍脑袋说的——你看智谱这次GLM-5.3的操作就懂了:它刻意控制变量,只做后训练,基座不动、架构不动、参数也不动,结果分数照样冲上国产第一梯队。这等于用实践给"堆参数"论上了一课:模型能力的上限,不只在预训练那一下,更在训练完之后的"打磨"环节。
二、后训练到底在"练"什么?
你可以把预训练想象成给一个孩子上完基础教育,后训练则是让他去实习、做项目、被社会毒打后学会办事。现在的模型光"读书多"不够,还得会"办事"——听懂人话、调用工具、写代码、按格式输出。唐杰指出的行业现状正是:大家太关注"读了多少书"(预训练规模),对"怎么办事"(后训练优化)投入不足。这也是为什么最近各家模型都在卷强化学习、卷对齐、卷Agent能力——本质上都是在补后训练这门课。
三、我的观点:这场"拨乱反正"来得正是时候
过去一年,行业为"千亿、万亿参数"烧了太多钱,但普通用户感受到的提升,远没有参数增长那么快。唐杰这个判断最大的价值,是把行业的注意力从"军备竞赛"拉回"把事办好"。对咱们普通用户来说,这也是个好消息:模型好不好用,终归要看它能不能把活儿干利索,而不是看它脑仁有多大。
互动问题: 你选AI工具时,会在意它背后是几千亿还是几万亿参数吗?还是只看它答得准不准、干活顺不顺手?来聊聊你的选择标准。
