铭鸿体育资讯网

【字节要做5万亿参数大模型,数据从哪来】字节被曝要搞国内最大的5万亿参数模型,超

【字节要做5万亿参数大模型,数据从哪来】字节被曝要搞国内最大的5万亿参数模型,超过阿里和Kimi。但做大模型有个隐秘的坑:不是越大越好,得喂够数据才行。早年模型小,扫一遍互联网全是新知识;吃到几万亿token后,重复内容越来越多,同样1万亿有效信息,可能要从5万亿原始数据里捞。更麻烦的是长尾数据——冷门专业知识、罕见代码、小语种,这些本来稀有,想扩大十倍,先得有百倍的数据池去筛。参数能用GPU解决,但数据没法凭空变出来。这也是很多人看好字节的原因:它不只会爬数据,还能靠平台活动让人主动创造新内容,虽然大部分是噪音,但总能筛出金子。你觉得大厂拼到最后,拼的到底是算力,还是谁更能搞到别人没有的数据?人工智能 你觉得数据才是终极壁垒吗