大模型读书法,居然只需要3个token?
北大刚开源的新项目里藏了个狠活:连书法家都认懵的狂草,大模型扫一眼就能秒懂,还能把图片信息做到98.8%的极限压缩,不少业内人看完都直呼开了眼界。
之前大家几乎都默认,让电脑看懂中国书法根本就是天方夜谭。
早年的OCR,连普通人写得稍潦草点的日常笔记都识别错一堆,更别说笔走龙蛇的行书、狂草了——有时候人盯着墨迹都要琢磨半天,更别提逻辑死板的机器了。
这次北大王选计算机研究所直接甩出个王炸,开源了一个叫CalliReader的外挂模块,相当于专门给大模型装了一双能读懂书法的“慧眼”。
这个模块是搭在8B参数的视觉语言模型InternVL上做的,核心就三招,每一招都精准戳中了之前行业里卡了很久的技术死穴。
第一招是字级切分。
先用YOLOv10精准框出作品里每一个字的位置,再通过专门的排序模块捋顺古人写字的阅读顺序。
咱们老祖宗写书法,内容大多是唐诗宋词这类大家熟悉的篇目,有了正确的阅读顺序打底,哪怕某个字草到笔画全缠成一团,靠上下文一推,基本八九不离十就能认准。
第二招才是真的炸场,就是那个叫CalliAlign的对齐模块。
之前普通的ViT模块处理图片,随便一张图就要转200多个token,要是碰上一整幅几十上百字的长卷书法,token分分钟就把大模型的上下文占满,根本跑不动。
北大团队就靠训练3个可调节参数,直接把原本占256个token的图片信息,硬生生压缩到只剩3个token!
算下来压缩率刚好到98.8%,最绝的是他们训练时的目标,就是让图片转出来的token,和对应文字本身的token几乎完全对齐,信息损失小到几乎可以忽略。
第三招思路更巧,直接解决了训练数据不够的老大难问题。
压缩完出来的是自定义的伪文本token,原本的基座模型根本不认,换别的团队可能早就吭哧吭哧去人工标注几万张书法图了,累得半死不说,标注质量还未必准。
北大团队直接走了个捷径:从流传下来的唐诗宋词里摘内容,再从现成的书法字典里集字拼出完整作品,生成出来的内容本身就是标准答案,字形也全是正宗的传统书法写法,几乎零成本就把训练样本的缺口补上了,之后再用LoRA做一轮指令微调,模型直接就把识别书法的技能点满了。
其实这种细粒度视觉对齐的思路,北大彭宇新教授团队之前开源的Finedefics模型就已经验证过威力:之前大家头疼很久的视觉对象和细粒度子类别对不齐的痛点,靠对比学习把细粒度属性和视觉文本做对齐,直接在6个权威数据集上把平均准确率拉高了10.89%。
现在这个CalliReader跑起来,普通行书作品的识别准确率高得惊人,效果甚至能吊打参数量比它大好几倍的大模型。
说真的,之前好多人还担心,AI发展起来会不会把咱们老祖宗传下来的书法给弄变味了?
你看现在从三星堆文物的数智化复原,到梅兰芳数字人重现经典剧目,科技早就成了传统文化传承的最强助攻。
老话说“笔墨当随时代”,现在有了AI帮忙,藏在书法里的千年文脉,反而能让更多人看懂、传得更远。
你觉得等AI能精准读懂狂草之后,是会冲击传统书法创作,还是能给书法圈带来前所未有的新机会?
