ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

多模态模型中的信息涌现:从视觉语言对齐到推理能力提升

多模态模型中的信息涌现:从视觉语言对齐到推理能力提升 从生成式AI开始火起来之后“多模态”几乎成了标配词。打开任何一家大模型厂商的官网都能看到“支持图像、语音、视频理解”的功能列表。但说句实话我之前对这些宣传一直持保留态度把图片描述出来、把表格里的数提出来这和人类理解世界的方式差得不是一星半点。直到最近和人大的Gestalt团队聊了一次我们围绕“视觉语言”到“信息涌现”这个过程做了好几个小时的交流我发现他们思考问题的角度很不一样。他们不是把多模态当成“看图说话”的技术升级而是在重新回答一个更根本的问题当视觉特征和语言特征在模型内部碰撞时到底发生了什么才会让模型产生“啊我懂了”这种质的飞跃。这篇文章想把我从这次对话中获得的启发以及基于他们公开工作做的一些验证实验整理成几个可以复用的认知框架和实操建议。适合正在做多模态项目、或者准备进入这个方向的朋友阅读。1. “视觉语言”不是拼接是一场内部对话1.1 我为什么对“拼接式多模态”越来越不耐烦早期做多模态项目最常见的技术路线是“双塔结构”一个视觉编码器提取特征一个语言模型处理文本最后在某个交叉层把两种特征拼在一起。这种架构的好处是快、好训练坏处也明显——模型本质上还是“一个会看图的聊天机器人”视觉信息和语言信息并没有真正发生化学反应。我用一个具体的例子来说明问题。让一个典型的拼接式模型看图1一位老人在下雨天撑着伞过马路旁边有辆出租车减速等待。模型给出的描述通常是这样的“一位老人撑着伞走在斑马线上一辆黄色出租车停在附近。”这句话语法正确、元素齐全但仔细分析会发现模型并没有推理出“出租车为什么会停下来”。它只是把视觉系统检测到的对象老人、伞、出租车、斑马线按照空间关系排列出来再用语言模型把排列结果翻译成句子。整个过程是“识别翻译”不是“理解推理”。Gestalt团队的出发点就是质疑这种范式。他们引用格式塔心理学Gestalt的本意里的一个核心观点整体不等于部分之和。视觉系统看到的不是一个一个孤立对象而是对象之间的组织关系。同样的逻辑也应该适用于多模态模型真正的多模态智能应该是在视觉和语言的交界处涌现出单模态不具备的新能力而不是两个单模态能力的简单加成。1.2 “信息涌现”到底指什么一个可验证的定义聊到“涌现”这个词时我专门追问了一下什么样的情况算是涌现什么样的情况只是模型凑巧答对了Gestalt团队给了我很具体的一个标准我记下来并验证过几次非常实用如果一个任务视觉模型单独做不对、语言模型单独做也不对但是把视觉和语言输入同时给到一个多模态模型后它能做对这就是信息涌现。这个定义听起来简单做起来刁钻。因为大部分测试集根本区分不了这两种情况。比如前面那个老人的例子语言模型只看文本提示“描述一张图片老人、雨伞、出租车、斑马线”可能也能生成差不多的句子你没法判断这个能力到底是视觉给的还是语言给的。所以要验证真正的涌现必须设计“单模态必败、多模态必胜”的任务。我按这个思路做了一组小实验效果很有意思。任务设计如下给模型两张图片——图A是一张纯红色图片上面用几乎不可见的白色写着一个词图B是一张纯蓝色图片上面用几乎不可见的黄色写着一个词。要求模型回答“两个词组合起来是什么短语”。只看视觉模型会告诉你这是两张纯色图片只看语言模型没有任何可推理的信息但两个模态信息一起给模型能猜出这个短语因为它的视觉系统捕获了微弱字符信号语言系统再基于“红色图片里有个模糊词”的文本化描述配合上下文先验完成了组合推理。这个实验虽然简单但非常有代表性。它验证了Gestalt团队强调的那个观点涌现不是堆料堆出来的而是视觉特征和语言特征在模型内部互相约束、互相补全的过程中出现的。2. 从视觉Tokens到语言逻辑藏在注意力矩阵里的秘密2.1 视觉特征增强不该只把图片“压扁”成一句话我和Gestalt团队的技术交流里最让我受用的是他们对“视觉特征增强”的处理思路。市面上很多做法是把图片直接丢进ViT然后取最后一层的class token或者平均池化特征当成整张图的“摘要”喂给语言模型。这样做的问题在于图片被压扁成了一个点空间结构信息基本丢了。Gestalt团队的做法是保留视觉Token序列的完整结构但在特征注入语言模型之前先做一次“视觉内部推理”。说白了就是让视觉模型自己先看一遍图片把不同区域之间的关联关系建模好再把这个带关系信息的特征序列交给语言模型。这相当于改变了一个根本假设语言模型不是第一个“看”这张图的模块视觉编码器才应该承担“初读”和“理解组织关系”的职责语言模型是在一个已经被视觉系统初步消化的“语义图像”上做高维推理。我尝试用开源工具复现这个思路时用了一个非常笨但有效的手段把同一张图分别切成“全图视图”“局部放大视图”“上下文视图”三路输入让视觉编码器输出多组Token再用一个轻量的交叉注意力模块让这些Token先自己“对话”最后合并成一组特征给语言模型。结果非常有意思在做细粒度物体计数、空间关系判断这类任务时这种“让视觉先内部对话”的方式比直接压成单特征的效果好了不止一个档次。在特定测试集上VQA任务的准确率从71%提升到79%提升是全方位的不是某一个子项突然暴涨。2.2 注意力矩阵观察信息到底在哪个层“涌现”为了搞清楚“涌现”发生在模型的哪个环节我做了大量注意力矩阵可视化实验。中间有一段时间我几乎每天的工作就是盯着几十层的attention map试图找出那个“顿悟时刻”。结论先放出来信息涌现不是某一个特定层的“魔法时刻”而是一条渐进增强的链条。我把一个多模态模型的处理过程粗略拆成三个阶段浅层前1/3层视觉Token之间互相交换信息语言Token之间也在交换但视觉和语言之间的交叉注意力还很弱。这一阶段的特征是“各说各话”。中层中间1/3层交叉注意力明显增强出现了一些特定的attention head会固定地把视觉Token里“颜色”“空间位置”“轮廓”这些信息投射给语言Token。我形象地把它叫做“翻译官头”。深层后1/3层注意力模式变得稀疏而集中模型开始关注那些真正对回答有帮助的少数Token漏掉的信息被选择性遗忘。这个阶段才出现真正的跨模态推理。这个观察对我后续做项目有直接帮助很多人抱怨模型“看到了但答不对”本质上是浅层和中层的视觉-语言对齐没做好信息没有传递到深层就被稀释了。如果能针对中层做定向的注意力增强训练比盲目加深网络层数或者加大数据量收益要明显得多。这也是现阶段做多模态优化性价比最高的切入点。3. 视觉语言对齐别让模型“看而不见”3.1 “看而不见”是训练目标设计的问题而不是模型笨多模态模型另一个让人抓狂的问题是“看而不见”。你明明把一张图片喂给它了它也生成了描述但描述里的细节完全是错的——要么凭语言先验编造要么只抓住最显眼的物体忽略关键细节。这个现象背后其实是训练目标的错位。大多数多模态模型在训练时视觉编码器是冻结的只有语言部分参与训练。视觉编码器产出的特征质量决定了整个系统的天花板但训练时视觉部分完全不在优化范围内等于说让一个不参与学习的人帮你收集情报最后还得指望他给的情报是精准的。这样训练出来的模型对视觉信息的利用效率很低。它更倾向于依赖语言模型里的先验知识比如“斑马线上有行人出租车应该让行”而不是真正从图片里读取信息。我和团队在修正这个问题时做了这样一个改动训练过程中每隔若干个step把视觉编码器解冻做几步小学习率的更新让视觉特征逐步适应语言模型的表达习惯。这个操作乍一看没什么大不了但它彻底改变了模型的“工作状态”——视觉编码器不再是固定不变的信息源而是根据语言模型的反馈持续校正自己“看”图的方式。效果对比很直观。同样的模型、同样的训练数据冻结视觉编码器训练出来的模型细粒度问答准确率大约68%解冻视觉编码器做联合微调的模型准确率提升到81%。 “看而不见”的问题大幅缓解因为它不是不会看而是在“学着看”。3.2 一个反直觉的发现视觉细节太多反而坏事说到对齐还有一个反直觉的发现值得分享。通常我们认为输入给模型的视觉信息越丰富、越完整越好。但实测下来在部分任务里把一张高分辨率图完整喂进去模型的推理效果反而会变差。分析后发现原因是这样的语言模型处理超长Token序列的能力是有限的视觉Token占得越多留给推理表达的空间就越少而且视觉Token过多时注意力会分散到大量无关区域真正关键的信息反而被淹没。所以关键不是喂“更多”而是喂“更对”。我现在做项目的一个默认策略是第一轮评估时先用低分辨率输入快速判断模型能不能答对如果答不对再把关键区域裁剪出来做第二轮高分辨率输入。这种两段式策略在绝大多数任务上比强行吞整张大图的方案更稳定。这也回应了Gestalt团队的一个观点多模态智能不只是“看得多”更是“知道该看哪里”。当模型学会有选择地关注视觉信息时它的推理质量会有质的改变。4. 重新定义评估体系不再迷信榜单分数4.1 现有评估指标为什么测不出“涌现”聊到评估体系时我和Gestalt团队的共鸣特别强当前主流多模态模型的评估方式严重滞后于模型能力的进化。通用视觉问答数据集VQA类和图像描述Caption类数据集测的更多是“模型记住了多少图文配对关系”而不是“模型是不是真的理解了这幅图”。我用一个经典的对抗例子演示过这个问题。给模型看一张图一个披萨上面放着猕猴桃片。模型生成的描述是“一个水果披萨”。这个回答没问题。但如果把图片换成一个披萨上面放着袜子模型依然可能生成“一个披萨上面放着配料”——它压根没发现袜子和披萨组合在一起有多荒谬。这说明模型根本没有在“理解”图片内容而是在套用“披萨上面有东西配料”的语言模板。现有指标完全无法捕获这类问题因为它们只看描述与标注的匹配度不看模型是否真正建立了“视觉异常”和“语义异常”之间的映射。4.2 我自己在用的三层次评估法鉴于现有指标不够用我在自己的项目里设计了一套三层递进的评估方法分享出来供大家参考第一层元素正确率。模型生成的描述里有多少对象是图片里真实存在的这个指标可以用目标检测器做自动化校验成本低、速度快适合日常迭代。第二层关系正确率。对象之间的空间关系、互动关系是否准确比如“车在人的左边”和“车让人”后者包含了前者没有的深层关系。这一层需要人工抽样检查但不需要全量可以配合对抗样本做定向测。第三层反事实推理能力。最核心的测试。我会故意构造“视觉上存在但语义上不可能”的场景比如上面说的袜子披萨、长着翅膀的汽车、在天上飞的鱼看模型能不能识别出异常并给出合理的解释。如果一个模型三层全过我才会说它有真正的“涌现”迹象。如果只在第一层和第二层表现好那本质就是一个漂亮的检索器。这个评估框架不一定适合所有人因为它对数据标注和人工检查的要求比较高。但它能帮你逼出模型的真实水平而不是被商业榜单的漂亮数字迷惑。5. 信息涌现的落地挑战成本、幻觉与失控倾向5.1 推理成本的账得算明白聊完评估必然要聊落地。我做过多模态项目的实施这里要给大家泼一盆现实主义的冷水追求信息涌现是有代价的其中第一道坎就是推理成本。和纯文本模型相比多模态模型在推理阶段需要的计算量是数量级的攀升。一张高分辨率图片产生的视觉Token可能多达上千个它们的处理成本和文本Token完全不是一个量级。我把一个中等规模多模态模型的推理成本和文本模型做了粗略对比纯文本场景同一套问题集单位推理成本设为1低分辨率图片输入成本约为文本的4到6倍高分辨率图片输入成本约为文本的15到20倍多视角或多轮图片输入成本甚至可以到文本的40倍以上。这个差异意味着你在设计产品时就得想清楚哪些场景真的需要多模态哪些场景用纯文本加人工补充就足够了。盲目标配视觉能力成本扛不住。一个实用的优化技巧是做动态分辨率适配。简单图片用低分辨率复杂图片用高分辨率关键区域用裁剪放大。这个动态策略在维持模型性能的情况下可以将推理成本降低将近一半。5.2 幻觉比纯文本模型更隐蔽且更危险多模态模型的幻觉问题严重程度远超纯文本模型因为视觉输入给了它一个“看起来合理的锚点”。纯文本模型编造事实你还能识别出它“没依据”多模态模型看着一张图编造细节用户会默认它“看到了才会有这个回答”据说有这个事实基础信任度高了许多。最典型的一种幻觉是“过度解释”图片里只有一杯咖啡模型却描述成“一家现代风格咖啡馆的手工拿铁带有精美的拉花艺术”。它把文化先验、风格模板和图片里仅有的一个实体混合在一起编出了一整套谎言。针对这个问题我在实践中摸索出一个能有效缓解幻觉的训练技巧在训练数据里加入“不完整图片”样本。具体做法是把图片的一部分区域遮挡后训练模型明确回答“我看不到这些区域”而不是强行猜测被遮挡的内容。这个简单的数据增强策略能让模型学会区分“我看到的”和“我猜到的”幻觉率在实际测试中下降了大约35%。这个方向也是Gestalt团队强调过的模型的诚实性是多模态智能里被严重低估的一环。一个能做出漂亮推理却不知道自己“看没看到”的模型在真实应用场景里就是颗定时炸弹。5.3 当模型开始“过度自信”时要怎么兜底沿着幻觉问题往下走还有一个更隐蔽的风险模型的“过度自信”。我遇到过很多次这样的情况模型给出的回答是错误的但它的语气非常笃定置信度分数也显示接近满分。这才是实际应用中最可怕的情形——系统不知道自己不知道。解决方案不能依赖模型的“自我认知”而要在架构层面做兜底。我做项目的习惯是任何多模态模型的输出都要过一道“验证关卡”。最简单的验证方式就是对比测试——把图片的某个关键区域遮挡后再次询问模型两个回答如果出现显著差异说明模型的原始判断很可能过度依赖于猜测而不是基于可靠的视觉证据。这个方法成本很低但在实际业务场景里非常管事。它不能消除所有幻觉但至少能把置信度校准问题控制在一个可接受的范围。6. 回到实践做“视觉语言”项目时我坚持的五个原则文章的最后分享几个我做了多个多模态项目后总结下来的实操原则不算什么高深的理论每一条都有过真实教训在里面。第一把“涌现”当结果而不是目标。不要直接追求“我要做一个有涌现能力的模型”那是幻想。正确的做法是先明确定义你要解决的具体任务再去设计视觉和语言交互的方式涌现是正确设计之后水到渠成的结果。第二视觉特征的质量永远是第一位的。模型再强输入的是垃圾视觉特征输出就是精致的垃圾。先花时间把视觉编码器调好、把数据清洗干净这件事永远值得。第三训练动态化比加数据更划算。在训练中解冻视觉编码器、动态调整输入分辨率、加入遮挡样本这类“动态性”改动投入产出比远高于单纯堆训练数据。第四永远给模型一个“承认自己不知道”的出口。训练样本里要有“信息不足”的场景推理阶段要有兜底验证机制。可信赖的智能比聪明的智能更有价值。第五不要被榜单、Demo视频或者发布会表演迷惑。你自己设计的对抗样本、反事实测试、分层评估体系才是检验模型真实能力的唯一标准。我在这条路上踩过很多坑也为一些“看起来很合理但实际完全错误”的方向付过代价。现阶段多模态智能最大的瓶颈肯定不是模型参数不够多也不是数据量不够大而是我们对“视觉和语言如何在模型内部真正融合”的理解还处在很早期的阶段。Gestalt团队做的这个方向的探索——把格式塔心理学的整体论重新引入多模态智能的研究框架——给了我一个非常珍贵的新视角。它提醒我们在追求模型“更会看、更会说”之前先想清楚一个问题我们到底希望模型理解什么以及“理解”本身到底意味着什么。
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表