ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

多模态AI看人熟不熟 视觉信息没帮上忙

多模态AI看人熟不熟 视觉信息没帮上忙 有些产品功能需要模型判断两个人的关系会议软件分析参会者是不是熟人社交产品判断该不该推荐破冰话题客服系统识别用户和客服之间是否已经建立过沟通。过去这类判断主要靠文本和语音现在多模态模型能同时看画面了——一段 20 秒的视频两个人面对面聊天模型能不能看出他们是熟人还是陌生人FriendBench 这个基准做的就是这件事而且结论比预想的有意思模型判断的准确率和人类没有显著差异但在回答倾向上模型和人类出现了系统性分歧。准确率不输人类倾向却不一样基准用 20 秒的破冰对话视频作为素材对比 26 个多模态大模型和人类群体在 96 个配对场景里的表现测试覆盖文本、音频、视频三种模态。结果分成两层看。准确率层面模型和人类没有显著差异都能从对话里提取出熟不熟的线索。但第二层结果暴露了差异人类在回答时保持中立倾向而最强的模型倾向于给出陌生人这个答案。也就是说模型在拿不准的时候默认往不认识那边靠。这个偏置不是推理能力的问题。从测试设计来看模型面对的是同样的信息输出却系统性偏向一侧更像是训练数据里陌生人样本占比更高或者模型学到了没有明确熟悉证据就判断为陌生的保守策略。视觉模态帮了人类没帮模型更值得琢磨的是第三个发现多模态信息对人类的帮助比对模型大。人类在文本和音频之外加上视觉行为信息后判断准确率明显提升——两个人说话时的眼神、身体姿态、距离感这些画面信息对人类有用。但同样的视觉信息加给模型准确率几乎没有变化。这说明模型在处理社交场景时视觉通道的信息并没有被真正利用起来。图像特征可能被提取了但没有和熟悉度这个任务目标形成有效的映射。对做多模态产品的人来说这是个提醒模型接了视频输入不等于它会用视频信息——视觉模态的接入成本和它对最终判断的实际贡献可能是两回事。对工程团队意味着什么这类基准看起来偏研究但对做社交、会议、客服类产品的团队有实际参考价值。模型在不确定场景下系统性偏向陌生人在真实产品里会产生累积效应如果一个推荐系统反复把熟人关系判断成陌生人用户感受到的就是功能失灵。而且这种偏置是隐性的——单次判断看不出问题只有统计大量输出才能发现。从工程角度看缓解手段无非几种在提示层面要求模型先判断证据强度再作答或者在决策层面对陌生人结论设置更高的置信度门槛。但基准里没有给出模型训练数据的分布细节也没有说明人类的中立倾向是否可以被模型模仿这些手段能起多大作用目前没有公开数据支撑。一个值得跟踪的问题是模型为什么在视觉模态上没有获益。如果是训练数据里社交场景样本太少那么随着多模态训练数据的丰富这个短板可能自动缓解如果是视觉特征和任务目标之间的映射设计问题那就需要架构层面的调整。两种情况对应完全不同的投入方向。关于维基框架维基框架关注企业应用开发中的长期维护问题。在实际项目中业务系统往往同时涉及权限、微服务、接口协议、部署环境等复杂因素因此我们希望提供一套更容易扩展和维护的基础框架。官网framewiki.comGiteegitee.com/wiki-frameworkGitHubgithub.com/wiki-framework示例项目gitee.com/cdkjframework/framewiki-example 许可证MulanPSL-2.0木兰宽松许可证第2版
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表