TPAMI 2026 | 视觉特征再升级!vMLLM:多级聚合 + 跨模态增强,MLLM 性能暴涨
(来源:小白学视觉)
在刷短视频、用AI识图答疑的日常里,你有没有遇到过这样的情况:AI明明“看”到了图片,却答非所问——比如问“图片里的猫是什么颜色”,它却盯着背景的花盆说个不停;或者想让它解读一张图表,它只能说出表面信息,抓不住关键数据。
这背后,其实是多模态大语言模型(MLLM)的“视觉短板”:现有模型大多只捡视觉编码器最后一层的特征用,就像看书只看最后一页,既丢了细节,又没做好图像和文字的精准对齐。而最近发表的vMLLM框架,恰恰解决了这个问题,给多模态大模型装上了更敏锐的“视觉感知系统”。
论文信息
题目: Boosting Multi-modal Large Language Model with Enhanced Visual Features
基于增强视觉特征提升多模态大语言模型
作者: Yiwei Ma, Weihuang Lin, Zhibin Wang, Jiayi Ji, Xiaoshuai Sun, Chia-Wen Lin, Rongrong Ji
源码:https://github.com/xmu-xiaoma666/vMLLM
先搞懂:多模态大模型为啥看“图”费劲?
我们先简单说说多模态大模型的工作逻辑:它靠视觉编码器提取图片特征,再通过连接器把视觉特征转换成文字模型能懂的语言,最后由语言模型生成回答。
但这里有两个核心问题一直没解决:
视觉特征用得“不全面”:视觉编码器不同层的特征各有价值——低层藏着边缘、纹理这些细粒度细节,高层装着“猫”“桌子”这种抽象语义。可多数模型只取最后一层的高层特征,相当于放弃了能精准定位的细节信息。
图像和文字“对不上焦”:图片里总有无关的背景信息,比如问“有几只狗”,模型却会被路边的树分散注意力;而且图像特征和文字指令的匹配度不够,没法精准盯着问题里的核心区域。
这两个问题,就像让一个人用模糊的望远镜看东西,还没法聚焦到关键目标,自然答不准、答不细。
核心创新:vMLLM框架,给视觉理解做“双升级”
为了解决这些问题,研究者提出了vMLLM视觉增强框架,核心就靠两个“独门模块”——多层级聚合模块(MAM)和模态内外增强模块(IEM)。先看整体架构图,一眼就能看懂它的工作流程:
图2
简单来说,vMLLM的工作步骤特别清晰:
先把输入图片传给视觉编码器,提取出所有层的视觉特征;
用MAM把这些多层特征“筛选整合”,既保留细节又抓住语义;
再用IEM给特征做“精准聚焦”,过滤无关信息,对准文字指令的核心;
最后把处理好的视觉特征和文字指令结合,传给语言模型生成回答。
第一个升级:MAM模块——不浪费任何一层视觉信息
MAM的核心思路,就是把视觉编码器每一层的特征都利用起来,而不是只捡最后一层。
图3
它会先把前半层的特征归为“低层细节组”,后半层归为“高层语义组”,再分别生成“查询特征”——相当于给两组特征做个“总结标签”。接着通过注意力机制,让模型自己判断:解决当前问题,该重点用哪几层的特征。
比如识别“猫的毛色”,模型会多关注低层的纹理特征;回答“图片里有什么动物”,就侧重高层的语义特征。最后把这些选出来的特征整合,既不丢细节,也不缺全局,让视觉特征更完整。
第二个升级:IEM模块——让图像和文字精准“对齐”
IEM解决的是“对焦”问题,核心是让模型学会“看问题找重点”,既过滤图片里的无关信息,又让图像和文字精准匹配。
图4
它做了两件事:
模态内增强:让图片特征自己“对比”,突出前景、主体这些关键区域,比如自动忽略背景的墙壁、马路,聚焦到猫、狗这些核心物体上;
模态间增强:根据文字指令调整注意力,比如问“有几只狗”,就专门强化图片里狗的区域特征,问“猫的眼睛是什么样”,就聚焦猫的眼部细节。
最后把增强后的特征和原始特征融合,既保留完整信息,又让重点更突出。
实测效果:不管换啥模型、啥数据,都能提性能
好的方法,得经得起各种测试。研究者做了大量实验,结果特别亮眼:
1. 不同视觉编码器都能用
不管是CLIP系列还是SigLIP系列的视觉编码器,加上vMLLM后,性能都能涨。比如SigLIP ViT-SO编码器,平均性能从47.35%涨到48.33%;而且编码器越好,提升越明显——因为好编码器提取的特征质量高,vMLLM能把这份优势放大。
2. 不同大小的语言模型都适配
不管是7B、8B还是13B规模的大语言模型,vMLLM都能带来稳定提升,平均涨幅在0.7%-1%左右。别小看这1%,在多模态评测里,每0.1%的提升都不容易,而且这是在不增加太多参数的前提下实现的。
3. 数据多少都能出效果
哪怕用较小的训练数据集(558k预训练+665k微调数据),vMLLM也能显著提分;数据量越大,提升越明显。比如AI2D图表理解任务,小数据下涨0.71%,大数据下直接涨6.9%。
4. 效率没咋降,性能却大涨
加了MAM和IEM后,模型参数只增加了3%-6%,处理速度(吞吐量)也只慢了8%-10%,但换来了全方位的性能提升。比如GQA视觉问答任务,从64%涨到65.04%;Infographic VQA信息图问答,从26.42%涨到27.74%。
看得见的效果:这些案例太直观了
光看数字不够,咱们看实际案例更有感觉:
图5
这张图里,vMLLM能精准识别图片里的文字、解读数学题、看懂图表和地图,甚至能缓解“幻觉”——比如不会把“没有的物体”编出来。
再看更细节的对比:
图8
面对同样的图片和问题,vMLLM的回答比其他先进模型更准、更细。比如解读统计图表时,它能精准说出数值和趋势;识别场景时,能抓住“商店名称”“物体位置”这些细节,而不是只说个大概。
还有注意力可视化的结果,更能说明问题:
图6
不同层级的视觉特征,能精准对准文字问题里的核心区域——低层特征盯细节,高层特征抓语义,选定层特征聚焦主体,真正做到了“问啥看啥”。
为啥这篇论文值得关注?
这篇论文的价值,不只是提了个新框架,更重要的是找准了多模态大模型的“视觉痛点”:
过去大家都在优化连接器、微调语言模型,却忽略了“视觉特征没利用好”这个基础问题。vMLLM从这个角度切入,用两个轻量的模块,既解决了“特征用不全”的问题,又解决了“特征对不准”的问题,而且兼容性极强——不管是啥视觉编码器、啥语言模型,都能直接集成。
对普通用户来说,这意味着未来的AI识图、图文问答、图表解读会更精准:问AI“图片里的咖啡杯有几个”,它不会再盯着旁边的面包乱说;让AI解读一份财报图表,它能精准说出营收数据和增长趋势。
对研究者来说,这篇论文也提供了新思路:多模态模型的优化,不该只盯着语言侧,视觉特征的挖掘和交互,还有很大的空间。
最后说两句
vMLLM的出现,就像给多模态大模型的“视觉系统”做了一次精准升级——不搞复杂的架构重构,只靠两个小模块,就让模型的视觉理解能力实现了质的提升。而且它的代码和预训练模型已经开源,不管是想落地应用,还是继续做研究,都有很高的参考价值。
未来,随着视觉特征挖掘越来越深入,多模态大模型或许能真正做到“所见即所懂”,在教育、医疗、办公等场景里,发挥出更实用的价值。
下载1:OpenCV-Contrib扩展模块中文版教程
在「小白学视觉」公众号后台回复:扩展模块中文教程,即可下载全网第一份OpenCV扩展模块教程中文版,涵盖扩展模块安装、SFM算法、立体视觉、目标跟踪、生物视觉、超分辨率处理等二十多章内容。
下载2:Python视觉实战项目52讲
在「小白学视觉」公众号后台回复:Python视觉实战项目,即可下载包括图像分割、口罩检测、车道线检测、车辆计数、添加眼线、车牌识别、字符识别、情绪检测、文本内容提取、面部识别等31个视觉实战项目,助力快速学校计算机视觉。
下载3:人工智能0基础学习攻略手册
交流群
欢迎加入公众号读者群一起和同行交流,目前有SLAM、三维视觉、传感器、自动驾驶、计算摄影、检测、分割、识别、医学影像、GAN、算法竞赛等微信群(以后会逐渐细分),请扫描下面微信号加群,备注:”昵称+学校/公司+研究方向“,例如:”张三 + 上海交大 + 视觉SLAM“。请按照格式备注,否则不予通过。添加成功后会根据研究方向邀请进入相关微信群。请勿在群内发送广告,否则会请出群,谢谢理解~