不给VLM装耳朵,也能听懂视频里的话吗?
(来源:科技行者)
有件事你可能没想到。
现在市面上那些号称能"看又能听"的全能AI模型,比如通义千问的Omni系列,为了让模型听懂音频,工程师们干的第一件事是给一个已经很聪明的视觉语言模型,硬生生塞进去一个音频编码器,然后拉着整个模型重新做一遍海量的音频视频文本对齐训练。
这个过程有多贵?贵到什么程度呢,每次基础模型升级换代,这套音频适配的活儿都要从头再来一遍。而且更麻烦的是,这么折腾一圈之后,模型原本很强的看图能力、做题能力、甚至医学问答能力,反而可能变差了。
这就是这篇论文想戳破的一个假设:难道每出一个新的视觉语言模型,我们就非得重新给它做一次昂贵的"耳科手术"吗?
**一个反直觉的答案是,很多时候根本不需要。**
来自阿联酋穆罕默德·本·扎耶德人工智能大学的研究团队做了一件挺"偷懒"但很聪明的事:他们没有碰模型本身一根手指头,而是在外面挂了一个语音识别模块,把音频转成带时间戳的文字,直接塞进语言模型原本就有的文字输入接口里。这套方案叫TFO。
VLM*:视觉语言模型(Vision-Language Model),一种既能理解图片又能理解文字的AI模型,比如你熟悉的那些能看图说话的AI
ASR*:自动语音识别(Automatic Speech Recognition),就是把人说的话转成文字的技术
TFO*:Training-Free Omni,训练无关全模态框架,本文提出的核心方法,不改动模型任何参数就让它具备听觉能力
当年那些全能模型是怎么"武装"起来的
要理解TFO这个思路有多巧,得先明白原来的做法有多"重"。
市面上主流的全能模型,比如Qwen2.5-Omni、MiniCPM-O、OmniVinci,走的都是同一条路:找一个已经训练好的视觉语言模型当骨架,再单独训练一套专门处理音频的编码器和连接层,最后把这两拨东西拉到一起,用海量的音频加视频加文本数据做联合对齐训练。
这套流程听起来合理,问题出在哪呢?
音频这个东西天生就难伺候。它是时间上连续密集的信号,还经常夹杂噪音,你得让模型精确地把某一段声音和视频里某一帧画面对上号。之前已经有研究发现,哪怕是专门训练出来的音视频模型,也经常会漏听关键的声音信息,或者反过来,光靠画面脑补出根本不存在的声音。
更扎心的是第三个问题:模型在学新本事的过程中,可能会把老本事给忘了。
这不是危言耸听。论文里的实验数据很直接地摆出来了。以Qwen2.5系列为例,原始的Qwen2.5-VL在WorldSense这个需要视频理解的基准上,得分是39.7分,等它被训练成Qwen2.5-Omni之后,这个分数反而只有34.2分。视觉能力在音频训练的过程中被稀释了。
**这就好比你花大力气去学一门新外语,结果因为练习时间挤占了母语的使用,反而说起母语来磕磕巴巴了。**
如果外语学习机构告诉你"没关系,只要努力练,母语肯定不会退步",你大概率会怀疑这个说法。这篇论文做的事情,某种程度上就是把这种怀疑变成了可以量化验证的实验。
TFO到底怎么运作的
TFO的整体思路说白了没有那么玄乎。
系统接收到的输入可能是一段带声音的视频,也可能是图片加语音提问。第一步,用Whisper这个语音识别工具,把音频转写成文字。
Whisper*:OpenAI开发的一款开源语音识别模型,能把多种语言的语音转成文字,还能识别语言种类和给出转写的置信度
转写不是简单地把话变成字就完事了。Whisper会给出每一段话的起止时间戳,还会标注这段转写的可信程度。这里有个关键的过滤机制:置信度低于0.65的片段直接被扔掉,不会进入后续流程。为什么要这么干?因为背景噪音、静音、非人声的部分经常被语音识别工具强行"脑补"出一些莫名其妙的文字,如果不做过滤,这些幻觉文字反而会误导后面的推理。
带着时间戳和文字内容的转写结果,会被组装成一段文字,塞进原本视觉语言模型的输入提示词里,跟系统指令、视觉内容、用户问题拼在一起,一起喂给这个完全没有被改动过的模型。
**整个过程中,视觉语言模型的每一个参数都是冻结的,一个字节都没有动过。**
这里就要提一下时间戳的作用了。假设你在看一段足球比赛视频,有人问"传中球被头球攻门之后紧接着发生了什么"。如果只给模型一段没有时间标记的纯文字转写,模型很难知道"进球那句话"具体对应视频的哪个时间点。有了时间戳,模型就能把"00:03到00:07说了句什么"和视频画面里"00:03到00:07发生了什么"对上号,实现真正的时空对齐推理。
如果没有这个功能会怎样?论文的消融实验给出了答案:去掉时间戳之后,AVUT-Gemini这个基准掉了2.3分,Daily-Omni掉了1.4分。分数不是崩盘式下跌,但确实说明时间戳在需要精确对时的任务上是真金白银的贡献。
生成回答之后,如果需要语音输出,还可以再套一层CosyVoice3把文字转成语音,不过这一步纯粹是可选的收尾,不影响前面所有的评测结果。
大规模验证:56个基准,21种语言
光说思路巧妙没用,得看数据。
研究团队选了四个不同的模型家族做对照实验,每一对都是"原始视觉语言模型 vs 对应的原生全能模型 vs TFO改造版本"三方比较,覆盖Qwen2.5系列的3B和7B、MiniCPM4.5的9B、VILA对应的NVILA-8B,还有Qwen3系列的30B。总共跑了56个基准数据集,涉及21种语言的语音评测。
这个规模在同类研究里算是相当扎实的。
先看音视频理解这块,涉及九个基准,包括WorldSense、Video-Holmes、AVUT等。Qwen2.5-3B用了TFO之后平均分提升了3.0分,7B提升2.2分,VILA提升0.4分。特别值得一提的是WorldSense这个需要理解真实世界场景的基准,Qwen2.5-7B从33.9分直接跳到48.4分,涨了14.5分,这个幅度不算小。
不过MiniCPM4.5和Qwen3这两个家族在音视频理解上反而略降了2.2分和0.8分,说明这套方案不是万能药,效果确实跟具体模型和任务性质有关系。
再看纯音频理解,九个基准的平均分在全部五组对比里都提升了,涨幅分别是1.5、1.4、4.0、13.5和1.4分。VILA对应的OmniVinci提升最猛,从50.3分冲到63.8分。VoiceBench这个基准在VILA上直接从27.5分涨到78.0分,涨了整整51.3分。
这个数字是什么概念?
意味着原本的OmniVinci在语音指令跟随类任务上,答对率不到三成,换成TFO之后能对接近八成。这不是小修小补,是质变级别的提升。
多语言这块表现更亮眼。用CoVoST2这个覆盖21种语言的翻译测试集,五组对比全部提升,涨幅从6.8到18.4分不等。MiniCPM4.5家族涨幅最大,从45.6分到64.0分。具体到语言上,爱沙尼亚语涨了43.6分,拉脱维亚语涨了35.4分,瑞典语涨了35.8分。这些都是原生全能模型表现特别差的小语种,恰恰在这些语言上TFO的提升最明显。
**这个规律揭示了一件事:全能模型的多语言能力短板,很可能是因为音频训练数据里这些小语种样本太少造成的,而Whisper作为一个专门的语音识别工具,训练数据覆盖面本身就更广。**
冻结的代价与收益:那些被保留下来的能力
前面说的都是TFO在语音相关任务上的表现,但这篇论文更有意思的部分,其实是它证明了"冻结"这件事本身带来的好处。
图像和视频理解方面,八个图像基准和六个视频基准的对比里,TFO在图像上五组对比全部占优,涨幅从0.3到2.4分。视频理解上四组对比领先,涨幅2.3到3.8分。VideoMME这个长视频理解基准在四个模型家族里都涨了0.4到10.5分。
代码和数学推理方面,四组对比里三组TFO占优。有意思的是,每一个TFO版本在MBPP、MBPP Sanitized、HumanEval这三个编程基准上都稳定超过对应的原生全能模型。数学方面波动稍大,但视觉数学推理上进步比较明显,比如Qwen2.5-3B在MathVerse上从32.1分涨到47.6分,涨了15.5分。
医学问答这块覆盖了12个基准,五组对比全部提升,涨幅0.5到1.7分。MedFrameQA在Qwen3上涨了9.8分,PMC-VQA在MiniCPM4.5上涨了5.6分。
视觉定位(也就是模型精确指出图片里某个物体位置的能力)方面,PixMo-Count这个计数基准五组全部提升,VILA涨了15.5分,Qwen3涨了11.2分。
这些数字堆在一起说明了什么?
**说明原生全能模型在学习听觉能力的过程中,确实付出了看不见的隐性代价,而这个代价被冻结方案完整规避掉了。**
这里可以打个比方。假设你请了一位家教,专门给孩子补数学,结果家教用力过猛,占用了孩子太多语文练习时间,期末考试数学是提高了,语文却退步了。而TFO相当于换了个思路:完全不动孩子原本的学习安排,只是额外给他配了个"实时翻译耳机",专门帮他听懂课堂上的语音内容,其他所有课程该怎么学还怎么学。
如果家长不做这个权衡,只盯着数学分数提升就沾沾自喜,语文退步的问题很容易被忽略。这篇论文的价值恰恰在于,它把这两笔账都摆出来对比着算,而不是只报喜不报忧。
TFO撞到的两堵墙
任何方案都有边界,TFO也不例外,论文对此说得很坦诚。
第一堵墙是速度。因为需要先跑一遍语音识别再跑视觉语言模型,两步是串行的,总耗时自然比原生全能模型一次到位要慢。以AVMeme这个基准为例,原生模型总耗时大概0.7到2.4秒,TFO则要1.3到3.1秒。不过如果同一段音视频要回答多个问题,转写结果可以只做一次然后反复用,这个额外开销就能被摊薄。
第二堵墙更本质,是转写这个环节天生的信息损失。
研究团队专门用AVHBench这个基准做了细分实验,把任务拆成三类。第一类叫"音视频匹配",看模型能不能判断听到的声音和看到的画面是不是对得上;第二类叫"视频驱动的音频幻觉",看模型会不会因为画面暗示了某种声音,就误以为真的听到了这个声音;第三类叫"音频驱动的视频幻觉",反过来,看模型会不会因为听到某种声音,就误以为画面里真的出现了对应的物体。
结果很清楚。前两类涉及非语音的声学信息,比如音乐、环境音、情绪语调,这些东西一旦被压缩成纯文字转写,细节就丢了,TFO在这两类任务上普遍表现不如原生全能模型,甚至有明显退步。但在第三类任务上,因为TFO压根没动过视觉通路,反而在四个模型家族里全部超过原生模型。
**这个界线划得非常干净:语言层面的路由能搞定"听懂说了什么",但搞不定"听懂这是什么声音"。**
研究团队没有就此止步,还试着补救过。他们额外接了几个专门处理音频的辅助模型,比如SenseVoice负责识别情绪和声音事件,MELLOW负责推理声学场景,AudioFlamingo2负责描述长音频,把这些模型输出的文字描述也一并塞进提示词。结果发现,这些辅助信息经常在某个基准上有点小提升,换个基准立马又拖后腿,没有哪个组合是稳定管用的。
这说明什么?说明想把丰富的声学信息塞进纯文字接口,本身就是个不太靠谱的路子,声音里那些非语言的信息,恐怕真的需要更贴合它本质的表示方式,而不是硬翻译成一串描述性文字。
这就好比你想向一个从没见过颜色的人描述"晚霞的橙红色有多美",你可以写很长的文字去形容,但这些文字终究替代不了直接看一眼。语言这个媒介本身,在传递某些感官信息时是有损耗的。
消融实验揭示的分工
论文里还做了个挺清晰的拆解实验,专门验证TFO里每个部件各自贡献了什么。
用Qwen2.5-VL-3B当底座,测试四种配置:原始视觉语言模型不加任何音频信息、加上Whisper转写、加Whisper但去掉时间戳、以及原生的Qwen2.5-Omni做对照。
结果显示,光是原始视觉语言模型,在WorldSense和Video-Holmes上就已经超过了原生全能模型,说明视觉推理能力本身没问题。加上Whisper之后,六个基准全线提升,五个超过了原生Omni模型。去掉时间戳,AVUT-Gemini掉2.3分,AVMeme-Full掉1.7分,Daily-Omni掉1.4分。
这个实验的价值在于把功劳拆分清楚了:视觉能力是原本骨架自带的,听懂说了什么靠的是Whisper,而精确对齐时间点则要靠时间戳这个额外设计。三个部分各司其职,谁也替代不了谁。
写在后面
读完这篇论文,我脑子里一直在打转的一个问题是:我们是不是习惯性地把"加能力"等同于"加训练"了?
在深度学习这几年的叙事里,几乎所有的进步故事都长得差不多:想让模型多会点什么,就去找更多数据、设计更复杂的结构、投入更多算力去训练。这套叙事太顺理成章了,以至于我们很少停下来问,有没有可能某个能力根本不需要被"塞"进模型内部,而是可以在外部拼接完成。
TFO这篇论文让我意外的地方,其实不是它的准确率数字有多漂亮,而是它选择了一条几乎"反工程直觉"的路:明明有现成的技术能做联合训练,却故意不这么做,转而去验证"不训练"到底能撑到什么程度。这种做减法的研究思路,在一个普遍追求"更大更强更复杂"的领域里,显得有点特立独行。
还有一个细节让我印象很深,就是那个关于置信度阈值0.65的选择。研究者试了0.6和0.75两个数值,发现0.6和0.65效果差不多,但0.75反而因为过滤太严格,把一些有用但语音识别不太确定的内容也一起扔掉了,导致AV-Odyssey这类任务分数下降。这个细节说明,看似简单的一个超参数,背后其实也是一场"宁可漏检还是宁可误判"的权衡博弈,没有什么绝对正确的答案。
这篇论文没有解决的问题也很明显:非语音的声学信息,比如音乐的情绪、环境音的层次感,这些东西怎么才能不经过文字这个"瓶颈",直接被语言模型理解?如果哪天有人找到一种方法,能让声音的"质感"绕过转写直接进入模型的推理过程,会不会又是另一个值得写的故事?
Q&A
Q1:TFO是什么?
A:TFO全称Training-Free Omni,是穆罕默德·本·扎耶德人工智能大学团队提出的一种方法,不需要改动或重新训练视觉语言模型,只靠外挂语音识别工具把音频转成带时间戳的文字,就能让模型具备听觉理解能力。
Q2:TFO和原生全能模型相比效果怎么样?
A:在56个基准、21种语言的测试中,TFO在纯音频理解和多语言语音任务上全面超过原生全能模型,同时更好地保留了原模型的图像视频理解、代码数学推理和医学问答能力,但在音乐、环境音等非语音声学理解上表现较弱。
Q3:TFO有什么局限性?
A:主要有两点,一是因为语音识别和模型推理是串行执行,整体耗时比原生模型略长;二是把声音转成文字会丢失情绪、音乐、环境音等非语言信息,导致这类任务表现不如经过专门训练的原生全能模型。