当伴侣吵架吵到面红耳赤,如果交给AI来"劝架",AI能听懂多少?
(来源:科技行者)
香港理工大学的一群研究者最近做了一件挺较真的事:他们找来174对夫妻和17个家庭做心理咨询访谈的真实录像,一帧一帧地标注,谁在什么时候说了什么话,情绪是什么样,谁对谁有什么看法,咨询师什么时候该开口、该对谁说话、该用什么策略。这套数据集起了个名字叫RESCUE-BENCH,然后拿了十个当下最厉害的大语言模型来做测试。
结果挺有意思:这些AI在"看懂一个人现在什么心情"这件事上表现得不错,但一旦涉及到"这两个人之间到底是什么关系动态""谁在拉扯谁""该先安抚谁"这类问题,统统翻车。
这篇论文的意义,可能比它听起来的要大。因为过去几乎所有的AI情感陪伴系统,都默认了一个前提:一个用户,一个AI,一对一聊天。可现实生活里,大部分让人心力交瘁的情绪困境,恰恰不是一个人的事。
**为什么"一对一安慰"模型解决不了真正的痛点**
先说说现在市面上AI情感支持系统都在做什么。
ESConv*:一个由学者构建的经典情感支持对话数据集,场景设定是一个寻求帮助者和一个支持者之间的一对一聊天,是目前大多数AI情感支持研究的基础
这类系统的逻辑很清楚:用户倾诉,AI理解情绪,AI给出安慰或建议,循环往复,目标是让这一个人感觉好一点。
问题是,当研究者们想把这套逻辑扩展到"多人场景"时,他们做的事情往往是简单粗暴的复制粘贴:同一套逻辑,套用在每个参与者身上,各自安慰各自的,互相之间的关系被完全无视。
这就好比你去调解两口子吵架,你分别把两人叫到不同房间,各自听各自倒苦水,分别安慰完就完事,从没让他们俩坐下来一起谈过彼此之间到底发生了什么。这种"调解"有用吗?
多半没用,因为矛盾的根源根本不在某一个人的情绪里,而在两人之间的互动模式里。如果一方总是追着要解释,另一方总是回避退缩,你单独安慰追的那个人"别急",单独安慰躲的那个人"别怕",这两人回到一起该怎么互动还是怎么互动,问题压根没触碰到。
论文里提到两个心理学概念来解释这个逻辑:
木桶效应*:一个群体的整体状态,往往取决于其中最脆弱、最痛苦的那个成员有没有被照顾好,而不是所有人平均水平如何
涟漪效应*:一个人的情绪和压力,会像水波一样在关系网络里扩散开去,影响到其他人
这两个概念放在一起看,意思很直白:如果你的AI系统只顾着让每个人"平均感觉好一点",却没注意到那个最痛苦的人到底有没有被真正接住,也没注意到情绪是怎么在人和人之间传染的,那这个系统从设计逻辑上就没抓住重点。
**关系感知型情感支持,到底要多做点什么**
论文提出了一个新任务,叫"关系感知情感支持对话"。听起来抽象,拆开来看其实很具体。
传统的情感支持系统,只需要搞明白一件事:这个人现在什么感受,强度多大。
而关系感知系统,除了要搞懂个人情绪,还得额外搞懂三件事:这个人对另一个人是什么态度和立场(比如"我觉得他从来没把我当回事");整个群体现在处于一种什么样的互动模式(比如"一个人在追,另一个人在躲",或者"两个人在互相攻击");基于这些理解,该在什么时候介入、该重点关照谁、该用什么策略。
研究者把这套复杂的判断拆成了六个具体的评测任务,分成两大类。
第一类叫"关系理解",包括情绪识别、观点预测、关系模式预测三项。第二类叫"关系敏感型支持",包括介入时机预测、支持对象预测、支持策略预测三项。
**为什么这六个任务缺一不可**
情绪识别*:判断某个说话人此刻内心的情绪状态和强度,这是传统ESC任务里就有的能力
观点预测*:判断一个人对另一个人的看法和态度,比如"她觉得他从来不听她说话"
关系模式预测*:判断当前这段对话整体处于什么样的互动循环里,比如追逐-回避、互相攻击、修复中的软化,等等
介入时机预测*:判断咨询师此刻该不该开口说话
支持对象预测*:判断这次介入应该主要针对谁,是某一个人、某两个人的冲突,还是整个家庭
支持策略预测*:判断针对选定的对象,该用什么样的具体干预方式
这六个任务加起来,才勉强够得上"理解一段复杂人际关系,并且做出恰当回应"这件事的完整链条。
传统的一对一情感支持研究,基本只涉及情绪识别和支持策略这两项,中间那四项——观点预测、关系模式预测、介入时机、支持对象——全都是空白。
这就像一个只会看体温计的医生,遇到复杂病人时突然发现,光看体温根本不够,还得看血压、心率、影像、化验单,才能判断到底该给哪个器官动手术,先动哪个,怎么动。
**真实素材从哪来:夫妻和家庭访谈录像**
数据从哪里来这件事,研究者处理得挺实在。他们没有用剧本演出来的对话,也没有让AI自己生成模拟场景,而是直接找了两档真实的纪实类访谈节目:一档是couple therapy(夫妻咨询),一档是family therapy(家庭咨询)。
他们手动把这些视频切成一个个独立的访谈片段,过滤掉时长不足两分钟的片段(太短的片段往往缺乏足够的关系背景),最终留下174个夫妻样本和17个家庭样本,总共标注了7079个对话轮次,视频总时长超过1064分钟。
为了保证标注质量,他们先用一个多模态大模型Gemini-3.1-Pro对每段视频做预标注,参考视频画面和字幕内容,生成结构化的标注草稿。然后请了三位博士级别的标注员,搭建了一套在线核查系统,逐条比对视频原始画面,修正错误标注,剔除识别错误严重、说话人对不上、或者证据不足的片段。
这个流程听起来繁琐,但你想想,如果直接用AI预标注结果不加人工核查,那这个基准数据集的可信度会大打折扣。就好比你要建一个法律案例库,不能让实习生随便翻翻案卷就写摘要,必须有资深律师逐条核实,否则整个案例库的权威性就没了根基。
标注的维度也做得很细,论文里列了六个结构化字段:时间和实体信息(谁在什么时候说话、对谁说)、语言内容(说了什么、什么类型的表达)、个体线索(语气、姿态、表情、内在情绪)、关系立场(互动行为、对他人的观点态度)、咨询师策略(用了什么支持手段)、关系模式(当前处于什么循环状态)。
**关系不是静止的,它会转来转去**
论文里做了一个挺扎实的分析,专门看关系模式是怎么随时间变化的。他们计算了一个转移矩阵,统计"当前处于某种关系状态"之后,"下一步最可能转向哪种状态"。
结果发现,关系变化是高度非线性的。
追逐-回避模式*:一方不断寻求联结、解释、回应,另一方却回避、缩小问题、转移话题或干脆闭嘴,这是一种典型的负性互动循环
攻击-攻击模式*:双方都在互相指责、批评、防御或反击,谁都不退让
修复性软化*:原本剑拔弩张的互动开始松动,双方语气变软,开始表达脆弱、道歉、承认伤害
数据显示,像"攻击-攻击"或者"追逐-回避"这种负面循环,通常不会一步跳到"稳定和谐",中间往往要经过"修复性软化"这个过渡状态。而"追逐-回避"这个模式非常顽固,即便暂时进入了"双方都沉默"或者"关系有所修复"的阶段,过一会儿又会重新冒出来,像一个反复发作的老毛病。
这个发现直接戳中了一个关键问题:如果一个AI系统只会给关系贴一个静态标签("这是攻击型关系"),而不会追踪它是怎么随时间演变的,那它其实没有真正理解关系,它只是拍了一张快照。
这就好比天气预报员只会说"今天是晴天",却完全不会预测"这场晴天接下来会不会转阴、会不会下雨"。知道当下状态是一回事,理解动态趋势是另一回事,后者才是真正有用的能力。
**十个大模型跑分,结果分裂得很明显**
研究者拿了十个代表性的大语言模型来测试,包括Qwen系列、DeepSeek系列、GPT-4o、Kimi K2.5、MiniMax M2.5等,全部用零样本设置跑,也就是不给任何针对性训练,直接看模型的原生能力。
结果呈现出一个很清晰的分裂:凡是依赖"局部线索"的任务,模型表现相对不错;凡是需要"关系推理"的任务,模型普遍翻车。
具体数字是这样的:介入时机预测任务上,平均F1值达到82.62%,情绪识别任务上,平均评分达到4.05分(满分5分)。这两项都是相对"看一眼当下就能判断"的任务。
但关系模式预测任务上,最好的模型准确率也只有45.60%,平均下来只有40.45%。这意味着接近六成的情况下,AI都判断错了当前的关系状态是什么。
观点预测任务上,虽然文本相似度得分(BERTScore)看起来还行,但语义评判得分明显低于情绪识别(3.58分对4.05分),说明AI能大致说出个"看起来像那么回事"的答案,但真正说准"这个人对另一个人的具体看法是什么",难度要大得多。
支持策略预测更惨,召回率只有31.88%,也就是说,AI推荐的最佳策略,只有大约三分之一的情况下真正命中了标注员认定的正确答案。
**为什么"看懂关系"比"看懂情绪"难这么多**
论文对三个代表性的失败任务做了深入分析,这部分内容特别值得琢磨。
先说关系模式预测。研究者按对话进程把每段对话切成十个时间段,发现准确率并不是随着对话变长而单调下降,而是忽高忽低地波动。
这说明问题的根源不是"上下文太长记不住",而是"关系状态在不停地转变,模型跟不上这种转变的节奏"。进一步的分析显示,不同阶段的关系模式分布本身就在剧烈变化,这意味着模型必须持续更新自己对当下互动结构的理解,而不能靠一次性判断吃老本。
再说观点预测。这里最大的难点在于,人们表达对另一个人的看法时,往往不是直接说出来的。
很多时候,一个人不会直接对伴侣说"我觉得你根本不在乎我",而是转过头去对咨询师抱怨,而且措辞往往是伪装过的。比如一个人内心其实是委屈和受伤,表现出来的却是愤怒和强势——愤怒是表面情绪,委屈才是底层动机。
模型往往只能抓住表层的粗粒度情绪,却抓不住这种"话里有话"的深层归因,结果就是经常把这种伪装误判为字面意思。
这就好比一个刚入行的心理咨询师,听到来访者说"我一点都不在乎他怎么想",很容易信以为真,而一个经验丰富的咨询师会立刻警觉:这句话说得这么用力,是不是恰恰相反?现在的大模型,大多还停留在"刚入行"的水平上。
最后说支持策略预测。这个任务上模型的召回率很低,但MRR(衡量正确答案排名靠前程度的指标)相对高一些,这个组合说明了一件事:AI大致能圈出一个"看起来合理"的候选策略范围,但没法精确地从这个范围里挑出那个最对的答案。
这类似于你去咨询装修方案,设计师能给你列出三种大体靠谱的方向,但没法一眼看出你家的具体情况最适合哪一种。这种"能猜个大概,猜不准具体"的状态,恰恰反映出深层关系推理这件事,比表面的分类判断要难得多。
**标签体系的构建:两套理论撑起整个框架**
这篇论文标注体系的理论支撑,值得单独说一说,因为它没有凭空发明一套标签,而是扎扎实实地对接了心理治疗领域已有的成熟理论。
情绪聚焦疗法*(EFT):一种关注夫妻依恋需求和情绪深层动机的心理治疗方法,强调识别负性互动循环、软化情绪防御、促进情感联结
结构式家庭治疗*(SFT):一种关注家庭结构、边界、层级和联盟关系的心理治疗方法,强调通过调整家庭内部结构来解决问题
夫妻场景的标签设计,主要围绕情绪聚焦疗法展开,像"追逐-回避""攻击-攻击""修复性软化"这些标签,都能在这套理论里找到对应的临床概念。家庭场景则主要依托结构式家庭治疗,像"边界/层级紧张""跨代联盟"这些标签,对应的是家庭里谁跟谁结盟、谁的边界被侵犯这类结构性问题。
这个设计思路挺聪明的地方在于,它没有让AI去发明一套"看起来合理"的标签体系,而是直接借用了几十年积累下来的临床智慧。这就像做医学AI诊断系统,你不会让工程师自己拍脑袋定义"什么是发烧",而是直接采用医学界公认的体温标准。
支持策略的标签同样精心设计,咨询师的每一种干预方式都对应着具体的理论功能,比如"track"(跟踪并命名当下的互动循环)、"reframe"(把责怪个人重新解释为共同的关系模式)、"evoke"(引导表达更深层的脆弱情绪)、"enact"(让一方直接对另一方说出内心话,而不是只对咨询师说)。
论文里花了大篇幅去区分这些相近标签之间的边界,比如track和reframe都涉及描述互动过程,但前者只是"命名"当下发生了什么,后者是"改变"这件事的意义框架。这种细致的边界划定,恰恰体现出真实临床场景里,同一个咨询师动作背后可能有完全不同的意图,而这种意图上的细微差别,恰恰是AI最容易搞混的地方。
**长尾分布:少数标签占大头,多数标签几乎绝迹**
数据分布这块也挺有意思。夫妻对话里,"追逐-回避"和"修复性软化"两种模式加起来占了将近三分之二的比例,而最罕见的"混合过渡"和"双方回避"两种状态合计还不到10%。家庭对话里更极端,"合作式家庭联盟"一个标签就占了41.9%。
这种极度不均衡的分布直接反映在模型表现上:常见、显著的关系模式,模型识别起来相对靠谱,像夫妻场景里最常见的"追逐-回避"平均准确率能到77.38%,但那些罕见的、需要精细区分的标签,准确率就惨不忍睹,比如"混合过渡"只有2.23%,家庭场景里的"混合过渡"更是低到1.59%。
这个现象其实挺符合直觉的:模型见过的、训练数据里出现频率高的模式,它学得比较扎实,那些边缘化的、需要细致辨析的情况,它基本没有能力应对。这就像一个刚学开车的新手,在城市主干道上开得挺稳,一旦遇到需要精细判断的窄巷会车,立刻手忙脚乱。
**夫妻场景和家庭场景,模型表现不完全一样**
论文还专门比较了夫妻场景和家庭场景下模型表现的差异,结果并不是简单的"哪个更好",而是各有胜负。
介入时机预测上两者几乎打平,关系模式预测上家庭场景略高一点。但支持对象预测在家庭场景下明显更差(54.87%对66.88%的召回率),支持策略预测反而在家庭场景下平均更高一点(36.83%对30.54%)。
更有意思的是,这个规律并不是所有模型都一致的。有些模型从夫妻场景切换到家庭场景后表现明显下滑,也有模型反而表现提升,这说明不同模型捕捉关系线索的方式存在系统性差异,家庭场景涉及更多人、更复杂的联盟结构,这对模型的考验方式和夫妻场景的两人对抗结构完全不同。
**写在后面**
读完这篇论文,最让我意外的一个细节,是那个关系状态转移矩阵的分析。我原本以为,人际关系的负面循环一旦形成,要么持续恶化,要么突然翻转变好,论文里的数据却告诉我,现实远比这更纠缠——"追逐-回避"这种模式,即便短暂进入了修复阶段,也会像退潮又涨潮一样反复冒头。这个发现让我重新想了想,自己身边那些"每次吵架都一个模子刻出来"的关系,原来背后可能真的存在一种可以被观察和量化的循环结构,而不只是"性格不合"这种模糊说法能解释的。
另一个让我停下来想了很久的地方,是论文里反复强调的那种区分:AI能识别一个人此刻是什么情绪,但很难识别这个人对另一个人的看法。这两者听起来接近,实际上是两种完全不同的认知任务。前者是内省,后者是归因,后者要求理解说话人为什么这样表达,以及这种表达背后可能藏着的另一层真实想法。这让我想到,人和人之间大部分误会的根源,可能恰恰就藏在这层"归因"上,而不是情绪本身。
这篇论文没有给出一个能立刻解决关系冲突的AI系统,它做的事情更朴素:告诉你现在的AI在哪些地方还看不懂,看不懂到什么程度。这种诚实的失败分析,有时候比一个夸大其词的成功案例更有价值。
如果有一天真的出现了一个能听懂夫妻吵架、能分辨谁在追谁在躲、能判断该先安慰哪一个人的AI,你会愿意让它介入你自己的关系吗?
Q&A
Q1:RESCUE-BENCH是什么?
A:RESCUE-BENCH是香港理工大学团队构建的一个关系感知情感支持对话基准数据集,由真实的夫妻和家庭心理咨询访谈视频标注而成,包含191个样本、7079个标注对话轮次,用于评测AI能否理解多人关系动态并做出恰当的情感支持决策。
Q2:为什么现有的AI情感支持系统在多人场景下表现不好?
A:因为传统AI情感支持系统只关注单个用户的情绪状态,采用一对一聊天模式,即使扩展到多人场景也只是各自安慰各自,完全没有建模人与人之间的关系动态、互动模式和相互影响,而这些关系因素恰恰是多人情感困境的核心症结。
Q3:测试结果显示大模型在哪些任务上表现最差?
A:大模型在关系模式预测、观点预测和支持策略预测这三项任务上表现明显较差,其中关系模式预测准确率最高只有45.6%,支持策略预测召回率仅31.88%,说明现有AI擅长识别单个情绪但难以理解复杂的人际关系动态。