盖住多少、盖在哪儿,才能让AI真正读懂脑电波?
(来源:科技行者)
你有没有玩过那种猜词游戏,一句话里挖掉几个空,让你猜缺的是什么词。
如果挖掉的是"的""了"这种虚词,你几乎不用动脑子就能填上。如果挖掉的是整句话最后一个关键词,你可能得联系上下文认真想一想。但如果挖空的是整段话,只留下开头一个字,那这游戏基本没法玩了,因为没有足够的线索让你推理。
这个挖空游戏的难度设计,恰好就是训练AI理解脑电信号时正在发生的事情。而这篇论文要回答的问题是:对于脑电图(EEG)这种又有空间维度又有时间维度的复杂信号,到底该怎么挖空,才能让AI学到真正有用的东西?
这个问题此前一直没人认真研究过,原因也很简单,每个新出的EEG基础模型都是把网络架构、训练数据、预训练目标、挖空方式这几样东西打包在一起换,谁也说不清楚模型效果好到底是因为哪一个改动。这篇论文的野心,就是把挖空方式这一个变量单独拎出来,其他全部锁死,看看它到底能带来多大的差异。
脑子的信号,为什么不能随便挖
先说说什么是EEG。
EEG(脑电图)*:通过贴在头皮上的多个电极记录大脑电活动的技术,每个电极对应一个"通道",记录的信号会随时间变化,形成一段既有空间维度(哪个电极)又有时间维度(什么时刻)的复杂数据。
近几年,"基础模型"这个概念从图像、语言领域杀入了脑电图分析领域。REVE、LaBraM、BIOT、BrainBERT这些名字背后,都是想造一个"万能脑电大脑",训练好之后可以直接用于各种下游任务,比如判断癫痫发作、给睡眠分期、识别运动想象、甚至判断情绪状态。
这些模型大多采用一种叫"掩码预测"的训练套路。
掩码预测(masked prediction)*:故意把输入数据的一部分遮起来,让模型根据剩下没遮住的部分去猜被遮住的内容,通过这种"补全练习"逼着模型学会数据内在的规律。
这个思路本身没什么新鲜的,BERT训练语言模型时挖掉几个词、MAE训练图像模型时挖掉几块像素区域,用的都是同一套逻辑。但问题在于,EEG信号跟文字、图片都不一样。
一段话里的词是一维排列的,一张图片的像素是二维排列的但没有明显的方向性,而EEG信号是"通道乘以时间"的二维网格,并且这两个维度性质完全不同:同一个电极在不同时刻记录的信号,短时间内高度相关,因为大脑活动是连续变化的;而不同电极在同一时刻记录的信号,即便隔得很远,相关性衰减得也很慢,因为大脑里的电信号会通过颅骨和头皮扩散传导,一个地方的活动会被周围一大片电极同时感应到。
这个不对称性,论文里专门测量过。同一通道的信号,时间间隔拉长到2秒左右,相关性的R?值就跌到了0.2以下,衰减非常快。而不同通道在同一时刻的相关性,随着电极间距离拉大衰减得慢得多,即便隔了整个头皮的距离,相关性依然明显存在。
这意味着什么?意味着如果你挖空的方式没有考虑到这个不对称性,训练出来的模型可能压根没学到真东西。
就像你玩填字游戏时,如果挖掉的空前后紧挨着大量提示信息,你根本不需要理解句子在说什么,扫一眼就能蒙对。EEG模型如果挖的是某个通道极短的一小段,模型完全可以靠这个通道自己前后的信号猜出答案,根本不需要去理解不同电极之间的空间关联,这样训练出来的表征自然是空洞的。反过来,如果挖空挖得太狠,比如把整个头皮所有电极在某个时刻的信号全部盖住,那模型能依赖的只剩下那条衰减很快的时间线索,这时候游戏又变成了瞎猜,模型学不到东西,因为没有足够信息支撑它做出有意义的推理。
于是研究者们把挖空这件事,正式拆解成了一个可以调节的参数系统。
给"挖空"建一套坐标系
论文里提出了一个统一的数学框架,用三个参数描述任何一种挖空策略:空间半径r,时间长度L,还有目标遮盖比例ρ。
具体来说,每次挖空会随机撒下若干个"块",每个块以某个电极为中心,向周围半径r范围内的所有电极、以及某个起始时刻往后连续L个时间片段,全部标记为"遮住"。半径r决定了挖空在空间上铺开多大范围,长度L决定了在时间上持续多久。
论文额外定义了两个极限情况:当r小到只覆盖单个电极时,记作"r=one",此时挖空退化成传统的随机块状遮盖;当r大到覆盖整个头皮所有电极时,记作"r=all",此时每个被选中的时间片段会让所有通道同时被遮住。
这套坐标系的巧妙之处在于,它把文献里五花八门的挖空方式统一了起来。之前不同论文里用的随机块遮盖、整通道遮盖、连续时间窗口遮盖、混合时空块遮盖,其实都只是这套坐标系里某几个特定的(L, r)取值。用L=1、r="one"就还原出随机遮盖,用r="all"配上较短的L就还原出时间块遮盖,用L拉满到覆盖整个窗口就还原出整通道遮盖。
这就好比你原本面对一堆散装的乐高积木,不知道它们之间有什么关系,现在有人告诉你其实它们全都是同一套零件系统里不同的组合方式,只是拼法不同。你一下子就能系统地去尝试各种拼法,而不是每次都从零摸索。
研究团队定下了一个包含29种(L, r)组合的网格,L取了1、2、4、8、16、33这六个值(对应从瞬时到覆盖整个30秒窗口),r取了"one"、6厘米、9厘米、12厘米、"all"这五个值,去掉了L=33且r="all"这种把信号全部挖空的退化情况,剩下29种搭配。
两套哲学的对决:MAE和JEPA
光有挖空方式还不够,论文还测试了两种完全不同的训练哲学。
第一种叫MAE,全称是掩码自编码器。
MAE(Masked Autoencoder,掩码自编码器)*:一种自监督学习方法,让模型直接在"原始输入空间"里重建被遮住的内容,比如EEG信号的原始波形数值,用简单的均方误差衡量预测好坏。
第二种叫JEPA,全称是联合嵌入预测架构。
JEPA(Joint-Embedding Predictive Architecture,联合嵌入预测架构)*:一种自监督学习方法,不直接重建原始输入,而是先把输入和目标都转换成"潜在特征空间"里的抽象表示,然后在这个抽象空间里做预测。为了给训练提供稳定的目标,JEPA额外维护一个"教师网络",它是主网络的滑动平均版本,用完整的输入生成目标特征。
这两种哲学的差别,有点像两种不同的做题方式。MAE要求你把答案原原本本地抄写出来,一笔一划不能错,这种要求非常硬,逼着你必须真的理解内容才能抄对。JEPA则宽松得多,它只要求你说出答案的"大意",用自己的话概括就行,不强求逐字复现。这种宽松带来了灵活性,但也埋下了一个隐患:如果"大意"这个标准本身可以被投机取巧地满足,比如你可以不看题目内容,直接把答案模板背下来蒙混过关,那训练就失败了,而且没人会立刻发现。这个隐患后面会引出论文里最有意思的一个发现。
为了保证公平对比,研究者刻意没有给JEPA加任何防止"摆烂"的辅助损失函数(比如VICReg那种强制方差的正则项),就是要让两种框架站在同一条起跑线上,唯一的变量就是挖空方式。
29种挖空方式乘以2种训练框架,一共58个预训练模型,全部基于同一个骨干网络REVE-Small训练,用同一批开源数据,同样的训练步数。之所以选REVE架构,是因为有三个独立的评测基准(OpenEEGBench、NeuralBench、NeuroAtlas)都不约而同地认定它是目前公开发表的最强EEG基础模型。
58个模型训练好之后,全部放到OpenEEGBench这个基准测试上,跑12个不同的下游数据集,涵盖脑机接口、睡眠分期、癫痫检测、情绪识别等各种任务,用最朴素的线性探测方式评估,也就是冻住模型本身不再训练,只在它输出的特征上面接一个简单的线性层去做具体任务。这样做的好处是能最干净地反映出模型学到的表征质量本身,而不是被复杂的微调过程掩盖。
四个发现,一个陷阱
第一个发现是,MAE和JEPA这两种完全不同的哲学,最终却在同一个地方找到了最优解。
不管用哪种框架,最佳的挖空方式都是空间半径9厘米、时间长度2秒。而且两者在失败模式上也高度一致:单电极挖空(r="one")因为太容易被同通道的时间信息蒙混过关,训练信号太弱;整头皮同时挖空(r="all")又因为空间线索被彻底抹除,只剩下衰减很快的时间线索,任务退化成几乎瞎猜;大多数较长的时间块(L=8或16)配上中等半径也表现不佳,因为这正好踩中了时间冗余度衰减快的规律。
有一个例外值得单独说说,就是L=33这种把整个通道从头到尾全部挖空的情况。这看起来应该是最难的挖空方式,但MAE在这种情况下表现意外地好。原因在于这时候任务性质变了,不再是"局部信息缺失需要靠上下文补全",而是变成了"完全不知道某个通道的信号长什么样,只能靠这个通道所在的头皮位置以及邻近通道的活动去整体推断",而这恰好利用了空间冗余度衰减慢这个特性,是一个难但可行的任务。JEPA在这种极端情况下表现就差一些。
第二个发现是,只要避开了那几个明确的失败区间,挖空方式具体怎么选其实没那么讲究。
在29种搭配里,MAE有11种、JEPA有9种,在统计检验上跟各自框架里表现最好的那个配置没有显著差异。这意味着只要落在"空间半径6到12厘米、时间长度1到4"这个大致区间内,你不用太纠结具体数字,结果都差不多好。但这种"随便选都行"的容错度,MAE和JEPA之间并不对等:MAE内部最好和最差配置之间的分差是0.32,JEPA内部的分差却高达0.77,是MAE的2.4倍。换句话说,如果你选择用JEPA框架训练,挖空方式选错的代价要比用MAE大得多,这个坑JEPA用户得更小心。
第三个发现是全文最有意思的部分,研究者把它叫做"偏置膨胀坍塌",这是一种只在JEPA框架下、只在整头皮同时挖空(r="all")这种极端情况下才会出现的隐蔽故障。
要理解这个故障,得先回到前面提过的那个隐患:JEPA允许模型用"大意"而不是"逐字复现"来满足训练目标,这就给了模型偷懒的空间。具体来说,当整个头皮的所有电极在同一时刻全部被遮住时,模型的预测器手里完全没有任何"当前时刻附近还看得见的电极"可以参考,唯一剩下的路径就是纯粹靠通道的空间位置编码去猜一个固定值。而教师网络那边,由于它是主网络的滑动平均版本,同样也会慢慢学会输出这个固定值。学生和教师就这样"心照不宣"地在一个跟输入信号完全无关的常数上达成了一致,训练损失被压得很低,看起来一切正常,但模型其实什么都没学到。
论文用数据验证了这个机制真实存在:随着预训练推进,模型输出中"跟位置绑定的固定偏置成分"膨胀了2到3倍,而"真正跟输入信号相关的浮动成分"却萎缩到原来的五分之一到十分之一。更麻烦的是,这个故障对所有常规的坍塌检测手段都是隐形的。方差检测查不出来,因为固定偏置本身就会让方差保持在正常水平;损失发散检测也查不出来,因为学生和教师是"一起"平滑地走向这个偷懒解,损失曲线看起来平稳下降,不会有任何异常波动;就连VICReg这种专门防止表征坍塌的正则化手段,研究者分析后认为也大概率救不了这个局面,因为这种偷懒解本身在各个特征维度上分布得很均匀,恰好能骗过那些检测指标。
这就像一个学生考试作弊,但他作弊的方式极其巧妙,不是抄别人的卷子,而是提前把标准答案的格式和长度背下来,写出一份看起来跟正确答案一模一样但内容全是空话的卷子。监考老师检查作答字数是否达标、格式是否规范,全都挑不出毛病,因为这份卷子在表面指标上完全合格。只有真正拿这份卷子去解决实际问题时,才会发现里面根本没有有效信息。而发现这个问题的唯一办法,是拿到下游真实任务上去实测,标准的训练时诊断指标全都失效了。
这个坍塌现象只在r="all"这一种极端挖空方式下出现,在正常的中等半径范围内完全不会发生,所以实际使用中的应对方式也很直接,就是别去碰这个极端配置。但研究者特别强调,真正令人不安的不是这个陷阱存在,而是它对所有标准检测手段都是隐形的,这提醒所有做JEPA类模型的人,光看训练损失和常规坍塌指标是不够的,必须要有下游真实任务的验证才能确认模型真的学到了东西。
第四个发现,是关于效率的。
在最优挖空配置下,MAE和JEPA训练出的模型,仅用大约14个H100 GPU小时的算力,就达到了公开发布的REVE-Base模型的下游表现水平,而REVE-Base官方报告的训练成本是260个A100 GPU小时,换算下来相当于本文方法的十几倍。这个对比虽然不是完全公平的同规模对比(REVE-Base参数量更大、用的训练数据更多),但也足以说明,选对挖空方式这件事本身的杠杆效应有多大。
这套开源代码和58个预训练模型checkpoint,也因此给整个领域降低了实验门槛,以后研究者不用再从零训练一个天价成本的大模型才能验证自己的想法。
为什么这件事值得认真做
论文最后提炼出了一条更普适的原则:挖空方式本质上是在探测信号的冗余结构,一个好的挖空策略,应该恰好去除掉那些"信息共享但又不至于轻易获取"的部分。
太容易的挖空任务(比如单电极遮盖),模型不需要真正理解跨时间或跨空间的关联,随便应付一下就能通过;太难的挖空任务(比如整头皮同时遮盖),模型索性放弃理解信号内容,转而寻找取巧的捷径。真正有效的挖空方式,落在这两个极端中间,既剥夺了唾手可得的捷径,又保留了足够的线索让模型能够、也必须通过理解信号内在规律来完成任务。
这个道理其实超出了EEG这一个领域。任何用"挖空猜测"来训练模型的场景,本质上都要面对这个平衡问题:任务太简单,模型学不到东西;任务太难,模型会去找捷径而不是认真理解。这篇论文用EEG这个具体案例,把这个平衡点用实验的方式标注了出来,也把"挖空方式该怎么调"这件事从玄学变成了可以量化研究的工程问题。
论文自己也坦诚了局限性:整个实验网格只用了一种骨干架构和一种预训练语料库,换成别的架构或数据集是否还成立有待验证;遮盖比例固定在0.55,没有和挖空几何形状一起联动调节;下游12个数据集里有一个数据集(PhysioNet-MI)实际上出现在预训练语料库中,虽然占比很小(大约34000小时里的48.5小时),但不能完全排除信息泄露的可能性。
写在后面
读完这篇论文,我印象最深的其实不是那个最优配置本身,而是"偏置膨胀坍塌"这个发现背后传递出的一种警觉。
我们习惯性地相信,训练损失下降、方差指标正常、没有出现数值爆炸,就代表模型训练是健康的。这篇论文用一个非常具体的反例告诉我们,这种信任是有漏洞的。一个模型完全可以在所有看得见的指标上表现正常,却在真正应该学到的东西上什么都没学到。这不是模型出了bug,而是优化过程本身找到了一条最省力的路径,恰好绕开了我们设计的所有检测机制。
这让我联想到一个更普遍的现象:任何一套评估体系,一旦被优化目标"摸透"了它的盲区,就有可能被悄悄钻空子,而且这种钻空子往往不是故意为之,只是数学上最优路径恰好经过了那个盲区。这不只是机器学习里的问题,很多依赖代理指标去衡量真实目标的系统,都可能面临类似的风险。
另一个让我觉得挺实在的地方是,这篇论文没有去做一个更花哨的新模型,而是老老实实地把别人论文里捆绑在一起的东西拆开来看。这种"拆解式"的研究价值经常被低估,因为它不产出一个新的SOTA数字,但它产出的是让整个领域少走弯路的判断依据。
如果你手头也在训练某个依赖"挖空猜测"套路的模型,不妨想一想,你设计的那个"空",究竟是让模型真的在思考,还是给了它一个偷懒的借口。
Q&A
Q1:EEG基础模型里最佳的掩码挖空方式是什么?
A:论文发现空间半径9厘米、时间长度2秒是MAE和JEPA两种框架共同认可的最优配置,在这个范围附近(半径6到12厘米、长度1到4)微调影响不大,但要避开单电极挖空和整头皮同时挖空这两种极端方式。
Q2:什么是偏置膨胀坍塌,为什么它很危险?
A:这是JEPA框架在整头皮同时挖空时出现的隐蔽故障,模型学会输出一个只跟电极位置绑定的固定值来应付训练目标,完全忽略真实脑电信号。危险之处在于训练损失、方差等常规监控指标全都显示正常,只有放到下游真实任务上才能发现模型其实什么都没学到。
Q3:MAE和JEPA这两种EEG训练框架该怎么选?
A:两者在最优配置下表现相近,但JEPA对挖空方式的选择更敏感,选错代价是MAE的2.4倍左右,而且JEPA存在偏置膨胀坍塌这个隐蔽风险。如果没有把握精细调参,MAE整体更稳妥,容错空间更大。