多模态情感识别——缺失模态
一、模态缺失的原因
(1)硬件问题与环境问题
采集数据时由于设备、环境等因素限制,直接导致模态数据无法获取或失效。面部被遮挡(如手遮脸)、低光照环境会导致面部特征无法提取; 嘈杂公共场所的噪音会破坏音频信号;用户沉默时段无语音输入,导致音频模态天然缺失。被试者移动会导致 EEG 信号失真,最终因数据无效被判定为模态缺失。
《Missing Modality Imagination Network》(MMIN,ACL 2021)提到,低端终端可能未配备视觉传感器,仅支持文本和音频采集;传感器故障会导致对应模态完全缺失[3]。
《利用模态不变特征实现缺乏模态的稳健多模态情绪识别》(IF-MMIN,2022)提到 EEG 设备电极接触不良的案例,导致生理模态数据丢失[5]。
《A Framework to Evaluate Fusion Methods for Multimodal Emotion Recognition》(IEEE Access 2023)提到,多模态传感器采集频率不一致(如视觉帧 15fps、音频 16kHz),导致部分时间步的模态数据不同步,被误判为“临时缺失”[7]。
《SMIL:多模态学习,缺乏严重缺失的模态》(AAAI 2021)以自动驾驶场景为例,指出 LiDAR 设备成本远高于摄像头,导致 3D 点云模态严重缺失;医疗、教育等低成本场景中,仅能采集文本问卷,无 EEG、面部模态[6]。
(2)数据传输与存储的影响
视频、生理信号等多模态数据体积大,在低带宽环境下传输时,会主动舍弃视觉和音频模态,仅保留文本。
《A Framework to Evaluate Fusion Methods》(IEEE Access 2023)提到,企业和研究机构为降低长期存储成本,仅保留核心模态,删除次要模态[7]。
《利用模态不变特征实现缺乏模态的稳健多模态情绪识别》(2022)指出,对音频、视频进行高压缩比处理时,会丢失语调、面部微表情等情感相关关键特征,导致模态功能失效[5]。
(3)模态与场景的不匹配
部分模态在特定场景下本就不存在或无意义。
《MMIN》(ACL 2021)提到社交媒体评论、文本问卷等场景仅含文本模态,无视觉、音频、生理模态;公共场合中用户可能拒绝开启摄像头和麦克风,仅提供文本输入,导致视觉和音频模态缺失[3];
《SMIL》(AAAI 2021)提到社交网络中用户的隐私设置会限制面部、生理模态的采集[6]。
部分模态无判别力平静状态下,生理信号(如心率)无明显波动,无法提供情感信息,模型训练时会视为 “有效缺失”;《IF-MMIN》(2022)提到,低强度情感场景中,视觉模态的表情特征不显著,实际等效于模态缺失[5]。
(4)隐私问题、数据集构建问题
因为隐私保护、标注难度等人为因素,直接影响训练数据的完整性。面部图像、生理信号等敏感模态涉及个人隐私,用户不愿提供,导致数据集该模态样本量不足或完全缺失;一些法规禁止采集儿童面部图像,导致特定场景下的模态缺失。EEG 信号、微表情等模态的标注需要专业知识,非专业标注者无法完成,导致数据集该模态缺失;多模态标注耗时耗力,研究机构为控制成本,仅标注核心模态。标注者误操作(如漏标视觉模态)会导致数据集层面的模态缺失,进而影响模型训练的有效性。
二、相关研究
1、原始数据生成式补全(2020-2021)
(1)相关方法
利用生成模型直接重建缺失模态的原始数据,主要方法有VAE(变分自编码器)和 GAN(生成对抗网络),通过完整模态的统计信息推断缺失模态。
Du et al. (ACM MM 2018)《半监督式深度生成建模不完整多模态情绪数据》提出利用多视图 VAE 学习跨模态共享潜在变量,在半监督框架下实现缺失模态数据的重建。模型通过挖掘不同模态间的潜在关联,生成缺失模态的原始特征,为后续生成式补全研究奠定了技术基础,其半监督训练思路也缓解了标注数据稀缺的问题[1]。
综述《Generative_Adversarial_Networks_in_Human_Emotion_Synthesis_A_Review》:系统梳理了 GAN 在人类情感合成(含缺失模态补全)中的应用现状,总结了不同 GAN 变体、在模态生成中的技术特点,同时也隐含指出了该类方法的核心缺陷 —— 生成过程不稳定,易出现模式坍塌,且生成数据的物理一致性难以保障[2]。
(2)存在的问题
该阶段方法存在一些问题:一是生成的原始数据易携带高频噪声、模糊伪影,甚至出现不符合物理规律的 “幻觉” 数据(如面部表情扭曲、音频语调异常);二是生成模型训练成本极高,GAN 的模式坍塌、VAE 的重建模糊等问题长期未得到有效解决;三是误差传播效应显著 ——“脏数据” 输入分类器后,不仅无法提供有效信息,反而会放大分类误差,导致最终性能甚至低于直接使用单模态数据的效果。
(3)改进
在后面研究者逐渐意识到情感识别的核心需求是语义特征匹配,不是直接生成原始数据,特征空间的容错率远高于原始数据空间,无需生成完整像素或波形,只需精准推断缺失模态的高维语义特征即可。基于这一认知,形成两大核心改进策略:
①特征空间想象
直接在高维特征空间推断缺失模态的语义表征,规避原始数据生成的噪声问题。论文Zhao et al. (ACL 2021)《Missing Modality Imagination Network (MMIN)》提出“跨模态特征想象”框架,利用级联残差自编码器(CRA)从可用模态中直接重建缺失模态的句子级语义特征,而非原始数据。同时引入循环一致性损失(Forward-Backward 想象),确保生成的特征与真实特征分布一致,彻底解决了原始数据生成的噪声与误差传播问题。该模型无需为不同缺失组合单独训练,实现了 “统一模型适配所有缺失场景”,在 IEMOCAP 数据集上较传统生成式方法平均准确率提升 15% 以上[3]。
②知识蒸馏
绕过显式生成过程,通过知识蒸馏让完整模态模型指导缺失模态模型学习特征。论文为 Wang et al. (KDD 2020)《通过知识蒸馏实现的多模态学习,且模态不完整》提出多教师蒸馏框架,将文本、音频、视觉单模态专家网络作为教师,多模态融合网络作为学生。教师网络将各自模态的情感特征提取知识、分类决策逻辑蒸馏给学生网络,使学生网络无需显式生成缺失模态数据,即可通过完整模态的知识补偿缺失信息,在保证性能的同时降低了计算成本,适配资源受限场景[4]。
2、静态鲁棒学习、动态统一架构(适配任意缺失组合)
特征空间补全解决了噪声与误差传播问题,但又出现了新的问题(一种情况就要单独训练一个模型,可不可以一个模型就适应所有情况),不同缺失组合(缺单模态、缺多模态)需要微调模型结构或超参数,模型碎片化严重,难以部署。强行拉近所有模态的特征分布,可能会破坏模态特有细粒度情感信息;缺乏统一评估标准,无法客观衡量模型在动态缺失场景下的泛化能力。
核心诉求:构建统一架构,动态适配所有缺失情况。
(1)相关方法
为解决模态异质性与严重缺失问题,有研究者提出模态不变特征学习与元学习适配两种思路,试图通过强化共享特征的判别力和模型的快速适应能力,提升静态缺失场景下的稳健性。
IF-MMIN (ICASSP 2022)《利用模态不变特征实现缺乏模态的稳健多模态情绪识别》提出在 MMIN 的特征想象框架基础上深化,引入中心矩差异(CMD)约束,强制解耦“模态特有特征”与“模态共享特征”。通过最小化不同模态共享特征的分布差异,挖掘跨模态通用的情感语义,即使某一模态缺失,共享特征仍能支撑准确分类;同时保留模态特有特征的独特性,避免细粒度信息丢失。在IEMOCAP数据集上,仅缺音频和视觉等弱模态场景下,准确率较MMIN提升 3%-5%[5]。
Ma et al. (AAAI 2021)《SMIL: 多模态学习,缺乏严重缺失的模态》提出针对90%样本存在模态缺失的极端场景,引入贝叶斯元学习框架。模型通过元训练学习“快速适应新缺失模式”的通用能力,无需针对严重缺失场景重新训练,即可快速调整参数适配。在CMU-MOSI 数据集上,仅用10%文本模态+100%图像模态训练时,准确率较GAN 等传统生成式方法提升 7.6%,突破了严重缺失场景对完整模态样本的依赖[6]。
(2)存在的问题
静态鲁棒学习提升了特定场景的性能,但仍未解决核心痛点:一是面对不同缺失组合仍需微调,部署维护成本高;二是实际场景中模态缺失具有随机性,静态模型难以实时调整;三是不同研究采用不同数据集、指标,无法客观对比方法优劣。这些问题推动研究转向动态路由+统一架构。
(3)改进
改进策略是构建统一框架,通过动态路由机制自适应不同缺失组合,同时建立标准化评估体系,推动技术向通用性发展。
①混合专家系统(MoE)动态路由
设计多专家网络与门控机制,根据输入模态的完整性动态激活相关专家,实现任意缺失组合的自适应处理。论文 Li et al. (ACM MM 2025)《通过统一多任务预训练框架实现多模态情绪识别及缺失模态 (UMAP)》提出当前领域SOTA方法,基于MoE架构构建模态专家(分别专攻文本、音频、视觉)与共享专家(专攻跨模态语义融合),通过门控网络实时判断输入模态的缺失情况,动态分配计算资源,完整模态时激活所有专家,缺失某一模态时自动强化其他专家与共享专家的贡献。模型结合对比学习与生成任务联合预训练,让模型在预训练阶段就学习模态缺失的适配规律,真正实现任意模态组合下的统一处理,无需针对特定缺失调整结构。跨数据集迁移(从 IEMOCAP 到 MSP-IMPROV)时,缺失模态场景下性能衰减幅度降低 15%[8]。
②标准化评估框架
建立统一评估体系,明确不同方法的优劣与适用场景。论文《A Framework to Evaluate Fusion Methods for Multimodal Emotion Recognition》(IEEE Access 2023)系统评估了 9 种主流融合方法(含 Self-Attention、Weighted Combination、Embracenet + 等)在缺失模态场景下的性能、效率与稳健性。通过 IEMOCAP 数据集的标准化测试,揭示了静态融合方法的动态适应性缺陷,明确Self-Attention、Weighted Combination等方法在缺失场景下的优势,文本缺失时,Weighted Combination 较 Tensor Fusion 准确率提升12%,且推理时间仅为Embracenet的1/3。该框架为后续统一架构的设计提供了量化参考,直接催生了对动态路由与轻量化统一模型的需求[7]。
3、小模型微调、大模型提示学习(预训练范式转移)
前两个阶段的研究主要依赖从头训练或微调中小型神经网络,模型的知识边界仅限于训练数据集,存在三大瓶颈:需要大量标注数据训练特征提取器、难以理解深层情感语义关联、新场景需重新训练大量参数。随着预训练大模型(Foundation Models)的兴起,研究转向 借力大模型先验知识,通过少量参数微调即可实现高效适配,解决低资源、分布外缺失场景的泛化问题。
(1)相关方法
前两个阶段的一些研究(MMIN[3]、IF-MMIN[5]、SMIL[6])均基于传统深度学习范式,依赖从头训练或微调中小型神经网络(LSTM、轻量 Transformer)。模型的特征提取能力完全依赖训练数据的覆盖度,面对分布外缺失场景(如训练时缺视觉,测试时缺音频+视觉)或极度稀缺数据时,泛化能力急剧下降。例:SMIL 在 CMU-MOSI 数据集 10% 文本模态场景下虽有提升,但跨到 MSP-IMPROV 数据集后,性能衰减幅度仍达 20%,难以满足实际应用需求。
(2)改进
利用预训练大模型的强大泛化先验知识,通过提示学习(Prompt Learning)等轻量化适配方法,让模型快速感知缺失模态并自适应调整,无需从头训练大量参数。
Guo et al. (ACL 2024)《多模态提示学习,缺少情感分析和情感识别的模态》引入缺失信号提示与生成提示,实现大模型对缺失模态的自适应。 缺失信号提示用于告知模型当前缺失的模态类型,引导模型调整注意力分配;生成提示用于引导大模型在特征空间补全缺失模态的语义信息,无需显式生成原始数据。该方法极大降低了计算成本,仅微调不足 1% 的参数,即可在 IEMOCAP、MSP-IMPROV 等多个数据集上实现稳定性能,跨场景泛化时性能衰减幅度降低至 8% 以内,解决了传统小模型存在的一些问题[9]。
UMAP (ACM MM 2025)《通过统一多任务预训练框架实现多模态情绪识别及缺失模态》通过多任务预训练(情感分类、跨模态对齐、缺失模态适配)构建通用框架,利用预训练阶段积累的跨模态知识,提升低资源缺失场景的泛化能力,是传统模型向大模型赋能过渡的关键成果。但是他也存在一些局限性:它使用的是提取的特征,而不是原始特征。如果使用比提取的特征复杂得多且模态之间相关性较弱的原始特征,则模型的性能可能会下降[8]。
(3)问题
大模型的推理成本极高,需要高性能 GPU 支持,难以部署在移动设备、边缘计算等资源受限场景。且与 MER 的实际部署需求(低延迟、低资源)存在矛盾。
大模型的黑箱特性导致缺失模态补全的特征缺乏可解释性 。
大模型提示学习的优势依赖于预训练知识与下游数据的匹配,但在低资源和高缺失率场景中,提示向量的学习易陷入局部最优。
参考文献
- Du C, Du C, Wang H, et al. Semi-supervised deep generative modelling of incomplete multi-modality emotional data[C]//Proceedings of the 26th ACM international conference on Multimedia. 2018: 108-116.
- Hajarolasvadi N, Ramirez M A, Beccaro W, et al. Generative adversarial networks in human emotion synthesis: A review[J]. IEEE Access, 2020, 8: 218499-218529.
- Zhao J, Li R, Jin Q. Missing modality imagination network for emotion recognition with uncertain missing modalities[C]//Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers). 2021: 2608-2618.
- Wang Q, Zhan L, Thompson P, et al. Multimodal learning with incomplete modalities by knowledge distillation[C]//Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining. 2020: 1828-1838.
- Zuo H, Liu R, Zhao J, et al. Exploiting modality-invariant feature for robust multimodal emotion recognition with missing modalities[C]//ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, 2023: 1-5.
- Ma M, Ren J, Zhao L, et al. Smil: Multimodal learning with severely missing modality[C]//Proceedings of the AAAI conference on artificial intelligence. 2021, 35(3): 2302-2310.
- Peña D, Aguilera A, Dongo I, et al. A framework to evaluate fusion methods for multimodal emotion recognition[J]. IEEE Access, 2023, 11: 10218-10237.
- Li Z, Zheng W L, Lu B L. Multimodal emotion recognition with missing modality via a unified multi-task pre-training framework[C]//Proceedings of the 33rd ACM International Conference on Multimedia. 2025: 5717-5725.
- Guo Z, Jin T, Zhao Z. Multimodal prompt learning with missing modalities for sentiment analysis and emotion recognition[C]//Proceedings of the 62nd annual meeting of the association for computational linguistics (volume 1: Long papers). 2024: 1726-1736.
- Pham H, Liang P P, Manzini T, et al. Found in translation: Learning robust joint representations by cyclic translations between modalities[C]//Proceedings of the AAAI conference on artificial intelligence. 2019, 33(01): 6892-6899.
更多推荐


所有评论(0)