多模态大模型研究每日简报【2025-09-05】
训练数据相关
- Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios (https://arxiv.org/abs/2509.04403): 该论文提出了一种面向真实世界多模态安全场景(RMS)的自适应数据集构建方法。该方法从图像出发,自动生成包含35k图像-文本对的数据集,并为每个样本提供指导性回复。此外,论文还提出了一种标准化的安全数据集评估指标,通过微调安全判别模型并在其他安全数据集上进行评估。实验结果表明,该方法具有良好的可扩展性和有效性,为构建真实世界多模态安全数据集提供了一种新的视角。
- Explicit and Implicit Data Augmentation for Social Event Detection (https://arxiv.org/abs/2509.04202): 针对社交事件检测任务中数据标注成本高的问题,该论文提出了一种名为SED-Aug的即插即用双重数据增强框架。该框架结合了显式文本增强(利用LLM生成多样化的文本信息)和隐式特征空间增强(设计五种新颖的扰动技术,作用于结构化融合嵌入)。实验结果表明,SED-Aug在Twitter2012和Twitter2018数据集上均显著优于现有方法。
- Completing Spatial Transcriptomics Data for Gene Expression Prediction Benchmarking (https://arxiv.org/abs/2505.02980): 该论文针对空间转录组学数据中的基因表达缺失问题,提出了SpaCKLE模型,一种基于Transformer的基因表达补全模型。此外,论文还整理了一个包含26个公共数据集的SpaRED数据库,为模型评估提供了一个标准化的资源。在SpaRED基准测试中,SpaCKLE显著提高了基因表达预测模型的性能。
- PIN: A Knowledge-Intensive Dataset for Paired and Interleaved Multimodal Documents (https://arxiv.org/abs/2406.13923): 本文提出了一种新的数据格式PIN,旨在促进视觉和文本知识的更深入融合。PIN格式独特地结合了语义丰富的Markdown文件,保留了细粒度的文本结构,以及捕获完整文档布局的整体图像。遵循这种格式,作者构建并发布了两个大规模的开源数据集:PIN-200M(约2亿个文档)和PIN-14M(约1400万个文档),这些数据集来自各种网络和科学来源,包括英语和中文。
- TRUST-VL: An Explainable News Assistant for General Multimodal Misinformation Detection (https://arxiv.org/abs/2509.04448): 该论文提出了一种统一且可解释的视觉-语言模型TRUST-VL,用于通用多模态错误信息检测。TRUST-VL包含一个新颖的Question-Aware Visual Amplifier模块,旨在提取特定于任务的视觉特征。为了支持训练,作者还构建了一个名为TRUST-Instruct的大规模指令数据集,其中包含198K个样本,这些样本具有与人类事实核查工作流程对齐的结构化推理链。
Agent相关
- SRWToolkit: An Open Source Wizard of Oz Toolkit to Create Social Robotic Avatars (https://arxiv.org/abs/2509.04356): 该论文介绍了一个名为SRWToolkit的开源Wizard of Oz工具包,旨在方便地创建由本地大型语言模型(LLM)驱动的社交机器人化身。该工具包提供文本输入、按钮激活语音和唤醒词命令等多模态交互方式,并允许实时配置化身的外观、行为、语言和声音。与依赖云端LLM服务的工作不同,SRWToolkit强调模块化和本地LLM推理。
- World Model Implanting for Test-time Adaptation of Embodied Agents (https://arxiv.org/abs/2509.03956): 为了使具身智能体能够适应新领域,该论文提出了一个世界模型植入框架(WorMI),通过测试时组合,将大型语言模型(LLM)的推理能力与独立学习的、特定领域的世界模型相结合。通过允许无缝植入和移除世界模型,具身智能体的策略实现了并保持了跨领域适应性。
大模型的行业应用
- A Foundation Model for Chest X-ray Interpretation with Grounded Reasoning via Online Reinforcement Learning (https://arxiv.org/abs/2509.03906): 该论文介绍了一个用于胸部X光片(CXR)解读的医学基础模型DeepMedix-R1。该模型通过顺序训练流程,首先在CXR指令数据上进行微调,然后暴露于高质量的合成推理样本,最后通过在线强化学习进行优化,从而能够生成与图像局部区域相关的答案和推理步骤。
- A Generative Foundation Model for Chest Radiography (https://arxiv.org/abs/2509.03903): 该论文开发了一个名为ChexGen的生成式视觉-语言基础模型,用于胸部X光片的文本、掩码和边界框引导合成。ChexGen在迄今为止最大的胸部X光数据集上进行了预训练,并通过专家评估和定量指标实现了对X光片的精确合成。
- StreetViewAI: Making Street View Accessible Using Context-Aware Multimodal AI (https://arxiv.org/abs/2508.08524): 该论文介绍了一个名为StreetViewAI的可访问街景工具,结合了上下文感知的多模态AI、可访问的导航控件和会话语音,使盲人用户能够虚拟地探索和体验现实世界的环境。
- AnomalyLMM: Bridging Generative Knowledge and Discriminative Retrieval for Text-Based Person Anomaly Search (https://arxiv.org/abs/2509.04376): 本文提出了AnomalyLMM,是第一个利用LMM进行基于文本的行人异常搜索的框架。主要贡献包括:(1)一种新颖的粗到细的流程,整合了LMM,将生成的世界知识与以检索为中心的异常检测相结合;(2)一个无训练的自适应手册,包括掩蔽跨模态提示、行为显着性预测和知识感知的重排序,从而能够零样本关注细微的异常线索。
- PianoBind: A Multimodal Joint Embedding Model for Pop-piano Music (https://arxiv.org/abs/2509.04215): 该论文提出了PianoBind,一种钢琴特定的多模态联合嵌入模型,旨在捕捉同质独奏钢琴音乐中的细微语义差异。该模型通过系统地研究多源训练和模态利用策略,在小规模和同质钢琴数据集上实现了优于通用音乐联合嵌入模型的文本到音乐检索性能。
文生图/文生视频
- Plot’n Polish: Zero-shot Story Visualization and Disentangled Editing with Text-to-Image Diffusion Models (https://arxiv.org/abs/2509.04446): 该论文介绍了一种名为Plot’n Polish的zero-shot框架,该框架能够生成一致的故事,并提供对故事可视化的细粒度控制,允许在不同细节层次上进行精细或粗略的编辑,同时保持跨多个帧的视觉和叙事一致性。
- TaleDiffusion: Multi-Character Story Generation with Dialogue Rendering (https://arxiv.org/abs/2509.04123): 该论文介绍了一种名为TaleDiffusion的新框架,用于生成多角色故事,并通过迭代过程、保持角色一致性和精确的对话分配来解决文本到故事可视化中的挑战。
- LOTS of Fashion! Multi-Conditioning for Image Generation via Sketch-Text Pairing (https://arxiv.org/abs/2507.22627): 本文提出了一种用于组合草图-文本的完整时尚外观图像生成的局部文本和草图方法(LOTS)。LOTS利用带有配对局部草图+文本信息的全局描述进行调节,并引入了一种新的基于步骤的扩散适应合并策略。
训练策略
- Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models (https://arxiv.org/abs/2509.04063): 该论文提出了一种用于VLA Flow模型的离线RL后训练目标,并推导出一个高效可行的离线RL微调算法——自适应强化流匹配(ARFM)。通过在VLA Flow模型损失中引入自适应调整的缩放因子,ARFM构建了一个有原则的偏差-方差权衡目标函数,以优化控制RL信号对流损失的影响。
- Attn-Adapter: Attention Is All You Need for Online Few-shot Learner of Vision-Language Model (https://arxiv.org/abs/2509.03895): 该论文提出了一种名为Attn-Adapter的新型在线少样本学习框架,通过双重注意力机制增强CLIP的适应性。Attn-Adapter包含Memory Attn-Adapter和Local-Global Attn-Adapter两个组件,分别用于细化类别嵌入和丰富图像嵌入。
底层模型架构
- Real Time FPGA Based Transformers & VLMs for Vision Tasks: SOTA Designs and Optimizations (https://arxiv.org/abs/2509.04162): 该论文对基于FPGA的Transformer和VLM推理的设计权衡、优化策略和实现挑战进行了全面的回顾,并讨论了硬件-算法协同设计的趋势。
安全与隐私
- An Automated, Scalable Machine Learning Model Inversion Assessment Pipeline (https://arxiv.org/abs/2509.04214): 该论文提出了一个新颖的DT&E工具,用于量化来自模型反演攻击(MIA)的数据隐私泄露风险,并引入了四个对抗风险维度来量化隐私泄露。该DT&E流水线结合了反演和视觉语言模型(VLM),以提高有效性并实现可扩展的分析。
- Defending LVLMs Against Vision Attacks through Partial-Perception Supervision (https://arxiv.org/abs/2412.12722): 该论文提出了一种名为DPS(Defense through Partial-Perception Supervision)的黑盒、无训练方法,用于防御LVLM免受恶意注入或扰动的输入图像的攻击。DPS利用仅感知部分图像的模型生成的响应来监督LVLM对原始图像的响应,从而在受到攻击时调整响应,同时保持对干净输入的原始响应。
- WASP: A Weight-Space Approach to Detecting Learned Spuriousness (https://arxiv.org/abs/2410.18970): 该论文提出了一种名为WASP(Weight-space Approach to detecting Spuriousness)的方法,通过分析模型在特定数据集上微调时权重向捕获各种(虚假)相关性的漂移来检测学习到的虚假性。WASP可以揭示数据集中的虚假相关性,即使这些相关性没有被训练或验证反例暴露。
其他
- Promptception: How Sensitive Are Large Multimodal Models to Prompts? (https://arxiv.org/abs/2509.03986): 该论文研究了大型多模态模型(LMM)对提示的敏感性,发现即使是提示措辞和结构的微小变化也会导致准确性偏差高达15%。为了解决这个问题,作者提出了Promptception框架,用于系统地评估LMM中的提示敏感性,并提出了针对专有和开源LMM的提示原则。
- GeoArena: An Open Platform for Benchmarking Large Vision-language Models on WorldWide Image Geolocalization (https://arxiv.org/abs/2509.04334): 该论文提出了GeoArena,一个用于评估LVLM在全球图像地理定位任务中的开放平台。GeoArena允许用户上传真实世界的图像,并利用成对的人工判断来确定哪个模型输出更符合人类的期望。
- OVGrasp: Open-Vocabulary Grasping Assistance via Multimodal Intent Detection (https://arxiv.org/abs/2509.04324): 该论文提出了一种名为OVGrasp的分层控制框架,用于基于软体外骨骼的抓取辅助,该框架集成了RGB-D视觉、开放词汇提示和语音命令,以实现鲁棒的多模态交互。
- TauGenNet: Plasma-Driven Tau PET Image Synthesis via Text-Guided 3D Diffusion Models (https://arxiv.org/abs/2509.04269): 该论文提出了一种文本引导的3D扩散模型,用于合成3D tau PET图像,利用结构MRI和血浆测量等多模态条件。
- FPC-VLA: A Vision-Language-Action Framework with a Supervisor for Failure Prediction and Correction (https://arxiv.org/abs/2509.04018): 针对传统感知-规划流水线在开放式任务中不足的问题,该论文提出了FPC-VLA,一个集成了VLA和用于故障预测和纠正的监督器的双模型框架。
- Synthesizing Sheet Music Problems for Evaluation and Reinforcement Learning (https://arxiv.org/abs/2509.04059): 该论文提出了合成基于音乐理论的乐谱问题的想法,用于评估和强化学习,并提出了一个数据合成框架,生成文本和视觉模态的可验证乐谱问题。
- SMooGPT: Stylized Motion Generation using Large Language Models (https://arxiv.org/abs/2509.04058): 该论文提出利用身体部位文本空间作为中间表示,并提出SMooGPT,一个经过微调的LLM,在生成所需的风格化运动时充当推理器、作曲家和生成器。
- Image Embedding Sampling Method for Diverse Captioning (https://arxiv.org/abs/2502.10118): 本文提出了一个无训练框架,通过使用较小的VLM(BLIP)作为主干显式地关注不同的图像区域来增强标题多样性和信息性。
- PAK-UCB Contextual Bandit: An Online Learning Approach to Prompt-Aware Selection of Generative Models and LLMs (https://arxiv.org/abs/2410.13287): 本文提出了一种在线学习框架来预测给定输入提示的最佳数据生成模型。所提出的PAK-UCB算法解决了一个上下文bandit(CB)设置,其中跨臂共享上下文变量,利用生成的数据来更新基于核的函数,这些函数预测每个可用模型对未见文本提示的得分。
编辑精选
-
Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios (https://arxiv.org/abs/2509.04403): 安全性是LLM应用的关键问题。该论文提出的自适应数据集构建方法有助于提高MLLM在真实世界安全场景中的鲁棒性。
-
FPC-VLA: A Vision-Language-Action Framework with a Supervisor for Failure Prediction and Correction (https://arxiv.org/abs/2509.04018): 机器人操作任务中,从错误中恢复的能力至关重要。该论文提出的FPC-VLA框架通过集成VLA和监督器,提高了机器人系统的可靠性和泛化能力。
-
Promptception: How Sensitive Are Large Multimodal Models to Prompts? (https://arxiv.org/abs/2509.03986): Prompt设计对LMM的性能有显著影响。该论文系统地评估了LMM的提示敏感性,并提出了针对专有和开源LMM的提示原则,有助于更稳健和公平的模型评估。
-
SRWToolkit: An Open Source Wizard of Oz Toolkit to Create Social Robotic Avatars (https://arxiv.org/abs/2509.04356): 本文提供了一个开源工具包,允许研究人员更方便地创建本地LLM驱动的社交机器人化身,这有助于人机交互领域的研究发展。
更多推荐

所有评论(0)