点击蓝字

关注我们

AI TIME欢迎每一位AI爱好者的加入!

01

Balcony: A Lightweight Approach to Dynamic Inference of Generative Language Model

在现实世界的应用中,部署大型语言模型(LLMs)常常受到严格的计算和延迟限制。动态推理能够根据不同的资源预算调整模型行为,但现有的方法通常受到硬件效率低下或性能下降的限制。本文介绍了一种简单而高效的基于深度的动态推理框架——Balcony。通过冻结预训练的LLMs,并在选定的退出点插入额外的Transformer层,Balcony在保持完整模型性能的同时,能够实时适应不同的计算预算。这些额外的层通过简单的自蒸馏损失进行训练,使子模型的输出与完整模型的输出保持一致。这种方法所需的训练标记和可调参数显著减少,与以往方法相比大幅降低了计算成本。在应用于LLaMA3-8B模型时,仅使用原始预训练数据的0.2%,Balcony实现了最小的性能下降,同时显著提高了推理速度。值得注意的是,Balcony在多种模型和不同规模的多种基准测试中,超越了Flextron和Layerskip等最先进的方法以及其他领先的压缩技术。

文章链接:

https://arxiv.org/abs/2503.05005

02

TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation

在减少大型语言模型(LLMs)的规模的同时保持其性能的挑战已经引起了广泛关注。然而,现有的方法,如模型蒸馏和迁移学习,常常无法实现高准确率。为了克服这一限制,本文提出了一种分支-合并蒸馏方法,通过两个阶段增强模型压缩:(1)分支阶段,通过领域特定的监督微调(SFT),将大型教师模型的知识选择性地蒸馏到专业学生模型中;(2)合并阶段,将这些学生模型合并,以实现跨领域知识转移并提升泛化能力。本文使用DeepSeek-R1作为教师模型,DeepSeek-R1-Distill-Qwen-32B作为学生模型验证了该蒸馏方法。最终合并得到的模型TinyR1-32B-Preview在多个基准测试中超越了其对应的学生模型DeepSeek-R1-Distill-Qwen-32B,包括数学(+5.5分)、编程(+4.4分)和科学(+2.9分),并且在AIME 2024上的表现接近DeepSeek-R1。分支-合并蒸馏方法为创建更小、高性能且计算成本和时间更低的LLMs提供了一种可扩展的解决方案。

文章链接:

https://arxiv.org/pdf/2503.04872

03

LVLM-Compress-Bench: Benchmarking the Broader Impact of Large Vision-Language Model Compression


尽管近期在理解压缩对大型语言模型(LLMs)下游任务性能和在单模态基准测试(例如问答、常识推理)中的可信度方面取得了一些进展,但对于多模态大型视觉-语言模型(LVLMs)的详细研究仍未展开。为了填补这一空白,本文提出了LVLM-Compress-Bench框架,用于深入研究压缩对LVLMs在多模态输入驱动任务中的生成性能的广泛影响。具体而言,本文考虑了自回归模型的两种主要压缩类别,即KV缓存压缩和权重压缩,分别针对动态增长的中间缓存和静态权重。通过整合多种最先进的KV缓存和权重压缩方法(包括均匀量化、异常值减少和分组量化),本文使用流行的LLaVA框架的四种LVLM变体进行了分析。该框架在十个不同的多模态数据集上进行了演示,涵盖识别、知识、语言生成、空间感知、视觉推理、幻觉和视觉错觉识别、毒性、刻板印象和偏见等不同能力。具体而言,该框架展示了压缩对一般和伦理关键指标的影响,利用现实世界和合成数据集的组合来涵盖多样化的社会交叉属性。广泛的实验评估揭示了LVLMs在不同KV和权重量化预算下的行为表现,既包括与FP16数据格式的基线模型相比保持性能的情况,也包括性能下降的情况。作者认为LVLM-Compress-Bench将帮助社区更深入地了解压缩的影响以及压缩模型可能带来的社会影响。

文章链接:

https://arxiv.org/abs/2503.04982

04

R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model

本文展示了在20亿参数的非监督微调(Non-SFT)模型上,通过强化学习(RL)实现多模态推理的“顿悟时刻”(Aha Moment)。研究团队从Qwen2-VL-2B基础模型出发,直接在SAT数据集上应用强化学习,无需传统的监督微调。在训练过程中,模型的响应长度最初下降,但随后通过RL逐渐增加,并最终出现了多模态的“顿悟时刻”,表现为模型能够自我反思并纠正错误。这一方法在CVBench基准测试上达到了59.47%的准确率,比基础模型高出约30%,比经过SFT的模型高出约2%。此外,研究还发现更长的推理过程对视觉推理任务有显著益处,响应长度与基准准确率之间呈现出正相关关系。

文章链接:

https://arxiv.org/abs/2503.05132

05

Advancing Multimodal In-Context Learning in Large Vision-Language Models with Task-aware Demonstrations

多模态情境学习(ICL)已成为大型视觉-语言模型(LVLMs)的关键能力,这得益于它们规模的增加和应用范围的扩大。尽管前景广阔,但在多模态环境中实现有效的ICL仍然具有挑战性,因为图像-文本输入的固有复杂性以及ICL性能对输入配置的高度敏感性。在这项工作中,作者揭示了多模态ICL背后的核心机制,确定任务映射是配置稳健情境演示(ICD)序列的关键因素。基于这些见解,作者提出了SabER,这是一种轻量级但功能强大的仅解码器变换器,配备了任务感知注意力,能够以自回归方式智能选择和排列演示库中的ICD。这种设计使得能够进行细粒度的特征提取和跨模态推理,迭代地细化任务映射以生成高质量的ICD序列。通过涵盖五个LVLMs和九个基准数据集的广泛实验,SabER不仅展示了强大的实证性能,而且还提供了对任务语义如何与多模态ICD相互作用的更深入理解。作者的发现强调了原则性ICD序列配置的重要性,并为在广泛的现实世界场景中增强多模态ICL开辟了新途径。

文章链接:

https://arxiv.org/abs/2503.04839

06

LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning

通用多模态嵌入模型在交错图像-文本检索、多模态RAG和多模态聚类等任务中起着至关重要的作用。然而,作者的实证结果表明,现有的基于大型多模态模型(LMM)的嵌入模型使用标准InfoNCE损失训练时,正负样本对之间的相似度分布存在高度重叠,使得有效区分困难负样本对变得具有挑战性。为了解决这个问题,作者提出了一个简单而有效的框架,根据负样本对的区分难度动态地改进嵌入模型的表示学习。在此框架内,作者训练了一系列名为LLaVE的模型,并在涵盖4个元任务和36个数据集的MMEB基准上进行评估。实验结果表明,LLaVE建立了更强的基线,实现了最先进的(SOTA)性能,同时表现出强大的可扩展性和效率。具体来说,LLaVE-2B超越了以前的SOTA 7B模型,而LLaVE-7B实现了进一步的性能提升6.2点。尽管LLaVE是在图像-文本数据上训练的,但它可以泛化到文本-视频检索任务,并以零样本方式实现强大的性能,展示了其在其他嵌入任务中转移的显著潜力。

文章链接:

https://arxiv.org/abs/2503.04812

07

Personalized Federated Learning via Learning Dynamic Graphs

个性化联邦学习(PFL)旨在为每个客户端训练一个针对其本地数据分布量身定制的个性化模型,但由于客户端本地数据分布的差异,学习在各个客户端上的表现并不理想。大多数现有的PFL方法侧重于为每个客户端个性化聚合的全局模型,忽视了联邦学习的一个基本方面:如何调节客户端模型的聚合。此外,几乎所有这些方法都忽略了联邦学习中客户端形成的图结构。在本文中,作者提出了一种新颖的方法,即个性化联邦学习与图注意力网络(pFedGAT),它捕获客户端之间的潜在图结构,并动态确定每个客户端对其他客户端的重要性,从而实现对聚合过程的细粒度控制。作者在多个数据分布场景中评估了pFedGAT,并在三个数据集:Fashion MNIST、CIFAR-10和CIFAR-100上将其与十二种最先进的方法进行了比较,发现它的表现始终很好。

文章链接:

https://arxiv.org/pdf/2503.05474

本期文章由陈研整理

往期精彩文章推荐


 关于AI TIME 

AI TIME源起于2019年,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,加强思想碰撞,链接全球AI学者、行业专家和爱好者,希望以辩论的形式,探讨人工智能和人类未来之间的矛盾,探索人工智能领域的未来。

迄今为止,AI TIME已经邀请了2000多位海内外讲者,举办了逾700场活动,超800万人次观看。

我知道你 

在看

提出观点,表达想法,欢迎 

留言

点击 阅读原文 查看更多!

Logo

脑启社区是一个专注类脑智能领域的开发者社区。欢迎加入社区,共建类脑智能生态。社区为开发者提供了丰富的开源类脑工具软件、类脑算法模型及数据集、类脑知识库、类脑技术培训课程以及类脑应用案例等资源。

更多推荐