Loading...

FastMMoE: Accelerating Multimodal Large Language Models through Dynamic Expert Activation and Rou...
多模态大语言模型(MLLMs)已取得令人瞩目的性能,但高分辨率视觉输入会产生长序列视觉tokens,导致显著的推理延迟。在保持性能的同时减少冗余视觉tokens,对于减轻计算/内存负担、推动MLLM在资源受限或延迟敏感场景中的部署至关重要。现有视觉token剪枝方法主要依赖基于注意力的冗余分析,且专为密集架构设计。本文提出Fast多模态混合专家(FastMMoE),一种面向混合专家(MoE)型MLLMs的无训练加速框架,其设计源于路由分析视角。

Measuring the Impact of Lexical Training Data Coverage on Hallucination Detection in Large Langua...
该研究聚焦大型语言模型(LLMs)幻觉检测问题,核心探索词汇级训练数据覆盖率(通过n-gram频率衡量)对幻觉检测的作用,弥补了现有研究对预训练数据暴露与幻觉关联的探索不足。研究背景:现有幻觉检测方法多依赖模型内部信号(如token级对数概率、熵)、一致性验证或外部知识检索,而预训练数据中词汇序列的覆盖情况这一基础信号未被系统研究。核心思路。

Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
大型语言模型的安全性通常通过静态基准进行评估,但关键失效模式具有动态性:分布偏移下的价值漂移、越狱攻击,以及部署过程中对齐性的缓慢退化。基于近期提出的“智能第二定律”(该定律将伦理熵视为一种状态变量,除非通过对齐工作加以抵消,否则会自发增加),我们将这一框架应用于大型语言模型的实际操作中。我们定义了五分类行为分类体系,训练了一个分类器以从模型对话文本中估算伦理熵StS(t)St,并在压力测试中测量了四个前沿模型的基础版本与指令微调版本的熵动态变化。

Knowledge-Informed Automatic Feature Extraction via Collaborative Large Language Model Agents
机器学习模型在表格数据上的性能严重依赖高质量的特征工程。尽管大型语言模型(LLMs)在自动化特征提取(AutoFE)方面展现出潜力,但现有方法往往受限于单一LLM架构、简单的定量反馈,且未能系统整合外部领域知识。本文提出RogueOne,一种基于LLM的新型多智能体框架,用于知识驱动的自动特征提取。RogueOne构建了一个由三个专业智能体(科学家、提取器和测试器)组成的去中心化系统,通过迭代协作发现、生成和验证预测性特征。

Vision Large Language Models Are Good Noise Handlers in Engagement Analysis
参与度识别与传统图像分类任务不同,视频数据集的参与度识别尤其受主观标签和噪声的挑战,导致模型性能受限。为克服主观和含噪参与度标签带来的难题,我们提出一种利用视觉大型语言模型(VLMs)优化标注并指导训练过程的框架。该框架通过问卷提取行为线索,将数据划分为高可靠性和低可靠性子集;同时引入融合课程学习与软标签优化的训练策略,逐步融入模糊样本,且通过调整监督信号反映不确定性。

Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models
本文提供的证据表明,对抗性诗歌可作为大型语言模型(LLMs)的通用单轮越狱技术。在25个前沿专有模型和开源权重模型中,精心设计的诗歌提示词实现了高攻击成功率(ASR),部分提供商的模型成功率超过90%。将提示词映射到MLCommons和欧盟行为准则(EUCoP)风险分类体系后发现,诗歌攻击可跨化学、生物、放射性、核(CBRN)危害、操纵、网络攻击及失控等领域迁移。通过标准化元提示词将1200个MLCommons有害提示词转化为诗歌形式后,其攻击成功率较散文基线最高提升18倍。

CoSP: Reconfigurable Multi-State Metamaterial Inverse Design via Contrastive Pretrained Large Lan...
超材料因其在亚波长尺度操控光的能力而闻名,但由于其复杂精密的结构,面临着巨大的设计挑战。因此,深度学习已成为简化其设计流程的强大工具。具有可调参数的可重构多态超材料(RMMs)能在外部刺激下在不同状态间切换光学特性,从而产生众多应用。然而,现有基于深度学习的逆向设计方法在考虑多态切换的可重构性方面存在不足。为应对这一挑战,我们提出了CoSP,一种基于对比预训练大语言模型(LLM)的智能逆向设计方法。通过在多态光谱上进行对比预训练,获得一个能够理解光谱的训练充分的光谱编码器,该编码器随后与预训练LLM交互。

Mitigating Label Length Bias in Large Language Models
大型语言模型(LLMs)是强大的零样本和少样本学习者。然而,当在一组候选选项上进行预测时,LLMs会受到标签偏差的影响,且现有校准方法忽略了多token类别标签引发的偏差。本文针对一种名为“标签长度偏差”的问题展开研究——即使经过标准长度归一化,不同长度的标签仍会被不一致地处理。为缓解这一偏差,我们提出了归一化上下文校准(NCC)方法:一种在完整标签层面进行概率归一化和校准的有效策略。NCC在多个数据集和模型上相较于现有方法实现了统计显著的性能提升,F1值最高提升10%。

PocketLLM: Ultimate Compression of Large Language Models via Meta Networks
本文针对大型语言模型(LLMs)在边缘设备部署时面临的存储、传输难题,提出了一种名为PocketLLM的极端压缩方法。将LLM的权重矩阵拆分为多个子向量,通过元编码器(meta-encoder)将其投影到latent空间,生成latent向量;构建紧凑码本(codebook),通过聚类将latent向量离散化为码本中的代表性向量,并用索引记录对应关系;利用轻量级元解码器(meta-decoder)将码本向量映射回原始权重空间,实现权重重建;

MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping
本文针对MoE(混合专家)架构的多模态大语言模型(MLLM)推理效率低的问题,提出了训练无关的专家跳过框架MoDES。核心发现是现有单模态LLM的专家跳过方法未考虑MoE层间专家贡献异质性和模态特异性,导致MLLM性能大幅下降。MoDES通过全局调制局部门控(GMLG)、双模态阈值化(DMT)和前沿搜索算法,在13个基准测试中实现高效推理:最高可跳过88%专家,保留95%以上原始性能,预填充速度提升2.16倍,解码速度提升1.26倍,显著优于NAEE、MC-MoE等现有方法。

Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security
多模态大语言模型(MLLMs)在跨模态理解方面展现出令人瞩目的能力,但尽管具备稳健的文本安全机制,仍易受通过视觉输入发起的对抗攻击。这些漏洞源于两个核心缺陷:视觉表征的连续性(为梯度-based攻击提供了可能),以及基于文本的安全机制难以充分迁移到视觉内容。本文提出Q-MLLM,一种新颖的架构,其整合了两级向量量化以构建离散瓶颈来抵御对抗攻击,同时保留多模态推理能力。通过在像素块级和语义级对视觉表征进行离散化,Q-MLLM阻断了攻击路径,并弥合了跨模态安全对齐差距。

Incorporating Self-Rewriting into Large Language Model Reasoning Reinforcement
该研究针对大型推理模型(LRMs)在强化学习(RL)训练中仅依赖最终结果正确性奖励,导致内部推理存在过度思考、思考不足、冗余思考和无序思考等缺陷的问题,提出了自重写(self-rewriting)框架。核心思路是将模型自我重写机制融入RL后训练流程(基于GRPO算法):仅对模型已完全掌握的“简单样本”(正确率100%)进行推理文本重写,保留核心观点的同时优化表达质量,再让模型从自身重写后的推理中学习;通过批量编译重写与常规生成任务,将计算开销控制在约10%,兼顾扩展性与效率。

AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabilities of Large L...
我们提出了AraLingBench——一个完全由人工标注的基准测试集,用于评估大型语言模型(LLMs)的阿拉伯语语言能力。该基准涵盖五个核心类别:语法、形态学、拼写、阅读理解和句法,通过150道由专家设计的多项选择题,直接评估语言的结构性理解能力。对35个阿拉伯语及双语LLM的评估结果显示,当前模型在表层语言熟练度上表现强劲,但在深层语法和句法推理方面存在困难。AraLingBench揭示了基于知识的基准测试高分与真实语言掌握能力之间的持续差距,表明许多模型通过记忆或模式识别而非真正理解来取得成功。

Addressing Stereotypes in Large Language Models: A Critical Examination and Mitigation
近年来,随着自然语言处理(NLP)的发展,ChatGPT等大型语言模型(LLMs)备受青睐,其应用场景涵盖多个学科领域及日常生活。LLMs理解和生成类人文本的能力,使其在原本未接触或未使用过此类模型的用户中迅速走红。然而,LLMs从训练数据中继承了显性和隐性偏见,这些偏见包括社会、伦理、文化、宗教等方面的偏见与刻板印象。模型的训练数据包含大量互联网内容——一个充斥着主观观点、无需事实核查且偏见可能被公开传播的场所。因此,LLMs的输出可能包含明显或隐蔽的偏见。

APD-Agents: A Large Language Model-Driven Multi-Agents Collaborative Framework for Automated Page...
布局设计是移动应用页面开发中的关键步骤。然而,设计出令人满意的布局对设计师而言极为耗时:他们需要确定页面上展示的控件和内容,然后反复调整其尺寸、位置和样式,以实现更佳的美观度和结构合理性。尽管如今许多设计软件能够协助执行这些重复性任务,但有效使用这些软件仍需大量培训。此外,跨应用页面的协同设计还需要额外时间来统一标准,确保样式一致性。在本研究中,我们提出了APD-Agents——一种基于大型语言模型(LLM)的多智能体协作框架,用于移动应用的自动化页面设计。

Large Language Model Driven Analysis of General Coordinates Network (GCN) Circulars
该研究聚焦NASA的通用坐标网络(GCN)数据库,针对其30年来积累的40500余份非结构化“通报”(Circulars),提出基于大语言模型(LLMs)的自动化文本挖掘方案。核心工作包括三部分:一是构建神经主题建模管道,实现天体物理主题的自动聚类与总结;二是通过对比微调,完成观测波段(高能、光学、射电等)和引力波(GW)相关事件的分类;三是基于开源Mistral模型搭建零样本系统,结合提示工程、输出解析和检索增强生成(RAG),自动提取伽马射线暴(GRB)的红移等关键信息。

Breaking Expert Knowledge Limits: Self-Pruning for Large Language Models
大型语言模型(LLMs)在各类任务中展现出卓越性能,但庞大的模型规模严重阻碍了其实际部署。现有针对LLMs的剪枝方法(如Wanda)严重依赖人工设计的剪枝算法,导致人力成本高昂且需要专业领域知识。此外,我们首次发现,均匀稀疏策略会引发高剪枝率下性能急剧下降的严重异常值问题,这引发了关于如何设计适配LLMs的自适应剪枝稀疏度的额外思考。LLMs能否实现自我剪枝?

LAUD: Integrating Large Language Models with Active Learning for Unlabeled Data
本研究分析了大型语言模型(LLMs)在变革研发(R&D)流程中的多重作用。通过自动化知识发现、强化假设生成、整合跨学科见解以及促进创新生态系统内的协作,LLMs显著提升了研究流程的效率与效果。这些模型能够广泛分析科学文献、专利数据库和实验数据,助力构建更灵活、更具洞察力的研发工作流,最终加快创新周期并缩短突破性理念的上市时间。关键词:大型语言模型(LLMs)、创新管理、战略决策、伦理AI治理、预测分析。

SMRC: Aligning Large Language Models with Student Reasoning for Mathematical Error Correction
大语言模型(LLMs)在解决数学问题时常常出现推理错误,如何自动检测并修正这些错误已成为一个重要的研究方向。然而,现有方法主要侧重于模型内部的自修正,未能满足教育场景中所需的“教师式”修正——即系统地引导和修正学生的解题过程。为填补这一空白,我们提出了SMRC(学生数学推理修正)方法,一种使LLMs与学生推理对齐的新型框架。具体而言,SMRC将学生推理建模为多步序列决策问题,并引入蒙特卡洛树搜索(MCTS)探索最优修正路径。

Operationalizing Pluralistic Values in Large Language Model Alignment Reveals Trade-offs in Safet...
尽管大型语言模型(LLMs)越来越多地通过人类反馈进行训练,以实现安全性并与人类价值观对齐,但对齐决策往往忽视了人类的社会多样性。本研究通过系统评估对齐流程中的人口统计学差异和设计参数,探讨了整合多元价值观对LLM行为的影响。

欢迎留下您的脚印