Loading...

Amortized Bayesian Meta-Learning for Low-Rank Adaptation of Large Language Models
采用低秩适应(LoRA)对大语言模型(LLMs)进行微调,是一种从特定数据集整合信息的经济高效方式。然而,微调后LLM的泛化能力(即对未见过数据集的表现)往往难以判断。已有研究提出通过上下文提示优化或元学习微调LLM来提升泛化能力,但这些方法内存与计算成本高昂——要么需要长上下文提示,要么需要保存参数副本并使用二阶梯度更新。为解决这些挑战,我们提出“用于LoRA的摊销贝叶斯元学习(ABMLL)”。该方法基于适用于小型模型的摊销贝叶斯元学习,将其适配到LLMs中,同时保持计算效率。

Knowledge Graph-Infused Fine-Tuning for Structured Reasoning in Large Language Models
本文针对大型语言模型在处理需结构化知识的任务时存在的推理链缺失和实体级语义理解不足问题,提出了一种基于知识图谱注入的微调算法框架。该方法以预训练语言模型为基础,引入结构化图信息进行辅助学习。具体而言,利用图神经网络对实体及其关系进行编码,构建基于图的语义表示;随后设计融合机制,将知识图谱嵌入与语言模型的上下文表示进行联合建模。为提升知识融合的鲁棒性,引入门控机制动态平衡语言语义与结构知识的贡献,有效缓解不同表示空间之间的冲突。

LLM4Sweat: A Trustworthy Large Language Model for Hyperhidrosis Support
尽管大语言模型(LLM)在医疗领域展现出良好前景,但其在罕见疾病中的应用仍受限于微调所需的稀缺且不可靠的数据集。多汗症是一种导致超出生理需求过度出汗的疾病,属于此类罕见疾病,影响着2%-3%的人群,对生理舒适和心理社会健康均造成显著影响。迄今为止,尚无研究专门定制LLM以推动多汗症的诊断或护理发展。为填补这一空白,我们提出LLM4Sweat——一个开源的、领域特定的LLM框架,旨在为多汗症提供可靠且具共情性的支持。

LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model
大规模语音语言模型(LSLMs)的发展因架构碎片化和透明度缺失而受阻,这阻碍了研究的系统性比较与可复现性。与视觉-语言领域不同,LSLM领域普遍存在仅发布模型权重、却不公开对应训练数据和配置的情况。为填补这些关键空白,我们提出LLaSO——首个用于大规模语音语言建模的全开放端到端框架。LLaSO为研究社区提供三项核心资源:(1)LLaSO-Align,含1200万条语音-文本对齐语料;(2)LLaSO-Instruct,含1350万条多任务指令微调数据;

MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models
近年来,多模态大语言模型(MLLMs)在多个领域取得了显著进展,相应的评测基准也在不断完善。在此过程中,科学领域的评测基准在评估MLLMs推理能力方面发挥了重要作用。然而,现有基准仍面临三大关键挑战:1)对模型在多语言场景下的推理能力评估不足;2)对MLLMs全面模态覆盖的评估不够充分;3)缺乏对科学知识点的细粒度标注。为弥补这些不足,我们提出了一个综合且具有挑战性的基准——MME-SCI。我们精心收集了1019个高质量问答对,涉及3种不同的评测模式。

Equinox: Holistic Fair Scheduling in Serving Large Language Models
大语言模型(LLM)服务面临前所未有的需求,但现有调度器难以在多样化工作负载中公平分配资源。先来先服务(FCFS)等当前部署策略无法实现客户端隔离,易导致资源被垄断;而每分钟请求数(RPM)策略在非高峰时段会造成资源浪费。虚拟令牌计数器(VTC)试图通过跟踪令牌消耗实现公平共享,但未能充分捕捉LLM的资源动态特性。

RotBench: Evaluating Multimodal Large Language Models on Identifying Image Rotation
我们研究了多模态大型语言模型(MLLMs)在识别0°、90°、180°和270°旋转输入图像朝向方面的准确程度。该任务要求模型具备稳健的视觉推理能力,以检测旋转线索并理解图像内的空间关系(无论图像朝向如何)。为评估MLLMs的这些能力,我们提出了ROTBENCH——一个包含350张人工筛选图像的基准数据集,涵盖生活场景、人像和风景图像。尽管该任务相对简单,但研究表明,包括GPT-5、o3和Gemini-2.5-Pro在内的多个最先进开源及专有MLLMs,均无法可靠识别输入图像的旋转角度。

Z-Pruner: Post-Training Pruning of Large Language Models for Efficiency without Retraining
近年来,大型语言模型(LLMs)取得了显著发展,在各类自然语言处理任务中展现出卓越性能。然而,这一进步的代价是模型规模不断扩大,这给模型部署、可扩展性和能效带来了巨大挑战。为解决这些局限,训练后剪枝已成为一种极具潜力的方法,能够在无需重新训练的情况下减小模型规模、降低推理延迟。尽管具备这些优势,但许多现有剪枝方法要么会导致模型性能大幅下降,要么需要消耗大量计算资源进行微调。在本研究中,我们提出了Z-Pruner——一种新型训练后剪枝方法,旨在对预训练大型语言模型进行稀疏化处理,且无需任何重新训练步骤。

Think Broad, Act Narrow: CWE Identification with Multi-Agent Large Language Models
机器学习和大型语言模型(LLMs)在漏洞检测领域近年来受到了广泛关注。遗憾的是,最先进的技术表明,LLMs甚至无法区分漏洞函数与其良性版本,这主要源于三个问题:漏洞检测需要深度分析,而LLMs在进行一次性预测时往往难以胜任;现有技术通常局限于函数级分析,而有效的漏洞检测需要超出函数范围的上下文信息;对二进制分类的聚焦可能导致识别出漏洞但关联错误的安全弱点(CWE),这可能会误导开发者。我们提出了一种新颖的多智能体LLM方法来解决CWE识别的挑战。

WarriorMath: Enhancing the Mathematical Ability of Large Language Models with a Defect-aware Fram...
研究背景:大型语言模型(LLMs)在数学问题解决上表现出色,但受限于高质量、多样化训练数据的获取。现有方法通过重述或难度递进扩充数据集,却忽视了LLMs的特定缺陷,导致生成的问题多为模型已能解决的,提升有限。核心方法:提出WarriorMath框架,整合缺陷感知数据合成与渐进式训练缺陷感知数据合成:由多个专家LLM组成“考试委员会”,协作生成、评价和优化数学问题。仅保留基础模型无法解决的题目,通过专家反馈迭代改进,生成针对性训练数据。渐进式训练。

Students‘ Perceptions to a Large Language Model‘s Generated Feedback and Scores of Argumentation ...
物理入门课程的学生往往依赖低效策略,他们更关注最终答案,而非理解背后的原理。将科学论证融入解题过程,既能培养批判性思维,又能将概念知识与实际应用关联起来。通过引导学习者清晰阐述解题所用的科学论证,并针对学生的策略提供实时反馈,我们旨在帮助学生培养更优质的解题能力。然而,在大规模物理课程中,为学生提供及时、个性化的反馈仍是一项挑战。人工智能(AI)领域的最新进展为解决该问题提供了富有前景的方案。本研究探究了AI生成的反馈在物理入门课程学生书面科学论证中的应用潜力。

Fin-PRM: A Domain-Specialized Process Reward Model for Financial Reasoning in Large Language Models
过程奖励模型(PRMs)已成为监督大语言模型(LLMs)中间推理过程的一种极具潜力的框架。然而,现有PRMs主要在通用领域或科学、技术、工程与数学(STEM)领域训练,在金融等领域专用场景中表现欠佳——这些场景的推理更具结构性、符号性,且对事实正确性与合规正确性高度敏感。本文提出Fin-PRM,这是一种面向领域专用、具备轨迹感知能力的PRM,专门用于评估金融任务中的中间推理步骤。Fin-PRM整合了步骤级与轨迹级奖励监督机制,能够对符合金融逻辑的推理轨迹进行精细化评估。

Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
多模态大型语言模型(MLLMs)通过无缝融合视觉与语言理解能力,在众多应用中取得了显著进展。然而,其可信度仍备受关注,存在幻觉、对抗脆弱性、隐私泄露及偏见行为等风险。现有评估与缓解方法往往聚焦于单一维度,且忽略了多模态特性引入的风险。为应对这些挑战,本文提出MultiTrust-X——一个用于评估、分析和缓解MLLMs可信度问题的全面基准测试体系。

Efficient Mixed-Precision Large Language Model Inference with TurboMind
混合精度推理技术通过对模型权重、激活值和键值(KV)缓存采用混合精度格式,降低了大语言模型(LLM)的内存与计算需求。本文提出了一种混合精度LLM推理技术,该技术包括:(1)跨层级存储与张量核心架构的系统性内存和计算优化;(2)跨不同精度格式与硬件配置的端到端全面混合精度优化。本文方法的核心是两条为实现最优硬件利用率而设计的新型混合精度流水线:一条是通用矩阵乘法(GEMM)流水线,通过离线权重打包与在线加速优化矩阵运算;

Driving Style Recognition Like an Expert Using Semantic Privileged Information from Large Languag...
现有驾驶风格识别系统在很大程度上依赖低级传感器衍生特征进行训练,却忽略了人类专家固有的丰富语义推理能力。这种差异导致算法分类与专家判断之间存在根本性偏差。为填补这一空白,本文提出一种新框架,该框架融合了从大语言模型(LLMs)中提取的语义特权信息(SPI),使识别结果与人类可解释的推理过程对齐。具体而言,首先引入DriBehavGPT——一个基于LLM的交互式模块,用于生成驾驶行为的自然语言描述;随后通过文本嵌入和降维处理,将这些描述转化为可兼容机器学习的表示形式;

A Review of Developmental Interpretability in Large Language Models
本综述整合了大型语言模型(LLMs)领域中新兴且关键的“发展可解释性”研究方向。我们梳理了该领域从“训练后模型的静态、事后分析”到“训练过程本身的动态研究”的演进历程。首先,我们综述了支撑研究者拆解学习过程的基础方法论——包括表征探测、因果追踪与电路分析。综述的核心部分剖析了LLM能力的发展轨迹,详细阐述了计算电路的形成与构成、知识获取的双阶段本质、上下文学习等策略的暂时动态,以及作为训练相变的涌现能力现象。

Cryfish: On deep audio analysis with Large Language Models
近年来,基于文本的大型语言模型(LLMs)取得了革命性进展,这使得人们对将此类模型的能力扩展到多模态感知与理解任务的兴趣日益浓厚。听觉作为一项核心能力,是LLMs整合的重要目标。然而,将听觉能力有效融入LLMs面临重大挑战,即如何在语音与声音任务中实现复杂听觉任务的泛化。为解决这些问题,我们提出了具备听觉能力的LLM变体——Cryfish。该模型通过基于Transformer的连接器,将WavLM音频编码器特征与Qwen2模型整合,并借助专用训练策略适配各类听觉任务。

DEXTER-LLM: Dynamic and Explainable Coordination of Multi-Robot Systems in Unknown Environments v...
未知环境下多机器人系统的在线协同面临重大挑战,尤其是在运行过程中检测到的语义特征动态触发新任务时。近年来,基于大语言模型(LLMs)的场景推理与规划方法,主要聚焦于已知环境中的“一次性端到端”解决方案,既缺乏在线运行所需的动态适应能力,也在规划过程中缺乏可解释性。为解决这些问题,本文提出一种适用于未知环境动态任务规划的新型框架(DEXTER-LLM),该框架整合四个模块:(1)任务理解模块,用于解析自然语言或线性时序逻辑(LTL)公式指定的任务间部分顺序关系;

RETAIL: Towards Real-world Travel Planning for Large Language Models
人工智能(AI)在招聘领域的应用日益广泛,大型语言模型(LLMs)甚至有可能影响乃至决定招聘决策。然而,这引发了关于偏见、公平性与信任的迫切担忧,在多元文化背景下此类担忧尤为突出。尽管LLMs在招聘中的作用不断增强,但鲜有研究系统探讨跨文化场景下AI驱动的招聘评估所存在的潜在偏见。本研究通过系统分析,探究LLMs如何从文化与身份维度评估求职面试表现。研究采用两组面试转录文本数据集(英国求职者100份、印度求职者100份),首先考察LLM在“可雇佣性”及相关特质评分上的跨文化差异。

EMNLP: Educator-role Moral and Normative Large Language Models Profiling
职业模拟(SP)技术能够让大型语言模型(LLMs)模拟专业角色,但在这类场景下,对模型的综合心理与伦理评估仍存在缺口。本文提出EMNLP框架,即“教师角色道德与规范性大语言模型分析框架”,用于对教师角色LLMs进行人格分析、道德发展阶段测量,以及软提示注入下的伦理风险评估。EMNLP框架扩展了现有量表,并构建了88个教师专属道德困境,实现了与人类教师的“职业导向型对比”;同时设计了针对性软提示注入集,用于评估教师角色模拟中模型的合规性与脆弱性。

欢迎留下您的脚印