Loading...
函数调用使大型语言模型(LLMs)能够借助工具和API与外部系统交互。然而,在面临多步骤工具使用场景时,LLMs在工具选择、参数生成和工具链规划方面仍存在困难。现有方法通常依赖人工设计特定任务演示,或从精心整理的库中检索相关内容。随着工具多样性和任务难度的增加,这些方法不仅需要大量专家投入,提示工程也会变得愈发复杂且低效。为解决这些挑战,本文提出一种自引导方法——逐步经验召回(StepwiseExperiencERecall,SEER)。该方法从持续更新的经验池中进行细粒度、逐步的检索。
Attribution, Citation, and Quotation: A Survey of Evidence-based Text Generation with Large Langu...
随着大语言模型(LLMs)的应用日益广泛,其可靠性与可信度相关的担忧也不断加剧。为此,越来越多的研究聚焦于LLMs的循证文本生成,旨在将模型输出与支持证据关联,以确保可追溯性与可验证性。然而,由于术语不一致、评估方式孤立以及缺乏统一基准,该领域呈现碎片化状态。为填补这一空白,我们系统分析了134篇论文,提出了LLMs循证文本生成的统一分类体系,并从七个关键维度研究了300种评估指标。
From Scores to Skills: A Cognitive Diagnosis Framework for Evaluating Financial Large Language Mo...
大型语言模型(LLMs)在金融应用中展现出潜力,但由于现有评估基准存在缺陷,其在这一高风险领域的适用性仍未得到充分验证。现有基准仅依赖分数级评估,用单一分数概括模型性能,掩盖了模型真实的知识掌握情况及其具体局限;同时,这些基准所依赖的数据集仅涵盖金融概念的一小部分,却忽略了现实应用中的其他关键内容。为解决这些问题,本文提出FinCDM——首个专为金融LLMs设计的认知诊断评估框架。
LLM-RIMSA: Large Language Models driven Reconfigurable Intelligent Metasurface Antenna Systems
6G网络的演进对超大规模连接和智能无线环境提出了需求,但现有可重构智能表面(RIS)技术在硬件效率、动态控制和可扩展性方面面临关键局限。本文提出了LLM-RIMSA,这是一种变革性框架,将大型语言模型(LLMs)与新型可重构智能超表面天线(RIMSA)架构相结合,以应对这些挑战。与传统RIS设计不同,RIMSA采用并行同轴馈电和二维超表面集成,使每个超材料单元能够独立调整其幅度和相位。
SafeLLM: Unlearning Harmful Outputs from Large Language Models against Jailbreak Attacks
越狱攻击通过构造对抗性提示绕过大型语言模型(LLMs)的对齐机制,导致模型生成有害、受限或有偏见的内容,对LLMs的安全性构成严重威胁。本文提出一种新型基于遗忘学习的防御框架SafeLLM,能够在保留语言流畅性和通用能力的同时,从LLMs中遗忘有害知识。SafeLLM采用三阶段流程:(1)基于外部分类器与模型内部评估相结合的混合方法,实现动态不安全输出检测;(2)通过前馈网络(FFN)激活进行token级有害内容追踪,定位有害知识;(3)通过约束优化抑制不安全行为,且不降低模型整体质量。
Flexible metadata harvesting for ecology using large language models
大型开放数据集能够加速生态研究,尤其是通过让研究者复用来自多源的数据集以形成新见解,从而推动研究进展。然而,要找到最适合整合的数据集,研究者必须应对各类生态与环境数据提供商平台,而这些平台的元数据可用性和标准各不相同。为攻克这一难题,我们开发了一款基于大型语言模型(LLM)的元数据收集器。该收集器可从任意数据集的登录页面灵活提取元数据,并借助现有元数据标准将其转换为用户自定义的统一格式。经验证,在LLM后处理流程的辅助下,我们的工具提取结构化和非结构化元数据的准确性相当。
Amortized Bayesian Meta-Learning for Low-Rank Adaptation of Large Language Models
采用低秩适应(LoRA)对大语言模型(LLMs)进行微调,是一种从特定数据集整合信息的经济高效方式。然而,微调后LLM的泛化能力(即对未见过数据集的表现)往往难以判断。已有研究提出通过上下文提示优化或元学习微调LLM来提升泛化能力,但这些方法内存与计算成本高昂——要么需要长上下文提示,要么需要保存参数副本并使用二阶梯度更新。为解决这些挑战,我们提出“用于LoRA的摊销贝叶斯元学习(ABMLL)”。该方法基于适用于小型模型的摊销贝叶斯元学习,将其适配到LLMs中,同时保持计算效率。
Knowledge Graph-Infused Fine-Tuning for Structured Reasoning in Large Language Models
本文针对大型语言模型在处理需结构化知识的任务时存在的推理链缺失和实体级语义理解不足问题,提出了一种基于知识图谱注入的微调算法框架。该方法以预训练语言模型为基础,引入结构化图信息进行辅助学习。具体而言,利用图神经网络对实体及其关系进行编码,构建基于图的语义表示;随后设计融合机制,将知识图谱嵌入与语言模型的上下文表示进行联合建模。为提升知识融合的鲁棒性,引入门控机制动态平衡语言语义与结构知识的贡献,有效缓解不同表示空间之间的冲突。
LLM4Sweat: A Trustworthy Large Language Model for Hyperhidrosis Support
尽管大语言模型(LLM)在医疗领域展现出良好前景,但其在罕见疾病中的应用仍受限于微调所需的稀缺且不可靠的数据集。多汗症是一种导致超出生理需求过度出汗的疾病,属于此类罕见疾病,影响着2%-3%的人群,对生理舒适和心理社会健康均造成显著影响。迄今为止,尚无研究专门定制LLM以推动多汗症的诊断或护理发展。为填补这一空白,我们提出LLM4Sweat——一个开源的、领域特定的LLM框架,旨在为多汗症提供可靠且具共情性的支持。
LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model
大规模语音语言模型(LSLMs)的发展因架构碎片化和透明度缺失而受阻,这阻碍了研究的系统性比较与可复现性。与视觉-语言领域不同,LSLM领域普遍存在仅发布模型权重、却不公开对应训练数据和配置的情况。为填补这些关键空白,我们提出LLaSO——首个用于大规模语音语言建模的全开放端到端框架。LLaSO为研究社区提供三项核心资源:(1)LLaSO-Align,含1200万条语音-文本对齐语料;(2)LLaSO-Instruct,含1350万条多任务指令微调数据;
MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models
近年来,多模态大语言模型(MLLMs)在多个领域取得了显著进展,相应的评测基准也在不断完善。在此过程中,科学领域的评测基准在评估MLLMs推理能力方面发挥了重要作用。然而,现有基准仍面临三大关键挑战:1)对模型在多语言场景下的推理能力评估不足;2)对MLLMs全面模态覆盖的评估不够充分;3)缺乏对科学知识点的细粒度标注。为弥补这些不足,我们提出了一个综合且具有挑战性的基准——MME-SCI。我们精心收集了1019个高质量问答对,涉及3种不同的评测模式。
Equinox: Holistic Fair Scheduling in Serving Large Language Models
大语言模型(LLM)服务面临前所未有的需求,但现有调度器难以在多样化工作负载中公平分配资源。先来先服务(FCFS)等当前部署策略无法实现客户端隔离,易导致资源被垄断;而每分钟请求数(RPM)策略在非高峰时段会造成资源浪费。虚拟令牌计数器(VTC)试图通过跟踪令牌消耗实现公平共享,但未能充分捕捉LLM的资源动态特性。
RotBench: Evaluating Multimodal Large Language Models on Identifying Image Rotation
我们研究了多模态大型语言模型(MLLMs)在识别0°、90°、180°和270°旋转输入图像朝向方面的准确程度。该任务要求模型具备稳健的视觉推理能力,以检测旋转线索并理解图像内的空间关系(无论图像朝向如何)。为评估MLLMs的这些能力,我们提出了ROTBENCH——一个包含350张人工筛选图像的基准数据集,涵盖生活场景、人像和风景图像。尽管该任务相对简单,但研究表明,包括GPT-5、o3和Gemini-2.5-Pro在内的多个最先进开源及专有MLLMs,均无法可靠识别输入图像的旋转角度。
Z-Pruner: Post-Training Pruning of Large Language Models for Efficiency without Retraining
近年来,大型语言模型(LLMs)取得了显著发展,在各类自然语言处理任务中展现出卓越性能。然而,这一进步的代价是模型规模不断扩大,这给模型部署、可扩展性和能效带来了巨大挑战。为解决这些局限,训练后剪枝已成为一种极具潜力的方法,能够在无需重新训练的情况下减小模型规模、降低推理延迟。尽管具备这些优势,但许多现有剪枝方法要么会导致模型性能大幅下降,要么需要消耗大量计算资源进行微调。在本研究中,我们提出了Z-Pruner——一种新型训练后剪枝方法,旨在对预训练大型语言模型进行稀疏化处理,且无需任何重新训练步骤。
Think Broad, Act Narrow: CWE Identification with Multi-Agent Large Language Models
机器学习和大型语言模型(LLMs)在漏洞检测领域近年来受到了广泛关注。遗憾的是,最先进的技术表明,LLMs甚至无法区分漏洞函数与其良性版本,这主要源于三个问题:漏洞检测需要深度分析,而LLMs在进行一次性预测时往往难以胜任;现有技术通常局限于函数级分析,而有效的漏洞检测需要超出函数范围的上下文信息;对二进制分类的聚焦可能导致识别出漏洞但关联错误的安全弱点(CWE),这可能会误导开发者。我们提出了一种新颖的多智能体LLM方法来解决CWE识别的挑战。
WarriorMath: Enhancing the Mathematical Ability of Large Language Models with a Defect-aware Fram...
研究背景:大型语言模型(LLMs)在数学问题解决上表现出色,但受限于高质量、多样化训练数据的获取。现有方法通过重述或难度递进扩充数据集,却忽视了LLMs的特定缺陷,导致生成的问题多为模型已能解决的,提升有限。核心方法:提出WarriorMath框架,整合缺陷感知数据合成与渐进式训练缺陷感知数据合成:由多个专家LLM组成“考试委员会”,协作生成、评价和优化数学问题。仅保留基础模型无法解决的题目,通过专家反馈迭代改进,生成针对性训练数据。渐进式训练。
Students‘ Perceptions to a Large Language Model‘s Generated Feedback and Scores of Argumentation ...
物理入门课程的学生往往依赖低效策略,他们更关注最终答案,而非理解背后的原理。将科学论证融入解题过程,既能培养批判性思维,又能将概念知识与实际应用关联起来。通过引导学习者清晰阐述解题所用的科学论证,并针对学生的策略提供实时反馈,我们旨在帮助学生培养更优质的解题能力。然而,在大规模物理课程中,为学生提供及时、个性化的反馈仍是一项挑战。人工智能(AI)领域的最新进展为解决该问题提供了富有前景的方案。本研究探究了AI生成的反馈在物理入门课程学生书面科学论证中的应用潜力。
Fin-PRM: A Domain-Specialized Process Reward Model for Financial Reasoning in Large Language Models
过程奖励模型(PRMs)已成为监督大语言模型(LLMs)中间推理过程的一种极具潜力的框架。然而,现有PRMs主要在通用领域或科学、技术、工程与数学(STEM)领域训练,在金融等领域专用场景中表现欠佳——这些场景的推理更具结构性、符号性,且对事实正确性与合规正确性高度敏感。本文提出Fin-PRM,这是一种面向领域专用、具备轨迹感知能力的PRM,专门用于评估金融任务中的中间推理步骤。Fin-PRM整合了步骤级与轨迹级奖励监督机制,能够对符合金融逻辑的推理轨迹进行精细化评估。
Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation
多模态大型语言模型(MLLMs)通过无缝融合视觉与语言理解能力,在众多应用中取得了显著进展。然而,其可信度仍备受关注,存在幻觉、对抗脆弱性、隐私泄露及偏见行为等风险。现有评估与缓解方法往往聚焦于单一维度,且忽略了多模态特性引入的风险。为应对这些挑战,本文提出MultiTrust-X——一个用于评估、分析和缓解MLLMs可信度问题的全面基准测试体系。
Efficient Mixed-Precision Large Language Model Inference with TurboMind
混合精度推理技术通过对模型权重、激活值和键值(KV)缓存采用混合精度格式,降低了大语言模型(LLM)的内存与计算需求。本文提出了一种混合精度LLM推理技术,该技术包括:(1)跨层级存储与张量核心架构的系统性内存和计算优化;(2)跨不同精度格式与硬件配置的端到端全面混合精度优化。本文方法的核心是两条为实现最优硬件利用率而设计的新型混合精度流水线:一条是通用矩阵乘法(GEMM)流水线,通过离线权重打包与在线加速优化矩阵运算;
