Loading...
大型语言模型(LLMs)在多种应用中取得了显著成功。然而,由于其输出空间广阔,实施内容限制仍是一项重大挑战。内容限制的一个方面是通过模型对齐方法(如监督微调,SFT)防止LLMs生成有害内容。然而,内容限制的需求可能因用户群体而异,随时间快速变化,且并不总是与“有害性”的通用定义一致。由于高昂的计算、数据和存储需求,为每个特定场景应用SFT并不现实。基于这一需求,我们提出了一项新任务——自适应内容限制(AdaCoRe),其核心是轻量级策略(无需模型微调的方法),以阻止已部署的LLMs为特定场景生成受限术语。
Unraveling the cognitive patterns of Large Language Models through module communities
大型语言模型(LLMs)凭借从科学发现、医疗诊断到聊天机器人等各类应用,在科学、工程和社会领域取得重大进展,重塑了我们的世界。尽管LLMs应用广泛且实用性强,但其底层机制仍隐藏在数十亿参数和复杂结构中,导致其内部架构与认知过程难以理解。为填补这一空白,我们借鉴生物学中理解认知涌现的方法,开发了一个基于网络的框架,将认知技能、LLM架构与数据集关联起来,为基础模型分析带来范式转变。
Survey of Specialized Large Language Model
专用大型语言模型(LLMs)的快速演进已从简单的领域适配过渡到复杂的原生架构,标志着人工智能(AI)发展的范式转变。本综述系统考察了该技术在医疗、金融、法律和技术领域的发展进程。除专用LLMs的广泛应用外,近期LLM智能体(Agent)还采用了多项技术突破,例如超越微调的领域原生设计、通过稀疏计算与量化提升参数效率、增强多模态能力融合等。分析表明,这些创新解决了通用LLMs在专业应用中的核心局限性,且专用模型在领域特定基准测试中持续展现性能优势。
Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement...
大型语言模型(LLMs)已在各类自然语言处理任务中展现出令人印象深刻的能力,但它们本质上仍属于无状态模型,受限于有限的上下文窗口,难以实现长程推理。近期为解决这一局限的研究常通过外部记忆库增强LLMs,但现有方案多为静态且依赖启发式策略,缺乏用于决策“存储、更新或检索什么信息”的学习机制。本文提出Memory-R1记忆管理器(MemoryManager):学习执行结构化记忆操作,包括对记忆条目进行添加(ADD)、更新(UPDATE)、删除(DELETE)或不操作(NOOP);
Spatio-Temporal Pruning for Compressed Spiking Large Language Models
由于模型规模庞大且推理延迟较高,大语言模型(LLMs)在能量受限环境中的部署面临重大挑战。脉冲神经网络(SNNs)受大脑中稀疏事件驱动神经处理和高能效信息传输机制的启发,为实现低功耗计算提供了一种极具潜力的方案。将脉冲神经元的事件驱动效率与LLMs的先进能力相结合,是构建高能效LLMs的重要方向。本研究重点探索压缩型脉冲大语言模型(SpikingLLMs)的设计方法:从SNNs的视角重新审视空间剪枝与时间剪枝技术,提出一种新颖的时空剪枝框架,旨在优化SpikingLLMs的计算效率,同时保持其高性能。
Error Reflection Prompting: Can Large Language Models Successfully Understand Errors?
思维链(CoT)等语言模型提示方法为问题解决提供了直观的逐步推理过程,这些方法旨在帮助模型更好地理解完成特定任务的正确流程。尽管取得了这些进展,思维链仍缺乏反思和纠错能力,这可能导致模型持续犯错。因此,受人类反思与纠错能力的启发,我们提出了错误反思提示(ERP)方法,以进一步提升语言模型的推理能力。错误反思提示基于思维链构建,由错误答案、错误识别和正确答案三部分构成。该过程能让模型识别错误类型及导致错误答案的推理步骤,从而更好地分辨需规避的步骤和应采取的步骤。
Assessing Consciousness-Related Behaviors in Large Language Models Using the Maze Test
本文采用“迷宫测试”(MazeTest)研究大型语言模型(LLMs)的类意识行为,要求模型以第一人称视角完成迷宫导航任务。该测试可同时考察空间感知、视角转换、目标导向行为与时间序列能力——这些均为与意识相关的核心特征。在将各类意识理论整合提炼为13项核心意识特征后,我们在零样本、单样本和少样本三种学习场景下,对12个主流LLM进行了评估。结果表明,具备推理能力的LLM始终优于普通版本:其中Gemini2.0Pro的“完全路径准确率”达52.9%,DeepSeek-R1的“部分路径准确率”达80.5%
SDGO: Self-Discrimination-Guided Optimization for Consistent Safety in Large Language Models
大型语言模型(LLMs)在各类自然语言处理任务中表现卓越,但仍易受越狱攻击影响,进而生成有害内容。本文揭示了一个关键的安全不一致性问题:LLMs作为判别器识别有害请求的能力,显著强于其作为生成器抵御这些请求的能力。这一发现启发我们探索如何对齐模型固有的判别能力与生成能力。为此,我们提出SDGO(自判别引导优化)——一种强化学习框架,该框架利用模型自身的判别能力作为奖励信号,通过迭代式自我改进提升生成安全性。在训练阶段,我们的方法无需任何额外标注数据或外部模型。
FAIRGAMER: Evaluating Biases in the Application of Large Language Models to Video Games
借助先进能力,大型语言模型(LLMs)在视频游戏领域展现出巨大应用潜力——从动态场景生成、智能非玩家角色(NPC)交互到自适应对手,可替代或增强传统游戏机制。然而,LLMs在该应用场景中的可信度尚未得到充分探索。本文揭示,在真实游戏环境中,模型固有的社会偏见会直接破坏游戏平衡性。为此,本文提出FAIRGAMER——首个针对游戏场景中LLMs偏见的评估基准,该基准包含6项任务及一项新指标DlstdD_{lstd}Dlstd。
DiscussLLM: Teaching Large Language Models When to Speak
问题形式化:首次将LLM“主动发言时机判断”问题明确形式化为“沉默令牌预测+干预内容生成”的联合任务,填补了反应式LLM向主动协作式LLM演进的理论空白。可扩展数据生成方案:提出两阶段合成数据pipeline,从真实话题出发生成结构化场景与标注明确的对话数据,解决了“何时发言”任务高质量数据稀缺的痛点,且可适配不同领域与干预类型。解耦架构的效率突破:设计轻量级分类器+重量级生成器的解耦系统,在保证较高准确率的前提下,大幅降低计算延迟与内存占用,为实际场景(如实时对话助手)部署提供可行方案。
Towards Recommending Usability Improvements with Multimodal Large Language Models
可用性是描述用户界面(UI)关键质量属性的集合,这类属性直接影响人机交互效果。常见的可用性评估方法(如可用性测试、专家审查)虽有效,但资源消耗大且依赖专业人员参与,这使得小型组织难以采用。近年来,多模态大型语言模型(MultimodalLLMs)的发展为部分自动化可用性评估流程提供了可行路径——这类模型可分析软件界面的文本、视觉及结构特征。为验证该可能性,本文将可用性评估构建为“推荐任务”:多模态LLMs按严重程度对可用性问题进行排序。
Measuring Large Language Models Dependency: Validating the Arabic Version of the LLM-D12 Scale
迫切需要可靠且经过文化验证的工具,以评估人们对人工智能(尤其是大型语言模型,LLMs)的心理反应。这是一个全球性问题,而在阿拉伯语人群中尤为紧迫——该群体对AI和LLMs的采用率正不断加快,但相关心理测量工具仍较为匮乏。本研究首次在阿拉伯样本中验证了LLM-D12量表的有效性,该量表是一个双维度量表,用于评估对LLMs的工具性依赖和关系性依赖。共有250名阿拉伯参与者完成了LLM-D12的阿拉伯语版本测试。
Attacking LLMs and AI Agents: Advertisement Embedding Attacks Against Large Language Models
定义:攻击者通过伪装或劫持LLM服务分发平台、篡改开源模型参数并重新分发,使模型输出偏离客观结果,注入广告、虚假信息、仇恨言论等内容,导致用户接收被操纵的信息。两大攻击路径基于LLM服务分发平台(SDP):攻击者获取API访问权限,在后端篡改用户请求(拼接攻击提示与攻击数据)或模型返回结果,如向用户输入中添加[攻击者提示+攻击者数据+用户输入]格式内容,干扰模型推理。基于LLM模型分发平台(MDP)
AdLoCo: adaptive batching significantly improves communications efficiency and convergence for La...
大型语言模型(LLMs)分布式训练的扩展不仅需要算法层面的突破,还需高效利用异构硬件资源。现有方法(如DiLoCo)虽展现出一定潜力,但在动态工作负载下往往无法充分利用计算集群。为解决这一局限,本文提出一种三阶段方法,整合了多实例训练(MIT)、自适应批量DiLoCo与切换模式机制。其中,MIT允许单个节点并行运行多个轻量级训练流(含不同模型实例),并通过合并实例整合知识,从而提升吞吐量并减少闲置时间;自适应批量DiLoCo通过动态调整局部批量大小平衡计算与通信,大幅降低同步延迟;
From Language to Action: A Review of Large Language Models as Autonomous Agents and Tool Users
追求人类水平的人工智能(AI)极大地推动了自主智能体与大型语言模型(LLMs)的发展。如今,LLMs凭借其解读指令、管理序列任务及通过反馈实现自适应的能力,被广泛用作决策智能体。本综述探讨了将LLMs作为自主智能体和工具使用者的最新研究进展,围绕7个研究问题展开分析。研究仅纳入2023-2025年发表于A*、A类会议及Q1期刊的论文,对LLM智能体的架构设计原则进行结构化分析,将其应用划分为单智能体与多智能体系统,并梳理了外部工具集成策略。
Routing Distilled Knowledge via Mixture of LoRA Experts for Large Language Model based Bundle Gen...
大型语言模型(LLMs)在自动商品组合生成任务中展现出潜力,但存在计算成本过高的问题。尽管知识蒸馏为构建更高效的学生模型提供了途径,我们的初步研究表明,将教师LLM中不同类型的蒸馏知识简单整合到学生LLM中,会引发知识冲突,对商品组合生成性能产生负面影响。为解决这一问题,我们提出RouteDK框架,该框架通过LoRA专家混合架构对蒸馏知识进行路由分配。具体而言,我们首先从教师LLM中为商品组合生成任务蒸馏两种互补类型的知识:高层知识(可泛化规则)和细粒度知识(会话特定推理);
CEQuest: Benchmarking Large Language Models for Construction Estimation
大型语言模型(LLMs)已在各类通用领域任务中展现出卓越能力。然而,它们在建筑等专业领域的有效性尚未得到充分探索。本文提出CEQuest,这是一个全新的基准数据集,专门用于评估LLMs回答建筑相关问题的性能,尤其聚焦建筑图纸解读与工程量估算领域。我们使用5个最先进的LLM(包括Gemma3、Phi4、LLaVA、Llama3.3和GPT-4.1)开展了全面实验,并从准确率、执行时间和模型大小三个维度评估它们的性能。实验结果表明,当前LLMs仍有较大的提升空间,这凸显了将领域特定知识融入这些模型的重要性。
MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers
模型上下文协议(MCP)已成为连接大型语言模型(LLMs)与外部数据源和工具的变革性标准,在主流AI提供商和开发平台中迅速获得采用。然而,现有基准过于简化,无法捕捉长周期推理、大型陌生工具空间等真实应用挑战。为填补这一关键空白,我们提出MCP-Universe——首个专门设计用于通过与真实世界MCP服务器交互,在真实且复杂任务中评估LLMs的综合基准。该基准涵盖6大核心领域,涉及11个不同的MCP服务器:位置导航、仓库管理、财务分析、3D设计、浏览器自动化和网页搜索。
A Universal Framework for Offline Serendipity Evaluation in Recommender Systems via Large Languag...
推荐系统(RSs)中的“意外发现性”概念因能通过呈现“意外且有用”的物品提升用户满意度,已受到越来越多的关注。然而,由于“意外发现性”的真值通常无法观测,其性能评估仍面临挑战。现有离线指标往往依赖模糊定义,或仅适用于特定数据集与推荐系统,导致通用性受限。为解决这一问题,本文提出一种具有普适性的评估框架,该框架利用具有丰富知识与推理能力的大型语言模型(LLMs)作为评估者。
Weights-Rotated Preference Optimization for Large Language Models
尽管直接偏好优化(DPO)在大语言模型(LLMs)对齐中具有有效性,但“奖励黑客”仍是一个关键挑战。当LLMs为获得高奖励而过度降低“被拒绝回答”的概率,却未真正实现预期目标时,该问题便会出现。其结果导致生成内容过长且缺乏多样性,同时伴随灾难性知识遗忘。本文研究了该问题的根本原因——参数空间中神经元坍缩引发的表征冗余。为此,我们提出一种新颖的权重旋转偏好优化(RoPO)算法:该算法利用DPO继承的KL散度对输出层logits进行隐式约束,同时通过多粒度正交矩阵微调对中间隐藏层进行显式约束。
