Loading...
追求人类水平的人工智能(AI)极大地推动了自主智能体与大型语言模型(LLMs)的发展。如今,LLMs凭借其解读指令、管理序列任务及通过反馈实现自适应的能力,被广泛用作决策智能体。本综述探讨了将LLMs作为自主智能体和工具使用者的最新研究进展,围绕7个研究问题展开分析。研究仅纳入2023-2025年发表于A*、A类会议及Q1期刊的论文,对LLM智能体的架构设计原则进行结构化分析,将其应用划分为单智能体与多智能体系统,并梳理了外部工具集成策略。
Routing Distilled Knowledge via Mixture of LoRA Experts for Large Language Model based Bundle Gen...
大型语言模型(LLMs)在自动商品组合生成任务中展现出潜力,但存在计算成本过高的问题。尽管知识蒸馏为构建更高效的学生模型提供了途径,我们的初步研究表明,将教师LLM中不同类型的蒸馏知识简单整合到学生LLM中,会引发知识冲突,对商品组合生成性能产生负面影响。为解决这一问题,我们提出RouteDK框架,该框架通过LoRA专家混合架构对蒸馏知识进行路由分配。具体而言,我们首先从教师LLM中为商品组合生成任务蒸馏两种互补类型的知识:高层知识(可泛化规则)和细粒度知识(会话特定推理);
CEQuest: Benchmarking Large Language Models for Construction Estimation
大型语言模型(LLMs)已在各类通用领域任务中展现出卓越能力。然而,它们在建筑等专业领域的有效性尚未得到充分探索。本文提出CEQuest,这是一个全新的基准数据集,专门用于评估LLMs回答建筑相关问题的性能,尤其聚焦建筑图纸解读与工程量估算领域。我们使用5个最先进的LLM(包括Gemma3、Phi4、LLaVA、Llama3.3和GPT-4.1)开展了全面实验,并从准确率、执行时间和模型大小三个维度评估它们的性能。实验结果表明,当前LLMs仍有较大的提升空间,这凸显了将领域特定知识融入这些模型的重要性。
MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers
模型上下文协议(MCP)已成为连接大型语言模型(LLMs)与外部数据源和工具的变革性标准,在主流AI提供商和开发平台中迅速获得采用。然而,现有基准过于简化,无法捕捉长周期推理、大型陌生工具空间等真实应用挑战。为填补这一关键空白,我们提出MCP-Universe——首个专门设计用于通过与真实世界MCP服务器交互,在真实且复杂任务中评估LLMs的综合基准。该基准涵盖6大核心领域,涉及11个不同的MCP服务器:位置导航、仓库管理、财务分析、3D设计、浏览器自动化和网页搜索。
A Universal Framework for Offline Serendipity Evaluation in Recommender Systems via Large Languag...
推荐系统(RSs)中的“意外发现性”概念因能通过呈现“意外且有用”的物品提升用户满意度,已受到越来越多的关注。然而,由于“意外发现性”的真值通常无法观测,其性能评估仍面临挑战。现有离线指标往往依赖模糊定义,或仅适用于特定数据集与推荐系统,导致通用性受限。为解决这一问题,本文提出一种具有普适性的评估框架,该框架利用具有丰富知识与推理能力的大型语言模型(LLMs)作为评估者。
Weights-Rotated Preference Optimization for Large Language Models
尽管直接偏好优化(DPO)在大语言模型(LLMs)对齐中具有有效性,但“奖励黑客”仍是一个关键挑战。当LLMs为获得高奖励而过度降低“被拒绝回答”的概率,却未真正实现预期目标时,该问题便会出现。其结果导致生成内容过长且缺乏多样性,同时伴随灾难性知识遗忘。本文研究了该问题的根本原因——参数空间中神经元坍缩引发的表征冗余。为此,我们提出一种新颖的权重旋转偏好优化(RoPO)算法:该算法利用DPO继承的KL散度对输出层logits进行隐式约束,同时通过多粒度正交矩阵微调对中间隐藏层进行显式约束。
Demographic Biases and Gaps in the Perception of Sexism in Large Language Models
大型语言模型(LLMs)已被证实可作为自动检测性别歧视的工具。以往研究表明,这些模型存在无法准确反映现实的偏差,对少数群体而言尤为明显。尽管各方已采取多种措施改进性别歧视内容检测,但由于该任务本身具有主观性,且自动化模型存在偏差,检测工作仍面临重大挑战。本研究利用EXIST2024推文数据集,探究不同LLMs检测社交媒体文本中性别歧视的能力。该数据集为每条推文提供6类人群标注,使我们能够评估LLMs在多大程度上可模拟这些人群在性别歧视检测中的认知。
LLM-as-classifier: Semi-Supervised, Iterative Framework for Hierarchical Text Classification usin...
大语言模型(LLMs)的出现为非结构化文本数据分析提供了前所未有的能力。然而,在生产环境中部署这些模型作为可靠、稳健且可扩展的分类器,面临着重大的方法学挑战。标准的微调方法不仅资源消耗大,还难以应对现实世界中常见的动态数据分布变化,这在工业界是普遍存在的问题。本文提出了一个全面的半监督框架,该框架利用LLMs的零样本和少样本能力构建层级文本分类器,以此解决这些行业性挑战。我们的方法强调“人类在环”的迭代过程,从领域知识提取开始,逐步推进至提示词优化、层级扩展和多维度验证。
Unveiling the Latent Directions of Reflection in Large Language Models
反思能力是大型语言模型(LLMs)评估并修正自身推理过程的核心能力,已被广泛用于提升复杂推理任务的性能。然而,以往大多数研究都侧重于设计反思提示策略或强化学习目标,对反思的内在机制探索不足。本文从模型激活潜在方向的视角研究反思机制,提出一种基于激活导向的方法,用于刻画具有不同反思意图(无反思、内在反思、触发反思)的指令特征。通过构建不同反思层级间的导向向量,我们证明:(1)可系统化识别新的反思诱导指令;(2)通过激活干预可直接增强或抑制反思行为;(3)抑制反思比诱导反思容易得多。
Towards Alignment-Centric Paradigm: A Survey of Instruction Tuning in Large Language Models
指令微调是一项关键技术,可使大型语言模型(LLMs)与人类意图、安全约束及特定领域需求保持对齐。本综述对指令微调的完整流程进行了全面概述,涵盖(1)数据收集方法、(2)全参数微调与参数高效微调策略,以及(3)评估协议。我们将数据集构建划分为三大范式:专家标注、基于大型模型的蒸馏生成以及自改进机制,每种范式在质量、可扩展性和资源成本方面均具有独特的权衡关系。微调技术涵盖从传统监督训练到轻量级方法(如低秩适配(LoRA)和前缀微调),重点关注计算效率与模型可复用性。
Evaluating Retrieval-Augmented Generation Strategies for Large Language Models in Travel Mode Cho...
准确预测出行方式选择对有效的交通规划至关重要,但传统的统计模型和机器学习模型受限于僵化的假设、有限的上下文推理能力以及较弱的泛化性。本研究探索了大语言模型(LLMs)作为一种更灵活、更具上下文感知能力的出行方式选择预测方法的潜力,并通过检索增强生成(RAG)技术,使预测结果以实证数据为支撑。我们开发了一个模块化框架,将RAG整合到基于LLM的出行方式选择预测中,并评估了四种检索策略:基础RAG、平衡检索RAG、交叉编码器重排序RAG,以及平衡检索与交叉编码器重排序结合的RAG。
Invisible Filters: Cultural Bias in Hiring Evaluations Using Large Language Models
人工智能(AI)在招聘领域的应用日益广泛,大型语言模型(LLMs)甚至有可能影响乃至决定招聘决策。然而,这引发了关于偏见、公平性与信任的迫切担忧,在多元文化背景下此类担忧尤为突出。尽管LLMs在招聘中的作用不断增强,但鲜有研究系统探讨跨文化场景下AI驱动的招聘评估所存在的潜在偏见。本研究通过系统分析,探究LLMs如何从文化与身份维度评估求职面试表现。研究采用两组面试转录文本数据集(英国求职者100份、印度求职者100份),首先考察LLM在“可雇佣性”及相关特质评分上的跨文化差异。
Confidence-Modulated Speculative Decoding for Large Language Models
推测解码已成为一种有效的自回归推理加速方法,其通过“先推测再验证”的范式实现token生成的并行化。然而,现有方法依赖固定的推测长度和刚性的验证标准,在模型不确定性变化和输入复杂度差异的场景下适应性有限。本文提出一种基于置信度调制推测的推测解码信息论框架。该方法利用编码器输出分布的熵和边际不确定性度量,在每轮迭代中动态调整推测生成的token数量。这种自适应机制减少了回滚频率、提升了资源利用率,同时保持了输出保真度。
MultiPL-MoE: Multi-Programming-Lingual Extension of Large Language Models through Hybrid Mixture-...
尽管大型语言模型(LLMs)具备出色的代码生成能力,但多编程语言代码生成任务仍极具挑战性。为解决这一问题,我们旨在在有限计算资源下,提升基础LLMs的多编程语言(MultiPL)性能,同时保留其在主流编程语言上的能力。我们将多编程语言视为多自然语言的特殊案例,提出一种基于混合专家(MoE)架构的LLMs多编程语言扩展模型——MultiPL-MoE。
Risk Assessment and Security Analysis of Large Language Models
随着大型语言模型(LLMs)在高风险应用中暴露出系统性安全挑战(包括隐私泄露、偏见放大和恶意滥用),迫切需要一套覆盖其全生命周期的动态风险评估与协同防御框架。本文聚焦大型语言模型在关键应用场景中的安全问题,例如用户数据泄露风险、恶意指令的蓄意输入以及模型偏见等。为解决这些问题,本文阐述了动态风险评估系统与分层防御体系的设计方案,该分层防御体系支持不同级别防护措施的协同工作。
Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?
多智能体辩论(MAD)已成为通过协同推理提升大型语言模型性能的极具潜力的范式。尽管近年来取得了诸多进展,但驱动MAD有效性的关键因素仍不明确。在本研究中,我们将MAD拆解为两个核心组件——多数投票与智能体间辩论,并评估它们各自的贡献。通过在7个NLP基准数据集上开展大量实验,我们发现:通常被认为是MAD带来的性能提升,绝大部分源于多数投票本身。为解释这一现象,我们提出一个将辩论建模为随机过程的理论框架,并证明该过程会在智能体的信念轨迹上诱导出鞅过程,这意味着仅靠辩论无法提升期望正确性。
CyPortQA: Benchmarking Multimodal Large Language Models for Cyclone Preparedness in Port Operation
随着热带气旋强度加剧且路径预报不确定性日益增加,美国港口在极端天气条件下面临更高的供应链风险。当热带气旋逼近时,港口运营者需快速将各类多模态预报产品(如概率风速图、路径圆锥图、官方公告)整合为清晰、可执行的指导方案。多模态大语言模型(MLLMs)为整合这些异质数据源与更广泛的背景知识提供了强大手段,但其在港口热带气旋防灾准备这一特定场景下的准确性与可靠性尚未得到严格验证。为填补这一空白,本文提出CyPortQA——首个针对热带气旋威胁下港口运营的多模态基准数据集。
Cognitive Agents Powered by Large Language Models for Agile Software Project Management
本文研究了将大型语言模型(LLMs)驱动的认知智能体整合到规模化敏捷框架(SAFe)中,以强化软件项目管理的方法。通过在仿真软件环境中部署虚拟智能体,本研究探索了其在IT项目开发中承担核心角色的潜力,从而通过智能自动化优化项目成果。研究重点关注这些智能体对敏捷方法的适应性,以及它们在决策制定、问题解决和协作动态方面的变革性影响。本研究采用CogniSim生态系统(一个旨在模拟现实世界软件工程挑战的平台),这些挑战包括技术能力与业务目标的对齐、依赖关系管理以及项目敏捷性的维持。
Ethical Considerations of Large Language Models in Game Playing
大型语言模型(LLMs)在游戏场景中展现出巨大潜力,但目前其在该场景下的伦理意义尚未得到足够关注。本研究以“狼人杀”(又称Mafia)为案例,探究并分析LLMs应用于游戏时的伦理考量。研究发现,LLMs的行为中存在性别偏见,该偏见会影响游戏公平性与玩家体验。部分角色(如守卫、狼人)对性别信息更敏感,表现为行为变化程度更高。研究进一步探究了通过姓名隐性传递性别信息的场景,结果表明,即使不存在显性性别标签,LLMs仍会表现出歧视倾向。本研究凸显了开发公平、伦理LLMs的重要性。
Should LLMs be WEIRD? Exploring WEIRDness and Human Rights in Large Language Models
大型语言模型(LLMs)的训练数据往往反映WEIRD价值观——即西方(Western)、受过教育(Educated)、工业化(Industrialized)、富裕(Rich)和民主(Democratic)群体的价值观。这引发了人们对文化偏见与公平性的担忧。本研究利用《世界价值观调查》的响应数据,对5个广泛使用的LLM(GPT-3.5、GPT-4、Llama-3、BLOOM和Qwen)进行评估,重点测量这些模型的响应与WEIRD国家价值观的对齐程度,以及是否存在与人权原则冲突的情况。
