Loading...
推荐系统(RSs)中的“意外发现性”概念因能通过呈现“意外且有用”的物品提升用户满意度,已受到越来越多的关注。然而,由于“意外发现性”的真值通常无法观测,其性能评估仍面临挑战。现有离线指标往往依赖模糊定义,或仅适用于特定数据集与推荐系统,导致通用性受限。为解决这一问题,本文提出一种具有普适性的评估框架,该框架利用具有丰富知识与推理能力的大型语言模型(LLMs)作为评估者。
Weights-Rotated Preference Optimization for Large Language Models
尽管直接偏好优化(DPO)在大语言模型(LLMs)对齐中具有有效性,但“奖励黑客”仍是一个关键挑战。当LLMs为获得高奖励而过度降低“被拒绝回答”的概率,却未真正实现预期目标时,该问题便会出现。其结果导致生成内容过长且缺乏多样性,同时伴随灾难性知识遗忘。本文研究了该问题的根本原因——参数空间中神经元坍缩引发的表征冗余。为此,我们提出一种新颖的权重旋转偏好优化(RoPO)算法:该算法利用DPO继承的KL散度对输出层logits进行隐式约束,同时通过多粒度正交矩阵微调对中间隐藏层进行显式约束。
Demographic Biases and Gaps in the Perception of Sexism in Large Language Models
大型语言模型(LLMs)已被证实可作为自动检测性别歧视的工具。以往研究表明,这些模型存在无法准确反映现实的偏差,对少数群体而言尤为明显。尽管各方已采取多种措施改进性别歧视内容检测,但由于该任务本身具有主观性,且自动化模型存在偏差,检测工作仍面临重大挑战。本研究利用EXIST2024推文数据集,探究不同LLMs检测社交媒体文本中性别歧视的能力。该数据集为每条推文提供6类人群标注,使我们能够评估LLMs在多大程度上可模拟这些人群在性别歧视检测中的认知。
LLM-as-classifier: Semi-Supervised, Iterative Framework for Hierarchical Text Classification usin...
大语言模型(LLMs)的出现为非结构化文本数据分析提供了前所未有的能力。然而,在生产环境中部署这些模型作为可靠、稳健且可扩展的分类器,面临着重大的方法学挑战。标准的微调方法不仅资源消耗大,还难以应对现实世界中常见的动态数据分布变化,这在工业界是普遍存在的问题。本文提出了一个全面的半监督框架,该框架利用LLMs的零样本和少样本能力构建层级文本分类器,以此解决这些行业性挑战。我们的方法强调“人类在环”的迭代过程,从领域知识提取开始,逐步推进至提示词优化、层级扩展和多维度验证。
Unveiling the Latent Directions of Reflection in Large Language Models
反思能力是大型语言模型(LLMs)评估并修正自身推理过程的核心能力,已被广泛用于提升复杂推理任务的性能。然而,以往大多数研究都侧重于设计反思提示策略或强化学习目标,对反思的内在机制探索不足。本文从模型激活潜在方向的视角研究反思机制,提出一种基于激活导向的方法,用于刻画具有不同反思意图(无反思、内在反思、触发反思)的指令特征。通过构建不同反思层级间的导向向量,我们证明:(1)可系统化识别新的反思诱导指令;(2)通过激活干预可直接增强或抑制反思行为;(3)抑制反思比诱导反思容易得多。
Towards Alignment-Centric Paradigm: A Survey of Instruction Tuning in Large Language Models
指令微调是一项关键技术,可使大型语言模型(LLMs)与人类意图、安全约束及特定领域需求保持对齐。本综述对指令微调的完整流程进行了全面概述,涵盖(1)数据收集方法、(2)全参数微调与参数高效微调策略,以及(3)评估协议。我们将数据集构建划分为三大范式:专家标注、基于大型模型的蒸馏生成以及自改进机制,每种范式在质量、可扩展性和资源成本方面均具有独特的权衡关系。微调技术涵盖从传统监督训练到轻量级方法(如低秩适配(LoRA)和前缀微调),重点关注计算效率与模型可复用性。
Evaluating Retrieval-Augmented Generation Strategies for Large Language Models in Travel Mode Cho...
准确预测出行方式选择对有效的交通规划至关重要,但传统的统计模型和机器学习模型受限于僵化的假设、有限的上下文推理能力以及较弱的泛化性。本研究探索了大语言模型(LLMs)作为一种更灵活、更具上下文感知能力的出行方式选择预测方法的潜力,并通过检索增强生成(RAG)技术,使预测结果以实证数据为支撑。我们开发了一个模块化框架,将RAG整合到基于LLM的出行方式选择预测中,并评估了四种检索策略:基础RAG、平衡检索RAG、交叉编码器重排序RAG,以及平衡检索与交叉编码器重排序结合的RAG。
Invisible Filters: Cultural Bias in Hiring Evaluations Using Large Language Models
人工智能(AI)在招聘领域的应用日益广泛,大型语言模型(LLMs)甚至有可能影响乃至决定招聘决策。然而,这引发了关于偏见、公平性与信任的迫切担忧,在多元文化背景下此类担忧尤为突出。尽管LLMs在招聘中的作用不断增强,但鲜有研究系统探讨跨文化场景下AI驱动的招聘评估所存在的潜在偏见。本研究通过系统分析,探究LLMs如何从文化与身份维度评估求职面试表现。研究采用两组面试转录文本数据集(英国求职者100份、印度求职者100份),首先考察LLM在“可雇佣性”及相关特质评分上的跨文化差异。
Confidence-Modulated Speculative Decoding for Large Language Models
推测解码已成为一种有效的自回归推理加速方法,其通过“先推测再验证”的范式实现token生成的并行化。然而,现有方法依赖固定的推测长度和刚性的验证标准,在模型不确定性变化和输入复杂度差异的场景下适应性有限。本文提出一种基于置信度调制推测的推测解码信息论框架。该方法利用编码器输出分布的熵和边际不确定性度量,在每轮迭代中动态调整推测生成的token数量。这种自适应机制减少了回滚频率、提升了资源利用率,同时保持了输出保真度。
MultiPL-MoE: Multi-Programming-Lingual Extension of Large Language Models through Hybrid Mixture-...
尽管大型语言模型(LLMs)具备出色的代码生成能力,但多编程语言代码生成任务仍极具挑战性。为解决这一问题,我们旨在在有限计算资源下,提升基础LLMs的多编程语言(MultiPL)性能,同时保留其在主流编程语言上的能力。我们将多编程语言视为多自然语言的特殊案例,提出一种基于混合专家(MoE)架构的LLMs多编程语言扩展模型——MultiPL-MoE。
Risk Assessment and Security Analysis of Large Language Models
随着大型语言模型(LLMs)在高风险应用中暴露出系统性安全挑战(包括隐私泄露、偏见放大和恶意滥用),迫切需要一套覆盖其全生命周期的动态风险评估与协同防御框架。本文聚焦大型语言模型在关键应用场景中的安全问题,例如用户数据泄露风险、恶意指令的蓄意输入以及模型偏见等。为解决这些问题,本文阐述了动态风险评估系统与分层防御体系的设计方案,该分层防御体系支持不同级别防护措施的协同工作。
Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?
多智能体辩论(MAD)已成为通过协同推理提升大型语言模型性能的极具潜力的范式。尽管近年来取得了诸多进展,但驱动MAD有效性的关键因素仍不明确。在本研究中,我们将MAD拆解为两个核心组件——多数投票与智能体间辩论,并评估它们各自的贡献。通过在7个NLP基准数据集上开展大量实验,我们发现:通常被认为是MAD带来的性能提升,绝大部分源于多数投票本身。为解释这一现象,我们提出一个将辩论建模为随机过程的理论框架,并证明该过程会在智能体的信念轨迹上诱导出鞅过程,这意味着仅靠辩论无法提升期望正确性。
CyPortQA: Benchmarking Multimodal Large Language Models for Cyclone Preparedness in Port Operation
随着热带气旋强度加剧且路径预报不确定性日益增加,美国港口在极端天气条件下面临更高的供应链风险。当热带气旋逼近时,港口运营者需快速将各类多模态预报产品(如概率风速图、路径圆锥图、官方公告)整合为清晰、可执行的指导方案。多模态大语言模型(MLLMs)为整合这些异质数据源与更广泛的背景知识提供了强大手段,但其在港口热带气旋防灾准备这一特定场景下的准确性与可靠性尚未得到严格验证。为填补这一空白,本文提出CyPortQA——首个针对热带气旋威胁下港口运营的多模态基准数据集。
Cognitive Agents Powered by Large Language Models for Agile Software Project Management
本文研究了将大型语言模型(LLMs)驱动的认知智能体整合到规模化敏捷框架(SAFe)中,以强化软件项目管理的方法。通过在仿真软件环境中部署虚拟智能体,本研究探索了其在IT项目开发中承担核心角色的潜力,从而通过智能自动化优化项目成果。研究重点关注这些智能体对敏捷方法的适应性,以及它们在决策制定、问题解决和协作动态方面的变革性影响。本研究采用CogniSim生态系统(一个旨在模拟现实世界软件工程挑战的平台),这些挑战包括技术能力与业务目标的对齐、依赖关系管理以及项目敏捷性的维持。
Ethical Considerations of Large Language Models in Game Playing
大型语言模型(LLMs)在游戏场景中展现出巨大潜力,但目前其在该场景下的伦理意义尚未得到足够关注。本研究以“狼人杀”(又称Mafia)为案例,探究并分析LLMs应用于游戏时的伦理考量。研究发现,LLMs的行为中存在性别偏见,该偏见会影响游戏公平性与玩家体验。部分角色(如守卫、狼人)对性别信息更敏感,表现为行为变化程度更高。研究进一步探究了通过姓名隐性传递性别信息的场景,结果表明,即使不存在显性性别标签,LLMs仍会表现出歧视倾向。本研究凸显了开发公平、伦理LLMs的重要性。
Should LLMs be WEIRD? Exploring WEIRDness and Human Rights in Large Language Models
大型语言模型(LLMs)的训练数据往往反映WEIRD价值观——即西方(Western)、受过教育(Educated)、工业化(Industrialized)、富裕(Rich)和民主(Democratic)群体的价值观。这引发了人们对文化偏见与公平性的担忧。本研究利用《世界价值观调查》的响应数据,对5个广泛使用的LLM(GPT-3.5、GPT-4、Llama-3、BLOOM和Qwen)进行评估,重点测量这些模型的响应与WEIRD国家价值观的对齐程度,以及是否存在与人权原则冲突的情况。
MizanQA: Benchmarking Large Language Models on Moroccan Legal Question Answering
大型语言模型(LLMs)的快速发展极大地推动了自然语言处理(NLP)领域的进步。然而,这些模型在专业的低资源领域(如阿拉伯语法律语境)中的有效性仍然有限。本文介绍了MizanQA(发音为“Mizan”,在阿拉伯语中意为“天平”,是正义的通用象征),这是一个旨在评估大型语言模型在摩洛哥法律问答(QA)任务上表现的基准。该任务具有丰富的语言和法律复杂性,其数据集融合了现代标准阿拉伯语、伊斯兰马利基法学、摩洛哥习惯法以及法国法律的影响。
Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Mo...
大型语言模型(LLMs)仍然容易受到越狱攻击的影响,这类攻击试图诱导LLMs生成有害响应。这些攻击的演变特性和多样性给防御系统带来了诸多挑战,其中包括:(1)在无需昂贵重新训练的情况下,适应并对抗新出现的攻击策略;(2)控制安全与效用之间的权衡。为解决这些挑战,本文提出了检索增强防御(RAD)——一种新型越狱检测框架。该框架将已知攻击示例数据库整合到检索增强生成(RAG)技术中,用于推断潜在的恶意用户查询以及攻击系统所使用的越狱策略。
A Survey on Large Language Model Benchmarks
近年来,随着大型语言模型(LLM)能力在深度和广度上的快速发展,各类相应的评估基准也日益增多。作为模型性能的定量评估工具,基准不仅是衡量模型能力的核心手段,也是引导模型发展方向、推动技术创新的关键要素。本文首次对大型语言模型基准的现状与发展进行系统性综述,将283个代表性基准划分为通用能力、特定领域和特定目标三大类。其中,通用能力基准涵盖语言核心、知识、推理等方面;特定领域基准聚焦自然科学、人文社会科学、工程技术等领域;特定目标基准则关注风险、可靠性、智能体等议题。
LLM Weekly(2026.8.17-2026.8.23)
AdaptyvBio和TwistBioscience独立合成并测试了这些设计:在1,320条序列中,有354条成功结合,命中率为22.6%–35.1%,而该领域常规命中率为10%–15%,且至少对六个靶点产生了高亲和力结合剂。它能同步现有GitHub仓库,而非完全替代。OpenRouter数据显示,前沿模型仅占总令牌量的16%,而六种流行的非前沿模型占据了80%的流量,其能力约为前沿模型的77%——每百万令牌成本0.50美元,而Fable5为20美元。
