Loading...

Evaluating Retrieval-Augmented Generation Strategies for Large Language Models in Travel Mode Cho...
准确预测出行方式选择对有效的交通规划至关重要,但传统的统计模型和机器学习模型受限于僵化的假设、有限的上下文推理能力以及较弱的泛化性。本研究探索了大语言模型(LLMs)作为一种更灵活、更具上下文感知能力的出行方式选择预测方法的潜力,并通过检索增强生成(RAG)技术,使预测结果以实证数据为支撑。我们开发了一个模块化框架,将RAG整合到基于LLM的出行方式选择预测中,并评估了四种检索策略:基础RAG、平衡检索RAG、交叉编码器重排序RAG,以及平衡检索与交叉编码器重排序结合的RAG。

Invisible Filters: Cultural Bias in Hiring Evaluations Using Large Language Models
人工智能(AI)在招聘领域的应用日益广泛,大型语言模型(LLMs)甚至有可能影响乃至决定招聘决策。然而,这引发了关于偏见、公平性与信任的迫切担忧,在多元文化背景下此类担忧尤为突出。尽管LLMs在招聘中的作用不断增强,但鲜有研究系统探讨跨文化场景下AI驱动的招聘评估所存在的潜在偏见。本研究通过系统分析,探究LLMs如何从文化与身份维度评估求职面试表现。研究采用两组面试转录文本数据集(英国求职者100份、印度求职者100份),首先考察LLM在“可雇佣性”及相关特质评分上的跨文化差异。

Confidence-Modulated Speculative Decoding for Large Language Models
推测解码已成为一种有效的自回归推理加速方法,其通过“先推测再验证”的范式实现token生成的并行化。然而,现有方法依赖固定的推测长度和刚性的验证标准,在模型不确定性变化和输入复杂度差异的场景下适应性有限。本文提出一种基于置信度调制推测的推测解码信息论框架。该方法利用编码器输出分布的熵和边际不确定性度量,在每轮迭代中动态调整推测生成的token数量。这种自适应机制减少了回滚频率、提升了资源利用率,同时保持了输出保真度。

MultiPL-MoE: Multi-Programming-Lingual Extension of Large Language Models through Hybrid Mixture-...
尽管大型语言模型(LLMs)具备出色的代码生成能力,但多编程语言代码生成任务仍极具挑战性。为解决这一问题,我们旨在在有限计算资源下,提升基础LLMs的多编程语言(MultiPL)性能,同时保留其在主流编程语言上的能力。我们将多编程语言视为多自然语言的特殊案例,提出一种基于混合专家(MoE)架构的LLMs多编程语言扩展模型——MultiPL-MoE。

Risk Assessment and Security Analysis of Large Language Models
随着大型语言模型(LLMs)在高风险应用中暴露出系统性安全挑战(包括隐私泄露、偏见放大和恶意滥用),迫切需要一套覆盖其全生命周期的动态风险评估与协同防御框架。本文聚焦大型语言模型在关键应用场景中的安全问题,例如用户数据泄露风险、恶意指令的蓄意输入以及模型偏见等。为解决这些问题,本文阐述了动态风险评估系统与分层防御体系的设计方案,该分层防御体系支持不同级别防护措施的协同工作。

Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?
多智能体辩论(MAD)已成为通过协同推理提升大型语言模型性能的极具潜力的范式。尽管近年来取得了诸多进展,但驱动MAD有效性的关键因素仍不明确。在本研究中,我们将MAD拆解为两个核心组件——多数投票与智能体间辩论,并评估它们各自的贡献。通过在7个NLP基准数据集上开展大量实验,我们发现:通常被认为是MAD带来的性能提升,绝大部分源于多数投票本身。为解释这一现象,我们提出一个将辩论建模为随机过程的理论框架,并证明该过程会在智能体的信念轨迹上诱导出鞅过程,这意味着仅靠辩论无法提升期望正确性。

CyPortQA: Benchmarking Multimodal Large Language Models for Cyclone Preparedness in Port Operation
随着热带气旋强度加剧且路径预报不确定性日益增加,美国港口在极端天气条件下面临更高的供应链风险。当热带气旋逼近时,港口运营者需快速将各类多模态预报产品(如概率风速图、路径圆锥图、官方公告)整合为清晰、可执行的指导方案。多模态大语言模型(MLLMs)为整合这些异质数据源与更广泛的背景知识提供了强大手段,但其在港口热带气旋防灾准备这一特定场景下的准确性与可靠性尚未得到严格验证。为填补这一空白,本文提出CyPortQA——首个针对热带气旋威胁下港口运营的多模态基准数据集。

Cognitive Agents Powered by Large Language Models for Agile Software Project Management
本文研究了将大型语言模型(LLMs)驱动的认知智能体整合到规模化敏捷框架(SAFe)中,以强化软件项目管理的方法。通过在仿真软件环境中部署虚拟智能体,本研究探索了其在IT项目开发中承担核心角色的潜力,从而通过智能自动化优化项目成果。研究重点关注这些智能体对敏捷方法的适应性,以及它们在决策制定、问题解决和协作动态方面的变革性影响。本研究采用CogniSim生态系统(一个旨在模拟现实世界软件工程挑战的平台),这些挑战包括技术能力与业务目标的对齐、依赖关系管理以及项目敏捷性的维持。

Ethical Considerations of Large Language Models in Game Playing
大型语言模型(LLMs)在游戏场景中展现出巨大潜力,但目前其在该场景下的伦理意义尚未得到足够关注。本研究以“狼人杀”(又称Mafia)为案例,探究并分析LLMs应用于游戏时的伦理考量。研究发现,LLMs的行为中存在性别偏见,该偏见会影响游戏公平性与玩家体验。部分角色(如守卫、狼人)对性别信息更敏感,表现为行为变化程度更高。研究进一步探究了通过姓名隐性传递性别信息的场景,结果表明,即使不存在显性性别标签,LLMs仍会表现出歧视倾向。本研究凸显了开发公平、伦理LLMs的重要性。

Should LLMs be WEIRD? Exploring WEIRDness and Human Rights in Large Language Models
大型语言模型(LLMs)的训练数据往往反映WEIRD价值观——即西方(Western)、受过教育(Educated)、工业化(Industrialized)、富裕(Rich)和民主(Democratic)群体的价值观。这引发了人们对文化偏见与公平性的担忧。本研究利用《世界价值观调查》的响应数据,对5个广泛使用的LLM(GPT-3.5、GPT-4、Llama-3、BLOOM和Qwen)进行评估,重点测量这些模型的响应与WEIRD国家价值观的对齐程度,以及是否存在与人权原则冲突的情况。

MizanQA: Benchmarking Large Language Models on Moroccan Legal Question Answering
大型语言模型(LLMs)的快速发展极大地推动了自然语言处理(NLP)领域的进步。然而,这些模型在专业的低资源领域(如阿拉伯语法律语境)中的有效性仍然有限。本文介绍了MizanQA(发音为“Mizan”,在阿拉伯语中意为“天平”,是正义的通用象征),这是一个旨在评估大型语言模型在摩洛哥法律问答(QA)任务上表现的基准。该任务具有丰富的语言和法律复杂性,其数据集融合了现代标准阿拉伯语、伊斯兰马利基法学、摩洛哥习惯法以及法国法律的影响。

Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Mo...
大型语言模型(LLMs)仍然容易受到越狱攻击的影响,这类攻击试图诱导LLMs生成有害响应。这些攻击的演变特性和多样性给防御系统带来了诸多挑战,其中包括:(1)在无需昂贵重新训练的情况下,适应并对抗新出现的攻击策略;(2)控制安全与效用之间的权衡。为解决这些挑战,本文提出了检索增强防御(RAD)——一种新型越狱检测框架。该框架将已知攻击示例数据库整合到检索增强生成(RAG)技术中,用于推断潜在的恶意用户查询以及攻击系统所使用的越狱策略。

A Survey on Large Language Model Benchmarks
近年来,随着大型语言模型(LLM)能力在深度和广度上的快速发展,各类相应的评估基准也日益增多。作为模型性能的定量评估工具,基准不仅是衡量模型能力的核心手段,也是引导模型发展方向、推动技术创新的关键要素。本文首次对大型语言模型基准的现状与发展进行系统性综述,将283个代表性基准划分为通用能力、特定领域和特定目标三大类。其中,通用能力基准涵盖语言核心、知识、推理等方面;特定领域基准聚焦自然科学、人文社会科学、工程技术等领域;特定目标基准则关注风险、可靠性、智能体等议题。

LLM Weekly(2026.8.17-2026.8.23)
AdaptyvBio和TwistBioscience独立合成并测试了这些设计:在1,320条序列中,有354条成功结合,命中率为22.6%–35.1%,而该领域常规命中率为10%–15%,且至少对六个靶点产生了高亲和力结合剂。它能同步现有GitHub仓库,而非完全替代。OpenRouter数据显示,前沿模型仅占总令牌量的16%,而六种流行的非前沿模型占据了80%的流量,其能力约为前沿模型的77%——每百万令牌成本0.50美元,而Fable5为20美元。

Consensus Is All You Need: Gossip-Based Reasoning Among Large Language Models
大型语言模型发展迅速,但没有任何一个单一模型能在所有领域都表现出色——每个模型都有其优势与劣势。我们没有仅依赖单个模型,而是从分布式系统中的流言协议(GossipProtocols)中汲取灵感:在该协议中,节点会与同伴交换信息,直至所有节点达成一致。在本研究构建的框架中,模型通过交换答案逐步推进,最终形成统一解决方案。每个大型语言模型都作为对等网络(Peer-to-PeerNetwork)中的一个节点,通过共享响应与思考过程达成集体决策。

LLM-GUARD: Large Language Model-Based Detection and Repair of Bugs and Security Vulnerabilities i...
大型语言模型(LLMs)——如ChatGPT-4、Claude3和LLaMA4——正日益融入软件/应用开发流程,支持从代码生成到调试的各类任务。然而,它们在检测多样化软件缺陷(尤其是复杂、与安全相关的漏洞)方面的实际效果,仍未得到充分探索。本研究以C++和Python语言中的基础编程错误、经典安全缺陷及生产级复杂漏洞为基准,对这三款主流LLMs开展系统性实证评估。

Ask Good Questions for Large Language Models
大型语言模型(LLMs)的最新进展显著提升了对话系统的性能,但当前方法常因无法识别用户在相关概念上的困惑,难以提供准确的主题引导。为解决这一问题,本文提出“善问(Ask-Good-Question,AGQ)框架”,该框架采用改进的“概念增强项目反应理论(CEIRT)模型”,以更好地识别用户知识水平。本文的贡献包括:将CEIRT模型与LLMs结合,基于启发文本直接生成指导性问题,大幅提升问答过程中的信息检索效率。通过与其他基线方法的对比,本文方法表现更优,显著改善了用户的信息检索体验。

The Promise of Large Language Models in Digital Health: Evidence from Sentiment Analysis in Onlin...
如今,数字健康分析面临着严峻挑战。对包含复杂情感和医疗背景的患者生成健康内容进行精细化分析,需要稀缺的领域专业知识;而在医疗场景中,传统机器学习方法又受限于数据短缺和隐私限制。在线健康社区(OHCs)便是这些挑战的典型代表,其帖子情感混杂、包含临床术语且情感表达隐含,要实现准确的情感分析(SA),必须具备专业知识。为应对这些挑战,本研究探索了大型语言模型(LLMs)如何通过上下文学习整合专家知识以开展情感分析,为复杂健康数据分析提供一种可扩展的解决方案。

Towards Scalable and Interpretable Mobile App Risk Analysis via Large Language Models
移动应用商店负责审核应用,以识别并缓解安全风险。当前的审核流程劳动密集型特征显著,依赖安全专业人员的人工分析及半自动化工具的辅助。为解决这一低效问题,本文提出系统Mars,该系统利用大型语言模型(LLMs)实现自动化风险识别与分析。Mars设计目标是在最少人工干预的情况下,同时对多个应用进行多类风险分析。为提升分析精度与运行效率,Mars借助预先构建的风险识别树,从高维应用特征中提取相关指标。这一初始步骤可对数据进行过滤,减少输入LLM的数据量,同时缓解无关特征引发的模型幻觉问题。

MLLMRec: Exploring the Potential of Multimodal Large Language Models in Recommender Systems
多模态推荐通常将用户行为数据与物品的模态特征相结合,以揭示用户偏好,相比传统推荐展现出更优的性能。然而,现有方法仍存在两个关键问题:(1)用户多模态表示的初始化方法要么未感知用户行为,要么存在噪声污染;(2)基于K近邻(KNN)构建的物品-物品图包含低相似度的噪声边,且缺乏受众共现关系。为解决这些问题,本文提出MLLMRec——一种新型的MLLM驱动多模态推荐框架,该框架包含两种物品-物品图优化策略。一方面,首先利用MLLM将物品图像转换为高质量语义描述,再将其与物品的文本元数据融合;

欢迎留下您的脚印