Loading...
问题提出:工具增强语言模型(如集成代码解释器的LLMs)虽能提升任务准确率,但即使工具选择和执行正确,模型仍可能将工具输出替代自身推理,导致解决方案看似正确却缺乏连贯论证,这种现象被定义为“工具诱导短视(TIM)”。研究设计构建基准数据集PYMATH,包含1679道竞赛级数学题,这类题目需代码辅助但无法仅靠代码完全解决,专门用于诱发和测量TIM;
A Multifaceted Analysis of Negative Bias in Large Language Models through the Lens of Parametric ...
负向偏差指大型语言模型(LLMs)在二元决策任务(如是非问答)中过度生成否定性响应的倾向。以往研究主要聚焦于检测和处理引发负向偏差的负向注意力头,但影响负向偏差的潜在详细因素仍未得到充分探索。本文中,我们证实LLMs存在格式层面的负向偏差——即提示格式对模型响应的影响大于否定性响应的语义本身。为了细粒度研究负向偏差,我们提出了一套评估集构建流程,基于模型的参数知识将数据集系统划分为三个子集:正确知识子集、错误知识子集和相关知识不足子集。
Architecting software monitors for control-flow anomaly detection through large language models a...
摘要背景:由于现代计算机系统的复杂性,确保其高可靠性变得日益具有挑战性。尽管系统在设计阶段会经过验证,但运行时行为可能存在差异,可能因"未知未知因素"导致控制流异常。目标:本文旨在通过软件监控检测控制流异常,该监控通过记录软件执行过程并识别与预期控制流的偏差来验证运行时行为。方法:提出一种结合大型语言模型(LLMs)和一致性检查的软件监控开发方法。该方法基于现有软件开发实践,在保留传统验证与确认(V&V)流程的同时,提供了额外的鲁棒性和可信度保障。
From Efficiency to Adaptivity: A Deeper Look at Adaptive Reasoning in Large Language Models
定义自适应推理:模型根据输入的难度、不确定性等特征,灵活分配推理资源(如推理深度、长度、策略)的能力——对简单任务快速响应,对复杂/陌生任务投入更多刻意推理,契合人类认知资源分配模式。形式化三大经典推理范式:在LLM语境下明确演绎推理(基于逻辑规则推导必然结论)、归纳推理(从示例中泛化隐含规则)、溯因推理(为观测结果生成合理解释)的算法实现形式。
Black-Box On-Policy Distillation of Large Language Models
黑盒蒸馏仅通过专有教师模型的文本输出来训练学生大语言模型(LLM),无需访问其内部对数概率或参数。本文提出生成对抗蒸馏(GAD),实现了策略级(on-policy)的黑盒蒸馏。GAD将学生LLM视为生成器,训练判别器区分其响应与教师LLM的响应,构建极小极大博弈。判别器作为与学生协同进化的策略级奖励模型,提供稳定、自适应的反馈。实验结果表明,GAD持续优于常用的序列级知识蒸馏方法。
Exploring State Tracking Capabilities of Large Language Models
大型语言模型(LLMs)在解决复杂任务(包括需要一定推理能力的任务)方面展现出了令人瞩目的性能。本文聚焦状态跟踪问题——即模型需要跟踪多个实体的主导状态。为将状态跟踪组件与其他因素分离,我们基于三个定义明确的状态跟踪任务提出了一个基准测试,并分析了LLMs在不同场景下的表现。结果表明,新一代LLMs(特别是GPT-4和Llama3)具备状态跟踪能力,尤其是在集成思维链(ChainofThought)等机制时表现更为突出。然而,旧代模型虽然能够理解任务并在初始阶段解决问题,但在经过一定步骤后往往会失败。
Scaling Open-Weight Large Language Models for Hydropower Regulatory Information Extraction: A Sys...
信息提取从监管文档中使用大型语言模型时,在性能与计算资源之间存在关键权衡。我们在水电许可文档上评估了7个开源模型(参数规模0.6B-70B),以提供实证性部署指导。分析发现了一个显著的14B参数阈值:低于该阈值时验证方法无效(F1
W2S-AlignTree: Weak-to-Strong Inference-Time Alignment for Large Language Models via Monte Carlo ...
大语言模型(LLMs)展现出令人瞩目的能力,但由于弱监督的不足和缺乏细粒度控制,其输出往往与人类偏好存在偏差。基于人类反馈的强化学习(RLHF)等训练时对齐方法面临高昂的专家监督成本和固有的可扩展性限制,在推理阶段提供的动态控制有限。因此,迫切需要一种可扩展且适应性强的对齐机制。为解决这一问题,我们提出W2S-AlignTree——首个将蒙特卡洛树搜索(MCTS)与弱到强泛化范式协同结合的插件式推理时对齐框架。W2S-AlignTree将LLM对齐表述为生成搜索树内的最优启发式搜索问题。
Additive Large Language Models for Semi-Structured Text
该研究针对大型语言模型(LLM)在临床文本分类中预测不透明的问题,提出了一种具有内在可解释性的框架研究背景:现有LLM在医疗风险预测、诊断支持等临床任务中表现出色,但缺乏可解释性,无法让医生了解预测结果的关键驱动因素,限制了其在临床场景的实际应用;而传统可解释模型(如规则-based评分)虽透明但性能有限,且难以捕捉临床文本中的丰富语义信息。核心设计。
LLMLagBench: Identifying Temporal Training Boundaries in Large Language Models
大型语言模型(LLMs)的预训练基于特定时间截止点前的文本数据,这形成了严格的知识边界——超出该边界后,模型若不查询外部来源则无法提供准确信息。更隐蔽的是,当这一限制未被知晓或忽视时,LLMs在推理任务中可能无意中将过时的时间敏感信息与通用知识混合,进而影响响应准确性。本文提出LLMLagBench,一款LLM时效性基准测试工具,通过评估模型对近期事件的知识掌握情况,为识别LLM训练数据的最早可能时间边界提供系统化方法。我们将该基准应用于多款LLM的评估,包括明确声明和未声明训练截止日期的模型。
OAD-Promoter: Enhancing Zero-shot VQA using Large Language Models with Object Attribute Description
大语言模型(LLMs)已成为视觉问答(VQA)中处理少样本或零样本场景下知识密集型问题的关键工具。然而,它们对大规模训练数据集的依赖使其在知识获取过程中不可避免地继承了语言偏见。这一局限性给现有方法带来两大核心约束:(1)LLMs因利用偏见导致预测结果可靠性下降;(2)尽管具备强大的知识推理能力,LLMs在分布外(OOD)泛化任务中仍面临挑战。为解决这些问题,我们提出了目标属性描述促进器(OAD-Promoter),一种通过缓解语言偏见和提升领域迁移鲁棒性来增强基于LLM的VQA性能的新方法。
Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models
该研究聚焦于推理型文本到视频检索(reasoningtext-to-videoretrieval)这一新兴任务,核心解决传统文本到视频检索无法处理隐含查询(需推理才能理解)和缺乏目标对象级定位的问题。任务定义:区别于传统显式查询(直接描述视觉内容),推理型文本到视频检索需处理隐含查询(涉及抽象语义、空间/时间关系等推理),同时返回满足查询条件的视频及对应目标对象的分割掩码(object-levelgroundingmasks)。核心挑战。
STaR: Towards Cognitive Table Reasoning via Slow-Thinking Large Language Models
表格推理是构建能够理解和分析结构化数据的智能系统的基础路径。尽管近年来大型语言模型(LLMs)在该领域取得了一定进展,但仍存在两大关键局限:(1)推理过程缺乏人类认知特有的深度和迭代优化特性;(2)推理过程存在不稳定性,影响下游应用的可靠性。本文提出STaR(Slow-ThinkingforTableReasoning)框架,旨在实现认知型表格推理——通过显式建模逐步推理过程和不确定性感知推理,为LLMs赋予慢思考能力。
Evaluating Large Language Models on Rare Disease Diagnosis: A Case Study using House M.D
研究背景:LLMs在多领域展现出强大能力,但在基于叙事性医学案例的罕见病诊断方面研究不足;现有医学数据集存在隐私限制、缺乏叙事驱动的诊断结构、规模有限等问题,而《豪斯医生》作为经医学教育验证的剧集,其叙事化病例可弥补这一缺口。数据集构建:从《豪斯医生》8季176集的公开维基内容中提取症状-诊断配对,经网页爬取、标准化病例转换、质量过滤三步流程,最终形成176个覆盖多医学专科、需多步推理的复杂病例数据集,且该数据集公开可获取。研究方法。
Simulating Misinformation Propagation in Social Networks using Large Language Models
社交媒体上的虚假信息借助惊奇感、情感共鸣和身份导向推理滋生蔓延,并常通过人类认知偏见被放大。为探究这些机制,本研究将大型语言模型(LLM)人格化为合成代理,模拟用户层面的偏见、意识形态倾向和信任启发式思维。在此框架下,我们引入“审计节点”体系,用于模拟和分析虚假信息在这类代理网络中传播时的演变过程。新闻文章在受人格条件约束的LLM节点网络中传播,每个节点会对接收的内容进行改写。随后,基于问答(QA)的审计器会在每个传播步骤中衡量事实保真度,实现对虚假信息失真的可解释、基于主张层面的追踪。
SAID: Empowering Large Language Models with Self-Activating Internal Defense
尽管大型语言模型(LLMs)在安全对齐方面取得了进展,但它们仍然容易受到旨在规避保护机制的越狱攻击。主流防御策略依赖外部干预(如输入过滤或输出修改),这些方法通常缺乏泛化能力,在损害模型可用性的同时还会产生显著的计算开销。在本研究中,我们提出了一种全新的无需训练的防御范式——自激活内部防御(SAID),该范式将防御任务从外部修正重构为内部能力激活。
Subnational Geocoding of Global Disasters Using Large Language Models
该研究聚焦全球灾害数据的国家级以下地理编码问题,针对EM-DAT等灾害数据库中位置信息多为非结构化文本、粒度不一致、拼写不规范等痛点,提出了一种基于大型语言模型(LLM)的全自动地理编码工作流。核心流程包括四步:1)利用GPT-4o解析EM-DAT中的自由文本位置信息,转化为层级化JSON结构(区分Admin1/2/3三级行政单位);2)通过GADM、OpenStreetMap、Wikidata三个独立地理信息源并行地理编码,生成候选几何图形;
Leveraging the Power of Large Language Models in Entity Linking via Adaptive Routing and Targeted...
实体链接(EL)传统上依赖大规模标注数据集和大量模型微调。尽管近年来的少样本方法通过提示工程利用大语言模型(LLMs)降低了训练需求,但由于基于LLM的推理成本高昂,这些方法往往存在效率问题。ARTER(自适应路由与目标实体推理)提出了一种结构化流水线,通过策略性组合候选生成、基于上下文的评分、自适应路由和选择性推理,在无需深度微调的情况下实现了高性能。ARTER对检索到的候选实体计算一组小型互补信号(包括嵌入特征和基于LLM的特征),将上下文提及划分为简单案例和复杂案例。
SSR: Socratic Self-Refine for Large Language Model Reasoning
大语言模型(LLMs)已展现出卓越的推理能力,但现有测试时框架往往依赖粗糙的自我验证和自我修正,限制了其在复杂任务上的效果。本文提出苏格拉底式自我优化(SSR),这是一种用于LLM推理细粒度评估和精准优化的新型框架。我们提出的SSR将模型响应分解为可验证的(子问题、子答案)对,通过受控重解和自一致性校验实现步骤级置信度评估。通过定位不可靠步骤并迭代优化,SSR能生成更准确、更具可解释性的推理链。在5个推理基准和3种LLM上的实证结果表明,SSR持续优于最先进的迭代自我优化基线。
LLM-as-a-Grader: Practical Insights from Large Language Model for Short-Answer and Report Evaluation
研究数据:收集约50名学生的5次简答题测验(共258份作答,每题侧重概念理解而非字面匹配,采用0.1分梯度计分),以及14个团队的项目报告(5-8页标准化结构,含摘要、方法、结果等8个评分模块)。研究方法:开发开源评分工具包LLM-as-a-Grader,通过Python脚本调用GPT-4oAPI,结合固定评分规则(如测验参考标准答案、报告遵循详细评分准则)进行自动评分;设置固定模型参数(温度0.0、top-p1.0)保证结果可复现,并由2名博士生担任人工评分员进行对比验证。核心结果。
