Loading...
本文针对现有大语言模型(LLM)评估多侧重通用能力、忽视跨领域事实准确性与知识校准的问题,提出了AA-Omniscience基准,用于衡量模型的事实召回能力和知识校准水平。基准设计核心涵盖6个经济相关领域(商业、人文社科、健康、法律、软件工程、科学工程与数学)、42个细分主题,共6000道问题,源自权威学术和行业来源。采用全知指数(OmniscienceIndex)作为核心指标(范围-100至100),奖励正确答案、惩罚幻觉输出、鼓励不确定时弃权,0分代表正确与错误答案数量持平。
MM-Telco: Benchmarks and Multimodal Large Language Models for Telecom Applications
大语言模型(LLMs)已成为自动化复杂推理和决策任务的强大工具。在电信领域,它们有望实现网络优化转型、自动化故障排查、提升客户支持质量并确保合规性。然而,由于电信领域存在特定挑战,需要专用适配方案,LLMs的部署受到阻碍。为克服这些挑战并加速LLMs在电信领域的适配,我们提出MM-Telco——一套全面的多模态基准测试套件与模型,专为电信领域量身定制。该基准包含多种文本和图像类任务,覆盖网络运维、网络管理、文档质量提升、文本与图像检索等实际应用场景。
Assessing Large Language Models in Generating RTL Design Specifications
问题定位:当前LLM在“从规范生成RTL”(Spec-to-RTL)方向已有较多研究,但反向的“从RTL生成规范”(RTL-to-Spec)因需语义抽象、时序推理等特殊能力,且缺乏可靠评估手段,相关探索较少。核心方案设计三类提示词策略:最小提示词(无结构约束)、规范感知提示词(明确硬件核心属性描述要求)、多步推理提示词(分分析-生成-自检三阶段);
MicroVQA++: High-Quality Microscopy Reasoning Dataset with Weakly Supervised Graphs for Multimoda...
多模态大语言模型(MLLMs)在生物医学成像领域的应用日益广泛,但显微镜图像的科学推理能力仍受限于缺乏大规模、高质量的训练数据。本文提出MicroVQA++,这是一个基于BIOMEDICA档案库、通过三阶段构建的大规模高质量显微镜视觉问答(VQA)语料库。第一阶段从同行评审文章中提取专家验证的图像-标题对作为初始监督数据;第二阶段引入HiCQA-Graph——一种新颖的异构图模型,通过融合基于自然语言推理(NLI)的文本蕴含、基于CLIP的视觉-语言对齐及智能体信号,识别并过滤不一致样本;
Adaptive Diagnostic Reasoning Framework for Pathology with Multimodal Large Language Models
人工智能工具已在病理学领域提升了筛查效率、标准化了定量分析,并揭示了可为治疗提供参考的预后模式。然而,这些工具的应用仍受到限制,因为大多数系统缺乏人类可理解的推理过程,难以审计诊断决策并预防错误。本文提出RECAP-PATH——一种可解释性框架,其建立了自学习范式,将现成的多模态大型语言模型从被动的模式识别转变为证据关联的诊断推理。该框架的核心是两阶段学习过程,能够自主推导诊断标准:多样化阶段扩展病理风格的解释内容,优化阶段则提升这些解释的准确性。
Decision and Gender Biases in Large Language Models: A Behavioral Economic Perspective
大型语言模型(LLMs)正日益介入经济和组织流程,从自动化客户支持、招聘到投资咨询和政策分析均有其身影。这些系统通常被认为具备无人类误差的理性决策能力;然而,它们的训练数据源自人类语言语料库,其中可能蕴含认知和社会偏见。本研究旨在探究先进LLMs在面对经典决策问题时,是表现为理性主体,还是会复刻人类的行为倾向。通过行为经济学中的两项经典实验——最后通牒博弈和赌博博弈,我们在中性和性别条件提示下,获取了两款最先进模型(GoogleGemma-7B和Qwen)的决策数据。
LLM Weekly(2026.7.6-2026.7.12)
OpenAI于7月9日发布GPT-5.6,提供三个变体:Sol(旗舰版,输入/输出每百万tokens定价$5/$30)、Terra(均衡版,$2.50/$15)和Luna(快速版,$1/$6)。Google发布Gemma4,这是一个新的开源权重、原生多模态模型家族,参数规模从23亿到310亿不等,包含密集和MoE变体。这些模型支持视觉、音频输入以及增强推理的“思考模式”,扩展了Google的开源权重生态系统,提供实际可部署的多模态能力。
TimeAudio: Bridging Temporal Gaps in Large Audio-Language Models
近年来,大型音频语言模型(LALMs)在对话式问答任务的音频内容理解方面展现出令人印象深刻的能力。然而,这些模型难以准确理解时间戳以实现时间定位(例如时间音频接地任务),且局限于短音频感知,导致其在细粒度任务上的性能受限。我们识别出限制其时间定位和长音频理解能力的三个关键方面:(i)时间戳表示方式,(ii)模型架构,(iii)训练数据。为解决这一问题,我们提出TimeAudio——一种新颖的方法,使LALMs能够将音频内容理解与精准的时间感知相结合。
Out-of-Distribution Detection with Positive and Negative Prompt Supervision Using Large Language ...
分布外(OOD)检测致力于划分分布内(ID)与OOD图像的分类边界。近年来,视觉-语言模型(VLM)通过融合视觉和文本模态,在OOD检测任务中展现出卓越性能。在此背景下,负提示词被引入以强调图像特征与提示词内容的差异性。然而,这些提示词通常包含大量非ID特征,可能因捕捉到重叠或误导性信息导致性能欠佳。为解决这一问题,我们提出正负提示词监督(PNPS)方法,该方法促使负提示词捕捉类间特征,并将这种语义知识迁移至视觉模态,以提升OOD检测性能。
AI-Salesman: Towards Reliable Large Language Model Driven Telemarketing
AI-Salesman:迈向可靠的大型语言模型驱动电话营销目标驱动型说服对话(例如电话营销应用)需要复杂的多轮规划和严格的事实真实性,这对即使是最先进的大型语言模型(LLMs)来说仍是一项重大挑战。先前的研究往往受限于缺乏特定任务数据,而直接应用LLM则存在策略脆弱性和事实幻觉问题。本文首先构建并发布了TeleSalesCorpus——该领域首个基于真实场景的对话数据集。随后,我们提出了AI-Salesman,一种具有双阶段架构的新型框架。
Random Text, Zipf‘s Law, Critical Length,and Implications for Large Language Models
我们研究一种刻意简化的非语言学文本模型:由有限字母表(含单个空格符号)中独立抽取符号组成的序列。单词被定义为非空格符号的最大连续块。在这个完全基于符号、无形态学、句法学或语义学的设定下,我们得出了多项结构性结论。首先,单词长度遵循由空格符号概率主导的几何分布。其次,特定长度单词的期望出现次数和该长度独特单词的期望数量可通过“优惠券收集者问题”的思路以闭合形式表达,这使我们能够定义临界单词长度(k^*)——在该长度处,单个单词类型从平均多次出现转变为至多出现一次。
Large Language Models and 3D Vision for Intelligent Robotic Perception and Autonomy
随着人工智能和机器人技术的快速发展,大语言模型(LLMs)与3D视觉的融合正成为提升机器人感知技术的变革性方法。这种融合使机器能够通过自然语言和空间理解来感知、推理并与复杂环境交互,弥合了语言智能与空间感知之间的鸿沟。本综述对LLMs与3D视觉交叉领域的最新方法、应用及挑战进行了全面分析,重点关注下一代机器人感知技术。我们首先介绍了LLMs的基本原理和3D数据表示方法,随后深入探讨了对机器人至关重要的3D感知技术。
Spatial Reasoning in Multimodal Large Language Models: A Survey of Tasks, Benchmarks and Methods
空间推理需要感知和操纵3D世界中空间关系的能力,是人类智能的核心组成部分,但对多模态大语言模型(MLLMs)而言仍是一项持续的挑战。现有综述常基于输入模态(如文本、图像、视频或3D)对近期进展进行分类,但本文认为空间能力并非仅由输入格式决定。相反,本综述提出一种分类体系,从认知层面组织空间智能,并根据推理复杂度划分任务,将其与多种认知功能关联。我们将文本仅输入、视觉-语言及具身场景下的现有基准数据集映射到该分类体系中,并综述评估空间推理能力的指标与方法。
From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models
问题提出:工具增强语言模型(如集成代码解释器的LLMs)虽能提升任务准确率,但即使工具选择和执行正确,模型仍可能将工具输出替代自身推理,导致解决方案看似正确却缺乏连贯论证,这种现象被定义为“工具诱导短视(TIM)”。研究设计构建基准数据集PYMATH,包含1679道竞赛级数学题,这类题目需代码辅助但无法仅靠代码完全解决,专门用于诱发和测量TIM;
A Multifaceted Analysis of Negative Bias in Large Language Models through the Lens of Parametric ...
负向偏差指大型语言模型(LLMs)在二元决策任务(如是非问答)中过度生成否定性响应的倾向。以往研究主要聚焦于检测和处理引发负向偏差的负向注意力头,但影响负向偏差的潜在详细因素仍未得到充分探索。本文中,我们证实LLMs存在格式层面的负向偏差——即提示格式对模型响应的影响大于否定性响应的语义本身。为了细粒度研究负向偏差,我们提出了一套评估集构建流程,基于模型的参数知识将数据集系统划分为三个子集:正确知识子集、错误知识子集和相关知识不足子集。
Architecting software monitors for control-flow anomaly detection through large language models a...
摘要背景:由于现代计算机系统的复杂性,确保其高可靠性变得日益具有挑战性。尽管系统在设计阶段会经过验证,但运行时行为可能存在差异,可能因"未知未知因素"导致控制流异常。目标:本文旨在通过软件监控检测控制流异常,该监控通过记录软件执行过程并识别与预期控制流的偏差来验证运行时行为。方法:提出一种结合大型语言模型(LLMs)和一致性检查的软件监控开发方法。该方法基于现有软件开发实践,在保留传统验证与确认(V&V)流程的同时,提供了额外的鲁棒性和可信度保障。
From Efficiency to Adaptivity: A Deeper Look at Adaptive Reasoning in Large Language Models
定义自适应推理:模型根据输入的难度、不确定性等特征,灵活分配推理资源(如推理深度、长度、策略)的能力——对简单任务快速响应,对复杂/陌生任务投入更多刻意推理,契合人类认知资源分配模式。形式化三大经典推理范式:在LLM语境下明确演绎推理(基于逻辑规则推导必然结论)、归纳推理(从示例中泛化隐含规则)、溯因推理(为观测结果生成合理解释)的算法实现形式。
Black-Box On-Policy Distillation of Large Language Models
黑盒蒸馏仅通过专有教师模型的文本输出来训练学生大语言模型(LLM),无需访问其内部对数概率或参数。本文提出生成对抗蒸馏(GAD),实现了策略级(on-policy)的黑盒蒸馏。GAD将学生LLM视为生成器,训练判别器区分其响应与教师LLM的响应,构建极小极大博弈。判别器作为与学生协同进化的策略级奖励模型,提供稳定、自适应的反馈。实验结果表明,GAD持续优于常用的序列级知识蒸馏方法。
Exploring State Tracking Capabilities of Large Language Models
大型语言模型(LLMs)在解决复杂任务(包括需要一定推理能力的任务)方面展现出了令人瞩目的性能。本文聚焦状态跟踪问题——即模型需要跟踪多个实体的主导状态。为将状态跟踪组件与其他因素分离,我们基于三个定义明确的状态跟踪任务提出了一个基准测试,并分析了LLMs在不同场景下的表现。结果表明,新一代LLMs(特别是GPT-4和Llama3)具备状态跟踪能力,尤其是在集成思维链(ChainofThought)等机制时表现更为突出。然而,旧代模型虽然能够理解任务并在初始阶段解决问题,但在经过一定步骤后往往会失败。
Scaling Open-Weight Large Language Models for Hydropower Regulatory Information Extraction: A Sys...
信息提取从监管文档中使用大型语言模型时,在性能与计算资源之间存在关键权衡。我们在水电许可文档上评估了7个开源模型(参数规模0.6B-70B),以提供实证性部署指导。分析发现了一个显著的14B参数阈值:低于该阈值时验证方法无效(F1
