Loading...
大型视觉语言模型(LVLMs)通常将编码器提取的视觉特征与预训练大型语言模型(LLM)对齐。然而,这使得视觉感知模块成为瓶颈,限制了LVLMs的整体性能。传统评估基准虽富含视觉语义,但往往存在不可避免的局部捷径,可能导致对模型感知能力的高估。本文提出TopoPerception基准,利用拓扑学特性跨多种粒度严格评估LVLMs的全局视觉感知能力。由于拓扑结构依赖图像的全局结构且不受局部特征影响,TopoPerception实现了无捷径的全局感知评估,与语义丰富的任务形成本质区别。
Constrained Network Slice Assignment via Large Language Models
现代网络支持网络切片技术,该技术将物理基础设施划分为多个虚拟切片,以适配不同的服务需求(如高带宽、低时延)。将用户最优分配到切片是一个约束优化问题,传统上需要复杂的算法。本文探索了使用大语言模型(LLMs)解决网络切片的无线资源分配问题,重点研究两种方法:(1)在零样本场景下使用LLM直接将用户服务请求分配到切片;(2)构建整数规划模型,利用LLM通过估计请求间的相似度提供语义洞察。实验表明,即使采用零样本提示,LLM也能生成合理的初步切片分配方案,尽管可能违反部分容量或时延约束。
LLM Weekly(2026.7.13-2026.7.19)
MiraMurati的初创公司推出Inkling,这是一个9750亿参数的MoE模型,其中410亿参数为激活参数,在45万亿token的文本、图像、音频和视频数据上训练而成。来自ImpossibleResearch、UCBerkeley和CMU的研究人员构建了Schema,这是一个让前沿模型像物理学家一样工作的“马具”:将每个游戏的机制编写为可执行程序,根据交互历史测试预测,并在模型内部进行规划。该框架消除了此前将长上下文RL限制在短序列上的内存瓶颈。
Leveraging Large Language Models for Career Mobility Analysis: A Study of Gender, Race, and Job C...
我们基于在线简历数据,对美国大学毕业生的职业流动性进行了大规模分析,旨在探究性别、种族与工作变动选择如何与向上职业流动相关联。本研究围绕两个核心研究问题展开:工作变动如何影响向上职业流动,以及不同性别和种族群体的向上职业流动结果存在哪些差异。我们通过多种数据处理和人工智能方法,解决了数据中存在的人口统计学属性缺失、薪资数据缺失和职业标签噪声等问题。具体而言,我们开发了一种基于大语言模型(LLM)的职业分类方法FewSOC,其准确率显著高于简历数据中的原始职业标签。
Automata-Based Steering of Large Language Models for Diverse Structured Generation
问题背景:现有结构化生成方法(如Outlines、SGLang)虽能通过有限自动机或下推自动机保证输出的语法有效性,但普遍缺乏多样性,导致下游应用(如软件测试、AI智能体规划)难以覆盖边缘场景。初步实验证实,即使调整采样温度,主流方法仍存在结构模式重复、自动机状态/转移覆盖不足的问题。核心方法:通过追踪生成过程中自动机的状态和转移历史,自适应调整LLM的token选择概率:引入全局转移计数器,奖励探索低频访问的状态路径,提升结构多样性;设计局部状态计数器,惩罚重复访问的状态,避免陷入局部最优;
AA-Omniscience: Evaluating Cross-Domain Knowledge Reliability in Large Language Models
本文针对现有大语言模型(LLM)评估多侧重通用能力、忽视跨领域事实准确性与知识校准的问题,提出了AA-Omniscience基准,用于衡量模型的事实召回能力和知识校准水平。基准设计核心涵盖6个经济相关领域(商业、人文社科、健康、法律、软件工程、科学工程与数学)、42个细分主题,共6000道问题,源自权威学术和行业来源。采用全知指数(OmniscienceIndex)作为核心指标(范围-100至100),奖励正确答案、惩罚幻觉输出、鼓励不确定时弃权,0分代表正确与错误答案数量持平。
MM-Telco: Benchmarks and Multimodal Large Language Models for Telecom Applications
大语言模型(LLMs)已成为自动化复杂推理和决策任务的强大工具。在电信领域,它们有望实现网络优化转型、自动化故障排查、提升客户支持质量并确保合规性。然而,由于电信领域存在特定挑战,需要专用适配方案,LLMs的部署受到阻碍。为克服这些挑战并加速LLMs在电信领域的适配,我们提出MM-Telco——一套全面的多模态基准测试套件与模型,专为电信领域量身定制。该基准包含多种文本和图像类任务,覆盖网络运维、网络管理、文档质量提升、文本与图像检索等实际应用场景。
Assessing Large Language Models in Generating RTL Design Specifications
问题定位:当前LLM在“从规范生成RTL”(Spec-to-RTL)方向已有较多研究,但反向的“从RTL生成规范”(RTL-to-Spec)因需语义抽象、时序推理等特殊能力,且缺乏可靠评估手段,相关探索较少。核心方案设计三类提示词策略:最小提示词(无结构约束)、规范感知提示词(明确硬件核心属性描述要求)、多步推理提示词(分分析-生成-自检三阶段);
MicroVQA++: High-Quality Microscopy Reasoning Dataset with Weakly Supervised Graphs for Multimoda...
多模态大语言模型(MLLMs)在生物医学成像领域的应用日益广泛,但显微镜图像的科学推理能力仍受限于缺乏大规模、高质量的训练数据。本文提出MicroVQA++,这是一个基于BIOMEDICA档案库、通过三阶段构建的大规模高质量显微镜视觉问答(VQA)语料库。第一阶段从同行评审文章中提取专家验证的图像-标题对作为初始监督数据;第二阶段引入HiCQA-Graph——一种新颖的异构图模型,通过融合基于自然语言推理(NLI)的文本蕴含、基于CLIP的视觉-语言对齐及智能体信号,识别并过滤不一致样本;
Adaptive Diagnostic Reasoning Framework for Pathology with Multimodal Large Language Models
人工智能工具已在病理学领域提升了筛查效率、标准化了定量分析,并揭示了可为治疗提供参考的预后模式。然而,这些工具的应用仍受到限制,因为大多数系统缺乏人类可理解的推理过程,难以审计诊断决策并预防错误。本文提出RECAP-PATH——一种可解释性框架,其建立了自学习范式,将现成的多模态大型语言模型从被动的模式识别转变为证据关联的诊断推理。该框架的核心是两阶段学习过程,能够自主推导诊断标准:多样化阶段扩展病理风格的解释内容,优化阶段则提升这些解释的准确性。
Decision and Gender Biases in Large Language Models: A Behavioral Economic Perspective
大型语言模型(LLMs)正日益介入经济和组织流程,从自动化客户支持、招聘到投资咨询和政策分析均有其身影。这些系统通常被认为具备无人类误差的理性决策能力;然而,它们的训练数据源自人类语言语料库,其中可能蕴含认知和社会偏见。本研究旨在探究先进LLMs在面对经典决策问题时,是表现为理性主体,还是会复刻人类的行为倾向。通过行为经济学中的两项经典实验——最后通牒博弈和赌博博弈,我们在中性和性别条件提示下,获取了两款最先进模型(GoogleGemma-7B和Qwen)的决策数据。
LLM Weekly(2026.7.6-2026.7.12)
OpenAI于7月9日发布GPT-5.6,提供三个变体:Sol(旗舰版,输入/输出每百万tokens定价$5/$30)、Terra(均衡版,$2.50/$15)和Luna(快速版,$1/$6)。Google发布Gemma4,这是一个新的开源权重、原生多模态模型家族,参数规模从23亿到310亿不等,包含密集和MoE变体。这些模型支持视觉、音频输入以及增强推理的“思考模式”,扩展了Google的开源权重生态系统,提供实际可部署的多模态能力。
TimeAudio: Bridging Temporal Gaps in Large Audio-Language Models
近年来,大型音频语言模型(LALMs)在对话式问答任务的音频内容理解方面展现出令人印象深刻的能力。然而,这些模型难以准确理解时间戳以实现时间定位(例如时间音频接地任务),且局限于短音频感知,导致其在细粒度任务上的性能受限。我们识别出限制其时间定位和长音频理解能力的三个关键方面:(i)时间戳表示方式,(ii)模型架构,(iii)训练数据。为解决这一问题,我们提出TimeAudio——一种新颖的方法,使LALMs能够将音频内容理解与精准的时间感知相结合。
Out-of-Distribution Detection with Positive and Negative Prompt Supervision Using Large Language ...
分布外(OOD)检测致力于划分分布内(ID)与OOD图像的分类边界。近年来,视觉-语言模型(VLM)通过融合视觉和文本模态,在OOD检测任务中展现出卓越性能。在此背景下,负提示词被引入以强调图像特征与提示词内容的差异性。然而,这些提示词通常包含大量非ID特征,可能因捕捉到重叠或误导性信息导致性能欠佳。为解决这一问题,我们提出正负提示词监督(PNPS)方法,该方法促使负提示词捕捉类间特征,并将这种语义知识迁移至视觉模态,以提升OOD检测性能。
AI-Salesman: Towards Reliable Large Language Model Driven Telemarketing
AI-Salesman:迈向可靠的大型语言模型驱动电话营销目标驱动型说服对话(例如电话营销应用)需要复杂的多轮规划和严格的事实真实性,这对即使是最先进的大型语言模型(LLMs)来说仍是一项重大挑战。先前的研究往往受限于缺乏特定任务数据,而直接应用LLM则存在策略脆弱性和事实幻觉问题。本文首先构建并发布了TeleSalesCorpus——该领域首个基于真实场景的对话数据集。随后,我们提出了AI-Salesman,一种具有双阶段架构的新型框架。
Random Text, Zipf‘s Law, Critical Length,and Implications for Large Language Models
我们研究一种刻意简化的非语言学文本模型:由有限字母表(含单个空格符号)中独立抽取符号组成的序列。单词被定义为非空格符号的最大连续块。在这个完全基于符号、无形态学、句法学或语义学的设定下,我们得出了多项结构性结论。首先,单词长度遵循由空格符号概率主导的几何分布。其次,特定长度单词的期望出现次数和该长度独特单词的期望数量可通过“优惠券收集者问题”的思路以闭合形式表达,这使我们能够定义临界单词长度(k^*)——在该长度处,单个单词类型从平均多次出现转变为至多出现一次。
Large Language Models and 3D Vision for Intelligent Robotic Perception and Autonomy
随着人工智能和机器人技术的快速发展,大语言模型(LLMs)与3D视觉的融合正成为提升机器人感知技术的变革性方法。这种融合使机器能够通过自然语言和空间理解来感知、推理并与复杂环境交互,弥合了语言智能与空间感知之间的鸿沟。本综述对LLMs与3D视觉交叉领域的最新方法、应用及挑战进行了全面分析,重点关注下一代机器人感知技术。我们首先介绍了LLMs的基本原理和3D数据表示方法,随后深入探讨了对机器人至关重要的3D感知技术。
Spatial Reasoning in Multimodal Large Language Models: A Survey of Tasks, Benchmarks and Methods
空间推理需要感知和操纵3D世界中空间关系的能力,是人类智能的核心组成部分,但对多模态大语言模型(MLLMs)而言仍是一项持续的挑战。现有综述常基于输入模态(如文本、图像、视频或3D)对近期进展进行分类,但本文认为空间能力并非仅由输入格式决定。相反,本综述提出一种分类体系,从认知层面组织空间智能,并根据推理复杂度划分任务,将其与多种认知功能关联。我们将文本仅输入、视觉-语言及具身场景下的现有基准数据集映射到该分类体系中,并综述评估空间推理能力的指标与方法。
From Proof to Program: Characterizing Tool-Induced Reasoning Hallucinations in Large Language Models
问题提出:工具增强语言模型(如集成代码解释器的LLMs)虽能提升任务准确率,但即使工具选择和执行正确,模型仍可能将工具输出替代自身推理,导致解决方案看似正确却缺乏连贯论证,这种现象被定义为“工具诱导短视(TIM)”。研究设计构建基准数据集PYMATH,包含1679道竞赛级数学题,这类题目需代码辅助但无法仅靠代码完全解决,专门用于诱发和测量TIM;
A Multifaceted Analysis of Negative Bias in Large Language Models through the Lens of Parametric ...
负向偏差指大型语言模型(LLMs)在二元决策任务(如是非问答)中过度生成否定性响应的倾向。以往研究主要聚焦于检测和处理引发负向偏差的负向注意力头,但影响负向偏差的潜在详细因素仍未得到充分探索。本文中,我们证实LLMs存在格式层面的负向偏差——即提示格式对模型响应的影响大于否定性响应的语义本身。为了细粒度研究负向偏差,我们提出了一套评估集构建流程,基于模型的参数知识将数据集系统划分为三个子集:正确知识子集、错误知识子集和相关知识不足子集。
