Loading...

LLM Weekly(2026.8.24-2026.8.30)
最终得到的单一模型,在专家验证的text-to-SQL任务上达到91.37%,每个任务成本约0.035美元,相比使用scaffold的开源流程高出8–22个百分点,同时以远低于GPT-5.6SolUltra的成本取得更好表现。由DeepMind前成员创办的伦敦实验室Inherent表示,其名为Faraday的智能体在复现已发表论文结果方面,比Anthropic和OpenAI的前沿模型表现更准确,而其底层仅采用一个基于Qwen3.6的270亿参数模型。

Emotion Omni: Enabling Empathetic Speech Response Generation through Large Language Models
随着语音大语言模型(speechLLMs)的发展,用户如今可通过语音直接与助手交互。然而,大多数现有模型仅将响应内容转化为语音,并未充分理解用户查询中所蕴含的丰富情感及副语言线索。在许多情况下,同一句话因情感表达不同,可能传递出截然不同的含义。此外,情感理解对于提升人机交互中的用户体验至关重要。目前,大多数具备共情能力的语音大语言模型都依赖海量数据集进行训练,这种方法不仅需要大量数据,还需消耗巨额计算资源。

LLM Weekly(2026.8.31-2026.9.6)
Mercor与SkyRL使用1,928个来自咨询、投行和法律领域的专家任务,对Qwen3.5–397B-A17B进行了后训练,使其在APEX-Agents上的Pass@1从16.11%提升至27.29%,相对提升70%。一位研究者在单张RTX5090上,从零训练了一个八层Transformer,仅耗时1.5小时,在ARC-AGI-1公共评测中取得44%,在ARC-AGI-2上取得7%。消融实验显示,真正发挥主要作用的是持久化知识层,而不仅仅是技能本身。

Investigating Advanced Reasoning of Large Language Models via Black-Box Interaction
现有任务在交互式未知环境中评估大型语言模型(LLMs)推理能力方面存在不足。这一缺陷导致演绎、归纳和溯因推理的评估相互孤立,忽略了人类探索现实世界所必需的整合推理过程。为解决这一挑战,我们提出了一种全新的评估范式——黑箱交互。黑箱由一个隐藏函数定义,该函数可将特定输入集合映射到输出。LLMs需在给定的探索轮次内与黑箱交互,并基于观察到的输入-输出对进行推理,以揭示黑箱背后的隐藏函数。基于这一思路,我们构建了ORACLE基准,该基准包含6类黑箱任务和96个黑箱,并对19个主流LLMs进行了基准测试。

Arrows of Math Reasoning Data Synthesis for Large Language Models: Diversity, Complexity and Corr...
提升大型语言模型(LLMs)的数学推理能力需要高质量的训练数据,然而传统方法在可扩展性、成本和数据可靠性方面面临严峻挑战。为解决这些局限,我们提出一种新颖的程序辅助合成框架,该框架能系统性地生成高质量数学语料,并确保其具备多样性、复杂性与正确性。此框架整合数学知识体系与特定领域工具,生成可执行程序;随后将这些程序转化为自然语言“问题-解答”对,并通过双边验证机制进行筛选——该机制一方面验证解答与程序输出的一致性以确保正确性,另一方面保障程序与问题的匹配性。

Federated Fine-Tuning of Sparsely-Activated Large Language Models on Resource-Constrained Devices
基于混合专家(MoE)架构的大型语言模型(LLMs)的联邦微调面临巨大挑战,这源于其庞大的计算需求与参与者的资源限制。现有研究尝试通过模型量化、计算卸载或专家剪枝来填补这一空白,但由于不切实际的系统假设以及未充分考虑MoE的特有属性,这些方法无法达到理想性能。本文提出Flux系统,该系统旨在实现基于MoE的LLMs在资源受限参与者(如消费级GPU)上的联邦微调,以最小化模型达到目标精度所需的时间。Flux引入三项关键创新:(1)基于量化的本地分析,以极低开销估算专家激活情况;

Less Is More? Examining Fairness in Pruned Large Language Models for Summarising Opinions
通过训练后剪枝实现的模型压缩,为在不显著影响模型性能的前提下降低模型规模与计算需求提供了可行路径。然而,剪枝对大语言模型(LLM)生成摘要公平性的影响尚未被探索——尤其在观点摘要任务中,有偏输出可能会影响公众认知。本文对观点摘要任务展开全面实证分析,在3个开源LLM上,结合4类公平性指标,考察了3种主流剪枝方法与不同校准集的作用。系统性分析表明,剪枝方法对公平性的影响显著大于校准集。

Neural Algorithmic Reasoners informed Large Language Model for Multi-Agent Path Finding
大语言模型(LLM)的发展与应用表明,基础模型可用于解决各类复杂任务。然而,其在多智能体路径规划(MAPF)任务中的表现却不尽如人意,目前针对该领域的研究也较为有限。MAPF是一项复杂任务,既需要路径规划能力,也要求多智能体具备协同配合能力。为提升LLM在MAPF任务中的性能,本文提出一种名为LLM-NAR的新型框架,该框架利用神经算法推理器(NAR)为LLM处理MAPF任务提供支持。LLM-NAR包含三个核心组件:用于MAPF任务的LLM、基于预训练图神经网络(GNN)的NAR以及交叉注意力机制。

Scaling Laws for Task-Stratified Knowledge in Post-Training Quantized Large Language Models
大语言模型(LLMs)因其规模庞大而面临严峻的部署挑战,训练后量化(PTQ)已成为一种切实可行的压缩方案。然而,目前人们对PTQ如何精确影响LLMs各类知识能力的全面理解仍有待完善,且现有量化模型缩放定律往往忽略了关键的PTQ特定参数和任务特异性敏感性。为填补这些空白,本文通过大量实证研究建立了任务分层的缩放定律。我们将LLMs的知识能力拆解为知识记忆与知识运用能力,并构建了一个整合模型大小、有效位宽、校准集大小和组大小的统一量化框架。

Retrieval Capabilities of Large Language Models Scale with Pretraining FLOPs
检索性能如何随预训练计算量(FLOPs)缩放?我们对参数规模从1.25亿到70亿的大语言模型(LLM)进行了检索性能基准测试,这些模型的预训练数据集规模覆盖10亿到2万亿以上tokens。研究发现,零样本BEIR任务的检索性能可预测地随LLM模型规模、训练时长和估算的FLOPs提升而缩放。我们还表明,在各类检索任务中,上下文学习(In-ContextLearning,ICL)分数与检索分数呈强相关。最后,我们强调了这一发现对基于LLM的检索模型开发的启示意义。

Root Cause Analysis of Radiation Oncology Incidents Using Large Language Models
该研究聚焦大型语言模型(LLMs)在放射肿瘤学事件根本原因分析(RCA)中的应用,旨在评估其推理能力及对患者安全工作的支持潜力。

Towards Synthesizing Normative Data for Cognitive Assessments Using Generative Multimodal Large L...
背景:认知评估需要标准化数据作为评估个体表现的重要基准。因此,基于新型图像刺激开发新的认知测试面临挑战,原因是缺乏可随时获取的标准化数据。传统数据收集方法成本高、耗时长且更新频率低,限制了其实际应用价值。生成式多模态大型语言模型(MLLMs)的最新进展为从现有认知测试图像中生成合成标准化数据提供了新方法。方法:本研究探究了使用多模态大型语言模型(具体为GPT-4o和GPT-4o-mini)为成熟的基于图像的认知评估(如“偷饼干”图片描述任务)合成标准化文本响应的可行性。

Political Ideology Shifts in Large Language Models
大型语言模型(LLMs)正日益应用于政治敏感场景,这引发了人们对其可能编码、放大或被引导至特定意识形态的担忧。本研究以政治指南针测试(PCT)为标准化工具,探究“采用合成角色”对不同模型家族、7个参数规模(7B-70B+)LLM意识形态表达的影响。分析揭示了四个一致模式:(1)更大规模的模型展现出更广泛且更极化的隐性意识形态覆盖;(2)模型对显性意识形态提示的敏感度随规模增大而提升;(3)模型对“右翼威权主义”提示的响应强度高于“左翼自由派”提示;

MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models
混合专家(MoE)模型通过实现大规模参数规模的同时保持计算效率,推动了大语言模型(LLM)和视觉语言模型(VLM)的规模扩展。然而,MoE模型在推理阶段引入了若干挑战,包括专家间负载不均衡以及额外的路由计算开销。为应对这些挑战并充分发挥MoE的优势,对硬件加速技术进行系统评估至关重要。本文提出MoE-Inference-Bench,这是一项全面的研究,用于评估MoE模型在不同场景下的性能。我们分析了批处理大小、序列长度以及FFN维度、专家数量等关键MoE超参数对吞吐量的影响。

Large Language Models as Universal Predictors? An Empirical Study on Small Tabular Datasets
大型语言模型(LLMs)最初为自然语言处理(NLP)而开发,如今已展现出跨模态、跨领域的泛化潜力。凭借上下文学习(ICL)能力,LLMs无需对下游任务进行显式微调,即可处理结构化输入并执行预测任务。本研究通过实证方法,探究了LLMs在小规模结构化数据集上针对分类、回归和聚类任务的函数近似能力。

CoCoA: Confidence and Context-Aware Adaptive Decoding for Resolving Knowledge Conflicts in Large ...
大语言模型(LLMs)的可信生成面临参数记忆与外部语境间知识冲突的挑战。现有专门用于处理冲突的对比解码方法往往缺乏适应性,在低冲突场景下可能导致性能下降。本文提出COCOA(置信度与语境感知自适应解码),这是一种新颖的令牌级算法,用于实现合理的冲突解决并提升生成内容的可信度。COCOA通过利用置信度感知指标(熵差和语境峰值)以及参数分布与语境分布之间的广义散度(Rényi散度)来解决知识冲突。关键在于,即便在低冲突场景下,COCOA仍能保持优异性能。

SurveyGen: Quality-Aware Scientific Survey Generation with Large Language Models
自动综述生成已成为科学文献处理领域的一项关键任务。尽管大型语言模型(LLMs)在生成综述文本方面展现出潜力,但由于缺乏标准化的评估数据集,严重阻碍了对其与人类撰写综述的性能进行严谨评估。在本研究中,我们提出了SurveyGen——一个大规模数据集,包含超过4200篇来自不同科学领域的人类撰写综述,以及242143条引用参考文献,同时还包含这些综述和被引论文的大量质量相关元数据。

CMPhysBench: A Benchmark for Evaluating Large Language Models in Condensed Matter Physics
我们提出了一个全新的基准CMPhysBench,旨在评估大型语言模型(LLMs)在凝聚态物理领域的能力。该基准包含520多道精心挑选的研究生水平题目,涵盖凝聚态物理的代表性子领域与基础理论框架,如磁学、超导、强关联系统等。为确保能深入考察模型对解题过程的理解,我们仅聚焦于计算题,要求模型独立生成完整的解题方案。同时,借助表达式的树形表示,我们引入了可扩展表达式编辑距离(SEED)评分机制,该机制能提供细粒度(非二进制)的部分分数,更精准地评估预测结果与真实结果之间的相似度。

Adaptive Content Restriction for Large Language Models via Suffix Optimization
大型语言模型(LLMs)在多种应用中取得了显著成功。然而,由于其输出空间广阔,实施内容限制仍是一项重大挑战。内容限制的一个方面是通过模型对齐方法(如监督微调,SFT)防止LLMs生成有害内容。然而,内容限制的需求可能因用户群体而异,随时间快速变化,且并不总是与“有害性”的通用定义一致。由于高昂的计算、数据和存储需求,为每个特定场景应用SFT并不现实。基于这一需求,我们提出了一项新任务——自适应内容限制(AdaCoRe),其核心是轻量级策略(无需模型微调的方法),以阻止已部署的LLMs为特定场景生成受限术语。

Unraveling the cognitive patterns of Large Language Models through module communities
大型语言模型(LLMs)凭借从科学发现、医疗诊断到聊天机器人等各类应用,在科学、工程和社会领域取得重大进展,重塑了我们的世界。尽管LLMs应用广泛且实用性强,但其底层机制仍隐藏在数十亿参数和复杂结构中,导致其内部架构与认知过程难以理解。为填补这一空白,我们借鉴生物学中理解认知涌现的方法,开发了一个基于网络的框架,将认知技能、LLM架构与数据集关联起来,为基础模型分析带来范式转变。

欢迎留下您的脚印