Loading...

LongReasonArena: A Long Reasoning Benchmark for Large Language Models
现有针对大语言模型(LLMs)的长上下文基准测试,主要侧重于评估模型对长输入的理解能力,却忽视了对其长推理能力的评估。为填补这一空白,我们提出了LONGREASONARENA——一个专门用于评估大语言模型长推理能力的基准测试集。该基准测试集中的任务要求模型通过执行多步骤算法来解决问题,这些算法体现了长推理的关键方面,如检索和回溯。通过控制输入,所需的推理长度可任意调整,对于最具挑战性的任务,推理长度甚至能达到100万tokens。

Addressing Tokenization Inconsistency in Steganography and Watermarking Based on Large Language M...
大型语言模型(LLMs)显著提升了文本生成的能力与效率。一方面,它们改善了基于文本的隐写术质量;另一方面,也凸显了水印技术作为防范恶意滥用手段的重要性。本研究聚焦隐写术和水印技术中发送方与接收方之间的分词不一致(TI)问题——该问题会破坏系统鲁棒性。研究发现,导致TI的“问题token”具有两大关键特征:低频性(Infrequency)和暂时性(Temporariness)。基于这些发现,我们提出两种针对性解决方案以消除TI:适用于隐写术的“逐步验证法”和适用于水印技术的“事后回滚法”。

Breaking the Trade-Off Between Faithfulness and Expressiveness for Large Language Models
将回复基于外部知识,是缓解大型语言模型(LLMs)幻觉现象的有效策略。然而,当前LLMs难以在无缝整合知识的同时,兼顾人类天然具备的“忠实性”与“表达性”——现有输出要么缺乏外部知识支撑(损害忠实性),要么过于冗余、生硬(牺牲表达性)。为打破这一权衡,本文提出协同解码(CoDe):一种动态融合“含外部知识”与“不含外部知识”输出概率的新方法。该融合过程由分布差异和模型置信度引导,能够从模型内部参数中选择性激活相关且可靠的表达。

Integrating gender inclusivity into large language models via instruction tuning
想象一种语言,它包含阳性、阴性和中性三种语法性别,但受历史和政治传统影响,阳性形式常被主要用于指代男性、女性及混合性别群体。这正是当代波兰语及其他部分斯拉夫语族、罗曼语族语言的现实情况。这种不公平语言体系带来的一个社会后果是:基于标准文本训练的大型语言模型(LLMs)会继承并强化这种阳性偏见,生成性别失衡的输出。本研究通过“包容性波兰语指令集(IPIS)”对LLMs进行微调,以解决这一问题。IPIS是一组由人类编写的指令集,包含波兰语性别包容性校对指令和波兰语↔英语性别敏感翻译指令。

Unbiased Reasoning for Knowledge-Intensive Tasks in Large Language Models via Conditional Front-D...
大型语言模型(LLMs)在自然语言处理方面展现出令人印象深刻的能力,但在需要深度推理和外部知识整合的知识密集型任务中,仍难以表现出色。尽管检索增强生成(RAG)和思维链(CoT)等方法已被提出,用于为LLMs补充外部知识,但这些方法仍受限于LLMs的内部偏差,这往往会导致错误答案的产生。在本文中,我们提出了一种新颖的因果提示框架——条件前门提示(CFD-Prompting)。该框架能够在外部知识的条件下,实现查询与答案之间因果效应的无偏估计,同时减轻内部偏差。

TULIP: Adapting Open-Source Large Language Models for Underrepresented Languages and Specialized ...
近年来,随着大型语言模型(LLM)的日益普及,其在金融领域的应用潜力巨大。尽管大型专有模型表现卓越(通过API以“黑箱”方案形式提供),但可本地部署的小型模型在适应性和隐私保护方面具备独特优势。尤其在金融这类对敏感信息管理和领域知识应用要求极高的场景中,提升小型模型的能力至关重要,对于代表性不足的语言而言更是如此。本研究提出TULIP模型系列,通过对Llama3.18B和Qwen2.57B模型进行领域与语言适配,重点面向土耳其语金融应用场景。

LLM Weekly(2026.8.24-2026.8.30)
最终得到的单一模型,在专家验证的text-to-SQL任务上达到91.37%,每个任务成本约0.035美元,相比使用scaffold的开源流程高出8–22个百分点,同时以远低于GPT-5.6SolUltra的成本取得更好表现。由DeepMind前成员创办的伦敦实验室Inherent表示,其名为Faraday的智能体在复现已发表论文结果方面,比Anthropic和OpenAI的前沿模型表现更准确,而其底层仅采用一个基于Qwen3.6的270亿参数模型。

Emotion Omni: Enabling Empathetic Speech Response Generation through Large Language Models
随着语音大语言模型(speechLLMs)的发展,用户如今可通过语音直接与助手交互。然而,大多数现有模型仅将响应内容转化为语音,并未充分理解用户查询中所蕴含的丰富情感及副语言线索。在许多情况下,同一句话因情感表达不同,可能传递出截然不同的含义。此外,情感理解对于提升人机交互中的用户体验至关重要。目前,大多数具备共情能力的语音大语言模型都依赖海量数据集进行训练,这种方法不仅需要大量数据,还需消耗巨额计算资源。

LLM Weekly(2026.8.31-2026.9.6)
Mercor与SkyRL使用1,928个来自咨询、投行和法律领域的专家任务,对Qwen3.5–397B-A17B进行了后训练,使其在APEX-Agents上的Pass@1从16.11%提升至27.29%,相对提升70%。一位研究者在单张RTX5090上,从零训练了一个八层Transformer,仅耗时1.5小时,在ARC-AGI-1公共评测中取得44%,在ARC-AGI-2上取得7%。消融实验显示,真正发挥主要作用的是持久化知识层,而不仅仅是技能本身。

Investigating Advanced Reasoning of Large Language Models via Black-Box Interaction
现有任务在交互式未知环境中评估大型语言模型(LLMs)推理能力方面存在不足。这一缺陷导致演绎、归纳和溯因推理的评估相互孤立,忽略了人类探索现实世界所必需的整合推理过程。为解决这一挑战,我们提出了一种全新的评估范式——黑箱交互。黑箱由一个隐藏函数定义,该函数可将特定输入集合映射到输出。LLMs需在给定的探索轮次内与黑箱交互,并基于观察到的输入-输出对进行推理,以揭示黑箱背后的隐藏函数。基于这一思路,我们构建了ORACLE基准,该基准包含6类黑箱任务和96个黑箱,并对19个主流LLMs进行了基准测试。

Arrows of Math Reasoning Data Synthesis for Large Language Models: Diversity, Complexity and Corr...
提升大型语言模型(LLMs)的数学推理能力需要高质量的训练数据,然而传统方法在可扩展性、成本和数据可靠性方面面临严峻挑战。为解决这些局限,我们提出一种新颖的程序辅助合成框架,该框架能系统性地生成高质量数学语料,并确保其具备多样性、复杂性与正确性。此框架整合数学知识体系与特定领域工具,生成可执行程序;随后将这些程序转化为自然语言“问题-解答”对,并通过双边验证机制进行筛选——该机制一方面验证解答与程序输出的一致性以确保正确性,另一方面保障程序与问题的匹配性。

Federated Fine-Tuning of Sparsely-Activated Large Language Models on Resource-Constrained Devices
基于混合专家(MoE)架构的大型语言模型(LLMs)的联邦微调面临巨大挑战,这源于其庞大的计算需求与参与者的资源限制。现有研究尝试通过模型量化、计算卸载或专家剪枝来填补这一空白,但由于不切实际的系统假设以及未充分考虑MoE的特有属性,这些方法无法达到理想性能。本文提出Flux系统,该系统旨在实现基于MoE的LLMs在资源受限参与者(如消费级GPU)上的联邦微调,以最小化模型达到目标精度所需的时间。Flux引入三项关键创新:(1)基于量化的本地分析,以极低开销估算专家激活情况;

Less Is More? Examining Fairness in Pruned Large Language Models for Summarising Opinions
通过训练后剪枝实现的模型压缩,为在不显著影响模型性能的前提下降低模型规模与计算需求提供了可行路径。然而,剪枝对大语言模型(LLM)生成摘要公平性的影响尚未被探索——尤其在观点摘要任务中,有偏输出可能会影响公众认知。本文对观点摘要任务展开全面实证分析,在3个开源LLM上,结合4类公平性指标,考察了3种主流剪枝方法与不同校准集的作用。系统性分析表明,剪枝方法对公平性的影响显著大于校准集。

Neural Algorithmic Reasoners informed Large Language Model for Multi-Agent Path Finding
大语言模型(LLM)的发展与应用表明,基础模型可用于解决各类复杂任务。然而,其在多智能体路径规划(MAPF)任务中的表现却不尽如人意,目前针对该领域的研究也较为有限。MAPF是一项复杂任务,既需要路径规划能力,也要求多智能体具备协同配合能力。为提升LLM在MAPF任务中的性能,本文提出一种名为LLM-NAR的新型框架,该框架利用神经算法推理器(NAR)为LLM处理MAPF任务提供支持。LLM-NAR包含三个核心组件:用于MAPF任务的LLM、基于预训练图神经网络(GNN)的NAR以及交叉注意力机制。

Scaling Laws for Task-Stratified Knowledge in Post-Training Quantized Large Language Models
大语言模型(LLMs)因其规模庞大而面临严峻的部署挑战,训练后量化(PTQ)已成为一种切实可行的压缩方案。然而,目前人们对PTQ如何精确影响LLMs各类知识能力的全面理解仍有待完善,且现有量化模型缩放定律往往忽略了关键的PTQ特定参数和任务特异性敏感性。为填补这些空白,本文通过大量实证研究建立了任务分层的缩放定律。我们将LLMs的知识能力拆解为知识记忆与知识运用能力,并构建了一个整合模型大小、有效位宽、校准集大小和组大小的统一量化框架。

Retrieval Capabilities of Large Language Models Scale with Pretraining FLOPs
检索性能如何随预训练计算量(FLOPs)缩放?我们对参数规模从1.25亿到70亿的大语言模型(LLM)进行了检索性能基准测试,这些模型的预训练数据集规模覆盖10亿到2万亿以上tokens。研究发现,零样本BEIR任务的检索性能可预测地随LLM模型规模、训练时长和估算的FLOPs提升而缩放。我们还表明,在各类检索任务中,上下文学习(In-ContextLearning,ICL)分数与检索分数呈强相关。最后,我们强调了这一发现对基于LLM的检索模型开发的启示意义。

Root Cause Analysis of Radiation Oncology Incidents Using Large Language Models
该研究聚焦大型语言模型(LLMs)在放射肿瘤学事件根本原因分析(RCA)中的应用,旨在评估其推理能力及对患者安全工作的支持潜力。

Towards Synthesizing Normative Data for Cognitive Assessments Using Generative Multimodal Large L...
背景:认知评估需要标准化数据作为评估个体表现的重要基准。因此,基于新型图像刺激开发新的认知测试面临挑战,原因是缺乏可随时获取的标准化数据。传统数据收集方法成本高、耗时长且更新频率低,限制了其实际应用价值。生成式多模态大型语言模型(MLLMs)的最新进展为从现有认知测试图像中生成合成标准化数据提供了新方法。方法:本研究探究了使用多模态大型语言模型(具体为GPT-4o和GPT-4o-mini)为成熟的基于图像的认知评估(如“偷饼干”图片描述任务)合成标准化文本响应的可行性。

Political Ideology Shifts in Large Language Models
大型语言模型(LLMs)正日益应用于政治敏感场景,这引发了人们对其可能编码、放大或被引导至特定意识形态的担忧。本研究以政治指南针测试(PCT)为标准化工具,探究“采用合成角色”对不同模型家族、7个参数规模(7B-70B+)LLM意识形态表达的影响。分析揭示了四个一致模式:(1)更大规模的模型展现出更广泛且更极化的隐性意识形态覆盖;(2)模型对显性意识形态提示的敏感度随规模增大而提升;(3)模型对“右翼威权主义”提示的响应强度高于“左翼自由派”提示;

MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models
混合专家(MoE)模型通过实现大规模参数规模的同时保持计算效率,推动了大语言模型(LLM)和视觉语言模型(VLM)的规模扩展。然而,MoE模型在推理阶段引入了若干挑战,包括专家间负载不均衡以及额外的路由计算开销。为应对这些挑战并充分发挥MoE的优势,对硬件加速技术进行系统评估至关重要。本文提出MoE-Inference-Bench,这是一项全面的研究,用于评估MoE模型在不同场景下的性能。我们分析了批处理大小、序列长度以及FFN维度、专家数量等关键MoE超参数对吞吐量的影响。

欢迎留下您的脚印