Loading...
语音到语音(S2S)大型语言模型(LLMs)是实现自然人机交互的基础,可支持端到端的语音对话系统。然而,对这类模型的评估仍是一项核心挑战。本文提出SageLM,这是一款用于全面评估S2S大型语言模型的端到端、多维度且可解释的语音大型语言模型。首先,与忽略声学特征的级联式方法不同,SageLM能同时评估语义和声学两个维度。其次,该模型利用基于推理依据的监督方式来增强可解释性,并指导模型学习,与基于规则的强化学习方法相比,其评估结果与预期评估目标的一致性更优。
Understanding Subword Compositionality of Large Language Models
大型语言模型(LLMs)以子词序列作为输入,这要求它们能有效地将子词表示组合成有意义的词级表示。在本文中,我们开展了一系列全面的实验,以探究LLMs如何组合子词信息,研究重点聚焦于三个关键方面:结构相似性、语义可分解性和形式保留。对实验结果的分析表明,5个LLM家族可被划分为三个不同的组别,这种分组可能反映了它们在底层组合策略上的差异。具体而言,我们观察到:(1)在各层中,子词组合表示与原词表示之间的结构相似性演化呈现出三种不同模式;(2)逐层探测模型对语义可分解性的敏感性时,所有模型均表现出优异性能;
Interleaving Large Language Models for Compiler Testing
翻译基于大语言模型交织的编译器测试方法倪云博,香港中文大学(香港)李少华∗,香港中文大学(香港)摘要:利用人工智能模型(尤其是大语言模型,LLMs)测试编译器已展现出巨大潜力。然而,现有方法面临两大关键问题:用于测试编译器的生成程序往往过于简单,且基于LLMs的大规模测试计算成本高昂。本文提出一种新颖的编译器测试框架,将测试过程解耦为两个独立阶段——离线阶段与在线阶段。在离线阶段,我们利用LLMs生成一组“小而功能丰富”的代码片段;
Leveraging Large Language Models for Accurate Sign Language Translation in Low-Resource Scenarios
将自然语言翻译为手语是一项极具复杂性且尚未充分探索的任务。尽管人们对无障碍与包容性的关注度不断提升,但手语翻译系统的稳健发展仍受限于平行语料的稀缺——这类语料需实现自然语言与手语数据的对齐。现有方法在这种数据稀缺的环境中往往难以泛化,因为少量可用数据集通常局限于特定领域、缺乏标准化,或无法完整捕捉手语丰富的语言特性。
How Quantization Shapes Bias in Large Language Models
本研究对量化如何影响模型偏见进行了全面评估,尤其关注其对特定人口统计子群体的影响。我们聚焦权重与激活量化策略,分析其在多种偏见类型(包括刻板印象、毒性、情感倾向与公平性)中的作用。研究采用概率型与生成文本型两类指标,结合9个基准测试,对不同架构家族与推理能力的模型展开评估。结果表明,量化对偏见的影响具有复杂性:尽管量化可降低模型毒性,且对情感倾向无显著影响,但在生成任务中(尤其是激进压缩场景下),它往往会轻微加剧刻板印象与不公平性。这些趋势在不同人口统计类别与模型类型中大体一致,但其影响程度取决于具体设置。
Named Entity Recognition of Historical Text via Large Language Model
大型语言模型(LLMs)已在各类自然语言处理任务和领域中展现出卓越的通用性,命名实体识别(NER)便是其中一项任务。该任务需识别并分类文本中的专有名词,如人物、组织、地点、日期及其他特定实体。命名实体识别在从非结构化文本数据中提取信息方面发挥着关键作用,可支持从非结构化文本中检索信息等下游应用。传统上,命名实体识别通过监督式机器学习方法实现,这类方法需要大量带标注的训练数据。然而,历史文本带来了独特的挑战:由于人工标注需高昂成本且对专业知识要求高,相关标注数据集往往稀缺甚至不存在。
LongReasonArena: A Long Reasoning Benchmark for Large Language Models
现有针对大语言模型(LLMs)的长上下文基准测试,主要侧重于评估模型对长输入的理解能力,却忽视了对其长推理能力的评估。为填补这一空白,我们提出了LONGREASONARENA——一个专门用于评估大语言模型长推理能力的基准测试集。该基准测试集中的任务要求模型通过执行多步骤算法来解决问题,这些算法体现了长推理的关键方面,如检索和回溯。通过控制输入,所需的推理长度可任意调整,对于最具挑战性的任务,推理长度甚至能达到100万tokens。
Addressing Tokenization Inconsistency in Steganography and Watermarking Based on Large Language M...
大型语言模型(LLMs)显著提升了文本生成的能力与效率。一方面,它们改善了基于文本的隐写术质量;另一方面,也凸显了水印技术作为防范恶意滥用手段的重要性。本研究聚焦隐写术和水印技术中发送方与接收方之间的分词不一致(TI)问题——该问题会破坏系统鲁棒性。研究发现,导致TI的“问题token”具有两大关键特征:低频性(Infrequency)和暂时性(Temporariness)。基于这些发现,我们提出两种针对性解决方案以消除TI:适用于隐写术的“逐步验证法”和适用于水印技术的“事后回滚法”。
Breaking the Trade-Off Between Faithfulness and Expressiveness for Large Language Models
将回复基于外部知识,是缓解大型语言模型(LLMs)幻觉现象的有效策略。然而,当前LLMs难以在无缝整合知识的同时,兼顾人类天然具备的“忠实性”与“表达性”——现有输出要么缺乏外部知识支撑(损害忠实性),要么过于冗余、生硬(牺牲表达性)。为打破这一权衡,本文提出协同解码(CoDe):一种动态融合“含外部知识”与“不含外部知识”输出概率的新方法。该融合过程由分布差异和模型置信度引导,能够从模型内部参数中选择性激活相关且可靠的表达。
Integrating gender inclusivity into large language models via instruction tuning
想象一种语言,它包含阳性、阴性和中性三种语法性别,但受历史和政治传统影响,阳性形式常被主要用于指代男性、女性及混合性别群体。这正是当代波兰语及其他部分斯拉夫语族、罗曼语族语言的现实情况。这种不公平语言体系带来的一个社会后果是:基于标准文本训练的大型语言模型(LLMs)会继承并强化这种阳性偏见,生成性别失衡的输出。本研究通过“包容性波兰语指令集(IPIS)”对LLMs进行微调,以解决这一问题。IPIS是一组由人类编写的指令集,包含波兰语性别包容性校对指令和波兰语↔英语性别敏感翻译指令。
Unbiased Reasoning for Knowledge-Intensive Tasks in Large Language Models via Conditional Front-D...
大型语言模型(LLMs)在自然语言处理方面展现出令人印象深刻的能力,但在需要深度推理和外部知识整合的知识密集型任务中,仍难以表现出色。尽管检索增强生成(RAG)和思维链(CoT)等方法已被提出,用于为LLMs补充外部知识,但这些方法仍受限于LLMs的内部偏差,这往往会导致错误答案的产生。在本文中,我们提出了一种新颖的因果提示框架——条件前门提示(CFD-Prompting)。该框架能够在外部知识的条件下,实现查询与答案之间因果效应的无偏估计,同时减轻内部偏差。
TULIP: Adapting Open-Source Large Language Models for Underrepresented Languages and Specialized ...
近年来,随着大型语言模型(LLM)的日益普及,其在金融领域的应用潜力巨大。尽管大型专有模型表现卓越(通过API以“黑箱”方案形式提供),但可本地部署的小型模型在适应性和隐私保护方面具备独特优势。尤其在金融这类对敏感信息管理和领域知识应用要求极高的场景中,提升小型模型的能力至关重要,对于代表性不足的语言而言更是如此。本研究提出TULIP模型系列,通过对Llama3.18B和Qwen2.57B模型进行领域与语言适配,重点面向土耳其语金融应用场景。
LLM Weekly(2026.8.24-2026.8.30)
最终得到的单一模型,在专家验证的text-to-SQL任务上达到91.37%,每个任务成本约0.035美元,相比使用scaffold的开源流程高出8–22个百分点,同时以远低于GPT-5.6SolUltra的成本取得更好表现。由DeepMind前成员创办的伦敦实验室Inherent表示,其名为Faraday的智能体在复现已发表论文结果方面,比Anthropic和OpenAI的前沿模型表现更准确,而其底层仅采用一个基于Qwen3.6的270亿参数模型。
Emotion Omni: Enabling Empathetic Speech Response Generation through Large Language Models
随着语音大语言模型(speechLLMs)的发展,用户如今可通过语音直接与助手交互。然而,大多数现有模型仅将响应内容转化为语音,并未充分理解用户查询中所蕴含的丰富情感及副语言线索。在许多情况下,同一句话因情感表达不同,可能传递出截然不同的含义。此外,情感理解对于提升人机交互中的用户体验至关重要。目前,大多数具备共情能力的语音大语言模型都依赖海量数据集进行训练,这种方法不仅需要大量数据,还需消耗巨额计算资源。
LLM Weekly(2026.8.31-2026.9.6)
Mercor与SkyRL使用1,928个来自咨询、投行和法律领域的专家任务,对Qwen3.5–397B-A17B进行了后训练,使其在APEX-Agents上的Pass@1从16.11%提升至27.29%,相对提升70%。一位研究者在单张RTX5090上,从零训练了一个八层Transformer,仅耗时1.5小时,在ARC-AGI-1公共评测中取得44%,在ARC-AGI-2上取得7%。消融实验显示,真正发挥主要作用的是持久化知识层,而不仅仅是技能本身。
Investigating Advanced Reasoning of Large Language Models via Black-Box Interaction
现有任务在交互式未知环境中评估大型语言模型(LLMs)推理能力方面存在不足。这一缺陷导致演绎、归纳和溯因推理的评估相互孤立,忽略了人类探索现实世界所必需的整合推理过程。为解决这一挑战,我们提出了一种全新的评估范式——黑箱交互。黑箱由一个隐藏函数定义,该函数可将特定输入集合映射到输出。LLMs需在给定的探索轮次内与黑箱交互,并基于观察到的输入-输出对进行推理,以揭示黑箱背后的隐藏函数。基于这一思路,我们构建了ORACLE基准,该基准包含6类黑箱任务和96个黑箱,并对19个主流LLMs进行了基准测试。
Arrows of Math Reasoning Data Synthesis for Large Language Models: Diversity, Complexity and Corr...
提升大型语言模型(LLMs)的数学推理能力需要高质量的训练数据,然而传统方法在可扩展性、成本和数据可靠性方面面临严峻挑战。为解决这些局限,我们提出一种新颖的程序辅助合成框架,该框架能系统性地生成高质量数学语料,并确保其具备多样性、复杂性与正确性。此框架整合数学知识体系与特定领域工具,生成可执行程序;随后将这些程序转化为自然语言“问题-解答”对,并通过双边验证机制进行筛选——该机制一方面验证解答与程序输出的一致性以确保正确性,另一方面保障程序与问题的匹配性。
Federated Fine-Tuning of Sparsely-Activated Large Language Models on Resource-Constrained Devices
基于混合专家(MoE)架构的大型语言模型(LLMs)的联邦微调面临巨大挑战,这源于其庞大的计算需求与参与者的资源限制。现有研究尝试通过模型量化、计算卸载或专家剪枝来填补这一空白,但由于不切实际的系统假设以及未充分考虑MoE的特有属性,这些方法无法达到理想性能。本文提出Flux系统,该系统旨在实现基于MoE的LLMs在资源受限参与者(如消费级GPU)上的联邦微调,以最小化模型达到目标精度所需的时间。Flux引入三项关键创新:(1)基于量化的本地分析,以极低开销估算专家激活情况;
Less Is More? Examining Fairness in Pruned Large Language Models for Summarising Opinions
通过训练后剪枝实现的模型压缩,为在不显著影响模型性能的前提下降低模型规模与计算需求提供了可行路径。然而,剪枝对大语言模型(LLM)生成摘要公平性的影响尚未被探索——尤其在观点摘要任务中,有偏输出可能会影响公众认知。本文对观点摘要任务展开全面实证分析,在3个开源LLM上,结合4类公平性指标,考察了3种主流剪枝方法与不同校准集的作用。系统性分析表明,剪枝方法对公平性的影响显著大于校准集。
Neural Algorithmic Reasoners informed Large Language Model for Multi-Agent Path Finding
大语言模型(LLM)的发展与应用表明,基础模型可用于解决各类复杂任务。然而,其在多智能体路径规划(MAPF)任务中的表现却不尽如人意,目前针对该领域的研究也较为有限。MAPF是一项复杂任务,既需要路径规划能力,也要求多智能体具备协同配合能力。为提升LLM在MAPF任务中的性能,本文提出一种名为LLM-NAR的新型框架,该框架利用神经算法推理器(NAR)为LLM处理MAPF任务提供支持。LLM-NAR包含三个核心组件:用于MAPF任务的LLM、基于预训练图神经网络(GNN)的NAR以及交叉注意力机制。
