Loading...

DRQA: Dynamic Reasoning Quota Allocation for Controlling Overthinking in Reasoning Large Language...
推理大型语言模型(RLLMs),如OpenAI-O3和DeepSeek-R1,近年来通过执行结构化多步推理展现出卓越能力。然而,近期研究发现,RLLMs常存在“过度思考”问题——即便面对简单问题,也会生成不必要的冗长推理链,导致token消耗过多和计算效率低下。有趣的是,我们观察到,当以批量模式处理多个问题时,由于隐式的资源竞争,RLLMs会通过动态压缩简单问题的推理步骤,表现出更高效的资源利用行为。

Memory-Efficient Federated Fine-Tuning of Large Language Models via Layer Pruning
联邦微调能够实现保护隐私的大型语言模型(LLM)适配,但高昂的内存成本限制了资源受限设备的参与。本文提出FEDPRUNER——一种创新的联邦微调范式,通过智能层剪枝解决这一问题。FEDPRUNER可灵活剪枝全局模型,根据设备内存约束生成个性化子模型。该范式采用宏-微协同剪枝框架:宏观层面,基于功能驱动的层编排机制对层进行分组;微观层面,基于重要性感知的层选择策略在组内剪枝,以构建设备专属子模型。此外,本文还提出一种细粒度变体,可独立剪枝多头注意力(MHA)和前馈网络(FFN)组件,从而精准保留关键结构元素。

Large Language Model-Based Automatic Formulation for Stochastic Optimization Models
本文首次对大型语言模型(LLMs,具体为ChatGPT)从自然语言描述中自动构建和求解随机优化问题的性能展开系统性整合研究。研究聚焦三大核心类别——联合机会约束模型、个体机会约束模型和两阶段随机线性规划(SLP-2),设计了多种提示策略,通过思维链和模块化推理引导ChatGPT完成结构化任务。本文提出了一种新的软评分指标,用于评估生成模型的结构质量和部分正确性,以解决传统标准准确性和基于执行的准确性评估方法的局限性。

Quantifying Language Disparities in Multilingual Large Language Models
大型多语言评估中报告的结果往往具有碎片化特征,且受目标语言、实验设置差异、模型选择等因素干扰。本文提出一套框架,可分离这些混淆变量,并引入三个可解释的指标——性能实现比(performancerealisationratio)、性能实现比的变异系数(itscoefficientofvariation)与语言潜力(languagepotential),从而更精细、更深入地量化(i)模型间与(ii)语言间的实际性能差异。

SageLM: A Multi-aspect and Explainable Large Language Model for Speech Judgement
语音到语音(S2S)大型语言模型(LLMs)是实现自然人机交互的基础,可支持端到端的语音对话系统。然而,对这类模型的评估仍是一项核心挑战。本文提出SageLM,这是一款用于全面评估S2S大型语言模型的端到端、多维度且可解释的语音大型语言模型。首先,与忽略声学特征的级联式方法不同,SageLM能同时评估语义和声学两个维度。其次,该模型利用基于推理依据的监督方式来增强可解释性,并指导模型学习,与基于规则的强化学习方法相比,其评估结果与预期评估目标的一致性更优。

Understanding Subword Compositionality of Large Language Models
大型语言模型(LLMs)以子词序列作为输入,这要求它们能有效地将子词表示组合成有意义的词级表示。在本文中,我们开展了一系列全面的实验,以探究LLMs如何组合子词信息,研究重点聚焦于三个关键方面:结构相似性、语义可分解性和形式保留。对实验结果的分析表明,5个LLM家族可被划分为三个不同的组别,这种分组可能反映了它们在底层组合策略上的差异。具体而言,我们观察到:(1)在各层中,子词组合表示与原词表示之间的结构相似性演化呈现出三种不同模式;(2)逐层探测模型对语义可分解性的敏感性时,所有模型均表现出优异性能;

Interleaving Large Language Models for Compiler Testing
翻译基于大语言模型交织的编译器测试方法倪云博,香港中文大学(香港)李少华∗,香港中文大学(香港)摘要:利用人工智能模型(尤其是大语言模型,LLMs)测试编译器已展现出巨大潜力。然而,现有方法面临两大关键问题:用于测试编译器的生成程序往往过于简单,且基于LLMs的大规模测试计算成本高昂。本文提出一种新颖的编译器测试框架,将测试过程解耦为两个独立阶段——离线阶段与在线阶段。在离线阶段,我们利用LLMs生成一组“小而功能丰富”的代码片段;

Leveraging Large Language Models for Accurate Sign Language Translation in Low-Resource Scenarios
将自然语言翻译为手语是一项极具复杂性且尚未充分探索的任务。尽管人们对无障碍与包容性的关注度不断提升,但手语翻译系统的稳健发展仍受限于平行语料的稀缺——这类语料需实现自然语言与手语数据的对齐。现有方法在这种数据稀缺的环境中往往难以泛化,因为少量可用数据集通常局限于特定领域、缺乏标准化,或无法完整捕捉手语丰富的语言特性。

How Quantization Shapes Bias in Large Language Models
本研究对量化如何影响模型偏见进行了全面评估,尤其关注其对特定人口统计子群体的影响。我们聚焦权重与激活量化策略,分析其在多种偏见类型(包括刻板印象、毒性、情感倾向与公平性)中的作用。研究采用概率型与生成文本型两类指标,结合9个基准测试,对不同架构家族与推理能力的模型展开评估。结果表明,量化对偏见的影响具有复杂性:尽管量化可降低模型毒性,且对情感倾向无显著影响,但在生成任务中(尤其是激进压缩场景下),它往往会轻微加剧刻板印象与不公平性。这些趋势在不同人口统计类别与模型类型中大体一致,但其影响程度取决于具体设置。

Named Entity Recognition of Historical Text via Large Language Model
大型语言模型(LLMs)已在各类自然语言处理任务和领域中展现出卓越的通用性,命名实体识别(NER)便是其中一项任务。该任务需识别并分类文本中的专有名词,如人物、组织、地点、日期及其他特定实体。命名实体识别在从非结构化文本数据中提取信息方面发挥着关键作用,可支持从非结构化文本中检索信息等下游应用。传统上,命名实体识别通过监督式机器学习方法实现,这类方法需要大量带标注的训练数据。然而,历史文本带来了独特的挑战:由于人工标注需高昂成本且对专业知识要求高,相关标注数据集往往稀缺甚至不存在。

LongReasonArena: A Long Reasoning Benchmark for Large Language Models
现有针对大语言模型(LLMs)的长上下文基准测试,主要侧重于评估模型对长输入的理解能力,却忽视了对其长推理能力的评估。为填补这一空白,我们提出了LONGREASONARENA——一个专门用于评估大语言模型长推理能力的基准测试集。该基准测试集中的任务要求模型通过执行多步骤算法来解决问题,这些算法体现了长推理的关键方面,如检索和回溯。通过控制输入,所需的推理长度可任意调整,对于最具挑战性的任务,推理长度甚至能达到100万tokens。

Addressing Tokenization Inconsistency in Steganography and Watermarking Based on Large Language M...
大型语言模型(LLMs)显著提升了文本生成的能力与效率。一方面,它们改善了基于文本的隐写术质量;另一方面,也凸显了水印技术作为防范恶意滥用手段的重要性。本研究聚焦隐写术和水印技术中发送方与接收方之间的分词不一致(TI)问题——该问题会破坏系统鲁棒性。研究发现,导致TI的“问题token”具有两大关键特征:低频性(Infrequency)和暂时性(Temporariness)。基于这些发现,我们提出两种针对性解决方案以消除TI:适用于隐写术的“逐步验证法”和适用于水印技术的“事后回滚法”。

Breaking the Trade-Off Between Faithfulness and Expressiveness for Large Language Models
将回复基于外部知识,是缓解大型语言模型(LLMs)幻觉现象的有效策略。然而,当前LLMs难以在无缝整合知识的同时,兼顾人类天然具备的“忠实性”与“表达性”——现有输出要么缺乏外部知识支撑(损害忠实性),要么过于冗余、生硬(牺牲表达性)。为打破这一权衡,本文提出协同解码(CoDe):一种动态融合“含外部知识”与“不含外部知识”输出概率的新方法。该融合过程由分布差异和模型置信度引导,能够从模型内部参数中选择性激活相关且可靠的表达。

Integrating gender inclusivity into large language models via instruction tuning
想象一种语言,它包含阳性、阴性和中性三种语法性别,但受历史和政治传统影响,阳性形式常被主要用于指代男性、女性及混合性别群体。这正是当代波兰语及其他部分斯拉夫语族、罗曼语族语言的现实情况。这种不公平语言体系带来的一个社会后果是:基于标准文本训练的大型语言模型(LLMs)会继承并强化这种阳性偏见,生成性别失衡的输出。本研究通过“包容性波兰语指令集(IPIS)”对LLMs进行微调,以解决这一问题。IPIS是一组由人类编写的指令集,包含波兰语性别包容性校对指令和波兰语↔英语性别敏感翻译指令。

Unbiased Reasoning for Knowledge-Intensive Tasks in Large Language Models via Conditional Front-D...
大型语言模型(LLMs)在自然语言处理方面展现出令人印象深刻的能力,但在需要深度推理和外部知识整合的知识密集型任务中,仍难以表现出色。尽管检索增强生成(RAG)和思维链(CoT)等方法已被提出,用于为LLMs补充外部知识,但这些方法仍受限于LLMs的内部偏差,这往往会导致错误答案的产生。在本文中,我们提出了一种新颖的因果提示框架——条件前门提示(CFD-Prompting)。该框架能够在外部知识的条件下,实现查询与答案之间因果效应的无偏估计,同时减轻内部偏差。

TULIP: Adapting Open-Source Large Language Models for Underrepresented Languages and Specialized ...
近年来,随着大型语言模型(LLM)的日益普及,其在金融领域的应用潜力巨大。尽管大型专有模型表现卓越(通过API以“黑箱”方案形式提供),但可本地部署的小型模型在适应性和隐私保护方面具备独特优势。尤其在金融这类对敏感信息管理和领域知识应用要求极高的场景中,提升小型模型的能力至关重要,对于代表性不足的语言而言更是如此。本研究提出TULIP模型系列,通过对Llama3.18B和Qwen2.57B模型进行领域与语言适配,重点面向土耳其语金融应用场景。

LLM Weekly(2026.8.24-2026.8.30)
最终得到的单一模型,在专家验证的text-to-SQL任务上达到91.37%,每个任务成本约0.035美元,相比使用scaffold的开源流程高出8–22个百分点,同时以远低于GPT-5.6SolUltra的成本取得更好表现。由DeepMind前成员创办的伦敦实验室Inherent表示,其名为Faraday的智能体在复现已发表论文结果方面,比Anthropic和OpenAI的前沿模型表现更准确,而其底层仅采用一个基于Qwen3.6的270亿参数模型。

Emotion Omni: Enabling Empathetic Speech Response Generation through Large Language Models
随着语音大语言模型(speechLLMs)的发展,用户如今可通过语音直接与助手交互。然而,大多数现有模型仅将响应内容转化为语音,并未充分理解用户查询中所蕴含的丰富情感及副语言线索。在许多情况下,同一句话因情感表达不同,可能传递出截然不同的含义。此外,情感理解对于提升人机交互中的用户体验至关重要。目前,大多数具备共情能力的语音大语言模型都依赖海量数据集进行训练,这种方法不仅需要大量数据,还需消耗巨额计算资源。

LLM Weekly(2026.8.31-2026.9.6)
Mercor与SkyRL使用1,928个来自咨询、投行和法律领域的专家任务,对Qwen3.5–397B-A17B进行了后训练,使其在APEX-Agents上的Pass@1从16.11%提升至27.29%,相对提升70%。一位研究者在单张RTX5090上,从零训练了一个八层Transformer,仅耗时1.5小时,在ARC-AGI-1公共评测中取得44%,在ARC-AGI-2上取得7%。消融实验显示,真正发挥主要作用的是持久化知识层,而不仅仅是技能本身。

Investigating Advanced Reasoning of Large Language Models via Black-Box Interaction
现有任务在交互式未知环境中评估大型语言模型(LLMs)推理能力方面存在不足。这一缺陷导致演绎、归纳和溯因推理的评估相互孤立,忽略了人类探索现实世界所必需的整合推理过程。为解决这一挑战,我们提出了一种全新的评估范式——黑箱交互。黑箱由一个隐藏函数定义,该函数可将特定输入集合映射到输出。LLMs需在给定的探索轮次内与黑箱交互,并基于观察到的输入-输出对进行推理,以揭示黑箱背后的隐藏函数。基于这一思路,我们构建了ORACLE基准,该基准包含6类黑箱任务和96个黑箱,并对19个主流LLMs进行了基准测试。

欢迎留下您的脚印