Loading...
本文聚焦5G新空口(NR)中的自适应调制编码(AMC)技术,针对传统AMC方案中因信道质量指示符(CQI)时效性衰减(反馈延迟导致)引发的链路性能下降问题,提出了一种基于大语言模型(LLM)的信道质量预测与AMC优化方法——LLM4AMC。研究背景:AMC作为链路自适应的核心技术,通过根据信道条件(基于信号与干扰加噪声比SINR推导的CQI)动态选择调制编码方案(MCS),平衡传输效率与可靠性。
Hallucinate Less by Thinking More: Aspect-Based Causal Abstention for Large Language Models
大语言模型(LLMs)经常生成流畅但事实错误的响应,这种现象被称为幻觉。回避机制(模型选择不回答而输出“我不知道”等表述)是一种常见的保障手段。然而,现有回避方法通常依赖生成后的信号(如生成变异或反馈),这限制了它们提前预防不可靠响应的能力。本文提出基于方面的因果回避(ABCA),这是一个新框架,通过因果推理分析LLM知识的内部多样性,实现生成前回避。这种多样性反映了从不同来源获取的参数化知识的多面性,代表了学科、法律背景或时间框架等不同方面。
Narratives to Numbers: Large Language Models and Economic Policy Uncertainty
本研究将大语言模型视为可估计分类器进行评估,并阐明了建模选择如何影响下游测量误差。通过重新审视经济政策不确定性(EPU)指数,我们发现现代分类器显著优于词典规则,更能贴合人类审核评估结果,且可自然拓展至含噪声的历史新闻和多语言新闻分析场景。我们利用这些工具,基于超过3.6亿篇报纸文章构建了新的19世纪美国EPU指数,并通过单一多语言模型构建了探索性的跨国指数。综合来看,研究结果表明,大语言模型(LLMs)能系统性改进文本衍生指标,应作为明确的测量工具整合到实证经济学研究中。
PathAgent: Toward Interpretable Analysis of Whole-slide Pathology Images via Large Language Model...
分析全切片图像(WSIs)需要一个迭代的、基于证据的推理过程,这与病理学家在收集证据时动态缩放、重新聚焦和自我修正的方式相似。然而,现有的计算流程往往缺乏这种明确的推理轨迹,导致预测本质上不透明且无法证明其合理性。为填补这一空白,我们提出了PathAgent,一种无需训练、基于大语言模型(LLM)的智能体框架,该框架模拟了人类专家的反思性、逐步分析方法。
Large Language Model-Based Reward Design for Deep Reinforcement Learning-Driven Autonomous Cyber ...
该研究聚焦于复杂动态网络环境中自主网络攻防的奖励设计难题,提出了一种基于大语言模型(LLM)的奖励设计方法,结合深度强化学习(DRL)构建自主网络防御策略。研究背景:传统网络攻防奖励设计依赖领域专家(SMEs),但随着网络状态空间扩大和攻防行为复杂化,专家面临巨大认知负担;而LLM的知识合成与上下文推理能力为解决该问题提供了可能。核心框架。
JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting
自回归大模型逐Token串行解码,推理延迟高;投机解码(SpeculativeDecoding,SD)通过草稿预生成+目标模型并行验证加速生成,但存在缩放天花板:草稿预算增大时,仅当接受率高、草稿开销低自回归树形草稿(EAGLE系列):分支满足因果依赖、接受率高,但树越深串行生成开销越大;双向分块扩散草稿(DFlash/DDTree):单次前向生成整块Token,开销极低,但各位置预测无分支因果约束,生成的树分支内部语义矛盾,大量草稿被拒绝,浪费算力。行业痛点:现有方案只能二选一,无法同时做到。
LLM4EO: Large Language Model for Evolutionary Optimization in Flexible Job Shop Scheduling
本文针对进化算法(EAs)中传统静态算子适应性差、动态算子依赖预定义设计和局部参数控制的局限,提出了一种基于大语言模型(LLMs)的进化优化框架LLM4EO,用于柔性作业车间调度问题(FJSP)的优化。问题背景:传统进化算法的算子设计依赖专家知识,静态参数和固定结构难以适应进化过程中的动态变化,导致搜索性能易退化;现有动态算子方法缺乏全局自适应优化机制。框架构成:LLM4EO包含三大核心组件:基于知识迁移的算子设计:利用LLM迁移经典算子优势,生成高质量初始算子种群;
Adaptive Layer-Wise Transformations for Post-Training Quantization of Large Language Models
该研究聚焦于大型语言模型(LLMs)训练后量化(PTQ)的核心挑战——激活值和权重中的系统性异常值导致低比特量化时性能大幅下降,而现有基于变换的量化方法因采用全层统一变换类型,忽略了各层异构的分布特性,难以达到最优效果。为此,研究提出自适应层-wise变换选择框架核心思路:不同层的统计特性(如异常值分布)决定了其适配的最优变换类型,需为每层单独选择affine变换(适用于分布较平坦的层)或rotation变换(适用于异常值集中的层)。
Empathetic Cascading Networks: A Multi-Stage Prompting Technique for Reducing Social Biases in La...
本报告提出了共情级联网络(ECN)框架,这是一种多阶段提示方法,旨在提升大型语言模型的共情能力和包容性。ECN包含四个阶段——视角采纳、情感共鸣、反思性理解和整合性合成,引导模型生成具有情感共鸣和语境感知的响应。实验结果表明,在GPT-3.5-turbo和GPT-4模型上,ECN均实现了最高的共情商数(EQ)分数,同时保持了具有竞争力的尊重度指标(Regard)和困惑度(Perplexity)指标。这些发现凸显了ECN在对话式人工智能中需要共情与包容性的应用场景中的潜力。
Qwen-AgentWorld: Language World Models for General Agents
世界模型能够基于当前观测与动作预测环境动态,是推理与规划的核心认知机制。本研究探究如何基于大语言模型构建世界模型,进一步突破通用智能体的能力上限。(1)我们首先构建面向智能体环境模拟的基础模型:推出Qwen-AgentWorld-35B-A3B与Qwen-AgentWorld-397B-A17B,这是首批可通过长思维链推理、同时模拟七大智能体交互领域的语言世界模型。
FastMMoE: Accelerating Multimodal Large Language Models through Dynamic Expert Activation and Rou...
多模态大语言模型(MLLMs)已取得令人瞩目的性能,但高分辨率视觉输入会产生长序列视觉tokens,导致显著的推理延迟。在保持性能的同时减少冗余视觉tokens,对于减轻计算/内存负担、推动MLLM在资源受限或延迟敏感场景中的部署至关重要。现有视觉token剪枝方法主要依赖基于注意力的冗余分析,且专为密集架构设计。本文提出Fast多模态混合专家(FastMMoE),一种面向混合专家(MoE)型MLLMs的无训练加速框架,其设计源于路由分析视角。
Supervised Fine Tuning of Large Language Models for Domain Specific Knowledge Graph Construction:...
大语言模型与知识图谱在历史文化领域具有广阔的应用潜力,有助于文化遗产的挖掘、研究与理解。本文以近代湖湘文化孕育的湖南历史名人为案例,预训练大模型可协助研究者从文献中快速提取特定历史人物信息(包括基本详情、生平事件及社会关系)并构建结构化知识图谱,为相关研究提供支持。目前,湖南历史名人的系统性数据收集仍较为匮乏,且通用大语言模型在这类低资源场景中往往存在领域知识提取精度不足、结构化输出能力薄弱等问题。为此,本文提出一种面向领域特定大模型的有监督微调方法,以提升湖南历史名人信息提取的质量与效率。
LLM-MemCluster: Empowering Large Language Models with Dynamic Memory for Text Clustering
大型语言模型(LLMs)凭借其深度语义理解能力,正在重塑无监督学习中的文本聚类任务。然而,它们的直接应用受到两大根本限制:缺乏用于迭代优化的有状态记忆,以及难以控制聚类粒度。因此,现有方法往往依赖包含外部模块的复杂流水线,牺牲了真正的端到端特性。本文提出LLM-MemCluster,一种将聚类重新定义为纯LLM原生任务的新型框架。该框架利用动态记忆(DynamicMemory)注入状态感知能力,并通过双提示策略(Dual-PromptStrategy)使模型能够推理并确定聚类数量。
ChemVTS-Bench: Evaluating Visual-Textual-Symbolic Reasoning of Multimodal Large Language Models i...
本文针对现有化学领域多模态大语言模型(MLLMs)评估基准的不足,提出了——一个专注于评估MLLMs化学领域视觉-文本-符号(VTS)推理能力的领域真实基准。现有基准的局限性:现有化学相关基准多依赖简单图文对,化学语义有限,未覆盖视觉、文本、SMILES(简化分子输入行项系统)等核心模态,且难以评估模型跨模态整合能力,存在对模型推理能力的高估问题。ChemVTS-Bench的核心设计。
A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large La...
基于离散扩散的多模态大语言模型(dMLLMs)凭借并行解码和双向上下文建模的优势,已成为自回归MLLMs的有力替代方案。然而,现有大多数dMLLMs在推理过程中因每个去噪步骤中的全序列注意力计算而面临巨大的计算开销。开创性研究试图通过键值缓存优化或高效采样等模态无关的视角解决这一问题,但大多忽视了视觉token的模态特定冗余。本文对视觉token冗余如何随不同dMLLM架构和任务演化,以及视觉token剪枝如何影响dMLLM响应和效率进行了全面研究。视觉冗余仅出现在处理长回答任务的从零训练dMLLMs中。
Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Langu...
指代多目标跟踪(RMOT)通过引入自然语言参考实现多模态融合跟踪,拓展了传统多目标跟踪(MOT)的应用场景。现有RMOT基准数据集仅描述物体的外观、相对位置和初始运动状态,这种所谓的“静态规则”无法捕捉物体运动的动态变化(包括速度变化和运动方向转换)。该局限性不仅导致静态参考与动态视觉模态之间存在时间差异,还制约了多模态跟踪性能。为解决这一问题,本文提出一种新颖的视觉-运动-参考对齐RMOT框架(VMRMOT)。
Kairos: A Native World Model Stack for Physical AI
世界模型正从被动的视觉生成器,转变为物理AI的基础运行基础设施:模型需要从多源异构数据中原生学习世界知识、在长时序区间内稳定维持全局状态,同时满足真实部署场景下的高效推理约束。本文提出Kairos,一套围绕上述核心需求设计的原生世界模型技术栈。世界学习:首创基于跨具身数据课程的原生预训练范式,将通用互联网视频、人类行为数据、机器人交互数据组织成渐进式训练路径;状态维持:依托搭载混合线性时序注意力的原生一体化架构,统一实现世界理解、画面生成、动作预测三大能力。
ViQ: Text-Aligned Visual Quantized Representations at Any Resolution
统一的图文表征是多模态领域的核心目标,它能够简化建模流程、提升训练效率。但如果仿照文本的离散token形式对图像做离散编码,会不可避免地产生严重信息丢失。现有离散表征方法难以平衡底层视觉细节与高层语义:以图像重建为目标的表征往往缺失语义信息,而语义能力更强的特征又会在量化过程中损失大量细节。本文提出ViQ(视觉量化表征框架),可在离散表征中同时兼顾语义与细节,且支持图像原生分辨率输入,能够作为通用统一离散表征适配任意视觉数据。我们将量化学习拆分为两个阶段:文本对齐预训练、特征离散化。
FIRM: Federated In-client Regularized Multi-objective Alignment for Large Language Models
大型语言模型(LLMs)与人类价值观的对齐通常需要平衡多个相互冲突的目标(如有用性和无害性)。这些模型的训练计算成本高昂,且中心化训练过程引发严重的数据隐私问题。联邦学习(FL)提供了一种极具吸引力的替代方案,但现有的联邦多目标优化(FMOO)方法面临严重的通信瓶颈——由于依赖向服务器传输多个梯度,这种方式对于大型模型而言难以扩展。本文提出FIRM(联邦客户端内正则化多目标对齐算法),这是一种同时实现客户端分歧漂移抑制和通信效率提升的新型算法。在FIRM中,每个客户端本地求解正则化多目标优化问题。
HSKBenchmark: Modeling and Benchmarking Chinese Second Language Acquisition in Large Language Mod...
语言习得对于揭示人类语言智能的本质至关重要,近年来已成为提升大型语言模型(LLMs)可解释性的重要视角。然而,开展需要控制人类学习者语言输入的实验在伦理和实践层面均不可行,这给语言习得建模(尤其是汉语第二语言习得)的可验证性和可扩展性带来挑战。尽管LLMs提供了可控且可复现的替代方案,但支持分阶段建模与评估的系统性基准测试仍处于空白状态。为解决这些问题,本文提出HSKBenchmark——首个用于LLMs汉语第二语言习得分阶段建模与写作评估的基准测试套件。
