Loading...

JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting
自回归大模型逐Token串行解码,推理延迟高;投机解码(SpeculativeDecoding,SD)通过草稿预生成+目标模型并行验证加速生成,但存在缩放天花板:草稿预算增大时,仅当接受率高、草稿开销低自回归树形草稿(EAGLE系列):分支满足因果依赖、接受率高,但树越深串行生成开销越大;双向分块扩散草稿(DFlash/DDTree):单次前向生成整块Token,开销极低,但各位置预测无分支因果约束,生成的树分支内部语义矛盾,大量草稿被拒绝,浪费算力。行业痛点:现有方案只能二选一,无法同时做到。

LLM4EO: Large Language Model for Evolutionary Optimization in Flexible Job Shop Scheduling
本文针对进化算法(EAs)中传统静态算子适应性差、动态算子依赖预定义设计和局部参数控制的局限,提出了一种基于大语言模型(LLMs)的进化优化框架LLM4EO,用于柔性作业车间调度问题(FJSP)的优化。问题背景:传统进化算法的算子设计依赖专家知识,静态参数和固定结构难以适应进化过程中的动态变化,导致搜索性能易退化;现有动态算子方法缺乏全局自适应优化机制。框架构成:LLM4EO包含三大核心组件:基于知识迁移的算子设计:利用LLM迁移经典算子优势,生成高质量初始算子种群;

Adaptive Layer-Wise Transformations for Post-Training Quantization of Large Language Models
该研究聚焦于大型语言模型(LLMs)训练后量化(PTQ)的核心挑战——激活值和权重中的系统性异常值导致低比特量化时性能大幅下降,而现有基于变换的量化方法因采用全层统一变换类型,忽略了各层异构的分布特性,难以达到最优效果。为此,研究提出自适应层-wise变换选择框架核心思路:不同层的统计特性(如异常值分布)决定了其适配的最优变换类型,需为每层单独选择affine变换(适用于分布较平坦的层)或rotation变换(适用于异常值集中的层)。

Empathetic Cascading Networks: A Multi-Stage Prompting Technique for Reducing Social Biases in La...
本报告提出了共情级联网络(ECN)框架,这是一种多阶段提示方法,旨在提升大型语言模型的共情能力和包容性。ECN包含四个阶段——视角采纳、情感共鸣、反思性理解和整合性合成,引导模型生成具有情感共鸣和语境感知的响应。实验结果表明,在GPT-3.5-turbo和GPT-4模型上,ECN均实现了最高的共情商数(EQ)分数,同时保持了具有竞争力的尊重度指标(Regard)和困惑度(Perplexity)指标。这些发现凸显了ECN在对话式人工智能中需要共情与包容性的应用场景中的潜力。

Qwen-AgentWorld: Language World Models for General Agents
世界模型能够基于当前观测与动作预测环境动态,是推理与规划的核心认知机制。本研究探究如何基于大语言模型构建世界模型,进一步突破通用智能体的能力上限。(1)我们首先构建面向智能体环境模拟的基础模型:推出Qwen-AgentWorld-35B-A3B与Qwen-AgentWorld-397B-A17B,这是首批可通过长思维链推理、同时模拟七大智能体交互领域的语言世界模型。

FastMMoE: Accelerating Multimodal Large Language Models through Dynamic Expert Activation and Rou...
多模态大语言模型(MLLMs)已取得令人瞩目的性能,但高分辨率视觉输入会产生长序列视觉tokens,导致显著的推理延迟。在保持性能的同时减少冗余视觉tokens,对于减轻计算/内存负担、推动MLLM在资源受限或延迟敏感场景中的部署至关重要。现有视觉token剪枝方法主要依赖基于注意力的冗余分析,且专为密集架构设计。本文提出Fast多模态混合专家(FastMMoE),一种面向混合专家(MoE)型MLLMs的无训练加速框架,其设计源于路由分析视角。

Supervised Fine Tuning of Large Language Models for Domain Specific Knowledge Graph Construction:...
大语言模型与知识图谱在历史文化领域具有广阔的应用潜力,有助于文化遗产的挖掘、研究与理解。本文以近代湖湘文化孕育的湖南历史名人为案例,预训练大模型可协助研究者从文献中快速提取特定历史人物信息(包括基本详情、生平事件及社会关系)并构建结构化知识图谱,为相关研究提供支持。目前,湖南历史名人的系统性数据收集仍较为匮乏,且通用大语言模型在这类低资源场景中往往存在领域知识提取精度不足、结构化输出能力薄弱等问题。为此,本文提出一种面向领域特定大模型的有监督微调方法,以提升湖南历史名人信息提取的质量与效率。

LLM-MemCluster: Empowering Large Language Models with Dynamic Memory for Text Clustering
大型语言模型(LLMs)凭借其深度语义理解能力,正在重塑无监督学习中的文本聚类任务。然而,它们的直接应用受到两大根本限制:缺乏用于迭代优化的有状态记忆,以及难以控制聚类粒度。因此,现有方法往往依赖包含外部模块的复杂流水线,牺牲了真正的端到端特性。本文提出LLM-MemCluster,一种将聚类重新定义为纯LLM原生任务的新型框架。该框架利用动态记忆(DynamicMemory)注入状态感知能力,并通过双提示策略(Dual-PromptStrategy)使模型能够推理并确定聚类数量。

ChemVTS-Bench: Evaluating Visual-Textual-Symbolic Reasoning of Multimodal Large Language Models i...
本文针对现有化学领域多模态大语言模型(MLLMs)评估基准的不足,提出了——一个专注于评估MLLMs化学领域视觉-文本-符号(VTS)推理能力的领域真实基准。现有基准的局限性:现有化学相关基准多依赖简单图文对,化学语义有限,未覆盖视觉、文本、SMILES(简化分子输入行项系统)等核心模态,且难以评估模型跨模态整合能力,存在对模型推理能力的高估问题。ChemVTS-Bench的核心设计。

A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large La...
基于离散扩散的多模态大语言模型(dMLLMs)凭借并行解码和双向上下文建模的优势,已成为自回归MLLMs的有力替代方案。然而,现有大多数dMLLMs在推理过程中因每个去噪步骤中的全序列注意力计算而面临巨大的计算开销。开创性研究试图通过键值缓存优化或高效采样等模态无关的视角解决这一问题,但大多忽视了视觉token的模态特定冗余。本文对视觉token冗余如何随不同dMLLM架构和任务演化,以及视觉token剪枝如何影响dMLLM响应和效率进行了全面研究。视觉冗余仅出现在处理长回答任务的从零训练dMLLMs中。

Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Langu...
指代多目标跟踪(RMOT)通过引入自然语言参考实现多模态融合跟踪,拓展了传统多目标跟踪(MOT)的应用场景。现有RMOT基准数据集仅描述物体的外观、相对位置和初始运动状态,这种所谓的“静态规则”无法捕捉物体运动的动态变化(包括速度变化和运动方向转换)。该局限性不仅导致静态参考与动态视觉模态之间存在时间差异,还制约了多模态跟踪性能。为解决这一问题,本文提出一种新颖的视觉-运动-参考对齐RMOT框架(VMRMOT)。

Kairos: A Native World Model Stack for Physical AI
世界模型正从被动的视觉生成器,转变为物理AI的基础运行基础设施:模型需要从多源异构数据中原生学习世界知识、在长时序区间内稳定维持全局状态,同时满足真实部署场景下的高效推理约束。本文提出Kairos,一套围绕上述核心需求设计的原生世界模型技术栈。世界学习:首创基于跨具身数据课程的原生预训练范式,将通用互联网视频、人类行为数据、机器人交互数据组织成渐进式训练路径;状态维持:依托搭载混合线性时序注意力的原生一体化架构,统一实现世界理解、画面生成、动作预测三大能力。

ViQ: Text-Aligned Visual Quantized Representations at Any Resolution
统一的图文表征是多模态领域的核心目标,它能够简化建模流程、提升训练效率。但如果仿照文本的离散token形式对图像做离散编码,会不可避免地产生严重信息丢失。现有离散表征方法难以平衡底层视觉细节与高层语义:以图像重建为目标的表征往往缺失语义信息,而语义能力更强的特征又会在量化过程中损失大量细节。本文提出ViQ(视觉量化表征框架),可在离散表征中同时兼顾语义与细节,且支持图像原生分辨率输入,能够作为通用统一离散表征适配任意视觉数据。我们将量化学习拆分为两个阶段:文本对齐预训练、特征离散化。

FIRM: Federated In-client Regularized Multi-objective Alignment for Large Language Models
大型语言模型(LLMs)与人类价值观的对齐通常需要平衡多个相互冲突的目标(如有用性和无害性)。这些模型的训练计算成本高昂,且中心化训练过程引发严重的数据隐私问题。联邦学习(FL)提供了一种极具吸引力的替代方案,但现有的联邦多目标优化(FMOO)方法面临严重的通信瓶颈——由于依赖向服务器传输多个梯度,这种方式对于大型模型而言难以扩展。本文提出FIRM(联邦客户端内正则化多目标对齐算法),这是一种同时实现客户端分歧漂移抑制和通信效率提升的新型算法。在FIRM中,每个客户端本地求解正则化多目标优化问题。

HSKBenchmark: Modeling and Benchmarking Chinese Second Language Acquisition in Large Language Mod...
语言习得对于揭示人类语言智能的本质至关重要,近年来已成为提升大型语言模型(LLMs)可解释性的重要视角。然而,开展需要控制人类学习者语言输入的实验在伦理和实践层面均不可行,这给语言习得建模(尤其是汉语第二语言习得)的可验证性和可扩展性带来挑战。尽管LLMs提供了可控且可复现的替代方案,但支持分阶段建模与评估的系统性基准测试仍处于空白状态。为解决这些问题,本文提出HSKBenchmark——首个用于LLMs汉语第二语言习得分阶段建模与写作评估的基准测试套件。

The Empowerment of Science of Science by Large Language Models: New Tools and Methods
定义与研究范畴:SciSci是对科学本身进行定量研究的交叉学科,涵盖科学家、学术文献、期刊、科研政策等对象,聚焦创新过程分析、影响力评估、合作与引用模式建模等方向,为管理科学与政策制定提供支撑。发展演进:早期以引文分析为核心(依赖SCI数据库),发现“马太效应”“隐形学院”等现象;中期引入知识图谱与可视化工具(如CiteSpace、VOSviewer);

Evaluating Adversarial Vulnerabilities in Modern Large Language Models
近年来,大型语言模型(LLMs)的快速兴起及其在各类应用中的广泛整合,使得深入理解其安全漏洞变得至关重要。本文对两款主流公开LLM——谷歌Gemini2.5Flash和OpenAI的GPT-4(特指免费版可访问的GPT-4omini模型)的越狱攻击易感性进行了比较分析。研究采用两种主要绕过策略:“自我绕过”(模型被提示规避自身安全协议)和“交叉绕过”(一个模型生成对抗性提示词以利用另一个模型的漏洞)。

Utilizing Large Language Models for Zero-Shot Medical Ontology Extension from Clinical Notes
整合新型医疗概念及关系到现有本体中,能显著提升其在生物医学研究和临床应用中的覆盖范围与实用性。临床笔记作为富含详细患者观察记录的非结构化文档,提供了极具价值的情境化见解,是本体扩展的潜力数据源,但目前尚未得到充分利用。尽管具备这一潜力,直接利用临床笔记进行本体扩展的相关研究仍较为匮乏。为填补这一空白,本文提出CLOZE框架,该框架借助大型语言模型(LLMs)从临床笔记中自动提取医疗实体,并将其整合到层级化医学本体中。

Learning to Compress: Unlocking the Potential of Large Language Models for Text Representation
文本表示在聚类、检索及其他下游应用中发挥着关键作用。随着大型语言模型(LLMs)的兴起,利用其能力实现文本表示的关注度日益提升。然而,大多数LLMs本质上是因果模型,且针对下一个token预测进行优化,这使其在生成整体连贯的表示时并非最优。为解决这一问题,近期研究引入了pretext任务以适配LLMs用于文本表示。但这些任务大多依赖token级预测目标,例如LLM2Vec中使用的掩码下一个token预测(MNTP)。

Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance
尽管百亿(10B)级工业基础模型不断拓宽图像修复的性能上限,但其高昂的计算开销严重限制了实际落地部署。构建高度优化、面向单一任务的专用模型是一条可行的解决思路;但对模型进行极致结构压缩时,不可避免会出现严重的表征瓶颈。针对该问题,本文提出Moebius——一款高效轻量图像修复框架。本文通过提出局部λ混合交互(LλMI)模块,系统性重构扩散模型主干网络。

欢迎留下您的脚印