Loading...
叙事驱动人类行为,是地缘政治的核心,但长期以来难以量化其重叠性与演变过程。本文提出一种可解释模型,整合成熟的词袋(BoW)主题表示与新型基于LLM的问答(Q&A)叙事模型,二者共享潜在的再生核希尔伯特空间表示,用于量化文本文档。该方法在无需LLM全量推断的前提下,缓解了使用LLM分析大规模语料时面临的成本、可解释性与泛化性挑战。我们推导了高效的函数梯度下降更新规则,这些规则具有可解释性,且在结构上与Transformer中的自注意力机制类似。
Understanding Counting Mechanisms in Large Language and Vision-Language Models
本文探讨了大型语言模型(LLMs)和大型视觉-语言模型(LVLMs)在计数任务中如何表示和计算数值信息。我们通过包含重复文本和视觉项目的受控实验,并借助因果中介分析和激活修补技术分析模型行为。为此,我们设计了一款名为CountScope的专用工具,用于数值内容的机制可解释性研究。结果表明,单个token或视觉特征会编码潜在的位置计数信息,这些信息可被提取并在不同上下文间传递。分层分析显示数值表征逐步涌现:低层编码小计数,高层表征大计数。
Large Language Models for Sentiment Analysis to Detect Social Challenges: A Use Case with South A...
该研究聚焦于利用大型语言模型(LLMs)对南非社交媒体帖子进行情感分析,以识别社会挑战。研究背景与目标:南非作为多语言国家(12种官方语言),低资源语言的情感分析工具匮乏,而社会挑战的精准识别对政府施策至关重要。研究旨在评估主流LLMs在英语、塞佩迪语(Sepedi)和茨瓦纳语(Setswana)中的零样本情感分析性能,覆盖就业、卫生、教育等10个南非政府重点关注的议题。实验设计。
VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models
本技术报告提出VibeThinker-3B,一款仅含30亿参数的紧凑型稠密大模型,旨在探究严格小模型体系下,可验证推理能力的性能上限。本文基于「频谱-信号」后训练范式,搭建一套优化完整训练流水线,通过课程式监督微调、多域强化学习、离线自蒸馏对模型推理能力进行系统性增强。大量实验证明,VibeThinker-3B在高难度可验证推理任务上达到行业前沿水平:在AIME26美国高中数学邀请赛取得94.3分,搭配声明级测试时缩放策略可提升至97.1;LiveCodeBenchv6代码基准一次通过率达80.2;
FastContext: Training Efficient Repository Explorer for Coding Agents
大语言模型(LLM)驱动的代码智能体在各类软件工程任务中已取得亮眼效果,但代码仓库探索环节仍是核心瓶颈:定位目标代码会消耗海量token,且大量无关代码片段会污染智能体上下文。现有绝大多数代码智能体采用单一模型同时完成仓库检索与问题求解,所有检索读取、搜索的中间过程都会残留在求解智能体的对话历史中。本文提出FastContext——一款专用探索子智能体,将仓库检索与任务求解彻底解耦。主智能体可按需调用FastContext,该子智能体并行执行多工具调用,仅输出精简的文件路径与代码行区间作为聚焦上下文。
Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models
本文聚焦大型语言模型(LLMs)的激活空间攻击风险,提出一种名为敏感度缩放导向(SSS)的白盒攻击方法。核心发现是解码器-onlyLLMs的中间激活层存在“注意力汇”(BOS令牌主导)和“压缩谷”(中层表示坍缩到低秩子空间),两者共同构成高增益区域,使微小扰动能通过自回归生成过程因果放大(因果放大效应CAE),实现行为渐变操控。SSS通过两阶段攻击实现高效操控:一是BOS锚定,在压缩谷层注入语义对齐的种子扰动;二是自适应强化,根据模型局部敏感度动态调整后续令牌的微扰强度。
LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling
循环Transformer通过重复复用共享模块扩展模型隐空间计算能力,但串行循环会随循环次数增加同步提升推理延迟与KV缓存内存占用。并行循环Transformer(PLT)通过跨循环位置偏移(CLP)和共享KV门控滑动窗口注意力缓解该开销,让循环次数成为可落地的设计参数。本文从收益-成本视角研究PLT的循环次数选择问题:额外循环虽能优化特征表征,但CLP机制会在每一处循环边界引入token位置不匹配损耗。
AI systems out-persuade expert humans
诸多社会重大决策最终取决于说服博弈的结果。对话式人工智能是这场博弈中一股全新的强大力量,但学界此前尚不明确:AI的说服能力能否超越受过专业训练、拥有高额激励的人类说服者。本文开展四项预先注册的对照实验,共计6923名被试、18978场对话,将大语言模型与多类人类说服者正面比拼:普通民众、四轮线上说服锦标赛优胜者、职业街头游说员、世界锦标赛辩论选手。实验结果稳定证实:即便给予人类专家自主选题、前置调研、数小时结构化实战练习、最高1000英镑现金奖励等全部有利条件,AI的说服效果仍显著更强。
TestWeaver: Execution-aware, Feedback-driven Regression Testing Generation with Large Language Mo...
回归测试确保代码变更不会意外破坏现有功能。尽管大语言模型(LLMs)在自动化回归测试生成方面显示出潜力,但它们往往在程序执行推理上存在局限,导致覆盖增长停滞——这种现象被称为“覆盖停滞”。本文提出了TestWeaver,一种新颖的基于LLM的方法,它整合了轻量级程序分析以更有效地引导测试生成。TestWeaver引入了三项关键创新:(1)通过向LLM提供目标行的反向切片(而非完整程序上下文),减少幻觉并提高聚焦性;
Pier: Efficient Large Language Model pretraining with Relaxed Global Communication
本文针对大型语言模型(LLM)预训练中全局通信(如all-reduce、all-gather)成为性能瓶颈的问题,提出了一种高效可扩展的优化框架Pier。该框架基于DiLoCo的双层优化结构(组内局部优化器+组间全局优化器),通过改进技术解决了DiLoCo存在的性能下降问题,并优化了并行架构以支持复杂训练场景。问题背景:LLM预训练依赖大规模分布式GPU集群,传统优化器(如AdamW)的全局通信导致扩展效率低下(如32A100GPU上GPT-21.5B训练扩展效率仅42.7%);
LLM4AMC: Adapting Large Language Models for Adaptive Modulation and Coding
本文聚焦5G新空口(NR)中的自适应调制编码(AMC)技术,针对传统AMC方案中因信道质量指示符(CQI)时效性衰减(反馈延迟导致)引发的链路性能下降问题,提出了一种基于大语言模型(LLM)的信道质量预测与AMC优化方法——LLM4AMC。研究背景:AMC作为链路自适应的核心技术,通过根据信道条件(基于信号与干扰加噪声比SINR推导的CQI)动态选择调制编码方案(MCS),平衡传输效率与可靠性。
Hallucinate Less by Thinking More: Aspect-Based Causal Abstention for Large Language Models
大语言模型(LLMs)经常生成流畅但事实错误的响应,这种现象被称为幻觉。回避机制(模型选择不回答而输出“我不知道”等表述)是一种常见的保障手段。然而,现有回避方法通常依赖生成后的信号(如生成变异或反馈),这限制了它们提前预防不可靠响应的能力。本文提出基于方面的因果回避(ABCA),这是一个新框架,通过因果推理分析LLM知识的内部多样性,实现生成前回避。这种多样性反映了从不同来源获取的参数化知识的多面性,代表了学科、法律背景或时间框架等不同方面。
Narratives to Numbers: Large Language Models and Economic Policy Uncertainty
本研究将大语言模型视为可估计分类器进行评估,并阐明了建模选择如何影响下游测量误差。通过重新审视经济政策不确定性(EPU)指数,我们发现现代分类器显著优于词典规则,更能贴合人类审核评估结果,且可自然拓展至含噪声的历史新闻和多语言新闻分析场景。我们利用这些工具,基于超过3.6亿篇报纸文章构建了新的19世纪美国EPU指数,并通过单一多语言模型构建了探索性的跨国指数。综合来看,研究结果表明,大语言模型(LLMs)能系统性改进文本衍生指标,应作为明确的测量工具整合到实证经济学研究中。
PathAgent: Toward Interpretable Analysis of Whole-slide Pathology Images via Large Language Model...
分析全切片图像(WSIs)需要一个迭代的、基于证据的推理过程,这与病理学家在收集证据时动态缩放、重新聚焦和自我修正的方式相似。然而,现有的计算流程往往缺乏这种明确的推理轨迹,导致预测本质上不透明且无法证明其合理性。为填补这一空白,我们提出了PathAgent,一种无需训练、基于大语言模型(LLM)的智能体框架,该框架模拟了人类专家的反思性、逐步分析方法。
Large Language Model-Based Reward Design for Deep Reinforcement Learning-Driven Autonomous Cyber ...
该研究聚焦于复杂动态网络环境中自主网络攻防的奖励设计难题,提出了一种基于大语言模型(LLM)的奖励设计方法,结合深度强化学习(DRL)构建自主网络防御策略。研究背景:传统网络攻防奖励设计依赖领域专家(SMEs),但随着网络状态空间扩大和攻防行为复杂化,专家面临巨大认知负担;而LLM的知识合成与上下文推理能力为解决该问题提供了可能。核心框架。
JetSpec: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting
自回归大模型逐Token串行解码,推理延迟高;投机解码(SpeculativeDecoding,SD)通过草稿预生成+目标模型并行验证加速生成,但存在缩放天花板:草稿预算增大时,仅当接受率高、草稿开销低自回归树形草稿(EAGLE系列):分支满足因果依赖、接受率高,但树越深串行生成开销越大;双向分块扩散草稿(DFlash/DDTree):单次前向生成整块Token,开销极低,但各位置预测无分支因果约束,生成的树分支内部语义矛盾,大量草稿被拒绝,浪费算力。行业痛点:现有方案只能二选一,无法同时做到。
LLM4EO: Large Language Model for Evolutionary Optimization in Flexible Job Shop Scheduling
本文针对进化算法(EAs)中传统静态算子适应性差、动态算子依赖预定义设计和局部参数控制的局限,提出了一种基于大语言模型(LLMs)的进化优化框架LLM4EO,用于柔性作业车间调度问题(FJSP)的优化。问题背景:传统进化算法的算子设计依赖专家知识,静态参数和固定结构难以适应进化过程中的动态变化,导致搜索性能易退化;现有动态算子方法缺乏全局自适应优化机制。框架构成:LLM4EO包含三大核心组件:基于知识迁移的算子设计:利用LLM迁移经典算子优势,生成高质量初始算子种群;
Adaptive Layer-Wise Transformations for Post-Training Quantization of Large Language Models
该研究聚焦于大型语言模型(LLMs)训练后量化(PTQ)的核心挑战——激活值和权重中的系统性异常值导致低比特量化时性能大幅下降,而现有基于变换的量化方法因采用全层统一变换类型,忽略了各层异构的分布特性,难以达到最优效果。为此,研究提出自适应层-wise变换选择框架核心思路:不同层的统计特性(如异常值分布)决定了其适配的最优变换类型,需为每层单独选择affine变换(适用于分布较平坦的层)或rotation变换(适用于异常值集中的层)。
Empathetic Cascading Networks: A Multi-Stage Prompting Technique for Reducing Social Biases in La...
本报告提出了共情级联网络(ECN)框架,这是一种多阶段提示方法,旨在提升大型语言模型的共情能力和包容性。ECN包含四个阶段——视角采纳、情感共鸣、反思性理解和整合性合成,引导模型生成具有情感共鸣和语境感知的响应。实验结果表明,在GPT-3.5-turbo和GPT-4模型上,ECN均实现了最高的共情商数(EQ)分数,同时保持了具有竞争力的尊重度指标(Regard)和困惑度(Perplexity)指标。这些发现凸显了ECN在对话式人工智能中需要共情与包容性的应用场景中的潜力。
Qwen-AgentWorld: Language World Models for General Agents
世界模型能够基于当前观测与动作预测环境动态,是推理与规划的核心认知机制。本研究探究如何基于大语言模型构建世界模型,进一步突破通用智能体的能力上限。(1)我们首先构建面向智能体环境模拟的基础模型:推出Qwen-AgentWorld-35B-A3B与Qwen-AgentWorld-397B-A17B,这是首批可通过长思维链推理、同时模拟七大智能体交互领域的语言世界模型。
