Loading...
大语言模型(LLMs)因其规模庞大而面临严峻的部署挑战,训练后量化(PTQ)已成为一种切实可行的压缩方案。然而,目前人们对PTQ如何精确影响LLMs各类知识能力的全面理解仍有待完善,且现有量化模型缩放定律往往忽略了关键的PTQ特定参数和任务特异性敏感性。为填补这些空白,本文通过大量实证研究建立了任务分层的缩放定律。我们将LLMs的知识能力拆解为知识记忆与知识运用能力,并构建了一个整合模型大小、有效位宽、校准集大小和组大小的统一量化框架。
Retrieval Capabilities of Large Language Models Scale with Pretraining FLOPs
检索性能如何随预训练计算量(FLOPs)缩放?我们对参数规模从1.25亿到70亿的大语言模型(LLM)进行了检索性能基准测试,这些模型的预训练数据集规模覆盖10亿到2万亿以上tokens。研究发现,零样本BEIR任务的检索性能可预测地随LLM模型规模、训练时长和估算的FLOPs提升而缩放。我们还表明,在各类检索任务中,上下文学习(In-ContextLearning,ICL)分数与检索分数呈强相关。最后,我们强调了这一发现对基于LLM的检索模型开发的启示意义。
Root Cause Analysis of Radiation Oncology Incidents Using Large Language Models
该研究聚焦大型语言模型(LLMs)在放射肿瘤学事件根本原因分析(RCA)中的应用,旨在评估其推理能力及对患者安全工作的支持潜力。
Towards Synthesizing Normative Data for Cognitive Assessments Using Generative Multimodal Large L...
背景:认知评估需要标准化数据作为评估个体表现的重要基准。因此,基于新型图像刺激开发新的认知测试面临挑战,原因是缺乏可随时获取的标准化数据。传统数据收集方法成本高、耗时长且更新频率低,限制了其实际应用价值。生成式多模态大型语言模型(MLLMs)的最新进展为从现有认知测试图像中生成合成标准化数据提供了新方法。方法:本研究探究了使用多模态大型语言模型(具体为GPT-4o和GPT-4o-mini)为成熟的基于图像的认知评估(如“偷饼干”图片描述任务)合成标准化文本响应的可行性。
Political Ideology Shifts in Large Language Models
大型语言模型(LLMs)正日益应用于政治敏感场景,这引发了人们对其可能编码、放大或被引导至特定意识形态的担忧。本研究以政治指南针测试(PCT)为标准化工具,探究“采用合成角色”对不同模型家族、7个参数规模(7B-70B+)LLM意识形态表达的影响。分析揭示了四个一致模式:(1)更大规模的模型展现出更广泛且更极化的隐性意识形态覆盖;(2)模型对显性意识形态提示的敏感度随规模增大而提升;(3)模型对“右翼威权主义”提示的响应强度高于“左翼自由派”提示;
MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models
混合专家(MoE)模型通过实现大规模参数规模的同时保持计算效率,推动了大语言模型(LLM)和视觉语言模型(VLM)的规模扩展。然而,MoE模型在推理阶段引入了若干挑战,包括专家间负载不均衡以及额外的路由计算开销。为应对这些挑战并充分发挥MoE的优势,对硬件加速技术进行系统评估至关重要。本文提出MoE-Inference-Bench,这是一项全面的研究,用于评估MoE模型在不同场景下的性能。我们分析了批处理大小、序列长度以及FFN维度、专家数量等关键MoE超参数对吞吐量的影响。
Large Language Models as Universal Predictors? An Empirical Study on Small Tabular Datasets
大型语言模型(LLMs)最初为自然语言处理(NLP)而开发,如今已展现出跨模态、跨领域的泛化潜力。凭借上下文学习(ICL)能力,LLMs无需对下游任务进行显式微调,即可处理结构化输入并执行预测任务。本研究通过实证方法,探究了LLMs在小规模结构化数据集上针对分类、回归和聚类任务的函数近似能力。
CoCoA: Confidence and Context-Aware Adaptive Decoding for Resolving Knowledge Conflicts in Large ...
大语言模型(LLMs)的可信生成面临参数记忆与外部语境间知识冲突的挑战。现有专门用于处理冲突的对比解码方法往往缺乏适应性,在低冲突场景下可能导致性能下降。本文提出COCOA(置信度与语境感知自适应解码),这是一种新颖的令牌级算法,用于实现合理的冲突解决并提升生成内容的可信度。COCOA通过利用置信度感知指标(熵差和语境峰值)以及参数分布与语境分布之间的广义散度(Rényi散度)来解决知识冲突。关键在于,即便在低冲突场景下,COCOA仍能保持优异性能。
SurveyGen: Quality-Aware Scientific Survey Generation with Large Language Models
自动综述生成已成为科学文献处理领域的一项关键任务。尽管大型语言模型(LLMs)在生成综述文本方面展现出潜力,但由于缺乏标准化的评估数据集,严重阻碍了对其与人类撰写综述的性能进行严谨评估。在本研究中,我们提出了SurveyGen——一个大规模数据集,包含超过4200篇来自不同科学领域的人类撰写综述,以及242143条引用参考文献,同时还包含这些综述和被引论文的大量质量相关元数据。
CMPhysBench: A Benchmark for Evaluating Large Language Models in Condensed Matter Physics
我们提出了一个全新的基准CMPhysBench,旨在评估大型语言模型(LLMs)在凝聚态物理领域的能力。该基准包含520多道精心挑选的研究生水平题目,涵盖凝聚态物理的代表性子领域与基础理论框架,如磁学、超导、强关联系统等。为确保能深入考察模型对解题过程的理解,我们仅聚焦于计算题,要求模型独立生成完整的解题方案。同时,借助表达式的树形表示,我们引入了可扩展表达式编辑距离(SEED)评分机制,该机制能提供细粒度(非二进制)的部分分数,更精准地评估预测结果与真实结果之间的相似度。
Adaptive Content Restriction for Large Language Models via Suffix Optimization
大型语言模型(LLMs)在多种应用中取得了显著成功。然而,由于其输出空间广阔,实施内容限制仍是一项重大挑战。内容限制的一个方面是通过模型对齐方法(如监督微调,SFT)防止LLMs生成有害内容。然而,内容限制的需求可能因用户群体而异,随时间快速变化,且并不总是与“有害性”的通用定义一致。由于高昂的计算、数据和存储需求,为每个特定场景应用SFT并不现实。基于这一需求,我们提出了一项新任务——自适应内容限制(AdaCoRe),其核心是轻量级策略(无需模型微调的方法),以阻止已部署的LLMs为特定场景生成受限术语。
Unraveling the cognitive patterns of Large Language Models through module communities
大型语言模型(LLMs)凭借从科学发现、医疗诊断到聊天机器人等各类应用,在科学、工程和社会领域取得重大进展,重塑了我们的世界。尽管LLMs应用广泛且实用性强,但其底层机制仍隐藏在数十亿参数和复杂结构中,导致其内部架构与认知过程难以理解。为填补这一空白,我们借鉴生物学中理解认知涌现的方法,开发了一个基于网络的框架,将认知技能、LLM架构与数据集关联起来,为基础模型分析带来范式转变。
Survey of Specialized Large Language Model
专用大型语言模型(LLMs)的快速演进已从简单的领域适配过渡到复杂的原生架构,标志着人工智能(AI)发展的范式转变。本综述系统考察了该技术在医疗、金融、法律和技术领域的发展进程。除专用LLMs的广泛应用外,近期LLM智能体(Agent)还采用了多项技术突破,例如超越微调的领域原生设计、通过稀疏计算与量化提升参数效率、增强多模态能力融合等。分析表明,这些创新解决了通用LLMs在专业应用中的核心局限性,且专用模型在领域特定基准测试中持续展现性能优势。
Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement...
大型语言模型(LLMs)已在各类自然语言处理任务中展现出令人印象深刻的能力,但它们本质上仍属于无状态模型,受限于有限的上下文窗口,难以实现长程推理。近期为解决这一局限的研究常通过外部记忆库增强LLMs,但现有方案多为静态且依赖启发式策略,缺乏用于决策“存储、更新或检索什么信息”的学习机制。本文提出Memory-R1记忆管理器(MemoryManager):学习执行结构化记忆操作,包括对记忆条目进行添加(ADD)、更新(UPDATE)、删除(DELETE)或不操作(NOOP);
Spatio-Temporal Pruning for Compressed Spiking Large Language Models
由于模型规模庞大且推理延迟较高,大语言模型(LLMs)在能量受限环境中的部署面临重大挑战。脉冲神经网络(SNNs)受大脑中稀疏事件驱动神经处理和高能效信息传输机制的启发,为实现低功耗计算提供了一种极具潜力的方案。将脉冲神经元的事件驱动效率与LLMs的先进能力相结合,是构建高能效LLMs的重要方向。本研究重点探索压缩型脉冲大语言模型(SpikingLLMs)的设计方法:从SNNs的视角重新审视空间剪枝与时间剪枝技术,提出一种新颖的时空剪枝框架,旨在优化SpikingLLMs的计算效率,同时保持其高性能。
Error Reflection Prompting: Can Large Language Models Successfully Understand Errors?
思维链(CoT)等语言模型提示方法为问题解决提供了直观的逐步推理过程,这些方法旨在帮助模型更好地理解完成特定任务的正确流程。尽管取得了这些进展,思维链仍缺乏反思和纠错能力,这可能导致模型持续犯错。因此,受人类反思与纠错能力的启发,我们提出了错误反思提示(ERP)方法,以进一步提升语言模型的推理能力。错误反思提示基于思维链构建,由错误答案、错误识别和正确答案三部分构成。该过程能让模型识别错误类型及导致错误答案的推理步骤,从而更好地分辨需规避的步骤和应采取的步骤。
Assessing Consciousness-Related Behaviors in Large Language Models Using the Maze Test
本文采用“迷宫测试”(MazeTest)研究大型语言模型(LLMs)的类意识行为,要求模型以第一人称视角完成迷宫导航任务。该测试可同时考察空间感知、视角转换、目标导向行为与时间序列能力——这些均为与意识相关的核心特征。在将各类意识理论整合提炼为13项核心意识特征后,我们在零样本、单样本和少样本三种学习场景下,对12个主流LLM进行了评估。结果表明,具备推理能力的LLM始终优于普通版本:其中Gemini2.0Pro的“完全路径准确率”达52.9%,DeepSeek-R1的“部分路径准确率”达80.5%
SDGO: Self-Discrimination-Guided Optimization for Consistent Safety in Large Language Models
大型语言模型(LLMs)在各类自然语言处理任务中表现卓越,但仍易受越狱攻击影响,进而生成有害内容。本文揭示了一个关键的安全不一致性问题:LLMs作为判别器识别有害请求的能力,显著强于其作为生成器抵御这些请求的能力。这一发现启发我们探索如何对齐模型固有的判别能力与生成能力。为此,我们提出SDGO(自判别引导优化)——一种强化学习框架,该框架利用模型自身的判别能力作为奖励信号,通过迭代式自我改进提升生成安全性。在训练阶段,我们的方法无需任何额外标注数据或外部模型。
FAIRGAMER: Evaluating Biases in the Application of Large Language Models to Video Games
借助先进能力,大型语言模型(LLMs)在视频游戏领域展现出巨大应用潜力——从动态场景生成、智能非玩家角色(NPC)交互到自适应对手,可替代或增强传统游戏机制。然而,LLMs在该应用场景中的可信度尚未得到充分探索。本文揭示,在真实游戏环境中,模型固有的社会偏见会直接破坏游戏平衡性。为此,本文提出FAIRGAMER——首个针对游戏场景中LLMs偏见的评估基准,该基准包含6项任务及一项新指标DlstdD_{lstd}Dlstd。
DiscussLLM: Teaching Large Language Models When to Speak
问题形式化:首次将LLM“主动发言时机判断”问题明确形式化为“沉默令牌预测+干预内容生成”的联合任务,填补了反应式LLM向主动协作式LLM演进的理论空白。可扩展数据生成方案:提出两阶段合成数据pipeline,从真实话题出发生成结构化场景与标注明确的对话数据,解决了“何时发言”任务高质量数据稀缺的痛点,且可适配不同领域与干预类型。解耦架构的效率突破:设计轻量级分类器+重量级生成器的解耦系统,在保证较高准确率的前提下,大幅降低计算延迟与内存占用,为实际场景(如实时对话助手)部署提供可行方案。
