Loading...
本文聚焦大型语言模型(LLMs)的内在信息处理机制,提出了一种基于信息论的任务无关方法,通过量化“认知轮廓”(CognitiveProfile)分析模型的智能特征。核心思路是利用“熵衰减曲线”(EntropyDecayCurve)追踪模型的归一化预测不确定性随上下文长度的变化,并引入“信息增益跨度”(IGS)指数总结曲线特征。模型规模显著影响认知轮廓:大模型(如Llama3.3)的熵衰减曲线下降更剧烈,能从“发散思考”快速过渡到“精确推理”;小模型的曲线更平缓,长上下文下不确定性仍较高。
Understanding Large Language Models‘ Ability on Interdisciplinary Research
近年来,大型语言模型(LLMs)的进展揭示了它们在复杂领域中执行多步骤、逻辑驱动推理的惊人能力,使它们成为科学发现中的强大工具和合作者,同时挑战了“灵感驱动的构思是人类独有的”这一长期观点。然而,缺乏一个专门的基准来评估LLMs在跨学科研究(IDR)场景中提出思想的能力,这严重阻碍了对其优势和局限性的充分理解。为填补这一空白,我们引入了IDRBench——一个开创性的基准,包含专家标注的数据集和一套专门设计的任务,用于评估LLMs从不同科学领域中为跨学科研究提出有价值研究思想的能力。
Is Large Language Model Performance on Reasoning Tasks Impacted by Different Ways Questions Are A...
大型语言模型(LLMs)已通过多种问题类型进行评估,例如选择题、判断题和长短简答题。本研究探讨了一个尚未被研究的问题:不同问题类型对LLM在推理任务上的准确性有何影响?我们通过定量推理和演绎推理任务,研究了5个LLM在三种不同问题类型上的表现。评估指标包括推理步骤的准确性和最终答案的选择准确性。主要发现:(1)不同问题类型下,LLM的表现存在显著差异;(2)推理准确性与最终答案选择准确性不一定相关;(3)选项数量和用词选择会影响LLM的表现。
Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Larg...
本文聚焦多模态大型语言模型(MLLMs)中的“物体幻觉”问题(即模型生成图像中不存在的物体等事实错误输出),深入探究了模型先验知识在中间层对视觉信息的抑制机制。研究发现,中间层的视觉事实知识与原始输入和纯文本输入的概率分布差异(通过JS散度量化)具有相似的演化趋势。动态目标层选择:通过计算中间层原始输入与纯文本输入的JS散度,选择散度最大的中间层作为目标层(该层含最丰富的视觉事实知识);视觉事实知识解码。
Applying the Chinese Wall Reverse Engineering Technique to Large Language Model Code Editing
本文聚焦代码大语言模型(CodeLLM)的版权争议与性能提升问题。核心背景是:主流商业代码大语言模型(如GPT-4、Gemini2.5Pro等)的训练数据不公开,可能包含受版权保护的开源代码,存在侵权风险;而部分注重数据合规性的模型(如Comma、Starcoder2)因训练数据有限,性能较弱,缺乏竞争力。
Metaphor and Large Language Models: When Surface Features Matter More than Deep Understanding
本文全面评估了大型语言模型(LLMs)在多个数据集、任务和提示配置下的隐喻理解能力。尽管隐喻处理在自然语言处理(NLP)领域已受到广泛关注,但以往研究局限于单一数据集评估和特定任务设置,且常通过词汇替换构建人工数据。为解决这些局限,我们利用多样化的公开数据集(含推理和隐喻标注)开展了大量实验,重点关注自然语言推理(NLI)和问答(QA)任务。结果表明,LLMs的表现更多受词汇重叠、句子长度等特征影响,而非隐喻内容。
StackTrans: From Large Language Model to Large Pushdown Automata Model
本文针对Transformer架构在捕获乔姆斯基层级(如正则表达式、确定性上下文无关文法)方面的固有局限,提出了一种名为STACKTRANS的新型模型。该模型受下推自动机(使用栈高效处理确定性上下文无关文法)启发,在Transformer层间引入隐藏状态栈,通过可微分的栈操作(推入、弹出、无操作)实现端到端训练,同时保持与现有框架(如flash-attention)的兼容性。
A Novel Self-Evolution Framework for Large Language Models
大型语言模型(LLMs)的能力在一定程度上受限于预训练,因此一些研究者通过后训练对其进行优化。现有的后训练策略(如基于记忆的检索或偏好优化)虽能提升用户对齐,但无法增强模型的领域认知。为填补这一空白,我们提出了一种新颖的双阶段自进化(DPSE)框架,可联合优化用户偏好适应和特定领域能力。DPSE引入了审查模块,用于提取多维交互信号并估计满意度分数,通过主题感知和偏好驱动策略指导结构化数据扩展。这些扩展后的数据集支持两阶段微调流程:先进行监督领域接地,再进行频率感知的偏好优化。
ChiMed 2.0: Advancing Chinese Medical Dataset in Facilitating Large Language Modeling
本文介绍了一个大规模中文医疗数据集ChiMed2.0,旨在推动中文医疗领域大语言模型(LLM)的研究与应用。该数据集扩展了此前的ChiMed工作,整合了来自中文医疗在线平台的真实数据和LLM生成的数据,涵盖传统中医经典文献和现代通用医疗数据,总规模达2.044亿汉字。具体而言,ChiMed2.0包含三部分核心数据:16.48万篇预训练文档、35.16万对有监督微调(SFT)问答对、4.17万条人类反馈强化学习(RLHF)偏好数据元组。
SimdBench: Benchmarking Large Language Models for SIMD-Intrinsic Code Generation
本文提出了SimdBench,这是首个专门用于评估大型语言模型(LLMs)生成SIMDintrinsic代码能力的基准测试。SIMD(单指令多数据)指令通过并行处理多个数据项加速性能关键任务,而SIMDintrinsic是编译器提供的内置函数,允许程序员在高级语言中显式调用SIMD指令,平衡编码效率与高性能。现有代码生成基准主要关注标量代码,缺乏对SIMDintrinsic代码的评估。
The Generative Energy Arena (GEA): Incorporating Energy Awareness in Large Language Model (LLM) H...
本文针对大型语言模型(LLMs)评估中能源消耗因素被忽视的问题,提出了生成能源竞技场(GenerativeEnergyArena,GEA)这一评估平台。背景:现有LLM评估方法存在局限——自动化基准测试与人类偏好相关性低,传统人类评估可扩展性差,公开竞技场(如LMArena)未考虑能源消耗;而LLM的能源消耗(训练和推理阶段)日益成为重要议题。
Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Op...
研究背景与动机LLMs在自然语言处理、多模态生成等领域取得巨大成功,但存在自我修正能力不足等问题;强化学习(RL)在游戏、决策控制等领域展现超人类性能,但透明度有限。结合两者优势的LLM后训练(对齐)成为趋势,核心挑战包括缺乏明确奖励信号、计算成本高昂、算法适配性等。理论基础基于马尔可夫决策过程(MDP)框架,将LLM生成过程建模为“无奖励MDP(MDP\R)”,其中状态为当前文本、动作为生成的token、转移为token拼接,但奖励函数需从数据中学习。
SE-VLN: A Self-Evolving Vision-Language Navigation Framework Based on Multimodal Large Language M...
近年来,视觉-语言导航(VLN)的进展主要归功于新兴的大型语言模型(LLMs)。这些方法在指令理解和任务推理方面展现出优异的泛化能力。然而,它们受限于LLMs的固定知识库和推理能力,无法充分整合经验知识,导致缺乏高效的进化能力。为解决这一问题,我们从自然智能体的进化能力中汲取灵感,提出了一种自进化VLN框架(SE-VLN),使VLN智能体能够在测试过程中实现持续进化。据我们所知,这是首次提出基于多模态大型语言模型的自进化VLN框架。
AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Re...
我们引入ABGEN,这是首个旨在评估大型语言模型(LLMs)在科学研究中设计消融研究能力的基准。ABGEN包含1500个专家注释示例,这些示例源自807篇自然语言处理(NLP)论文。在该基准中,LLMs的任务是根据给定的研究背景,为特定模块或流程生成详细的消融研究设计。我们对DeepSeek-R1-0528和o4-mini等领先LLMs的评估表明,这些模型在消融研究设计的重要性、忠实性和合理性方面与人类专家存在显著性能差距。
Enhancing Cross-task Transfer of Large Language Models via Activation Steering
大型语言模型(LLMs)通过提示能够有效利用预训练知识,但在处理未见过的任务时往往表现不佳,尤其是在数据稀缺场景中。尽管跨任务上下文学习为任务间知识迁移提供了直接解决方案,但它在鲁棒性、可扩展性和效率方面仍面临关键挑战。本文研究了是否可以通过潜在空间引导实现跨任务迁移,且无需参数更新或输入扩展。通过分析LLMs潜在空间中的激活模式,我们发现由上下文示例诱导的增强激活在不同任务中具有一致模式。受此发现启发,我们提出了CAST——一种新型跨任务激活引导迁移框架,通过操纵模型的内部激活状态实现有效迁移。
Analysis of Image-and-Text Uncertainty Propagation in Multimodal Large Language Models with Cardi...
本文聚焦多模态大型语言模型(MLLMs)中图像与文本的不确定性传播问题,尤其结合心脏磁共振(cardiacMR)相关临床应用展开研究。研究背景指出,MLLMs虽能整合文本、图像等多模态信息并在临床决策等任务中表现优异,但输入模态间的相互关系、单模态数据的不确定性及其在临床应用中的分解尚未被充分理解。为此,作者提出多模态不确定性传播模型(MUPM),旨在量化图像-only、文本-only及联合图像-文本输入的不确定性之间的关系,包括图像与文本输入的相关性。
Argus: Leveraging Multiview Images for Improved 3-D Scene Understanding With Large Language Models
本文提出了一种名为Argus的新型3D大型多模态基础模型(3D-LMM),旨在利用多视角图像增强大型语言模型(LLMs)对3D场景的理解能力。现有3D场景理解方法高度依赖3D点云,但室内场景的3D点云重建存在信息丢失问题(如无纹理平面或重复图案区域易被遗漏、复杂结构物体因图像与点云错位导致细节失真)。而2D多视角图像与3D点云具有视觉一致性,能提供更详细的场景信息,可弥补上述缺陷。设计融合模块,将多视角图像和相机姿态融合为“视图到场景特征(view-as-scenefeatures)”;
VAR-MATH: Probing True Mathematical Reasoning in Large Language Models via Symbolic Multi-Instanc...
近年来,强化学习(RL)的进展显著提升了大型语言模型(LLMs)的数学推理能力,这一点已被标准基准测试所证实。然而,即便模型在有缺陷的信号(例如随机奖励或反向奖励)上训练,这些性能提升往往仍然存在。这引发了一个核心问题:此类提升反映的是真正的推理能力,还是仅仅是对基准测试特定模式过拟合的产物?为解决这一问题,本文从评估视角出发,指出了现有评估协议的两个关键缺陷:一是基准污染,源于测试题的公开可获取性,增加了数据泄露风险;
What Level of Automation is “Good Enough“? A Benchmark of Large Language Models for Meta-Analysis...
本文聚焦于大型语言模型(LLMs)在元分析数据提取中的实际表现评估,旨在解决从随机对照试验(RCTs)全文中自动提取数据用于元分析的挑战。研究选取了Gemini-2.0-flash、Grok-3、GPT-4o-mini三个LLM,在高血压、糖尿病、骨科三个医学领域,针对统计结果、偏倚风险评估和研究层面特征三类任务,测试了基础提示、自我反思提示、模型集成、定制提示四种提示策略,以探究如何提升提取质量。研究发现,所有模型均表现出高精度,但召回率较低(存在关键信息遗漏);
From Neurons to Semantics: Evaluating Cross-Linguistic Alignment Capabilities of Large Language M...
本文聚焦大型语言模型(LLMs)的跨语言对齐能力评估,提出了一种基于神经元状态的新框架,并通过实验验证了其有效性。研究背景:现有跨语言对齐评估方法多依赖句子嵌入,但神经模型的表示空间存在非光滑性(如各向异性),尤其影响低资源语言的语义对齐评估。核心方法:受神经科学中“相似信息激活重叠神经元区域”的启发,NeuronXA通过量化神经元对多语言平行语料的激活一致性来评估跨语言对齐。具体包括:神经元状态检测(激活状态为二进制0/1,激活值为绝对强度);
