Loading...

From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
随着多模态大型语言模型(MLLMs)在感知任务中取得显著成功,增强其复杂推理能力已成为关键研究焦点。现有模型仍面临推理路径不透明、泛化能力不足等挑战。思维链(CoT)推理在语言模型中已展现出提升推理透明度和输出可解释性的显著成效,将其扩展到多模态领域有望改善模型推理能力。本文围绕“多模态思维链(MCoT)”展开系统性综述:首先从技术演进和任务需求视角分析其诞生的背景与理论动机;然后从思维链范式、训练后阶段、推理阶段三个方面介绍主流MCoT方法,并解析其底层机制;

Two-Faced Social Agents: Context Collapse in Role-Conditioned Large Language Models
该研究聚焦前沿大语言模型(LLMs)作为社会智能体时的角色条件保真度,核心探究模型在不同社会经济地位(SES)角色设定下,面对认知负荷任务(SAT数学题)与低认知负荷任务(情感偏好题)时的表现差异,揭示了“语境崩塌”(contextualcollapse)现象及模型的“双面性”特征。研究设计SAT数学题(高认知负荷,单一正确答案,需优化准确性);情感偏好题(低认知负荷,主观多元答案,可表达角色差异)。

Large language models for automated PRISMA 2020 adherence checking
该研究聚焦于大型语言模型(LLMs)在PRISMA2020指南依从性检查中的应用,核心旨在解决同行评审中手动检查指南依从性的沉重负担,同时填补现有研究中缺乏可共享基准、未系统比较输入格式影响等空白。研究通过四阶段流程开展:首先构建了含108篇知识共享(CreativeCommons)授权系统评价的版权友好型基准数据集;随后进行参数优化(确定提示词顺序、推理预算等最优设置);

Music Recommendation with Large Language Models: Challenges, Opportunities, and Evaluation
音乐推荐系统(MRS)长期依赖信息检索框架,其进展主要通过检索导向子任务的准确率来衡量。尽管这种模式具有一定效果,但这种简化范式难以解答“什么构成优质推荐”这一深层问题,而通过用户研究或公平性分析来拓展评估的尝试影响有限。大型语言模型(LLMs)的出现打破了这一框架:LLMs是生成式而非基于排序的模型,使得标准准确率指标失去意义。它们还带来了幻觉、知识截止、非确定性和训练数据不透明等挑战,导致传统的训练/测试协议难以解释。与此同时,LLMs创造了新的机遇,支持自然语言交互,甚至允许模型充当评估者。

Error-Driven Scene Editing for 3D Grounding in Large Language Models
该研究针对当前3D-LLM在3D环境中语言接地(将语言描述与视觉、空间元素精准关联)的局限性,提出了DEER-3D框架,核心是通过“误差驱动的3D场景编辑”生成目标性反事实样本,迭代优化模型的空间接地能力。尽管3D-LLM近年来取得了进展,但它们在将语言精准接地到3D环境中的视觉和空间元素方面仍存在局限。这一局限部分源于训练数据——由于3D资源稀缺,现有数据更侧重语言推理而非空间理解,导致固有接地偏差未得到解决。

HFL-FlowLLM: Large Language Models for Network Traffic Flow Classification in Heterogeneous Feder...
该研究针对5G和物联网驱动的现代通信网络中,网络流量分类面临的分布式数据处理、隐私保护、设备异构性等挑战,提出了HFL-FlowLLM框架——首个将大型语言模型(LLM)应用于异构联邦学习(HFL)场景下网络流量分类的解决方案。在5G和物联网(IoT)驱动的现代通信网络中,有效的网络流量分类对于服务质量(QoS)管理和安全保障至关重要。传统的集中式机器学习在这些异构环境中难以应对分布式数据和隐私问题,而现有的联邦学习方法则存在成本高、泛化能力弱的缺陷。

Do Large Language Models (LLMs) Understand Chronology?
大语言模型(LLMs)在金融和经济学领域的应用日益广泛,而基于提示词的方法在缓解前瞻偏差时,隐含假设模型能够理解时间顺序。我们通过一系列复杂度递增的时间排序任务,测试了这一基本问题,任务所涉及的事实均是模型在预训练阶段已掌握的内容。测试任务包括:(1)时间排序、(2)条件排序(先筛选后排序)和(3)时代错误检测。我们评估了GPT-4.1、Claude-3.7Sonnet(含扩展思维与不含扩展思维两种设置),以及新发布的GPT-5在不同推理强度下的表现。

Incoherent Beliefs & Inconsistent Actions in Large Language Models
现实世界的任务和环境与大型语言模型(LLMs)通常所评估的静态数据集存在差异。这类任务可能涉及序列交互,需要根据新证据连贯地更新信念,并基于这些信念做出恰当决策。预测LLMs在这类动态环境中的表现至关重要,但仅通过静态场景的测量难以准确判断。本研究考察了LLM性能的两个关键维度:连贯更新信念的能力,以及所采取行动与信念的一致性程度。首先,我们发现LLMs的信念更新方式存在显著不一致性——模型直接得出的后验概率与基于先验的正确更新结果之间,平均差异可达30%。

Rdgai: Classifying transcriptional changes using Large Language Models with a test case from an A...
本文聚焦文本传统系统发育分析中存在的变体分类难题,提出并开发了一款名为Rdgai的软件包。传统系统发育方法常将所有文本变体视为等价,导致真实系统发育信号被干扰或引入偏差,而手动分类变体耗时费力,成为该类分析的主要障碍。

A Comprehensive Study of Implicit and Explicit Biases in Large Language Models
大型语言模型(LLMs)从其训练数据集中继承了显性和隐性偏见。识别并减轻LLMs中的偏见对于确保输出结果的公平性至关重要,因为这些偏见可能会强化有害的刻板印象和错误信息。本研究强调,在生成式人工智能快速发展的背景下,解决LLMs中的偏见问题具有迫切性。我们采用了StereoSet和CrowSPairs等特定于偏见的基准数据集,对BERT和GPT-3.5等多款生成式模型中的各类偏见进行了评估。

PathMind: A Retrieve-Prioritize-Reason Framework for Knowledge Graph Reasoning with Large Languag...
知识图谱推理(KGR)是通过在知识图谱上执行逻辑演绎来推断新知识的任务。近年来,大型语言模型(LLMs)在复杂推理任务中展现出卓越性能。尽管取得了令人瞩目的成果,但当前基于LLM的KGR方法仍面临两个关键局限:首先,现有方法往往不加区分地提取推理路径,未评估其不同的重要性,可能引入无关噪声误导LLMs;其次,部分方法利用LLMs动态探索潜在推理路径,但需要高昂的检索需求和频繁的LLM调用。

Large Language Model-based Data Science Agent: A Survey
大型语言模型(LLMs)的快速发展推动了其在多个领域的创新应用,其中基于LLM的代理已成为重要的探索方向。本综述对专为数据科学任务设计的基于LLM的代理进行了全面分析,总结了近期研究的洞见。从代理视角,我们讨论了关键设计原则,包括代理角色、执行方式、知识来源和反思方法;从数据科学视角,我们识别了基于LLM的代理所涉及的关键流程,包括数据预处理、模型开发、评估、可视化等。本文的主要贡献有二:(1)全面回顾了将基于LLM的代理应用于数据科学任务的最新进展;

ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
本文针对大型语言模型(LLMs)面临的后门攻击问题,提出了一种轻量且高效的后门检测方法ConfGuard。后门攻击通过在训练过程中植入隐藏触发器,使模型在正常输入下表现正常,但在特定触发器输入时生成攻击者指定的恶意输出。现有防御方法多针对分类任务,难以适应LLMs的自回归特性和庞大输出空间,存在性能差、延迟高的问题。研究发现,后门模型存在“序列锁定”(sequencelock)现象:在生成目标序列时,其输出token的置信度异常高且稳定,几乎无分支点;而良性模型生成时,置信度会因分支点波动。

SmallThinker: A Family of Efficient Large Language Models Natively Trained for Local Deployment
本文介绍了SmallThinker系列大语言模型(LLMs),该系列模型并非通过压缩云端模型适配本地设备,而是从底层原生设计,专为本地设备的弱计算能力、有限内存和低速存储等约束优化。核心目标:突破大语言模型依赖云端GPU部署的限制,实现本地设备(如消费级CPU、智能手机)上的高效运行,同时保证性能。模型架构:采用两级稀疏结构(细粒度混合专家(MoE)+稀疏前馈网络)减少计算需求;通过预注意力路由器(pre-attentionrouter)提前预测所需专家参数,与注意力计算并行预取,隐藏存储延迟;

Joint Lossless Compression and Steganography for Medical Images via Large Language Models
近年来,大型语言模型(LLMs)在无损图像压缩领域取得了显著进展。然而,将现有范式直接应用于医学图像时,压缩性能与效率之间的权衡不尽如人意。此外,现有基于LLM的压缩器往往忽视压缩过程的安全性,而这在现代医疗场景中至关重要。为此,我们提出了一种新颖的联合无损压缩与隐写术框架。受位平面切片(BPS)的启发,我们发现可以将隐私消息以隐形方式安全嵌入医学图像。基于这一见解,我们首先设计了自适应模态分解策略,将整个图像划分为两个部分,为后续的双路径无损压缩提供全局和局部模态。

EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language Models
本文针对混合专家模型(Mixture-of-Experts,MoE)在大语言模型(LLMs)中面临的两大核心挑战——高额GPU内存消耗(需加载所有专家权重)和推理加速与激活参数减少不匹配(低激活参数未转化为等效速度提升),提出了一种名为EAC-MoE的专家选择感知压缩方法。基于专家选择校准的量化(QESC):低比特量化会导致专家选择偏差(即路由器可能选错专家),QESC通过逐层校准MoE中的路由器,减轻这种偏差,从而保留量化模型的性能。基于专家选择频率的剪枝(PESF)

From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Lar...
本文聚焦大型语言模型(LLMs)对人类表达与思维的同质化效应,通过整合语言学、认知科学和计算机科学的跨学科证据,系统分析了LLMs如何影响认知多样性(体现为语言、视角和推理的差异)。认知多样性的重要性:认知多样性是创造力、集体智慧和社会适应性的核心,源于文化、历史和个体经验的差异,表现为语言风格、视角和推理方式的多样性。LLMs的同质化机制LLMs基于“下一个token预测”训练,倾向于复制训练数据中占主导地位的语言、文化和意识形态(如英语、全球北方视角),边缘化小众表达和推理方式。

Evaluating Position Bias in Large Language Model Recommendations
大型语言模型(LLMs)正被越来越多地探索作为推荐任务的通用工具,无需特定任务训练即可实现零样本和指令跟随能力。尽管研究界对LLMs抱有极大热情,但将其直接应用于推荐任务仍存在重要隐患。本文表明,基于LLM的推荐模型存在位置偏差——提示中候选项目的顺序会不成比例地影响LLM生成的推荐结果。首先,我们在真实世界数据集上分析了LLM推荐的位置偏差,结果揭示了LLM对输入顺序高度敏感的系统性偏差。此外,我们提出了一种新的提示策略来缓解LLM推荐模型的位置偏差,称为迭代选择排序(RISE)。

Isolating Culture Neurons in Multilingual Large Language Models
本文聚焦多语言大型语言模型(LLMs)中文化信息的编码机制,旨在定位并分离与文化相关的特定神经元(“文化神经元”),并探究其与语言特定神经元的关系。研究通过扩展已有的语言特定神经元识别方法,提出了识别“纯文化神经元”(即仅编码文化信息而不依赖语言的神经元)的方法论,并构建了包含6种文化、8520万tokens的多文化数据集MUREL以支持实验。实验结果表明:多语言LLMs中,不同文化的信息被编码在distinct神经元群体中,且这些神经元主要集中在模型的上层;

Zero-Shot Grammar Competency Estimation Using Large Language Model Generated Pseudo Labels
语法能力评估对于衡量书面和口语的语言熟练度至关重要;然而,口语模态因其自发性、无结构性和不流畅性而面临额外挑战。开发精准的语法评分模型还需要大量专家标注,这使得大规模数据构建难以实现。为解决这些局限性,我们提出一种零样本语法能力评估框架,该框架利用无标注数据和大型语言模型(LLMs),无需依赖人工标签。在训练过程中,我们通过基于语法能力评分准则的提示词,利用LLM对无标注数据生成预测结果。这些预测结果被视为伪标签,通过一种专为有效处理标签噪声设计的新型训练框架,用于训练基于Transformer的模型。

欢迎留下您的脚印