Loading...
本文聚焦大型语言模型(LLMs)的推导能力(DerivationCapability,DC)概念定义:正式定义“推导关系(DR)”为输入域变化(T)与输出域变化(R)的映射规则,推导能力(DC)则是LLMs遵循DR,在输入发生特定变化时对输出进行相应调整的能力。评估框架(DEVAL):提出系统化评估框架DEVAL,通过“规则形式化(将任务规则转化为DR)→数据集构建(基于DR生成测试数据)→模型评估(量化输出是否符合DR)”三步流程,解决传统评估无法衡量“变化一致性”的缺陷。模型评估结果。
Knowledge-Grounded Agentic Large Language Models for Multi-Hazard Understanding from Reconnaissan...
数据集构建:创建了HazardRecQA数据集,基于GEER全球7类灾害(地震、飓风、洪水等)的90起事件侦察报告,生成5776个问答对,涵盖灾害特征、分析方法、影响与破坏、响应与恢复四大知识类别,支持模型客观评估。框架设计:提出混合检索智能RAG(MoRA-RAG)框架,核心包含三部分:智能分块(AgenticChunk):通过LLM代理提取事实命题并分组,保留上下文连贯性,避免传统分块的语义碎片化;
Near-Lossless Model Compression Enables Longer Context Inference in DNA Large Language Models
基于海量跨物种DNA语料训练的DNA大语言模型(DNALLMs),已掌握基因组序列的基本“语法”与进化模式,成为DNA序列建模(尤其是长距离依赖建模)的强大先验工具。然而,两个核心约束限制了其应用:自注意力机制的二次计算成本,以及自回归解码过程中键值(KV)缓存所需的内存持续扩张。这些约束迫使研究人员采用固定窗口截断或滑动窗口等启发式方法,而这些方法会丢弃远端信息,导致超长序列建模的保真度受损。
Evaluating Large Language Models for Diacritic Restoration in Romanian Texts: A Comparative Study
自动重音符号恢复对于罗马尼亚语等重音符号丰富的语言的文本处理至关重要。本研究评估了多款大型语言模型(LLMs)在罗马尼亚语文本重音符号恢复任务中的性能。
From Phonemes to Meaning: Evaluating Large Language Models on Tamil
大型语言模型(LLMs)在高资源语言的各类任务中展现出强大的泛化能力;然而,它们在泰米尔语等低资源、形态丰富语言中的语言能力尚未得到充分探索。现有多语言基准大多依赖翻译后的英语数据集,无法捕捉目标语言的语言和文化细微差异。为填补这一空白,我们引入ILAKKANAM——首个泰米尔语专属语言评估基准,该基准基于斯里兰卡1-13年级泰米尔语学科考试题目手动筛选构建,包含820道问题。每道题目由经过训练的语言学家标注为5个语言类别和1个事实知识类别,覆盖全年级以确保广泛的语言覆盖度。
Interpretable Ransomware Detection Using Hybrid Large Language Models: A Comparative Analysis of ...
该研究聚焦勒索软件的可解释性检测,提出了一种融合大型语言模型(LLM)与可解释人工智能(XAI)的混合框架。数据处理:采用UGRansome(网络行为数据)和ProcessMemory(PM,主机内存行为数据)两个结构化数据集,通过填充缺失值、KBinsDiscretizer离散化、令牌编码等步骤,将数值型和分类型勒索软件特征转换为文本序列,适配LLM的输入格式。模型训练与评估。
Part-X-MLLM: Part-aware 3D Multimodal Large Language Model
任务范式创新:首次将3D零件级交互统一为"语言建模问题",通过结构化程序令牌序列实现生成、编辑、问答任务的接口归一化,打破传统模型的任务壁垒;双编码器设计:提出分离几何与外观的双路径编码架构,解决单编码器在零件定位与语义理解中的表征冲突,在纯几何任务(如边界框列举)上IoU提升7.06%;可控语义粒度机制:基于CLIP语义相似度的零件聚类算法,支持自动合并细粒度零件为粗粒度组件,无需手动定义聚类数量或掩码;模型无关的控制接口。
TZ-LLM: Protecting On-Device Large Language Models with Arm TrustZone
部署在移动设备上的大语言模型(LLMs)具有保护用户隐私、降低网络延迟等优势,但也带来了显著的安全风险:专有模型可能向终端用户泄露。为缓解这一风险,我们提出了一种基于Arm可信执行环境(TEE)TrustZone的设备端LLM保护系统设计。该系统解决了两大核心挑战:(1)内存效率与快速推理之间的矛盾(在TEE内存中缓存模型参数);(2)富执行环境(REE)与TEE之间缺乏高效安全的神经网络处理器(NPU)分时共享机制。
Reasoning in Diffusion Large Language Models is Concentrated in Dynamic Confusion Zones
核心问题指出:现有dLLM的轨迹型RL方法普遍采用均匀子采样策略,假设所有去噪步骤同等重要,但这一假设存在缺陷——推理过程中仅少数“关键节点”决定最终成败,均匀分配梯度预算会浪费计算资源在无意义步骤上,导致训练不稳定、推理精度不足。轨迹动态分析。
Mathematical Analysis of Hallucination Dynamics in Large Language Models: Uncertainty Quantificat...
大型语言模型(LLMs)是强大的语言处理工具,但仍易产生幻觉——即听起来合理但事实不准确或缺乏依据的输出。本研究提出一个连贯、基于数学原理的框架,用于理解、量化和缓解这些幻觉。借助概率建模、信息论、三角信号分析和贝叶斯不确定性估算,我们分析了误差如何在自回归生成中累积,提出了精细化的不确定性指标(包括语义感知和相位感知变体),并开发了原则性缓解策略:对比解码、检索增强接地、事实对齐和弃权机制。这一统一视角整合了校准、检索和对齐领域的最新进展,为构建更安全、更可靠的大型语言模型提供了支持。
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
随着多模态大型语言模型(MLLMs)在感知任务中取得显著成功,增强其复杂推理能力已成为关键研究焦点。现有模型仍面临推理路径不透明、泛化能力不足等挑战。思维链(CoT)推理在语言模型中已展现出提升推理透明度和输出可解释性的显著成效,将其扩展到多模态领域有望改善模型推理能力。本文围绕“多模态思维链(MCoT)”展开系统性综述:首先从技术演进和任务需求视角分析其诞生的背景与理论动机;然后从思维链范式、训练后阶段、推理阶段三个方面介绍主流MCoT方法,并解析其底层机制;
Two-Faced Social Agents: Context Collapse in Role-Conditioned Large Language Models
该研究聚焦前沿大语言模型(LLMs)作为社会智能体时的角色条件保真度,核心探究模型在不同社会经济地位(SES)角色设定下,面对认知负荷任务(SAT数学题)与低认知负荷任务(情感偏好题)时的表现差异,揭示了“语境崩塌”(contextualcollapse)现象及模型的“双面性”特征。研究设计SAT数学题(高认知负荷,单一正确答案,需优化准确性);情感偏好题(低认知负荷,主观多元答案,可表达角色差异)。
Large language models for automated PRISMA 2020 adherence checking
该研究聚焦于大型语言模型(LLMs)在PRISMA2020指南依从性检查中的应用,核心旨在解决同行评审中手动检查指南依从性的沉重负担,同时填补现有研究中缺乏可共享基准、未系统比较输入格式影响等空白。研究通过四阶段流程开展:首先构建了含108篇知识共享(CreativeCommons)授权系统评价的版权友好型基准数据集;随后进行参数优化(确定提示词顺序、推理预算等最优设置);
Music Recommendation with Large Language Models: Challenges, Opportunities, and Evaluation
音乐推荐系统(MRS)长期依赖信息检索框架,其进展主要通过检索导向子任务的准确率来衡量。尽管这种模式具有一定效果,但这种简化范式难以解答“什么构成优质推荐”这一深层问题,而通过用户研究或公平性分析来拓展评估的尝试影响有限。大型语言模型(LLMs)的出现打破了这一框架:LLMs是生成式而非基于排序的模型,使得标准准确率指标失去意义。它们还带来了幻觉、知识截止、非确定性和训练数据不透明等挑战,导致传统的训练/测试协议难以解释。与此同时,LLMs创造了新的机遇,支持自然语言交互,甚至允许模型充当评估者。
Error-Driven Scene Editing for 3D Grounding in Large Language Models
该研究针对当前3D-LLM在3D环境中语言接地(将语言描述与视觉、空间元素精准关联)的局限性,提出了DEER-3D框架,核心是通过“误差驱动的3D场景编辑”生成目标性反事实样本,迭代优化模型的空间接地能力。尽管3D-LLM近年来取得了进展,但它们在将语言精准接地到3D环境中的视觉和空间元素方面仍存在局限。这一局限部分源于训练数据——由于3D资源稀缺,现有数据更侧重语言推理而非空间理解,导致固有接地偏差未得到解决。
HFL-FlowLLM: Large Language Models for Network Traffic Flow Classification in Heterogeneous Feder...
该研究针对5G和物联网驱动的现代通信网络中,网络流量分类面临的分布式数据处理、隐私保护、设备异构性等挑战,提出了HFL-FlowLLM框架——首个将大型语言模型(LLM)应用于异构联邦学习(HFL)场景下网络流量分类的解决方案。在5G和物联网(IoT)驱动的现代通信网络中,有效的网络流量分类对于服务质量(QoS)管理和安全保障至关重要。传统的集中式机器学习在这些异构环境中难以应对分布式数据和隐私问题,而现有的联邦学习方法则存在成本高、泛化能力弱的缺陷。
Do Large Language Models (LLMs) Understand Chronology?
大语言模型(LLMs)在金融和经济学领域的应用日益广泛,而基于提示词的方法在缓解前瞻偏差时,隐含假设模型能够理解时间顺序。我们通过一系列复杂度递增的时间排序任务,测试了这一基本问题,任务所涉及的事实均是模型在预训练阶段已掌握的内容。测试任务包括:(1)时间排序、(2)条件排序(先筛选后排序)和(3)时代错误检测。我们评估了GPT-4.1、Claude-3.7Sonnet(含扩展思维与不含扩展思维两种设置),以及新发布的GPT-5在不同推理强度下的表现。
Incoherent Beliefs & Inconsistent Actions in Large Language Models
现实世界的任务和环境与大型语言模型(LLMs)通常所评估的静态数据集存在差异。这类任务可能涉及序列交互,需要根据新证据连贯地更新信念,并基于这些信念做出恰当决策。预测LLMs在这类动态环境中的表现至关重要,但仅通过静态场景的测量难以准确判断。本研究考察了LLM性能的两个关键维度:连贯更新信念的能力,以及所采取行动与信念的一致性程度。首先,我们发现LLMs的信念更新方式存在显著不一致性——模型直接得出的后验概率与基于先验的正确更新结果之间,平均差异可达30%。
Rdgai: Classifying transcriptional changes using Large Language Models with a test case from an A...
本文聚焦文本传统系统发育分析中存在的变体分类难题,提出并开发了一款名为Rdgai的软件包。传统系统发育方法常将所有文本变体视为等价,导致真实系统发育信号被干扰或引入偏差,而手动分类变体耗时费力,成为该类分析的主要障碍。
A Comprehensive Study of Implicit and Explicit Biases in Large Language Models
大型语言模型(LLMs)从其训练数据集中继承了显性和隐性偏见。识别并减轻LLMs中的偏见对于确保输出结果的公平性至关重要,因为这些偏见可能会强化有害的刻板印象和错误信息。本研究强调,在生成式人工智能快速发展的背景下,解决LLMs中的偏见问题具有迫切性。我们采用了StereoSet和CrowSPairs等特定于偏见的基准数据集,对BERT和GPT-3.5等多款生成式模型中的各类偏见进行了评估。
