Loading...

Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-Wo...
本文围绕“大型语言模型(LLMs)能否在真实临床场景中胜任儿科医生工作”这一核心问题,构建了(儿科动态智能、适应性与安全性评估基准),从“基础医学知识应用”“动态诊疗能力”“儿科医疗安全与伦理”三个维度,对过去两年发布的12款代表性LLMs(含GPT-4o、Qwen3-235B-A22B、DeepSeek-V3等)进行了系统性评估。评估覆盖19个儿科亚专科、211种典型疾病,采用选择题(单/多选)、简答题等多种题型,结合真实临床病例与标准化考试资源设计任务。

Bridging Human and Model Perspectives: A Comparative Analysis of Political Bias Detection in News...
检测新闻媒体中的政治偏见是一项复杂任务,需要解读微妙的语言和语境线索。尽管自然语言处理(NLP)领域的最新进展已实现自动偏见分类,但大型语言模型(LLMs)与人类判断的契合程度仍未得到充分探索,且尚未被深入理解。本研究旨在提出一个对比框架,用于评估人类标注与多个大型语言模型(包括GPT、BERT、RoBERTa和FLAN)在政治偏见检测中的表现。我们构建了一个人工标注的新闻文章数据集,通过评估标注一致性、偏见极性和模型间一致性,量化人类与模型在偏见感知上的差异。

Failure to Mix: Large language models struggle to answer according to desired probability distrib...
科学想法的生成与筛选需要遵循目标概率分布进行探索。相比之下,当前的人工智能基准测试均存在客观正确答案,而通过强化学习针对这些基准训练大型语言模型(LLMs)会抑制概率性探索。本文中,我们开展了系统性实验,要求大型语言模型生成符合简单概率分布的输出,结果发现所有接受测试的现代大型语言模型均严重无法遵循指定分布。例如,当要求以49%的概率输出"1"时,模型输出"0"的概率接近100%。这种近乎只生成概率略高选项的阶跃函数式行为,甚至会覆盖大型语言模型内置的强烈偏差。

A Specialized Large Language Model for Clinical Reasoning and Diagnosis in Rare Diseases
该研究针对罕见病诊断周期长(平均4-8年)、现有方法存在证据提取与诊断推理脱节、大语言模型(LLM)面临数据稀缺、知识陈旧和幻觉等问题,开发了一款专注于罕见病临床推理与诊断的领域专用大语言模型。核心数据资源构建。

AutoTool: Efficient Tool Selection for Large Language Model Agents
大型语言模型(LLM)智能体已成为自动化复杂任务的强大工具,其核心优势在于利用LLM的推理和决策能力。然而,当前智能体框架的主要瓶颈在于工具选择的高推理成本——尤其是在ReAct等方法中,需在每个步骤反复调用LLM以确定使用何种工具。本文提出AutoTool,一种基于图结构的新型框架,其核心创新在于利用一项关键实证发现:工具使用惯性(toolusageinertia),即工具调用遵循可预测的序列模式,从而绕过重复的LLM推理。

Bias in, Bias out: Annotation Bias in Multilingual Large Language Models
自然语言处理(NLP)数据集的标注偏差仍是多语言大型语言模型(LLMs)发展的主要挑战,尤其在文化多元场景中。来自任务框架、标注者主观性和文化错配的偏差会扭曲模型输出并加剧社会危害。本文提出一个理解标注偏差的综合框架,区分了指令偏差、标注者偏差以及语境与文化偏差。我们综述了检测方法(包括标注者间一致性、模型分歧和元数据分析),并重点介绍了多语言模型分歧和文化推理等新兴技术。进一步,我们概述了主动和被动缓解策略,包括招募多样化标注者、迭代优化指南以及事后模型调整。

Encoding and Understanding Astrophysical Information in Large Language Model-Generated Summaries
本文以天体物理学X射线源为研究对象,探索大型语言模型(LLMs)能否编码科学测量中获取的物理信息,核心围绕两个问题展开:1)提示词设计是否影响LLM对物理量的编码效果;2)文本中的哪些语言层面内容对编码测量所代表的物理信息最为关键。研究过程中,作者整合了NASA天体物理学数据系统(ADS)的科学论文文本语料与钱德拉源目录(CSC)中的物理统计数据,通过OpenAI的gpt-4o-mini模型生成天体物理源的物理信息摘要,并使用ada-002模型将摘要编码为嵌入向量。

Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and ...
我们推出了荔枝(Lychee)系列的Uni-MoE2.0。作为一款全开源的全能模态大模型(OLM),它在以语言为中心的多模态理解、推理和生成方面显著推进了荔枝系列的Uni-MoE模型。基于稠密型大语言模型(LLM),我们通过三大核心贡献从零构建了Uni-MoE-2.0-Omni:动态容量混合专家(MoE)设计、结合迭代强化策略的渐进式训练方法,以及精心设计的多模态数据匹配技术。该模型具备全能模态理解能力,同时支持图像、文本和语音生成。

Prompting Large Language Models to Detect Dementia Family Caregivers
本文针对SMM4H2025共享任务3(检测Twitter上痴呆症家庭护理者的推文)展开研究,该任务为二分类问题:区分推文作者是否提及自己有痴呆症家庭成员(标签1)或仅提及痴呆症但无个人关联(标签0)。数据准备:针对训练集标签不平衡(约33%标签0、67%标签1),采用过采样方法平衡两类样本;未使用预处理(如去停用词),因原始数据包含关键语境信息。提示设计:测试了零样本、少样本、思维链(ChainofThought)、级联(Cascade)四种提示策略,将任务转化为指令式对话格式。模型微调。

DEVAL: A Framework for Evaluating and Improving the Derivation Capability of Large Language Models
本文聚焦大型语言模型(LLMs)的推导能力(DerivationCapability,DC)概念定义:正式定义“推导关系(DR)”为输入域变化(T)与输出域变化(R)的映射规则,推导能力(DC)则是LLMs遵循DR,在输入发生特定变化时对输出进行相应调整的能力。评估框架(DEVAL):提出系统化评估框架DEVAL,通过“规则形式化(将任务规则转化为DR)→数据集构建(基于DR生成测试数据)→模型评估(量化输出是否符合DR)”三步流程,解决传统评估无法衡量“变化一致性”的缺陷。模型评估结果。

Knowledge-Grounded Agentic Large Language Models for Multi-Hazard Understanding from Reconnaissan...
数据集构建:创建了HazardRecQA数据集,基于GEER全球7类灾害(地震、飓风、洪水等)的90起事件侦察报告,生成5776个问答对,涵盖灾害特征、分析方法、影响与破坏、响应与恢复四大知识类别,支持模型客观评估。框架设计:提出混合检索智能RAG(MoRA-RAG)框架,核心包含三部分:智能分块(AgenticChunk):通过LLM代理提取事实命题并分组,保留上下文连贯性,避免传统分块的语义碎片化;

Near-Lossless Model Compression Enables Longer Context Inference in DNA Large Language Models
基于海量跨物种DNA语料训练的DNA大语言模型(DNALLMs),已掌握基因组序列的基本“语法”与进化模式,成为DNA序列建模(尤其是长距离依赖建模)的强大先验工具。然而,两个核心约束限制了其应用:自注意力机制的二次计算成本,以及自回归解码过程中键值(KV)缓存所需的内存持续扩张。这些约束迫使研究人员采用固定窗口截断或滑动窗口等启发式方法,而这些方法会丢弃远端信息,导致超长序列建模的保真度受损。

Evaluating Large Language Models for Diacritic Restoration in Romanian Texts: A Comparative Study
自动重音符号恢复对于罗马尼亚语等重音符号丰富的语言的文本处理至关重要。本研究评估了多款大型语言模型(LLMs)在罗马尼亚语文本重音符号恢复任务中的性能。

From Phonemes to Meaning: Evaluating Large Language Models on Tamil
大型语言模型(LLMs)在高资源语言的各类任务中展现出强大的泛化能力;然而,它们在泰米尔语等低资源、形态丰富语言中的语言能力尚未得到充分探索。现有多语言基准大多依赖翻译后的英语数据集,无法捕捉目标语言的语言和文化细微差异。为填补这一空白,我们引入ILAKKANAM——首个泰米尔语专属语言评估基准,该基准基于斯里兰卡1-13年级泰米尔语学科考试题目手动筛选构建,包含820道问题。每道题目由经过训练的语言学家标注为5个语言类别和1个事实知识类别,覆盖全年级以确保广泛的语言覆盖度。

Interpretable Ransomware Detection Using Hybrid Large Language Models: A Comparative Analysis of ...
该研究聚焦勒索软件的可解释性检测,提出了一种融合大型语言模型(LLM)与可解释人工智能(XAI)的混合框架。数据处理:采用UGRansome(网络行为数据)和ProcessMemory(PM,主机内存行为数据)两个结构化数据集,通过填充缺失值、KBinsDiscretizer离散化、令牌编码等步骤,将数值型和分类型勒索软件特征转换为文本序列,适配LLM的输入格式。模型训练与评估。

Part-X-MLLM: Part-aware 3D Multimodal Large Language Model
任务范式创新:首次将3D零件级交互统一为"语言建模问题",通过结构化程序令牌序列实现生成、编辑、问答任务的接口归一化,打破传统模型的任务壁垒;双编码器设计:提出分离几何与外观的双路径编码架构,解决单编码器在零件定位与语义理解中的表征冲突,在纯几何任务(如边界框列举)上IoU提升7.06%;可控语义粒度机制:基于CLIP语义相似度的零件聚类算法,支持自动合并细粒度零件为粗粒度组件,无需手动定义聚类数量或掩码;模型无关的控制接口。

TZ-LLM: Protecting On-Device Large Language Models with Arm TrustZone
部署在移动设备上的大语言模型(LLMs)具有保护用户隐私、降低网络延迟等优势,但也带来了显著的安全风险:专有模型可能向终端用户泄露。为缓解这一风险,我们提出了一种基于Arm可信执行环境(TEE)TrustZone的设备端LLM保护系统设计。该系统解决了两大核心挑战:(1)内存效率与快速推理之间的矛盾(在TEE内存中缓存模型参数);(2)富执行环境(REE)与TEE之间缺乏高效安全的神经网络处理器(NPU)分时共享机制。

Reasoning in Diffusion Large Language Models is Concentrated in Dynamic Confusion Zones
核心问题指出:现有dLLM的轨迹型RL方法普遍采用均匀子采样策略,假设所有去噪步骤同等重要,但这一假设存在缺陷——推理过程中仅少数“关键节点”决定最终成败,均匀分配梯度预算会浪费计算资源在无意义步骤上,导致训练不稳定、推理精度不足。轨迹动态分析。

Mathematical Analysis of Hallucination Dynamics in Large Language Models: Uncertainty Quantificat...
大型语言模型(LLMs)是强大的语言处理工具,但仍易产生幻觉——即听起来合理但事实不准确或缺乏依据的输出。本研究提出一个连贯、基于数学原理的框架,用于理解、量化和缓解这些幻觉。借助概率建模、信息论、三角信号分析和贝叶斯不确定性估算,我们分析了误差如何在自回归生成中累积,提出了精细化的不确定性指标(包括语义感知和相位感知变体),并开发了原则性缓解策略:对比解码、检索增强接地、事实对齐和弃权机制。这一统一视角整合了校准、检索和对齐领域的最新进展,为构建更安全、更可靠的大型语言模型提供了支持。

From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
随着多模态大型语言模型(MLLMs)在感知任务中取得显著成功,增强其复杂推理能力已成为关键研究焦点。现有模型仍面临推理路径不透明、泛化能力不足等挑战。思维链(CoT)推理在语言模型中已展现出提升推理透明度和输出可解释性的显著成效,将其扩展到多模态领域有望改善模型推理能力。本文围绕“多模态思维链(MCoT)”展开系统性综述:首先从技术演进和任务需求视角分析其诞生的背景与理论动机;然后从思维链范式、训练后阶段、推理阶段三个方面介绍主流MCoT方法,并解析其底层机制;

欢迎留下您的脚印