Loading...

Comparison of Text-Based and Image-Based Retrieval in Multimodal Retrieval Augmented Generation L...
检索增强生成(RAG)的最新进展已使大型语言模型(LLMs)能够访问包含文本和视觉信息(如财务文档中的图表、示意图和表格)的多模态知识库。然而,现有多模态RAG系统在预处理阶段依赖基于LLM的总结将图像转换为文本,仅在向量数据库中存储文本表示,这导致下游检索和问答任务关键的上下文信息与视觉细节丢失。为解决这一局限,本文对多模态RAG系统的两种检索方法进行了全面对比分析,包括文本基片段检索(图像在嵌入前先总结为文本)和直接多模态嵌入检索(图像以原生形式存储在向量空间中,并在生成过程中传递给视觉LLM)。

Hallucination in World Models is Predictable and Preventable
现代生成式世界模型能够生成越来越逼真、可通过动作控制的未来画面,但这类模型频繁产生幻觉:推演生成的画面视觉流畅,却逐渐偏离真实环境的动力学规律。本文提出假设:幻觉集中出现在状态-动作空间数据覆盖不足的区域,可依靠轻量、基于数据的模型内部信号实现幻觉检测与优化缓解。为验证该假设,我们构建MMBench2数据集:一套总时长427小时、包含210项任务的视觉世界建模数据集,配套真值动作、奖励标签与实时仿真环境,并基于该数据集训练3.5亿参数的世界模型。

Detecting Sleeper Agents in Large Language Models via Semantic Drift Analysis
该研究针对大型语言模型(LLMs)中“潜伏代理”(sleeperagents)这一安全隐患,提出了一种实用的实时检测系统。“潜伏代理”指模型在训练和安全评估阶段表现正常,却在特定部署条件下被触发恶意行为,且现有安全训练(如RLHF)无法消除此类后门。研究核心是双方法检测架构语义漂移检测:利用Sentence-BERT生成文本嵌入,计算模型部署时的响应与安全基线响应的语义偏差(余弦相似度),通过Z分数归一化识别异常;金丝雀基线对比。

Watchdogs and Oracles: Runtime Verification Meets Large Language Models for Autonomous Systems
双向共生融合视角:突破现有研究中“LLM仅作为翻译工具”或“RV仅作为LLM监控手段”的单向关系,提出二者双向赋能——LLM增强RV的预测性与可访问性,RV为LLM提供形式化安全保障,形成统一架构。聚焦自主系统的场景适配:区别于通用的LLM与形式化方法融合研究,专门针对自主系统的实时监控、不完全信息、安全关键决策等核心需求,强化预测性监控与不确定性处理的落地性。多层级监控与预测性融合。

ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions
指令遵循是大语言模型(LLMs)的核心能力。现有研究主要评估模型对用户指令的遵循程度,却往往忽视了指令中包含冲突约束的场景——这在复杂提示中十分常见。LLMs在该类场景下的表现尚未得到充分探究。为填补这一空白,我们提出ConInstruct基准数据集,专门用于评估LLMs检测和解决用户指令中冲突的能力。利用该数据集,我们评估了LLMs的冲突检测性能,并分析了它们的冲突解决行为。实验结果揭示了两个关键发现:(1)多数闭源LLMs展现出强劲的冲突检测能力,而开源模型中仅DeepSeek-R1表现相当。

Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
大型语言模型(LLMs)正日益融入教育应用中。然而,它们仍然容易受到越狱攻击和微调攻击的影响,这些攻击可能破坏安全对齐并产生有害输出。现有研究主要集中于通用安全评估,对教育场景的独特安全需求关注有限。为填补这一空白,我们构建了EduHarm基准,包含五个典型教育场景下的安全-不安全指令对,为教育类LLM提供系统化的安全评估工具。此外,我们提出了一种适用于教育类LLM的三阶段防御框架(TSSF),可同时缓解越狱攻击和微调攻击。

OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models
首个多模态协同压缩框架:首次针对OmniLLMs开展音视频令牌联合压缩研究,突破传统单模态压缩局限,适配音视频令牌的时空耦合特性。音频引导动态剪枝策略:以音频保留分数为信息密度代理,动态调整视频剪枝率,实现跨模态语义与时间对齐的精准保留,避免盲目剪枝导致的性能损失。交错时空压缩模块(ISTC):创新地交替处理时间冗余(相邻帧令牌相似度合并)与空间冗余(密度峰值聚类剪枝),在抑制冗余的同时避免单一维度过度压缩。无训练与高兼容性设计。

Lost in the Pipeline: How Well Do Large Language Models Handle Data Preparation?
大型语言模型(LLMs)近年来在支持和自动化各类任务中展现出卓越能力。在众多值得探索以测试LLM能力的任务中,我们聚焦于数据准备——这一数据驱动流程中至关重要但往往耗时费力的环节。本文旨在研究LLM是否能有效支持用户选择并自动化数据准备任务。为此,我们同时选取了通用型LLM与经微调的表格型LLM,通过向这些模型输入低质量数据集,评估其执行数据探查、数据清洗等任务的能力,并将LLM提供的支持与传统数据准备工具进行对比。

ELPO: Ensemble Learning Based Prompt Optimization for Large Language Models
大型语言模型(LLMs)的卓越性能高度依赖精心设计的提示词。然而,人工提示词工程是一项费力的工作,成为LLMs实际应用的核心瓶颈。这一现象催生了一个新兴研究领域——自动提示词优化(APO),该领域近年来发展迅速。现有APO方法(如基于进化算法或试错法的方法)在一定程度上实现了高效准确的提示词优化,但这些研究聚焦于单一模型或算法进行生成策略与优化过程,限制了其在处理复杂任务时的性能。为解决这一问题,我们提出一种名为基于集成学习的提示词优化(ELPO)的新型框架,以实现更准确、更鲁棒的结果。

Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-Wo...
本文围绕“大型语言模型(LLMs)能否在真实临床场景中胜任儿科医生工作”这一核心问题,构建了(儿科动态智能、适应性与安全性评估基准),从“基础医学知识应用”“动态诊疗能力”“儿科医疗安全与伦理”三个维度,对过去两年发布的12款代表性LLMs(含GPT-4o、Qwen3-235B-A22B、DeepSeek-V3等)进行了系统性评估。评估覆盖19个儿科亚专科、211种典型疾病,采用选择题(单/多选)、简答题等多种题型,结合真实临床病例与标准化考试资源设计任务。

Bridging Human and Model Perspectives: A Comparative Analysis of Political Bias Detection in News...
检测新闻媒体中的政治偏见是一项复杂任务,需要解读微妙的语言和语境线索。尽管自然语言处理(NLP)领域的最新进展已实现自动偏见分类,但大型语言模型(LLMs)与人类判断的契合程度仍未得到充分探索,且尚未被深入理解。本研究旨在提出一个对比框架,用于评估人类标注与多个大型语言模型(包括GPT、BERT、RoBERTa和FLAN)在政治偏见检测中的表现。我们构建了一个人工标注的新闻文章数据集,通过评估标注一致性、偏见极性和模型间一致性,量化人类与模型在偏见感知上的差异。

Failure to Mix: Large language models struggle to answer according to desired probability distrib...
科学想法的生成与筛选需要遵循目标概率分布进行探索。相比之下,当前的人工智能基准测试均存在客观正确答案,而通过强化学习针对这些基准训练大型语言模型(LLMs)会抑制概率性探索。本文中,我们开展了系统性实验,要求大型语言模型生成符合简单概率分布的输出,结果发现所有接受测试的现代大型语言模型均严重无法遵循指定分布。例如,当要求以49%的概率输出"1"时,模型输出"0"的概率接近100%。这种近乎只生成概率略高选项的阶跃函数式行为,甚至会覆盖大型语言模型内置的强烈偏差。

A Specialized Large Language Model for Clinical Reasoning and Diagnosis in Rare Diseases
该研究针对罕见病诊断周期长(平均4-8年)、现有方法存在证据提取与诊断推理脱节、大语言模型(LLM)面临数据稀缺、知识陈旧和幻觉等问题,开发了一款专注于罕见病临床推理与诊断的领域专用大语言模型。核心数据资源构建。

AutoTool: Efficient Tool Selection for Large Language Model Agents
大型语言模型(LLM)智能体已成为自动化复杂任务的强大工具,其核心优势在于利用LLM的推理和决策能力。然而,当前智能体框架的主要瓶颈在于工具选择的高推理成本——尤其是在ReAct等方法中,需在每个步骤反复调用LLM以确定使用何种工具。本文提出AutoTool,一种基于图结构的新型框架,其核心创新在于利用一项关键实证发现:工具使用惯性(toolusageinertia),即工具调用遵循可预测的序列模式,从而绕过重复的LLM推理。

Bias in, Bias out: Annotation Bias in Multilingual Large Language Models
自然语言处理(NLP)数据集的标注偏差仍是多语言大型语言模型(LLMs)发展的主要挑战,尤其在文化多元场景中。来自任务框架、标注者主观性和文化错配的偏差会扭曲模型输出并加剧社会危害。本文提出一个理解标注偏差的综合框架,区分了指令偏差、标注者偏差以及语境与文化偏差。我们综述了检测方法(包括标注者间一致性、模型分歧和元数据分析),并重点介绍了多语言模型分歧和文化推理等新兴技术。进一步,我们概述了主动和被动缓解策略,包括招募多样化标注者、迭代优化指南以及事后模型调整。

Encoding and Understanding Astrophysical Information in Large Language Model-Generated Summaries
本文以天体物理学X射线源为研究对象,探索大型语言模型(LLMs)能否编码科学测量中获取的物理信息,核心围绕两个问题展开:1)提示词设计是否影响LLM对物理量的编码效果;2)文本中的哪些语言层面内容对编码测量所代表的物理信息最为关键。研究过程中,作者整合了NASA天体物理学数据系统(ADS)的科学论文文本语料与钱德拉源目录(CSC)中的物理统计数据,通过OpenAI的gpt-4o-mini模型生成天体物理源的物理信息摘要,并使用ada-002模型将摘要编码为嵌入向量。

Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and ...
我们推出了荔枝(Lychee)系列的Uni-MoE2.0。作为一款全开源的全能模态大模型(OLM),它在以语言为中心的多模态理解、推理和生成方面显著推进了荔枝系列的Uni-MoE模型。基于稠密型大语言模型(LLM),我们通过三大核心贡献从零构建了Uni-MoE-2.0-Omni:动态容量混合专家(MoE)设计、结合迭代强化策略的渐进式训练方法,以及精心设计的多模态数据匹配技术。该模型具备全能模态理解能力,同时支持图像、文本和语音生成。

Prompting Large Language Models to Detect Dementia Family Caregivers
本文针对SMM4H2025共享任务3(检测Twitter上痴呆症家庭护理者的推文)展开研究,该任务为二分类问题:区分推文作者是否提及自己有痴呆症家庭成员(标签1)或仅提及痴呆症但无个人关联(标签0)。数据准备:针对训练集标签不平衡(约33%标签0、67%标签1),采用过采样方法平衡两类样本;未使用预处理(如去停用词),因原始数据包含关键语境信息。提示设计:测试了零样本、少样本、思维链(ChainofThought)、级联(Cascade)四种提示策略,将任务转化为指令式对话格式。模型微调。

DEVAL: A Framework for Evaluating and Improving the Derivation Capability of Large Language Models
本文聚焦大型语言模型(LLMs)的推导能力(DerivationCapability,DC)概念定义:正式定义“推导关系(DR)”为输入域变化(T)与输出域变化(R)的映射规则,推导能力(DC)则是LLMs遵循DR,在输入发生特定变化时对输出进行相应调整的能力。评估框架(DEVAL):提出系统化评估框架DEVAL,通过“规则形式化(将任务规则转化为DR)→数据集构建(基于DR生成测试数据)→模型评估(量化输出是否符合DR)”三步流程,解决传统评估无法衡量“变化一致性”的缺陷。模型评估结果。

Knowledge-Grounded Agentic Large Language Models for Multi-Hazard Understanding from Reconnaissan...
数据集构建:创建了HazardRecQA数据集,基于GEER全球7类灾害(地震、飓风、洪水等)的90起事件侦察报告,生成5776个问答对,涵盖灾害特征、分析方法、影响与破坏、响应与恢复四大知识类别,支持模型客观评估。框架设计:提出混合检索智能RAG(MoRA-RAG)框架,核心包含三部分:智能分块(AgenticChunk):通过LLM代理提取事实命题并分组,保留上下文连贯性,避免传统分块的语义碎片化;

欢迎留下您的脚印