Loading...
本文旨在通过自然语言处理(NLP)模型改进美国药物过量死亡监测中的药物识别准确性和时效性。研究使用2020年来自美国10个地区的35,433条死亡记录作为训练和内部测试数据,2023-2024年的3,335条独立记录作为外部验证数据,比较了多种NLP方法的性能,包括传统单标签/多标签分类器、编码器模型(如BERT、BioClinicalBERT)和大型语言模型(LLMs,如Qwen3、Llama3)。
Assessing the Value of Visual Input: A Benchmark of Multimodal Large Language Models for Robotic ...
大型语言模型(LLMs)在增强机器人路径规划方面展现出潜力。本文通过全面的基准测试,评估了视觉输入对多模态大型语言模型在这类任务中的效用。我们在2D网格环境中评估了15个多模态大型语言模型生成有效且最优路径的能力(该环境模拟简化的机器人规划场景),比较了仅文本输入与文本+视觉输入在不同模型规模和网格复杂度下的表现。结果表明,在较简单的小网格任务中,模型成功率中等,视觉输入或少样本文本提示能带来一定收益;但在较大网格上,性能显著下降,凸显了可扩展性挑战。
Improving Contextual ASR via Multi-grained Fusion with Large Language Models
尽管端到端自动语音识别(ASR)模型在通用语音转录任务中表现出色,但它们在准确识别上下文相关关键词(如专有名词或用户特定实体)时往往存在困难。以往的研究通过文本模态的关键词词典来改进关键词识别,主要分为令牌级融合(引导逐令牌生成)和短语级融合(支持直接复制关键词短语)两种方式。然而,这些方法基于不同的粒度,且各有局限。本文提出一种新颖的多粒度融合方法,结合大型语言模型(LLMs),同时利用令牌级和短语级融合的优势。
Assay2Mol: large language model-based drug design using BioAssay context
本文提出了一种基于大型语言模型(LLM)的药物设计工作流Assay2Mol,旨在利用海量未结构化的生物测定(BioAssay)数据加速早期药物发现。根据目标蛋白或表型的文本描述,从PubChem等数据库中检索相关的BioAssay记录;对检索到的BioAssay数据进行过滤、总结和分析,提取关键实验信息(如分子结构、活性结果等);利用LLM的上下文学习能力,基于这些BioAssay数据生成具有目标活性的候选分子。
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
本文聚焦于单体多模态大语言模型(MLLMs),这类模型将视觉编码与语言解码整合到单一模型中,旨在解决现有单体MLLMs在优化稳定性和灾难性遗忘方面的挑战。核心问题:现有单体MLLMs的预训练策略常面临优化不稳定和灾难性遗忘(即学习视觉知识时丢失原有语言能力),且训练成本高、推理效率低。解决方案提出:通过混合专家(MoE)架构嵌入视觉专家网络,并设计内源性视觉预训练(EViP)策略,分三阶段(概念学习、语义学习、对齐学习)渐进式学习视觉知识,同时冻结LLM参数以保留语言能力。提出。
Evaluating the Ability of Large Language Models to Reason about Cardinal Directions, Revisited
本文聚焦于评估大型语言模型(LLMs)对基本方向(cardinaldirections,CDs)的推理能力,是对作者此前在COSIT-24会议上发表工作的扩展。研究使用一个包含5760个问题的基准数据集(由6个模板生成),测试了28个LLM(包括最新的大型推理模型LRMs)的表现。研究背景:空间推理是人类在物理世界中行动的基础,而LLMs不具备实体性,其对现实世界场景的空间推理能力有待验证。基本方向推理在导航、地理理解、气候分析等领域至关重要,因此成为研究焦点。实验设计。
FCRF: Flexible Constructivism Reflection for Long-Horizon Robotic Task Planning with Large Langua...
本文针对家用机器人在复杂长时程任务执行中存在的误差累积问题,提出了一种基于大语言模型(LLMs)的灵活建构主义反思框架(FlexibleConstructivismReflectionFramework,FCRF)。该框架借鉴人类认知适应机制,采用“导师-执行者(Mentor-Actor)”架构,解决现有LLM自反思方法中反思机制僵化、无法根据任务难度调整强度的局限。执行者(Actor):基于ReAct框架生成行动序列,负责任务规划执行;导师(Mentor)
Large Language Model as An Operator: An Experience-Driven Solution for Distribution Network Volta...
研究背景:大型语言模型(LLMs)在自然语言处理和知识储备上的优势使其逐渐被引入电力系统,但现有研究中LLMs多用于辅助任务(如模拟设置、预测等),在调度策略生成中仅起支持作用,依赖优化算法或强化学习代理。核心问题:探索LLMs能否独立生成电力系统调度策略,针对配电网电压控制这一典型的“经验驱动”场景(实际中模型和数据精度有限,调度策略常依赖专家经验)展开研究。提出方法:构建了基于LLMs的经验驱动电压控制方案,包含四个核心模块:经验存储。
Rethinking Memorization Measures and their Implications in Large Language Models
本文围绕大语言模型(LLMs)中的记忆(memorization)现象展开研究,核心探讨了三个问题:最优语言学习中是否能避免记忆、记忆带来的隐私威胁是否被夸大、不同记忆度量方法的差异及影响。记忆度量方法的重新审视:分析了现有基于回忆的(recollection-based)和反事实的(counterfactual)记忆度量方法,并提出新的情境记忆(contextualmemorization)度量。
Automated Safety Evaluations Across 20 Large Language Models: The Aymara LLM Risk and Responsibil...
随着大型语言模型(LLMs)越来越多地融入现实世界应用,可扩展且严谨的安全评估变得至关重要。本文介绍了艾马拉AI(AymaraAI),这是一个用于生成和管理定制化、基于政策的安全评估的程序化平台。艾马拉AI将自然语言安全政策转化为对抗性提示,并使用经人类判断验证的AI评分器对模型响应进行评分。我们通过“艾马拉大语言模型风险与责任矩阵”展示了其能力,该矩阵在10个真实世界安全领域对20个商用LLM进行了评估。结果显示,模型表现差异显著,安全得分均值范围为86.2%至52.4%。
Large Language Models as Medical Codes Selectors: a benchmark using the International Classificat...
本文研究了大型语言模型(LLMs)在自动分配国际初级保健分类(ICPC-2)编码中的潜力,通过结合领域特定搜索引擎的输出,评估其在医疗编码任务中的性能。背景:医疗编码对医疗数据结构化、研究、质量监控和政策制定至关重要,但人工编码耗时且易出错,自动化需求迫切。方法。
A Hybrid Framework for Subject Analysis: Integrating Embedding-Based Regression Models with Large...
本文聚焦图书馆管理系统中的主题分析任务,提出了一种融合基于嵌入的机器学习(ML)模型与大型语言模型(LLMs)的混合框架,用于预测图书的国会图书馆主题标题(LCSH)。传统机器学习模型在多标签分类中难以处理未见过的案例,而LLMs虽在分类和摘要任务中应用广泛,但在主题分析中存在过度生成和“幻觉”(生成非标准术语)的问题。利用ML模型预测LCSH标签的最佳数量,指导LLM生成,避免过度或不足生成;对LLM生成的术语进行后处理,用实际LCSH术语替换“幻觉”术语,减少错误。
Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models
在本文中,我们提出了VideoNarrator,这是一种新颖的无需训练的管道,旨在生成密集视频字幕,为视频内容提供结构化快照。这些字幕包含带有精确时间戳的详细叙述,能够捕捉视频每个片段中的细微信息。尽管多模态大语言模型(MLLMs)在视频理解方面取得了进展,但这些模型在时间对齐叙述方面常常存在困难,且在不熟悉的场景中容易产生“幻觉”(即生成不准确内容)。VideoNarrator通过一个灵活的管道解决了这些挑战,其中现成的MLLMs和视觉语言模型(VLMs)可分别作为字幕生成器、上下文提供者或字幕验证器。
What do Large Language Models know about materials?
本文聚焦大型语言模型(LLMs)在材料科学与工程中的应用,核心探讨LLMs对材料知识的掌握能力及其在材料的“加工-结构-性能-性能表现”(Processing-Structure-Property-Performance,PSPP)链推理中的适用性。研究背景:LLMs通过语言接口建立关联,有望用于PSPP链的逐步推理,但训练数据多来自互联网(含大量非科学内容),其材料知识的准确性需验证。
Descrip3D: Enhancing Large Language Model-based 3D Scene Understanding with Object-Level Text Des...
理解3D场景不仅仅是识别对象,还需要推理对象之间的空间和语义关系。当前的3D场景-语言模型在这种关系理解上常常存在困难,尤其是当仅靠视觉嵌入无法充分传达对象的角色和交互时。在本文中,我们提出了Descrip3D,这是一种新颖且强大的框架,它使用自然语言显式编码对象之间的关系。与以往仅依赖2D和3D嵌入的方法不同,Descrip3D为每个对象添加了文本描述,以捕捉其内在属性和上下文关系。这些关系线索通过双层次整合融入模型:嵌入融合和提示级注入。
Large Language Models Assisting Ontology Evaluation
研究背景:本体评估中的能力问题(CQ)验证是重要的功能需求验证方式,但传统方法耗时、费力且易出错。近年来大语言模型(LLMs)在本体工程中展现潜力,但在通过CQ验证进行功能评估(尤其是人机协同场景)的研究仍属空白。核心贡献提出OE-Assist框架,通过自动和半自动方式辅助CQ验证,实现本体功能评估。构建OntoEval数据集,包含1393个CQ及其对应的本体和本体故事,由两位本体工程师交叉验证标注。
Intent-Based Network for RAN Management with Large Language Models
本文提出了一种基于意图的无线接入网(RAN)管理系统,该系统整合大语言模型(LLMs)以解决RAN管理中日益增长的复杂性问题,核心是通过LLM驱动的代理架构实现高层用户意图到精确RAN配置的动态翻译与优化。核心背景:随着RAN中服务类型和资源需求的多样化,网络配置复杂度激增,传统手动配置难以满足敏捷性和可扩展性需求。基于意图的网络(IBN)通过高层意图声明简化配置,但意图到具体指令的准确翻译仍是关键挑战。系统架构。
Value-Based Large Language Model Agent Simulation for Mutual Evaluation of Trust and Interpersona...
大型语言模型(LLMs)已成为模拟复杂社会现象的强大工具,可通过类人代理(具有特定特征)实现。在人类社会中,价值相似性对建立信任和亲密关系至关重要,但这一原则在由LLM代理组成的人工社会中是否成立仍未可知。因此,本研究通过两个实验探究价值相似性对LLM代理间关系建立的影响。首先,在初步实验中,我们评估了LLMs中价值的可控性,以确定控制价值的最有效模型和提示词设计。随后,在主要实验中,我们生成了具有特定价值的LLM代理对,并分析了它们在对话后对彼此信任和人际亲密感的相互评估。
The Evolving Role of Large Language Models in Scientific Innovation: Evaluator, Collaborator, and...
本文系统探讨了大型语言模型(LLMs)在科学创新中的演变角色,提出了一个金字塔式的层级框架,将其角色分为评估者(Evaluator)、合作者(Collaborator)和科学家(Scientist),并从基准测试、算法、评估结果等维度分析了各角色的能力与局限。核心框架评估者:聚焦科学知识合成(如文献整合、知识提取)和文献质量评估(如创新性、严谨性判断),辅助研究者处理信息过载问题。合作者。
Tracing Facts or just Copies? A critical investigation of the Competitions of Mechanisms in Large...
本文呈现了一项可复现性研究,探究大型语言模型(LLMs)如何处理竞争性的事实与反事实信息,重点关注注意力头在这一过程中的作用。我们尝试复现并整合Ortu等人[13]、Yu、Merullo与Pavlick[17]以及McDougall等人[7]的三项近期研究成果,这些研究通过机械可解释性工具探究了模型习得事实与矛盾上下文信息之间的竞争。本研究具体分析了注意力头强度与事实输出比例的关系,评估了关于注意力头抑制机制的竞争性假设,并探究了这些注意力模式的领域特异性。
