Loading...
本文聚焦大型语言模型(LLMs)的跨语言对齐能力评估,提出了一种基于神经元状态的新框架,并通过实验验证了其有效性。研究背景:现有跨语言对齐评估方法多依赖句子嵌入,但神经模型的表示空间存在非光滑性(如各向异性),尤其影响低资源语言的语义对齐评估。核心方法:受神经科学中“相似信息激活重叠神经元区域”的启发,NeuronXA通过量化神经元对多语言平行语料的激活一致性来评估跨语言对齐。具体包括:神经元状态检测(激活状态为二进制0/1,激活值为绝对强度);
Language Integration in Fine-Tuning Multimodal Large Language Models for Image-Based Regression
多模态大型语言模型(MLLMs)在基于图像的回归任务中展现出潜力,但当前方法存在关键局限性。近期方法通过预设输出词汇和通用任务级提示(如“你会如何评价这张图像?”)微调MLLMs,假设这能模拟人类评分行为。我们的分析表明,这些方法并不优于仅用图像的训练方式:使用预设词汇和通用提示的模型与仅用图像的模型性能相当,未能利用文本输入的语义理解能力。我们提出基于Transformer分类的回归(RvTC),用灵活的分箱策略替代词汇约束的分类。
Large Language Models‘ Internal Perception of Symbolic Music
大型语言模型(LLMs)擅长建模自然语言中字符串之间的关系,并已展现出扩展到其他符号领域(如编程或数学)的潜力。然而,它们对符号音乐的隐式建模程度仍未得到充分探索。本文通过从描述类型和风格组合的文本提示生成符号音乐数据,并通过识别和生成任务评估其效用,来研究LLMs如何表示音乐概念。我们在不依赖显式音乐训练的情况下,生成了一个LLM生成的MIDI文件数据集。然后,我们完全基于这个LLM生成的MIDI数据集训练神经网络,进行类型和风格分类以及旋律补全,并将其性能与现有模型进行基准对比。
Strategy Adaptation in Large Language Model Werewolf Agents
本研究提出了一种通过根据其他玩家的态度和对话上下文切换预定义策略来提高狼人杀代理性能的方法。尽管先前使用提示工程的狼人杀代理研究已采用隐含定义有效策略的方法,但这些方法无法适应不断变化的情境。在本研究中,我们提出了一种基于游戏上下文和其他玩家角色估计结果来明确选择合适策略的方法。我们将具备策略适应能力的狼人杀代理与采用隐含或固定策略的基线代理进行对比,验证了所提方法的有效性。
Improving Drug Identification in Overdose Death Surveillance using Large Language Models
本文旨在通过自然语言处理(NLP)模型改进美国药物过量死亡监测中的药物识别准确性和时效性。研究使用2020年来自美国10个地区的35,433条死亡记录作为训练和内部测试数据,2023-2024年的3,335条独立记录作为外部验证数据,比较了多种NLP方法的性能,包括传统单标签/多标签分类器、编码器模型(如BERT、BioClinicalBERT)和大型语言模型(LLMs,如Qwen3、Llama3)。
Assessing the Value of Visual Input: A Benchmark of Multimodal Large Language Models for Robotic ...
大型语言模型(LLMs)在增强机器人路径规划方面展现出潜力。本文通过全面的基准测试,评估了视觉输入对多模态大型语言模型在这类任务中的效用。我们在2D网格环境中评估了15个多模态大型语言模型生成有效且最优路径的能力(该环境模拟简化的机器人规划场景),比较了仅文本输入与文本+视觉输入在不同模型规模和网格复杂度下的表现。结果表明,在较简单的小网格任务中,模型成功率中等,视觉输入或少样本文本提示能带来一定收益;但在较大网格上,性能显著下降,凸显了可扩展性挑战。
Improving Contextual ASR via Multi-grained Fusion with Large Language Models
尽管端到端自动语音识别(ASR)模型在通用语音转录任务中表现出色,但它们在准确识别上下文相关关键词(如专有名词或用户特定实体)时往往存在困难。以往的研究通过文本模态的关键词词典来改进关键词识别,主要分为令牌级融合(引导逐令牌生成)和短语级融合(支持直接复制关键词短语)两种方式。然而,这些方法基于不同的粒度,且各有局限。本文提出一种新颖的多粒度融合方法,结合大型语言模型(LLMs),同时利用令牌级和短语级融合的优势。
Assay2Mol: large language model-based drug design using BioAssay context
本文提出了一种基于大型语言模型(LLM)的药物设计工作流Assay2Mol,旨在利用海量未结构化的生物测定(BioAssay)数据加速早期药物发现。根据目标蛋白或表型的文本描述,从PubChem等数据库中检索相关的BioAssay记录;对检索到的BioAssay数据进行过滤、总结和分析,提取关键实验信息(如分子结构、活性结果等);利用LLM的上下文学习能力,基于这些BioAssay数据生成具有目标活性的候选分子。
Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
本文聚焦于单体多模态大语言模型(MLLMs),这类模型将视觉编码与语言解码整合到单一模型中,旨在解决现有单体MLLMs在优化稳定性和灾难性遗忘方面的挑战。核心问题:现有单体MLLMs的预训练策略常面临优化不稳定和灾难性遗忘(即学习视觉知识时丢失原有语言能力),且训练成本高、推理效率低。解决方案提出:通过混合专家(MoE)架构嵌入视觉专家网络,并设计内源性视觉预训练(EViP)策略,分三阶段(概念学习、语义学习、对齐学习)渐进式学习视觉知识,同时冻结LLM参数以保留语言能力。提出。
Evaluating the Ability of Large Language Models to Reason about Cardinal Directions, Revisited
本文聚焦于评估大型语言模型(LLMs)对基本方向(cardinaldirections,CDs)的推理能力,是对作者此前在COSIT-24会议上发表工作的扩展。研究使用一个包含5760个问题的基准数据集(由6个模板生成),测试了28个LLM(包括最新的大型推理模型LRMs)的表现。研究背景:空间推理是人类在物理世界中行动的基础,而LLMs不具备实体性,其对现实世界场景的空间推理能力有待验证。基本方向推理在导航、地理理解、气候分析等领域至关重要,因此成为研究焦点。实验设计。
FCRF: Flexible Constructivism Reflection for Long-Horizon Robotic Task Planning with Large Langua...
本文针对家用机器人在复杂长时程任务执行中存在的误差累积问题,提出了一种基于大语言模型(LLMs)的灵活建构主义反思框架(FlexibleConstructivismReflectionFramework,FCRF)。该框架借鉴人类认知适应机制,采用“导师-执行者(Mentor-Actor)”架构,解决现有LLM自反思方法中反思机制僵化、无法根据任务难度调整强度的局限。执行者(Actor):基于ReAct框架生成行动序列,负责任务规划执行;导师(Mentor)
Large Language Model as An Operator: An Experience-Driven Solution for Distribution Network Volta...
研究背景:大型语言模型(LLMs)在自然语言处理和知识储备上的优势使其逐渐被引入电力系统,但现有研究中LLMs多用于辅助任务(如模拟设置、预测等),在调度策略生成中仅起支持作用,依赖优化算法或强化学习代理。核心问题:探索LLMs能否独立生成电力系统调度策略,针对配电网电压控制这一典型的“经验驱动”场景(实际中模型和数据精度有限,调度策略常依赖专家经验)展开研究。提出方法:构建了基于LLMs的经验驱动电压控制方案,包含四个核心模块:经验存储。
Rethinking Memorization Measures and their Implications in Large Language Models
本文围绕大语言模型(LLMs)中的记忆(memorization)现象展开研究,核心探讨了三个问题:最优语言学习中是否能避免记忆、记忆带来的隐私威胁是否被夸大、不同记忆度量方法的差异及影响。记忆度量方法的重新审视:分析了现有基于回忆的(recollection-based)和反事实的(counterfactual)记忆度量方法,并提出新的情境记忆(contextualmemorization)度量。
Automated Safety Evaluations Across 20 Large Language Models: The Aymara LLM Risk and Responsibil...
随着大型语言模型(LLMs)越来越多地融入现实世界应用,可扩展且严谨的安全评估变得至关重要。本文介绍了艾马拉AI(AymaraAI),这是一个用于生成和管理定制化、基于政策的安全评估的程序化平台。艾马拉AI将自然语言安全政策转化为对抗性提示,并使用经人类判断验证的AI评分器对模型响应进行评分。我们通过“艾马拉大语言模型风险与责任矩阵”展示了其能力,该矩阵在10个真实世界安全领域对20个商用LLM进行了评估。结果显示,模型表现差异显著,安全得分均值范围为86.2%至52.4%。
Large Language Models as Medical Codes Selectors: a benchmark using the International Classificat...
本文研究了大型语言模型(LLMs)在自动分配国际初级保健分类(ICPC-2)编码中的潜力,通过结合领域特定搜索引擎的输出,评估其在医疗编码任务中的性能。背景:医疗编码对医疗数据结构化、研究、质量监控和政策制定至关重要,但人工编码耗时且易出错,自动化需求迫切。方法。
A Hybrid Framework for Subject Analysis: Integrating Embedding-Based Regression Models with Large...
本文聚焦图书馆管理系统中的主题分析任务,提出了一种融合基于嵌入的机器学习(ML)模型与大型语言模型(LLMs)的混合框架,用于预测图书的国会图书馆主题标题(LCSH)。传统机器学习模型在多标签分类中难以处理未见过的案例,而LLMs虽在分类和摘要任务中应用广泛,但在主题分析中存在过度生成和“幻觉”(生成非标准术语)的问题。利用ML模型预测LCSH标签的最佳数量,指导LLM生成,避免过度或不足生成;对LLM生成的术语进行后处理,用实际LCSH术语替换“幻觉”术语,减少错误。
Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models
在本文中,我们提出了VideoNarrator,这是一种新颖的无需训练的管道,旨在生成密集视频字幕,为视频内容提供结构化快照。这些字幕包含带有精确时间戳的详细叙述,能够捕捉视频每个片段中的细微信息。尽管多模态大语言模型(MLLMs)在视频理解方面取得了进展,但这些模型在时间对齐叙述方面常常存在困难,且在不熟悉的场景中容易产生“幻觉”(即生成不准确内容)。VideoNarrator通过一个灵活的管道解决了这些挑战,其中现成的MLLMs和视觉语言模型(VLMs)可分别作为字幕生成器、上下文提供者或字幕验证器。
What do Large Language Models know about materials?
本文聚焦大型语言模型(LLMs)在材料科学与工程中的应用,核心探讨LLMs对材料知识的掌握能力及其在材料的“加工-结构-性能-性能表现”(Processing-Structure-Property-Performance,PSPP)链推理中的适用性。研究背景:LLMs通过语言接口建立关联,有望用于PSPP链的逐步推理,但训练数据多来自互联网(含大量非科学内容),其材料知识的准确性需验证。
Descrip3D: Enhancing Large Language Model-based 3D Scene Understanding with Object-Level Text Des...
理解3D场景不仅仅是识别对象,还需要推理对象之间的空间和语义关系。当前的3D场景-语言模型在这种关系理解上常常存在困难,尤其是当仅靠视觉嵌入无法充分传达对象的角色和交互时。在本文中,我们提出了Descrip3D,这是一种新颖且强大的框架,它使用自然语言显式编码对象之间的关系。与以往仅依赖2D和3D嵌入的方法不同,Descrip3D为每个对象添加了文本描述,以捕捉其内在属性和上下文关系。这些关系线索通过双层次整合融入模型:嵌入融合和提示级注入。
Large Language Models Assisting Ontology Evaluation
研究背景:本体评估中的能力问题(CQ)验证是重要的功能需求验证方式,但传统方法耗时、费力且易出错。近年来大语言模型(LLMs)在本体工程中展现潜力,但在通过CQ验证进行功能评估(尤其是人机协同场景)的研究仍属空白。核心贡献提出OE-Assist框架,通过自动和半自动方式辅助CQ验证,实现本体功能评估。构建OntoEval数据集,包含1393个CQ及其对应的本体和本体故事,由两位本体工程师交叉验证标注。
