Loading...

ChiMed 2.0: Advancing Chinese Medical Dataset in Facilitating Large Language Modeling
本文介绍了一个大规模中文医疗数据集ChiMed2.0,旨在推动中文医疗领域大语言模型(LLM)的研究与应用。该数据集扩展了此前的ChiMed工作,整合了来自中文医疗在线平台的真实数据和LLM生成的数据,涵盖传统中医经典文献和现代通用医疗数据,总规模达2.044亿汉字。具体而言,ChiMed2.0包含三部分核心数据:16.48万篇预训练文档、35.16万对有监督微调(SFT)问答对、4.17万条人类反馈强化学习(RLHF)偏好数据元组。

SimdBench: Benchmarking Large Language Models for SIMD-Intrinsic Code Generation
本文提出了SimdBench,这是首个专门用于评估大型语言模型(LLMs)生成SIMDintrinsic代码能力的基准测试。SIMD(单指令多数据)指令通过并行处理多个数据项加速性能关键任务,而SIMDintrinsic是编译器提供的内置函数,允许程序员在高级语言中显式调用SIMD指令,平衡编码效率与高性能。现有代码生成基准主要关注标量代码,缺乏对SIMDintrinsic代码的评估。

The Generative Energy Arena (GEA): Incorporating Energy Awareness in Large Language Model (LLM) H...
本文针对大型语言模型(LLMs)评估中能源消耗因素被忽视的问题,提出了生成能源竞技场(GenerativeEnergyArena,GEA)这一评估平台。背景:现有LLM评估方法存在局限——自动化基准测试与人类偏好相关性低,传统人类评估可扩展性差,公开竞技场(如LMArena)未考虑能源消耗;而LLM的能源消耗(训练和推理阶段)日益成为重要议题。

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Op...
研究背景与动机LLMs在自然语言处理、多模态生成等领域取得巨大成功,但存在自我修正能力不足等问题;强化学习(RL)在游戏、决策控制等领域展现超人类性能,但透明度有限。结合两者优势的LLM后训练(对齐)成为趋势,核心挑战包括缺乏明确奖励信号、计算成本高昂、算法适配性等。理论基础基于马尔可夫决策过程(MDP)框架,将LLM生成过程建模为“无奖励MDP(MDP\R)”,其中状态为当前文本、动作为生成的token、转移为token拼接,但奖励函数需从数据中学习。

SE-VLN: A Self-Evolving Vision-Language Navigation Framework Based on Multimodal Large Language M...
近年来,视觉-语言导航(VLN)的进展主要归功于新兴的大型语言模型(LLMs)。这些方法在指令理解和任务推理方面展现出优异的泛化能力。然而,它们受限于LLMs的固定知识库和推理能力,无法充分整合经验知识,导致缺乏高效的进化能力。为解决这一问题,我们从自然智能体的进化能力中汲取灵感,提出了一种自进化VLN框架(SE-VLN),使VLN智能体能够在测试过程中实现持续进化。据我们所知,这是首次提出基于多模态大型语言模型的自进化VLN框架。

AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Re...
我们引入ABGEN,这是首个旨在评估大型语言模型(LLMs)在科学研究中设计消融研究能力的基准。ABGEN包含1500个专家注释示例,这些示例源自807篇自然语言处理(NLP)论文。在该基准中,LLMs的任务是根据给定的研究背景,为特定模块或流程生成详细的消融研究设计。我们对DeepSeek-R1-0528和o4-mini等领先LLMs的评估表明,这些模型在消融研究设计的重要性、忠实性和合理性方面与人类专家存在显著性能差距。

Enhancing Cross-task Transfer of Large Language Models via Activation Steering
大型语言模型(LLMs)通过提示能够有效利用预训练知识,但在处理未见过的任务时往往表现不佳,尤其是在数据稀缺场景中。尽管跨任务上下文学习为任务间知识迁移提供了直接解决方案,但它在鲁棒性、可扩展性和效率方面仍面临关键挑战。本文研究了是否可以通过潜在空间引导实现跨任务迁移,且无需参数更新或输入扩展。通过分析LLMs潜在空间中的激活模式,我们发现由上下文示例诱导的增强激活在不同任务中具有一致模式。受此发现启发,我们提出了CAST——一种新型跨任务激活引导迁移框架,通过操纵模型的内部激活状态实现有效迁移。

Analysis of Image-and-Text Uncertainty Propagation in Multimodal Large Language Models with Cardi...
本文聚焦多模态大型语言模型(MLLMs)中图像与文本的不确定性传播问题,尤其结合心脏磁共振(cardiacMR)相关临床应用展开研究。研究背景指出,MLLMs虽能整合文本、图像等多模态信息并在临床决策等任务中表现优异,但输入模态间的相互关系、单模态数据的不确定性及其在临床应用中的分解尚未被充分理解。为此,作者提出多模态不确定性传播模型(MUPM),旨在量化图像-only、文本-only及联合图像-文本输入的不确定性之间的关系,包括图像与文本输入的相关性。

Argus: Leveraging Multiview Images for Improved 3-D Scene Understanding With Large Language Models
本文提出了一种名为Argus的新型3D大型多模态基础模型(3D-LMM),旨在利用多视角图像增强大型语言模型(LLMs)对3D场景的理解能力。现有3D场景理解方法高度依赖3D点云,但室内场景的3D点云重建存在信息丢失问题(如无纹理平面或重复图案区域易被遗漏、复杂结构物体因图像与点云错位导致细节失真)。而2D多视角图像与3D点云具有视觉一致性,能提供更详细的场景信息,可弥补上述缺陷。设计融合模块,将多视角图像和相机姿态融合为“视图到场景特征(view-as-scenefeatures)”;

VAR-MATH: Probing True Mathematical Reasoning in Large Language Models via Symbolic Multi-Instanc...
近年来,强化学习(RL)的进展显著提升了大型语言模型(LLMs)的数学推理能力,这一点已被标准基准测试所证实。然而,即便模型在有缺陷的信号(例如随机奖励或反向奖励)上训练,这些性能提升往往仍然存在。这引发了一个核心问题:此类提升反映的是真正的推理能力,还是仅仅是对基准测试特定模式过拟合的产物?为解决这一问题,本文从评估视角出发,指出了现有评估协议的两个关键缺陷:一是基准污染,源于测试题的公开可获取性,增加了数据泄露风险;

What Level of Automation is “Good Enough“? A Benchmark of Large Language Models for Meta-Analysis...
本文聚焦于大型语言模型(LLMs)在元分析数据提取中的实际表现评估,旨在解决从随机对照试验(RCTs)全文中自动提取数据用于元分析的挑战。研究选取了Gemini-2.0-flash、Grok-3、GPT-4o-mini三个LLM,在高血压、糖尿病、骨科三个医学领域,针对统计结果、偏倚风险评估和研究层面特征三类任务,测试了基础提示、自我反思提示、模型集成、定制提示四种提示策略,以探究如何提升提取质量。研究发现,所有模型均表现出高精度,但召回率较低(存在关键信息遗漏);

From Neurons to Semantics: Evaluating Cross-Linguistic Alignment Capabilities of Large Language M...
本文聚焦大型语言模型(LLMs)的跨语言对齐能力评估,提出了一种基于神经元状态的新框架,并通过实验验证了其有效性。研究背景:现有跨语言对齐评估方法多依赖句子嵌入,但神经模型的表示空间存在非光滑性(如各向异性),尤其影响低资源语言的语义对齐评估。核心方法:受神经科学中“相似信息激活重叠神经元区域”的启发,NeuronXA通过量化神经元对多语言平行语料的激活一致性来评估跨语言对齐。具体包括:神经元状态检测(激活状态为二进制0/1,激活值为绝对强度);

Language Integration in Fine-Tuning Multimodal Large Language Models for Image-Based Regression
多模态大型语言模型(MLLMs)在基于图像的回归任务中展现出潜力,但当前方法存在关键局限性。近期方法通过预设输出词汇和通用任务级提示(如“你会如何评价这张图像?”)微调MLLMs,假设这能模拟人类评分行为。我们的分析表明,这些方法并不优于仅用图像的训练方式:使用预设词汇和通用提示的模型与仅用图像的模型性能相当,未能利用文本输入的语义理解能力。我们提出基于Transformer分类的回归(RvTC),用灵活的分箱策略替代词汇约束的分类。

Large Language Models‘ Internal Perception of Symbolic Music
大型语言模型(LLMs)擅长建模自然语言中字符串之间的关系,并已展现出扩展到其他符号领域(如编程或数学)的潜力。然而,它们对符号音乐的隐式建模程度仍未得到充分探索。本文通过从描述类型和风格组合的文本提示生成符号音乐数据,并通过识别和生成任务评估其效用,来研究LLMs如何表示音乐概念。我们在不依赖显式音乐训练的情况下,生成了一个LLM生成的MIDI文件数据集。然后,我们完全基于这个LLM生成的MIDI数据集训练神经网络,进行类型和风格分类以及旋律补全,并将其性能与现有模型进行基准对比。

Strategy Adaptation in Large Language Model Werewolf Agents
本研究提出了一种通过根据其他玩家的态度和对话上下文切换预定义策略来提高狼人杀代理性能的方法。尽管先前使用提示工程的狼人杀代理研究已采用隐含定义有效策略的方法,但这些方法无法适应不断变化的情境。在本研究中,我们提出了一种基于游戏上下文和其他玩家角色估计结果来明确选择合适策略的方法。我们将具备策略适应能力的狼人杀代理与采用隐含或固定策略的基线代理进行对比,验证了所提方法的有效性。

Improving Drug Identification in Overdose Death Surveillance using Large Language Models
本文旨在通过自然语言处理(NLP)模型改进美国药物过量死亡监测中的药物识别准确性和时效性。研究使用2020年来自美国10个地区的35,433条死亡记录作为训练和内部测试数据,2023-2024年的3,335条独立记录作为外部验证数据,比较了多种NLP方法的性能,包括传统单标签/多标签分类器、编码器模型(如BERT、BioClinicalBERT)和大型语言模型(LLMs,如Qwen3、Llama3)。

Assessing the Value of Visual Input: A Benchmark of Multimodal Large Language Models for Robotic ...
大型语言模型(LLMs)在增强机器人路径规划方面展现出潜力。本文通过全面的基准测试,评估了视觉输入对多模态大型语言模型在这类任务中的效用。我们在2D网格环境中评估了15个多模态大型语言模型生成有效且最优路径的能力(该环境模拟简化的机器人规划场景),比较了仅文本输入与文本+视觉输入在不同模型规模和网格复杂度下的表现。结果表明,在较简单的小网格任务中,模型成功率中等,视觉输入或少样本文本提示能带来一定收益;但在较大网格上,性能显著下降,凸显了可扩展性挑战。

Improving Contextual ASR via Multi-grained Fusion with Large Language Models
尽管端到端自动语音识别(ASR)模型在通用语音转录任务中表现出色,但它们在准确识别上下文相关关键词(如专有名词或用户特定实体)时往往存在困难。以往的研究通过文本模态的关键词词典来改进关键词识别,主要分为令牌级融合(引导逐令牌生成)和短语级融合(支持直接复制关键词短语)两种方式。然而,这些方法基于不同的粒度,且各有局限。本文提出一种新颖的多粒度融合方法,结合大型语言模型(LLMs),同时利用令牌级和短语级融合的优势。

Assay2Mol: large language model-based drug design using BioAssay context
本文提出了一种基于大型语言模型(LLM)的药物设计工作流Assay2Mol,旨在利用海量未结构化的生物测定(BioAssay)数据加速早期药物发现。根据目标蛋白或表型的文本描述,从PubChem等数据库中检索相关的BioAssay记录;对检索到的BioAssay数据进行过滤、总结和分析,提取关键实验信息(如分子结构、活性结果等);利用LLM的上下文学习能力,基于这些BioAssay数据生成具有目标活性的候选分子。

Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models
本文聚焦于单体多模态大语言模型(MLLMs),这类模型将视觉编码与语言解码整合到单一模型中,旨在解决现有单体MLLMs在优化稳定性和灾难性遗忘方面的挑战。核心问题:现有单体MLLMs的预训练策略常面临优化不稳定和灾难性遗忘(即学习视觉知识时丢失原有语言能力),且训练成本高、推理效率低。解决方案提出:通过混合专家(MoE)架构嵌入视觉专家网络,并设计内源性视觉预训练(EViP)策略,分三阶段(概念学习、语义学习、对齐学习)渐进式学习视觉知识,同时冻结LLM参数以保留语言能力。提出。

欢迎留下您的脚印