Loading...

ChemVTS-Bench: Evaluating Visual-Textual-Symbolic Reasoning of Multimodal Large Language Models i...
本文针对现有化学领域多模态大语言模型(MLLMs)评估基准的不足,提出了——一个专注于评估MLLMs化学领域视觉-文本-符号(VTS)推理能力的领域真实基准。现有基准的局限性:现有化学相关基准多依赖简单图文对,化学语义有限,未覆盖视觉、文本、SMILES(简化分子输入行项系统)等核心模态,且难以评估模型跨模态整合能力,存在对模型推理能力的高估问题。ChemVTS-Bench的核心设计。

A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large La...
基于离散扩散的多模态大语言模型(dMLLMs)凭借并行解码和双向上下文建模的优势,已成为自回归MLLMs的有力替代方案。然而,现有大多数dMLLMs在推理过程中因每个去噪步骤中的全序列注意力计算而面临巨大的计算开销。开创性研究试图通过键值缓存优化或高效采样等模态无关的视角解决这一问题,但大多忽视了视觉token的模态特定冗余。本文对视觉token冗余如何随不同dMLLM架构和任务演化,以及视觉token剪枝如何影响dMLLM响应和效率进行了全面研究。视觉冗余仅出现在处理长回答任务的从零训练dMLLMs中。

Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Langu...
指代多目标跟踪(RMOT)通过引入自然语言参考实现多模态融合跟踪,拓展了传统多目标跟踪(MOT)的应用场景。现有RMOT基准数据集仅描述物体的外观、相对位置和初始运动状态,这种所谓的“静态规则”无法捕捉物体运动的动态变化(包括速度变化和运动方向转换)。该局限性不仅导致静态参考与动态视觉模态之间存在时间差异,还制约了多模态跟踪性能。为解决这一问题,本文提出一种新颖的视觉-运动-参考对齐RMOT框架(VMRMOT)。

Kairos: A Native World Model Stack for Physical AI
世界模型正从被动的视觉生成器,转变为物理AI的基础运行基础设施:模型需要从多源异构数据中原生学习世界知识、在长时序区间内稳定维持全局状态,同时满足真实部署场景下的高效推理约束。本文提出Kairos,一套围绕上述核心需求设计的原生世界模型技术栈。世界学习:首创基于跨具身数据课程的原生预训练范式,将通用互联网视频、人类行为数据、机器人交互数据组织成渐进式训练路径;状态维持:依托搭载混合线性时序注意力的原生一体化架构,统一实现世界理解、画面生成、动作预测三大能力。

ViQ: Text-Aligned Visual Quantized Representations at Any Resolution
统一的图文表征是多模态领域的核心目标,它能够简化建模流程、提升训练效率。但如果仿照文本的离散token形式对图像做离散编码,会不可避免地产生严重信息丢失。现有离散表征方法难以平衡底层视觉细节与高层语义:以图像重建为目标的表征往往缺失语义信息,而语义能力更强的特征又会在量化过程中损失大量细节。本文提出ViQ(视觉量化表征框架),可在离散表征中同时兼顾语义与细节,且支持图像原生分辨率输入,能够作为通用统一离散表征适配任意视觉数据。我们将量化学习拆分为两个阶段:文本对齐预训练、特征离散化。

FIRM: Federated In-client Regularized Multi-objective Alignment for Large Language Models
大型语言模型(LLMs)与人类价值观的对齐通常需要平衡多个相互冲突的目标(如有用性和无害性)。这些模型的训练计算成本高昂,且中心化训练过程引发严重的数据隐私问题。联邦学习(FL)提供了一种极具吸引力的替代方案,但现有的联邦多目标优化(FMOO)方法面临严重的通信瓶颈——由于依赖向服务器传输多个梯度,这种方式对于大型模型而言难以扩展。本文提出FIRM(联邦客户端内正则化多目标对齐算法),这是一种同时实现客户端分歧漂移抑制和通信效率提升的新型算法。在FIRM中,每个客户端本地求解正则化多目标优化问题。

HSKBenchmark: Modeling and Benchmarking Chinese Second Language Acquisition in Large Language Mod...
语言习得对于揭示人类语言智能的本质至关重要,近年来已成为提升大型语言模型(LLMs)可解释性的重要视角。然而,开展需要控制人类学习者语言输入的实验在伦理和实践层面均不可行,这给语言习得建模(尤其是汉语第二语言习得)的可验证性和可扩展性带来挑战。尽管LLMs提供了可控且可复现的替代方案,但支持分阶段建模与评估的系统性基准测试仍处于空白状态。为解决这些问题,本文提出HSKBenchmark——首个用于LLMs汉语第二语言习得分阶段建模与写作评估的基准测试套件。

The Empowerment of Science of Science by Large Language Models: New Tools and Methods
定义与研究范畴:SciSci是对科学本身进行定量研究的交叉学科,涵盖科学家、学术文献、期刊、科研政策等对象,聚焦创新过程分析、影响力评估、合作与引用模式建模等方向,为管理科学与政策制定提供支撑。发展演进:早期以引文分析为核心(依赖SCI数据库),发现“马太效应”“隐形学院”等现象;中期引入知识图谱与可视化工具(如CiteSpace、VOSviewer);

Evaluating Adversarial Vulnerabilities in Modern Large Language Models
近年来,大型语言模型(LLMs)的快速兴起及其在各类应用中的广泛整合,使得深入理解其安全漏洞变得至关重要。本文对两款主流公开LLM——谷歌Gemini2.5Flash和OpenAI的GPT-4(特指免费版可访问的GPT-4omini模型)的越狱攻击易感性进行了比较分析。研究采用两种主要绕过策略:“自我绕过”(模型被提示规避自身安全协议)和“交叉绕过”(一个模型生成对抗性提示词以利用另一个模型的漏洞)。

Utilizing Large Language Models for Zero-Shot Medical Ontology Extension from Clinical Notes
整合新型医疗概念及关系到现有本体中,能显著提升其在生物医学研究和临床应用中的覆盖范围与实用性。临床笔记作为富含详细患者观察记录的非结构化文档,提供了极具价值的情境化见解,是本体扩展的潜力数据源,但目前尚未得到充分利用。尽管具备这一潜力,直接利用临床笔记进行本体扩展的相关研究仍较为匮乏。为填补这一空白,本文提出CLOZE框架,该框架借助大型语言模型(LLMs)从临床笔记中自动提取医疗实体,并将其整合到层级化医学本体中。

Learning to Compress: Unlocking the Potential of Large Language Models for Text Representation
文本表示在聚类、检索及其他下游应用中发挥着关键作用。随着大型语言模型(LLMs)的兴起,利用其能力实现文本表示的关注度日益提升。然而,大多数LLMs本质上是因果模型,且针对下一个token预测进行优化,这使其在生成整体连贯的表示时并非最优。为解决这一问题,近期研究引入了pretext任务以适配LLMs用于文本表示。但这些任务大多依赖token级预测目标,例如LLM2Vec中使用的掩码下一个token预测(MNTP)。

Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance
尽管百亿(10B)级工业基础模型不断拓宽图像修复的性能上限,但其高昂的计算开销严重限制了实际落地部署。构建高度优化、面向单一任务的专用模型是一条可行的解决思路;但对模型进行极致结构压缩时,不可避免会出现严重的表征瓶颈。针对该问题,本文提出Moebius——一款高效轻量图像修复框架。本文通过提出局部λ混合交互(LλMI)模块,系统性重构扩散模型主干网络。

Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
多模态大语言模型(MLLMs)近年来发展迅速,现已应用于视觉文档理解任务。这些模型需处理包括日语在内的多种语言的文档图像,而日语文档中部分采用竖排书写,因此对竖排文本的支持至关重要。然而,专门针对竖排日语文本的研究仍较为有限。本研究评估了现有MLLMs对竖排日语文本的识别能力:首先,通过将日语文本渲染为图像生成合成日语OCR数据集,用于模型微调和评估(该数据集包含横排与竖排两种书写形式);其次,构建了源自真实文档图像的竖排日语文本评估数据集。

RoSA: Enhancing Parameter-Efficient Fine-Tuning via RoPE-aware Selective Adaptation in Large Lang...
微调大型语言模型对于特定任务适配至关重要,但计算成本仍高得令人却步。参数高效微调(PEFT)方法已成为一种解决方案,但现有方法通常忽视模型组件的独特作用以及层间的异质性重要性,从而限制了适配效率。基于旋转位置编码(RoPE)会在注意力状态的低频维度诱导关键激活这一观察,我们提出了RoPE感知选择性适配(RoSA)——一种新型PEFT框架,能够以更具针对性和有效性的方式分配可训练参数。

OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Unde...
大型视觉语言模型(LVLMs)已被证明在图像级任务(如视觉问答和图像描述)中表现出色。然而,在许多实例级任务中(如视觉定位和目标检测),与以往的专业模型相比,LVLMs仍存在性能差距。同时,尽管行人跟踪是一项经典任务,但在目标跟踪与自然语言结合的领域出现了诸多新方向,例如指代多目标跟踪(ReferringMOT)、跨视角指代多目标跟踪(Cross-viewReferringMOT)和语义多目标跟踪(SemanticMOT)。

FastMMoE: Accelerating Multimodal Large Language Models through Dynamic Expert Activation and Rou...
多模态大语言模型(MLLMs)已取得令人瞩目的性能,但高分辨率视觉输入会产生长序列视觉tokens,导致显著的推理延迟。在保持性能的同时减少冗余视觉tokens,对于减轻计算/内存负担、推动MLLM在资源受限或延迟敏感场景中的部署至关重要。现有视觉token剪枝方法主要依赖基于注意力的冗余分析,且专为密集架构设计。本文提出Fast多模态混合专家(FastMMoE),一种面向混合专家(MoE)型MLLMs的无训练加速框架,其设计源于路由分析视角。

Measuring the Impact of Lexical Training Data Coverage on Hallucination Detection in Large Langua...
该研究聚焦大型语言模型(LLMs)幻觉检测问题,核心探索词汇级训练数据覆盖率(通过n-gram频率衡量)对幻觉检测的作用,弥补了现有研究对预训练数据暴露与幻觉关联的探索不足。研究背景:现有幻觉检测方法多依赖模型内部信号(如token级对数概率、熵)、一致性验证或外部知识检索,而预训练数据中词汇序列的覆盖情况这一基础信号未被系统研究。核心思路。

Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
大型语言模型的安全性通常通过静态基准进行评估,但关键失效模式具有动态性:分布偏移下的价值漂移、越狱攻击,以及部署过程中对齐性的缓慢退化。基于近期提出的“智能第二定律”(该定律将伦理熵视为一种状态变量,除非通过对齐工作加以抵消,否则会自发增加),我们将这一框架应用于大型语言模型的实际操作中。我们定义了五分类行为分类体系,训练了一个分类器以从模型对话文本中估算伦理熵StS(t)St,并在压力测试中测量了四个前沿模型的基础版本与指令微调版本的熵动态变化。

Knowledge-Informed Automatic Feature Extraction via Collaborative Large Language Model Agents
机器学习模型在表格数据上的性能严重依赖高质量的特征工程。尽管大型语言模型(LLMs)在自动化特征提取(AutoFE)方面展现出潜力,但现有方法往往受限于单一LLM架构、简单的定量反馈,且未能系统整合外部领域知识。本文提出RogueOne,一种基于LLM的新型多智能体框架,用于知识驱动的自动特征提取。RogueOne构建了一个由三个专业智能体(科学家、提取器和测试器)组成的去中心化系统,通过迭代协作发现、生成和验证预测性特征。

Vision Large Language Models Are Good Noise Handlers in Engagement Analysis
参与度识别与传统图像分类任务不同,视频数据集的参与度识别尤其受主观标签和噪声的挑战,导致模型性能受限。为克服主观和含噪参与度标签带来的难题,我们提出一种利用视觉大型语言模型(VLMs)优化标注并指导训练过程的框架。该框架通过问卷提取行为线索,将数据划分为高可靠性和低可靠性子集;同时引入融合课程学习与软标签优化的训练策略,逐步融入模糊样本,且通过调整监督信号反映不确定性。

欢迎留下您的脚印