Loading...

Kairos: A Native World Model Stack for Physical AI
世界模型正从被动的视觉生成器,转变为物理AI的基础运行基础设施:模型需要从多源异构数据中原生学习世界知识、在长时序区间内稳定维持全局状态,同时满足真实部署场景下的高效推理约束。本文提出Kairos,一套围绕上述核心需求设计的原生世界模型技术栈。世界学习:首创基于跨具身数据课程的原生预训练范式,将通用互联网视频、人类行为数据、机器人交互数据组织成渐进式训练路径;状态维持:依托搭载混合线性时序注意力的原生一体化架构,统一实现世界理解、画面生成、动作预测三大能力。

ViQ: Text-Aligned Visual Quantized Representations at Any Resolution
统一的图文表征是多模态领域的核心目标,它能够简化建模流程、提升训练效率。但如果仿照文本的离散token形式对图像做离散编码,会不可避免地产生严重信息丢失。现有离散表征方法难以平衡底层视觉细节与高层语义:以图像重建为目标的表征往往缺失语义信息,而语义能力更强的特征又会在量化过程中损失大量细节。本文提出ViQ(视觉量化表征框架),可在离散表征中同时兼顾语义与细节,且支持图像原生分辨率输入,能够作为通用统一离散表征适配任意视觉数据。我们将量化学习拆分为两个阶段:文本对齐预训练、特征离散化。

FIRM: Federated In-client Regularized Multi-objective Alignment for Large Language Models
大型语言模型(LLMs)与人类价值观的对齐通常需要平衡多个相互冲突的目标(如有用性和无害性)。这些模型的训练计算成本高昂,且中心化训练过程引发严重的数据隐私问题。联邦学习(FL)提供了一种极具吸引力的替代方案,但现有的联邦多目标优化(FMOO)方法面临严重的通信瓶颈——由于依赖向服务器传输多个梯度,这种方式对于大型模型而言难以扩展。本文提出FIRM(联邦客户端内正则化多目标对齐算法),这是一种同时实现客户端分歧漂移抑制和通信效率提升的新型算法。在FIRM中,每个客户端本地求解正则化多目标优化问题。

HSKBenchmark: Modeling and Benchmarking Chinese Second Language Acquisition in Large Language Mod...
语言习得对于揭示人类语言智能的本质至关重要,近年来已成为提升大型语言模型(LLMs)可解释性的重要视角。然而,开展需要控制人类学习者语言输入的实验在伦理和实践层面均不可行,这给语言习得建模(尤其是汉语第二语言习得)的可验证性和可扩展性带来挑战。尽管LLMs提供了可控且可复现的替代方案,但支持分阶段建模与评估的系统性基准测试仍处于空白状态。为解决这些问题,本文提出HSKBenchmark——首个用于LLMs汉语第二语言习得分阶段建模与写作评估的基准测试套件。

The Empowerment of Science of Science by Large Language Models: New Tools and Methods
定义与研究范畴:SciSci是对科学本身进行定量研究的交叉学科,涵盖科学家、学术文献、期刊、科研政策等对象,聚焦创新过程分析、影响力评估、合作与引用模式建模等方向,为管理科学与政策制定提供支撑。发展演进:早期以引文分析为核心(依赖SCI数据库),发现“马太效应”“隐形学院”等现象;中期引入知识图谱与可视化工具(如CiteSpace、VOSviewer);

Evaluating Adversarial Vulnerabilities in Modern Large Language Models
近年来,大型语言模型(LLMs)的快速兴起及其在各类应用中的广泛整合,使得深入理解其安全漏洞变得至关重要。本文对两款主流公开LLM——谷歌Gemini2.5Flash和OpenAI的GPT-4(特指免费版可访问的GPT-4omini模型)的越狱攻击易感性进行了比较分析。研究采用两种主要绕过策略:“自我绕过”(模型被提示规避自身安全协议)和“交叉绕过”(一个模型生成对抗性提示词以利用另一个模型的漏洞)。

Utilizing Large Language Models for Zero-Shot Medical Ontology Extension from Clinical Notes
整合新型医疗概念及关系到现有本体中,能显著提升其在生物医学研究和临床应用中的覆盖范围与实用性。临床笔记作为富含详细患者观察记录的非结构化文档,提供了极具价值的情境化见解,是本体扩展的潜力数据源,但目前尚未得到充分利用。尽管具备这一潜力,直接利用临床笔记进行本体扩展的相关研究仍较为匮乏。为填补这一空白,本文提出CLOZE框架,该框架借助大型语言模型(LLMs)从临床笔记中自动提取医疗实体,并将其整合到层级化医学本体中。

Learning to Compress: Unlocking the Potential of Large Language Models for Text Representation
文本表示在聚类、检索及其他下游应用中发挥着关键作用。随着大型语言模型(LLMs)的兴起,利用其能力实现文本表示的关注度日益提升。然而,大多数LLMs本质上是因果模型,且针对下一个token预测进行优化,这使其在生成整体连贯的表示时并非最优。为解决这一问题,近期研究引入了pretext任务以适配LLMs用于文本表示。但这些任务大多依赖token级预测目标,例如LLM2Vec中使用的掩码下一个token预测(MNTP)。

Moebius: 0.2B Lightweight Image Inpainting Framework with 10B-Level Performance
尽管百亿(10B)级工业基础模型不断拓宽图像修复的性能上限,但其高昂的计算开销严重限制了实际落地部署。构建高度优化、面向单一任务的专用模型是一条可行的解决思路;但对模型进行极致结构压缩时,不可避免会出现严重的表征瓶颈。针对该问题,本文提出Moebius——一款高效轻量图像修复框架。本文通过提出局部λ混合交互(LλMI)模块,系统性重构扩散模型主干网络。

Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
多模态大语言模型(MLLMs)近年来发展迅速,现已应用于视觉文档理解任务。这些模型需处理包括日语在内的多种语言的文档图像,而日语文档中部分采用竖排书写,因此对竖排文本的支持至关重要。然而,专门针对竖排日语文本的研究仍较为有限。本研究评估了现有MLLMs对竖排日语文本的识别能力:首先,通过将日语文本渲染为图像生成合成日语OCR数据集,用于模型微调和评估(该数据集包含横排与竖排两种书写形式);其次,构建了源自真实文档图像的竖排日语文本评估数据集。

RoSA: Enhancing Parameter-Efficient Fine-Tuning via RoPE-aware Selective Adaptation in Large Lang...
微调大型语言模型对于特定任务适配至关重要,但计算成本仍高得令人却步。参数高效微调(PEFT)方法已成为一种解决方案,但现有方法通常忽视模型组件的独特作用以及层间的异质性重要性,从而限制了适配效率。基于旋转位置编码(RoPE)会在注意力状态的低频维度诱导关键激活这一观察,我们提出了RoPE感知选择性适配(RoSA)——一种新型PEFT框架,能够以更具针对性和有效性的方式分配可训练参数。

OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Unde...
大型视觉语言模型(LVLMs)已被证明在图像级任务(如视觉问答和图像描述)中表现出色。然而,在许多实例级任务中(如视觉定位和目标检测),与以往的专业模型相比,LVLMs仍存在性能差距。同时,尽管行人跟踪是一项经典任务,但在目标跟踪与自然语言结合的领域出现了诸多新方向,例如指代多目标跟踪(ReferringMOT)、跨视角指代多目标跟踪(Cross-viewReferringMOT)和语义多目标跟踪(SemanticMOT)。

FastMMoE: Accelerating Multimodal Large Language Models through Dynamic Expert Activation and Rou...
多模态大语言模型(MLLMs)已取得令人瞩目的性能,但高分辨率视觉输入会产生长序列视觉tokens,导致显著的推理延迟。在保持性能的同时减少冗余视觉tokens,对于减轻计算/内存负担、推动MLLM在资源受限或延迟敏感场景中的部署至关重要。现有视觉token剪枝方法主要依赖基于注意力的冗余分析,且专为密集架构设计。本文提出Fast多模态混合专家(FastMMoE),一种面向混合专家(MoE)型MLLMs的无训练加速框架,其设计源于路由分析视角。

Measuring the Impact of Lexical Training Data Coverage on Hallucination Detection in Large Langua...
该研究聚焦大型语言模型(LLMs)幻觉检测问题,核心探索词汇级训练数据覆盖率(通过n-gram频率衡量)对幻觉检测的作用,弥补了现有研究对预训练数据暴露与幻觉关联的探索不足。研究背景:现有幻觉检测方法多依赖模型内部信号(如token级对数概率、熵)、一致性验证或外部知识检索,而预训练数据中词汇序列的覆盖情况这一基础信号未被系统研究。核心思路。

Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
大型语言模型的安全性通常通过静态基准进行评估,但关键失效模式具有动态性:分布偏移下的价值漂移、越狱攻击,以及部署过程中对齐性的缓慢退化。基于近期提出的“智能第二定律”(该定律将伦理熵视为一种状态变量,除非通过对齐工作加以抵消,否则会自发增加),我们将这一框架应用于大型语言模型的实际操作中。我们定义了五分类行为分类体系,训练了一个分类器以从模型对话文本中估算伦理熵StS(t)St,并在压力测试中测量了四个前沿模型的基础版本与指令微调版本的熵动态变化。

Knowledge-Informed Automatic Feature Extraction via Collaborative Large Language Model Agents
机器学习模型在表格数据上的性能严重依赖高质量的特征工程。尽管大型语言模型(LLMs)在自动化特征提取(AutoFE)方面展现出潜力,但现有方法往往受限于单一LLM架构、简单的定量反馈,且未能系统整合外部领域知识。本文提出RogueOne,一种基于LLM的新型多智能体框架,用于知识驱动的自动特征提取。RogueOne构建了一个由三个专业智能体(科学家、提取器和测试器)组成的去中心化系统,通过迭代协作发现、生成和验证预测性特征。

Vision Large Language Models Are Good Noise Handlers in Engagement Analysis
参与度识别与传统图像分类任务不同,视频数据集的参与度识别尤其受主观标签和噪声的挑战,导致模型性能受限。为克服主观和含噪参与度标签带来的难题,我们提出一种利用视觉大型语言模型(VLMs)优化标注并指导训练过程的框架。该框架通过问卷提取行为线索,将数据划分为高可靠性和低可靠性子集;同时引入融合课程学习与软标签优化的训练策略,逐步融入模糊样本,且通过调整监督信号反映不确定性。

Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models
本文提供的证据表明,对抗性诗歌可作为大型语言模型(LLMs)的通用单轮越狱技术。在25个前沿专有模型和开源权重模型中,精心设计的诗歌提示词实现了高攻击成功率(ASR),部分提供商的模型成功率超过90%。将提示词映射到MLCommons和欧盟行为准则(EUCoP)风险分类体系后发现,诗歌攻击可跨化学、生物、放射性、核(CBRN)危害、操纵、网络攻击及失控等领域迁移。通过标准化元提示词将1200个MLCommons有害提示词转化为诗歌形式后,其攻击成功率较散文基线最高提升18倍。

CoSP: Reconfigurable Multi-State Metamaterial Inverse Design via Contrastive Pretrained Large Lan...
超材料因其在亚波长尺度操控光的能力而闻名,但由于其复杂精密的结构,面临着巨大的设计挑战。因此,深度学习已成为简化其设计流程的强大工具。具有可调参数的可重构多态超材料(RMMs)能在外部刺激下在不同状态间切换光学特性,从而产生众多应用。然而,现有基于深度学习的逆向设计方法在考虑多态切换的可重构性方面存在不足。为应对这一挑战,我们提出了CoSP,一种基于对比预训练大语言模型(LLM)的智能逆向设计方法。通过在多态光谱上进行对比预训练,获得一个能够理解光谱的训练充分的光谱编码器,该编码器随后与预训练LLM交互。

Mitigating Label Length Bias in Large Language Models
大型语言模型(LLMs)是强大的零样本和少样本学习者。然而,当在一组候选选项上进行预测时,LLMs会受到标签偏差的影响,且现有校准方法忽略了多token类别标签引发的偏差。本文针对一种名为“标签长度偏差”的问题展开研究——即使经过标准长度归一化,不同长度的标签仍会被不一致地处理。为缓解这一偏差,我们提出了归一化上下文校准(NCC)方法:一种在完整标签层面进行概率归一化和校准的有效策略。NCC在多个数据集和模型上相较于现有方法实现了统计显著的性能提升,F1值最高提升10%。

欢迎留下您的脚印