Loading...

Event-CausNet: Unlocking Causal Knowledge from Text with Large Language Models for Reliable Spati...
本文针对时空图神经网络(GNNs)在交通事故、极端天气等非周期性事件中预测可靠性大幅下降的问题,提出了框架,核心是将因果推理与大语言模型(LLMs)、时空预测模型结合,提升事件驱动场景下交通预测的准确性、鲁棒性和可解释性。尽管时空图神经网络(GNNs)在建模周期性交通模式方面表现出色,但在事故等非周期性事件中,其可靠性会急剧下降。这一失效的根源在于GNNs本质上是关联模型,所学习的历史模式会被干扰事件引入的新因果因素破坏。

Optimal Self-Consistency for Efficient Reasoning with Large Language Models
自一致性(SC)是一种广泛使用的测试时推理技术,用于提升大语言模型(LLM)在思维链推理任务中的性能。该技术通过从大语言模型生成多个响应(或称“样本”),并选择出现频率最高的答案,本质上可视为一种多数投票或经验模式估计方法。尽管效果显著,但在数据集上直接应用时,传统SC的计算成本极高,且缺乏对样本效率和缩放行为的统一理论分析。本文基于模式估计和投票理论,首次对SC及其变体的缩放行为进行了全面分析,推导并通过实证验证了SC在不同数据集上的幂律缩放特性,同时分析了固定分配和动态分配采样方案的样本效率。

Jailbreaking Large Vision Language Models in Intelligent Transportation Systems
研究背景:LVLMs在ITS中广泛应用于交通数据分析、车辆交互、路标识别等场景,但现有安全护栏易被越狱攻击突破,可能导致非法监控、交通规则漠视等安全风险,而相关安全研究尚未充分开展。核心工作构建数据集:基于OpenAI禁止类别,生成150条交通领域有害查询(涵盖非法活动、物理伤害等5类,每类30条);提出攻击方法:通过图像排版操纵(将有害查询嵌入良性图像字幕)+多轮提示(3轮对话逐步诱导),突破LVLMs安全限制;

ExplainableGuard: Interpretable Adversarial Defense for Large Language Models Using Chain-of-Thou...
大型语言模型(LLMs)越来越容易受到对抗性攻击,这些攻击能巧妙地操纵其输出结果。尽管已有多种防御机制被提出,但许多机制以黑箱形式运行,其决策过程缺乏透明度。本文提出ExplainableGuard,这是一种可解释的对抗性防御框架,利用DeepSeek-Reasoner的思维链(CoT)推理能力。该方法不仅能检测并中和文本中的对抗性扰动,还能为每个防御动作提供分步解释。我们证明了定制化的思维链提示如何引导大型语言模型进行多维度分析(字符级、词汇级、结构级、语义级),并生成净化后的输出文本及人类可理解的理由。

Differences in the Moral Foundations of Large Language Models
本文聚焦大型语言模型(LLMs)的道德判断机制,基于乔纳森·海特的道德基础理论(MFT),通过合成实验探究不同模型的道德价值倾向及其与人类基线的差异。研究背景与理论基础:LLMs已广泛应用于关键领域,但道德判断的规范性与透明度不足;现有对齐研究多集中于“狭义偏见危害”或“广义灾难风险”,忽略中间层面的价值判断差异。MFT将道德直觉分解为关怀、公平、忠诚、权威、神圣、自由六大基础,且与政治意识形态相关(自由主义侧重“个体化基础”,保守主义均衡重视“约束性基础”),为分析提供框架。研究设计。

PAS : Prelim Attention Score for Detecting Object Hallucinations in Large Vision--Language Models
大型视觉语言模型(LVLMs)功能强大,但受物体幻觉问题影响,其可靠性仍有待提升。本研究发现,在许多幻觉预测中,LVLM实际上会忽视图像信息,转而依赖先前生成的输出(“初步”)tokens来推断新物体。我们通过在初步输出条件下图像与预测物体之间的互信息来量化这种行为,结果表明,弱图像依赖与幻觉现象高度相关。基于这一发现,我们提出了初步注意力分数(PAS)——一种轻量级、无需训练的信号,由初步输出tokens的注意力权重计算得到。PAS无需额外的前向传播,可在推理过程中实时计算。

LLM4SCREENLIT: Recommendations on Assessing the Performance of Large Language Models for Screenin...
Context:大型语言模型(LLMs)的发布速度远超用户对其进行严格评估的能力。当LLMs为研究提供支撑(如为系统评价(SRs)识别相关文献)时,可靠的实证评估至关重要。Objective:本文旨在识别并探讨LLM在相关文献筛选中性能评估的关键挑战,总结(评估)最佳实践,并提出针对性建议。Method:以一项近期大规模研究为案例,本文指出了传统指标在评估生成式AI工具筛选SR相关文献性能时存在的问题。

A General Highly Accurate Online Planning Method Integrating Large Language Models into Nested Ro...
在目标导向对话任务中,核心挑战是在有限的轮次内引导交互朝着给定目标推进。现有方法要么依赖复杂的提示工程(其效果严重依赖人类经验),要么整合策略网络与预训练策略模型(这类方法通常难以适应新的对话场景,且训练成本高昂)。因此,本文提出了面向目标导向对话的嵌套滚动策略自适应方法(NRPA-GD)——一种新颖的对话策略规划方法。该方法通过利用大语言模型(LLM)同时模拟用户与系统的行为,完全避免了特定模型的训练。

DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic...
体育视频理解面临独特挑战,要求模型具备高速动态感知能力、复杂规则理解能力以及长时序上下文推理能力。尽管多模态大语言模型(MLLM)在通用领域已展现出潜力,但当前体育领域的研究仍存在显著局限:现有方法要么聚焦单一运动项目、局限于特定任务,要么依赖无训练范式,缺乏稳健的学习型推理过程。为填补这一空白,我们提出DeepSport——首个专为多任务、多运动项目视频理解设计的端到端训练MLLM框架。

Evaluating the Ability of Large Language Models to Identify Adherence to CONSORT Reporting Guidel...
研究背景:CONSORT指南是RCT透明化、高质量报告的全球基准,但人工核查其依从性耗时耗力,且需专业方法学知识,成为同行评审和证据合成的瓶颈;LLMs在自然语言理解领域展现潜力,但在高风险的方法学评估任务中表现尚未验证。研究设计构建含150篇跨多个医学专科RCT的数据集(RCTBench),涵盖5550个可评估的CONSORT子项,由两名训练有素的方法学家独立标注(分为“合规”“不合规”“不适用”三类),分歧由资深仲裁者解决。

Human-Level and Beyond: Benchmarking Large Language Models Against Clinical Pharmacists in Prescr...
研究背景:用药错误是患者伤害和医疗成本增加的主要原因,75%以上的用药错误发生在处方开具或给药阶段,临床药师审核虽能提升用药安全性,但存在人力短缺、耗时久、依赖个人经验等局限,LLMs为处方审核提供了新的解决方案,但缺乏标准化评估框架。RxBench基准构建:整合权威药学参考资料中的14类常见处方错误,包含1150道单选题、230道多选题和879道简答题,覆盖抗肿瘤药、高危药品、中药等多种处方类型,经资深临床药师审核验证,确保数据的临床代表性和科学性。实验设计。

Large Language Models Meet Extreme Multi-label Classification: Scaling and Multi-modal Framework
基础模型已在众多领域革新人工智能,但在极端多标签分类(XMC)中其变革潜力尚未充分释放。XMC中的查询需与超大规模标签空间中的相关标签匹配,核心挑战在于平衡效率与性能。因此,近期诸多方法通过将XMC转化为基于小型纯编码器Transformer架构学习嵌入的最大内积搜索问题,实现了效率优化。本文聚焦XMC的两个关键方向:如何有效利用更大规模的纯解码器模型,以及如何在保持计算效率的前提下挖掘视觉信息价值。研究表明,这两方面单独对XMC性能均有重要作用,且融合后可进一步提升效果。

Group-Aware Reinforcement Learning for Output Diversity in Large Language Models
该研究针对大型语言模型(LLMs)在生成任务中普遍存在的模式崩溃(modecollapse)Group-AwarePolicyOptimization(GAPO,群体感知策略优化)。核心背景:现有模型(如ChatGPT-4o、ClaudeSonnet3.5等)在监督微调(SFT)和人类反馈强化学习(RLHF)训练后,虽提升了事实准确性和对齐性,但会倾向于高概率输出,导致多样性下降;而温度调节、top-k采样等解码策略仅能部分缓解,无法解决模型概率分布的根本问题。方法设计。

CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Lang...
跨视频推理(CVR)是视频理解领域的一项重大挑战,它要求同时理解多个视频,以聚合和对比视频组间的信息。大多数现有视频理解基准聚焦于单视频分析,无法评估多模态大语言模型(MLLMs)对多个视频进行同步推理的能力。近期部分基准评估了MLLMs在多视角视频上的性能,这些视频捕捉同一场景的不同视角,但它们的任务设置有限,难以全面评估MLLMs在多样真实世界CVR场景中的表现。为此,我们提出CrossVid——首个旨在全面评估MLLMs跨视频场景下时空推理能力的基准。

L3M+P: Lifelong Planning with Large Language Models
本文提出了一种名为L3M+P(LifelongLLM+P)的框架,旨在解决通用服务机器人在长期部署中面临的规划挑战。现有方法(如LLM+P)虽结合了大型语言模型(LLMs)与经典规划方法,但存在两点关键局限:一是依赖详细且一致的环境描述,而实际环境中该信息往往难以获取;二是仅聚焦孤立任务规划,无法支持机器人长期连续部署所需的动态环境记忆更新。动态世界状态表示:采用外部知识图谱作为世界状态的结构化表示,可通过传感器输入和人类自然语言交互等多模态信息更新。一致性维护。

Guiding an Automatic Speech Recognition Decoder Using Large Language Models
自动语音识别(ASR)由声学模型(AM)和语言模型(LM)组成。声学模型基于语言单位(通常是音素、字符或token)估计声学信号的概率,而语言模型评估特定词或token序列的可能性。尽管大型语言模型(LLMs)在多个任务中展现出巨大潜力,但将其集成到ASR中仍是一个未解决的挑战。通过分解“给定声学信号的词(或token)最大后验概率(MAP)估计器”,我们推导出一种迭代流程,实现了AM与LLM的新型集成,同时保持两者的分离性。

AI-Based Measurement of Innovation: Mapping Expert Insight into Large Language Model Applications
本文提出了一种名为MicroMix的混合精度量化框架,专门针对大型语言模型(LLMs)在NVIDIABlackwell架构上的高效推理设计。该框架结合了基于微缩放(Microscaling,MX)数据格式的量化算法和矩阵乘法内核,通过灵活分配MXFP4、MXFP6、MXFP8精度通道,在保证模型精度的同时显著提升计算效率。引入量化阈值,识别低精度格式(MXFP4/MXFP6)下量化误差过大的激活元素,将其分配到更高精度通道(MXFP6/MXFP8);

Prompt-Based Value Steering of Large Language Models
大型语言模型正日益应用于人类价值对齐至关重要的场景中。尽管模型微调常被用于确保生成安全响应,但这种技术具有静态性,无法适应涉及动态价值和偏好的日常场景。本文提出一种实用、可复现且模型无关的流程,用于评估候选提示词是否能有效引导生成文本趋向特定人类价值,并形式化了一种评分方法,以量化生成响应中目标价值的存在度与增益。我们将该方法应用于Wizard-Vicuna语言模型的一个变体,结合施瓦茨基本人类价值理论与对话数据集进行结构化评估。

TopoPerception: A Shortcut-Free Evaluation of Global Visual Perception in Large Vision-Language M...
大型视觉语言模型(LVLMs)通常将编码器提取的视觉特征与预训练大型语言模型(LLM)对齐。然而,这使得视觉感知模块成为瓶颈,限制了LVLMs的整体性能。传统评估基准虽富含视觉语义,但往往存在不可避免的局部捷径,可能导致对模型感知能力的高估。本文提出TopoPerception基准,利用拓扑学特性跨多种粒度严格评估LVLMs的全局视觉感知能力。由于拓扑结构依赖图像的全局结构且不受局部特征影响,TopoPerception实现了无捷径的全局感知评估,与语义丰富的任务形成本质区别。

Constrained Network Slice Assignment via Large Language Models
现代网络支持网络切片技术,该技术将物理基础设施划分为多个虚拟切片,以适配不同的服务需求(如高带宽、低时延)。将用户最优分配到切片是一个约束优化问题,传统上需要复杂的算法。本文探索了使用大语言模型(LLMs)解决网络切片的无线资源分配问题,重点研究两种方法:(1)在零样本场景下使用LLM直接将用户服务请求分配到切片;(2)构建整数规划模型,利用LLM通过估计请求间的相似度提供语义洞察。实验表明,即使采用零样本提示,LLM也能生成合理的初步切片分配方案,尽管可能违反部分容量或时延约束。

欢迎留下您的脚印