Loading...
我们提出了VideoPerceiver,这是一款新型视频多模态大语言模型(VMLLM),旨在增强视频理解中的细粒度感知能力,解决现有VMLLM在短片段短暂动作或长视频稀有瞬时事件推理上的局限。VideoPerceiver采用两阶段训练框架:在监督微调(SFT)阶段,我们通过从字幕中提取事件-动作关键词、识别对应关键帧并替换为相邻帧,构建“关键信息缺失”视频;
DeCoT: Decomposing Complex Instructions for Enhanced Text-to-Image Generation with Large Language...
尽管文本到图像(T2I)模型已取得显著进展,但当前模型在处理复杂、长文本指令时仍面临挑战,往往无法准确呈现复杂细节、空间关系或特定约束。LongBench-T2I等基准测试凸显了这一局限,表明模型在构图、特定文本渲染和精细纹理处理方面存在不足。为解决该问题,本文提出DeCoT(Decomposition-CoT)框架——一种利用大型语言模型(LLMs)显著提升T2I模型对复杂指令理解与执行能力的新方法。
Extracting Disaster Impacts and Impact Related Locations in Social Media Posts Using Large Langua...
大规模灾害往往会对人员和基础设施造成灾难性后果。由现场传感器、遥感影像和/或地理数据等权威来源生成的灾害影响态势感知信息,常因大气不透明度、卫星重访周期和时间限制而受到局限,这往往导致地理时间信息缺口。相比之下,与灾害影响相关的社交媒体帖子可在灾害期间充当"地理传感器",人们会在其中描述具体的灾害影响及相关地点。然而,灾害相关社交媒体帖子中提及的并非所有地点都与灾害影响直接相关——只有受影响地点对有效调配资源至关重要。
EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Mo...
指令式视觉分割(IVS)任务要求根据自然语言指令分割图像或视频中的目标。尽管近年来多模态大语言模型(MLLMs)在IVS任务上取得了优异性能,但其推理成本仍是主要瓶颈,在视频任务中尤为突出。本文通过实证分析MLLMs中的视觉令牌采样过程,发现令牌子集的覆盖度与分割性能之间存在强相关性。这一发现启发我们设计了一种简单高效的令牌剪枝方法,该方法可筛选出紧凑且具有空间代表性的令牌子集,从而加速推理过程。
Discovering Expert-Level Nash Equilibrium Algorithms with Large Language Models
算法设计与分析是计算机科学的基石,但该领域面临一项重大挑战:传统上,要证明一种算法在所有输入下的性能保证,需要大量且往往容易出错的人工工作。尽管人工智能(AI)在求解特定问题实例方面已展现出巨大成功,但自动化发现具有此类可证明性能保证的通用算法,仍是一个难以逾越的障碍。这一挑战源于难以将算法设计的创造性过程与形式化分析的严谨过程相融合。为解决这一问题,我们提出了LegoNE框架——该框架将上述两个过程紧密结合,用于解决计算近似纳什均衡这一基础且极具挑战性的问题。
The Structural Sources of Verb Meaning Revisited: Large Language Models Display Syntactic Bootstr...
句法引导假说(Gleitman,1990)认为,儿童会利用动词所处的句法环境来学习动词含义。本文旨在验证大语言模型是否也表现出类似行为。为此,我们在去除句法信息的扰动数据集上训练RoBERTa和GPT-2两种模型。结果表明:与去除共现信息相比,去除句法线索对模型动词表征的破坏更大;此外,在人类动词学习中,句法引导对心理动词(如see、think)的习得尤为关键,而在本研究的训练设置中,心理动词的表征受句法去除的负面影响也显著大于物理动词(如take、push)。
Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation
大语言模型(LLMs)的最新进展为序列推荐开辟了新途径,其能够对用户行为序列进行自然语言推理。一种常见方法将推荐任务构建为语言建模任务:将交互历史转换为提示词,并通过有监督微调(SFT)学习用户偏好。然而,这些方法仅在文本模态下运作,往往会忽略用户的细粒度兴趣——尤其是当这些兴趣由产品图像、电影海报等丰富视觉信号塑造时。多模态大语言模型(MLLMs)通过在共享语义空间中对齐文本和视觉信息,提供了一种极具潜力的替代方案。
Can Large Language Models Solve Path Constraints in Symbolic Execution?
符号执行是一项重要的软件分析技术,对软件测试和调试等下游任务具有重要意义。然而,若干局限阻碍了符号执行在实际软件中的应用,其中之一便是无法求解多样化的执行路径约束:传统基于SMT求解器的符号执行难以处理包含复杂数据结构或外部API调用的执行路径。本文聚焦于探索采用大型语言模型(LLM)替代符号执行中传统基于求解器的技术来解决路径约束问题的可能性。我们通过实证研究评估LLM在两类路径约束求解任务中的能力:生成测试输入以覆盖指定执行路径,以及判断给定执行路径是否可满足且不触发任何bug。
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
我们提出了VideoPerceiver,这是一款新型视频多模态大语言模型(VMLLM),旨在增强视频理解中的细粒度感知能力,解决现有VMLLM在短片段短暂动作或长视频稀有瞬时事件推理上的局限。VideoPerceiver采用两阶段训练框架:在监督微调(SFT)阶段,我们通过从字幕中提取事件-动作关键词、识别对应关键帧并替换为相邻帧,构建“关键信息缺失”视频;
Towards Robust and Fair Next Visit Diagnosis Prediction under Noisy Clinical Notes with Large Lan...
人工智能(AI)十年间的快速发展为临床决策支持系统(CDSS)带来了新机遇,大型语言模型(LLMs)在时效性医疗任务中展现出强大的推理能力。然而,临床文本常因人为错误或自动处理流程缺陷而质量下降,引发了对AI辅助决策可靠性和公平性的担忧。尽管如此,此类质量退化的影响尚未得到充分研究,尤其是噪声导致的分布偏移如何加剧预测不确定性并对不同人口统计学亚组产生不均衡影响。本文针对多种文本损坏场景,对最先进的LLMs开展系统性研究,重点关注下次就诊诊断预测任务中的鲁棒性和公平性。
Large Language Model Enhanced Graph Invariant Contrastive Learning for Out-of-Distribution Recomm...
该研究针对图推荐系统中的分布外(OOD)泛化问题展开,核心挑战在于传统图神经网络(GNN)易学习训练数据中的虚假相关性,而非稳定的因果关系,导致数据分布发生偏移时推荐性能大幅下降。因果分数生成模块:通过环境提取器识别数据中的潜在环境,结合不变学习模块对用户-物品交互关系进行稳定性评估,生成因果置信分数矩阵,量化每个交互的因果关联强度。LLM校准的因果图编辑模块(LLMC2GE)
INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models
我们提出了INTERLACE,这是一种新颖的框架,通过样本高效的微调在剪枝视觉语言模型(VLMs)冗余层的同时保持模型性能。现有层剪枝方法应用于视觉语言模型时会导致显著的性能下降。相比之下,我们通过分析连续三层(三元组)来识别局部冗余:删除前两层中冗余度最高的层,对剩余层进行微调以补偿丢失的容量,并冻结第三层以在微调过程中充当稳定锚点。我们发现,这种交错式微调-冻结设计能够在剪枝后通过极少数据实现快速收敛。
Rethinking Retrieval: From Traditional Retrieval Augmented Generation to Agentic and Non-Vector R...
研究背景:现有RAG技术在金融文档处理中缺乏向量型与非向量型架构的系统对比,且先进RAG技术对检索精度、答案质量、延迟和成本的实证影响尚不明确。金融文档(如SEC10-K、10-Q、8-K文件)具有篇幅长、术语专、多跳推理需求高等特点,给问答系统带来独特挑战。研究对象与方案对比两种检索架构:基于向量的智能体RAG(融合混合搜索与元数据过滤)和基于层级节点的推理系统(无嵌入,通过文档目录结构遍历检索)。评估两种先进增强技术:交叉编码器重排序(提升检索精度)和“从小到大”片段检索(保障上下文完整性)
The Catastrophic Paradox of Human Cognitive Frameworks in Large Language Model Evaluation: A Comp...
核心矛盾:模型在CHC框架下测得的人类IQ分数(85.0-121.4)与概念准确性评分严重脱节,二元精确匹配评分(按心理测量传统)与LLM作为评判者的概念准确性评分相关系数仅为0.175(p
Prompt Fencing: A Cryptographic Approach to Establishing Security Boundaries in Large Language Mo...
大型语言模型(LLMs)仍然容易受到提示注入攻击,这是生产部署中最严重的安全威胁。本文提出了提示围栏(PromptFencing),这是一种新颖的架构方法,应用密码学认证和数据架构原则在LLM提示中建立明确的安全边界。我们的方法为提示片段添加包含信任等级和内容类型的加密签名元数据,使LLM能够区分可信指令与不可信内容。
Simulated Self-Assessment in Large Language Models: A Psychometric Approach to AI Self-Efficacy
自我评估是可靠智能的关键方面,但大型语言模型(LLMs)的评估主要集中在任务准确性上。本研究改编了10项一般自我效能感量表(GSES),在四种条件(无任务、计算推理、社会推理和总结任务)下诱导10个LLM进行模拟自我评估。结果显示,GSES反应在重复测试和随机题目顺序下具有高度稳定性。然而,不同模型在各条件下的自我效能感水平存在显著差异,总得分低于人类常模。所有模型在计算推理和社会推理题目上均达到完美准确率,而总结任务的表现差异较大。
Consiglieres in the Shadow: Understanding the Use of Uncensored Large Language Models in Cybercrimes
人工智能技术(尤其是大型语言模型,LLMs)的发展不仅改变了计算领域,也带来了新的安全与隐私风险。已有研究表明,网络犯罪者正越来越多地将无审查大型语言模型(ULLMs)作为恶意服务的后端。然而,在HuggingFace等平台托管的海量开源LLM中识别ULLMs面临巨大挑战,这严重阻碍了对ULLMs的深入理解。本文首次对ULLMs展开系统性研究,通过建模开源LLM之间、LLM与相关数据(如微调/合并/压缩模型、含有害内容的数据集)之间的关系,成功克服这一挑战。
The Catastrophic Paradox of Human Cognitive Frameworks in Large Language Model Evaluation: A Comp...
核心矛盾:模型在CHC框架下测得的人类IQ分数(85.0-121.4)与概念准确性评分严重脱节,二元精确匹配评分(按心理测量传统)与LLM作为评判者的概念准确性评分相关系数仅为0.175(p
Large Language Models for the Summarization of Czech Documents: From History to the Present
文本摘要是将较长文本自动浓缩为更短、连贯的摘要,同时保留原始含义和关键信息的任务。尽管该任务在英语和其他高资源语言中已得到广泛研究,但捷克语摘要(尤其是历史文献语境下的摘要)仍未被充分探索。这主要归因于捷克语固有的语言复杂性以及高质量标注数据集的缺乏。在本研究中,我们利用大型语言模型(LLMs)的能力来填补这一空白,具体采用了Mistral和mT5模型——这些模型在多种自然语言处理任务和多语言场景中均表现出优异性能。
Gender Bias in Emotion Recognition by Large Language Models
大型语言模型(LLMs)的快速发展及其在日常生活中的日益普及,凸显了评估并确保其公平性的重要性。本研究聚焦情绪心智理论领域的公平性问题,探究当LLMs面对人物及其环境描述并被问及“此人感受如何”时,是否会表现出性别偏见。此外,我们提出并评估了多种去偏策略,结果表明,要实现有意义的偏见减少,需要基于训练的干预措施,而非仅依赖提示工程等推理时的提示类方法。
