Loading...

Detecting and Pruning Prominent but Detrimental Neurons in Large Language Models
本文聚焦于大型语言模型(LLMs)中存在的“捷径学习”问题——模型依赖训练数据中的领域特定相关性(而非可迁移的推理能力)实现高置信度预测,导致在新任务或分布上性能下降。为解决这一问题,作者提出一种基于神经元修剪的微调方法,核心是识别并移除与领域特定机制(DSM)相关的神经元,以增强模型的泛化能力。具体而言,该方法利用积分梯度(IntegratedGradients)量化神经元对高置信度预测的影响,定位那些对特定数据集性能贡献过大但缺乏稳健推理能力的神经元;

Large Language Models Encode Semantics in Low-Dimensional Linear Subspaces
语义的低维线性子空间编码:LLMs会将高级语义信息(如数学、物理等学科知识)压缩到低维线性子空间中,这些子空间的有效维度通常远低于模型的总隐藏维度(常低于10%)。线性可分的语义簇:不同语义内容的表示形成线性可分的簇,且这种可分性在模型深层更显著(通过SVM分类准确率提升体现),表明深层更倾向于结构化语义分离。指令对潜在表示的影响:思维链(chain-of-thought)等结构化推理指令或对齐行为会锐化并分离潜在表示,即使表面内容不变,也会导致内部表示的显著差异;

RepoMark: A Code Usage Auditing Framework for Code Large Language Models
代码生成领域大语言模型(LLMs)的快速发展,以前所未有的效率实现了编码任务自动化,为软件开发带来了变革。然而,这些模型基于开源代码仓库(如GitHub)进行训练的方式,引发了严重的伦理和法律问题,尤其是在数据授权和开源许可证合规性方面。由于数据收集过程缺乏透明度,开发者越来越质疑模型训练者在使用代码仓库进行训练前是否获得了合法授权。为解决这些问题,我们提出了一种新颖的数据标记框架RepoMark,用于审计代码大语言模型的数据使用情况。

GuardVal: Dynamic Large Language Model Jailbreak Evaluation for Comprehensive Safety Testing
本文针对大型语言模型(LLMs)面临的越狱攻击(即通过精心设计的提示词绕过安全机制,生成有害内容)评估难题,提出了一种动态评估协议GuardVal。现有评估方法存在局限性:传统人工基准(如PromptBench、TrustLLM)依赖人工标注,可扩展性差且易受训练数据污染;自动化动态生成方法(如HarmBench、JailbreakBench)多针对特定任务,缺乏对模型特性的动态适配。

Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study
人工智能模型在皮肤疾病(包括癌症)诊断方面已展现出显著成效,有望辅助临床医生进行病情分析。然而,在这些模型投入实际应用之前,其预测结果的可解释性亟待大幅提升。为此,本研究探索了两种极具潜力的方法的结合:多模态大型语言模型(MLLMs)与定量属性的运用。多模态大型语言模型为提升可解释性提供了潜在途径,它能通过交互式形式,以自然语言为诊断提供推理依据。此外,近期研究发现,一系列与病变外观相关的定量属性(如病变面积)对恶性病变的预测准确率较高。基于这类概念构建的预测模型,有望进一步提升可解释性。

Lethe: Purifying Backdoored Large Language Models with Knowledge Dilution
大型语言模型(LLMs)已取得显著进展,在各类自然语言处理(NLP)任务中展现出卓越性能。然而,这些模型仍易受后门攻击——面对标准查询时表现正常,但当特定触发器被激活时,会生成有害响应或非预期输出。现有后门防御要么缺乏全面性(聚焦于有限的触发器设置、仅检测不净化的机制及狭窄的应用领域),要么无法抵御模型编辑攻击、多触发器攻击、无触发器攻击等复杂场景。本文提出一种名为LETHE的新方法,通过内部和外部双机制的知识稀释,消除LLMs中的后门行为。

Enhancing Semantic Understanding in Pointer Analysis using Large Language Models
指针分析的研究已开展四十余年。然而,现有框架仍受错误事实传播的困扰。一个主要局限在于它们对代码的语义理解不足,导致对用户定义函数的处理过于保守。大型语言模型(LLMs)的最新进展为弥补这一差距提供了新机遇。本文提出了LMPA(LLM增强型指针分析)框架,该框架将LLMs融入指针分析中,以同时提升精度和可扩展性。LMPA能识别与系统API相似的用户定义函数,并对其进行相应建模,从而减少跨调用上下文的错误传播。此外,该框架通过推断初始指向集,并引入一种结合自然语言的新型总结策略,增强了基于总结的分析。

GDLLM: A Global Distance-aware Modeling Approach Based on Large Language Models for Event Tempora...
在自然语言处理(NLP)领域,事件时间关系抽取(ETRE)的任务是识别两个事件之间的时间关系。以往研究已意识到语言模型对ETRE的重要性,但小型语言模型(SLMs)有限的预训练知识,使其在不平衡分类数据集中难以处理少数类关系;而对于大型语言模型(LLMs),研究人员采用人工设计的提示或指令,这可能引入额外噪声,干扰模型对事件间长距离依赖关系的判断。为解决这些问题,本文提出GDLLM——一种基于LLMs的全局距离感知建模方法。

Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models
大型语言模型(LLMs)在数学、编码等复杂推理任务中表现出色,但在儿童轻松就能完成的简单交互任务上却频繁受挫。这种差异凸显了陈述性知识(了解“是什么”)与程序性知识(掌握“怎么做”)之间的关键鸿沟。尽管传统强化学习(RL)智能体可通过环境交互获取程序性知识,但它们往往表现为“黑箱”,且需要大量训练数据。相比之下,LLMs拥有丰富的世界知识与推理能力,却无法在交互场景中将这种静态知识有效转化为动态决策。

Challenges and Applications of Large Language Models: A Comparison of GPT and DeepSeek family of ...
大型语言模型(LLMs)正推动各行业人工智能变革,但其开发与部署仍面临复杂挑战。本综述梳理了LLM构建与使用过程中的16个关键挑战,并分析了两种采用独特技术路径的最先进模型——OpenAI的闭源模型GPT-4o(2024年5月更新)与开源大型混合专家模型DeepSeek-V3-0324(2025年3月发布)——如何应对这些挑战。通过对比,本文揭示了闭源模型(安全性强、可靠性经微调优化)与开源模型(效率高、适应性强)之间的权衡关系。

CAPE: Context-Aware Personality Evaluation Framework for Large Language Models
传统用于评估人类的心理测量测试,如今正被应用于大型语言模型(LLMs)以评估其行为特质。然而,现有研究采用无上下文方法,孤立地回答每个问题以避免上下文干扰,我们将这种模式称为“迪士尼世界测试”——这是一种脱离现实应用场景的人工设定,因为在现实中,对话历史会显著影响响应结果。为填补这一空白,我们提出首个适用于LLMs的上下文感知人格评估(CAPE)框架,该框架将先前的对话交互纳入评估流程。为深入分析上下文的影响,我们引入新型指标来量化LLMs响应的一致性(一致性是人类行为的核心特质)。

OnGoal: Tracking and Visualizing Conversational Goals in Multi-Turn Dialogue with Large Language ...
随着大语言模型(LLMs)多轮对话的长度和复杂度不断增加,用户如何更好地评估和回顾对话目标的进展?本文提出OnGoal——一款LLM聊天界面,可帮助用户更好地管理目标进展。OnGoal通过LLM辅助评估提供目标一致性的实时反馈,为评估结果提供带示例的解释,并展示目标随时间的进展概况,助力用户更高效地驾驭复杂对话。在一项包含20名参与者的写作任务研究中,我们将OnGoal与无目标追踪的基线聊天界面进行对比。结果显示,使用OnGoal时,参与者实现目标的时间和精力更少,同时会探索新的提示策略以解决沟通偏差。

AudioStory: Generating Long-Form Narrative Audio with Large Language Models
本文聚焦现有文本到音频(TTA)生成模型在长时长叙事音频生成上的不足,提出了名为AudioStory的统一框架,旨在解决长时长叙事音频所需的时间连贯性和组合推理难题。

QR-LoRA: QR-Based Low-Rank Adaptation for Efficient Fine-Tuning of Large Language Models
大型语言模型(LLMs)规模的持续扩大,推动了参数高效微调技术的发展。低秩适配(LoRA)作为一种极具潜力的方法,通过对预训练权重施加低秩更新,减少了可训练参数的数量。标准LoRA直接学习两个更新因子矩阵,而近期的几款变体则首先通过预训练权重的奇异值分解(SVD)初始化这些矩阵——但该操作对大型模型而言计算成本高昂,且得到的奇异向量往往难以解释。在本研究中,我们通过带列主元的QR分解,从预训练权重矩阵中提取正交基,随后将LoRA的更新表示为这些基向量的线性组合——仅训练标量系数。

SoK: Large Language Model-Generated Textual Phishing Campaigns End-to-End Analysis of Generation,...
钓鱼是一种普遍存在的社会工程攻击手段,攻击者通过伪装成可信实体,窃取信息或诱导受害者执行有害操作。文本钓鱼因其低成本、高扩展性和高隐蔽性占据主导地位,而大型语言模型(LLM)的出现进一步放大了这些优势,使得攻击者能在几分钟内发起规模化的“钓鱼即服务”攻击。尽管针对LLM辅助钓鱼攻击的研究日益增多,但关于钓鱼攻击全生命周期的系统性整合研究仍较为稀缺。本文首次提出关于LLM生成钓鱼攻击的知识体系化(SoK)研究,通过“生成-特征-防御”的端到端分析,涵盖生成技术、攻击特征与防御策略。

Dhati+: Fine-tuned Large Language Models for Arabic Subjectivity Evaluation
尽管阿拉伯语具有重要地位,且是一门语言丰富、形态复杂的语言,但它面临着资源匮乏的挑战。大型标注数据集的稀缺,阻碍了阿拉伯语主观性分析精准工具的开发。近年来,深度学习和Transformer模型的发展已被证明在英语和法语文本分类任务中效果显著。本文提出了一种针对阿拉伯语文本数据主观性评估的新方法。为解决专用标注数据集短缺的问题,我们利用现有的阿拉伯语数据集(ASTD、LABR、HARD和SANAD),构建了一个综合数据集AraDhati+。

When Large Language Models Meet Law: Dual-Lens Taxonomy, Technical Advances, and Ethical Governance
本文是首篇全面综述大语言模型(LLMs)在法律领域应用的研究,通过创新的“双透镜分类法”整合法律推理框架与专业本体,系统梳理了该领域的历史研究与当代突破。技术演进:追溯法律人工智能从早期符号方法(如规则推理系统)到基于Transformer的LLMs的演变。LLMs凭借上下文推理、生成式论证等涌现能力,突破了传统方法在法律语义捕捉、证据推理统一等方面的局限,通过稀疏注意力机制、混合专家架构等技术实现了任务泛化、推理形式化和工作流整合。核心进展。

SUMMA: A Multimodal Large Language Model for Advertisement Summarization
理解多模态视频广告对于提升短视频平台的查询-广告匹配度和相关性排序、增强广告效果与用户体验至关重要。然而,具有高商业价值的多模态信息的有效利用,仍在很大程度上受制于对高度压缩视频嵌入的依赖,这一问题长期以来未能得到妥善解决。为应对这一挑战,我们提出了SUMMA(SUmmarizingMultiModalAds的缩写)——一种多模态模型,能够自动将视频广告处理成突出高商业价值内容的摘要,从而在抖音搜索广告系统中提升对广告的理解与排序效果。

ThinkDial: An Open Recipe for Controlling Reasoning Effort in Large Language Models
具备思维链推理能力的大型语言模型(LLMs)已展现出卓越的问题解决能力,但在实际部署中,控制其计算成本仍是一项重大挑战。近期,OpenAI的gpt-oss系列等专有系统引入了离散操作模式,以实现直观的推理控制,而开源社区在很大程度上未能实现此类能力。本文提出ThinkDial——首个开源端到端框架,该框架通过离散操作模式成功实现了类似gpt-oss的可控推理。

Collaborative Intelligence: Topic Modelling of Large Language Model use in Live Cybersecurity Ope...
目的:本研究对安全运营中心(SOC)在实时安全操作中使用大型语言模型(LLM)的情况进行主题建模,旨在深入了解SOC专家如何主动使用该工具。背景:人机协作团队已得到广泛研究,但基于Transformer的语言模型引发了新一轮协作浪潮。某大型网络安全提供商的SOC人员使用LLM支持实时安全操作,本研究旨在分析这些专家如何将LLM融入工作流程。方法:本研究的数据集来源于SOC操作员在10个月内,通过内部部署的基于HTTP的聊天应用访问GPT-4的交互记录。

欢迎留下您的脚印