Loading...
指针分析的研究已开展四十余年。然而,现有框架仍受错误事实传播的困扰。一个主要局限在于它们对代码的语义理解不足,导致对用户定义函数的处理过于保守。大型语言模型(LLMs)的最新进展为弥补这一差距提供了新机遇。本文提出了LMPA(LLM增强型指针分析)框架,该框架将LLMs融入指针分析中,以同时提升精度和可扩展性。LMPA能识别与系统API相似的用户定义函数,并对其进行相应建模,从而减少跨调用上下文的错误传播。此外,该框架通过推断初始指向集,并引入一种结合自然语言的新型总结策略,增强了基于总结的分析。
GDLLM: A Global Distance-aware Modeling Approach Based on Large Language Models for Event Tempora...
在自然语言处理(NLP)领域,事件时间关系抽取(ETRE)的任务是识别两个事件之间的时间关系。以往研究已意识到语言模型对ETRE的重要性,但小型语言模型(SLMs)有限的预训练知识,使其在不平衡分类数据集中难以处理少数类关系;而对于大型语言模型(LLMs),研究人员采用人工设计的提示或指令,这可能引入额外噪声,干扰模型对事件间长距离依赖关系的判断。为解决这些问题,本文提出GDLLM——一种基于LLMs的全局距离感知建模方法。
Think in Games: Learning to Reason in Games via Reinforcement Learning with Large Language Models
大型语言模型(LLMs)在数学、编码等复杂推理任务中表现出色,但在儿童轻松就能完成的简单交互任务上却频繁受挫。这种差异凸显了陈述性知识(了解“是什么”)与程序性知识(掌握“怎么做”)之间的关键鸿沟。尽管传统强化学习(RL)智能体可通过环境交互获取程序性知识,但它们往往表现为“黑箱”,且需要大量训练数据。相比之下,LLMs拥有丰富的世界知识与推理能力,却无法在交互场景中将这种静态知识有效转化为动态决策。
Challenges and Applications of Large Language Models: A Comparison of GPT and DeepSeek family of ...
大型语言模型(LLMs)正推动各行业人工智能变革,但其开发与部署仍面临复杂挑战。本综述梳理了LLM构建与使用过程中的16个关键挑战,并分析了两种采用独特技术路径的最先进模型——OpenAI的闭源模型GPT-4o(2024年5月更新)与开源大型混合专家模型DeepSeek-V3-0324(2025年3月发布)——如何应对这些挑战。通过对比,本文揭示了闭源模型(安全性强、可靠性经微调优化)与开源模型(效率高、适应性强)之间的权衡关系。
CAPE: Context-Aware Personality Evaluation Framework for Large Language Models
传统用于评估人类的心理测量测试,如今正被应用于大型语言模型(LLMs)以评估其行为特质。然而,现有研究采用无上下文方法,孤立地回答每个问题以避免上下文干扰,我们将这种模式称为“迪士尼世界测试”——这是一种脱离现实应用场景的人工设定,因为在现实中,对话历史会显著影响响应结果。为填补这一空白,我们提出首个适用于LLMs的上下文感知人格评估(CAPE)框架,该框架将先前的对话交互纳入评估流程。为深入分析上下文的影响,我们引入新型指标来量化LLMs响应的一致性(一致性是人类行为的核心特质)。
OnGoal: Tracking and Visualizing Conversational Goals in Multi-Turn Dialogue with Large Language ...
随着大语言模型(LLMs)多轮对话的长度和复杂度不断增加,用户如何更好地评估和回顾对话目标的进展?本文提出OnGoal——一款LLM聊天界面,可帮助用户更好地管理目标进展。OnGoal通过LLM辅助评估提供目标一致性的实时反馈,为评估结果提供带示例的解释,并展示目标随时间的进展概况,助力用户更高效地驾驭复杂对话。在一项包含20名参与者的写作任务研究中,我们将OnGoal与无目标追踪的基线聊天界面进行对比。结果显示,使用OnGoal时,参与者实现目标的时间和精力更少,同时会探索新的提示策略以解决沟通偏差。
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
本文聚焦现有文本到音频(TTA)生成模型在长时长叙事音频生成上的不足,提出了名为AudioStory的统一框架,旨在解决长时长叙事音频所需的时间连贯性和组合推理难题。
QR-LoRA: QR-Based Low-Rank Adaptation for Efficient Fine-Tuning of Large Language Models
大型语言模型(LLMs)规模的持续扩大,推动了参数高效微调技术的发展。低秩适配(LoRA)作为一种极具潜力的方法,通过对预训练权重施加低秩更新,减少了可训练参数的数量。标准LoRA直接学习两个更新因子矩阵,而近期的几款变体则首先通过预训练权重的奇异值分解(SVD)初始化这些矩阵——但该操作对大型模型而言计算成本高昂,且得到的奇异向量往往难以解释。在本研究中,我们通过带列主元的QR分解,从预训练权重矩阵中提取正交基,随后将LoRA的更新表示为这些基向量的线性组合——仅训练标量系数。
SoK: Large Language Model-Generated Textual Phishing Campaigns End-to-End Analysis of Generation,...
钓鱼是一种普遍存在的社会工程攻击手段,攻击者通过伪装成可信实体,窃取信息或诱导受害者执行有害操作。文本钓鱼因其低成本、高扩展性和高隐蔽性占据主导地位,而大型语言模型(LLM)的出现进一步放大了这些优势,使得攻击者能在几分钟内发起规模化的“钓鱼即服务”攻击。尽管针对LLM辅助钓鱼攻击的研究日益增多,但关于钓鱼攻击全生命周期的系统性整合研究仍较为稀缺。本文首次提出关于LLM生成钓鱼攻击的知识体系化(SoK)研究,通过“生成-特征-防御”的端到端分析,涵盖生成技术、攻击特征与防御策略。
Dhati+: Fine-tuned Large Language Models for Arabic Subjectivity Evaluation
尽管阿拉伯语具有重要地位,且是一门语言丰富、形态复杂的语言,但它面临着资源匮乏的挑战。大型标注数据集的稀缺,阻碍了阿拉伯语主观性分析精准工具的开发。近年来,深度学习和Transformer模型的发展已被证明在英语和法语文本分类任务中效果显著。本文提出了一种针对阿拉伯语文本数据主观性评估的新方法。为解决专用标注数据集短缺的问题,我们利用现有的阿拉伯语数据集(ASTD、LABR、HARD和SANAD),构建了一个综合数据集AraDhati+。
When Large Language Models Meet Law: Dual-Lens Taxonomy, Technical Advances, and Ethical Governance
本文是首篇全面综述大语言模型(LLMs)在法律领域应用的研究,通过创新的“双透镜分类法”整合法律推理框架与专业本体,系统梳理了该领域的历史研究与当代突破。技术演进:追溯法律人工智能从早期符号方法(如规则推理系统)到基于Transformer的LLMs的演变。LLMs凭借上下文推理、生成式论证等涌现能力,突破了传统方法在法律语义捕捉、证据推理统一等方面的局限,通过稀疏注意力机制、混合专家架构等技术实现了任务泛化、推理形式化和工作流整合。核心进展。
SUMMA: A Multimodal Large Language Model for Advertisement Summarization
理解多模态视频广告对于提升短视频平台的查询-广告匹配度和相关性排序、增强广告效果与用户体验至关重要。然而,具有高商业价值的多模态信息的有效利用,仍在很大程度上受制于对高度压缩视频嵌入的依赖,这一问题长期以来未能得到妥善解决。为应对这一挑战,我们提出了SUMMA(SUmmarizingMultiModalAds的缩写)——一种多模态模型,能够自动将视频广告处理成突出高商业价值内容的摘要,从而在抖音搜索广告系统中提升对广告的理解与排序效果。
ThinkDial: An Open Recipe for Controlling Reasoning Effort in Large Language Models
具备思维链推理能力的大型语言模型(LLMs)已展现出卓越的问题解决能力,但在实际部署中,控制其计算成本仍是一项重大挑战。近期,OpenAI的gpt-oss系列等专有系统引入了离散操作模式,以实现直观的推理控制,而开源社区在很大程度上未能实现此类能力。本文提出ThinkDial——首个开源端到端框架,该框架通过离散操作模式成功实现了类似gpt-oss的可控推理。
Collaborative Intelligence: Topic Modelling of Large Language Model use in Live Cybersecurity Ope...
目的:本研究对安全运营中心(SOC)在实时安全操作中使用大型语言模型(LLM)的情况进行主题建模,旨在深入了解SOC专家如何主动使用该工具。背景:人机协作团队已得到广泛研究,但基于Transformer的语言模型引发了新一轮协作浪潮。某大型网络安全提供商的SOC人员使用LLM支持实时安全操作,本研究旨在分析这些专家如何将LLM融入工作流程。方法:本研究的数据集来源于SOC操作员在10个月内,通过内部部署的基于HTTP的聊天应用访问GPT-4的交互记录。
How Does Cognitive Bias Affect Large Language Models? A Case Study on the Anchoring Effect in Pri...
在人类身上已被深入研究的认知偏差,在大型语言模型(LLMs)中同样可被观察到,这会影响其在实际应用中的可靠性。本文探究了LLM驱动的价格谈判中的锚定效应。为此,我们指令扮演卖家的LLM智能体应用锚定效应,并采用客观指标与主观指标相结合的方式对谈判过程进行评估。实验结果表明,LLMs与人类类似,会受到锚定效应的影响。此外,我们还探究了锚定效应与推理能力、人格特质等因素的关联。研究发现,具备推理能力的模型受锚定效应影响更小,这表明长推理链可缓解锚定效应。
Automatic Question & Answer Generation Using Generative Large Language Model (LLM)
在教育领域,学生评估与知识传授同等重要。学生要接受评估,通常需通过文本类学术评估方式。教师需设计多套题目,且这些题目需对所有学生公平,以检验他们对特定主题的掌握程度。由于教师可能需要手动查阅大量不同的教学材料,这一过程颇具挑战性。本研究的目标是通过微调生成式大语言模型(LLM)实现自动问答生成(AQAG),从而简化整个评估流程。为适配教师偏好的题目类型(选择题、概念题或事实题),研究引入了提示工程(PE)技术。本研究提出在自然语言处理(NLP)领域采用无监督学习方法,重点关注英文文本处理。
Beyond Quality: Unlocking Diversity in Ad Headline Generation with Large Language Models
广告标题生在现代广告中发挥着至关重要的作用,要吸引广泛的受众群体,标题的质量和多样性缺一不可。当前的方法主要针对标题质量或点击率(CTR)对语言模型进行优化,往往忽视了对多样性的需求,导致生成的标题具有同质化特征。为解决这一局限,我们提出了DIVER框架——一种基于大型语言模型(LLMs)的新型框架,该框架能对多样性和质量进行联合优化。首先,我们设计了一个语义和风格感知的数据生成管道,可自动生成高质量的训练样本对,每个样本对包含广告内容和多个多样化的标题。
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
大语言模型(LLMs)在众多生成任务中已取得卓越性能。然而,如何有效使模型输出与期望行为对齐,仍是一项重大挑战。激活引导是一种高效且经济的方法,它在推理阶段直接修改LLMs的内部激活状态,使模型响应符合期望行为,同时避免了微调带来的高昂成本。现有方法通常对所有生成内容无差别干预,或仅依据问题本身决定是否干预,这限制了对干预强度的精准评估。为此,本文提出带回溯的灵活激活引导(FASB)框架:该框架通过追踪LLMs生成过程中的内部状态,结合问题与已生成内容,动态决定干预的必要性与强度。
A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers
科学大语言模型(Sci-LLMs)正改变科学研究中知识的表示、整合与应用方式,但其发展受限于科学数据的复杂特性。本综述以“数据为中心”,提出一个全面的整合分析框架,将Sci-LLMs的发展重构为模型与其底层数据基质的协同进化过程。首先,我们构建了科学数据的统一分类体系与科学知识的层级模型,重点强调科学语料区别于通用自然语言处理数据集的三大核心挑战:多模态、跨尺度与领域特异性。
AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language M...
多模态大型语言模型(MLLMs)的发展推动了视觉问答(VQA)领域取得重大进展,使其从单图像视觉问答(SVQA)逐步演进至多图像视觉问答(MVQA)。然而,MVQA中图像数量的增加不可避免地引入了大量与问答无关的视觉冗余,这对模型的准确率和效率均产生了负面影响。为解决这一问题,现有方法在控制压缩视觉令牌数量方面缺乏灵活性,且往往会产生离散的视觉片段,阻碍了MLLMs对图像的整体理解。在本文中,我们提出一种简洁且通用的自适应视觉锚定策略,该策略可无缝集成到现有MLLMs中,通过自适应压缩显著提升模型准确率。
