Loading...
本文聚焦现有文本到音频(TTA)生成模型在长时长叙事音频生成上的不足,提出了名为AudioStory的统一框架,旨在解决长时长叙事音频所需的时间连贯性和组合推理难题。
QR-LoRA: QR-Based Low-Rank Adaptation for Efficient Fine-Tuning of Large Language Models
大型语言模型(LLMs)规模的持续扩大,推动了参数高效微调技术的发展。低秩适配(LoRA)作为一种极具潜力的方法,通过对预训练权重施加低秩更新,减少了可训练参数的数量。标准LoRA直接学习两个更新因子矩阵,而近期的几款变体则首先通过预训练权重的奇异值分解(SVD)初始化这些矩阵——但该操作对大型模型而言计算成本高昂,且得到的奇异向量往往难以解释。在本研究中,我们通过带列主元的QR分解,从预训练权重矩阵中提取正交基,随后将LoRA的更新表示为这些基向量的线性组合——仅训练标量系数。
SoK: Large Language Model-Generated Textual Phishing Campaigns End-to-End Analysis of Generation,...
钓鱼是一种普遍存在的社会工程攻击手段,攻击者通过伪装成可信实体,窃取信息或诱导受害者执行有害操作。文本钓鱼因其低成本、高扩展性和高隐蔽性占据主导地位,而大型语言模型(LLM)的出现进一步放大了这些优势,使得攻击者能在几分钟内发起规模化的“钓鱼即服务”攻击。尽管针对LLM辅助钓鱼攻击的研究日益增多,但关于钓鱼攻击全生命周期的系统性整合研究仍较为稀缺。本文首次提出关于LLM生成钓鱼攻击的知识体系化(SoK)研究,通过“生成-特征-防御”的端到端分析,涵盖生成技术、攻击特征与防御策略。
Dhati+: Fine-tuned Large Language Models for Arabic Subjectivity Evaluation
尽管阿拉伯语具有重要地位,且是一门语言丰富、形态复杂的语言,但它面临着资源匮乏的挑战。大型标注数据集的稀缺,阻碍了阿拉伯语主观性分析精准工具的开发。近年来,深度学习和Transformer模型的发展已被证明在英语和法语文本分类任务中效果显著。本文提出了一种针对阿拉伯语文本数据主观性评估的新方法。为解决专用标注数据集短缺的问题,我们利用现有的阿拉伯语数据集(ASTD、LABR、HARD和SANAD),构建了一个综合数据集AraDhati+。
When Large Language Models Meet Law: Dual-Lens Taxonomy, Technical Advances, and Ethical Governance
本文是首篇全面综述大语言模型(LLMs)在法律领域应用的研究,通过创新的“双透镜分类法”整合法律推理框架与专业本体,系统梳理了该领域的历史研究与当代突破。技术演进:追溯法律人工智能从早期符号方法(如规则推理系统)到基于Transformer的LLMs的演变。LLMs凭借上下文推理、生成式论证等涌现能力,突破了传统方法在法律语义捕捉、证据推理统一等方面的局限,通过稀疏注意力机制、混合专家架构等技术实现了任务泛化、推理形式化和工作流整合。核心进展。
SUMMA: A Multimodal Large Language Model for Advertisement Summarization
理解多模态视频广告对于提升短视频平台的查询-广告匹配度和相关性排序、增强广告效果与用户体验至关重要。然而,具有高商业价值的多模态信息的有效利用,仍在很大程度上受制于对高度压缩视频嵌入的依赖,这一问题长期以来未能得到妥善解决。为应对这一挑战,我们提出了SUMMA(SUmmarizingMultiModalAds的缩写)——一种多模态模型,能够自动将视频广告处理成突出高商业价值内容的摘要,从而在抖音搜索广告系统中提升对广告的理解与排序效果。
ThinkDial: An Open Recipe for Controlling Reasoning Effort in Large Language Models
具备思维链推理能力的大型语言模型(LLMs)已展现出卓越的问题解决能力,但在实际部署中,控制其计算成本仍是一项重大挑战。近期,OpenAI的gpt-oss系列等专有系统引入了离散操作模式,以实现直观的推理控制,而开源社区在很大程度上未能实现此类能力。本文提出ThinkDial——首个开源端到端框架,该框架通过离散操作模式成功实现了类似gpt-oss的可控推理。
Collaborative Intelligence: Topic Modelling of Large Language Model use in Live Cybersecurity Ope...
目的:本研究对安全运营中心(SOC)在实时安全操作中使用大型语言模型(LLM)的情况进行主题建模,旨在深入了解SOC专家如何主动使用该工具。背景:人机协作团队已得到广泛研究,但基于Transformer的语言模型引发了新一轮协作浪潮。某大型网络安全提供商的SOC人员使用LLM支持实时安全操作,本研究旨在分析这些专家如何将LLM融入工作流程。方法:本研究的数据集来源于SOC操作员在10个月内,通过内部部署的基于HTTP的聊天应用访问GPT-4的交互记录。
How Does Cognitive Bias Affect Large Language Models? A Case Study on the Anchoring Effect in Pri...
在人类身上已被深入研究的认知偏差,在大型语言模型(LLMs)中同样可被观察到,这会影响其在实际应用中的可靠性。本文探究了LLM驱动的价格谈判中的锚定效应。为此,我们指令扮演卖家的LLM智能体应用锚定效应,并采用客观指标与主观指标相结合的方式对谈判过程进行评估。实验结果表明,LLMs与人类类似,会受到锚定效应的影响。此外,我们还探究了锚定效应与推理能力、人格特质等因素的关联。研究发现,具备推理能力的模型受锚定效应影响更小,这表明长推理链可缓解锚定效应。
Automatic Question & Answer Generation Using Generative Large Language Model (LLM)
在教育领域,学生评估与知识传授同等重要。学生要接受评估,通常需通过文本类学术评估方式。教师需设计多套题目,且这些题目需对所有学生公平,以检验他们对特定主题的掌握程度。由于教师可能需要手动查阅大量不同的教学材料,这一过程颇具挑战性。本研究的目标是通过微调生成式大语言模型(LLM)实现自动问答生成(AQAG),从而简化整个评估流程。为适配教师偏好的题目类型(选择题、概念题或事实题),研究引入了提示工程(PE)技术。本研究提出在自然语言处理(NLP)领域采用无监督学习方法,重点关注英文文本处理。
Beyond Quality: Unlocking Diversity in Ad Headline Generation with Large Language Models
广告标题生在现代广告中发挥着至关重要的作用,要吸引广泛的受众群体,标题的质量和多样性缺一不可。当前的方法主要针对标题质量或点击率(CTR)对语言模型进行优化,往往忽视了对多样性的需求,导致生成的标题具有同质化特征。为解决这一局限,我们提出了DIVER框架——一种基于大型语言模型(LLMs)的新型框架,该框架能对多样性和质量进行联合优化。首先,我们设计了一个语义和风格感知的数据生成管道,可自动生成高质量的训练样本对,每个样本对包含广告内容和多个多样化的标题。
Steering When Necessary: Flexible Steering Large Language Models with Backtracking
大语言模型(LLMs)在众多生成任务中已取得卓越性能。然而,如何有效使模型输出与期望行为对齐,仍是一项重大挑战。激活引导是一种高效且经济的方法,它在推理阶段直接修改LLMs的内部激活状态,使模型响应符合期望行为,同时避免了微调带来的高昂成本。现有方法通常对所有生成内容无差别干预,或仅依据问题本身决定是否干预,这限制了对干预强度的精准评估。为此,本文提出带回溯的灵活激活引导(FASB)框架:该框架通过追踪LLMs生成过程中的内部状态,结合问题与已生成内容,动态决定干预的必要性与强度。
A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers
科学大语言模型(Sci-LLMs)正改变科学研究中知识的表示、整合与应用方式,但其发展受限于科学数据的复杂特性。本综述以“数据为中心”,提出一个全面的整合分析框架,将Sci-LLMs的发展重构为模型与其底层数据基质的协同进化过程。首先,我们构建了科学数据的统一分类体系与科学知识的层级模型,重点强调科学语料区别于通用自然语言处理数据集的三大核心挑战:多模态、跨尺度与领域特异性。
AVAM: Universal Training-free Adaptive Visual Anchoring Embedded into Multimodal Large Language M...
多模态大型语言模型(MLLMs)的发展推动了视觉问答(VQA)领域取得重大进展,使其从单图像视觉问答(SVQA)逐步演进至多图像视觉问答(MVQA)。然而,MVQA中图像数量的增加不可避免地引入了大量与问答无关的视觉冗余,这对模型的准确率和效率均产生了负面影响。为解决这一问题,现有方法在控制压缩视觉令牌数量方面缺乏灵活性,且往往会产生离散的视觉片段,阻碍了MLLMs对图像的整体理解。在本文中,我们提出一种简洁且通用的自适应视觉锚定策略,该策略可无缝集成到现有MLLMs中,通过自适应压缩显著提升模型准确率。
A Retail-Corpus for Aspect-Based Sentiment Analysis with Large Language Models
基于方面的情感分析(ABSA)通过将情感与特定方面相关联,增强了情感检测能力,相比传统情感分析能提供更深入的洞察。本研究构建了一个包含10,814条多语言客户评论的手动标注数据集,这些评论均针对实体零售店,标注涵盖8个方面类别及其对应情感。利用该数据集,研究人员评估了GPT-4与LLaMA-3在基于方面的情感分析任务中的性能,为新引入的数据集建立了基准。结果显示,两个模型的准确率均超过85%,且在所有相关指标上,GPT-4的整体表现均优于LLaMA-3。
MQAD: A Large-Scale Question Answering Dataset for Training Music Large Language Models
问答(QA)是人类理解一段音乐音频的自然方式。然而,对于机器而言,获取一个涵盖音乐各方面信息的大规模数据集至关重要,却也颇具挑战性,因为此类公开可用的音乐数据十分稀缺。本文介绍了MQAD,这是一个基于百万歌曲数据集(MSD)构建的音乐问答数据集,包含27万首歌曲,涵盖丰富的音乐特征——包括节拍、和弦、调式、结构、乐器和流派——并包含近300万条不同的问题和描述。MQAD的独特之处在于其提供了和弦、乐段等详细的时变音乐信息,能够支持对歌曲中音乐内在结构的探索。
DRQA: Dynamic Reasoning Quota Allocation for Controlling Overthinking in Reasoning Large Language...
推理大型语言模型(RLLMs),如OpenAI-O3和DeepSeek-R1,近年来通过执行结构化多步推理展现出卓越能力。然而,近期研究发现,RLLMs常存在“过度思考”问题——即便面对简单问题,也会生成不必要的冗长推理链,导致token消耗过多和计算效率低下。有趣的是,我们观察到,当以批量模式处理多个问题时,由于隐式的资源竞争,RLLMs会通过动态压缩简单问题的推理步骤,表现出更高效的资源利用行为。
Memory-Efficient Federated Fine-Tuning of Large Language Models via Layer Pruning
联邦微调能够实现保护隐私的大型语言模型(LLM)适配,但高昂的内存成本限制了资源受限设备的参与。本文提出FEDPRUNER——一种创新的联邦微调范式,通过智能层剪枝解决这一问题。FEDPRUNER可灵活剪枝全局模型,根据设备内存约束生成个性化子模型。该范式采用宏-微协同剪枝框架:宏观层面,基于功能驱动的层编排机制对层进行分组;微观层面,基于重要性感知的层选择策略在组内剪枝,以构建设备专属子模型。此外,本文还提出一种细粒度变体,可独立剪枝多头注意力(MHA)和前馈网络(FFN)组件,从而精准保留关键结构元素。
Large Language Model-Based Automatic Formulation for Stochastic Optimization Models
本文首次对大型语言模型(LLMs,具体为ChatGPT)从自然语言描述中自动构建和求解随机优化问题的性能展开系统性整合研究。研究聚焦三大核心类别——联合机会约束模型、个体机会约束模型和两阶段随机线性规划(SLP-2),设计了多种提示策略,通过思维链和模块化推理引导ChatGPT完成结构化任务。本文提出了一种新的软评分指标,用于评估生成模型的结构质量和部分正确性,以解决传统标准准确性和基于执行的准确性评估方法的局限性。
Quantifying Language Disparities in Multilingual Large Language Models
大型多语言评估中报告的结果往往具有碎片化特征,且受目标语言、实验设置差异、模型选择等因素干扰。本文提出一套框架,可分离这些混淆变量,并引入三个可解释的指标——性能实现比(performancerealisationratio)、性能实现比的变异系数(itscoefficientofvariation)与语言潜力(languagepotential),从而更精细、更深入地量化(i)模型间与(ii)语言间的实际性能差异。
