Loading...
本文聚焦于软件开发中提交消息(commitmessages)的质量评估问题。提交消息是记录代码变更的关键文档,但实际中常存在质量不足(如空消息或信息不完整)的问题。尽管基于大型语言模型(LLMs)的自动提交消息生成技术已取得进展,但评估生成消息的质量仍面临挑战:传统基于参考文本的自动指标(如BLEU、ROUGE-L)存在局限性(如依赖文本相似度、无法处理语义等价但表达不同的消息),而人类评估虽准确却耗时耗力、可扩展性差。
Using Large Language Models for Legal Decision-Making in Austrian Value-Added Tax Law: An Experim...
本文通过实验评估了大型语言模型(LLMs)在奥地利及欧盟增值税(VAT)法框架下辅助法律决策的能力。研究聚焦于两种提升LLM性能的方法——微调(fine-tuning)和检索增强生成(RAG),并在两类案例中进行验证:一是权威教科书案例,二是税务咨询公司的真实案例。研究的核心目标是确定基于LLM的系统的最佳配置,并评估其法律推理能力。实验结果表明,经过适当配置的LLMs能够有效支持税务专业人员处理增值税任务,提供有法律依据的决策理由,尤其在自动化常规任务和提供初步分析方面潜力显著。
Understanding Driving Risks using Large Language Models: Toward Elderly Driver Assessment
本文研究了多模态大语言模型(具体为ChatGPT-4o)利用静态行车记录仪图像进行类人交通场景解读的潜力,重点聚焦与老年司机评估相关的三项任务:交通密度评估、交叉口可见性评估和停车标志识别。这些任务需上下文推理而非简单目标检测。研究采用零样本、少样本和多样本提示策略,以人类标注为基准,通过精确率、召回率和F1分数评估模型性能。结果显示,提示设计对模型性能影响显著:交叉口可见性的召回率从零样本的21.7%提升至多样本的57.0%;交通密度的一致性从53.5%提升至67.6%;
Leveraging Large Language Models for Classifying App Users‘ Feedback
本文聚焦于利用大型语言模型(LLMs)解决应用用户反馈分类的挑战,传统方法依赖有监督机器学习,但受限于标注数据集的规模和质量。LLMs在用户反馈分类中的基础能力:在零样本设置下,LLMs对不同来源(应用商店、X平台、论坛)和分类方案的用户反馈进行分类,结果显示其在粗粒度分类(如“bug报告”“功能请求”“其他”)中表现较好,但细粒度分类效果不佳。粗粒度分类方案的影响:将数据集统一为“bug报告”“功能请求”“其他”的粗粒度方案后,LLMs的分类准确性显著提升,尤其在应用商店数据集上;
Lizard: An Efficient Linearization Framework for Large Language Models
我们提出了Lizard,这是一种线性化框架,可将基于Transformer的预训练大型语言模型(LLMs)转化为灵活的亚二次架构,用于无限上下文生成。基于Transformer的LLMs在上下文长度增加时面临显著的内存和计算瓶颈,这源于softmax注意力的二次复杂度以及键值(KV)缓存的增长。Lizard通过引入一种亚二次注意力机制解决了这些限制,该机制在保留输出质量的同时,能够紧密逼近softmax注意力。
Advancing Large Language Models for Tibetan with Curated Data and Continual Pre-Training
本文针对藏语作为低资源语言在现有大语言模型中支持不足的问题,提出了一套涵盖数据构建、模型训练与评估的完整方案,旨在提升大语言模型的藏语处理能力。藏语预训练语料库构建:从开源数据集、大规模网页爬取、合成数据生成、私有数据四大来源收集藏语数据,通过定制化数据清洗与去重流程(包括语言过滤、质量过滤等),最终构建了72GB的高质量藏语语料库,为目前规模最大的藏语预训练数据。模型训练。
Fine-tuning Large Language Model for Automated Algorithm Design
本文聚焦于为自动算法设计(AutomatedAlgorithmDesign,AAD)任务微调大型语言模型(LLMs),旨在解决现有方法依赖通用LLMs导致的计算开销大、性能受限等问题。研究背景与问题:现有AAD方法多使用通用编码任务训练的现成LLMs,存在查询次数多、计算成本高、缺乏算法设计相关归纳偏差等局限,因此需探索专为算法设计定制的LLMs。方法设计提出多样性感知的基于排序(Diversity-AwareRank-based,DAR)采样策略。
Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling
当前主流文生图模型(FLUX.1-dev、Qwen-Image)基于Transformer+FlowMatching范式,生成画质提升的同时推理成本极高,1024×1024图单张推理可达数十秒。硬件/系统优化:量化、高效注意力,加速幅度有限;时序蒸馏:大幅减少采样步数,但需要额外训练,成本高;多分辨率加速:无训练、5倍以上提速,但主流方案在隐空间上采样,易产生模糊、伪影,且需要运行时动态识别图像区域。时序蒸馏、特征缓存等不依赖硬件的文生图扩散加速方案,无需定制算子与系统优化即可降低推理耗时。
Distilling Empathy from Large Language Models
本文聚焦于从大型语言模型(LLMs)向小型语言模型(SLMs)蒸馏共情能力的问题,旨在确保SLMs在保持高效性的同时,保留LLMs已具备的共情能力(这对人机交互频繁的资源受限场景至关重要)。两步微调流程:先通过有监督微调(SFT)让SLMs学习高共情响应,再通过基于直接偏好优化(DPO)的强化学习(RLHF),利用(低共情、高共情)响应对进一步优化,提升模型对共情细微差别的把握。三种共情蒸馏方法直接蒸馏:直接让LLMs生成共情响应作为训练数据;
First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
后训练量化(PTQ)为压缩大语言模型(LLMs)提供了一种高效方法,可显著降低内存访问和计算成本。现有基于补偿的权重校准方法通常依赖二阶泰勒展开来建模量化误差,其假设是在训练良好的全精度模型中一阶项可忽略。然而,我们发现,渐进式补偿过程会在潜在权重与其全精度对应项之间引入累积的一阶偏差,这使得上述假设从根本上不成立。为解决这一问题,我们提出FOEM,一种新的PTQ方法,它明确纳入一阶梯度项以改进量化误差补偿。
MLAR: Multi-layer Large Language Model-based Robotic Process Automation Applicant Tracking
本文介绍了一种创新的申请人跟踪系统(ATS),该系统通过一种新型机器人流程自动化(RPA)框架(进一步称为MLAR)得到增强。由于时间和资源限制,传统招聘流程常在简历筛选和候选人短名单生成环节遇到瓶颈。MLAR通过在三个不同层面应用大型语言模型(LLMs)解决这些挑战:第一层从职位描述中提取关键特征,第二层解析申请人简历以识别教育背景、工作经验和技能,第三层进行相似度匹配。然后,通过先进的语义算法对这些特征进行匹配,以高效识别最佳候选人。
ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning
大型语言模型(LLMs)已展现出卓越的生成能力。然而,它们易被滥用的特性引发了严重的安全担忧。尽管训练后安全对齐方法已被广泛采用,但LLMs仍易受恶意指令攻击,这些指令可能绕过安全约束。近期研究引入了推理时安全推理(系统2对齐),即LLMs在生成最终响应前通过推理过程进行安全验证。但我们发现,这些验证依赖随意的推理过程,与人类结构化推理逻辑(先识别用户真实意图,再基于真实意图评估风险)不一致。因此,这些防御方法仍难以抵御复杂的越狱指令——这类指令将有害目标隐藏在看似无害的语言中。
Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding
LLMs自然形成情感层级结构:随着模型规模增大(如Llama3.18B到405B),其内部会涌现出更复杂的情感层级树,且与人类心理学中的情感层级模型(如Shaver等人1987年提出的情感轮)的一致性更强。情感层级复杂度与识别能力相关:模型情感层级的几何特征(如路径长度、平均深度)可预测其情感识别准确率,层级越复杂,识别能力越强。LLMs存在系统性情感识别偏差。
DATE-LM: Benchmarking Data Attribution Evaluation for Large Language Models
本文介绍了,这是一个用于评估大型语言模型(LLMs)数据归因方法的统一基准套件。数据归因方法旨在量化训练数据样本对模型输出的影响,在数据集筛选、模型可解释性、数据估值等领域有重要应用。训练数据选择:评估归因方法在预训练和微调阶段筛选高质量数据的能力;毒性/偏见过滤:检测并过滤训练数据中可能导致模型产生有害输出的样本;事实归因:追溯模型输出中的事实性内容至训练数据中的支持证据。没有单一方法在所有任务中表现最优;数据归因方法与简单基线(如基于词汇或检索的方法)存在性能权衡;
Invariant-based Robust Weights Watermark for Large Language Models
缺失数据是现实世界数据集面临的关键挑战,会显著降低机器学习模型的性能。尽管大语言模型(LLMs)最近在表格数据插补中展现出卓越能力(如UnIMP等框架),但它们对经典嵌入方法的依赖往往限制了其捕捉复杂非线性相关性的能力,尤其是在包含数值、分类和文本特征的混合类型数据场景中。本文提出了Quantum-UnIMP,这是一种将浅层量子电路集成到基于LLMs的插补架构中的新型框架。我们的核心创新在于,用瞬时量子多项式(IQP)电路生成的量子特征映射替代传统的经典输入嵌入。
Program-as-Weights: A Programming Paradigm for Fuzzy Functions
许多日常编程任务难以通过简洁的基于规则的代码实现,例如对关键日志行触发告警、修复格式损坏的JSON、基于用户意图对搜索结果排序。如今开发者越来越多地将这类任务交给大语言模型API处理,但需要付出无法本地运行、结果不可复现、调用成本高昂的代价。本文提出模糊函数编程:将自然语言描述的任务需求编译为紧凑、可本地执行的神经网络构件。
Can Large Language Models Improve Phishing Defense? A Large-Scale Controlled Experiment on Warnin...
本文聚焦于大型语言模型(LLMs)在提升钓鱼防御中的应用,通过大规模对照实验评估LLM生成钓鱼警告解释的效果。研究背景为:传统钓鱼警告因解释模糊、内容静态,防御效果有限,而人工生成的解释虽有效但维护成本高、难以适应威胁变化。研究设计了包含750名参与者的组间实验,对比了人工生成的警告解释与两种LLM(Claude3.5Sonnet和Llama3.370B)生成的解释,且两种LLM均采用两种解释风格(基于特征和反事实)。LLM生成的解释效果与人工生成的相当,甚至更优(Claude表现尤为突出);
Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine ...
本文针对文档图像机器翻译(DIMT)任务中因训练数据有限、视觉与文本信息交互复杂导致的泛化能力不足问题,提出了一种名为M4Doc的单模态到混合模态对齐框架。该框架利用多模态大语言模型(MLLMs)的优势,通过训练阶段将仅图像编码器与MLLM的多模态表示对齐,使轻量级DIMT模型学习关键的视觉-文本关联;推理阶段则绕过MLLM,在保持计算效率的同时复用其多模态知识。实验表明,M4Doc在翻译质量上有显著提升,尤其在跨域泛化和复杂文档图像场景中表现优异。
Beyond the Surface: Probing the Ideological Depth of Large Language Models
大型语言模型(LLMs)已展现出显著的意识形态倾向,但其立场的稳定性与深度仍未得到充分理解。表面层次的响应常可通过简单的提示工程操纵,这使得人们质疑这些响应是否反映了连贯的潜在意识形态。本文探讨了LLMs中“意识形态深度”的概念,将其定义为模型内部政治表征的稳健性与复杂性。我们采用双路径方法展开研究:首先,通过指令提示和激活引导,测量两款知名开源LLMs的“可引导性”。研究发现,部分模型可轻松在自由派与保守派观点间切换,而另一些模型则表现出抗拒性或更高的拒绝率,这表明其存在更根深蒂固的意识形态结构。
Cultural Bias in Large Language Models: Evaluating AI Agents through Moral Questionnaires
本文聚焦大型语言模型(LLMs)中的文化偏见问题,通过在19个文化背景下应用《道德基础问卷(MFQ-2)》,系统评估了LLMs对不同文化道德框架的表征能力。LLMs未能有效呈现多样化的文化道德框架,反而系统性地同质化道德多样性,其生成的道德响应与人类直觉存在显著差距;模型规模(参数数量)的增加并未持续提升文化表征的准确性,部分小型模型(如Qwen2.57B)表现优于同系列大型模型;西方文化视角在LLMs中表征更优,而非西方视角(如日本)存在显著偏差;
