Loading...

First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
后训练量化(PTQ)为压缩大语言模型(LLMs)提供了一种高效方法,可显著降低内存访问和计算成本。现有基于补偿的权重校准方法通常依赖二阶泰勒展开来建模量化误差,其假设是在训练良好的全精度模型中一阶项可忽略。然而,我们发现,渐进式补偿过程会在潜在权重与其全精度对应项之间引入累积的一阶偏差,这使得上述假设从根本上不成立。为解决这一问题,我们提出FOEM,一种新的PTQ方法,它明确纳入一阶梯度项以改进量化误差补偿。

MLAR: Multi-layer Large Language Model-based Robotic Process Automation Applicant Tracking
本文介绍了一种创新的申请人跟踪系统(ATS),该系统通过一种新型机器人流程自动化(RPA)框架(进一步称为MLAR)得到增强。由于时间和资源限制,传统招聘流程常在简历筛选和候选人短名单生成环节遇到瓶颈。MLAR通过在三个不同层面应用大型语言模型(LLMs)解决这些挑战:第一层从职位描述中提取关键特征,第二层解析申请人简历以识别教育背景、工作经验和技能,第三层进行相似度匹配。然后,通过先进的语义算法对这些特征进行匹配,以高效识别最佳候选人。

ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning
大型语言模型(LLMs)已展现出卓越的生成能力。然而,它们易被滥用的特性引发了严重的安全担忧。尽管训练后安全对齐方法已被广泛采用,但LLMs仍易受恶意指令攻击,这些指令可能绕过安全约束。近期研究引入了推理时安全推理(系统2对齐),即LLMs在生成最终响应前通过推理过程进行安全验证。但我们发现,这些验证依赖随意的推理过程,与人类结构化推理逻辑(先识别用户真实意图,再基于真实意图评估风险)不一致。因此,这些防御方法仍难以抵御复杂的越狱指令——这类指令将有害目标隐藏在看似无害的语言中。

Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding
LLMs自然形成情感层级结构:随着模型规模增大(如Llama3.18B到405B),其内部会涌现出更复杂的情感层级树,且与人类心理学中的情感层级模型(如Shaver等人1987年提出的情感轮)的一致性更强。情感层级复杂度与识别能力相关:模型情感层级的几何特征(如路径长度、平均深度)可预测其情感识别准确率,层级越复杂,识别能力越强。LLMs存在系统性情感识别偏差。

DATE-LM: Benchmarking Data Attribution Evaluation for Large Language Models
本文介绍了,这是一个用于评估大型语言模型(LLMs)数据归因方法的统一基准套件。数据归因方法旨在量化训练数据样本对模型输出的影响,在数据集筛选、模型可解释性、数据估值等领域有重要应用。训练数据选择:评估归因方法在预训练和微调阶段筛选高质量数据的能力;毒性/偏见过滤:检测并过滤训练数据中可能导致模型产生有害输出的样本;事实归因:追溯模型输出中的事实性内容至训练数据中的支持证据。没有单一方法在所有任务中表现最优;数据归因方法与简单基线(如基于词汇或检索的方法)存在性能权衡;

Invariant-based Robust Weights Watermark for Large Language Models
缺失数据是现实世界数据集面临的关键挑战,会显著降低机器学习模型的性能。尽管大语言模型(LLMs)最近在表格数据插补中展现出卓越能力(如UnIMP等框架),但它们对经典嵌入方法的依赖往往限制了其捕捉复杂非线性相关性的能力,尤其是在包含数值、分类和文本特征的混合类型数据场景中。本文提出了Quantum-UnIMP,这是一种将浅层量子电路集成到基于LLMs的插补架构中的新型框架。我们的核心创新在于,用瞬时量子多项式(IQP)电路生成的量子特征映射替代传统的经典输入嵌入。

Program-as-Weights: A Programming Paradigm for Fuzzy Functions
许多日常编程任务难以通过简洁的基于规则的代码实现,例如对关键日志行触发告警、修复格式损坏的JSON、基于用户意图对搜索结果排序。如今开发者越来越多地将这类任务交给大语言模型API处理,但需要付出无法本地运行、结果不可复现、调用成本高昂的代价。本文提出模糊函数编程:将自然语言描述的任务需求编译为紧凑、可本地执行的神经网络构件。

Can Large Language Models Improve Phishing Defense? A Large-Scale Controlled Experiment on Warnin...
本文聚焦于大型语言模型(LLMs)在提升钓鱼防御中的应用,通过大规模对照实验评估LLM生成钓鱼警告解释的效果。研究背景为:传统钓鱼警告因解释模糊、内容静态,防御效果有限,而人工生成的解释虽有效但维护成本高、难以适应威胁变化。研究设计了包含750名参与者的组间实验,对比了人工生成的警告解释与两种LLM(Claude3.5Sonnet和Llama3.370B)生成的解释,且两种LLM均采用两种解释风格(基于特征和反事实)。LLM生成的解释效果与人工生成的相当,甚至更优(Claude表现尤为突出);

Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine ...
本文针对文档图像机器翻译(DIMT)任务中因训练数据有限、视觉与文本信息交互复杂导致的泛化能力不足问题,提出了一种名为M4Doc的单模态到混合模态对齐框架。该框架利用多模态大语言模型(MLLMs)的优势,通过训练阶段将仅图像编码器与MLLM的多模态表示对齐,使轻量级DIMT模型学习关键的视觉-文本关联;推理阶段则绕过MLLM,在保持计算效率的同时复用其多模态知识。实验表明,M4Doc在翻译质量上有显著提升,尤其在跨域泛化和复杂文档图像场景中表现优异。

Beyond the Surface: Probing the Ideological Depth of Large Language Models
大型语言模型(LLMs)已展现出显著的意识形态倾向,但其立场的稳定性与深度仍未得到充分理解。表面层次的响应常可通过简单的提示工程操纵,这使得人们质疑这些响应是否反映了连贯的潜在意识形态。本文探讨了LLMs中“意识形态深度”的概念,将其定义为模型内部政治表征的稳健性与复杂性。我们采用双路径方法展开研究:首先,通过指令提示和激活引导,测量两款知名开源LLMs的“可引导性”。研究发现,部分模型可轻松在自由派与保守派观点间切换,而另一些模型则表现出抗拒性或更高的拒绝率,这表明其存在更根深蒂固的意识形态结构。

Cultural Bias in Large Language Models: Evaluating AI Agents through Moral Questionnaires
本文聚焦大型语言模型(LLMs)中的文化偏见问题,通过在19个文化背景下应用《道德基础问卷(MFQ-2)》,系统评估了LLMs对不同文化道德框架的表征能力。LLMs未能有效呈现多样化的文化道德框架,反而系统性地同质化道德多样性,其生成的道德响应与人类直觉存在显著差距;模型规模(参数数量)的增加并未持续提升文化表征的准确性,部分小型模型(如Qwen2.57B)表现优于同系列大型模型;西方文化视角在LLMs中表征更优,而非西方视角(如日本)存在显著偏差;

SLIM: A Heterogeneous Accelerator for Edge Inference of Sparse Large Language Model via Adaptive ...
本文提出了一种名为SLIM的异构加速器,旨在解决资源受限的边缘设备上稀疏大语言模型(LLM)推理的效率问题。LLM虽在自然语言处理中表现卓越,但因其模型规模庞大、内存密集型操作(如前馈网络FFN和多头注意力MHA),在边缘设备上高效推理面临挑战。SLIM通过算法与硬件协同设计,充分利用LLM的稀疏性(推理中多数神经元未激活),仅处理激活的神经元以减少数据移动。算法层面:提出基于自适应阈值的高效推理算法,支持运行时可配置的稀疏性,且精度损失可忽略;硬件层面。

AICrypto: A Comprehensive Benchmark For Evaluating Cryptography Capabilities of Large Language Mo...
大型语言模型(LLMs)已在多个领域展现出卓越能力。然而,它们在作为网络安全基石的密码学领域的应用仍未得到充分探索。为填补这一空白,我们提出了AICrypto——首个旨在评估LLMs密码学能力的全面基准。该基准包含135道选择题、150个夺旗赛(CTF)挑战和18个证明题,覆盖从事实记忆到漏洞利用再到形式化推理的广泛技能。所有任务均由密码学专家仔细审核或构建,以确保正确性和严谨性。为支持CTF挑战的自动化评估,我们设计了一个基于代理的框架。

A Survey of Large Language Models in Discipline-specific Research: Challenges, Methods and Opport...
研究目标:探索LLMs适应特定学科需求的关键技术方法、分析其在数学、物理、化学、生物、人文社科等领域的实际应用、梳理跨学科协作中的挑战与机遇。技术方法:将LLMs的适配技术分为两类——内部知识优化(如持续预训练、监督微调、人类反馈强化学习)和外部交互协作(如提示工程、检索增强生成、智能体方法、工具集成),并对比了各类技术的优缺点及适用场景。学科应用。

Agentic Large Language Models for Conceptual Systems Engineering and Design
本文研究了基于大型语言模型(LLMs)的多智能体系统(MAS)在概念系统工程与设计中的应用,以太阳能水处理系统为目标案例,对比了九角色多智能体系统(MAS)与两智能体系统(2AS)的性能。核心方法:提出“设计状态图(DSG)”,一种JSON可序列化的图形表示,将需求、物理实现和基于Python的物理模型整合到节点中;通过实验对比MAS(九种角色分工)和2AS(生成器-反射器循环)在需求提取、功能分解、模拟器代码生成等任务中的表现。实验设置。

Automating Expert-Level Medical Reasoning Evaluation of Large Language Models
本文针对大型语言模型(LLMs)在临床决策中应用时的医学推理能力评估问题,提出了一套解决方案。MedThink-Bench基准数据集:包含500个复杂医学问题,覆盖10个医学领域(如病理学、诊断、治疗等),每个问题均由医学专家标注细粒度、分步的推理轨迹,模拟真实临床逻辑。LLM-w-Ref评估框架:结合专家精心设计的细粒度推理过程与“LLM作为评判者”(LLM-as-a-Judge)机制,实现对LLMs中间推理过程的自动化、可扩展评估,且评估结果与专家判断高度一致。实验发现。

Geospatial Question Answering on Historical Maps Using Spatio-Temporal Knowledge Graphs and Large...
近年来的技术进步已实现从数字历史地图中提取矢量化特征。然而,要充分利用这些信息,提取出的特征必须以结构化且有意义的方式组织,以支持高效的访问和使用。问答(QA)是一种很有前景的方法,它能让用户(尤其是不熟悉数据库查询语言的用户)以自然、直观的方式获取知识。在本研究项目中,我们通过整合从历史地图数据构建的时空知识图谱(KG)与大语言模型(LLM),开发了一个地理空间问答(GeoQA)系统。具体而言,我们定义了用于指导时空知识图谱构建的本体,并研究了事实型和描述型这两种不同类型地理空间问答的工作流程。

EconAgentic in DePIN Markets: A Large Language Model Approach to the Sharing Economy of Decentral...
去中心化物理基础设施(DePIN)市场正通过代币经济和治理去中心化运营的智能合约革新共享经济。截至2024年,DePIN项目市值已突破100亿美元,彰显其快速增长态势。然而,这类市场的无监管属性,加之智能合约中人工智能(AI)代理的自主部署,引发了效率低下、可能与人类价值观偏离等风险。为应对这些问题,本文提出EconAgentic框架——一种基于大语言模型(LLM)的解决方案,旨在缓解上述挑战。本研究聚焦三大核心领域:1)构建DePIN市场动态演化模型;2)评估利益相关者行为及其经济影响;

Large Language Models and Non-Negative Matrix Factorization for Bioacoustic Signal Decomposition
本文提出了一种结合大型语言模型(LLMs)和非负矩阵分解(NMF)的生物声学信号分析框架,旨在解决临床记录中生物声学信号(如心肺信号)重叠导致的分离与解读难题。研究背景:传统信号分离技术依赖专家解读,在嘈杂环境中可靠性低;NMF作为无监督盲源分离方法,可将复杂信号分解为可解释的成分,但缺乏临床意义关联能力。方法设计数据采集:使用数字听诊器在临床人体模型上获取受控的心肺重叠信号;信号分解:通过短时傅里叶变换(STFT)将信号转换为时空表示,再用NMF分解为混合矩阵(W)和源信号矩阵(H);

Prompt4Trust: A Reinforcement Learning Prompt Augmentation Framework for Clinically-Aligned Confi...
多模态大型语言模型(MLLMs)在医疗健康领域的应用具有巨大潜力。然而,它们在安全关键场景中的部署受到两个关键限制的阻碍:(i)对提示设计的敏感性;(ii)倾向于生成高置信度的错误响应。由于临床医生可能依赖模型声明的置信度来评估其预测的可靠性,因此当模型表达高置信度时,其准确性也必须很高,这一点尤为重要。我们提出了Prompt4Trust,这是首个针对MLLMs置信度校准的强化学习(RL)提示增强框架。

欢迎留下您的脚印