Loading...

Advancing Large Language Models for Tibetan with Curated Data and Continual Pre-Training
本文针对藏语作为低资源语言在现有大语言模型中支持不足的问题,提出了一套涵盖数据构建、模型训练与评估的完整方案,旨在提升大语言模型的藏语处理能力。藏语预训练语料库构建:从开源数据集、大规模网页爬取、合成数据生成、私有数据四大来源收集藏语数据,通过定制化数据清洗与去重流程(包括语言过滤、质量过滤等),最终构建了72GB的高质量藏语语料库,为目前规模最大的藏语预训练数据。模型训练。

Fine-tuning Large Language Model for Automated Algorithm Design
本文聚焦于为自动算法设计(AutomatedAlgorithmDesign,AAD)任务微调大型语言模型(LLMs),旨在解决现有方法依赖通用LLMs导致的计算开销大、性能受限等问题。研究背景与问题:现有AAD方法多使用通用编码任务训练的现成LLMs,存在查询次数多、计算成本高、缺乏算法设计相关归纳偏差等局限,因此需探索专为算法设计定制的LLMs。方法设计提出多样性感知的基于排序(Diversity-AwareRank-based,DAR)采样策略。

Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling
当前主流文生图模型(FLUX.1-dev、Qwen-Image)基于Transformer+FlowMatching范式,生成画质提升的同时推理成本极高,1024×1024图单张推理可达数十秒。硬件/系统优化:量化、高效注意力,加速幅度有限;时序蒸馏:大幅减少采样步数,但需要额外训练,成本高;多分辨率加速:无训练、5倍以上提速,但主流方案在隐空间上采样,易产生模糊、伪影,且需要运行时动态识别图像区域。时序蒸馏、特征缓存等不依赖硬件的文生图扩散加速方案,无需定制算子与系统优化即可降低推理耗时。

Distilling Empathy from Large Language Models
本文聚焦于从大型语言模型(LLMs)向小型语言模型(SLMs)蒸馏共情能力的问题,旨在确保SLMs在保持高效性的同时,保留LLMs已具备的共情能力(这对人机交互频繁的资源受限场景至关重要)。两步微调流程:先通过有监督微调(SFT)让SLMs学习高共情响应,再通过基于直接偏好优化(DPO)的强化学习(RLHF),利用(低共情、高共情)响应对进一步优化,提升模型对共情细微差别的把握。三种共情蒸馏方法直接蒸馏:直接让LLMs生成共情响应作为训练数据;

First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
后训练量化(PTQ)为压缩大语言模型(LLMs)提供了一种高效方法,可显著降低内存访问和计算成本。现有基于补偿的权重校准方法通常依赖二阶泰勒展开来建模量化误差,其假设是在训练良好的全精度模型中一阶项可忽略。然而,我们发现,渐进式补偿过程会在潜在权重与其全精度对应项之间引入累积的一阶偏差,这使得上述假设从根本上不成立。为解决这一问题,我们提出FOEM,一种新的PTQ方法,它明确纳入一阶梯度项以改进量化误差补偿。

MLAR: Multi-layer Large Language Model-based Robotic Process Automation Applicant Tracking
本文介绍了一种创新的申请人跟踪系统(ATS),该系统通过一种新型机器人流程自动化(RPA)框架(进一步称为MLAR)得到增强。由于时间和资源限制,传统招聘流程常在简历筛选和候选人短名单生成环节遇到瓶颈。MLAR通过在三个不同层面应用大型语言模型(LLMs)解决这些挑战:第一层从职位描述中提取关键特征,第二层解析申请人简历以识别教育背景、工作经验和技能,第三层进行相似度匹配。然后,通过先进的语义算法对这些特征进行匹配,以高效识别最佳候选人。

ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning
大型语言模型(LLMs)已展现出卓越的生成能力。然而,它们易被滥用的特性引发了严重的安全担忧。尽管训练后安全对齐方法已被广泛采用,但LLMs仍易受恶意指令攻击,这些指令可能绕过安全约束。近期研究引入了推理时安全推理(系统2对齐),即LLMs在生成最终响应前通过推理过程进行安全验证。但我们发现,这些验证依赖随意的推理过程,与人类结构化推理逻辑(先识别用户真实意图,再基于真实意图评估风险)不一致。因此,这些防御方法仍难以抵御复杂的越狱指令——这类指令将有害目标隐藏在看似无害的语言中。

Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding
LLMs自然形成情感层级结构:随着模型规模增大(如Llama3.18B到405B),其内部会涌现出更复杂的情感层级树,且与人类心理学中的情感层级模型(如Shaver等人1987年提出的情感轮)的一致性更强。情感层级复杂度与识别能力相关:模型情感层级的几何特征(如路径长度、平均深度)可预测其情感识别准确率,层级越复杂,识别能力越强。LLMs存在系统性情感识别偏差。

DATE-LM: Benchmarking Data Attribution Evaluation for Large Language Models
本文介绍了,这是一个用于评估大型语言模型(LLMs)数据归因方法的统一基准套件。数据归因方法旨在量化训练数据样本对模型输出的影响,在数据集筛选、模型可解释性、数据估值等领域有重要应用。训练数据选择:评估归因方法在预训练和微调阶段筛选高质量数据的能力;毒性/偏见过滤:检测并过滤训练数据中可能导致模型产生有害输出的样本;事实归因:追溯模型输出中的事实性内容至训练数据中的支持证据。没有单一方法在所有任务中表现最优;数据归因方法与简单基线(如基于词汇或检索的方法)存在性能权衡;

Invariant-based Robust Weights Watermark for Large Language Models
缺失数据是现实世界数据集面临的关键挑战,会显著降低机器学习模型的性能。尽管大语言模型(LLMs)最近在表格数据插补中展现出卓越能力(如UnIMP等框架),但它们对经典嵌入方法的依赖往往限制了其捕捉复杂非线性相关性的能力,尤其是在包含数值、分类和文本特征的混合类型数据场景中。本文提出了Quantum-UnIMP,这是一种将浅层量子电路集成到基于LLMs的插补架构中的新型框架。我们的核心创新在于,用瞬时量子多项式(IQP)电路生成的量子特征映射替代传统的经典输入嵌入。

Program-as-Weights: A Programming Paradigm for Fuzzy Functions
许多日常编程任务难以通过简洁的基于规则的代码实现,例如对关键日志行触发告警、修复格式损坏的JSON、基于用户意图对搜索结果排序。如今开发者越来越多地将这类任务交给大语言模型API处理,但需要付出无法本地运行、结果不可复现、调用成本高昂的代价。本文提出模糊函数编程:将自然语言描述的任务需求编译为紧凑、可本地执行的神经网络构件。

Can Large Language Models Improve Phishing Defense? A Large-Scale Controlled Experiment on Warnin...
本文聚焦于大型语言模型(LLMs)在提升钓鱼防御中的应用,通过大规模对照实验评估LLM生成钓鱼警告解释的效果。研究背景为:传统钓鱼警告因解释模糊、内容静态,防御效果有限,而人工生成的解释虽有效但维护成本高、难以适应威胁变化。研究设计了包含750名参与者的组间实验,对比了人工生成的警告解释与两种LLM(Claude3.5Sonnet和Llama3.370B)生成的解释,且两种LLM均采用两种解释风格(基于特征和反事实)。LLM生成的解释效果与人工生成的相当,甚至更优(Claude表现尤为突出);

Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine ...
本文针对文档图像机器翻译(DIMT)任务中因训练数据有限、视觉与文本信息交互复杂导致的泛化能力不足问题,提出了一种名为M4Doc的单模态到混合模态对齐框架。该框架利用多模态大语言模型(MLLMs)的优势,通过训练阶段将仅图像编码器与MLLM的多模态表示对齐,使轻量级DIMT模型学习关键的视觉-文本关联;推理阶段则绕过MLLM,在保持计算效率的同时复用其多模态知识。实验表明,M4Doc在翻译质量上有显著提升,尤其在跨域泛化和复杂文档图像场景中表现优异。

Beyond the Surface: Probing the Ideological Depth of Large Language Models
大型语言模型(LLMs)已展现出显著的意识形态倾向,但其立场的稳定性与深度仍未得到充分理解。表面层次的响应常可通过简单的提示工程操纵,这使得人们质疑这些响应是否反映了连贯的潜在意识形态。本文探讨了LLMs中“意识形态深度”的概念,将其定义为模型内部政治表征的稳健性与复杂性。我们采用双路径方法展开研究:首先,通过指令提示和激活引导,测量两款知名开源LLMs的“可引导性”。研究发现,部分模型可轻松在自由派与保守派观点间切换,而另一些模型则表现出抗拒性或更高的拒绝率,这表明其存在更根深蒂固的意识形态结构。

Cultural Bias in Large Language Models: Evaluating AI Agents through Moral Questionnaires
本文聚焦大型语言模型(LLMs)中的文化偏见问题,通过在19个文化背景下应用《道德基础问卷(MFQ-2)》,系统评估了LLMs对不同文化道德框架的表征能力。LLMs未能有效呈现多样化的文化道德框架,反而系统性地同质化道德多样性,其生成的道德响应与人类直觉存在显著差距;模型规模(参数数量)的增加并未持续提升文化表征的准确性,部分小型模型(如Qwen2.57B)表现优于同系列大型模型;西方文化视角在LLMs中表征更优,而非西方视角(如日本)存在显著偏差;

SLIM: A Heterogeneous Accelerator for Edge Inference of Sparse Large Language Model via Adaptive ...
本文提出了一种名为SLIM的异构加速器,旨在解决资源受限的边缘设备上稀疏大语言模型(LLM)推理的效率问题。LLM虽在自然语言处理中表现卓越,但因其模型规模庞大、内存密集型操作(如前馈网络FFN和多头注意力MHA),在边缘设备上高效推理面临挑战。SLIM通过算法与硬件协同设计,充分利用LLM的稀疏性(推理中多数神经元未激活),仅处理激活的神经元以减少数据移动。算法层面:提出基于自适应阈值的高效推理算法,支持运行时可配置的稀疏性,且精度损失可忽略;硬件层面。

AICrypto: A Comprehensive Benchmark For Evaluating Cryptography Capabilities of Large Language Mo...
大型语言模型(LLMs)已在多个领域展现出卓越能力。然而,它们在作为网络安全基石的密码学领域的应用仍未得到充分探索。为填补这一空白,我们提出了AICrypto——首个旨在评估LLMs密码学能力的全面基准。该基准包含135道选择题、150个夺旗赛(CTF)挑战和18个证明题,覆盖从事实记忆到漏洞利用再到形式化推理的广泛技能。所有任务均由密码学专家仔细审核或构建,以确保正确性和严谨性。为支持CTF挑战的自动化评估,我们设计了一个基于代理的框架。

A Survey of Large Language Models in Discipline-specific Research: Challenges, Methods and Opport...
研究目标:探索LLMs适应特定学科需求的关键技术方法、分析其在数学、物理、化学、生物、人文社科等领域的实际应用、梳理跨学科协作中的挑战与机遇。技术方法:将LLMs的适配技术分为两类——内部知识优化(如持续预训练、监督微调、人类反馈强化学习)和外部交互协作(如提示工程、检索增强生成、智能体方法、工具集成),并对比了各类技术的优缺点及适用场景。学科应用。

Agentic Large Language Models for Conceptual Systems Engineering and Design
本文研究了基于大型语言模型(LLMs)的多智能体系统(MAS)在概念系统工程与设计中的应用,以太阳能水处理系统为目标案例,对比了九角色多智能体系统(MAS)与两智能体系统(2AS)的性能。核心方法:提出“设计状态图(DSG)”,一种JSON可序列化的图形表示,将需求、物理实现和基于Python的物理模型整合到节点中;通过实验对比MAS(九种角色分工)和2AS(生成器-反射器循环)在需求提取、功能分解、模拟器代码生成等任务中的表现。实验设置。

Automating Expert-Level Medical Reasoning Evaluation of Large Language Models
本文针对大型语言模型(LLMs)在临床决策中应用时的医学推理能力评估问题,提出了一套解决方案。MedThink-Bench基准数据集:包含500个复杂医学问题,覆盖10个医学领域(如病理学、诊断、治疗等),每个问题均由医学专家标注细粒度、分步的推理轨迹,模拟真实临床逻辑。LLM-w-Ref评估框架:结合专家精心设计的细粒度推理过程与“LLM作为评判者”(LLM-as-a-Judge)机制,实现对LLMs中间推理过程的自动化、可扩展评估,且评估结果与专家判断高度一致。实验发现。

欢迎留下您的脚印