Loading...

LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
近年来,大型语言模型(LLMs)的进展激发了人们对众多应用的兴趣,这些应用需要强大的长程能力,这对处理大量输入上下文和持续生成扩展输出至关重要。随着序列长度的增加,LLMs中的键值(KV)对数量激增,形成了显著的效率瓶颈。在本文中,我们提出了一种新的KV缓存优化范式LaCache,这是一种无需训练的方法,用于LLMs的高效且准确的生成式推理。LaCache使LLMs能够同时解决长程建模中的两个关键挑战:强大的长程能力,以及无需担心内存不足(OOM)的连续生成。

Fusing Large Language Models with Temporal Transformers for Time Series Forecasting
近年来,大型语言模型(LLMs)在各类任务中展现出强大能力,因此近期研究将其应用于时间序列预测(TSF)任务——即根据给定的历史时间序列预测未来值。现有的基于LLM的方法通过提示或微调策略,将从文本数据中学习到的知识迁移到时间序列预测中。然而,LLMs擅长对离散token和语义模式进行推理,但最初并非为建模连续数值时间序列数据而设计。文本与时间序列数据之间的差异导致LLMs的性能不如直接在TSF数据上训练的vanillaTransformer模型。

EV-STLLM: Electric vehicle charging forecasting based on spatio-temporal large language models wi...
本文提出了一种基于时空大语言模型(LLM)的电动汽车(EV)充电预测框架EV-STLLM,旨在解决现有模型在捕捉复杂时空依赖关系、处理大规模数据分布以及融合多维度信息方面的局限性。数据处理模块采用变分模态分解(VMD)进行数据去噪,去除高频白噪声;结合改进的自适应噪声完备集合经验模态分解(ICEEMDAN)进行多频率分解,将信号分为高、中、低频分量;通过模糊信息粒化(FIG)提取多尺度信息(如日、周粒度),保留短期波动和长期趋势;利用ReliefF算法进行特征选择,减少冗余特征,增强模型效率。

FaceLLM: A Multimodal Large Language Model for Face Understanding
多模态大语言模型(MLLMs)在视觉-语言任务中已展现出卓越性能。然而,现有MLLMs主要在通用数据集上训练,限制了它们对特定领域视觉线索(如人脸图像中的线索)的推理能力。特别是,由于缺乏大规模带标注的人脸图像-文本数据集,MLLMs在需要详细理解面部结构、表情、情绪和人口统计学特征的任务中仍未得到充分探索。在本研究中,我们提出了FaceLLM,这是一种专为人脸图像理解训练的多模态大语言模型。

Towards Practical Benchmarking of Data Cleaning Techniques: On Generating Authentic Errors via La...
本文聚焦于数据驱动系统中的数据质量问题,针对现有表格数据错误生成方法(如规则驱动的BART)存在的错误模式单一、与真实错误分布差异大等局限,提出了一种基于大型语言模型(LLMs)的表格错误生成框架TableEG。指令微调:利用真实错误标注数据对LLM进行微调,使模型学习真实错误的分布特征;任务增强:设计多样化任务模板(如错误生成、检测、修正),增强模型对表格二维结构和行列依赖关系的理解;三元组表示(I,T,O)

Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
上海人工智能实验室Agents-A1团队本文提出Agents-A1,一款35B混合专家智能体模型。该模型通过拓展智能体任务视界,达到万亿参数大模型的性能水平。我们从两个维度研究智能体视界缩放技术:拉长长时序交互轨迹、融合异构智能体能力。为支撑该技术路线,我们搭建一套长时序知识-动作基础设施,打通外部知识、智能体动作、环境观测与校验结果,生成平均长度达45000token的智能体交互轨迹。

ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Lang...
本文聚焦视频多模态大语言模型(VideoMLLMs)的主动交互能力,针对现有评估基准和指标的不足,提出了首个综合基准和新型评估指标。背景:随着视频多模态大语言模型的发展,用户对模型的主动交互能力(如在视频播放中自主决定响应时机)需求增加,但现有基准多基于离线或在线交互(依赖用户触发),且缺乏考虑时间动态的评估指标。ProactiveVideoQA基准。

DOPD: Dual On-policy Distillation
在线策略蒸馏(OPD)通过使用稠密的逐Token信号监督学生模型采样得到的轨迹,实现更优质的能力迁移。为获取高质量监督源、进一步突破蒸馏性能上限,一种直观思路是为教师或学生模型引入特权信息。但这类额外输入会引发一种我们命名为特权错觉的失效问题:该现象会混淆两类完全不同的性能差距——一类是学生需要通过蒸馏弥补的可迁移能力差距,另一类是仅能模仿、却永远无法复刻的信息不对称差距。加之逐Token监督天然存在分布不均的特性,仅有少量Token承载关键能力信号,该问题会被进一步放大。

Diagnosing Failures in Large Language Models‘ Answers: Integrating Error Attribution into Evaluat...
构建错误归因框架(MisattributionFramework):包含6个一级类别(响应质量、指令遵循、知识能力、推理能力、安全性、其他错误)和15个二级类别,系统梳理了LLMs常见错误类型。创建归因数据集(AttriData):基于上述框架,人工标注了21,702条样本,涵盖分数、错误归因和反馈信息,涵盖NLP基础、数学、推理等多类任务,兼顾基础与进阶能力评估。提出错误归因模型(MisAttributionLLM)

Evaluating Generated Commit Messages with Large Language Models
本文聚焦于软件开发中提交消息(commitmessages)的质量评估问题。提交消息是记录代码变更的关键文档,但实际中常存在质量不足(如空消息或信息不完整)的问题。尽管基于大型语言模型(LLMs)的自动提交消息生成技术已取得进展,但评估生成消息的质量仍面临挑战:传统基于参考文本的自动指标(如BLEU、ROUGE-L)存在局限性(如依赖文本相似度、无法处理语义等价但表达不同的消息),而人类评估虽准确却耗时耗力、可扩展性差。

Using Large Language Models for Legal Decision-Making in Austrian Value-Added Tax Law: An Experim...
本文通过实验评估了大型语言模型(LLMs)在奥地利及欧盟增值税(VAT)法框架下辅助法律决策的能力。研究聚焦于两种提升LLM性能的方法——微调(fine-tuning)和检索增强生成(RAG),并在两类案例中进行验证:一是权威教科书案例,二是税务咨询公司的真实案例。研究的核心目标是确定基于LLM的系统的最佳配置,并评估其法律推理能力。实验结果表明,经过适当配置的LLMs能够有效支持税务专业人员处理增值税任务,提供有法律依据的决策理由,尤其在自动化常规任务和提供初步分析方面潜力显著。

Understanding Driving Risks using Large Language Models: Toward Elderly Driver Assessment
本文研究了多模态大语言模型(具体为ChatGPT-4o)利用静态行车记录仪图像进行类人交通场景解读的潜力,重点聚焦与老年司机评估相关的三项任务:交通密度评估、交叉口可见性评估和停车标志识别。这些任务需上下文推理而非简单目标检测。研究采用零样本、少样本和多样本提示策略,以人类标注为基准,通过精确率、召回率和F1分数评估模型性能。结果显示,提示设计对模型性能影响显著:交叉口可见性的召回率从零样本的21.7%提升至多样本的57.0%;交通密度的一致性从53.5%提升至67.6%;

Leveraging Large Language Models for Classifying App Users‘ Feedback
本文聚焦于利用大型语言模型(LLMs)解决应用用户反馈分类的挑战,传统方法依赖有监督机器学习,但受限于标注数据集的规模和质量。LLMs在用户反馈分类中的基础能力:在零样本设置下,LLMs对不同来源(应用商店、X平台、论坛)和分类方案的用户反馈进行分类,结果显示其在粗粒度分类(如“bug报告”“功能请求”“其他”)中表现较好,但细粒度分类效果不佳。粗粒度分类方案的影响:将数据集统一为“bug报告”“功能请求”“其他”的粗粒度方案后,LLMs的分类准确性显著提升,尤其在应用商店数据集上;

Lizard: An Efficient Linearization Framework for Large Language Models
我们提出了Lizard,这是一种线性化框架,可将基于Transformer的预训练大型语言模型(LLMs)转化为灵活的亚二次架构,用于无限上下文生成。基于Transformer的LLMs在上下文长度增加时面临显著的内存和计算瓶颈,这源于softmax注意力的二次复杂度以及键值(KV)缓存的增长。Lizard通过引入一种亚二次注意力机制解决了这些限制,该机制在保留输出质量的同时,能够紧密逼近softmax注意力。

Advancing Large Language Models for Tibetan with Curated Data and Continual Pre-Training
本文针对藏语作为低资源语言在现有大语言模型中支持不足的问题,提出了一套涵盖数据构建、模型训练与评估的完整方案,旨在提升大语言模型的藏语处理能力。藏语预训练语料库构建:从开源数据集、大规模网页爬取、合成数据生成、私有数据四大来源收集藏语数据,通过定制化数据清洗与去重流程(包括语言过滤、质量过滤等),最终构建了72GB的高质量藏语语料库,为目前规模最大的藏语预训练数据。模型训练。

Fine-tuning Large Language Model for Automated Algorithm Design
本文聚焦于为自动算法设计(AutomatedAlgorithmDesign,AAD)任务微调大型语言模型(LLMs),旨在解决现有方法依赖通用LLMs导致的计算开销大、性能受限等问题。研究背景与问题:现有AAD方法多使用通用编码任务训练的现成LLMs,存在查询次数多、计算成本高、缺乏算法设计相关归纳偏差等局限,因此需探索专为算法设计定制的LLMs。方法设计提出多样性感知的基于排序(Diversity-AwareRank-based,DAR)采样策略。

Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling
当前主流文生图模型(FLUX.1-dev、Qwen-Image)基于Transformer+FlowMatching范式,生成画质提升的同时推理成本极高,1024×1024图单张推理可达数十秒。硬件/系统优化:量化、高效注意力,加速幅度有限;时序蒸馏:大幅减少采样步数,但需要额外训练,成本高;多分辨率加速:无训练、5倍以上提速,但主流方案在隐空间上采样,易产生模糊、伪影,且需要运行时动态识别图像区域。时序蒸馏、特征缓存等不依赖硬件的文生图扩散加速方案,无需定制算子与系统优化即可降低推理耗时。

Distilling Empathy from Large Language Models
本文聚焦于从大型语言模型(LLMs)向小型语言模型(SLMs)蒸馏共情能力的问题,旨在确保SLMs在保持高效性的同时,保留LLMs已具备的共情能力(这对人机交互频繁的资源受限场景至关重要)。两步微调流程:先通过有监督微调(SFT)让SLMs学习高共情响应,再通过基于直接偏好优化(DPO)的强化学习(RLHF),利用(低共情、高共情)响应对进一步优化,提升模型对共情细微差别的把握。三种共情蒸馏方法直接蒸馏:直接让LLMs生成共情响应作为训练数据;

First-Order Error Matters: Accurate Compensation for Quantized Large Language Models
后训练量化(PTQ)为压缩大语言模型(LLMs)提供了一种高效方法,可显著降低内存访问和计算成本。现有基于补偿的权重校准方法通常依赖二阶泰勒展开来建模量化误差,其假设是在训练良好的全精度模型中一阶项可忽略。然而,我们发现,渐进式补偿过程会在潜在权重与其全精度对应项之间引入累积的一阶偏差,这使得上述假设从根本上不成立。为解决这一问题,我们提出FOEM,一种新的PTQ方法,它明确纳入一阶梯度项以改进量化误差补偿。

MLAR: Multi-layer Large Language Model-based Robotic Process Automation Applicant Tracking
本文介绍了一种创新的申请人跟踪系统(ATS),该系统通过一种新型机器人流程自动化(RPA)框架(进一步称为MLAR)得到增强。由于时间和资源限制,传统招聘流程常在简历筛选和候选人短名单生成环节遇到瓶颈。MLAR通过在三个不同层面应用大型语言模型(LLMs)解决这些挑战:第一层从职位描述中提取关键特征,第二层解析申请人简历以识别教育背景、工作经验和技能,第三层进行相似度匹配。然后,通过先进的语义算法对这些特征进行匹配,以高效识别最佳候选人。

欢迎留下您的脚印