Loading...

LLMs on Trial: Evaluating Judicial Fairness for Large Language Models
近年来,大型语言模型(LLMs)的进展激发了人们对众多应用的兴趣,这些应用需要强大的长程能力,这对处理大量输入上下文和持续生成扩展输出至关重要。随着序列长度的增加,LLMs中的键值(KV)对数量激增,形成了显著的效率瓶颈。在本文中,我们提出了一种新的KV缓存优化范式LaCache,这是一种无需训练的方法,用于LLMs的高效且准确的生成式推理。LaCache使LLMs能够同时解决长程建模中的两个关键挑战:强大的长程能力,以及无需担心内存不足(OOM)的连续生成。

HKGAI-V1: Towards Regional Sovereign Large Language Model for Hong Kong
开发背景与目标:针对香港“一国两制”下独特的社会法律环境、多语言需求(粤语、普通话、英语)及本地文化价值观,构建符合区域特性的主权AI基础设施,以实现AI在公共服务、法律、教育等关键领域的自主可控。技术基础与架构:基于DeepSeek架构,通过全参数微调实现与香港区域规范的系统对齐,并整合检索增强生成(RAG)系统确保信息的时效性和事实准确性。系统架构包含设计原则(可扩展性、多层安全、用户中心等)、智能体工作流(规划、执行、交互)及核心层组件(信任治理层、平台服务层等)。价值对齐方法。

AnalogTester: A Large Language Model-Based Framework for Automatic Testbench Generation in Analog...
近年来的进展表明,大语言模型(LLMs)在模拟电路设计中具有巨大潜力。然而,模拟电路的测试平台构建仍依赖人工,这成为实现全自动化设计流程的关键瓶颈。特别是在复现学术论文中的电路设计时,手动构建测试平台需要大量时间和频繁调整,无法满足自动化所需的动态多样性和灵活性要求。AnalogTester通过基于LLM的流水线解决模拟电路自动化设计挑战:a)领域知识整合;b)论文信息提取;c)仿真方案合成;d)基于清华电子设计(TED)的测试平台代码生成。

Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference
本文聚焦边缘设备上大语言模型(LLM)推理的挑战,提出了一种基于混合systolic阵列(HSA)架构的边缘LLM推理加速器,旨在优化推理过程中计算密集的prefill阶段和内存受限的decode阶段的效率。背景与挑战:边缘LLM推理需兼顾安全性、低延迟和成本效益,但面临内存容量有限、功耗约束严格、decode阶段内存带宽窄导致性能受限等问题。

Semantic Source Code Segmentation using Small and Large Language Models
源代码分割——将代码划分为功能连贯的片段——在软件开发中的知识检索和维护中至关重要。尽管手动和句法分析方法能支持大型代码库的高效导航与理解,但随着代码库规模增长,这些方法已变得不切实际,尤其对于R等低资源语言及其研究领域(如社会科学、心理学)而言。本文提出了一种基于大型和小型语言模型(LLMs/SLMs)的自动化、领域特定的研究型R代码分割方法。文中介绍了两种新方法和一个人工标注数据集StatCodeSeg。我们探索了两种截然不同的方法:带上下文的逐行分析和基于范围的片段确定。

DS@GT at Touch\‘e: Large Language Models for Retrieval-Augmented Debate
大型语言模型(LLMs)展现出强大的对话能力。在本工作论文中,我们从两个方面研究它们在辩论中的应用:在结构化辩论中结合可用论据数据集的表现能力,以及在整个辩论过程中评估表述的能力。我们部署了来自三个提供商的六个领先公开可用模型用于检索增强辩论与评估。评估通过四个关键指标进行:质量、数量、方式和相关性。在这项任务中,我们发现尽管LLMs在给定相关论据时辩论表现良好,但它们的回应往往冗长,而在评估方面则保持一致。

A Sparsity Predicting Approach for Large Language Models via Activation Pattern Clustering
大型语言模型(LLMs)表现出显著的激活稀疏性,即给定输入仅会激活一部分神经元。尽管这种稀疏性为降低计算成本提供了可能,但要高效利用它,需要以可扩展的方式预测激活模式。然而,由于现代LLMs中神经元数量极其庞大,直接在神经元层面进行预测的计算成本极高。为实现激活稀疏性的高效预测与利用,我们提出一种基于聚类的激活模式压缩框架。我们不再独立处理每个神经元,而是将相似的激活模式分组为少量具有代表性的聚类。该方法的聚类精度高达79.34%,优于标准二进制聚类方法,同时保持困惑度(PPL)得分的下降最小。

xpSHACL: Explainable SHACL Validation using Retrieval-Augmented Generation and Large Language Models
形状约束语言(SHACL)是一种用于验证RDF数据的强大语言。鉴于近年来行业对知识图谱(KGs)的关注,更多用户需要正确验证链接数据。然而,传统的SHACL验证引擎通常会生成简洁的英文报告,非技术用户难以理解和据此采取行动。本文提出了xpSHACL,一种可解释的SHACL验证系统,该系统通过将基于规则的证明树与检索增强生成(RAG)和大型语言模型(LLMs)相结合,为约束违反生成详细、多语言、人类可读的解释。

Agentic Abstention: Do Agents Know When to Stop Instead of Act?
现有LLM智能体(Agent)相关研究大多聚焦任务完成能力(规划、记忆、工具调用),忽略一个关键缺陷:面对模糊、矛盾、环境无解的用户需求时,Agent存在行动偏好(actionbias),会持续无意义调用工具、重复搜索/命令,不会主动停止;传统LLM弃权(Abstention)仅针对单轮问答,无法适配多轮、环境交互的Agent场景。定义多轮序贯决策问题:Agent每一步有三类动作——(完成任务)、(调用工具探索)、(终止交互,告知任务不可行/需求模糊)。弃权分为两大类:整合三大场景、超28000条任务,

LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models
近年来,大型语言模型(LLMs)的进展激发了人们对众多应用的兴趣,这些应用需要强大的长程能力,这对处理大量输入上下文和持续生成扩展输出至关重要。随着序列长度的增加,LLMs中的键值(KV)对数量激增,形成了显著的效率瓶颈。在本文中,我们提出了一种新的KV缓存优化范式LaCache,这是一种无需训练的方法,用于LLMs的高效且准确的生成式推理。LaCache使LLMs能够同时解决长程建模中的两个关键挑战:强大的长程能力,以及无需担心内存不足(OOM)的连续生成。

Fusing Large Language Models with Temporal Transformers for Time Series Forecasting
近年来,大型语言模型(LLMs)在各类任务中展现出强大能力,因此近期研究将其应用于时间序列预测(TSF)任务——即根据给定的历史时间序列预测未来值。现有的基于LLM的方法通过提示或微调策略,将从文本数据中学习到的知识迁移到时间序列预测中。然而,LLMs擅长对离散token和语义模式进行推理,但最初并非为建模连续数值时间序列数据而设计。文本与时间序列数据之间的差异导致LLMs的性能不如直接在TSF数据上训练的vanillaTransformer模型。

EV-STLLM: Electric vehicle charging forecasting based on spatio-temporal large language models wi...
本文提出了一种基于时空大语言模型(LLM)的电动汽车(EV)充电预测框架EV-STLLM,旨在解决现有模型在捕捉复杂时空依赖关系、处理大规模数据分布以及融合多维度信息方面的局限性。数据处理模块采用变分模态分解(VMD)进行数据去噪,去除高频白噪声;结合改进的自适应噪声完备集合经验模态分解(ICEEMDAN)进行多频率分解,将信号分为高、中、低频分量;通过模糊信息粒化(FIG)提取多尺度信息(如日、周粒度),保留短期波动和长期趋势;利用ReliefF算法进行特征选择,减少冗余特征,增强模型效率。

FaceLLM: A Multimodal Large Language Model for Face Understanding
多模态大语言模型(MLLMs)在视觉-语言任务中已展现出卓越性能。然而,现有MLLMs主要在通用数据集上训练,限制了它们对特定领域视觉线索(如人脸图像中的线索)的推理能力。特别是,由于缺乏大规模带标注的人脸图像-文本数据集,MLLMs在需要详细理解面部结构、表情、情绪和人口统计学特征的任务中仍未得到充分探索。在本研究中,我们提出了FaceLLM,这是一种专为人脸图像理解训练的多模态大语言模型。

Towards Practical Benchmarking of Data Cleaning Techniques: On Generating Authentic Errors via La...
本文聚焦于数据驱动系统中的数据质量问题,针对现有表格数据错误生成方法(如规则驱动的BART)存在的错误模式单一、与真实错误分布差异大等局限,提出了一种基于大型语言模型(LLMs)的表格错误生成框架TableEG。指令微调:利用真实错误标注数据对LLM进行微调,使模型学习真实错误的分布特征;任务增强:设计多样化任务模板(如错误生成、检测、修正),增强模型对表格二维结构和行列依赖关系的理解;三元组表示(I,T,O)

Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
上海人工智能实验室Agents-A1团队本文提出Agents-A1,一款35B混合专家智能体模型。该模型通过拓展智能体任务视界,达到万亿参数大模型的性能水平。我们从两个维度研究智能体视界缩放技术:拉长长时序交互轨迹、融合异构智能体能力。为支撑该技术路线,我们搭建一套长时序知识-动作基础设施,打通外部知识、智能体动作、环境观测与校验结果,生成平均长度达45000token的智能体交互轨迹。

ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Lang...
本文聚焦视频多模态大语言模型(VideoMLLMs)的主动交互能力,针对现有评估基准和指标的不足,提出了首个综合基准和新型评估指标。背景:随着视频多模态大语言模型的发展,用户对模型的主动交互能力(如在视频播放中自主决定响应时机)需求增加,但现有基准多基于离线或在线交互(依赖用户触发),且缺乏考虑时间动态的评估指标。ProactiveVideoQA基准。

DOPD: Dual On-policy Distillation
在线策略蒸馏(OPD)通过使用稠密的逐Token信号监督学生模型采样得到的轨迹,实现更优质的能力迁移。为获取高质量监督源、进一步突破蒸馏性能上限,一种直观思路是为教师或学生模型引入特权信息。但这类额外输入会引发一种我们命名为特权错觉的失效问题:该现象会混淆两类完全不同的性能差距——一类是学生需要通过蒸馏弥补的可迁移能力差距,另一类是仅能模仿、却永远无法复刻的信息不对称差距。加之逐Token监督天然存在分布不均的特性,仅有少量Token承载关键能力信号,该问题会被进一步放大。

Diagnosing Failures in Large Language Models‘ Answers: Integrating Error Attribution into Evaluat...
构建错误归因框架(MisattributionFramework):包含6个一级类别(响应质量、指令遵循、知识能力、推理能力、安全性、其他错误)和15个二级类别,系统梳理了LLMs常见错误类型。创建归因数据集(AttriData):基于上述框架,人工标注了21,702条样本,涵盖分数、错误归因和反馈信息,涵盖NLP基础、数学、推理等多类任务,兼顾基础与进阶能力评估。提出错误归因模型(MisAttributionLLM)

Evaluating Generated Commit Messages with Large Language Models
本文聚焦于软件开发中提交消息(commitmessages)的质量评估问题。提交消息是记录代码变更的关键文档,但实际中常存在质量不足(如空消息或信息不完整)的问题。尽管基于大型语言模型(LLMs)的自动提交消息生成技术已取得进展,但评估生成消息的质量仍面临挑战:传统基于参考文本的自动指标(如BLEU、ROUGE-L)存在局限性(如依赖文本相似度、无法处理语义等价但表达不同的消息),而人类评估虽准确却耗时耗力、可扩展性差。

Using Large Language Models for Legal Decision-Making in Austrian Value-Added Tax Law: An Experim...
本文通过实验评估了大型语言模型(LLMs)在奥地利及欧盟增值税(VAT)法框架下辅助法律决策的能力。研究聚焦于两种提升LLM性能的方法——微调(fine-tuning)和检索增强生成(RAG),并在两类案例中进行验证:一是权威教科书案例,二是税务咨询公司的真实案例。研究的核心目标是确定基于LLM的系统的最佳配置,并评估其法律推理能力。实验结果表明,经过适当配置的LLMs能够有效支持税务专业人员处理增值税任务,提供有法律依据的决策理由,尤其在自动化常规任务和提供初步分析方面潜力显著。

欢迎留下您的脚印