Loading...
本文针对Transformer架构的大型语言模型(LLMs)在长上下文推理中面临的计算与内存成本随序列长度增长的问题,以及后Transformer模型(如状态空间模型SSMs、线性注意力、循环神经网络RNNs)的兴起,提出了一种基于存内处理(PIM)的加速方案Pimba,以统一支持Transformer和后Transformer模型的高效服务。核心发现:Transformer的注意力机制和后Transformer的状态更新操作均受限于内存带宽,成为批处理推理的性能瓶颈。
Modeling Understanding of Story-Based Analogies Using Large Language Models
本文聚焦大型语言模型(LLMs)在基于故事的类比推理任务中的表现,通过与人类认知对比,深入探究LLMs的类比推理能力。语义表示:使用BERT的句子嵌入评估LLMs是否能捕捉源故事与真类比目标故事的相似性,以及与假类比干扰故事的差异性;提示策略:测试“两步增强提示法”(让模型自生成提示后再推理)能否提升LLMs与人类表现的一致性;细粒度对齐:从单个类比问题层面而非仅整体准确率,评估LLMs与人类对“难易问题”的判断是否一致;模型因素。
A Code Comprehension Benchmark for Large Language Models for Code
本文聚焦于大型语言模型(LLMs)的代码理解能力,指出尽管LLMs在代码生成、补全等任务中表现出色(得益于大规模代码数据训练及下一个token预测的预训练目标),但它们往往仅学习到代码的表层句法模式,缺乏对代码语义的深层理解,导致在代码调试、优化等需语义理解的任务中表现不佳。为解决这一问题,研究提出通过在大规模数据集上针对代码理解任务微调模型,以增强其对代码语义的稳健理解。
Enhancing the Capabilities of Large Language Models for API calls through Knowledge Graphs
本文聚焦气象等知识密集型领域中,大语言模型(LLM)通过API调用利用工具的能力不足问题,提出了名为KG2data的系统。该系统整合知识图谱、LLM、ReAct代理和工具使用技术,实现气象领域的智能数据获取与查询处理。通过虚拟API测试,将KG2data与chat2data(无知识模块)、RAG2data(用向量数据库替代知识图谱)对比,结果显示KG2data在名称识别失败率(1.43%)、幻觉识别失败率(0%)、API调用准确率(88.57%)等指标上均优于后两者。
Towards Applying Large Language Models to Complement Single-Cell Foundation Models
本文聚焦于大语言模型(LLMs)与单细胞基础模型(如scGPT)的互补应用,旨在解决单细胞基础模型无法利用生物文本信息的局限性。研究背景:单细胞基础模型(如scGPT)在单细胞组学任务中表现优异,但仅基于基因表达数据训练,无法利用海量生物文本知识;而LLMs因预训练时涵盖生物知识,被尝试用于单细胞分析,但现有研究多将其作为替代方案,对其性能驱动因素及与单细胞模型的互补性探索不足。核心方法通过可解释性方法(集成梯度、LIME)和消融实验,探究LLMs在单细胞数据分析中的性能机制;
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Languag...
视频理解在将低级视觉信号与高级认知推理连接方面发挥着关键作用,并且是自动驾驶、具身人工智能以及更广泛的通用人工智能(AGI)追求的基础。大型语言模型(LLMs)的快速发展,特别是那些利用思维链(CoT)技术的模型,显著提升了视频推理能力。然而,当前方法主要依赖文本信息进行推理,忽视了实际视频推理过程中的视觉模态。相比之下,人类在推理时会自然地重新审视视觉内容。受此启发,我们提出了一种新型视频推理范式:视频-文本交织思维链(ViTCoT),它能促进更直观且与认知对齐的推理。
Enhancing Trading Performance Through Sentiment Analysis with Large Language Models: Evidence fro...
本文聚焦多模态大语言模型(MLLMs)在音频隐私安全领域的风险,首次系统研究了MLLMs通过音频数据推断敏感个人属性的能力(称为“音频隐私属性分析”),并提出了相应的数据集、框架和防御策略。研究背景与问题:MLLMs的发展带来了跨模态任务的突破,但也引发新的隐私风险。相比文本和图像,音频具有易被隐蔽采集、包含语调/音高等独特信息的特点,但其隐私属性分析尚未被充分研究。核心挑战缺乏带敏感属性标注的音频基准数据集;
The Man Behind the Sound: Demystifying Audio Private Attribute Profiling via Multimodal Large Lan...
本文聚焦多模态大语言模型(MLLMs)在音频隐私安全领域的风险,首次系统研究了MLLMs通过音频数据推断敏感个人属性的能力(称为“音频隐私属性分析”),并提出了相应的数据集、框架和防御策略。研究背景与问题:MLLMs的发展带来了跨模态任务的突破,但也引发新的隐私风险。相比文本和图像,音频具有易被隐蔽采集、包含语调/音高等独特信息的特点,但其隐私属性分析尚未被充分研究。核心挑战缺乏带敏感属性标注的音频基准数据集;
LLMalMorph: On The Feasibility of Generating Variant Malware using Large-Language-Models
本文提出了一个名为LLMalMorph的半自动化框架,旨在利用大型语言模型(LLMs)对恶意软件源代码进行修改,生成具有逃避检测能力的变体,同时保留其核心恶意功能。框架设计函数变异器(FunctionMutator):通过抽象语法树(AST)提取恶意软件源代码中的函数、头文件和全局变量,结合精心设计的提示词(Prompt)和代码转换策略,利用LLM(如Codestral-22B)对函数进行修改。变体合成器(VariantSynthesizer)
Persona-Based Synthetic Data Generation Using Multi-Stage Conditioning with Large Language Models...
本文针对情感识别领域高质量、多样化情感数据集稀缺的问题,提出了一种基于大语言模型(LLM)的新型框架PersonaGen。该框架通过多阶段角色条件控制基础角色构建:采样年龄、性别、职业、人格类型(如MBTI)等人口统计学属性,确保组合的合理性;社会文化背景整合:加入教育背景、居住地、家庭结构、宗教信仰、收入水平等维度,增强角色的真实性;情境与风格设置:定义具体场景(如地点、活动、交流对象)和语言风格(如礼貌用语、网络俚语);情感文本生成:基于上述角色和情境,引导LLM生成符合目标情感类别的文本。
Emergence of Hierarchical Emotion Organization in Large Language Models
LLMs自然形成情感层级结构:随着模型规模增大(如Llama3.18B到405B),其内部会涌现出更复杂的情感层级树,且与人类心理学中的情感层级模型(如Shaver等人1987年提出的情感轮)的一致性更强。情感层级复杂度与识别能力相关:模型情感层级的几何特征(如路径长度、平均深度)可预测其情感识别准确率,层级越复杂,识别能力越强。LLMs存在系统性情感识别偏差。
LLMs on Trial: Evaluating Judicial Fairness for Large Language Models
近年来,大型语言模型(LLMs)的进展激发了人们对众多应用的兴趣,这些应用需要强大的长程能力,这对处理大量输入上下文和持续生成扩展输出至关重要。随着序列长度的增加,LLMs中的键值(KV)对数量激增,形成了显著的效率瓶颈。在本文中,我们提出了一种新的KV缓存优化范式LaCache,这是一种无需训练的方法,用于LLMs的高效且准确的生成式推理。LaCache使LLMs能够同时解决长程建模中的两个关键挑战:强大的长程能力,以及无需担心内存不足(OOM)的连续生成。
HKGAI-V1: Towards Regional Sovereign Large Language Model for Hong Kong
开发背景与目标:针对香港“一国两制”下独特的社会法律环境、多语言需求(粤语、普通话、英语)及本地文化价值观,构建符合区域特性的主权AI基础设施,以实现AI在公共服务、法律、教育等关键领域的自主可控。技术基础与架构:基于DeepSeek架构,通过全参数微调实现与香港区域规范的系统对齐,并整合检索增强生成(RAG)系统确保信息的时效性和事实准确性。系统架构包含设计原则(可扩展性、多层安全、用户中心等)、智能体工作流(规划、执行、交互)及核心层组件(信任治理层、平台服务层等)。价值对齐方法。
AnalogTester: A Large Language Model-Based Framework for Automatic Testbench Generation in Analog...
近年来的进展表明,大语言模型(LLMs)在模拟电路设计中具有巨大潜力。然而,模拟电路的测试平台构建仍依赖人工,这成为实现全自动化设计流程的关键瓶颈。特别是在复现学术论文中的电路设计时,手动构建测试平台需要大量时间和频繁调整,无法满足自动化所需的动态多样性和灵活性要求。AnalogTester通过基于LLM的流水线解决模拟电路自动化设计挑战:a)领域知识整合;b)论文信息提取;c)仿真方案合成;d)基于清华电子设计(TED)的测试平台代码生成。
Hybrid Systolic Array Accelerator with Optimized Dataflow for Edge Large Language Model Inference
本文聚焦边缘设备上大语言模型(LLM)推理的挑战,提出了一种基于混合systolic阵列(HSA)架构的边缘LLM推理加速器,旨在优化推理过程中计算密集的prefill阶段和内存受限的decode阶段的效率。背景与挑战:边缘LLM推理需兼顾安全性、低延迟和成本效益,但面临内存容量有限、功耗约束严格、decode阶段内存带宽窄导致性能受限等问题。
Semantic Source Code Segmentation using Small and Large Language Models
源代码分割——将代码划分为功能连贯的片段——在软件开发中的知识检索和维护中至关重要。尽管手动和句法分析方法能支持大型代码库的高效导航与理解,但随着代码库规模增长,这些方法已变得不切实际,尤其对于R等低资源语言及其研究领域(如社会科学、心理学)而言。本文提出了一种基于大型和小型语言模型(LLMs/SLMs)的自动化、领域特定的研究型R代码分割方法。文中介绍了两种新方法和一个人工标注数据集StatCodeSeg。我们探索了两种截然不同的方法:带上下文的逐行分析和基于范围的片段确定。
DS@GT at Touch\‘e: Large Language Models for Retrieval-Augmented Debate
大型语言模型(LLMs)展现出强大的对话能力。在本工作论文中,我们从两个方面研究它们在辩论中的应用:在结构化辩论中结合可用论据数据集的表现能力,以及在整个辩论过程中评估表述的能力。我们部署了来自三个提供商的六个领先公开可用模型用于检索增强辩论与评估。评估通过四个关键指标进行:质量、数量、方式和相关性。在这项任务中,我们发现尽管LLMs在给定相关论据时辩论表现良好,但它们的回应往往冗长,而在评估方面则保持一致。
A Sparsity Predicting Approach for Large Language Models via Activation Pattern Clustering
大型语言模型(LLMs)表现出显著的激活稀疏性,即给定输入仅会激活一部分神经元。尽管这种稀疏性为降低计算成本提供了可能,但要高效利用它,需要以可扩展的方式预测激活模式。然而,由于现代LLMs中神经元数量极其庞大,直接在神经元层面进行预测的计算成本极高。为实现激活稀疏性的高效预测与利用,我们提出一种基于聚类的激活模式压缩框架。我们不再独立处理每个神经元,而是将相似的激活模式分组为少量具有代表性的聚类。该方法的聚类精度高达79.34%,优于标准二进制聚类方法,同时保持困惑度(PPL)得分的下降最小。
xpSHACL: Explainable SHACL Validation using Retrieval-Augmented Generation and Large Language Models
形状约束语言(SHACL)是一种用于验证RDF数据的强大语言。鉴于近年来行业对知识图谱(KGs)的关注,更多用户需要正确验证链接数据。然而,传统的SHACL验证引擎通常会生成简洁的英文报告,非技术用户难以理解和据此采取行动。本文提出了xpSHACL,一种可解释的SHACL验证系统,该系统通过将基于规则的证明树与检索增强生成(RAG)和大型语言模型(LLMs)相结合,为约束违反生成详细、多语言、人类可读的解释。
Agentic Abstention: Do Agents Know When to Stop Instead of Act?
现有LLM智能体(Agent)相关研究大多聚焦任务完成能力(规划、记忆、工具调用),忽略一个关键缺陷:面对模糊、矛盾、环境无解的用户需求时,Agent存在行动偏好(actionbias),会持续无意义调用工具、重复搜索/命令,不会主动停止;传统LLM弃权(Abstention)仅针对单轮问答,无法适配多轮、环境交互的Agent场景。定义多轮序贯决策问题:Agent每一步有三类动作——(完成任务)、(调用工具探索)、(终止交互,告知任务不可行/需求模糊)。弃权分为两大类:整合三大场景、超28000条任务,
