Loading...

Isolating Culture Neurons in Multilingual Large Language Models
本文聚焦多语言大型语言模型(LLMs)中文化信息的编码机制,旨在定位并分离与文化相关的特定神经元(“文化神经元”),并探究其与语言特定神经元的关系。研究通过扩展已有的语言特定神经元识别方法,提出了识别“纯文化神经元”(即仅编码文化信息而不依赖语言的神经元)的方法论,并构建了包含6种文化、8520万tokens的多文化数据集MUREL以支持实验。实验结果表明:多语言LLMs中,不同文化的信息被编码在distinct神经元群体中,且这些神经元主要集中在模型的上层;

Zero-Shot Grammar Competency Estimation Using Large Language Model Generated Pseudo Labels
语法能力评估对于衡量书面和口语的语言熟练度至关重要;然而,口语模态因其自发性、无结构性和不流畅性而面临额外挑战。开发精准的语法评分模型还需要大量专家标注,这使得大规模数据构建难以实现。为解决这些局限性,我们提出一种零样本语法能力评估框架,该框架利用无标注数据和大型语言模型(LLMs),无需依赖人工标签。在训练过程中,我们通过基于语法能力评分准则的提示词,利用LLM对无标注数据生成预测结果。这些预测结果被视为伪标签,通过一种专为有效处理标签噪声设计的新型训练框架,用于训练基于Transformer的模型。

Multi-Agent Multimodal Large Language Model Framework for Automated Interpretation of Fuel Effici...
提升公共交通的燃油效率需要将复杂的多模态数据整合为可解释、与决策相关的洞见。然而,传统的分析和可视化方法往往产生碎片化的输出,需要大量人工解读,限制了可扩展性和一致性。本研究提出了一个多智能体框架,利用多模态大语言模型(LLM)实现数据叙事自动化和能源洞见生成。该框架协调三个专业化智能体(包括数据叙事智能体、LLM评估智能体和可选的人工介入评估器),将分析成果迭代转化为连贯的、面向利益相关者的报告。

Automated Construction of Medical Indicator Knowledge Graphs Using Retrieval Augmented Large Lang...
该研究聚焦于医疗指标知识图谱的自动化构建,旨在解决传统临床知识图谱依赖人工整理和规则提取、效率低且难以适配复杂医疗指南的问题。研究背景:人工智能(尤其是大语言模型LLMs)在医疗文本处理中作用显著,但医疗知识的有效应用需结构化表示;现有知识图谱构建方式受限于医疗指南的复杂性和语境模糊性,自动化程度低。核心框架:提出融合检索增强生成(RAG)与LLMs的自动化构建框架,包含五大模块:数据获取与整合:从权威机构收集临床指南,经标准化预处理(过滤、术语归一化等);

ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
多维度扰动策略:首次整合字符、词、句子三级文本扰动,采用插件化设计,支持动态扩展新策略,解决了现有方法突变多样性不足的问题。语义驱动的适应性评估:引入基于语义嵌入的相似度指标,替代传统词法或统计指标,实现更可解释、更精准的提示词筛选,确保对抗性提示词既保留有害意图又具备自然性。双维度越狱判断机制:分离“行为合规性”与“内容有害性”评估,通过LLM基分类器替代脆弱的关键词匹配,大幅降低假阳性和假阴性,提升越狱检测的可靠性。黑盒适配与高实用性:无需模型内部参数或梯度信息,适用于商业闭源模型;

GenSIaC: Toward Security-Aware Infrastructure-as-Code Generation with Large Language Models
近年来,基础设施即代码(IaC)已成为通过代码和自动化管理与配置IT基础设施的关键方法。IaC能帮助组织创建可扩展且一致的环境,有效管理服务器和开发配置。然而,云基础设施的复杂性日益增加,导致IaC脚本中配置错误和安全漏洞的风险上升。为解决这一问题,本文探索了大型语言模型(LLMs)在生成安全感知IaC代码方面的潜力,以避免开发人员和管理员引入的配置错误。尽管LLMs在自然语言处理和代码生成领域取得了显著进展,但它们生成安全IaC脚本的能力仍不明确。

Can Small GenAI Language Models Rival Large Language Models in Understanding Application Behavior?
该研究聚焦于小型生成式AI语言模型(SLMs)与大型语言模型(LLMs)在应用程序行为理解(以恶意软件检测为代表性任务)中的能力对比。研究团队以SBAN数据集的10,000个样本(含5,000个良性代码和5,000个恶意软件代码)为基础,选取DeepSeek、Phi、Llama、Qwen、Mistral系列的5个不同参数规模模型,通过分类头和基于提示词两种方法,从准确率、精确率、召回率、F1分数等维度进行系统评估。

Applying Large Language Models to Characterize Public Narratives
公共叙事(PNs)是领导力发展和公民动员的关键工具,但由于其主观解读特性和专家标注的高昂成本,对其进行系统化分析仍面临挑战。本研究提出了一种新颖的计算框架,利用大型语言模型(LLMs)实现公共叙事的自动化定性标注。通过与领域专家共同开发的标注手册,我们将LLM的性能与专家标注者进行了对比评估。研究结果表明,LLM能够达到接近人类专家的性能,在8个叙事样本和14个标注代码上的平均F1值为0.80。随后,我们将分析扩展到包含22个故事的更大规模数据集,实证探索了公共叙事框架要素的呈现模式。

Comparative Analysis of Large Language Model Inference Serving Systems: A Performance Study of vL...
大语言模型(LLM)在生产环境中的部署需要高效的推理服务系统,以平衡吞吐量、延迟和资源利用率。本文对两款主流开源LLM推理框架——vLLM和HuggingFace文本生成推理(TGI)进行了全面的实证评估。我们使用参数规模从70亿到700亿的LLaMA-2模型,在吞吐量性能、端到端延迟、GPU内存利用率和可扩展性等多个维度对这些系统进行基准测试。实验结果表明,通过其创新的PagedAttention机制,vLLM在高并发工作负载下的吞吐量比TGI高出24倍;而TGI在交互式单用户场景中表现出更低的尾部延迟。

CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference
大型语言模型在推理过程中面临显著的计算瓶颈,这源于大规模词汇表上昂贵的输出层计算。本文提出CSV-Decode,一种新颖的方法,其利用几何上界为每个解码步骤构建小规模子词汇表,在实现高效稀疏计算的同时,维持双重正确性保证:精确top-k认证和ε-认证softmax近似。该方法通过离线聚类词汇嵌入,并利用质心+半径上界识别可安全跳过计算的tokens。我们提供了完整的系统实现,包括稀疏GEMV内核、多GPU分片和CUDAGraph优化。

LLM Weekly(2026.7.20-2026.7.26)
Anthropic发布了ClaudeOpus5,其定位为以Fable5一半的价格提供接近Fable5的前沿智能水平。Opus5在Frontier-Bench和GDPval-AA上创下了新纪录,在CursorBench3.2上的得分与Fable5的差距在0.5%以内,并以三分之一的成本在OSWorld2.0上击败了Fable5。定价维持在每百万tokens输入5美元/输出25美元。

Agentic large language models improve retrieval-based radiology question answering
本文聚焦于放射学问答(QA)任务,提出了一种基于智能体(agentic)的检索增强生成(RAG)框架,以解决传统RAG系统单步检索的局限性。该框架让大语言模型(LLMs)能够自主分解放射学问题、迭代从Radiopaedia.org检索目标临床证据,并动态合成基于证据的回答。研究评估了24个不同架构、参数规模(0.5B至>670B)和训练范式(通用、推理优化、临床微调)的LLM,使用104个来自RSNA-RadioQA和ExtendedQA数据集的专家精选问题。

UrBLiMP: A Benchmark for Evaluating the Linguistic Competence of Large Language Models in Urdu
本文介绍了,这是一个用于评估大型语言模型(LLMs)在乌尔都语中句法能力的基准数据集。该数据集包含5,696个最小对句(minimalpairs),针对乌尔都语10个核心句法现象(如体标记一致、与格宾语、作格性、主谓一致等),通过乌尔都语树库和原始语料库结合人工验证构建,标注者间一致性达96.10%,确保了数据可靠性。

QCBench: Evaluating Large Language Models on Domain-Specific Quantitative Chemistry
本文提出了一个名为QCBench的定量化学基准(QuantitativeChemistryBenchmark),旨在系统评估大型语言模型(LLMs)在特定领域的定量化学推理能力。该基准包含350个计算化学问题,覆盖7个化学子领域(分析化学、生物/有机化学、普通化学、无机化学、物理化学、聚合物化学、量子化学),并分为基础、中级、专家三个层级的难度。QCBench的设计聚焦于纯计算问题(基于真实化学场景的公式应用和逐步计算),以减少模型依赖捷径的可能,更精准地评估其数值推理能力。

MHARFedLLM: Multimodal Human Activity Recognition Using Federated Large Language Model
本文提出了一种名为FedTime-MAGNET的新型多模态联邦学习框架,用于人体活动识别(HAR)。该框架整合了深度相机、压力垫和加速度计等多源异构数据,通过多模态融合、时间序列大语言模型(LLM)和联邦学习技术,提升HAR系统的准确性和鲁棒性。基于LoRA优化的定制化T5编码器,用于处理时序传感器数据;双注意力残差时序卷积神经网络(DART-CNN),用于提取图像模态的时空嵌入;

Am I Blue or Is My Hobby Counting Teardrops? Expression Leakage in Large Language Models as a Sym...
大型语言模型(LLMs)凭借下一个token预测和自注意力机制,在自然语言处理(NLP)任务中取得了显著进展,但它们整合广泛上下文的能力也使它们容易纳入无关信息。先前的研究主要关注语义泄漏——由语义无关的上下文引入的偏差。在本文中,我们提出“表达泄漏”这一新颖现象,即LLMs会系统性地生成带有情感色彩的表达,而这些表达与输入上下文在语义上无关。为分析表达泄漏,我们收集了一个基准数据集,并设计了一套从common-crawl的自由文本中自动生成数据集的方案。

AirTrafficGen: Configurable Air Traffic Scenario Generation with Large Language Models
本文介绍了一种名为的端到端框架,旨在利用大型语言模型(LLMs)自动化生成空中交通管制(ATC)训练场景,以解决手动设计场景耗时、多样性有限的问题。基于图的空域表示:将三维空域(包含航线、导航点等)离散化为图结构,使LLMs能够处理空域拓扑信息;工程化提示框架:通过精细设计的提示词,实现对场景中交互存在性、类型、位置等特征的细粒度控制;基准测试。

A Survey on Data Security in Large Language Models
数据安全风险:重点分析了五类核心风险,包括数据污染(通过恶意训练数据操纵模型行为)、提示注入(恶意提示覆盖模型原始指令)、幻觉(生成看似合理但错误的信息)、提示泄露(泄露系统提示等敏感信息)和偏见(模型继承训练数据中的社会偏见)。防御策略:综述了三类主流防御方法,包括对抗性训练(通过对抗样本提升模型鲁棒性)、基于人类反馈的强化学习(RLHF,通过人类偏好优化模型输出)、数据增强(通过扩充训练数据多样性缓解偏见等问题)。评估数据集。

MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models
本文提出了一种名为MicroMix的混合精度量化框架,专门针对大型语言模型(LLMs)在NVIDIABlackwell架构上的高效推理设计。该框架结合了基于微缩放(Microscaling,MX)数据格式的量化算法和矩阵乘法内核,通过灵活分配MXFP4、MXFP6、MXFP8精度通道,在保证模型精度的同时显著提升计算效率。引入量化阈值,识别低精度格式(MXFP4/MXFP6)下量化误差过大的激活元素,将其分配到更高精度通道(MXFP6/MXFP8);

Event-CausNet: Unlocking Causal Knowledge from Text with Large Language Models for Reliable Spati...
本文针对时空图神经网络(GNNs)在交通事故、极端天气等非周期性事件中预测可靠性大幅下降的问题,提出了框架,核心是将因果推理与大语言模型(LLMs)、时空预测模型结合,提升事件驱动场景下交通预测的准确性、鲁棒性和可解释性。尽管时空图神经网络(GNNs)在建模周期性交通模式方面表现出色,但在事故等非周期性事件中,其可靠性会急剧下降。这一失效的根源在于GNNs本质上是关联模型,所学习的历史模式会被干扰事件引入的新因果因素破坏。

欢迎留下您的脚印