Loading...

SmallThinker: A Family of Efficient Large Language Models Natively Trained for Local Deployment
本文介绍了SmallThinker系列大语言模型(LLMs),该系列模型并非通过压缩云端模型适配本地设备,而是从底层原生设计,专为本地设备的弱计算能力、有限内存和低速存储等约束优化。核心目标:突破大语言模型依赖云端GPU部署的限制,实现本地设备(如消费级CPU、智能手机)上的高效运行,同时保证性能。模型架构:采用两级稀疏结构(细粒度混合专家(MoE)+稀疏前馈网络)减少计算需求;通过预注意力路由器(pre-attentionrouter)提前预测所需专家参数,与注意力计算并行预取,隐藏存储延迟;

Joint Lossless Compression and Steganography for Medical Images via Large Language Models
近年来,大型语言模型(LLMs)在无损图像压缩领域取得了显著进展。然而,将现有范式直接应用于医学图像时,压缩性能与效率之间的权衡不尽如人意。此外,现有基于LLM的压缩器往往忽视压缩过程的安全性,而这在现代医疗场景中至关重要。为此,我们提出了一种新颖的联合无损压缩与隐写术框架。受位平面切片(BPS)的启发,我们发现可以将隐私消息以隐形方式安全嵌入医学图像。基于这一见解,我们首先设计了自适应模态分解策略,将整个图像划分为两个部分,为后续的双路径无损压缩提供全局和局部模态。

EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language Models
本文针对混合专家模型(Mixture-of-Experts,MoE)在大语言模型(LLMs)中面临的两大核心挑战——高额GPU内存消耗(需加载所有专家权重)和推理加速与激活参数减少不匹配(低激活参数未转化为等效速度提升),提出了一种名为EAC-MoE的专家选择感知压缩方法。基于专家选择校准的量化(QESC):低比特量化会导致专家选择偏差(即路由器可能选错专家),QESC通过逐层校准MoE中的路由器,减轻这种偏差,从而保留量化模型的性能。基于专家选择频率的剪枝(PESF)

From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Lar...
本文聚焦大型语言模型(LLMs)对人类表达与思维的同质化效应,通过整合语言学、认知科学和计算机科学的跨学科证据,系统分析了LLMs如何影响认知多样性(体现为语言、视角和推理的差异)。认知多样性的重要性:认知多样性是创造力、集体智慧和社会适应性的核心,源于文化、历史和个体经验的差异,表现为语言风格、视角和推理方式的多样性。LLMs的同质化机制LLMs基于“下一个token预测”训练,倾向于复制训练数据中占主导地位的语言、文化和意识形态(如英语、全球北方视角),边缘化小众表达和推理方式。

Evaluating Position Bias in Large Language Model Recommendations
大型语言模型(LLMs)正被越来越多地探索作为推荐任务的通用工具,无需特定任务训练即可实现零样本和指令跟随能力。尽管研究界对LLMs抱有极大热情,但将其直接应用于推荐任务仍存在重要隐患。本文表明,基于LLM的推荐模型存在位置偏差——提示中候选项目的顺序会不成比例地影响LLM生成的推荐结果。首先,我们在真实世界数据集上分析了LLM推荐的位置偏差,结果揭示了LLM对输入顺序高度敏感的系统性偏差。此外,我们提出了一种新的提示策略来缓解LLM推荐模型的位置偏差,称为迭代选择排序(RISE)。

Isolating Culture Neurons in Multilingual Large Language Models
本文聚焦多语言大型语言模型(LLMs)中文化信息的编码机制,旨在定位并分离与文化相关的特定神经元(“文化神经元”),并探究其与语言特定神经元的关系。研究通过扩展已有的语言特定神经元识别方法,提出了识别“纯文化神经元”(即仅编码文化信息而不依赖语言的神经元)的方法论,并构建了包含6种文化、8520万tokens的多文化数据集MUREL以支持实验。实验结果表明:多语言LLMs中,不同文化的信息被编码在distinct神经元群体中,且这些神经元主要集中在模型的上层;

Zero-Shot Grammar Competency Estimation Using Large Language Model Generated Pseudo Labels
语法能力评估对于衡量书面和口语的语言熟练度至关重要;然而,口语模态因其自发性、无结构性和不流畅性而面临额外挑战。开发精准的语法评分模型还需要大量专家标注,这使得大规模数据构建难以实现。为解决这些局限性,我们提出一种零样本语法能力评估框架,该框架利用无标注数据和大型语言模型(LLMs),无需依赖人工标签。在训练过程中,我们通过基于语法能力评分准则的提示词,利用LLM对无标注数据生成预测结果。这些预测结果被视为伪标签,通过一种专为有效处理标签噪声设计的新型训练框架,用于训练基于Transformer的模型。

Multi-Agent Multimodal Large Language Model Framework for Automated Interpretation of Fuel Effici...
提升公共交通的燃油效率需要将复杂的多模态数据整合为可解释、与决策相关的洞见。然而,传统的分析和可视化方法往往产生碎片化的输出,需要大量人工解读,限制了可扩展性和一致性。本研究提出了一个多智能体框架,利用多模态大语言模型(LLM)实现数据叙事自动化和能源洞见生成。该框架协调三个专业化智能体(包括数据叙事智能体、LLM评估智能体和可选的人工介入评估器),将分析成果迭代转化为连贯的、面向利益相关者的报告。

Automated Construction of Medical Indicator Knowledge Graphs Using Retrieval Augmented Large Lang...
该研究聚焦于医疗指标知识图谱的自动化构建,旨在解决传统临床知识图谱依赖人工整理和规则提取、效率低且难以适配复杂医疗指南的问题。研究背景:人工智能(尤其是大语言模型LLMs)在医疗文本处理中作用显著,但医疗知识的有效应用需结构化表示;现有知识图谱构建方式受限于医疗指南的复杂性和语境模糊性,自动化程度低。核心框架:提出融合检索增强生成(RAG)与LLMs的自动化构建框架,包含五大模块:数据获取与整合:从权威机构收集临床指南,经标准化预处理(过滤、术语归一化等);

ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
多维度扰动策略:首次整合字符、词、句子三级文本扰动,采用插件化设计,支持动态扩展新策略,解决了现有方法突变多样性不足的问题。语义驱动的适应性评估:引入基于语义嵌入的相似度指标,替代传统词法或统计指标,实现更可解释、更精准的提示词筛选,确保对抗性提示词既保留有害意图又具备自然性。双维度越狱判断机制:分离“行为合规性”与“内容有害性”评估,通过LLM基分类器替代脆弱的关键词匹配,大幅降低假阳性和假阴性,提升越狱检测的可靠性。黑盒适配与高实用性:无需模型内部参数或梯度信息,适用于商业闭源模型;

GenSIaC: Toward Security-Aware Infrastructure-as-Code Generation with Large Language Models
近年来,基础设施即代码(IaC)已成为通过代码和自动化管理与配置IT基础设施的关键方法。IaC能帮助组织创建可扩展且一致的环境,有效管理服务器和开发配置。然而,云基础设施的复杂性日益增加,导致IaC脚本中配置错误和安全漏洞的风险上升。为解决这一问题,本文探索了大型语言模型(LLMs)在生成安全感知IaC代码方面的潜力,以避免开发人员和管理员引入的配置错误。尽管LLMs在自然语言处理和代码生成领域取得了显著进展,但它们生成安全IaC脚本的能力仍不明确。

Can Small GenAI Language Models Rival Large Language Models in Understanding Application Behavior?
该研究聚焦于小型生成式AI语言模型(SLMs)与大型语言模型(LLMs)在应用程序行为理解(以恶意软件检测为代表性任务)中的能力对比。研究团队以SBAN数据集的10,000个样本(含5,000个良性代码和5,000个恶意软件代码)为基础,选取DeepSeek、Phi、Llama、Qwen、Mistral系列的5个不同参数规模模型,通过分类头和基于提示词两种方法,从准确率、精确率、召回率、F1分数等维度进行系统评估。

Applying Large Language Models to Characterize Public Narratives
公共叙事(PNs)是领导力发展和公民动员的关键工具,但由于其主观解读特性和专家标注的高昂成本,对其进行系统化分析仍面临挑战。本研究提出了一种新颖的计算框架,利用大型语言模型(LLMs)实现公共叙事的自动化定性标注。通过与领域专家共同开发的标注手册,我们将LLM的性能与专家标注者进行了对比评估。研究结果表明,LLM能够达到接近人类专家的性能,在8个叙事样本和14个标注代码上的平均F1值为0.80。随后,我们将分析扩展到包含22个故事的更大规模数据集,实证探索了公共叙事框架要素的呈现模式。

Comparative Analysis of Large Language Model Inference Serving Systems: A Performance Study of vL...
大语言模型(LLM)在生产环境中的部署需要高效的推理服务系统,以平衡吞吐量、延迟和资源利用率。本文对两款主流开源LLM推理框架——vLLM和HuggingFace文本生成推理(TGI)进行了全面的实证评估。我们使用参数规模从70亿到700亿的LLaMA-2模型,在吞吐量性能、端到端延迟、GPU内存利用率和可扩展性等多个维度对这些系统进行基准测试。实验结果表明,通过其创新的PagedAttention机制,vLLM在高并发工作负载下的吞吐量比TGI高出24倍;而TGI在交互式单用户场景中表现出更低的尾部延迟。

CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference
大型语言模型在推理过程中面临显著的计算瓶颈,这源于大规模词汇表上昂贵的输出层计算。本文提出CSV-Decode,一种新颖的方法,其利用几何上界为每个解码步骤构建小规模子词汇表,在实现高效稀疏计算的同时,维持双重正确性保证:精确top-k认证和ε-认证softmax近似。该方法通过离线聚类词汇嵌入,并利用质心+半径上界识别可安全跳过计算的tokens。我们提供了完整的系统实现,包括稀疏GEMV内核、多GPU分片和CUDAGraph优化。

LLM Weekly(2026.7.20-2026.7.26)
Anthropic发布了ClaudeOpus5,其定位为以Fable5一半的价格提供接近Fable5的前沿智能水平。Opus5在Frontier-Bench和GDPval-AA上创下了新纪录,在CursorBench3.2上的得分与Fable5的差距在0.5%以内,并以三分之一的成本在OSWorld2.0上击败了Fable5。定价维持在每百万tokens输入5美元/输出25美元。

Agentic large language models improve retrieval-based radiology question answering
本文聚焦于放射学问答(QA)任务,提出了一种基于智能体(agentic)的检索增强生成(RAG)框架,以解决传统RAG系统单步检索的局限性。该框架让大语言模型(LLMs)能够自主分解放射学问题、迭代从Radiopaedia.org检索目标临床证据,并动态合成基于证据的回答。研究评估了24个不同架构、参数规模(0.5B至>670B)和训练范式(通用、推理优化、临床微调)的LLM,使用104个来自RSNA-RadioQA和ExtendedQA数据集的专家精选问题。

UrBLiMP: A Benchmark for Evaluating the Linguistic Competence of Large Language Models in Urdu
本文介绍了,这是一个用于评估大型语言模型(LLMs)在乌尔都语中句法能力的基准数据集。该数据集包含5,696个最小对句(minimalpairs),针对乌尔都语10个核心句法现象(如体标记一致、与格宾语、作格性、主谓一致等),通过乌尔都语树库和原始语料库结合人工验证构建,标注者间一致性达96.10%,确保了数据可靠性。

QCBench: Evaluating Large Language Models on Domain-Specific Quantitative Chemistry
本文提出了一个名为QCBench的定量化学基准(QuantitativeChemistryBenchmark),旨在系统评估大型语言模型(LLMs)在特定领域的定量化学推理能力。该基准包含350个计算化学问题,覆盖7个化学子领域(分析化学、生物/有机化学、普通化学、无机化学、物理化学、聚合物化学、量子化学),并分为基础、中级、专家三个层级的难度。QCBench的设计聚焦于纯计算问题(基于真实化学场景的公式应用和逐步计算),以减少模型依赖捷径的可能,更精准地评估其数值推理能力。

MHARFedLLM: Multimodal Human Activity Recognition Using Federated Large Language Model
本文提出了一种名为FedTime-MAGNET的新型多模态联邦学习框架,用于人体活动识别(HAR)。该框架整合了深度相机、压力垫和加速度计等多源异构数据,通过多模态融合、时间序列大语言模型(LLM)和联邦学习技术,提升HAR系统的准确性和鲁棒性。基于LoRA优化的定制化T5编码器,用于处理时序传感器数据;双注意力残差时序卷积神经网络(DART-CNN),用于提取图像模态的时空嵌入;

欢迎留下您的脚印