Loading...
公共叙事(PNs)是领导力发展和公民动员的关键工具,但由于其主观解读特性和专家标注的高昂成本,对其进行系统化分析仍面临挑战。本研究提出了一种新颖的计算框架,利用大型语言模型(LLMs)实现公共叙事的自动化定性标注。通过与领域专家共同开发的标注手册,我们将LLM的性能与专家标注者进行了对比评估。研究结果表明,LLM能够达到接近人类专家的性能,在8个叙事样本和14个标注代码上的平均F1值为0.80。随后,我们将分析扩展到包含22个故事的更大规模数据集,实证探索了公共叙事框架要素的呈现模式。
Comparative Analysis of Large Language Model Inference Serving Systems: A Performance Study of vL...
大语言模型(LLM)在生产环境中的部署需要高效的推理服务系统,以平衡吞吐量、延迟和资源利用率。本文对两款主流开源LLM推理框架——vLLM和HuggingFace文本生成推理(TGI)进行了全面的实证评估。我们使用参数规模从70亿到700亿的LLaMA-2模型,在吞吐量性能、端到端延迟、GPU内存利用率和可扩展性等多个维度对这些系统进行基准测试。实验结果表明,通过其创新的PagedAttention机制,vLLM在高并发工作负载下的吞吐量比TGI高出24倍;而TGI在交互式单用户场景中表现出更低的尾部延迟。
CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference
大型语言模型在推理过程中面临显著的计算瓶颈,这源于大规模词汇表上昂贵的输出层计算。本文提出CSV-Decode,一种新颖的方法,其利用几何上界为每个解码步骤构建小规模子词汇表,在实现高效稀疏计算的同时,维持双重正确性保证:精确top-k认证和ε-认证softmax近似。该方法通过离线聚类词汇嵌入,并利用质心+半径上界识别可安全跳过计算的tokens。我们提供了完整的系统实现,包括稀疏GEMV内核、多GPU分片和CUDAGraph优化。
LLM Weekly(2026.7.20-2026.7.26)
Anthropic发布了ClaudeOpus5,其定位为以Fable5一半的价格提供接近Fable5的前沿智能水平。Opus5在Frontier-Bench和GDPval-AA上创下了新纪录,在CursorBench3.2上的得分与Fable5的差距在0.5%以内,并以三分之一的成本在OSWorld2.0上击败了Fable5。定价维持在每百万tokens输入5美元/输出25美元。
Agentic large language models improve retrieval-based radiology question answering
本文聚焦于放射学问答(QA)任务,提出了一种基于智能体(agentic)的检索增强生成(RAG)框架,以解决传统RAG系统单步检索的局限性。该框架让大语言模型(LLMs)能够自主分解放射学问题、迭代从Radiopaedia.org检索目标临床证据,并动态合成基于证据的回答。研究评估了24个不同架构、参数规模(0.5B至>670B)和训练范式(通用、推理优化、临床微调)的LLM,使用104个来自RSNA-RadioQA和ExtendedQA数据集的专家精选问题。
UrBLiMP: A Benchmark for Evaluating the Linguistic Competence of Large Language Models in Urdu
本文介绍了,这是一个用于评估大型语言模型(LLMs)在乌尔都语中句法能力的基准数据集。该数据集包含5,696个最小对句(minimalpairs),针对乌尔都语10个核心句法现象(如体标记一致、与格宾语、作格性、主谓一致等),通过乌尔都语树库和原始语料库结合人工验证构建,标注者间一致性达96.10%,确保了数据可靠性。
QCBench: Evaluating Large Language Models on Domain-Specific Quantitative Chemistry
本文提出了一个名为QCBench的定量化学基准(QuantitativeChemistryBenchmark),旨在系统评估大型语言模型(LLMs)在特定领域的定量化学推理能力。该基准包含350个计算化学问题,覆盖7个化学子领域(分析化学、生物/有机化学、普通化学、无机化学、物理化学、聚合物化学、量子化学),并分为基础、中级、专家三个层级的难度。QCBench的设计聚焦于纯计算问题(基于真实化学场景的公式应用和逐步计算),以减少模型依赖捷径的可能,更精准地评估其数值推理能力。
MHARFedLLM: Multimodal Human Activity Recognition Using Federated Large Language Model
本文提出了一种名为FedTime-MAGNET的新型多模态联邦学习框架,用于人体活动识别(HAR)。该框架整合了深度相机、压力垫和加速度计等多源异构数据,通过多模态融合、时间序列大语言模型(LLM)和联邦学习技术,提升HAR系统的准确性和鲁棒性。基于LoRA优化的定制化T5编码器,用于处理时序传感器数据;双注意力残差时序卷积神经网络(DART-CNN),用于提取图像模态的时空嵌入;
Am I Blue or Is My Hobby Counting Teardrops? Expression Leakage in Large Language Models as a Sym...
大型语言模型(LLMs)凭借下一个token预测和自注意力机制,在自然语言处理(NLP)任务中取得了显著进展,但它们整合广泛上下文的能力也使它们容易纳入无关信息。先前的研究主要关注语义泄漏——由语义无关的上下文引入的偏差。在本文中,我们提出“表达泄漏”这一新颖现象,即LLMs会系统性地生成带有情感色彩的表达,而这些表达与输入上下文在语义上无关。为分析表达泄漏,我们收集了一个基准数据集,并设计了一套从common-crawl的自由文本中自动生成数据集的方案。
AirTrafficGen: Configurable Air Traffic Scenario Generation with Large Language Models
本文介绍了一种名为的端到端框架,旨在利用大型语言模型(LLMs)自动化生成空中交通管制(ATC)训练场景,以解决手动设计场景耗时、多样性有限的问题。基于图的空域表示:将三维空域(包含航线、导航点等)离散化为图结构,使LLMs能够处理空域拓扑信息;工程化提示框架:通过精细设计的提示词,实现对场景中交互存在性、类型、位置等特征的细粒度控制;基准测试。
A Survey on Data Security in Large Language Models
数据安全风险:重点分析了五类核心风险,包括数据污染(通过恶意训练数据操纵模型行为)、提示注入(恶意提示覆盖模型原始指令)、幻觉(生成看似合理但错误的信息)、提示泄露(泄露系统提示等敏感信息)和偏见(模型继承训练数据中的社会偏见)。防御策略:综述了三类主流防御方法,包括对抗性训练(通过对抗样本提升模型鲁棒性)、基于人类反馈的强化学习(RLHF,通过人类偏好优化模型输出)、数据增强(通过扩充训练数据多样性缓解偏见等问题)。评估数据集。
MicroMix: Efficient Mixed-Precision Quantization with Microscaling Formats for Large Language Models
本文提出了一种名为MicroMix的混合精度量化框架,专门针对大型语言模型(LLMs)在NVIDIABlackwell架构上的高效推理设计。该框架结合了基于微缩放(Microscaling,MX)数据格式的量化算法和矩阵乘法内核,通过灵活分配MXFP4、MXFP6、MXFP8精度通道,在保证模型精度的同时显著提升计算效率。引入量化阈值,识别低精度格式(MXFP4/MXFP6)下量化误差过大的激活元素,将其分配到更高精度通道(MXFP6/MXFP8);
Event-CausNet: Unlocking Causal Knowledge from Text with Large Language Models for Reliable Spati...
本文针对时空图神经网络(GNNs)在交通事故、极端天气等非周期性事件中预测可靠性大幅下降的问题,提出了框架,核心是将因果推理与大语言模型(LLMs)、时空预测模型结合,提升事件驱动场景下交通预测的准确性、鲁棒性和可解释性。尽管时空图神经网络(GNNs)在建模周期性交通模式方面表现出色,但在事故等非周期性事件中,其可靠性会急剧下降。这一失效的根源在于GNNs本质上是关联模型,所学习的历史模式会被干扰事件引入的新因果因素破坏。
Optimal Self-Consistency for Efficient Reasoning with Large Language Models
自一致性(SC)是一种广泛使用的测试时推理技术,用于提升大语言模型(LLM)在思维链推理任务中的性能。该技术通过从大语言模型生成多个响应(或称“样本”),并选择出现频率最高的答案,本质上可视为一种多数投票或经验模式估计方法。尽管效果显著,但在数据集上直接应用时,传统SC的计算成本极高,且缺乏对样本效率和缩放行为的统一理论分析。本文基于模式估计和投票理论,首次对SC及其变体的缩放行为进行了全面分析,推导并通过实证验证了SC在不同数据集上的幂律缩放特性,同时分析了固定分配和动态分配采样方案的样本效率。
Jailbreaking Large Vision Language Models in Intelligent Transportation Systems
研究背景:LVLMs在ITS中广泛应用于交通数据分析、车辆交互、路标识别等场景,但现有安全护栏易被越狱攻击突破,可能导致非法监控、交通规则漠视等安全风险,而相关安全研究尚未充分开展。核心工作构建数据集:基于OpenAI禁止类别,生成150条交通领域有害查询(涵盖非法活动、物理伤害等5类,每类30条);提出攻击方法:通过图像排版操纵(将有害查询嵌入良性图像字幕)+多轮提示(3轮对话逐步诱导),突破LVLMs安全限制;
ExplainableGuard: Interpretable Adversarial Defense for Large Language Models Using Chain-of-Thou...
大型语言模型(LLMs)越来越容易受到对抗性攻击,这些攻击能巧妙地操纵其输出结果。尽管已有多种防御机制被提出,但许多机制以黑箱形式运行,其决策过程缺乏透明度。本文提出ExplainableGuard,这是一种可解释的对抗性防御框架,利用DeepSeek-Reasoner的思维链(CoT)推理能力。该方法不仅能检测并中和文本中的对抗性扰动,还能为每个防御动作提供分步解释。我们证明了定制化的思维链提示如何引导大型语言模型进行多维度分析(字符级、词汇级、结构级、语义级),并生成净化后的输出文本及人类可理解的理由。
Differences in the Moral Foundations of Large Language Models
本文聚焦大型语言模型(LLMs)的道德判断机制,基于乔纳森·海特的道德基础理论(MFT),通过合成实验探究不同模型的道德价值倾向及其与人类基线的差异。研究背景与理论基础:LLMs已广泛应用于关键领域,但道德判断的规范性与透明度不足;现有对齐研究多集中于“狭义偏见危害”或“广义灾难风险”,忽略中间层面的价值判断差异。MFT将道德直觉分解为关怀、公平、忠诚、权威、神圣、自由六大基础,且与政治意识形态相关(自由主义侧重“个体化基础”,保守主义均衡重视“约束性基础”),为分析提供框架。研究设计。
PAS : Prelim Attention Score for Detecting Object Hallucinations in Large Vision--Language Models
大型视觉语言模型(LVLMs)功能强大,但受物体幻觉问题影响,其可靠性仍有待提升。本研究发现,在许多幻觉预测中,LVLM实际上会忽视图像信息,转而依赖先前生成的输出(“初步”)tokens来推断新物体。我们通过在初步输出条件下图像与预测物体之间的互信息来量化这种行为,结果表明,弱图像依赖与幻觉现象高度相关。基于这一发现,我们提出了初步注意力分数(PAS)——一种轻量级、无需训练的信号,由初步输出tokens的注意力权重计算得到。PAS无需额外的前向传播,可在推理过程中实时计算。
LLM4SCREENLIT: Recommendations on Assessing the Performance of Large Language Models for Screenin...
Context:大型语言模型(LLMs)的发布速度远超用户对其进行严格评估的能力。当LLMs为研究提供支撑(如为系统评价(SRs)识别相关文献)时,可靠的实证评估至关重要。Objective:本文旨在识别并探讨LLM在相关文献筛选中性能评估的关键挑战,总结(评估)最佳实践,并提出针对性建议。Method:以一项近期大规模研究为案例,本文指出了传统指标在评估生成式AI工具筛选SR相关文献性能时存在的问题。
A General Highly Accurate Online Planning Method Integrating Large Language Models into Nested Ro...
在目标导向对话任务中,核心挑战是在有限的轮次内引导交互朝着给定目标推进。现有方法要么依赖复杂的提示工程(其效果严重依赖人类经验),要么整合策略网络与预训练策略模型(这类方法通常难以适应新的对话场景,且训练成本高昂)。因此,本文提出了面向目标导向对话的嵌套滚动策略自适应方法(NRPA-GD)——一种新颖的对话策略规划方法。该方法通过利用大语言模型(LLM)同时模拟用户与系统的行为,完全避免了特定模型的训练。
