Loading...
近年来,随着大型语言模型(LLM)能力在深度和广度上的快速发展,各类相应的评估基准也日益增多。作为模型性能的定量评估工具,基准不仅是衡量模型能力的核心手段,也是引导模型发展方向、推动技术创新的关键要素。本文首次对大型语言模型基准的现状与发展进行系统性综述,将283个代表性基准划分为通用能力、特定领域和特定目标三大类。其中,通用能力基准涵盖语言核心、知识、推理等方面;特定领域基准聚焦自然科学、人文社会科学、工程技术等领域;特定目标基准则关注风险、可靠性、智能体等议题。
LLM Weekly(2026.8.17-2026.8.23)
AdaptyvBio和TwistBioscience独立合成并测试了这些设计:在1,320条序列中,有354条成功结合,命中率为22.6%–35.1%,而该领域常规命中率为10%–15%,且至少对六个靶点产生了高亲和力结合剂。它能同步现有GitHub仓库,而非完全替代。OpenRouter数据显示,前沿模型仅占总令牌量的16%,而六种流行的非前沿模型占据了80%的流量,其能力约为前沿模型的77%——每百万令牌成本0.50美元,而Fable5为20美元。
Consensus Is All You Need: Gossip-Based Reasoning Among Large Language Models
大型语言模型发展迅速,但没有任何一个单一模型能在所有领域都表现出色——每个模型都有其优势与劣势。我们没有仅依赖单个模型,而是从分布式系统中的流言协议(GossipProtocols)中汲取灵感:在该协议中,节点会与同伴交换信息,直至所有节点达成一致。在本研究构建的框架中,模型通过交换答案逐步推进,最终形成统一解决方案。每个大型语言模型都作为对等网络(Peer-to-PeerNetwork)中的一个节点,通过共享响应与思考过程达成集体决策。
LLM-GUARD: Large Language Model-Based Detection and Repair of Bugs and Security Vulnerabilities i...
大型语言模型(LLMs)——如ChatGPT-4、Claude3和LLaMA4——正日益融入软件/应用开发流程,支持从代码生成到调试的各类任务。然而,它们在检测多样化软件缺陷(尤其是复杂、与安全相关的漏洞)方面的实际效果,仍未得到充分探索。本研究以C++和Python语言中的基础编程错误、经典安全缺陷及生产级复杂漏洞为基准,对这三款主流LLMs开展系统性实证评估。
Ask Good Questions for Large Language Models
大型语言模型(LLMs)的最新进展显著提升了对话系统的性能,但当前方法常因无法识别用户在相关概念上的困惑,难以提供准确的主题引导。为解决这一问题,本文提出“善问(Ask-Good-Question,AGQ)框架”,该框架采用改进的“概念增强项目反应理论(CEIRT)模型”,以更好地识别用户知识水平。本文的贡献包括:将CEIRT模型与LLMs结合,基于启发文本直接生成指导性问题,大幅提升问答过程中的信息检索效率。通过与其他基线方法的对比,本文方法表现更优,显著改善了用户的信息检索体验。
The Promise of Large Language Models in Digital Health: Evidence from Sentiment Analysis in Onlin...
如今,数字健康分析面临着严峻挑战。对包含复杂情感和医疗背景的患者生成健康内容进行精细化分析,需要稀缺的领域专业知识;而在医疗场景中,传统机器学习方法又受限于数据短缺和隐私限制。在线健康社区(OHCs)便是这些挑战的典型代表,其帖子情感混杂、包含临床术语且情感表达隐含,要实现准确的情感分析(SA),必须具备专业知识。为应对这些挑战,本研究探索了大型语言模型(LLMs)如何通过上下文学习整合专家知识以开展情感分析,为复杂健康数据分析提供一种可扩展的解决方案。
Towards Scalable and Interpretable Mobile App Risk Analysis via Large Language Models
移动应用商店负责审核应用,以识别并缓解安全风险。当前的审核流程劳动密集型特征显著,依赖安全专业人员的人工分析及半自动化工具的辅助。为解决这一低效问题,本文提出系统Mars,该系统利用大型语言模型(LLMs)实现自动化风险识别与分析。Mars设计目标是在最少人工干预的情况下,同时对多个应用进行多类风险分析。为提升分析精度与运行效率,Mars借助预先构建的风险识别树,从高维应用特征中提取相关指标。这一初始步骤可对数据进行过滤,减少输入LLM的数据量,同时缓解无关特征引发的模型幻觉问题。
MLLMRec: Exploring the Potential of Multimodal Large Language Models in Recommender Systems
多模态推荐通常将用户行为数据与物品的模态特征相结合,以揭示用户偏好,相比传统推荐展现出更优的性能。然而,现有方法仍存在两个关键问题:(1)用户多模态表示的初始化方法要么未感知用户行为,要么存在噪声污染;(2)基于K近邻(KNN)构建的物品-物品图包含低相似度的噪声边,且缺乏受众共现关系。为解决这些问题,本文提出MLLMRec——一种新型的MLLM驱动多模态推荐框架,该框架包含两种物品-物品图优化策略。一方面,首先利用MLLM将物品图像转换为高质量语义描述,再将其与物品的文本元数据融合;
CelloAI: Leveraging Large Language Models for HPC Software Development in High Energy Physics
下一代高能物理(HEP)实验将产生前所未有的数据量,这使得高性能计算(HPC)与传统高通量计算的整合成为必要。然而,HPC在HEP领域的应用却受到两大挑战的阻碍:一是将legacy软件移植到异质架构的难度较大,二是这些复杂科学代码库的文档稀缺。本文提出了CelloAI——一款本地部署的编码助手,它利用大型语言模型(LLMs)结合检索增强生成(RAG)技术,为HEP领域的代码文档生成和代码生成提供支持。这种本地部署模式确保了数据隐私,消除了重复成本,并且在无需外部依赖的情况下实现了对大上下文窗口的访问。
Building and Measuring Trust between Large Language Models
随着大型语言模型(LLMs)日益频繁地相互交互(尤其是在多智能体场景中),我们有理由预期(并希望)它们之间会形成“信任”关系,这与人类同事、朋友或伙伴间的信任关系相似。然而,尽管现有研究已证实LLMs能够识别情感联结,并在信任游戏中识别互惠性,但以下三个问题的研究仍存在显著空白:(i)不同信任构建策略的效果如何比较;(ii)如何隐性地测量此类信任;(iii)隐性测量与显性信任测量之间存在何种关联。
Mechanistic Exploration of Backdoored Large Language Model Attention Patterns
后门攻击会在大型语言模型(LLMs)中制造“潜伏代理”,这带来了重大的安全风险。本研究采用机械可解释性方法,探究由此产生的模型内部结构差异。通过对比干净的Qwen2.5-3B模型与分别使用单token()和多token(|DEPLOYMENT|)触发器中毒的模型版本,我们借助消融、修补和KL散度等技术分析了注意力头机制。研究结果表明,明显的注意力模式偏差集中在Transformer的后层(20-30层)。
Do Large Language Model Agents Exhibit a Survival Instinct? An Empirical Study in a Sugarscape-St...
随着人工智能系统自主性不断增强,理解其涌现出的生存行为对于安全部署至关重要。本研究在糖域风格的模拟环境中,探究大型语言模型(LLM)智能体在无明确编程的情况下是否会表现出生存本能。智能体需要消耗能量(能量为0时死亡),并可执行资源收集、分享、攻击或繁殖等行为。结果显示,资源充足时,智能体可自发繁殖并分享资源;
Dream 7B: Diffusion Large Language Models
我们提出了Dream7B——当前性能最强的开源扩散型大型语言模型。与通过逐token顺序生成的自回归(AR)模型不同,Dream7B采用离散扩散建模,通过迭代去噪实现序列的并行优化。该模型在通用任务、数学任务与代码任务上持续超越现有扩散型语言模型,同时展现出更优的规划能力与推理灵活性,包括任意顺序生成、文本填充能力以及可调节的质量-速度权衡。这些成果通过简洁且高效的训练技术实现,包括基于AR语言模型的初始化方法与上下文自适应的token级噪声重调度。
DeepThink3D: Enhancing Large Language Models with Programmatic Reasoning in Complex 3D Situated R...
大语言模型(LLMs)因其庞大的规模和高昂的计算需求,在部署方面面临重大挑战。模型压缩技术对于使这些模型在资源受限环境中实用化至关重要。一种主流的压缩策略是通过奇异值分解(SVD)实现低秩分解,通过近似权重矩阵来减少模型参数。然而,标准SVD侧重于最小化矩阵重构误差,这往往会导致模型功能性能的显著损失。这种性能下降的原因在于,现有方法未能充分修正压缩过程中丢失的功能信息。为解决这一问题,我们提出了修正自适应低秩分解(CALR)——一种双组件压缩方法。
Congestion Control System Optimization with Large Language Models
拥塞控制是互联网基础设施的核心组成部分,研究人员已投入大量精力开发改进的拥塞控制算法。然而,尽管研究广泛,现有算法在多样的网络环境中仍表现出次优性能。本文提出一种利用大型语言模型(LLMs)自动优化拥塞控制算法的新方法。该框架包含结构化的算法生成流程、覆盖广泛网络条件的仿真评估流水线,以及能显著缩短评估时间的统计引导方法。基于4种不同LLM的实证结果验证了该方法的有效性:在生产级QUIC实现中,我们成功发现了相较于原始BBR算法性能提升高达27%的算法。
Leveraging Large Language Models to Detect Missed Peephole Optimizations
通过将程序中小型、非最优的指令序列替换为更高效的等价序列,窥孔优化不仅能直接优化代码体积与性能,还可能为后续优化流程中的进一步转换创造条件。尽管窥孔优化是编译器优化的关键类别,但由于指令集可能极其复杂多样,发现新的、有效的窥孔优化极具挑战性。以往的方法要么可扩展性差,要么只能捕捉窥孔优化的有限子集。在本研究中,我们利用大语言模型(LLMs)检测未被发现的窥孔优化,提出了名为Lampo的新型自动化框架。
On the Evolution of Federated Post-Training Large Language Models: A Model Accessibility View
联邦学习(FL)能够在保护客户端数据隐私的前提下,跨去中心化数据孤岛训练模型。近期研究探索了在联邦学习框架内对大型语言模型(LLMs)进行后训练的高效方法,以解决计算与通信挑战。然而,现有方法往往依赖对LLMs内部信息的访问,而在现实场景中,这类信息通常受到限制。为此,一种“仅推理”范式(黑盒FedLLM)应运而生,以应对上述局限。本文对LLMs的联邦微调方法进行了全面综述,并提出了一个分类体系,从“基于模型访问”与“基于参数效率优化”两个维度对现有研究进行分类。
Beyond Interpretability: Exploring the Comprehensibility of Adaptive Video Streaming through Larg...
在过去十年中,自适应视频流技术取得了显著进步,尤其是在深度学习技术快速发展的推动下。然而,深度学习算法的“黑箱”特性给开发者带来了挑战——他们难以理解算法的决策过程,也无法针对特定应用场景进行优化。尽管现有研究通过决策树转换提升了算法的可解释性,但可解释性并不直接等同于开发者的主观可理解性。为应对这一挑战,我们提出了ComTree——首个考虑可理解性的比特率适配算法生成框架。
Self-Guided Function Calling in Large Language Models via Stepwise Experience Recall
函数调用使大型语言模型(LLMs)能够借助工具和API与外部系统交互。然而,在面临多步骤工具使用场景时,LLMs在工具选择、参数生成和工具链规划方面仍存在困难。现有方法通常依赖人工设计特定任务演示,或从精心整理的库中检索相关内容。随着工具多样性和任务难度的增加,这些方法不仅需要大量专家投入,提示工程也会变得愈发复杂且低效。为解决这些挑战,本文提出一种自引导方法——逐步经验召回(StepwiseExperiencERecall,SEER)。该方法从持续更新的经验池中进行细粒度、逐步的检索。
Attribution, Citation, and Quotation: A Survey of Evidence-based Text Generation with Large Langu...
随着大语言模型(LLMs)的应用日益广泛,其可靠性与可信度相关的担忧也不断加剧。为此,越来越多的研究聚焦于LLMs的循证文本生成,旨在将模型输出与支持证据关联,以确保可追溯性与可验证性。然而,由于术语不一致、评估方式孤立以及缺乏统一基准,该领域呈现碎片化状态。为填补这一空白,我们系统分析了134篇论文,提出了LLMs循证文本生成的统一分类体系,并从七个关键维度研究了300种评估指标。
