Loading...
我们提出了Dream7B——当前性能最强的开源扩散型大型语言模型。与通过逐token顺序生成的自回归(AR)模型不同,Dream7B采用离散扩散建模,通过迭代去噪实现序列的并行优化。该模型在通用任务、数学任务与代码任务上持续超越现有扩散型语言模型,同时展现出更优的规划能力与推理灵活性,包括任意顺序生成、文本填充能力以及可调节的质量-速度权衡。这些成果通过简洁且高效的训练技术实现,包括基于AR语言模型的初始化方法与上下文自适应的token级噪声重调度。
DeepThink3D: Enhancing Large Language Models with Programmatic Reasoning in Complex 3D Situated R...
大语言模型(LLMs)因其庞大的规模和高昂的计算需求,在部署方面面临重大挑战。模型压缩技术对于使这些模型在资源受限环境中实用化至关重要。一种主流的压缩策略是通过奇异值分解(SVD)实现低秩分解,通过近似权重矩阵来减少模型参数。然而,标准SVD侧重于最小化矩阵重构误差,这往往会导致模型功能性能的显著损失。这种性能下降的原因在于,现有方法未能充分修正压缩过程中丢失的功能信息。为解决这一问题,我们提出了修正自适应低秩分解(CALR)——一种双组件压缩方法。
Congestion Control System Optimization with Large Language Models
拥塞控制是互联网基础设施的核心组成部分,研究人员已投入大量精力开发改进的拥塞控制算法。然而,尽管研究广泛,现有算法在多样的网络环境中仍表现出次优性能。本文提出一种利用大型语言模型(LLMs)自动优化拥塞控制算法的新方法。该框架包含结构化的算法生成流程、覆盖广泛网络条件的仿真评估流水线,以及能显著缩短评估时间的统计引导方法。基于4种不同LLM的实证结果验证了该方法的有效性:在生产级QUIC实现中,我们成功发现了相较于原始BBR算法性能提升高达27%的算法。
Leveraging Large Language Models to Detect Missed Peephole Optimizations
通过将程序中小型、非最优的指令序列替换为更高效的等价序列,窥孔优化不仅能直接优化代码体积与性能,还可能为后续优化流程中的进一步转换创造条件。尽管窥孔优化是编译器优化的关键类别,但由于指令集可能极其复杂多样,发现新的、有效的窥孔优化极具挑战性。以往的方法要么可扩展性差,要么只能捕捉窥孔优化的有限子集。在本研究中,我们利用大语言模型(LLMs)检测未被发现的窥孔优化,提出了名为Lampo的新型自动化框架。
On the Evolution of Federated Post-Training Large Language Models: A Model Accessibility View
联邦学习(FL)能够在保护客户端数据隐私的前提下,跨去中心化数据孤岛训练模型。近期研究探索了在联邦学习框架内对大型语言模型(LLMs)进行后训练的高效方法,以解决计算与通信挑战。然而,现有方法往往依赖对LLMs内部信息的访问,而在现实场景中,这类信息通常受到限制。为此,一种“仅推理”范式(黑盒FedLLM)应运而生,以应对上述局限。本文对LLMs的联邦微调方法进行了全面综述,并提出了一个分类体系,从“基于模型访问”与“基于参数效率优化”两个维度对现有研究进行分类。
Beyond Interpretability: Exploring the Comprehensibility of Adaptive Video Streaming through Larg...
在过去十年中,自适应视频流技术取得了显著进步,尤其是在深度学习技术快速发展的推动下。然而,深度学习算法的“黑箱”特性给开发者带来了挑战——他们难以理解算法的决策过程,也无法针对特定应用场景进行优化。尽管现有研究通过决策树转换提升了算法的可解释性,但可解释性并不直接等同于开发者的主观可理解性。为应对这一挑战,我们提出了ComTree——首个考虑可理解性的比特率适配算法生成框架。
Self-Guided Function Calling in Large Language Models via Stepwise Experience Recall
函数调用使大型语言模型(LLMs)能够借助工具和API与外部系统交互。然而,在面临多步骤工具使用场景时,LLMs在工具选择、参数生成和工具链规划方面仍存在困难。现有方法通常依赖人工设计特定任务演示,或从精心整理的库中检索相关内容。随着工具多样性和任务难度的增加,这些方法不仅需要大量专家投入,提示工程也会变得愈发复杂且低效。为解决这些挑战,本文提出一种自引导方法——逐步经验召回(StepwiseExperiencERecall,SEER)。该方法从持续更新的经验池中进行细粒度、逐步的检索。
Attribution, Citation, and Quotation: A Survey of Evidence-based Text Generation with Large Langu...
随着大语言模型(LLMs)的应用日益广泛,其可靠性与可信度相关的担忧也不断加剧。为此,越来越多的研究聚焦于LLMs的循证文本生成,旨在将模型输出与支持证据关联,以确保可追溯性与可验证性。然而,由于术语不一致、评估方式孤立以及缺乏统一基准,该领域呈现碎片化状态。为填补这一空白,我们系统分析了134篇论文,提出了LLMs循证文本生成的统一分类体系,并从七个关键维度研究了300种评估指标。
From Scores to Skills: A Cognitive Diagnosis Framework for Evaluating Financial Large Language Mo...
大型语言模型(LLMs)在金融应用中展现出潜力,但由于现有评估基准存在缺陷,其在这一高风险领域的适用性仍未得到充分验证。现有基准仅依赖分数级评估,用单一分数概括模型性能,掩盖了模型真实的知识掌握情况及其具体局限;同时,这些基准所依赖的数据集仅涵盖金融概念的一小部分,却忽略了现实应用中的其他关键内容。为解决这些问题,本文提出FinCDM——首个专为金融LLMs设计的认知诊断评估框架。
LLM-RIMSA: Large Language Models driven Reconfigurable Intelligent Metasurface Antenna Systems
6G网络的演进对超大规模连接和智能无线环境提出了需求,但现有可重构智能表面(RIS)技术在硬件效率、动态控制和可扩展性方面面临关键局限。本文提出了LLM-RIMSA,这是一种变革性框架,将大型语言模型(LLMs)与新型可重构智能超表面天线(RIMSA)架构相结合,以应对这些挑战。与传统RIS设计不同,RIMSA采用并行同轴馈电和二维超表面集成,使每个超材料单元能够独立调整其幅度和相位。
SafeLLM: Unlearning Harmful Outputs from Large Language Models against Jailbreak Attacks
越狱攻击通过构造对抗性提示绕过大型语言模型(LLMs)的对齐机制,导致模型生成有害、受限或有偏见的内容,对LLMs的安全性构成严重威胁。本文提出一种新型基于遗忘学习的防御框架SafeLLM,能够在保留语言流畅性和通用能力的同时,从LLMs中遗忘有害知识。SafeLLM采用三阶段流程:(1)基于外部分类器与模型内部评估相结合的混合方法,实现动态不安全输出检测;(2)通过前馈网络(FFN)激活进行token级有害内容追踪,定位有害知识;(3)通过约束优化抑制不安全行为,且不降低模型整体质量。
Flexible metadata harvesting for ecology using large language models
大型开放数据集能够加速生态研究,尤其是通过让研究者复用来自多源的数据集以形成新见解,从而推动研究进展。然而,要找到最适合整合的数据集,研究者必须应对各类生态与环境数据提供商平台,而这些平台的元数据可用性和标准各不相同。为攻克这一难题,我们开发了一款基于大型语言模型(LLM)的元数据收集器。该收集器可从任意数据集的登录页面灵活提取元数据,并借助现有元数据标准将其转换为用户自定义的统一格式。经验证,在LLM后处理流程的辅助下,我们的工具提取结构化和非结构化元数据的准确性相当。
Amortized Bayesian Meta-Learning for Low-Rank Adaptation of Large Language Models
采用低秩适应(LoRA)对大语言模型(LLMs)进行微调,是一种从特定数据集整合信息的经济高效方式。然而,微调后LLM的泛化能力(即对未见过数据集的表现)往往难以判断。已有研究提出通过上下文提示优化或元学习微调LLM来提升泛化能力,但这些方法内存与计算成本高昂——要么需要长上下文提示,要么需要保存参数副本并使用二阶梯度更新。为解决这些挑战,我们提出“用于LoRA的摊销贝叶斯元学习(ABMLL)”。该方法基于适用于小型模型的摊销贝叶斯元学习,将其适配到LLMs中,同时保持计算效率。
Knowledge Graph-Infused Fine-Tuning for Structured Reasoning in Large Language Models
本文针对大型语言模型在处理需结构化知识的任务时存在的推理链缺失和实体级语义理解不足问题,提出了一种基于知识图谱注入的微调算法框架。该方法以预训练语言模型为基础,引入结构化图信息进行辅助学习。具体而言,利用图神经网络对实体及其关系进行编码,构建基于图的语义表示;随后设计融合机制,将知识图谱嵌入与语言模型的上下文表示进行联合建模。为提升知识融合的鲁棒性,引入门控机制动态平衡语言语义与结构知识的贡献,有效缓解不同表示空间之间的冲突。
LLM4Sweat: A Trustworthy Large Language Model for Hyperhidrosis Support
尽管大语言模型(LLM)在医疗领域展现出良好前景,但其在罕见疾病中的应用仍受限于微调所需的稀缺且不可靠的数据集。多汗症是一种导致超出生理需求过度出汗的疾病,属于此类罕见疾病,影响着2%-3%的人群,对生理舒适和心理社会健康均造成显著影响。迄今为止,尚无研究专门定制LLM以推动多汗症的诊断或护理发展。为填补这一空白,我们提出LLM4Sweat——一个开源的、领域特定的LLM框架,旨在为多汗症提供可靠且具共情性的支持。
LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model
大规模语音语言模型(LSLMs)的发展因架构碎片化和透明度缺失而受阻,这阻碍了研究的系统性比较与可复现性。与视觉-语言领域不同,LSLM领域普遍存在仅发布模型权重、却不公开对应训练数据和配置的情况。为填补这些关键空白,我们提出LLaSO——首个用于大规模语音语言建模的全开放端到端框架。LLaSO为研究社区提供三项核心资源:(1)LLaSO-Align,含1200万条语音-文本对齐语料;(2)LLaSO-Instruct,含1350万条多任务指令微调数据;
MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models
近年来,多模态大语言模型(MLLMs)在多个领域取得了显著进展,相应的评测基准也在不断完善。在此过程中,科学领域的评测基准在评估MLLMs推理能力方面发挥了重要作用。然而,现有基准仍面临三大关键挑战:1)对模型在多语言场景下的推理能力评估不足;2)对MLLMs全面模态覆盖的评估不够充分;3)缺乏对科学知识点的细粒度标注。为弥补这些不足,我们提出了一个综合且具有挑战性的基准——MME-SCI。我们精心收集了1019个高质量问答对,涉及3种不同的评测模式。
Equinox: Holistic Fair Scheduling in Serving Large Language Models
大语言模型(LLM)服务面临前所未有的需求,但现有调度器难以在多样化工作负载中公平分配资源。先来先服务(FCFS)等当前部署策略无法实现客户端隔离,易导致资源被垄断;而每分钟请求数(RPM)策略在非高峰时段会造成资源浪费。虚拟令牌计数器(VTC)试图通过跟踪令牌消耗实现公平共享,但未能充分捕捉LLM的资源动态特性。
RotBench: Evaluating Multimodal Large Language Models on Identifying Image Rotation
我们研究了多模态大型语言模型(MLLMs)在识别0°、90°、180°和270°旋转输入图像朝向方面的准确程度。该任务要求模型具备稳健的视觉推理能力,以检测旋转线索并理解图像内的空间关系(无论图像朝向如何)。为评估MLLMs的这些能力,我们提出了ROTBENCH——一个包含350张人工筛选图像的基准数据集,涵盖生活场景、人像和风景图像。尽管该任务相对简单,但研究表明,包括GPT-5、o3和Gemini-2.5-Pro在内的多个最先进开源及专有MLLMs,均无法可靠识别输入图像的旋转角度。
Z-Pruner: Post-Training Pruning of Large Language Models for Efficiency without Retraining
近年来,大型语言模型(LLMs)取得了显著发展,在各类自然语言处理任务中展现出卓越性能。然而,这一进步的代价是模型规模不断扩大,这给模型部署、可扩展性和能效带来了巨大挑战。为解决这些局限,训练后剪枝已成为一种极具潜力的方法,能够在无需重新训练的情况下减小模型规模、降低推理延迟。尽管具备这些优势,但许多现有剪枝方法要么会导致模型性能大幅下降,要么需要消耗大量计算资源进行微调。在本研究中,我们提出了Z-Pruner——一种新型训练后剪枝方法,旨在对预训练大型语言模型进行稀疏化处理,且无需任何重新训练步骤。
