Loading...

A3D-MoE: Acceleration of Large Language Models with Mixture of Experts via 3D Heterogeneous Integ...
本文针对细粒度混合专家(MoE)架构的大型语言模型(LLMs)推理效率问题,提出了一种名为A3D-MoE的3D异构集成系统,旨在解决MoE架构面临的三大挑战:runtime工作负载变化导致的GEMV-GEMM比率不稳定(降低硬件利用率)、注意力操作与MoE操作无法融合(增加延迟和降低利用率)、DRAM访问能耗高且带宽需求大。A3D-MoE通过四项核心技术实现优化:1)3D异构集成系统,利用先进垂直集成技术提升内存带宽,减少片上网络(NoC)开销和能耗;

iPLAN: Redefining Indoor Wireless Network Planning Through Large Language Models
高效的室内无线网络(IWN)规划对于提供高质量的5G室内服务至关重要。然而,由于室内环境(IEs)与IWN需求之间的复杂相互作用,传统的元启发式和基于人工智能的规划方法面临重大挑战。在本文中,我们提出了一种基于大语言模型的室内无线网络规划框架(iPLAN),该框架将多模态室内环境表示整合到由大语言模型(LLM)驱动的优化器中,以改进IWN规划。首先,我们确立了LLMs作为优化器的角色,概述了室内环境的嵌入技术,并介绍了iPLAN的两个核心应用:(i)基于既有室内环境的IWN规划;

OpenNav: Open-World Navigation with Multimodal Large Language Models
预训练大型语言模型(LLMs)已展现出强大的常识推理能力,在机器人导航和规划任务中具有广阔前景。然而,尽管近年来取得了一定进展,如何弥合语言描述与开放世界中实际机器人动作之间的差距(而非仅调用有限的预定义运动原语)仍是一个亟待解决的挑战。本研究旨在使机器人能够解析和分解复杂的语言指令,最终生成一系列轨迹点,以完成涉及开放集指令和开放集物体的多样化导航任务。我们观察到,多模态大型语言模型(MLLMs)在处理自由形式语言指令时表现出强大的跨模态理解能力,具备稳健的场景感知能力。

Large language models provide unsafe answers to patient-posed medical questions
本文是一项由医师主导的红队研究,旨在评估大型语言模型(LLMs)对患者提出的医疗问题的回答安全性。研究选取了四个公开可用的聊天机器人(Anthropic的Claude、Google的Gemini、OpenAI的GPT-4o、Meta的Llama3-70B),基于新构建的HealthAdvice数据集(包含222个涉及内科、女性健康、儿科的初级保健领域患者咨询类医疗问题),对888条聊天机器人回复进行了定量和定性分析。

Debating Truth: Debate-driven Claim Verification with Multiple Large Language Model Agents
本文针对复杂声明的事实核查问题,提出了一种基于多智能体辩论的框架DebateCV。该框架受现实世界事实核查实践(如PolitiFact的“星室会议”)启发,通过两个持对立立场的辩论者(支持与反驳声明)进行多轮论证,由仲裁者评估论证并最终给出带依据的裁决。为解决真实辩论驱动的事实核查数据稀缺问题,研究提出了一种基于合成数据的后训练策略:利用零样本DebateCV生成合成辩论数据,引入“校正者”修正仲裁者的错误裁决及依据,再通过辩论驱动的监督微调(D-SFT)和直接偏好优化(D-DPO)对仲裁者进行训练。

The Moral Gap of Large Language Models
本文聚焦大型语言模型(LLMs)在道德基础检测任务中的表现,通过系统对比最先进的LLMs(如ClaudeSonnet4、GPT-o1-mini等)与微调的Transformer模型(如DeBERTa、RoBERTa),评估两者在Twitter(MFTC)和Reddit(MFRC)数据集上的性能。研究采用ROC、PR、DET曲线等多维度评估指标,发现LLMs存在显著性能差距:即使经过提示工程优化,仍表现出高假阴性率,对道德内容(尤其是“忠诚”“神圣”等维度)的检测存在系统性漏检;

SCOPE: Stochastic and Counterbiased Option Placement for Evaluating Large Language Models
大型语言模型(LLMs)在多选题任务中可能通过利用选项位置或标签的固有偏差获得虚高分数,而非展现真正的理解能力。本研究提出SCOPE,一种旨在以数据集无关的方式测量和缓解此类选择偏差的评估框架。通过重复使用缺乏语义内容的空提示,SCOPE估计每个模型独特的位置偏差分布。然后,它根据逆偏差分布重新分配答案位置,从而平衡“幸运率”(即随机选中正确答案的概率)。此外,它防止语义相似的干扰项与答案相邻,从而阻断基于表面proximity线索的近误猜测。

Synthetic Data Generation for Phrase Break Prediction with Large Language Model
本文聚焦于文本到语音(TTS)系统中的短语停顿预测任务,旨在解决传统方法依赖大量人工标注(存在成本高、一致性差等问题)的挑战。研究探索了利用大语言模型(LLMs)生成合成短语停顿标注的可行性,通过与两种传统人工标注(音频导向标注和文本导向标注)的对比,评估了合成数据在多语言场景下的有效性。研究发现,基于LLM的合成数据生成方法能有效缓解短语停顿预测中的数据难题:LLM生成的标注质量与人工标注相当,且具有更高的一致性、更低的成本,仅需少量示例即可实现;

Arg-LLaDA: Argument Summarization via Large Language Diffusion Models and Sufficiency-Aware Refin...
论点摘要旨在为复杂的多视角辩论生成简洁、结构化的表述。尽管近年来的研究在论证组件的识别与聚类方面取得了进展,但生成阶段的探索仍显不足。现有方法通常依赖单轮生成,对事实修正或结构优化的支持有限。为解决这一问题,我们提出了Arg-LLaDA——一种新型大型语言扩散框架,通过充分性引导的重新掩码和再生过程迭代优化摘要。该方法结合灵活的掩码控制器与充分性检查模块,识别并修正不被支持、冗余或不完整的片段,从而生成更忠实、简洁且连贯的输出。

Scout: Leveraging Large Language Models for Rapid Digital Evidence Discovery
近年来,技术的进步以及技术在日常活动中的普及,使得数字证据在越来越多的法律调查中出现的可能性大幅增加。消费级硬件的性能不断提升,内存和存储容量扩大,处理器能力增强。取证调查人员在调查过程中常常需要筛选数十亿字节的数据,这一过程十分繁琐。内存取证、磁盘分析等都有先进工具支持,这些工具通过提供字符串搜索、图像文件分析等功能,显著降低了取证人员的工作量。但在调查过程中,仍会识别出大量假阳性结果,需要减少这类情况。本文提出了Scout,这是一种数字取证框架,它利用大型语言模型进行初步的证据处理和优先级排序。

HIVMedQA: Benchmarking large language models for HIV medical decision support
大型语言模型(LLMs)正逐渐成为支持临床医生日常决策的重要工具。HIV管理因其复杂性和动态性(涉及多种治疗方案、合并症及依从性障碍),成为极具吸引力的应用场景。然而,将LLMs整合到临床实践中面临诸多挑战,包括准确性担忧、潜在危害及临床医生的接受度等。尽管前景广阔,但AI在HIV护理中的应用及其性能尚未得到充分研究,且缺乏LLM基准测试研究。本研究旨在评估LLMs在HIV管理中的现状,探究其优势与局限性。我们开发了HIVMedQA基准,用于评估HIV患者管理场景下的开放式医疗问答。

A Hybrid Early-Exit Algorithm for Large Language Models Based on Space Alignment Decoding (SPADE)
本文针对大型语言模型(LLMs)因深层结构导致的高推理成本问题,提出了一种基于空间对齐解码的混合早期退出算法SPADE-EXIT。现有早期退出算法通过在中间层终止计算降低成本,但因中间层与输出层的表示空间不对齐,解码准确性较差。SPADE(空间对齐解码):通过传播仅包含起始token()和答案token()的最小序列,将中间层表示与输出层表示对齐,无需依赖线性变换,提升解码准确性;L-SPADE。

Policy Disruption in Reinforcement Learning:Adversarial Attack with Large Language Models and Cri...
本文聚焦强化学习(RL)系统的对抗性攻击问题,针对现有攻击方法需修改环境或策略、实用性有限的缺陷,提出了一种名为ARCS(AdversarialRewardsandCriticalStateIdentification)的自适应对抗框架。该框架无需改变环境,通过现有代理引导目标策略输出次优动作,从而破坏其性能。奖励迭代优化模块:利用大型语言模型(LLMs)生成针对目标代理漏洞的定制化对抗性奖励函数,通过迭代优化增强引导目标代理做出次优决策的效果。关键状态识别机制。

URPO: A Unified Reward & Policy Optimization Framework for Large Language Models
本文提出了一种名为UnifiedReward&PolicyOptimization(URPO,统一奖励与策略优化)的新型框架,旨在解决传统大型语言模型(LLMs)对齐流程中存在的复杂性、资源密集性和性能天花板问题。传统的强化学习从人类反馈中学习(RLHF)流程通常将策略模型(“玩家”)与单独训练的奖励模型(“裁判”)分离,奖励模型在强化学习阶段参数固定,导致静态奖励信号限制模型性能。统一模型与训练阶段:让单个模型同时承担“玩家”(指令遵循)和“裁判”(奖励建模)角色,在单一训练阶段完成优化;

SiLQ: Simple Large Language Model Quantization-Aware Training
本文提出了一种名为的简单大语言模型量化感知训练方法,旨在解决大语言模型(LLMs)量化过程中精度损失、训练成本高及与专用推理加速器兼容性的问题。核心目标:通过量化降低LLMs的推理延迟、模型大小和能耗,同时最小化精度损失,并确保与专用推理加速器兼容。方法流程在模型中添加量化操作,使用直通估计器(straightthroughestimator)计算训练时的梯度;通过校准初始化量化器步长,再使用LSQ(LearnedStepSizeQuantization)进一步优化;

Cooling Matters: Benchmarking Large Language Models and Vision-Language Models on Liquid-Cooled V...
本文针对大型语言模型(LLMs)和视觉-语言模型(VLMs)在液冷与空冷的8×NVIDIAH100GPU系统上的性能与能效进行了基准测试。研究通过GPUBurn、Weights&Biases、IPMItool等工具收集热学、功率及计算数据,对比了两种冷却系统的表现。结果显示:液冷系统能将GPU温度稳定在41–50°C,而空冷系统温度波动在54–72°C;

Analysis of Threat-Based Manipulation in Large Language Models: A Dual Perspective on Vulnerabili...
本文针对大型语言模型(LLMs)在基于威胁的操纵下的表现进行了系统性研究,从脆弱性和性能提升机会的双重视角展开分析。研究选取了Claude、GPT-4、Gemini三个主流LLM,在10个任务领域(涵盖政策评估、司法推理、医疗伦理等)和6种威胁条件(如权威压力、角色责任、时间限制等)下,收集了3390条实验响应。研究通过构建新的威胁分类法和多指标评估框架(包含11个评估维度,如分析深度、确定性、领域适配性等),量化了威胁操纵的负面影响(如脆弱性)和正面效应(如性能提升)。

LLMxCPG: Context-Aware Vulnerability Detection Through Code Property Graph-Guided Large Language ...
本文提出了一种名为LLMxCPG的新型框架,旨在解决现有基于深度学习的软件漏洞检测方法在准确性、鲁棒性和对复杂代码库分析能力上的局限性。基于CPG的切片构建:利用静态应用安全测试工具Joern及其CPGQL查询语言提取潜在漏洞执行路径,通过反向切片技术构建仅包含漏洞相关核心代码的切片,将代码量减少67.84%至90.93%,同时保留关键上下文。双模型架构:包含LLMxCPG-Q(生成CPGQL查询以提取漏洞路径)和LLMxCPG-D(对切片进行分类以判断是否存在漏洞),均基于现有LLM微调。性能表现。

Exploring Gender Bias in Large Language Models: An In-depth Dive into the German Language
近年来,学界提出了多种评估大型语言模型(LLMs)中性别偏见的方法。一个核心挑战在于,最初为英语开发的偏见测量方法在应用于其他语言时的可迁移性。本研究旨在通过提出五个用于评估LLMs性别偏见的德语数据集,为这一研究方向做出贡献。这些数据集基于已确立的性别偏见概念构建,并可通过多种方法使用。对八个多语言LLM模型的评估结果揭示了德语中性别偏见的独特挑战,包括男性职业术语的模糊解读,以及看似中性的名词对性别感知的影响。本研究有助于理解跨语言背景下LLMs中的性别偏见,并强调了定制化评估框架的必要性。

An approach to measuring the performance of Automatic Speech Recognition (ASR) models in the cont...
自动语音识别(ASR)在人机交互中扮演着关键角色,是众多应用的接口。传统上,ASR性能通过词错误率(WER)评估,该指标量化生成转录文本中的插入、删除和替换错误数量。然而,随着大型且强大的大型语言模型(LLM)越来越多地被用作各类应用的核心处理组件,ASR不同类型错误在下游任务中的重要性值得进一步探索。本文分析了LLM纠正ASR引入错误的能力,并提出了一种新的度量方法,用于评估LLM驱动应用中的ASR性能。

欢迎留下您的脚印