Loading...
论点摘要旨在为复杂的多视角辩论生成简洁、结构化的表述。尽管近年来的研究在论证组件的识别与聚类方面取得了进展,但生成阶段的探索仍显不足。现有方法通常依赖单轮生成,对事实修正或结构优化的支持有限。为解决这一问题,我们提出了Arg-LLaDA——一种新型大型语言扩散框架,通过充分性引导的重新掩码和再生过程迭代优化摘要。该方法结合灵活的掩码控制器与充分性检查模块,识别并修正不被支持、冗余或不完整的片段,从而生成更忠实、简洁且连贯的输出。
Scout: Leveraging Large Language Models for Rapid Digital Evidence Discovery
近年来,技术的进步以及技术在日常活动中的普及,使得数字证据在越来越多的法律调查中出现的可能性大幅增加。消费级硬件的性能不断提升,内存和存储容量扩大,处理器能力增强。取证调查人员在调查过程中常常需要筛选数十亿字节的数据,这一过程十分繁琐。内存取证、磁盘分析等都有先进工具支持,这些工具通过提供字符串搜索、图像文件分析等功能,显著降低了取证人员的工作量。但在调查过程中,仍会识别出大量假阳性结果,需要减少这类情况。本文提出了Scout,这是一种数字取证框架,它利用大型语言模型进行初步的证据处理和优先级排序。
HIVMedQA: Benchmarking large language models for HIV medical decision support
大型语言模型(LLMs)正逐渐成为支持临床医生日常决策的重要工具。HIV管理因其复杂性和动态性(涉及多种治疗方案、合并症及依从性障碍),成为极具吸引力的应用场景。然而,将LLMs整合到临床实践中面临诸多挑战,包括准确性担忧、潜在危害及临床医生的接受度等。尽管前景广阔,但AI在HIV护理中的应用及其性能尚未得到充分研究,且缺乏LLM基准测试研究。本研究旨在评估LLMs在HIV管理中的现状,探究其优势与局限性。我们开发了HIVMedQA基准,用于评估HIV患者管理场景下的开放式医疗问答。
A Hybrid Early-Exit Algorithm for Large Language Models Based on Space Alignment Decoding (SPADE)
本文针对大型语言模型(LLMs)因深层结构导致的高推理成本问题,提出了一种基于空间对齐解码的混合早期退出算法SPADE-EXIT。现有早期退出算法通过在中间层终止计算降低成本,但因中间层与输出层的表示空间不对齐,解码准确性较差。SPADE(空间对齐解码):通过传播仅包含起始token()和答案token()的最小序列,将中间层表示与输出层表示对齐,无需依赖线性变换,提升解码准确性;L-SPADE。
Policy Disruption in Reinforcement Learning:Adversarial Attack with Large Language Models and Cri...
本文聚焦强化学习(RL)系统的对抗性攻击问题,针对现有攻击方法需修改环境或策略、实用性有限的缺陷,提出了一种名为ARCS(AdversarialRewardsandCriticalStateIdentification)的自适应对抗框架。该框架无需改变环境,通过现有代理引导目标策略输出次优动作,从而破坏其性能。奖励迭代优化模块:利用大型语言模型(LLMs)生成针对目标代理漏洞的定制化对抗性奖励函数,通过迭代优化增强引导目标代理做出次优决策的效果。关键状态识别机制。
URPO: A Unified Reward & Policy Optimization Framework for Large Language Models
本文提出了一种名为UnifiedReward&PolicyOptimization(URPO,统一奖励与策略优化)的新型框架,旨在解决传统大型语言模型(LLMs)对齐流程中存在的复杂性、资源密集性和性能天花板问题。传统的强化学习从人类反馈中学习(RLHF)流程通常将策略模型(“玩家”)与单独训练的奖励模型(“裁判”)分离,奖励模型在强化学习阶段参数固定,导致静态奖励信号限制模型性能。统一模型与训练阶段:让单个模型同时承担“玩家”(指令遵循)和“裁判”(奖励建模)角色,在单一训练阶段完成优化;
SiLQ: Simple Large Language Model Quantization-Aware Training
本文提出了一种名为的简单大语言模型量化感知训练方法,旨在解决大语言模型(LLMs)量化过程中精度损失、训练成本高及与专用推理加速器兼容性的问题。核心目标:通过量化降低LLMs的推理延迟、模型大小和能耗,同时最小化精度损失,并确保与专用推理加速器兼容。方法流程在模型中添加量化操作,使用直通估计器(straightthroughestimator)计算训练时的梯度;通过校准初始化量化器步长,再使用LSQ(LearnedStepSizeQuantization)进一步优化;
Cooling Matters: Benchmarking Large Language Models and Vision-Language Models on Liquid-Cooled V...
本文针对大型语言模型(LLMs)和视觉-语言模型(VLMs)在液冷与空冷的8×NVIDIAH100GPU系统上的性能与能效进行了基准测试。研究通过GPUBurn、Weights&Biases、IPMItool等工具收集热学、功率及计算数据,对比了两种冷却系统的表现。结果显示:液冷系统能将GPU温度稳定在41–50°C,而空冷系统温度波动在54–72°C;
Analysis of Threat-Based Manipulation in Large Language Models: A Dual Perspective on Vulnerabili...
本文针对大型语言模型(LLMs)在基于威胁的操纵下的表现进行了系统性研究,从脆弱性和性能提升机会的双重视角展开分析。研究选取了Claude、GPT-4、Gemini三个主流LLM,在10个任务领域(涵盖政策评估、司法推理、医疗伦理等)和6种威胁条件(如权威压力、角色责任、时间限制等)下,收集了3390条实验响应。研究通过构建新的威胁分类法和多指标评估框架(包含11个评估维度,如分析深度、确定性、领域适配性等),量化了威胁操纵的负面影响(如脆弱性)和正面效应(如性能提升)。
LLMxCPG: Context-Aware Vulnerability Detection Through Code Property Graph-Guided Large Language ...
本文提出了一种名为LLMxCPG的新型框架,旨在解决现有基于深度学习的软件漏洞检测方法在准确性、鲁棒性和对复杂代码库分析能力上的局限性。基于CPG的切片构建:利用静态应用安全测试工具Joern及其CPGQL查询语言提取潜在漏洞执行路径,通过反向切片技术构建仅包含漏洞相关核心代码的切片,将代码量减少67.84%至90.93%,同时保留关键上下文。双模型架构:包含LLMxCPG-Q(生成CPGQL查询以提取漏洞路径)和LLMxCPG-D(对切片进行分类以判断是否存在漏洞),均基于现有LLM微调。性能表现。
Exploring Gender Bias in Large Language Models: An In-depth Dive into the German Language
近年来,学界提出了多种评估大型语言模型(LLMs)中性别偏见的方法。一个核心挑战在于,最初为英语开发的偏见测量方法在应用于其他语言时的可迁移性。本研究旨在通过提出五个用于评估LLMs性别偏见的德语数据集,为这一研究方向做出贡献。这些数据集基于已确立的性别偏见概念构建,并可通过多种方法使用。对八个多语言LLM模型的评估结果揭示了德语中性别偏见的独特挑战,包括男性职业术语的模糊解读,以及看似中性的名词对性别感知的影响。本研究有助于理解跨语言背景下LLMs中的性别偏见,并强调了定制化评估框架的必要性。
An approach to measuring the performance of Automatic Speech Recognition (ASR) models in the cont...
自动语音识别(ASR)在人机交互中扮演着关键角色,是众多应用的接口。传统上,ASR性能通过词错误率(WER)评估,该指标量化生成转录文本中的插入、删除和替换错误数量。然而,随着大型且强大的大型语言模型(LLM)越来越多地被用作各类应用的核心处理组件,ASR不同类型错误在下游任务中的重要性值得进一步探索。本文分析了LLM纠正ASR引入错误的能力,并提出了一种新的度量方法,用于评估LLM驱动应用中的ASR性能。
Exploring Large Language Models for Analyzing and Improving Method Names in Scientific Code
本文聚焦于大型语言模型(LLMs)在分析和改进科学代码中方法名的应用,通过对4个主流LLMs(GoogleGemini、AlibabaQwen2.5Coder32B、MetaLLaMa3.370B、DeepSeek-R170B)的评估,探索其在科学代码方法名优化中的有效性。LLMs能否有效识别和分类方法名的语法模式(如词性标注);LLMs提出的方法名改进建议是否符合软件工程最佳实践。
HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlig...
随着视频内容的指数级增长,个性化视频高亮已成为一项关键任务,因为用户偏好具有高度的变异性和复杂性。然而,现有的视频数据集往往缺乏个性化,它们依赖于孤立的视频或简单的文本查询,无法捕捉用户行为的复杂性。在本研究中,我们提出了HIPPO-VIDEO——一个用于个性化视频高亮的新型数据集。该数据集通过基于大语言模型(LLM)的用户模拟器生成真实的观看历史,以反映多样化的用户偏好。该数据集包含2040组(观看历史,显著性分数)对,覆盖170个语义类别下的20400个视频。
eX-NIDS: A Framework for Explainable Network Intrusion Detection Leveraging Large Language Models
研究背景:现有基于深度学习的网络入侵检测系统(NIDS)虽性能优异,但缺乏可解释性,传统可解释AI技术(如SHAP)存在依赖机器学习知识、仅关注统计异常、缺乏上下文信息等局限;大型语言模型(LLMs)在网络安全领域的可解释性应用尚未充分探索,且直接使用易出现幻觉(生成不实信息)和误解释。核心框架。
Distilled Large Language Model in Confidential Computing Environment for System-on-Chip Design
研究背景:LLMs在SoC设计等计算机辅助设计(CAD)任务中应用广泛,但涉及的敏感数据(如RTL设计、电路规格)存在泄露风险。可信执行环境(TEEs)为保护数据和模型提供了可能,但现有TEE(如IntelSGX)难以高效支持资源密集型的LLMs。实验设计。
Advancing Visual Large Language Model for Multi-granular Versatile Perception
本文针对计算机视觉中的感知任务,提出了一个名为的统一框架。感知任务可按两个维度分为四类:预测类型(边界框/掩码)和指令类型(基于词/基于句子)。现有研究多仅覆盖部分任务组合,限制了通用性。MVP-LM通过整合多粒度解码器、Chain-of-Thought(CoT)启发的数据集统一策略和查询增强策略,实现了在单一架构中处理全景分割、目标检测、视觉定位、指代表达式分割等多类任务。实验表明,MVP-LM在词级和句子级感知任务的多个基准测试中表现优异,验证了其有效性。
Do Large Language Models Have a Planning Theory of Mind? Evidence from MindGames: a Multi-Step Pe...
本文聚焦大语言模型(LLMs)是否具备“规划心智理论”(PlanningTheoryofMind,PToM),即通过推断他人信念和需求来动态规划行动、干预其心智状态以达成目标的能力。研究团队设计了名为MINDGAMES的多轮说服任务,要求参与者(人类或LLM)通过选择性披露信息,说服目标agent选择自己偏好的方案。REVEALED条件:参与者已知目标的偏好和信息状态,仅需预测信息披露的效果;HIDDEN条件:参与者需通过互动对话推断目标的偏好和信息状态,进行多步骤反事实规划。
Efficient Compositional Multi-tasking for On-device Large Language Models
本文聚焦于设备端大型语言模型(LLMs)的高效组合多任务处理问题。现有基于适配器(如LoRA)的模型合并方法仅能处理单个测试样本对应单一任务的场景,而实际应用中常需同时执行多个任务(如生成翻译后的摘要需同时完成翻译和摘要任务)。为此,本文提出:1)一个包含4个实用组合任务的基准测试集(如“摘要+翻译”“回复+语气调整”等),每个任务结合一个主任务(如摘要生成)和一个辅助任务(如翻译);
Gaze-supported Large Language Model Framework for Bi-directional Human-Robot Interaction
大型语言模型(LLMs)的快速发展为辅助机器人的灵活、通用知识驱动人机交互(HRI)系统创造了令人兴奋的潜力。现有HRI系统在解读和遵循用户指令、生成动作及解决机器人任务方面已取得显著进展。然而,在协作任务中对用户的双向、多模态、上下文感知支持仍是一个未解决的挑战。本文提出了一种基于注视和语音的辅助机器人交互界面,该界面能够通过多视觉输入感知工作环境,并为动态中的用户提供任务支持。我们的系统采用模块化设计,可迁移至不同任务和机器人;由于基于语言的交互状态表示和快速机载感知模块,其具备实时处理能力。
