Loading...
大型语言模型(LLMs)在多选题任务中可能通过利用选项位置或标签的固有偏差获得虚高分数,而非展现真正的理解能力。本研究提出SCOPE,一种旨在以数据集无关的方式测量和缓解此类选择偏差的评估框架。通过重复使用缺乏语义内容的空提示,SCOPE估计每个模型独特的位置偏差分布。然后,它根据逆偏差分布重新分配答案位置,从而平衡“幸运率”(即随机选中正确答案的概率)。此外,它防止语义相似的干扰项与答案相邻,从而阻断基于表面proximity线索的近误猜测。
Synthetic Data Generation for Phrase Break Prediction with Large Language Model
本文聚焦于文本到语音(TTS)系统中的短语停顿预测任务,旨在解决传统方法依赖大量人工标注(存在成本高、一致性差等问题)的挑战。研究探索了利用大语言模型(LLMs)生成合成短语停顿标注的可行性,通过与两种传统人工标注(音频导向标注和文本导向标注)的对比,评估了合成数据在多语言场景下的有效性。研究发现,基于LLM的合成数据生成方法能有效缓解短语停顿预测中的数据难题:LLM生成的标注质量与人工标注相当,且具有更高的一致性、更低的成本,仅需少量示例即可实现;
Arg-LLaDA: Argument Summarization via Large Language Diffusion Models and Sufficiency-Aware Refin...
论点摘要旨在为复杂的多视角辩论生成简洁、结构化的表述。尽管近年来的研究在论证组件的识别与聚类方面取得了进展,但生成阶段的探索仍显不足。现有方法通常依赖单轮生成,对事实修正或结构优化的支持有限。为解决这一问题,我们提出了Arg-LLaDA——一种新型大型语言扩散框架,通过充分性引导的重新掩码和再生过程迭代优化摘要。该方法结合灵活的掩码控制器与充分性检查模块,识别并修正不被支持、冗余或不完整的片段,从而生成更忠实、简洁且连贯的输出。
Scout: Leveraging Large Language Models for Rapid Digital Evidence Discovery
近年来,技术的进步以及技术在日常活动中的普及,使得数字证据在越来越多的法律调查中出现的可能性大幅增加。消费级硬件的性能不断提升,内存和存储容量扩大,处理器能力增强。取证调查人员在调查过程中常常需要筛选数十亿字节的数据,这一过程十分繁琐。内存取证、磁盘分析等都有先进工具支持,这些工具通过提供字符串搜索、图像文件分析等功能,显著降低了取证人员的工作量。但在调查过程中,仍会识别出大量假阳性结果,需要减少这类情况。本文提出了Scout,这是一种数字取证框架,它利用大型语言模型进行初步的证据处理和优先级排序。
HIVMedQA: Benchmarking large language models for HIV medical decision support
大型语言模型(LLMs)正逐渐成为支持临床医生日常决策的重要工具。HIV管理因其复杂性和动态性(涉及多种治疗方案、合并症及依从性障碍),成为极具吸引力的应用场景。然而,将LLMs整合到临床实践中面临诸多挑战,包括准确性担忧、潜在危害及临床医生的接受度等。尽管前景广阔,但AI在HIV护理中的应用及其性能尚未得到充分研究,且缺乏LLM基准测试研究。本研究旨在评估LLMs在HIV管理中的现状,探究其优势与局限性。我们开发了HIVMedQA基准,用于评估HIV患者管理场景下的开放式医疗问答。
A Hybrid Early-Exit Algorithm for Large Language Models Based on Space Alignment Decoding (SPADE)
本文针对大型语言模型(LLMs)因深层结构导致的高推理成本问题,提出了一种基于空间对齐解码的混合早期退出算法SPADE-EXIT。现有早期退出算法通过在中间层终止计算降低成本,但因中间层与输出层的表示空间不对齐,解码准确性较差。SPADE(空间对齐解码):通过传播仅包含起始token()和答案token()的最小序列,将中间层表示与输出层表示对齐,无需依赖线性变换,提升解码准确性;L-SPADE。
Policy Disruption in Reinforcement Learning:Adversarial Attack with Large Language Models and Cri...
本文聚焦强化学习(RL)系统的对抗性攻击问题,针对现有攻击方法需修改环境或策略、实用性有限的缺陷,提出了一种名为ARCS(AdversarialRewardsandCriticalStateIdentification)的自适应对抗框架。该框架无需改变环境,通过现有代理引导目标策略输出次优动作,从而破坏其性能。奖励迭代优化模块:利用大型语言模型(LLMs)生成针对目标代理漏洞的定制化对抗性奖励函数,通过迭代优化增强引导目标代理做出次优决策的效果。关键状态识别机制。
URPO: A Unified Reward & Policy Optimization Framework for Large Language Models
本文提出了一种名为UnifiedReward&PolicyOptimization(URPO,统一奖励与策略优化)的新型框架,旨在解决传统大型语言模型(LLMs)对齐流程中存在的复杂性、资源密集性和性能天花板问题。传统的强化学习从人类反馈中学习(RLHF)流程通常将策略模型(“玩家”)与单独训练的奖励模型(“裁判”)分离,奖励模型在强化学习阶段参数固定,导致静态奖励信号限制模型性能。统一模型与训练阶段:让单个模型同时承担“玩家”(指令遵循)和“裁判”(奖励建模)角色,在单一训练阶段完成优化;
SiLQ: Simple Large Language Model Quantization-Aware Training
本文提出了一种名为的简单大语言模型量化感知训练方法,旨在解决大语言模型(LLMs)量化过程中精度损失、训练成本高及与专用推理加速器兼容性的问题。核心目标:通过量化降低LLMs的推理延迟、模型大小和能耗,同时最小化精度损失,并确保与专用推理加速器兼容。方法流程在模型中添加量化操作,使用直通估计器(straightthroughestimator)计算训练时的梯度;通过校准初始化量化器步长,再使用LSQ(LearnedStepSizeQuantization)进一步优化;
Cooling Matters: Benchmarking Large Language Models and Vision-Language Models on Liquid-Cooled V...
本文针对大型语言模型(LLMs)和视觉-语言模型(VLMs)在液冷与空冷的8×NVIDIAH100GPU系统上的性能与能效进行了基准测试。研究通过GPUBurn、Weights&Biases、IPMItool等工具收集热学、功率及计算数据,对比了两种冷却系统的表现。结果显示:液冷系统能将GPU温度稳定在41–50°C,而空冷系统温度波动在54–72°C;
Analysis of Threat-Based Manipulation in Large Language Models: A Dual Perspective on Vulnerabili...
本文针对大型语言模型(LLMs)在基于威胁的操纵下的表现进行了系统性研究,从脆弱性和性能提升机会的双重视角展开分析。研究选取了Claude、GPT-4、Gemini三个主流LLM,在10个任务领域(涵盖政策评估、司法推理、医疗伦理等)和6种威胁条件(如权威压力、角色责任、时间限制等)下,收集了3390条实验响应。研究通过构建新的威胁分类法和多指标评估框架(包含11个评估维度,如分析深度、确定性、领域适配性等),量化了威胁操纵的负面影响(如脆弱性)和正面效应(如性能提升)。
LLMxCPG: Context-Aware Vulnerability Detection Through Code Property Graph-Guided Large Language ...
本文提出了一种名为LLMxCPG的新型框架,旨在解决现有基于深度学习的软件漏洞检测方法在准确性、鲁棒性和对复杂代码库分析能力上的局限性。基于CPG的切片构建:利用静态应用安全测试工具Joern及其CPGQL查询语言提取潜在漏洞执行路径,通过反向切片技术构建仅包含漏洞相关核心代码的切片,将代码量减少67.84%至90.93%,同时保留关键上下文。双模型架构:包含LLMxCPG-Q(生成CPGQL查询以提取漏洞路径)和LLMxCPG-D(对切片进行分类以判断是否存在漏洞),均基于现有LLM微调。性能表现。
Exploring Gender Bias in Large Language Models: An In-depth Dive into the German Language
近年来,学界提出了多种评估大型语言模型(LLMs)中性别偏见的方法。一个核心挑战在于,最初为英语开发的偏见测量方法在应用于其他语言时的可迁移性。本研究旨在通过提出五个用于评估LLMs性别偏见的德语数据集,为这一研究方向做出贡献。这些数据集基于已确立的性别偏见概念构建,并可通过多种方法使用。对八个多语言LLM模型的评估结果揭示了德语中性别偏见的独特挑战,包括男性职业术语的模糊解读,以及看似中性的名词对性别感知的影响。本研究有助于理解跨语言背景下LLMs中的性别偏见,并强调了定制化评估框架的必要性。
An approach to measuring the performance of Automatic Speech Recognition (ASR) models in the cont...
自动语音识别(ASR)在人机交互中扮演着关键角色,是众多应用的接口。传统上,ASR性能通过词错误率(WER)评估,该指标量化生成转录文本中的插入、删除和替换错误数量。然而,随着大型且强大的大型语言模型(LLM)越来越多地被用作各类应用的核心处理组件,ASR不同类型错误在下游任务中的重要性值得进一步探索。本文分析了LLM纠正ASR引入错误的能力,并提出了一种新的度量方法,用于评估LLM驱动应用中的ASR性能。
Exploring Large Language Models for Analyzing and Improving Method Names in Scientific Code
本文聚焦于大型语言模型(LLMs)在分析和改进科学代码中方法名的应用,通过对4个主流LLMs(GoogleGemini、AlibabaQwen2.5Coder32B、MetaLLaMa3.370B、DeepSeek-R170B)的评估,探索其在科学代码方法名优化中的有效性。LLMs能否有效识别和分类方法名的语法模式(如词性标注);LLMs提出的方法名改进建议是否符合软件工程最佳实践。
HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlig...
随着视频内容的指数级增长,个性化视频高亮已成为一项关键任务,因为用户偏好具有高度的变异性和复杂性。然而,现有的视频数据集往往缺乏个性化,它们依赖于孤立的视频或简单的文本查询,无法捕捉用户行为的复杂性。在本研究中,我们提出了HIPPO-VIDEO——一个用于个性化视频高亮的新型数据集。该数据集通过基于大语言模型(LLM)的用户模拟器生成真实的观看历史,以反映多样化的用户偏好。该数据集包含2040组(观看历史,显著性分数)对,覆盖170个语义类别下的20400个视频。
eX-NIDS: A Framework for Explainable Network Intrusion Detection Leveraging Large Language Models
研究背景:现有基于深度学习的网络入侵检测系统(NIDS)虽性能优异,但缺乏可解释性,传统可解释AI技术(如SHAP)存在依赖机器学习知识、仅关注统计异常、缺乏上下文信息等局限;大型语言模型(LLMs)在网络安全领域的可解释性应用尚未充分探索,且直接使用易出现幻觉(生成不实信息)和误解释。核心框架。
Distilled Large Language Model in Confidential Computing Environment for System-on-Chip Design
研究背景:LLMs在SoC设计等计算机辅助设计(CAD)任务中应用广泛,但涉及的敏感数据(如RTL设计、电路规格)存在泄露风险。可信执行环境(TEEs)为保护数据和模型提供了可能,但现有TEE(如IntelSGX)难以高效支持资源密集型的LLMs。实验设计。
Advancing Visual Large Language Model for Multi-granular Versatile Perception
本文针对计算机视觉中的感知任务,提出了一个名为的统一框架。感知任务可按两个维度分为四类:预测类型(边界框/掩码)和指令类型(基于词/基于句子)。现有研究多仅覆盖部分任务组合,限制了通用性。MVP-LM通过整合多粒度解码器、Chain-of-Thought(CoT)启发的数据集统一策略和查询增强策略,实现了在单一架构中处理全景分割、目标检测、视觉定位、指代表达式分割等多类任务。实验表明,MVP-LM在词级和句子级感知任务的多个基准测试中表现优异,验证了其有效性。
Do Large Language Models Have a Planning Theory of Mind? Evidence from MindGames: a Multi-Step Pe...
本文聚焦大语言模型(LLMs)是否具备“规划心智理论”(PlanningTheoryofMind,PToM),即通过推断他人信念和需求来动态规划行动、干预其心智状态以达成目标的能力。研究团队设计了名为MINDGAMES的多轮说服任务,要求参与者(人类或LLM)通过选择性披露信息,说服目标agent选择自己偏好的方案。REVEALED条件:参与者已知目标的偏好和信息状态,仅需预测信息披露的效果;HIDDEN条件:参与者需通过互动对话推断目标的偏好和信息状态,进行多步骤反事实规划。
