Loading...
大型语言模型(LLMs)在软件工程领域的快速发展,暴露了现有基准测试集的关键局限性,尤其是广泛使用的SWEbench数据集。近期研究发现了严重的数据污染问题,例如SWEbench(Jimenez等人,2023)报告称,32.67%的成功补丁涉及直接的解决方案泄露,31.08%的补丁因测试用例不足而通过。我们提出了SWE-MERA,这是一个动态、持续更新的基准测试集,旨在通过自动化收集真实世界的GitHub问题并进行严格的质量验证,解决这些根本性挑战。
Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models
本文聚焦大型语言模型(LLMs)在面对微小提示编辑时的鲁棒性,旨在区分模型“好的敏感性”(对良性噪声不敏感)与“坏的敏感性”(对语义关键变化不敏感)。实验设计:选取50个LeetCode编程问题,设计三种扰动方案:渐进式欠指定:每次删除10%的tokens(模拟可忽略的良性噪声);词汇翻转:交换关键量词(如max↔min,模拟必须响应的语义变化);术语膨胀:将常见名词替换为晦涩技术术语(模拟重要性模糊的变化)。模型测试。
Quantifying Label-Induced Bias in Large Language Model Self- and Cross-Evaluations
大型语言模型(LLMs)正越来越多地被用于评估输出内容,但其判断可能受到干扰。本研究探究了ChatGPT、Gemini和Claude在四种条件(无标签、真实标签及两种虚假标签场景)下进行自评与跨模型评估时的偏差。研究中,每个模型生成的博客文章均由这三种模型通过“总体偏好投票”和“针对连贯性、信息量、简洁性的质量评分”两种方式进行评估,所有分数均以百分比形式呈现,以便直接对比。结果显示出显著的不对称性:无论内容实际质量如何,“Claude”标签始终能提高评分,而“Gemini”标签则持续降低评分。
SoK: Large Language Model Copyright Auditing via Fingerprinting
大型语言模型(LLM)凭借广泛的能力和高昂的训练资源投入,成为极具价值的知识产权,但它们仍面临版权侵权风险,例如未授权使用和模型窃取。LLM指纹识别技术作为一种非侵入式方法,通过提取和比较LLM的独特特征来识别侵权行为,为版权审计提供了一种极具潜力的解决方案。然而,由于各类模型修改技术的普遍应用以及缺乏标准化评估,其可靠性仍存在不确定性。在本系统性研究(SoK)中,我们首次对LLM指纹识别技术进行了全面研究。
Bridging Literature and the Universe Via A Multi-Agent Large Language Model System
本文介绍了SIMAGENTS,这是一个基于多智能体大语言模型(LLM)的系统,旨在自动化宇宙学模拟中的参数配置和初步分析流程,以解决物理学家在处理复杂模拟时面临的文献参数提取困难、软件适配繁琐等问题。核心功能:SIMAGENTS由三个专业化智能体组成——PhysicsAgent(解析文献提取物理参数)、SoftwareAgent(验证参数是否符合模拟软件要求)、AnalysisCodeWriter(生成模拟结果分析代码)。
Model-Driven Quantum Code Generation Using Large Language Models and Retrieval-Augmented Generation
本文提出了一种新的研究方向,即利用大型语言模型(LLMs)实现模型到文本/代码的转换,且这些LLMs可通过检索增强生成(RAG)管道进行增强。研究重点聚焦于量子及混合量子-经典软件系统,在这类系统中,模型驱动方法有助于降低成本,并缓解因平台异构性以及开发者技能不足所带来的风险。本文对其中一项提出的理念进行了验证,该理念旨在从软件系统的UML模型实例中生成代码。所生成的Python代码采用了成熟的Qiskit库,可在基于门或基于电路的量子计算机上执行。
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
多模态大语言模型(MLLMs)在疾病诊断、临床决策等医疗应用中具有巨大潜力。然而,这些任务需要高度准确、语境敏感且符合专业标准的响应,因此可靠的奖励模型和评估器至关重要。尽管其意义重大,医疗奖励模型(MRMs)和评估器的研究仍处于探索阶段,目前尚无针对临床需求的专用基准。现有基准要么聚焦于通用MLLM的能力评估,要么将模型作为“求解器”进行测试,忽略了诊断准确性、临床相关性等关键评估维度。为解决这一问题,我们提出——首个专为评估医疗场景下MRMs和评估器设计的基准。
Enhancing Vaccine Safety Surveillance: Extracting Vaccine Mentions from Emergency Department Tria...
本文旨在评估微调后的Llama3.2模型在从急诊科分诊记录中提取疫苗相关信息的效果,以支持近实时的疫苗安全监测。研究通过提示工程初步创建标注数据集,经人工标注者确认后,用于微调Llama模型,并将提示工程模型、微调模型与基于规则的方法进行性能对比。结果显示,微调后的30亿参数Llama模型在提取疫苗名称的准确性上表现最优;模型量化技术使其能在资源受限环境中高效部署。研究证实,大型语言模型(LLMs)在自动化提取急诊科记录数据方面具有潜力,可助力高效的疫苗安全监测及免疫接种后不良事件(AEFI)的早期发现。
A Serverless Architecture for Real-Time Stock Analysis using Large Language Models: An Iterative ...
强大且易获取的大型语言模型(如Google的Gemini)的出现,为金融数据分析的民主化带来了新机遇。本文记录了一个用于实时股票分析的新型无服务器系统的设计、实现与迭代调试过程。该系统利用GeminiAPI进行定性评估,通过GitHubActions实现数据获取与处理的自动化,并通过解耦的静态前端展示结果。我们详细描述了系统的架构演进(从初始概念到稳健的事件驱动pipeline),重点突出了部署过程中遇到的实际挑战。
Quantum-Accelerated Neural Imputation with Large Language Models (LLMs)
缺失数据是现实世界数据集面临的关键挑战,会显著降低机器学习模型的性能。尽管大语言模型(LLMs)最近在表格数据插补中展现出卓越能力(如UnIMP等框架),但它们对经典嵌入方法的依赖往往限制了其捕捉复杂非线性相关性的能力,尤其是在包含数值、分类和文本特征的混合类型数据场景中。本文提出了Quantum-UnIMP,这是一种将浅层量子电路集成到基于LLMs的插补架构中的新型框架。我们的核心创新在于,用瞬时量子多项式(IQP)电路生成的量子特征映射替代传统的经典输入嵌入。
ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety
阴谋论削弱公众对科学和机构的信任,且通过演变和吸收反证来抵抗反驳。随着人工智能生成的虚假信息日益复杂,理解阴谋论内容中的修辞模式对于制定针对性预干预(如提前辟谣)和评估人工智能漏洞至关重要。本文引入CONSPIRED(阴谋论评估数据集),该数据集基于CONSPIR认知框架(Lewandowsky&Cook,2020),对来自在线阴谋论文章的多句片段(80-120词)标注阴谋论认知特征,是首个标注通用阴谋论认知特征的数据集。
Large Language Models (LLMs) for Electronic Design Automation (EDA)
跨环节的系统性整合视角:并非孤立研究LLM在EDA单一环节的应用,而是覆盖从前端设计、HLS、测试、验证到物理实现的全流程,提出LLM驱动的智能代理构想,旨在统一多模态数据(自然语言、HDL、原理图等),实现全流程自动化与集成化设计。实用化的技术框架设计:针对HLS这一关键环节,提出“错误检测-代码修复-功能验证-性能优化”的闭环程序修复框架,以及“测试台适配-变量监测-输入生成-冗余过滤”的行为差异测试框架,解决实际设计中的兼容性与一致性问题。硬件设计自动化的优化。
Prompting Strategies for Language Model-Based Item Generation in K-12 Education: Bridging the Gap...
本研究探索利用语言模型进行自动题目生成(AIG),以创建用于形态学评估的多项选择题(MCQs),旨在降低人工出卷的成本并解决人工出卷一致性差的问题。研究采用双维度方法:首先,将微调后的中型模型(Gemma,20亿参数)与未微调的大型模型(GPT-3.5,1750亿参数)进行对比;其次,评估7种结构化提示策略,包括零样本、少样本、思维链、基于角色、序列式及混合提示策略。生成的题目通过自动指标和专家评分从5个维度进行评估,同时使用经专家评分样本训练的GPT-4.1来大规模模拟人工评分。
ConfTuner: Training Large Language Models to Express Their Confidence Verbally
大语言模型(LLMs)正越来越多地应用于科学、法律、医疗等高风险领域,在这些领域中,准确表达不确定性对模型的可靠性和可信度至关重要。然而,现有LLMs常出现“过度自信”现象——生成错误答案时仍表现出高置信度。近年来,研究人员开始关注LLM语言化置信度的校准问题,即模型以文本形式(如“我有80%的把握认为……”)表达置信度的能力。现有方法要么依赖提示工程,要么使用启发式生成的不确定性估计进行微调,二者的效果和泛化性均有限。受传统机器学习模型中“恰当评分规则”(用于置信度校准)思想的启发,本文提出。
Geopolitical Parallax: Beyond Walter Lippmann Just After Large Language Models
长期以来,新闻客观性一直备受争议,其在中立、基于事实的报道理想与主观框架不可避免性之间摇摆不定。随着大型语言模型(LLMs)的出现,这些矛盾如今由算法系统调节,而这些算法系统的训练数据和设计选择本身可能蕴含文化或意识形态偏见。本研究通过对比中国起源(Qwen、BGE、Jina)和西方起源(Snowflake、Granite)模型家族的文章级嵌入向量,探究“地缘视差”——即新闻质量与主观性评估中的系统性分歧。
zkLoRA: Fine-Tuning Large Language Models with Verifiable Security via Zero-Knowledge Proofs
大型语言模型(LLMs)的微调对于使其适配特定任务至关重要,但该过程计算成本高昂,且在正确性与隐私保护方面存在隐患——尤其在不可信环境中。尽管低秩适应(LoRA)等参数高效方法大幅降低了资源需求,但在零知识约束下确保微调的安全性与可验证性,仍是尚未解决的挑战。为此,本文提出zkLoRA——首个将LoRA微调与零知识证明(ZKPs)融合的框架,实现可证明的安全性与正确性。zkLoRA采用查找参数、求和检查协议、多项式承诺等先进密码学技术,验证Transformer架构中的算术与非算术操作。
Integrating Large Language Models with Network Optimization for Interactive and Explainable Suppl...
本文提出了一个整合框架,将传统网络优化模型与大型语言模型(LLMs)相结合,为供应链规划提供交互式、可解释且角色感知的决策支持。该系统通过生成自然语言总结、上下文可视化图表和定制化关键绩效指标(KPIs),填补了复杂运筹学输出与业务相关者理解之间的鸿沟。核心优化模型采用混合整数规划形式,解决多周期、多产品配送中心网络中的战术性库存再分配问题。技术架构包含AI智能体、RESTfulAPI和动态用户界面,支持实时交互、配置更新和基于模拟的洞察生成。
Automating MD simulations for Proteins using Large language Models: NAMD-Agent
本文是首篇全面综述大语言模型(LLMs)在法律领域应用的研究,通过创新的“双透镜分类法”整合法律推理框架与专业本体,系统梳理了该领域的历史研究与当代突破。技术演进:追溯法律人工智能从早期符号方法(如规则推理系统)到基于Transformer的LLMs的演变。LLMs凭借上下文推理、生成式论证等涌现能力,突破了传统方法在法律语义捕捉、证据推理统一等方面的局限,通过稀疏注意力机制、混合专家架构等技术实现了任务泛化、推理形式化和工作流整合。核心进展。
Detecting and Pruning Prominent but Detrimental Neurons in Large Language Models
本文聚焦于大型语言模型(LLMs)中存在的“捷径学习”问题——模型依赖训练数据中的领域特定相关性(而非可迁移的推理能力)实现高置信度预测,导致在新任务或分布上性能下降。为解决这一问题,作者提出一种基于神经元修剪的微调方法,核心是识别并移除与领域特定机制(DSM)相关的神经元,以增强模型的泛化能力。具体而言,该方法利用积分梯度(IntegratedGradients)量化神经元对高置信度预测的影响,定位那些对特定数据集性能贡献过大但缺乏稳健推理能力的神经元;
Large Language Models Encode Semantics in Low-Dimensional Linear Subspaces
语义的低维线性子空间编码:LLMs会将高级语义信息(如数学、物理等学科知识)压缩到低维线性子空间中,这些子空间的有效维度通常远低于模型的总隐藏维度(常低于10%)。线性可分的语义簇:不同语义内容的表示形成线性可分的簇,且这种可分性在模型深层更显著(通过SVM分类准确率提升体现),表明深层更倾向于结构化语义分离。指令对潜在表示的影响:思维链(chain-of-thought)等结构化推理指令或对齐行为会锐化并分离潜在表示,即使表面内容不变,也会导致内部表示的显著差异;
