Loading...
本文提出了一种结合大型语言模型(LLMs)和非负矩阵分解(NMF)的生物声学信号分析框架,旨在解决临床记录中生物声学信号(如心肺信号)重叠导致的分离与解读难题。研究背景:传统信号分离技术依赖专家解读,在嘈杂环境中可靠性低;NMF作为无监督盲源分离方法,可将复杂信号分解为可解释的成分,但缺乏临床意义关联能力。方法设计数据采集:使用数字听诊器在临床人体模型上获取受控的心肺重叠信号;信号分解:通过短时傅里叶变换(STFT)将信号转换为时空表示,再用NMF分解为混合矩阵(W)和源信号矩阵(H);
Prompt4Trust: A Reinforcement Learning Prompt Augmentation Framework for Clinically-Aligned Confi...
多模态大型语言模型(MLLMs)在医疗健康领域的应用具有巨大潜力。然而,它们在安全关键场景中的部署受到两个关键限制的阻碍:(i)对提示设计的敏感性;(ii)倾向于生成高置信度的错误响应。由于临床医生可能依赖模型声明的置信度来评估其预测的可靠性,因此当模型表达高置信度时,其准确性也必须很高,这一点尤为重要。我们提出了Prompt4Trust,这是首个针对MLLMs置信度校准的强化学习(RL)提示增强框架。
Can Large Language Models Understand As Well As Apply Patent Regulations to Pass a Hands-On Paten...
本文聚焦大语言模型(LLMs)在专利法律领域的实际应用能力,通过评估多个开源及专有LLMs(如GPT系列、Anthropic、Llama-3等)在欧洲专利代理人资格考试(EQE)中的表现,探究其理解和应用专利法规的能力。模型表现差异:OpenAIo1表现最优,准确率达0.82,F1分数0.81;而AWSLlama3.18B准确率仅0.50,接近随机猜测水平。所有模型均未达到通过考试所需的0.90准确率阈值,即使是被宣传为“超越博士或执业律师水平”的模型。关键影响因素。
Finding Common Ground: Using Large Language Models to Detect Agreement in Multi-Agent Decision Co...
决策会议是一种结构化的协作会议,它汇聚不同领域的专家以解决复杂问题,并就未来行动或政策的建议达成共识。这类会议通常依赖引导式讨论来确保富有成效的对话和集体共识。近年来,大型语言模型(LLMs)在模拟现实场景中展现出巨大潜力,尤其是通过模仿群体互动的协作式多智能体系统。本文提出了一种基于LLM的新型多智能体系统,旨在模拟决策会议,重点关注检测参与智能体之间的共识。
Automated Bug Triaging using Instruction-Tuned Large Language Models
人工缺陷分类速度慢、一致性差,在大型软件项目中已逐渐难以维持。本文提出一种基于指令微调的项目专属大型语言模型(LLM),用于自动化缺陷分类,该模型整合了候选约束解码技术,可确保开发者分配结果的有效性。我们的框架以8B参数的DeepSeek-R1-Distill-Llama-8B模型为基础,利用从EclipseJDT和Mozilla缺陷跟踪数据中提取的对话式JSONL格式数据,对LoRA适配器进行微调。该方法无需手工特征、图构建或复杂预处理,仅需极少工程工作量即可快速适配新项目。
Operational Validation of Large-Language-Model Agent Social Simulation: Evidence from Voat v/tech...
大型语言模型(LLMs)为生成式社交模拟提供了可能,这类模拟能够捕捉在线社交平台上受文化影响、遵循规范的互动行为。本研究以Voat平台(一个类似Reddit的另类右翼新闻聚合与讨论平台,2014-2020年活跃)为原型,构建了一个技术社区模拟。研究基于YSocial框架,从Voat的共享URL(涵盖30多个领域)中筛选固定技术链接目录作为模拟种子,并利用MADOC数据集的样本校准参数,以匹配Voat的v/technology社区特征。
Provable Benefits of In-Tool Learning for Large Language Models
配备检索、记忆或外部API的工具增强型语言模型正在重塑人工智能,但它们的理论优势仍未得到充分探索。本文通过证明工具内学习(外部检索)相对于权重内学习(记忆)在事实召回任务中的优势,解决了这一问题。我们发现,模型仅通过权重所能记忆的事实数量,从根本上受其参数数量的限制。相反,我们通过一种简单高效的电路结构证明,使用工具能够实现无界的事实召回。这些结果在受控实验中得到了验证——使用工具的模型始终优于依赖记忆的模型。
Leveraging Large Language Models for Generating Research Topic Ontologies: A Multi-Disciplinary S...
研究领域的本体与分类法对于科学知识的管理和组织至关重要,它们能够促进信息的高效分类、传播与检索。然而,此类本体的创建与维护是成本高昂且耗时的任务,通常需要多个领域专家协同完成。因此,该领域的本体往往存在不同学科覆盖不均衡、跨领域连接薄弱以及更新周期长等问题。本研究探究了多个大型语言模型(LLMs)在识别三个学术领域(生物医学、物理学、工程学)内研究主题间语义关系的能力。研究在三种不同条件下对模型进行评估:零样本提示、思维链提示以及基于现有本体的微调。
SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineer...
大型语言模型(LLMs)在软件工程领域的快速发展,暴露了现有基准测试集的关键局限性,尤其是广泛使用的SWEbench数据集。近期研究发现了严重的数据污染问题,例如SWEbench(Jimenez等人,2023)报告称,32.67%的成功补丁涉及直接的解决方案泄露,31.08%的补丁因测试用例不足而通过。我们提出了SWE-MERA,这是一个动态、持续更新的基准测试集,旨在通过自动化收集真实世界的GitHub问题并进行严格的质量验证,解决这些根本性挑战。
Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models
本文聚焦大型语言模型(LLMs)在面对微小提示编辑时的鲁棒性,旨在区分模型“好的敏感性”(对良性噪声不敏感)与“坏的敏感性”(对语义关键变化不敏感)。实验设计:选取50个LeetCode编程问题,设计三种扰动方案:渐进式欠指定:每次删除10%的tokens(模拟可忽略的良性噪声);词汇翻转:交换关键量词(如max↔min,模拟必须响应的语义变化);术语膨胀:将常见名词替换为晦涩技术术语(模拟重要性模糊的变化)。模型测试。
Quantifying Label-Induced Bias in Large Language Model Self- and Cross-Evaluations
大型语言模型(LLMs)正越来越多地被用于评估输出内容,但其判断可能受到干扰。本研究探究了ChatGPT、Gemini和Claude在四种条件(无标签、真实标签及两种虚假标签场景)下进行自评与跨模型评估时的偏差。研究中,每个模型生成的博客文章均由这三种模型通过“总体偏好投票”和“针对连贯性、信息量、简洁性的质量评分”两种方式进行评估,所有分数均以百分比形式呈现,以便直接对比。结果显示出显著的不对称性:无论内容实际质量如何,“Claude”标签始终能提高评分,而“Gemini”标签则持续降低评分。
SoK: Large Language Model Copyright Auditing via Fingerprinting
大型语言模型(LLM)凭借广泛的能力和高昂的训练资源投入,成为极具价值的知识产权,但它们仍面临版权侵权风险,例如未授权使用和模型窃取。LLM指纹识别技术作为一种非侵入式方法,通过提取和比较LLM的独特特征来识别侵权行为,为版权审计提供了一种极具潜力的解决方案。然而,由于各类模型修改技术的普遍应用以及缺乏标准化评估,其可靠性仍存在不确定性。在本系统性研究(SoK)中,我们首次对LLM指纹识别技术进行了全面研究。
Bridging Literature and the Universe Via A Multi-Agent Large Language Model System
本文介绍了SIMAGENTS,这是一个基于多智能体大语言模型(LLM)的系统,旨在自动化宇宙学模拟中的参数配置和初步分析流程,以解决物理学家在处理复杂模拟时面临的文献参数提取困难、软件适配繁琐等问题。核心功能:SIMAGENTS由三个专业化智能体组成——PhysicsAgent(解析文献提取物理参数)、SoftwareAgent(验证参数是否符合模拟软件要求)、AnalysisCodeWriter(生成模拟结果分析代码)。
Model-Driven Quantum Code Generation Using Large Language Models and Retrieval-Augmented Generation
本文提出了一种新的研究方向,即利用大型语言模型(LLMs)实现模型到文本/代码的转换,且这些LLMs可通过检索增强生成(RAG)管道进行增强。研究重点聚焦于量子及混合量子-经典软件系统,在这类系统中,模型驱动方法有助于降低成本,并缓解因平台异构性以及开发者技能不足所带来的风险。本文对其中一项提出的理念进行了验证,该理念旨在从软件系统的UML模型实例中生成代码。所生成的Python代码采用了成熟的Qiskit库,可在基于门或基于电路的量子计算机上执行。
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
多模态大语言模型(MLLMs)在疾病诊断、临床决策等医疗应用中具有巨大潜力。然而,这些任务需要高度准确、语境敏感且符合专业标准的响应,因此可靠的奖励模型和评估器至关重要。尽管其意义重大,医疗奖励模型(MRMs)和评估器的研究仍处于探索阶段,目前尚无针对临床需求的专用基准。现有基准要么聚焦于通用MLLM的能力评估,要么将模型作为“求解器”进行测试,忽略了诊断准确性、临床相关性等关键评估维度。为解决这一问题,我们提出——首个专为评估医疗场景下MRMs和评估器设计的基准。
Enhancing Vaccine Safety Surveillance: Extracting Vaccine Mentions from Emergency Department Tria...
本文旨在评估微调后的Llama3.2模型在从急诊科分诊记录中提取疫苗相关信息的效果,以支持近实时的疫苗安全监测。研究通过提示工程初步创建标注数据集,经人工标注者确认后,用于微调Llama模型,并将提示工程模型、微调模型与基于规则的方法进行性能对比。结果显示,微调后的30亿参数Llama模型在提取疫苗名称的准确性上表现最优;模型量化技术使其能在资源受限环境中高效部署。研究证实,大型语言模型(LLMs)在自动化提取急诊科记录数据方面具有潜力,可助力高效的疫苗安全监测及免疫接种后不良事件(AEFI)的早期发现。
A Serverless Architecture for Real-Time Stock Analysis using Large Language Models: An Iterative ...
强大且易获取的大型语言模型(如Google的Gemini)的出现,为金融数据分析的民主化带来了新机遇。本文记录了一个用于实时股票分析的新型无服务器系统的设计、实现与迭代调试过程。该系统利用GeminiAPI进行定性评估,通过GitHubActions实现数据获取与处理的自动化,并通过解耦的静态前端展示结果。我们详细描述了系统的架构演进(从初始概念到稳健的事件驱动pipeline),重点突出了部署过程中遇到的实际挑战。
Quantum-Accelerated Neural Imputation with Large Language Models (LLMs)
缺失数据是现实世界数据集面临的关键挑战,会显著降低机器学习模型的性能。尽管大语言模型(LLMs)最近在表格数据插补中展现出卓越能力(如UnIMP等框架),但它们对经典嵌入方法的依赖往往限制了其捕捉复杂非线性相关性的能力,尤其是在包含数值、分类和文本特征的混合类型数据场景中。本文提出了Quantum-UnIMP,这是一种将浅层量子电路集成到基于LLMs的插补架构中的新型框架。我们的核心创新在于,用瞬时量子多项式(IQP)电路生成的量子特征映射替代传统的经典输入嵌入。
ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety
阴谋论削弱公众对科学和机构的信任,且通过演变和吸收反证来抵抗反驳。随着人工智能生成的虚假信息日益复杂,理解阴谋论内容中的修辞模式对于制定针对性预干预(如提前辟谣)和评估人工智能漏洞至关重要。本文引入CONSPIRED(阴谋论评估数据集),该数据集基于CONSPIR认知框架(Lewandowsky&Cook,2020),对来自在线阴谋论文章的多句片段(80-120词)标注阴谋论认知特征,是首个标注通用阴谋论认知特征的数据集。
Large Language Models (LLMs) for Electronic Design Automation (EDA)
跨环节的系统性整合视角:并非孤立研究LLM在EDA单一环节的应用,而是覆盖从前端设计、HLS、测试、验证到物理实现的全流程,提出LLM驱动的智能代理构想,旨在统一多模态数据(自然语言、HDL、原理图等),实现全流程自动化与集成化设计。实用化的技术框架设计:针对HLS这一关键环节,提出“错误检测-代码修复-功能验证-性能优化”的闭环程序修复框架,以及“测试台适配-变量监测-输入生成-冗余过滤”的行为差异测试框架,解决实际设计中的兼容性与一致性问题。硬件设计自动化的优化。
