Loading...
研究目标:探索LLMs适应特定学科需求的关键技术方法、分析其在数学、物理、化学、生物、人文社科等领域的实际应用、梳理跨学科协作中的挑战与机遇。技术方法:将LLMs的适配技术分为两类——内部知识优化(如持续预训练、监督微调、人类反馈强化学习)和外部交互协作(如提示工程、检索增强生成、智能体方法、工具集成),并对比了各类技术的优缺点及适用场景。学科应用。
Agentic Large Language Models for Conceptual Systems Engineering and Design
本文研究了基于大型语言模型(LLMs)的多智能体系统(MAS)在概念系统工程与设计中的应用,以太阳能水处理系统为目标案例,对比了九角色多智能体系统(MAS)与两智能体系统(2AS)的性能。核心方法:提出“设计状态图(DSG)”,一种JSON可序列化的图形表示,将需求、物理实现和基于Python的物理模型整合到节点中;通过实验对比MAS(九种角色分工)和2AS(生成器-反射器循环)在需求提取、功能分解、模拟器代码生成等任务中的表现。实验设置。
Automating Expert-Level Medical Reasoning Evaluation of Large Language Models
本文针对大型语言模型(LLMs)在临床决策中应用时的医学推理能力评估问题,提出了一套解决方案。MedThink-Bench基准数据集:包含500个复杂医学问题,覆盖10个医学领域(如病理学、诊断、治疗等),每个问题均由医学专家标注细粒度、分步的推理轨迹,模拟真实临床逻辑。LLM-w-Ref评估框架:结合专家精心设计的细粒度推理过程与“LLM作为评判者”(LLM-as-a-Judge)机制,实现对LLMs中间推理过程的自动化、可扩展评估,且评估结果与专家判断高度一致。实验发现。
Geospatial Question Answering on Historical Maps Using Spatio-Temporal Knowledge Graphs and Large...
近年来的技术进步已实现从数字历史地图中提取矢量化特征。然而,要充分利用这些信息,提取出的特征必须以结构化且有意义的方式组织,以支持高效的访问和使用。问答(QA)是一种很有前景的方法,它能让用户(尤其是不熟悉数据库查询语言的用户)以自然、直观的方式获取知识。在本研究项目中,我们通过整合从历史地图数据构建的时空知识图谱(KG)与大语言模型(LLM),开发了一个地理空间问答(GeoQA)系统。具体而言,我们定义了用于指导时空知识图谱构建的本体,并研究了事实型和描述型这两种不同类型地理空间问答的工作流程。
EconAgentic in DePIN Markets: A Large Language Model Approach to the Sharing Economy of Decentral...
去中心化物理基础设施(DePIN)市场正通过代币经济和治理去中心化运营的智能合约革新共享经济。截至2024年,DePIN项目市值已突破100亿美元,彰显其快速增长态势。然而,这类市场的无监管属性,加之智能合约中人工智能(AI)代理的自主部署,引发了效率低下、可能与人类价值观偏离等风险。为应对这些问题,本文提出EconAgentic框架——一种基于大语言模型(LLM)的解决方案,旨在缓解上述挑战。本研究聚焦三大核心领域:1)构建DePIN市场动态演化模型;2)评估利益相关者行为及其经济影响;
Large Language Models and Non-Negative Matrix Factorization for Bioacoustic Signal Decomposition
本文提出了一种结合大型语言模型(LLMs)和非负矩阵分解(NMF)的生物声学信号分析框架,旨在解决临床记录中生物声学信号(如心肺信号)重叠导致的分离与解读难题。研究背景:传统信号分离技术依赖专家解读,在嘈杂环境中可靠性低;NMF作为无监督盲源分离方法,可将复杂信号分解为可解释的成分,但缺乏临床意义关联能力。方法设计数据采集:使用数字听诊器在临床人体模型上获取受控的心肺重叠信号;信号分解:通过短时傅里叶变换(STFT)将信号转换为时空表示,再用NMF分解为混合矩阵(W)和源信号矩阵(H);
Prompt4Trust: A Reinforcement Learning Prompt Augmentation Framework for Clinically-Aligned Confi...
多模态大型语言模型(MLLMs)在医疗健康领域的应用具有巨大潜力。然而,它们在安全关键场景中的部署受到两个关键限制的阻碍:(i)对提示设计的敏感性;(ii)倾向于生成高置信度的错误响应。由于临床医生可能依赖模型声明的置信度来评估其预测的可靠性,因此当模型表达高置信度时,其准确性也必须很高,这一点尤为重要。我们提出了Prompt4Trust,这是首个针对MLLMs置信度校准的强化学习(RL)提示增强框架。
Can Large Language Models Understand As Well As Apply Patent Regulations to Pass a Hands-On Paten...
本文聚焦大语言模型(LLMs)在专利法律领域的实际应用能力,通过评估多个开源及专有LLMs(如GPT系列、Anthropic、Llama-3等)在欧洲专利代理人资格考试(EQE)中的表现,探究其理解和应用专利法规的能力。模型表现差异:OpenAIo1表现最优,准确率达0.82,F1分数0.81;而AWSLlama3.18B准确率仅0.50,接近随机猜测水平。所有模型均未达到通过考试所需的0.90准确率阈值,即使是被宣传为“超越博士或执业律师水平”的模型。关键影响因素。
Finding Common Ground: Using Large Language Models to Detect Agreement in Multi-Agent Decision Co...
决策会议是一种结构化的协作会议,它汇聚不同领域的专家以解决复杂问题,并就未来行动或政策的建议达成共识。这类会议通常依赖引导式讨论来确保富有成效的对话和集体共识。近年来,大型语言模型(LLMs)在模拟现实场景中展现出巨大潜力,尤其是通过模仿群体互动的协作式多智能体系统。本文提出了一种基于LLM的新型多智能体系统,旨在模拟决策会议,重点关注检测参与智能体之间的共识。
Automated Bug Triaging using Instruction-Tuned Large Language Models
人工缺陷分类速度慢、一致性差,在大型软件项目中已逐渐难以维持。本文提出一种基于指令微调的项目专属大型语言模型(LLM),用于自动化缺陷分类,该模型整合了候选约束解码技术,可确保开发者分配结果的有效性。我们的框架以8B参数的DeepSeek-R1-Distill-Llama-8B模型为基础,利用从EclipseJDT和Mozilla缺陷跟踪数据中提取的对话式JSONL格式数据,对LoRA适配器进行微调。该方法无需手工特征、图构建或复杂预处理,仅需极少工程工作量即可快速适配新项目。
Operational Validation of Large-Language-Model Agent Social Simulation: Evidence from Voat v/tech...
大型语言模型(LLMs)为生成式社交模拟提供了可能,这类模拟能够捕捉在线社交平台上受文化影响、遵循规范的互动行为。本研究以Voat平台(一个类似Reddit的另类右翼新闻聚合与讨论平台,2014-2020年活跃)为原型,构建了一个技术社区模拟。研究基于YSocial框架,从Voat的共享URL(涵盖30多个领域)中筛选固定技术链接目录作为模拟种子,并利用MADOC数据集的样本校准参数,以匹配Voat的v/technology社区特征。
Provable Benefits of In-Tool Learning for Large Language Models
配备检索、记忆或外部API的工具增强型语言模型正在重塑人工智能,但它们的理论优势仍未得到充分探索。本文通过证明工具内学习(外部检索)相对于权重内学习(记忆)在事实召回任务中的优势,解决了这一问题。我们发现,模型仅通过权重所能记忆的事实数量,从根本上受其参数数量的限制。相反,我们通过一种简单高效的电路结构证明,使用工具能够实现无界的事实召回。这些结果在受控实验中得到了验证——使用工具的模型始终优于依赖记忆的模型。
Leveraging Large Language Models for Generating Research Topic Ontologies: A Multi-Disciplinary S...
研究领域的本体与分类法对于科学知识的管理和组织至关重要,它们能够促进信息的高效分类、传播与检索。然而,此类本体的创建与维护是成本高昂且耗时的任务,通常需要多个领域专家协同完成。因此,该领域的本体往往存在不同学科覆盖不均衡、跨领域连接薄弱以及更新周期长等问题。本研究探究了多个大型语言模型(LLMs)在识别三个学术领域(生物医学、物理学、工程学)内研究主题间语义关系的能力。研究在三种不同条件下对模型进行评估:零样本提示、思维链提示以及基于现有本体的微调。
SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineer...
大型语言模型(LLMs)在软件工程领域的快速发展,暴露了现有基准测试集的关键局限性,尤其是广泛使用的SWEbench数据集。近期研究发现了严重的数据污染问题,例如SWEbench(Jimenez等人,2023)报告称,32.67%的成功补丁涉及直接的解决方案泄露,31.08%的补丁因测试用例不足而通过。我们提出了SWE-MERA,这是一个动态、持续更新的基准测试集,旨在通过自动化收集真实世界的GitHub问题并进行严格的质量验证,解决这些根本性挑战。
Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models
本文聚焦大型语言模型(LLMs)在面对微小提示编辑时的鲁棒性,旨在区分模型“好的敏感性”(对良性噪声不敏感)与“坏的敏感性”(对语义关键变化不敏感)。实验设计:选取50个LeetCode编程问题,设计三种扰动方案:渐进式欠指定:每次删除10%的tokens(模拟可忽略的良性噪声);词汇翻转:交换关键量词(如max↔min,模拟必须响应的语义变化);术语膨胀:将常见名词替换为晦涩技术术语(模拟重要性模糊的变化)。模型测试。
Quantifying Label-Induced Bias in Large Language Model Self- and Cross-Evaluations
大型语言模型(LLMs)正越来越多地被用于评估输出内容,但其判断可能受到干扰。本研究探究了ChatGPT、Gemini和Claude在四种条件(无标签、真实标签及两种虚假标签场景)下进行自评与跨模型评估时的偏差。研究中,每个模型生成的博客文章均由这三种模型通过“总体偏好投票”和“针对连贯性、信息量、简洁性的质量评分”两种方式进行评估,所有分数均以百分比形式呈现,以便直接对比。结果显示出显著的不对称性:无论内容实际质量如何,“Claude”标签始终能提高评分,而“Gemini”标签则持续降低评分。
SoK: Large Language Model Copyright Auditing via Fingerprinting
大型语言模型(LLM)凭借广泛的能力和高昂的训练资源投入,成为极具价值的知识产权,但它们仍面临版权侵权风险,例如未授权使用和模型窃取。LLM指纹识别技术作为一种非侵入式方法,通过提取和比较LLM的独特特征来识别侵权行为,为版权审计提供了一种极具潜力的解决方案。然而,由于各类模型修改技术的普遍应用以及缺乏标准化评估,其可靠性仍存在不确定性。在本系统性研究(SoK)中,我们首次对LLM指纹识别技术进行了全面研究。
Bridging Literature and the Universe Via A Multi-Agent Large Language Model System
本文介绍了SIMAGENTS,这是一个基于多智能体大语言模型(LLM)的系统,旨在自动化宇宙学模拟中的参数配置和初步分析流程,以解决物理学家在处理复杂模拟时面临的文献参数提取困难、软件适配繁琐等问题。核心功能:SIMAGENTS由三个专业化智能体组成——PhysicsAgent(解析文献提取物理参数)、SoftwareAgent(验证参数是否符合模拟软件要求)、AnalysisCodeWriter(生成模拟结果分析代码)。
Model-Driven Quantum Code Generation Using Large Language Models and Retrieval-Augmented Generation
本文提出了一种新的研究方向,即利用大型语言模型(LLMs)实现模型到文本/代码的转换,且这些LLMs可通过检索增强生成(RAG)管道进行增强。研究重点聚焦于量子及混合量子-经典软件系统,在这类系统中,模型驱动方法有助于降低成本,并缓解因平台异构性以及开发者技能不足所带来的风险。本文对其中一项提出的理念进行了验证,该理念旨在从软件系统的UML模型实例中生成代码。所生成的Python代码采用了成熟的Qiskit库,可在基于门或基于电路的量子计算机上执行。
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
多模态大语言模型(MLLMs)在疾病诊断、临床决策等医疗应用中具有巨大潜力。然而,这些任务需要高度准确、语境敏感且符合专业标准的响应,因此可靠的奖励模型和评估器至关重要。尽管其意义重大,医疗奖励模型(MRMs)和评估器的研究仍处于探索阶段,目前尚无针对临床需求的专用基准。现有基准要么聚焦于通用MLLM的能力评估,要么将模型作为“求解器”进行测试,忽略了诊断准确性、临床相关性等关键评估维度。为解决这一问题,我们提出——首个专为评估医疗场景下MRMs和评估器设计的基准。
