Loading...

Cultural Bias in Large Language Models: Evaluating AI Agents through Moral Questionnaires
本文聚焦大型语言模型(LLMs)中的文化偏见问题,通过在19个文化背景下应用《道德基础问卷(MFQ-2)》,系统评估了LLMs对不同文化道德框架的表征能力。LLMs未能有效呈现多样化的文化道德框架,反而系统性地同质化道德多样性,其生成的道德响应与人类直觉存在显著差距;模型规模(参数数量)的增加并未持续提升文化表征的准确性,部分小型模型(如Qwen2.57B)表现优于同系列大型模型;西方文化视角在LLMs中表征更优,而非西方视角(如日本)存在显著偏差;

SLIM: A Heterogeneous Accelerator for Edge Inference of Sparse Large Language Model via Adaptive ...
本文提出了一种名为SLIM的异构加速器,旨在解决资源受限的边缘设备上稀疏大语言模型(LLM)推理的效率问题。LLM虽在自然语言处理中表现卓越,但因其模型规模庞大、内存密集型操作(如前馈网络FFN和多头注意力MHA),在边缘设备上高效推理面临挑战。SLIM通过算法与硬件协同设计,充分利用LLM的稀疏性(推理中多数神经元未激活),仅处理激活的神经元以减少数据移动。算法层面:提出基于自适应阈值的高效推理算法,支持运行时可配置的稀疏性,且精度损失可忽略;硬件层面。

AICrypto: A Comprehensive Benchmark For Evaluating Cryptography Capabilities of Large Language Mo...
大型语言模型(LLMs)已在多个领域展现出卓越能力。然而,它们在作为网络安全基石的密码学领域的应用仍未得到充分探索。为填补这一空白,我们提出了AICrypto——首个旨在评估LLMs密码学能力的全面基准。该基准包含135道选择题、150个夺旗赛(CTF)挑战和18个证明题,覆盖从事实记忆到漏洞利用再到形式化推理的广泛技能。所有任务均由密码学专家仔细审核或构建,以确保正确性和严谨性。为支持CTF挑战的自动化评估,我们设计了一个基于代理的框架。

A Survey of Large Language Models in Discipline-specific Research: Challenges, Methods and Opport...
研究目标:探索LLMs适应特定学科需求的关键技术方法、分析其在数学、物理、化学、生物、人文社科等领域的实际应用、梳理跨学科协作中的挑战与机遇。技术方法:将LLMs的适配技术分为两类——内部知识优化(如持续预训练、监督微调、人类反馈强化学习)和外部交互协作(如提示工程、检索增强生成、智能体方法、工具集成),并对比了各类技术的优缺点及适用场景。学科应用。

Agentic Large Language Models for Conceptual Systems Engineering and Design
本文研究了基于大型语言模型(LLMs)的多智能体系统(MAS)在概念系统工程与设计中的应用,以太阳能水处理系统为目标案例,对比了九角色多智能体系统(MAS)与两智能体系统(2AS)的性能。核心方法:提出“设计状态图(DSG)”,一种JSON可序列化的图形表示,将需求、物理实现和基于Python的物理模型整合到节点中;通过实验对比MAS(九种角色分工)和2AS(生成器-反射器循环)在需求提取、功能分解、模拟器代码生成等任务中的表现。实验设置。

Automating Expert-Level Medical Reasoning Evaluation of Large Language Models
本文针对大型语言模型(LLMs)在临床决策中应用时的医学推理能力评估问题,提出了一套解决方案。MedThink-Bench基准数据集:包含500个复杂医学问题,覆盖10个医学领域(如病理学、诊断、治疗等),每个问题均由医学专家标注细粒度、分步的推理轨迹,模拟真实临床逻辑。LLM-w-Ref评估框架:结合专家精心设计的细粒度推理过程与“LLM作为评判者”(LLM-as-a-Judge)机制,实现对LLMs中间推理过程的自动化、可扩展评估,且评估结果与专家判断高度一致。实验发现。

Geospatial Question Answering on Historical Maps Using Spatio-Temporal Knowledge Graphs and Large...
近年来的技术进步已实现从数字历史地图中提取矢量化特征。然而,要充分利用这些信息,提取出的特征必须以结构化且有意义的方式组织,以支持高效的访问和使用。问答(QA)是一种很有前景的方法,它能让用户(尤其是不熟悉数据库查询语言的用户)以自然、直观的方式获取知识。在本研究项目中,我们通过整合从历史地图数据构建的时空知识图谱(KG)与大语言模型(LLM),开发了一个地理空间问答(GeoQA)系统。具体而言,我们定义了用于指导时空知识图谱构建的本体,并研究了事实型和描述型这两种不同类型地理空间问答的工作流程。

EconAgentic in DePIN Markets: A Large Language Model Approach to the Sharing Economy of Decentral...
去中心化物理基础设施(DePIN)市场正通过代币经济和治理去中心化运营的智能合约革新共享经济。截至2024年,DePIN项目市值已突破100亿美元,彰显其快速增长态势。然而,这类市场的无监管属性,加之智能合约中人工智能(AI)代理的自主部署,引发了效率低下、可能与人类价值观偏离等风险。为应对这些问题,本文提出EconAgentic框架——一种基于大语言模型(LLM)的解决方案,旨在缓解上述挑战。本研究聚焦三大核心领域:1)构建DePIN市场动态演化模型;2)评估利益相关者行为及其经济影响;

Large Language Models and Non-Negative Matrix Factorization for Bioacoustic Signal Decomposition
本文提出了一种结合大型语言模型(LLMs)和非负矩阵分解(NMF)的生物声学信号分析框架,旨在解决临床记录中生物声学信号(如心肺信号)重叠导致的分离与解读难题。研究背景:传统信号分离技术依赖专家解读,在嘈杂环境中可靠性低;NMF作为无监督盲源分离方法,可将复杂信号分解为可解释的成分,但缺乏临床意义关联能力。方法设计数据采集:使用数字听诊器在临床人体模型上获取受控的心肺重叠信号;信号分解:通过短时傅里叶变换(STFT)将信号转换为时空表示,再用NMF分解为混合矩阵(W)和源信号矩阵(H);

Prompt4Trust: A Reinforcement Learning Prompt Augmentation Framework for Clinically-Aligned Confi...
多模态大型语言模型(MLLMs)在医疗健康领域的应用具有巨大潜力。然而,它们在安全关键场景中的部署受到两个关键限制的阻碍:(i)对提示设计的敏感性;(ii)倾向于生成高置信度的错误响应。由于临床医生可能依赖模型声明的置信度来评估其预测的可靠性,因此当模型表达高置信度时,其准确性也必须很高,这一点尤为重要。我们提出了Prompt4Trust,这是首个针对MLLMs置信度校准的强化学习(RL)提示增强框架。

Can Large Language Models Understand As Well As Apply Patent Regulations to Pass a Hands-On Paten...
本文聚焦大语言模型(LLMs)在专利法律领域的实际应用能力,通过评估多个开源及专有LLMs(如GPT系列、Anthropic、Llama-3等)在欧洲专利代理人资格考试(EQE)中的表现,探究其理解和应用专利法规的能力。模型表现差异:OpenAIo1表现最优,准确率达0.82,F1分数0.81;而AWSLlama3.18B准确率仅0.50,接近随机猜测水平。所有模型均未达到通过考试所需的0.90准确率阈值,即使是被宣传为“超越博士或执业律师水平”的模型。关键影响因素。

Finding Common Ground: Using Large Language Models to Detect Agreement in Multi-Agent Decision Co...
决策会议是一种结构化的协作会议,它汇聚不同领域的专家以解决复杂问题,并就未来行动或政策的建议达成共识。这类会议通常依赖引导式讨论来确保富有成效的对话和集体共识。近年来,大型语言模型(LLMs)在模拟现实场景中展现出巨大潜力,尤其是通过模仿群体互动的协作式多智能体系统。本文提出了一种基于LLM的新型多智能体系统,旨在模拟决策会议,重点关注检测参与智能体之间的共识。

Automated Bug Triaging using Instruction-Tuned Large Language Models
人工缺陷分类速度慢、一致性差,在大型软件项目中已逐渐难以维持。本文提出一种基于指令微调的项目专属大型语言模型(LLM),用于自动化缺陷分类,该模型整合了候选约束解码技术,可确保开发者分配结果的有效性。我们的框架以8B参数的DeepSeek-R1-Distill-Llama-8B模型为基础,利用从EclipseJDT和Mozilla缺陷跟踪数据中提取的对话式JSONL格式数据,对LoRA适配器进行微调。该方法无需手工特征、图构建或复杂预处理,仅需极少工程工作量即可快速适配新项目。

Operational Validation of Large-Language-Model Agent Social Simulation: Evidence from Voat v/tech...
大型语言模型(LLMs)为生成式社交模拟提供了可能,这类模拟能够捕捉在线社交平台上受文化影响、遵循规范的互动行为。本研究以Voat平台(一个类似Reddit的另类右翼新闻聚合与讨论平台,2014-2020年活跃)为原型,构建了一个技术社区模拟。研究基于YSocial框架,从Voat的共享URL(涵盖30多个领域)中筛选固定技术链接目录作为模拟种子,并利用MADOC数据集的样本校准参数,以匹配Voat的v/technology社区特征。

Provable Benefits of In-Tool Learning for Large Language Models
配备检索、记忆或外部API的工具增强型语言模型正在重塑人工智能,但它们的理论优势仍未得到充分探索。本文通过证明工具内学习(外部检索)相对于权重内学习(记忆)在事实召回任务中的优势,解决了这一问题。我们发现,模型仅通过权重所能记忆的事实数量,从根本上受其参数数量的限制。相反,我们通过一种简单高效的电路结构证明,使用工具能够实现无界的事实召回。这些结果在受控实验中得到了验证——使用工具的模型始终优于依赖记忆的模型。

Leveraging Large Language Models for Generating Research Topic Ontologies: A Multi-Disciplinary S...
研究领域的本体与分类法对于科学知识的管理和组织至关重要,它们能够促进信息的高效分类、传播与检索。然而,此类本体的创建与维护是成本高昂且耗时的任务,通常需要多个领域专家协同完成。因此,该领域的本体往往存在不同学科覆盖不均衡、跨领域连接薄弱以及更新周期长等问题。本研究探究了多个大型语言模型(LLMs)在识别三个学术领域(生物医学、物理学、工程学)内研究主题间语义关系的能力。研究在三种不同条件下对模型进行评估:零样本提示、思维链提示以及基于现有本体的微调。

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineer...
大型语言模型(LLMs)在软件工程领域的快速发展,暴露了现有基准测试集的关键局限性,尤其是广泛使用的SWEbench数据集。近期研究发现了严重的数据污染问题,例如SWEbench(Jimenez等人,2023)报告称,32.67%的成功补丁涉及直接的解决方案泄露,31.08%的补丁因测试用例不足而通过。我们提出了SWE-MERA,这是一个动态、持续更新的基准测试集,旨在通过自动化收集真实世界的GitHub问题并进行严格的质量验证,解决这些根本性挑战。

Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models
本文聚焦大型语言模型(LLMs)在面对微小提示编辑时的鲁棒性,旨在区分模型“好的敏感性”(对良性噪声不敏感)与“坏的敏感性”(对语义关键变化不敏感)。实验设计:选取50个LeetCode编程问题,设计三种扰动方案:渐进式欠指定:每次删除10%的tokens(模拟可忽略的良性噪声);词汇翻转:交换关键量词(如max↔min,模拟必须响应的语义变化);术语膨胀:将常见名词替换为晦涩技术术语(模拟重要性模糊的变化)。模型测试。

Quantifying Label-Induced Bias in Large Language Model Self- and Cross-Evaluations
大型语言模型(LLMs)正越来越多地被用于评估输出内容,但其判断可能受到干扰。本研究探究了ChatGPT、Gemini和Claude在四种条件(无标签、真实标签及两种虚假标签场景)下进行自评与跨模型评估时的偏差。研究中,每个模型生成的博客文章均由这三种模型通过“总体偏好投票”和“针对连贯性、信息量、简洁性的质量评分”两种方式进行评估,所有分数均以百分比形式呈现,以便直接对比。结果显示出显著的不对称性:无论内容实际质量如何,“Claude”标签始终能提高评分,而“Gemini”标签则持续降低评分。

SoK: Large Language Model Copyright Auditing via Fingerprinting
大型语言模型(LLM)凭借广泛的能力和高昂的训练资源投入,成为极具价值的知识产权,但它们仍面临版权侵权风险,例如未授权使用和模型窃取。LLM指纹识别技术作为一种非侵入式方法,通过提取和比较LLM的独特特征来识别侵权行为,为版权审计提供了一种极具潜力的解决方案。然而,由于各类模型修改技术的普遍应用以及缺乏标准化评估,其可靠性仍存在不确定性。在本系统性研究(SoK)中,我们首次对LLM指纹识别技术进行了全面研究。

欢迎留下您的脚印