Loading...
随着大型语言模型(LLMs)在决策关键领域的应用日益广泛,确保其置信度估计与实际正确性准确匹配变得至关重要。现有校准方法主要集中于后处理调整或辅助模型训练;然而,这些方法中的许多都需要额外的监督数据或参数更新。在本研究中,我们受“可信度校准游戏”(CredenceCalibrationGame)的启发,提出了一种新颖的基于提示词的校准框架。该方法构建了一个结构化的交互循环,在该循环中,LLMs会根据其预测置信度与正确性的匹配程度接收反馈。
The Prompting Brain: Neurocognitive Markers of Expertise in Guiding Large Language Models
提示工程已迅速成为与大型语言模型(LLMs)高效交互的关键技能。然而,该专业能力背后的认知与神经基础仍未得到充分探索。本文呈现了一项横断面前瞻性功能性磁共振成像(fMRI)研究的结果,旨在探究提示工程专家与中级从业者在大脑功能连接及网络活动上的差异。研究结果揭示了与更高提示工程素养相关的独特神经标记,包括左中颞回、左额极等脑区功能连接增强,以及关键认知网络中功率-频率动态的改变。这些发现为提示工程专业能力的神经生物学基础提供了初步见解。
Large Language Models as Visualization Agents for Immersive Binary Reverse Engineering
沉浸式虚拟现实(VR)具备降低二进制逆向工程(RE)认知复杂度的潜力,可通过增强记忆、假设验证和视觉组织,借助具身认知与外部认知辅助逆向工程过程。在前期研究中,我们采用认知系统工程方法确定了初始的功能集合,并开发了一个VR环境,通过空间持久性和交互性支持逆向工程。本研究对该平台进行扩展,集成了一个大型语言模型(LLM)代理,该代理能够查询二进制分析工具、回答技术问题,并根据分析师的任务动态生成沉浸式3D可视化结果。我们阐述了系统架构、评估流程与结果。
Uncovering Emergent Physics Representations Learned In-Context by Large Language Models
大型语言模型(LLMs)展现出令人印象深刻的上下文学习(ICL)能力,仅通过文本提示就能解决各类任务。随着这些能力的不断发展,其适用领域也在显著拓展。然而,LLMs内部究竟通过何种精确机制或结构,实现对不同类别任务的有效上下文学习,目前仍不明确。基于物理的任务为探究这一难题提供了理想的测试平台。与基础算术或符号方程等合成序列不同,物理系统基于基本原理的结构化动力学,能提供可实验控制的真实世界数据。这一特性使其成为在真实且可控的场景下,研究LLMs涌现推理行为的绝佳选择。
Strengthening Programming Comprehension in Large Language Models through Code Generation
大型语言模型(LLMs)得益于大规模训练和指令微调,近期在各类与代码相关的任务中展现出令人印象深刻的成果。然而,研究表明,它们对数据流程、控制流程等基础编程概念的掌握仍较为浅显,这导致当代码需要深度推理时,其性能表现不稳定。这一局限性制约了LLMs在实际软件开发场景中的应用。为解决该问题,本研究提出一种结合概念感知微调的反事实代码增强框架,旨在引导LLMs形成更扎实的概念理解能力。在多种模型和基准数据集上开展的全面评估结果,验证了所提方法的有效性。
LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models
大型语言模型(LLMs)在全球技术领域的广泛应用及其重要性日益提升,这使得在多样化的语言和文化背景下确保其安全性成为一项必须严格关注的任务。现有针对LLMs的多语言安全评估中,缺乏全面的评估方法和多样化的数据,这限制了评估的有效性,阻碍了稳健的多语言安全对齐技术的发展。为填补这一关键空白,我们提出了LinguaSafe——一个精心构建、注重语言真实性的综合多语言安全基准。LinguaSafe数据集包含12种语言(从匈牙利语到马来语)的45000条数据。
MATA (m\=ata): Mindful Assessment of the Telugu Abilities of Large Language Models
本文提出MATA(మాట,意为“单词”)——一个全新的评估数据集,用于测试大语言模型(LLMs)的泰卢固语能力。该数据集包含729道精心筛选的选择题和开放式问题,覆盖多个语言维度。我们在该数据集上对11个开源和闭源LLM进行了评估,并对其性能展开细粒度分析。此外,我们通过实证研究发现,LLM在解答选择题时会依赖答案位置、干扰项模式等表面线索。最后,我们还将“LLM作为评判者”的评估方式与人工评估在开放式问题上的结果进行对比,就其在低资源语言中的可靠性得出了相关结论。
SimInterview: Transforming Business Education through Large Language Model-Based Simulated Multil...
商业面试准备既需要扎实的理论基础,也需要精湛的软技能,但传统课堂教学方法往往无法提供雇主当前所期望的个性化、具备文化意识的练习。本文介绍了SimInterview,这是一款基于大型语言模型(LLM)的多语言模拟面试培训系统,专为进入AI变革劳动力市场的商业专业人士设计。该系统利用LLM智能体和合成AI技术,打造出能够进行个性化、实时对话式面试的逼真虚拟招聘官。其框架通过检索增强生成(RAG)技术动态适配面试场景,使个人简历与多种语言的特定职位要求相匹配。
Help or Hurdle? Rethinking Model Context Protocol-Augmented Large Language Models
模型上下文协议(MCP)支持大型语言模型(LLMs)按需访问外部资源。尽管人们普遍认为MCP能提升模型性能,但LLMs实际如何利用这一能力仍未得到充分研究。本文提出首个综合评估框架MCPGAUGE,从四个关键维度探究LLM-MCP交互:主动性(自主工具调用)、依从性(遵循工具使用指令)、有效性(集成后的任务性能)和开销(产生的计算成本)。MCPGAUGE包含160个提示词套件和25个数据集,覆盖知识理解、通用推理与代码生成任务。
E3RG: Building Explicit Emotion-driven Empathetic Response Generation System with Multimodal Larg...
多模态共情响应生成(MERG)对于构建具备情感智能的人机交互至关重要。尽管大语言模型(LLMs)已提升了基于文本的共情响应生成(ERG)性能,但在处理多模态情感内容与维持身份一致性方面仍面临挑战。为此,本文提出E3RG系统——一种基于多模态大语言模型(MLLMs)的显式情感驱动共情响应生成系统,该系统将MERG任务拆解为三个部分:多模态共情理解、共情记忆检索与多模态响应生成。通过整合先进的富表现力语音生成模型与视频生成模型,E3RG无需额外训练即可生成自然、情感丰富且身份一致的响应。
Neuro-Symbolic Artificial Intelligence: Towards Improving the Reasoning Abilities of Large Langua...
LLMs推理现状:LLMs在多任务中表现出色,但复杂推理能力薄弱,仅能复现训练数据中的推理步骤,无法实现真正的逻辑推理,而强推理能力是通往通用人工智能(AGI)的关键里程碑。推理任务形式化:给定输入问题Q和背景知识K,推理目标是通过推理路径Z(由一系列中间步骤z1z2znz1z2...zn组成)得到答案A,满足AfQKA=f(Q,K)AfQK(f为映射函数),且每个中间步骤zigiQKz1zi−1zigiQK。
Large Language Models Enable Personalized Nudges to Promote Carbon Offsetting Among Air Travellers
助推策略是促进可持续行为的有效工具,但其效果取决于个体偏好。通过模拟人类决策,大型语言模型(LLMs)为无需大量行为数据即可定制助推策略提供了一种经济高效的途径,然而这一潜力尚未得到充分探索。本研究聚焦航空领域,利用LLMs设计基于个性化诱饵的助推策略,鼓励航空旅行者自愿抵消航班产生的二氧化碳排放,并通过来自中国、德国、印度、新加坡和美国的3495份调查数据验证其有效性。结果表明,基于LLM的个性化助推策略比统一策略更有效,可将碳抵消率提升3%-7%,每年可为航空业额外减少230万吨二氧化碳排放。
COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models
当前的代码生成基准主要聚焦于功能正确性,却忽略了实际编程中两个关键维度:算法效率与代码质量。本文提出COMPASS(即Codility多维度编程评估基准,COdility’sMulti-dimensionalProgrammingASSessment),这是一个全面的评估框架,可从正确性、效率、质量三个维度评估代码生成能力。COMPASS包含50道来自Codility真实竞赛的编程题目,并提供来自393,150条人类提交数据的真实基线。
The Curious Case of Analogies: Investigating Analogical Reasoning in Large Language Models
类比推理是人类认知的核心,为各类智力活动奠定重要基础。尽管已有研究表明大型语言模型(LLMs)能够表示任务模式和表层概念,但这些模型是否能编码高层关系概念并通过结构化比较将其应用于新场景,仍有待探究。本文通过比例类比和故事类比探究这一核心问题,并得出三项关键发现。首先,LLMs能有效编码类比实体间的潜在关系;在正确推理案例中,属性信息和关系信息均会通过中上层网络传递,而推理失败则反映出这些网络层中缺失关系信息。
Cognitive Decision Routing in Large Language Models: When to Think Fast, When to Think Slow
理论融合创新:首次将卡尼曼双过程理论及认知偏差(如相关启发式、专家判断噪声)系统融入LLMs推理策略设计,提出“计算等价原则”“统计学习对齐”等3个理论映射原则,避免直接移植人类认知机制,适配AI信息处理特性。查询复杂度评估维度创新:明确提出四个可量化的查询复杂度维度(相关强度、领域交叉、利益相关者数量、不确定性),为推理策略选择提供客观依据,区别于传统基于置信度或长度的单一维度评估。动态路由框架创新。
The Cultural Gene of Large Language Models: A Study on the Impact of Cross-Corpus Training on Mod...
大型语言模型(LLMs)正在全球范围内部署,但其背后潜藏的文化与伦理假设尚未得到充分探索。本文旨在研究“文化基因”这一概念——即LLMs从训练语料中继承的系统性价值倾向。我们提出了一种以“文化探针数据集(CPD)”为核心的全新方法,该数据集用于从跨文化心理学的关键维度(具体为个人主义-集体主义(IDV)和权力距离(PDI))对模型进行评估。通过对西方中心模型(GPT-4)与东方中心模型(文心一言)开展大规模对比研究,我们提供了强有力的定量和定性证据,证明两类模型存在显著的文化差异。
MedKGent: A Large Language Model Agent Framework for Constructing Temporally Evolving Medical Kno...
医疗文献的快速增长给领域知识的规模化结构化与整合带来了日益严峻的挑战。知识图谱(KGs)为解决这一问题提供了广阔前景,它能够实现高效检索、自动推理和知识发现。然而,当前的知识图谱构建方法往往依赖泛化性有限的有监督流水线,或者简单地聚合大语言模型(LLMs)的输出结果。这些方法将生物医学语料视为静态数据,忽略了知识演化过程中的时间动态性和语境不确定性。为克服这些局限,我们提出了MedKGent——一个用于构建随时间演化的医疗知识图谱的大语言模型代理框架。
Scaling Item-to-Standard Alignment with Large Language Models: Accuracy, Limits, and Solutions
随着教育系统的发展,确保评估项目与内容标准保持对齐,对于维护公平性和教学相关性至关重要。传统人工对齐审核虽准确,但速度慢且劳动强度大,尤其在大规模题库场景中难以规模化。本研究探讨大型语言模型(LLMs)能否在不牺牲准确性的前提下加速这一过程。利用K-5年级的12,000余条项目-技能对,我们在三项模拟真实挑战的任务中测试了三款LLM(GPT-3.5Turbo、GPT-4o-mini和GPT-4o):识别错位项目、从全量标准中选择正确技能、分类前缩小候选列表范围。
A Systematic Analysis of Large Language Models with RAG-enabled Dynamic Prompting for Medical Err...
该研究聚焦临床文档中的医疗错误检测与修正问题,系统分析了三种提示策略(零样本提示、随机示例静态提示SPR、检索增强生成动态提示RDP)在9种指令微调大语言模型(含GPT系列、Claude、Gemini等)上的表现,通过MEDEC数据集完成错误标记检测、错误句子检测、错误修正三个子任务的评估。零样本提示在非典型错误和缩写密集型错误检测中召回率低;SPR虽提升召回率,但显著增加假阳性率(FPR);
LLM Weekly(2026.8.10-2026.8.16)
隐藏信息准确性从个体的近100%下降到17-36%,相互矛盾的指令升级为恶意软件和账户锁定,协调的智能体群组发现了266个漏洞,而并行独立运行的智能体仅发现21个。OpenAI发布了GPT-5.6-Cyber,这是一个基于GPT-5.6Sol构建的安全专用模型,用于漏洞研究、漏洞验证和渗透测试,在内部高级网络评估中完成了95%的请求。不同于蒸馏到权重中,一个更强的“构建器”模型使用5%的数据作为验证集,为较弱的目标模型迭代构建一个推理时的工具包。
