Loading...
情绪在日常和高压力任务中,对人类行为和认知都有着巨大的影响。在讨论是否将大型语言模型(LLMs)融入日常生活(例如,作为人类主体的代理或与人类主体互动)以及如何融入时,需要了解这些工具如何评估带有情绪色彩的刺激或情境,这一认知至关重要。在这些情况下,模型与人类行为的一致性,能够为LLMs在特定角色或互动中的有效性提供参考。为了增进这种理解,我们让多个主流的大型语言模型对一些数据集(包含单词和图像)进行评分,而这些数据集此前已由人类对其情绪内容进行过评分。
Automated Optimization Modeling through Expert-Guided Large Language Model Reasoning
优化建模(OM)是解决复杂决策问题的关键手段。然而,该过程耗时且易出错,严重依赖领域专家。尽管大型语言模型(LLMs)凭借其天然语言理解和推理能力,在应对这些挑战方面展现出潜力,但当前方法仍面临三大关键局限:基准标注错误率高达42%;评估范围狭窄,仅考虑最优值;因过度依赖多智能体系统或模型微调,导致计算效率低下。在本研究中,我们首先通过系统纠错和更全面的标注来优化现有数据集。此外,我们引入LogiOR——一个来自物流领域的新型优化建模基准,包含更多具有标准化标注的复杂问题。
Investigation of the Inter-Rater Reliability between Large Language Models and Human Raters in Qu...
定性分析通常受限于小型数据集,因为其耗时费力。此外,为确保研究结果的可靠性,还需要第二名人类评分者参与。如果能证明人工智能工具与人类评分结果相比具有较高的可靠性,那么它们就有可能取代人类评分者。本研究探究了最先进的大型语言模型(LLMs)——ChatGPT-4o和ChatGPT-4.5-preview,在对人工编码的音频转录文本进行评分时的评分者间信度。我们通过探索提示词和超参数来优化模型性能。研究参与者是来自美国中西部某大学的14个本科学生小组,这些小组就某个项目的问题解决策略展开了讨论。
Scalable Scientific Interest Profiling Using Large Language Models
目的:研究画像能够凸显科研人员的研究重点,为人才发现和合作搭建提供支持,但这些画像往往存在信息过时的问题。目前迫切需要自动化、可扩展的方法来保持这些画像的时效性。方法:本研究设计并评估了两种基于大型语言模型(LLMs)的学术兴趣画像生成方法——一种通过总结研究者在PubMed上的出版物摘要生成画像,另一种利用出版物的医学主题词(MeSH术语)生成摘要,并将这些机器生成的画像与研究者自我总结的兴趣画像进行对比。
GTool: Graph Enhanced Tool Planning with Large Language Model
基于大语言模型(LLMs)的工具规划,指选择、组织并准备完成用户请求所需的工具,是连接自然语言理解与任务执行的关键环节。然而,现有方法将不同工具视为孤立组件,未能利用工具固有的依赖关系,导致规划结果无效。由于工具依赖往往不完备,LLMs难以准确识别用户请求所需的合适工具,在大规模工具集场景下这一问题尤为突出。为解决该挑战,我们提出GTool——首个旨在增强LLMs在不完备依赖下工具规划能力的方法。GTool构建任务特异性工具图以高效筛选工具,并生成能为LLMs理解的,提供充足的依赖信息。
Mitigating Hallucinations in Large Language Models via Causal Reasoning
大型语言模型(LLMs)会产生逻辑不一致的幻觉,这类幻觉看似连贯却违背推理原则。近期研究表明,因果推理能力与此类幻觉存在负相关。然而,LLMs中现有的推理方法(如思维链(CoT)及其基于图的变体)均在语言token层面运行,并未对变量间的潜在因果关系进行建模,缺乏表示条件独立性或满足因果识别假设的能力。为填补这一空白,我们提出因果DAG构建与推理监督微调框架(CDCR-SFT):该框架通过监督微调训练LLMs,使其显式构建变量级别的有向无环图(DAG),再基于此图进行推理。
ALIGN: Word Association Learning for Cross-Cultural Generalization in Large Language Models
随着大型语言模型(LLMs)在跨文化交流中的应用日益广泛,其行为仍受预训练语料中过度代表的语言和观点的分布偏差影响。然而,由于文化知识有限且缺乏对有效学习方法的探索,建模和对齐文化仍是一项挑战。本研究提出一种成本高效、基于认知的解决方案:对母语者的自由词汇联想规范进行参数高效微调,这些规范编码了隐性的文化图式。研究利用Small-World-of-Words项目的英语(美国)和普通话词汇联想数据,通过监督微调(SFT)和基于PPO的偏好优化,对Llama-3.1-8B和Qwen-2.5-7B模型进行适配。
Unlearning at Scale: Implementing the Right to be Forgotten in Large Language Models
我们针对大型语言模型(LLMs)研究《通用数据保护条例》(GDPR)第17条规定的“被遗忘权”,并将“遗忘”(Unlearning)构建为可复现的系统级问题。我们的方法将训练视为确定性程序,同时记录最小化的微批次日志(含有序ID哈希、随机数种子(RNGseed)、学习率值、优化器步数计数器及累积边界)。在固定的计算栈与确定性核函数前提下,若满足前置条件,过滤“待遗忘数据闭包”并回放训练后期过程,可得到与仅用“保留数据”训练完全一致的模型参数(训练数据类型下的位级一致)。
Credence Calibration Game? Calibrating Large Language Models through Structured Play
随着大型语言模型(LLMs)在决策关键领域的应用日益广泛,确保其置信度估计与实际正确性准确匹配变得至关重要。现有校准方法主要集中于后处理调整或辅助模型训练;然而,这些方法中的许多都需要额外的监督数据或参数更新。在本研究中,我们受“可信度校准游戏”(CredenceCalibrationGame)的启发,提出了一种新颖的基于提示词的校准框架。该方法构建了一个结构化的交互循环,在该循环中,LLMs会根据其预测置信度与正确性的匹配程度接收反馈。
The Prompting Brain: Neurocognitive Markers of Expertise in Guiding Large Language Models
提示工程已迅速成为与大型语言模型(LLMs)高效交互的关键技能。然而,该专业能力背后的认知与神经基础仍未得到充分探索。本文呈现了一项横断面前瞻性功能性磁共振成像(fMRI)研究的结果,旨在探究提示工程专家与中级从业者在大脑功能连接及网络活动上的差异。研究结果揭示了与更高提示工程素养相关的独特神经标记,包括左中颞回、左额极等脑区功能连接增强,以及关键认知网络中功率-频率动态的改变。这些发现为提示工程专业能力的神经生物学基础提供了初步见解。
Large Language Models as Visualization Agents for Immersive Binary Reverse Engineering
沉浸式虚拟现实(VR)具备降低二进制逆向工程(RE)认知复杂度的潜力,可通过增强记忆、假设验证和视觉组织,借助具身认知与外部认知辅助逆向工程过程。在前期研究中,我们采用认知系统工程方法确定了初始的功能集合,并开发了一个VR环境,通过空间持久性和交互性支持逆向工程。本研究对该平台进行扩展,集成了一个大型语言模型(LLM)代理,该代理能够查询二进制分析工具、回答技术问题,并根据分析师的任务动态生成沉浸式3D可视化结果。我们阐述了系统架构、评估流程与结果。
Uncovering Emergent Physics Representations Learned In-Context by Large Language Models
大型语言模型(LLMs)展现出令人印象深刻的上下文学习(ICL)能力,仅通过文本提示就能解决各类任务。随着这些能力的不断发展,其适用领域也在显著拓展。然而,LLMs内部究竟通过何种精确机制或结构,实现对不同类别任务的有效上下文学习,目前仍不明确。基于物理的任务为探究这一难题提供了理想的测试平台。与基础算术或符号方程等合成序列不同,物理系统基于基本原理的结构化动力学,能提供可实验控制的真实世界数据。这一特性使其成为在真实且可控的场景下,研究LLMs涌现推理行为的绝佳选择。
Strengthening Programming Comprehension in Large Language Models through Code Generation
大型语言模型(LLMs)得益于大规模训练和指令微调,近期在各类与代码相关的任务中展现出令人印象深刻的成果。然而,研究表明,它们对数据流程、控制流程等基础编程概念的掌握仍较为浅显,这导致当代码需要深度推理时,其性能表现不稳定。这一局限性制约了LLMs在实际软件开发场景中的应用。为解决该问题,本研究提出一种结合概念感知微调的反事实代码增强框架,旨在引导LLMs形成更扎实的概念理解能力。在多种模型和基准数据集上开展的全面评估结果,验证了所提方法的有效性。
LinguaSafe: A Comprehensive Multilingual Safety Benchmark for Large Language Models
大型语言模型(LLMs)在全球技术领域的广泛应用及其重要性日益提升,这使得在多样化的语言和文化背景下确保其安全性成为一项必须严格关注的任务。现有针对LLMs的多语言安全评估中,缺乏全面的评估方法和多样化的数据,这限制了评估的有效性,阻碍了稳健的多语言安全对齐技术的发展。为填补这一关键空白,我们提出了LinguaSafe——一个精心构建、注重语言真实性的综合多语言安全基准。LinguaSafe数据集包含12种语言(从匈牙利语到马来语)的45000条数据。
MATA (m\=ata): Mindful Assessment of the Telugu Abilities of Large Language Models
本文提出MATA(మాట,意为“单词”)——一个全新的评估数据集,用于测试大语言模型(LLMs)的泰卢固语能力。该数据集包含729道精心筛选的选择题和开放式问题,覆盖多个语言维度。我们在该数据集上对11个开源和闭源LLM进行了评估,并对其性能展开细粒度分析。此外,我们通过实证研究发现,LLM在解答选择题时会依赖答案位置、干扰项模式等表面线索。最后,我们还将“LLM作为评判者”的评估方式与人工评估在开放式问题上的结果进行对比,就其在低资源语言中的可靠性得出了相关结论。
SimInterview: Transforming Business Education through Large Language Model-Based Simulated Multil...
商业面试准备既需要扎实的理论基础,也需要精湛的软技能,但传统课堂教学方法往往无法提供雇主当前所期望的个性化、具备文化意识的练习。本文介绍了SimInterview,这是一款基于大型语言模型(LLM)的多语言模拟面试培训系统,专为进入AI变革劳动力市场的商业专业人士设计。该系统利用LLM智能体和合成AI技术,打造出能够进行个性化、实时对话式面试的逼真虚拟招聘官。其框架通过检索增强生成(RAG)技术动态适配面试场景,使个人简历与多种语言的特定职位要求相匹配。
Help or Hurdle? Rethinking Model Context Protocol-Augmented Large Language Models
模型上下文协议(MCP)支持大型语言模型(LLMs)按需访问外部资源。尽管人们普遍认为MCP能提升模型性能,但LLMs实际如何利用这一能力仍未得到充分研究。本文提出首个综合评估框架MCPGAUGE,从四个关键维度探究LLM-MCP交互:主动性(自主工具调用)、依从性(遵循工具使用指令)、有效性(集成后的任务性能)和开销(产生的计算成本)。MCPGAUGE包含160个提示词套件和25个数据集,覆盖知识理解、通用推理与代码生成任务。
E3RG: Building Explicit Emotion-driven Empathetic Response Generation System with Multimodal Larg...
多模态共情响应生成(MERG)对于构建具备情感智能的人机交互至关重要。尽管大语言模型(LLMs)已提升了基于文本的共情响应生成(ERG)性能,但在处理多模态情感内容与维持身份一致性方面仍面临挑战。为此,本文提出E3RG系统——一种基于多模态大语言模型(MLLMs)的显式情感驱动共情响应生成系统,该系统将MERG任务拆解为三个部分:多模态共情理解、共情记忆检索与多模态响应生成。通过整合先进的富表现力语音生成模型与视频生成模型,E3RG无需额外训练即可生成自然、情感丰富且身份一致的响应。
Neuro-Symbolic Artificial Intelligence: Towards Improving the Reasoning Abilities of Large Langua...
LLMs推理现状:LLMs在多任务中表现出色,但复杂推理能力薄弱,仅能复现训练数据中的推理步骤,无法实现真正的逻辑推理,而强推理能力是通往通用人工智能(AGI)的关键里程碑。推理任务形式化:给定输入问题Q和背景知识K,推理目标是通过推理路径Z(由一系列中间步骤z1z2znz1z2...zn组成)得到答案A,满足AfQKA=f(Q,K)AfQK(f为映射函数),且每个中间步骤zigiQKz1zi−1zigiQK。
Large Language Models Enable Personalized Nudges to Promote Carbon Offsetting Among Air Travellers
助推策略是促进可持续行为的有效工具,但其效果取决于个体偏好。通过模拟人类决策,大型语言模型(LLMs)为无需大量行为数据即可定制助推策略提供了一种经济高效的途径,然而这一潜力尚未得到充分探索。本研究聚焦航空领域,利用LLMs设计基于个性化诱饵的助推策略,鼓励航空旅行者自愿抵消航班产生的二氧化碳排放,并通过来自中国、德国、印度、新加坡和美国的3495份调查数据验证其有效性。结果表明,基于LLM的个性化助推策略比统一策略更有效,可将碳抵消率提升3%-7%,每年可为航空业额外减少230万吨二氧化碳排放。
