Loading...

Rethinking Memorization Measures and their Implications in Large Language Models
本文围绕大语言模型(LLMs)中的记忆(memorization)现象展开研究,核心探讨了三个问题:最优语言学习中是否能避免记忆、记忆带来的隐私威胁是否被夸大、不同记忆度量方法的差异及影响。记忆度量方法的重新审视:分析了现有基于回忆的(recollection-based)和反事实的(counterfactual)记忆度量方法,并提出新的情境记忆(contextualmemorization)度量。

Automated Safety Evaluations Across 20 Large Language Models: The Aymara LLM Risk and Responsibil...
随着大型语言模型(LLMs)越来越多地融入现实世界应用,可扩展且严谨的安全评估变得至关重要。本文介绍了艾马拉AI(AymaraAI),这是一个用于生成和管理定制化、基于政策的安全评估的程序化平台。艾马拉AI将自然语言安全政策转化为对抗性提示,并使用经人类判断验证的AI评分器对模型响应进行评分。我们通过“艾马拉大语言模型风险与责任矩阵”展示了其能力,该矩阵在10个真实世界安全领域对20个商用LLM进行了评估。结果显示,模型表现差异显著,安全得分均值范围为86.2%至52.4%。

Large Language Models as Medical Codes Selectors: a benchmark using the International Classificat...
本文研究了大型语言模型(LLMs)在自动分配国际初级保健分类(ICPC-2)编码中的潜力,通过结合领域特定搜索引擎的输出,评估其在医疗编码任务中的性能。背景:医疗编码对医疗数据结构化、研究、质量监控和政策制定至关重要,但人工编码耗时且易出错,自动化需求迫切。方法。

A Hybrid Framework for Subject Analysis: Integrating Embedding-Based Regression Models with Large...
本文聚焦图书馆管理系统中的主题分析任务,提出了一种融合基于嵌入的机器学习(ML)模型与大型语言模型(LLMs)的混合框架,用于预测图书的国会图书馆主题标题(LCSH)。传统机器学习模型在多标签分类中难以处理未见过的案例,而LLMs虽在分类和摘要任务中应用广泛,但在主题分析中存在过度生成和“幻觉”(生成非标准术语)的问题。利用ML模型预测LCSH标签的最佳数量,指导LLM生成,避免过度或不足生成;对LLM生成的术语进行后处理,用实际LCSH术语替换“幻觉”术语,减少错误。

Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models
在本文中,我们提出了VideoNarrator,这是一种新颖的无需训练的管道,旨在生成密集视频字幕,为视频内容提供结构化快照。这些字幕包含带有精确时间戳的详细叙述,能够捕捉视频每个片段中的细微信息。尽管多模态大语言模型(MLLMs)在视频理解方面取得了进展,但这些模型在时间对齐叙述方面常常存在困难,且在不熟悉的场景中容易产生“幻觉”(即生成不准确内容)。VideoNarrator通过一个灵活的管道解决了这些挑战,其中现成的MLLMs和视觉语言模型(VLMs)可分别作为字幕生成器、上下文提供者或字幕验证器。

What do Large Language Models know about materials?
本文聚焦大型语言模型(LLMs)在材料科学与工程中的应用,核心探讨LLMs对材料知识的掌握能力及其在材料的“加工-结构-性能-性能表现”(Processing-Structure-Property-Performance,PSPP)链推理中的适用性。研究背景:LLMs通过语言接口建立关联,有望用于PSPP链的逐步推理,但训练数据多来自互联网(含大量非科学内容),其材料知识的准确性需验证。

Descrip3D: Enhancing Large Language Model-based 3D Scene Understanding with Object-Level Text Des...
理解3D场景不仅仅是识别对象,还需要推理对象之间的空间和语义关系。当前的3D场景-语言模型在这种关系理解上常常存在困难,尤其是当仅靠视觉嵌入无法充分传达对象的角色和交互时。在本文中,我们提出了Descrip3D,这是一种新颖且强大的框架,它使用自然语言显式编码对象之间的关系。与以往仅依赖2D和3D嵌入的方法不同,Descrip3D为每个对象添加了文本描述,以捕捉其内在属性和上下文关系。这些关系线索通过双层次整合融入模型:嵌入融合和提示级注入。

Large Language Models Assisting Ontology Evaluation
研究背景:本体评估中的能力问题(CQ)验证是重要的功能需求验证方式,但传统方法耗时、费力且易出错。近年来大语言模型(LLMs)在本体工程中展现潜力,但在通过CQ验证进行功能评估(尤其是人机协同场景)的研究仍属空白。核心贡献提出OE-Assist框架,通过自动和半自动方式辅助CQ验证,实现本体功能评估。构建OntoEval数据集,包含1393个CQ及其对应的本体和本体故事,由两位本体工程师交叉验证标注。

Intent-Based Network for RAN Management with Large Language Models
本文提出了一种基于意图的无线接入网(RAN)管理系统,该系统整合大语言模型(LLMs)以解决RAN管理中日益增长的复杂性问题,核心是通过LLM驱动的代理架构实现高层用户意图到精确RAN配置的动态翻译与优化。核心背景:随着RAN中服务类型和资源需求的多样化,网络配置复杂度激增,传统手动配置难以满足敏捷性和可扩展性需求。基于意图的网络(IBN)通过高层意图声明简化配置,但意图到具体指令的准确翻译仍是关键挑战。系统架构。

Value-Based Large Language Model Agent Simulation for Mutual Evaluation of Trust and Interpersona...
大型语言模型(LLMs)已成为模拟复杂社会现象的强大工具,可通过类人代理(具有特定特征)实现。在人类社会中,价值相似性对建立信任和亲密关系至关重要,但这一原则在由LLM代理组成的人工社会中是否成立仍未可知。因此,本研究通过两个实验探究价值相似性对LLM代理间关系建立的影响。首先,在初步实验中,我们评估了LLMs中价值的可控性,以确定控制价值的最有效模型和提示词设计。随后,在主要实验中,我们生成了具有特定价值的LLM代理对,并分析了它们在对话后对彼此信任和人际亲密感的相互评估。

The Evolving Role of Large Language Models in Scientific Innovation: Evaluator, Collaborator, and...
本文系统探讨了大型语言模型(LLMs)在科学创新中的演变角色,提出了一个金字塔式的层级框架,将其角色分为评估者(Evaluator)、合作者(Collaborator)和科学家(Scientist),并从基准测试、算法、评估结果等维度分析了各角色的能力与局限。核心框架评估者:聚焦科学知识合成(如文献整合、知识提取)和文献质量评估(如创新性、严谨性判断),辅助研究者处理信息过载问题。合作者。

Tracing Facts or just Copies? A critical investigation of the Competitions of Mechanisms in Large...
本文呈现了一项可复现性研究,探究大型语言模型(LLMs)如何处理竞争性的事实与反事实信息,重点关注注意力头在这一过程中的作用。我们尝试复现并整合Ortu等人[13]、Yu、Merullo与Pavlick[17]以及McDougall等人[7]的三项近期研究成果,这些研究通过机械可解释性工具探究了模型习得事实与矛盾上下文信息之间的竞争。本研究具体分析了注意力头强度与事实输出比例的关系,评估了关于注意力头抑制机制的竞争性假设,并探究了这些注意力模式的领域特异性。

Auto-Formulating Dynamic Programming Problems with Large Language Models
本文聚焦于利用大型语言模型(LLMs)实现动态规划(DP)问题的自动建模,旨在解决传统DP建模依赖专家知识、现有LLM方法在DP任务中表现不佳的问题。问题背景:DP作为运筹学中的核心方法,其建模涉及多阶段决策和随机过渡,且现实场景中的DP问题常嵌入自然语言描述,包含隐含假设和领域术语,导致LLM自动建模难度大;同时,缺乏标准化的DP评估基准,阻碍了模型性能的系统验证。核心方法提出DP-Bench。

MapIQ: Benchmarking Multimodal Large Language Models for Map Question Answering
本文介绍了MapIQ,一个用于评估多模态大型语言模型(MLLMs)地图问答(Map-VQA)能力的基准数据集。该数据集包含14,706个问答对,覆盖三种地图类型(分级设色地图、六边形地图、比例符号地图)和六个主题(如住房、犯罪、环境等),并通过六个视觉分析任务(如值检索、空间极值识别、区域比较等)评估模型性能。

DrafterBench: Benchmarking Large Language Models for Tasks Automation in Civil Engineering
本文聚焦大型语言模型(LLMs)的推理策略问题,旨在探究能否通过提示词控制LLMs的推理策略,以提升其在逻辑问题求解中的表现。研究背景:人类推理会根据问题类型动态选择策略(如假设遵循、链式构建等),而现有LLMs倾向于依赖单一推理策略,可能限制其在复杂推理任务中的有效性。核心实验设计提示词模板,引导LLMs采用四种人类启发的推理策略(假设遵循、链式构建、复合推理、串联推理),验证了无需微调即可控制LLMs的推理模式。

Reasoning Strategies in Large Language Models: Can They Follow, Prefer, and Optimize?
本文聚焦大型语言模型(LLMs)的推理策略问题,旨在探究能否通过提示词控制LLMs的推理策略,以提升其在逻辑问题求解中的表现。研究背景:人类推理会根据问题类型动态选择策略(如假设遵循、链式构建等),而现有LLMs倾向于依赖单一推理策略,可能限制其在复杂推理任务中的有效性。核心实验设计提示词模板,引导LLMs采用四种人类启发的推理策略(假设遵循、链式构建、复合推理、串联推理),验证了无需微调即可控制LLMs的推理模式。

Text2VR: Automated instruction Generation in Virtual Reality using Large language Models for Asse...
本文提出了一种名为Text2VR的方法,旨在利用大型语言模型(LLMs)自动从文本输入生成虚拟现实(VR)中的装配任务训练指令,以解决VR训练内容开发耗时、需专业知识等问题。LLM模块:通过微调(以Llama3模型为例)从文本中提取任务相关信息(如组件名称、数量、装配顺序等),具体包括数据集生成(利用ChatGPT生成合成数据,采用监督微调格式)、模型训练(参数高效微调)和实时推理(将文本输入转化为结构化信息)。智能模块。

ElectriQ: A Benchmark for Assessing the Response Capability of Large Language Models in Power Mar...
本文针对电力营销客服领域现有系统(如中国95598热线)存在响应缓慢、流程僵化、领域准确性不足等问题,提出了首个用于评估和增强大型语言模型(LLMs)在该领域表现的基准——ElectriQ。对话数据集:涵盖6个关键服务类别的55万条高质量多轮对话,数据来源包括真实客服语音转录文本、知识问答数据及人工筛选的高优质样本;评估指标:定义了4个核心维度——专业性(领域知识准确性)、通俗性(专业术语转化为日常语言的能力)、可读性(逻辑与语法连贯性)、用户友好性(情感关怀与共情能力);知识增强方法。

NetIntent: Leveraging Large Language Models for End-to-End Intent-Based SDN Automation
基于意图的网络(IBN)通常利用软件定义网络(SDN)的可编程性来简化网络管理。然而,从用户指定的高层意图到设备特定的底层配置,整个流程的自动化仍面临重大挑战。现有解决方案往往依赖刚性的、基于规则的翻译器和固定API,限制了可扩展性和适应性。相比之下,大语言模型(LLMs)的最新进展提供了一条利用自然语言理解和灵活推理的有前景的路径。然而,LLMs在多大程度上能执行IBN任务尚不明确。

Efficient Temporal Tokenization for Mobility Prediction with Large Language Models
本文提出了一种名为RHYTHM(ReasoningwithHierarchicalTemporalTokenizationforHumanMobility)的框架,旨在利用大型语言模型(LLMs)进行人类移动性预测和轨迹推理。该框架的核心思路是通过结构化的时间抽象重构移动性建模,将轨迹分割为日常片段并编码为离散token,结合分层注意力机制捕捉每日和每周的依赖关系,同时大幅缩短序列长度。

欢迎留下您的脚印