Loading...

Large Language Models Assisting Ontology Evaluation
研究背景:本体评估中的能力问题(CQ)验证是重要的功能需求验证方式,但传统方法耗时、费力且易出错。近年来大语言模型(LLMs)在本体工程中展现潜力,但在通过CQ验证进行功能评估(尤其是人机协同场景)的研究仍属空白。核心贡献提出OE-Assist框架,通过自动和半自动方式辅助CQ验证,实现本体功能评估。构建OntoEval数据集,包含1393个CQ及其对应的本体和本体故事,由两位本体工程师交叉验证标注。

Intent-Based Network for RAN Management with Large Language Models
本文提出了一种基于意图的无线接入网(RAN)管理系统,该系统整合大语言模型(LLMs)以解决RAN管理中日益增长的复杂性问题,核心是通过LLM驱动的代理架构实现高层用户意图到精确RAN配置的动态翻译与优化。核心背景:随着RAN中服务类型和资源需求的多样化,网络配置复杂度激增,传统手动配置难以满足敏捷性和可扩展性需求。基于意图的网络(IBN)通过高层意图声明简化配置,但意图到具体指令的准确翻译仍是关键挑战。系统架构。

Value-Based Large Language Model Agent Simulation for Mutual Evaluation of Trust and Interpersona...
大型语言模型(LLMs)已成为模拟复杂社会现象的强大工具,可通过类人代理(具有特定特征)实现。在人类社会中,价值相似性对建立信任和亲密关系至关重要,但这一原则在由LLM代理组成的人工社会中是否成立仍未可知。因此,本研究通过两个实验探究价值相似性对LLM代理间关系建立的影响。首先,在初步实验中,我们评估了LLMs中价值的可控性,以确定控制价值的最有效模型和提示词设计。随后,在主要实验中,我们生成了具有特定价值的LLM代理对,并分析了它们在对话后对彼此信任和人际亲密感的相互评估。

The Evolving Role of Large Language Models in Scientific Innovation: Evaluator, Collaborator, and...
本文系统探讨了大型语言模型(LLMs)在科学创新中的演变角色,提出了一个金字塔式的层级框架,将其角色分为评估者(Evaluator)、合作者(Collaborator)和科学家(Scientist),并从基准测试、算法、评估结果等维度分析了各角色的能力与局限。核心框架评估者:聚焦科学知识合成(如文献整合、知识提取)和文献质量评估(如创新性、严谨性判断),辅助研究者处理信息过载问题。合作者。

Tracing Facts or just Copies? A critical investigation of the Competitions of Mechanisms in Large...
本文呈现了一项可复现性研究,探究大型语言模型(LLMs)如何处理竞争性的事实与反事实信息,重点关注注意力头在这一过程中的作用。我们尝试复现并整合Ortu等人[13]、Yu、Merullo与Pavlick[17]以及McDougall等人[7]的三项近期研究成果,这些研究通过机械可解释性工具探究了模型习得事实与矛盾上下文信息之间的竞争。本研究具体分析了注意力头强度与事实输出比例的关系,评估了关于注意力头抑制机制的竞争性假设,并探究了这些注意力模式的领域特异性。

Auto-Formulating Dynamic Programming Problems with Large Language Models
本文聚焦于利用大型语言模型(LLMs)实现动态规划(DP)问题的自动建模,旨在解决传统DP建模依赖专家知识、现有LLM方法在DP任务中表现不佳的问题。问题背景:DP作为运筹学中的核心方法,其建模涉及多阶段决策和随机过渡,且现实场景中的DP问题常嵌入自然语言描述,包含隐含假设和领域术语,导致LLM自动建模难度大;同时,缺乏标准化的DP评估基准,阻碍了模型性能的系统验证。核心方法提出DP-Bench。

MapIQ: Benchmarking Multimodal Large Language Models for Map Question Answering
本文介绍了MapIQ,一个用于评估多模态大型语言模型(MLLMs)地图问答(Map-VQA)能力的基准数据集。该数据集包含14,706个问答对,覆盖三种地图类型(分级设色地图、六边形地图、比例符号地图)和六个主题(如住房、犯罪、环境等),并通过六个视觉分析任务(如值检索、空间极值识别、区域比较等)评估模型性能。

DrafterBench: Benchmarking Large Language Models for Tasks Automation in Civil Engineering
本文聚焦大型语言模型(LLMs)的推理策略问题,旨在探究能否通过提示词控制LLMs的推理策略,以提升其在逻辑问题求解中的表现。研究背景:人类推理会根据问题类型动态选择策略(如假设遵循、链式构建等),而现有LLMs倾向于依赖单一推理策略,可能限制其在复杂推理任务中的有效性。核心实验设计提示词模板,引导LLMs采用四种人类启发的推理策略(假设遵循、链式构建、复合推理、串联推理),验证了无需微调即可控制LLMs的推理模式。

Reasoning Strategies in Large Language Models: Can They Follow, Prefer, and Optimize?
本文聚焦大型语言模型(LLMs)的推理策略问题,旨在探究能否通过提示词控制LLMs的推理策略,以提升其在逻辑问题求解中的表现。研究背景:人类推理会根据问题类型动态选择策略(如假设遵循、链式构建等),而现有LLMs倾向于依赖单一推理策略,可能限制其在复杂推理任务中的有效性。核心实验设计提示词模板,引导LLMs采用四种人类启发的推理策略(假设遵循、链式构建、复合推理、串联推理),验证了无需微调即可控制LLMs的推理模式。

Text2VR: Automated instruction Generation in Virtual Reality using Large language Models for Asse...
本文提出了一种名为Text2VR的方法,旨在利用大型语言模型(LLMs)自动从文本输入生成虚拟现实(VR)中的装配任务训练指令,以解决VR训练内容开发耗时、需专业知识等问题。LLM模块:通过微调(以Llama3模型为例)从文本中提取任务相关信息(如组件名称、数量、装配顺序等),具体包括数据集生成(利用ChatGPT生成合成数据,采用监督微调格式)、模型训练(参数高效微调)和实时推理(将文本输入转化为结构化信息)。智能模块。

ElectriQ: A Benchmark for Assessing the Response Capability of Large Language Models in Power Mar...
本文针对电力营销客服领域现有系统(如中国95598热线)存在响应缓慢、流程僵化、领域准确性不足等问题,提出了首个用于评估和增强大型语言模型(LLMs)在该领域表现的基准——ElectriQ。对话数据集:涵盖6个关键服务类别的55万条高质量多轮对话,数据来源包括真实客服语音转录文本、知识问答数据及人工筛选的高优质样本;评估指标:定义了4个核心维度——专业性(领域知识准确性)、通俗性(专业术语转化为日常语言的能力)、可读性(逻辑与语法连贯性)、用户友好性(情感关怀与共情能力);知识增强方法。

NetIntent: Leveraging Large Language Models for End-to-End Intent-Based SDN Automation
基于意图的网络(IBN)通常利用软件定义网络(SDN)的可编程性来简化网络管理。然而,从用户指定的高层意图到设备特定的底层配置,整个流程的自动化仍面临重大挑战。现有解决方案往往依赖刚性的、基于规则的翻译器和固定API,限制了可扩展性和适应性。相比之下,大语言模型(LLMs)的最新进展提供了一条利用自然语言理解和灵活推理的有前景的路径。然而,LLMs在多大程度上能执行IBN任务尚不明确。

Efficient Temporal Tokenization for Mobility Prediction with Large Language Models
本文提出了一种名为RHYTHM(ReasoningwithHierarchicalTemporalTokenizationforHumanMobility)的框架,旨在利用大型语言模型(LLMs)进行人类移动性预测和轨迹推理。该框架的核心思路是通过结构化的时间抽象重构移动性建模,将轨迹分割为日常片段并编码为离散token,结合分层注意力机制捕捉每日和每周的依赖关系,同时大幅缩短序列长度。

Linguistic and Embedding-Based Profiling of Texts generated by Humans and Large Language Models
本文聚焦于人类撰写文本(HWT)与大型语言模型(LLMs)生成文本(MGT)的语言特征差异,通过多维度语言分析(形态学、句法、语义等)揭示两者的区别,并探讨模型输出的变异性与同质化趋势。研究使用RAID数据集(涵盖8个领域、11种LLMs的467,985条文本),提取了文本长度、句子长度、形态复杂度、依存深度、情感性等10项语言特征,结合统计分析、逻辑分类器和风格嵌入模型进行分析。人类文本倾向于句法结构更简单、语义内容更多样;人类与机器文本在不同领域均表现出风格多样性,但人类的特征变异性更大;

A Collaborative Framework Integrating Large Language Model and Chemical Fragment Space: Mutual In...
药物设计,尤其是铅化合物的发现,对对抗疾病和提升人类健康具有核心战略意义。然而,现有的计算方法难以有效整合领域特定知识,严重限制了其识别具有经验证结合模式和新骨架的新型铅化合物的能力。本文提出了AutoLeadDesign——一种铅化合物设计框架,该框架利用化学片段启发大语言模型中蕴含的丰富领域知识,以逐步实现对广阔化学空间的高效探索。综合实验表明,AutoLeadDesign的性能优于基准方法。

GOFAI meets Generative AI: Development of Expert Systems by means of Large Language Models
大型语言模型(LLMs)的发展成功改变了基于知识的系统(如开放域问答系统),这些系统能够自动生成大量看似连贯的信息。然而,这些模型存在一些缺点,例如会产生“幻觉”,即自信地生成错误或不可验证的事实。在本文中,我们提出了一种利用LLMs以可控且透明的方式开发专家系统的新方法。通过限制领域范围并采用结构化的基于提示的提取方法,我们生成了Prolog语言的符号化知识表示,这些表示可由人类专家验证和修正。该方法还保证了所开发专家系统的可解释性、可扩展性和可靠性。

Assessing the Reliability of Large Language Models for Deductive Qualitative Coding: A Comparativ...
本文聚焦大型语言模型(LLMs)在演绎定性编码中的可靠性评估,以ChatGPT为研究对象,通过比较议程项目(CAP)主编码手册,将美国最高法院案例摘要分类为21个主要政策领域,系统测试了四种干预策略(零样本、少样本、基于定义、分步任务分解)的效果。分步任务分解策略表现最优,准确率达0.775,Cohen’sκ为0.744,Krippendorff’sα为0.746,达到“实质性一致”阈值;干预策略对分类结果影响显著(如基于定义与少样本策略的Cramér’sV=0.613);

Aligning Large Language Models to Low-Resource Languages through LLM-Based Selective Translation:...
本文聚焦于多语言大语言模型(LLMs)在低资源语言(以印地语为例)中的性能差距问题,旨在通过基于LLM的选择性翻译技术提升模型在低资源语言上的对齐效果。研究背景指出,多语言LLMs在英语与非英语语言(尤其是低资源语言)间存在显著性能差异,核心瓶颈在于低资源语言缺乏高质量对齐数据。传统方法通过翻译英语对齐数据来补充,但常规翻译技术难以保留代码、数学表达式、JSON等非可翻译内容,导致数据失效。为此,本文提出基于LLM的选择性翻译:仅翻译文本中可翻译部分,同时保留非可翻译内容和句子结构。

Automated Interpretation of Non-Destructive Evaluation Contour Maps Using Large Language Models f...
桥梁的维护和安全对交通部门至关重要,无损检测(NDE)技术是评估结构完整性的关键。然而,解读NDE数据耗时且需要专业知识,可能延误决策。大型语言模型(LLMs)的最新进展为自动化和改进这种分析提供了新途径。本试点研究全面评估了LLM解释NDEcontour图的能力,并展示了LLMs在提供详细桥梁状况分析方面的有效性。研究建立了将LLMs整合到桥梁检测工作流的框架,表明LLM辅助分析可在不影响准确性的前提下提高效率。

osmAG-LLM: Zero-Shot Open-Vocabulary Object Navigation via Semantic Maps and Large Language Model...
近年来,开放词汇机器人映射方法通过预训练的视觉-语言特征丰富密集几何地图,实现了高细节描述,并能引导机器人根据开放词汇语言查询找到物体。尽管这类方法的可扩展性已受到一定关注,但另一个根本问题是:高细节物体映射会因物体频繁移动而迅速过时。在本研究中,我们开发了一种用于目标导航的映射与导航系统,从根本上考虑了查询物体可能已移动或完全未被映射的情况。我们不追求高保真的映射细节,而是认为地图的主要作用是提供环境锚定和上下文,并将其与LLM的语义先验结合,推理物体位置,同时采用主动在线方法导航至目标物体。

欢迎留下您的脚印