Loading...

MapIQ: Benchmarking Multimodal Large Language Models for Map Question Answering
本文介绍了MapIQ,一个用于评估多模态大型语言模型(MLLMs)地图问答(Map-VQA)能力的基准数据集。该数据集包含14,706个问答对,覆盖三种地图类型(分级设色地图、六边形地图、比例符号地图)和六个主题(如住房、犯罪、环境等),并通过六个视觉分析任务(如值检索、空间极值识别、区域比较等)评估模型性能。

DrafterBench: Benchmarking Large Language Models for Tasks Automation in Civil Engineering
本文聚焦大型语言模型(LLMs)的推理策略问题,旨在探究能否通过提示词控制LLMs的推理策略,以提升其在逻辑问题求解中的表现。研究背景:人类推理会根据问题类型动态选择策略(如假设遵循、链式构建等),而现有LLMs倾向于依赖单一推理策略,可能限制其在复杂推理任务中的有效性。核心实验设计提示词模板,引导LLMs采用四种人类启发的推理策略(假设遵循、链式构建、复合推理、串联推理),验证了无需微调即可控制LLMs的推理模式。

Reasoning Strategies in Large Language Models: Can They Follow, Prefer, and Optimize?
本文聚焦大型语言模型(LLMs)的推理策略问题,旨在探究能否通过提示词控制LLMs的推理策略,以提升其在逻辑问题求解中的表现。研究背景:人类推理会根据问题类型动态选择策略(如假设遵循、链式构建等),而现有LLMs倾向于依赖单一推理策略,可能限制其在复杂推理任务中的有效性。核心实验设计提示词模板,引导LLMs采用四种人类启发的推理策略(假设遵循、链式构建、复合推理、串联推理),验证了无需微调即可控制LLMs的推理模式。

Text2VR: Automated instruction Generation in Virtual Reality using Large language Models for Asse...
本文提出了一种名为Text2VR的方法,旨在利用大型语言模型(LLMs)自动从文本输入生成虚拟现实(VR)中的装配任务训练指令,以解决VR训练内容开发耗时、需专业知识等问题。LLM模块:通过微调(以Llama3模型为例)从文本中提取任务相关信息(如组件名称、数量、装配顺序等),具体包括数据集生成(利用ChatGPT生成合成数据,采用监督微调格式)、模型训练(参数高效微调)和实时推理(将文本输入转化为结构化信息)。智能模块。

ElectriQ: A Benchmark for Assessing the Response Capability of Large Language Models in Power Mar...
本文针对电力营销客服领域现有系统(如中国95598热线)存在响应缓慢、流程僵化、领域准确性不足等问题,提出了首个用于评估和增强大型语言模型(LLMs)在该领域表现的基准——ElectriQ。对话数据集:涵盖6个关键服务类别的55万条高质量多轮对话,数据来源包括真实客服语音转录文本、知识问答数据及人工筛选的高优质样本;评估指标:定义了4个核心维度——专业性(领域知识准确性)、通俗性(专业术语转化为日常语言的能力)、可读性(逻辑与语法连贯性)、用户友好性(情感关怀与共情能力);知识增强方法。

NetIntent: Leveraging Large Language Models for End-to-End Intent-Based SDN Automation
基于意图的网络(IBN)通常利用软件定义网络(SDN)的可编程性来简化网络管理。然而,从用户指定的高层意图到设备特定的底层配置,整个流程的自动化仍面临重大挑战。现有解决方案往往依赖刚性的、基于规则的翻译器和固定API,限制了可扩展性和适应性。相比之下,大语言模型(LLMs)的最新进展提供了一条利用自然语言理解和灵活推理的有前景的路径。然而,LLMs在多大程度上能执行IBN任务尚不明确。

Efficient Temporal Tokenization for Mobility Prediction with Large Language Models
本文提出了一种名为RHYTHM(ReasoningwithHierarchicalTemporalTokenizationforHumanMobility)的框架,旨在利用大型语言模型(LLMs)进行人类移动性预测和轨迹推理。该框架的核心思路是通过结构化的时间抽象重构移动性建模,将轨迹分割为日常片段并编码为离散token,结合分层注意力机制捕捉每日和每周的依赖关系,同时大幅缩短序列长度。

Linguistic and Embedding-Based Profiling of Texts generated by Humans and Large Language Models
本文聚焦于人类撰写文本(HWT)与大型语言模型(LLMs)生成文本(MGT)的语言特征差异,通过多维度语言分析(形态学、句法、语义等)揭示两者的区别,并探讨模型输出的变异性与同质化趋势。研究使用RAID数据集(涵盖8个领域、11种LLMs的467,985条文本),提取了文本长度、句子长度、形态复杂度、依存深度、情感性等10项语言特征,结合统计分析、逻辑分类器和风格嵌入模型进行分析。人类文本倾向于句法结构更简单、语义内容更多样;人类与机器文本在不同领域均表现出风格多样性,但人类的特征变异性更大;

A Collaborative Framework Integrating Large Language Model and Chemical Fragment Space: Mutual In...
药物设计,尤其是铅化合物的发现,对对抗疾病和提升人类健康具有核心战略意义。然而,现有的计算方法难以有效整合领域特定知识,严重限制了其识别具有经验证结合模式和新骨架的新型铅化合物的能力。本文提出了AutoLeadDesign——一种铅化合物设计框架,该框架利用化学片段启发大语言模型中蕴含的丰富领域知识,以逐步实现对广阔化学空间的高效探索。综合实验表明,AutoLeadDesign的性能优于基准方法。

GOFAI meets Generative AI: Development of Expert Systems by means of Large Language Models
大型语言模型(LLMs)的发展成功改变了基于知识的系统(如开放域问答系统),这些系统能够自动生成大量看似连贯的信息。然而,这些模型存在一些缺点,例如会产生“幻觉”,即自信地生成错误或不可验证的事实。在本文中,我们提出了一种利用LLMs以可控且透明的方式开发专家系统的新方法。通过限制领域范围并采用结构化的基于提示的提取方法,我们生成了Prolog语言的符号化知识表示,这些表示可由人类专家验证和修正。该方法还保证了所开发专家系统的可解释性、可扩展性和可靠性。

Assessing the Reliability of Large Language Models for Deductive Qualitative Coding: A Comparativ...
本文聚焦大型语言模型(LLMs)在演绎定性编码中的可靠性评估,以ChatGPT为研究对象,通过比较议程项目(CAP)主编码手册,将美国最高法院案例摘要分类为21个主要政策领域,系统测试了四种干预策略(零样本、少样本、基于定义、分步任务分解)的效果。分步任务分解策略表现最优,准确率达0.775,Cohen’sκ为0.744,Krippendorff’sα为0.746,达到“实质性一致”阈值;干预策略对分类结果影响显著(如基于定义与少样本策略的Cramér’sV=0.613);

Aligning Large Language Models to Low-Resource Languages through LLM-Based Selective Translation:...
本文聚焦于多语言大语言模型(LLMs)在低资源语言(以印地语为例)中的性能差距问题,旨在通过基于LLM的选择性翻译技术提升模型在低资源语言上的对齐效果。研究背景指出,多语言LLMs在英语与非英语语言(尤其是低资源语言)间存在显著性能差异,核心瓶颈在于低资源语言缺乏高质量对齐数据。传统方法通过翻译英语对齐数据来补充,但常规翻译技术难以保留代码、数学表达式、JSON等非可翻译内容,导致数据失效。为此,本文提出基于LLM的选择性翻译:仅翻译文本中可翻译部分,同时保留非可翻译内容和句子结构。

Automated Interpretation of Non-Destructive Evaluation Contour Maps Using Large Language Models f...
桥梁的维护和安全对交通部门至关重要,无损检测(NDE)技术是评估结构完整性的关键。然而,解读NDE数据耗时且需要专业知识,可能延误决策。大型语言模型(LLMs)的最新进展为自动化和改进这种分析提供了新途径。本试点研究全面评估了LLM解释NDEcontour图的能力,并展示了LLMs在提供详细桥梁状况分析方面的有效性。研究建立了将LLMs整合到桥梁检测工作流的框架,表明LLM辅助分析可在不影响准确性的前提下提高效率。

osmAG-LLM: Zero-Shot Open-Vocabulary Object Navigation via Semantic Maps and Large Language Model...
近年来,开放词汇机器人映射方法通过预训练的视觉-语言特征丰富密集几何地图,实现了高细节描述,并能引导机器人根据开放词汇语言查询找到物体。尽管这类方法的可扩展性已受到一定关注,但另一个根本问题是:高细节物体映射会因物体频繁移动而迅速过时。在本研究中,我们开发了一种用于目标导航的映射与导航系统,从根本上考虑了查询物体可能已移动或完全未被映射的情况。我们不追求高保真的映射细节,而是认为地图的主要作用是提供环境锚定和上下文,并将其与LLM的语义先验结合,推理物体位置,同时采用主动在线方法导航至目标物体。

Graph Representations for Reading Comprehension Analysis using Large Language Model and Eye-Track...
本文聚焦于阅读理解分析,旨在通过大型语言模型(LLMs)与眼动追踪生物标志物,探索人类与LLMs在语言理解上的差异与一致性。研究背景:阅读理解是人类认知发展的核心技能,但全球约61%的青少年未达到基础阅读能力。此前研究利用LLMs标记单个单词与推理目标的相关性,并通过脑电图(EEG)和眼动追踪验证,但仅关注单个单词,难以捕捉句子的整体语义和关键短语的作用。研究方法:提出基于LLM的图表示方法,将阅读材料中的词或短语作为节点,语义/句法关系作为边,构建知识图谱;

What is the Best Process Model Representation? A Comparative Analysis for Process Modeling with L...
大型语言模型(LLMs)正越来越多地应用于流程建模(PMo)任务,如流程模型生成(PMG)。为支持这些任务,研究者们引入了多种流程模型表示(PMRs),作为模型抽象或生成目标。然而,这些PMRs在结构、复杂度和可用性上差异显著,且从未被系统比较过。此外,近年来的PMG方法依赖于不同的评估策略和生成技术,导致比较困难。本文提出了首个实证研究,在LLMs辅助的PMo场景下评估多种PMRs。我们引入了PMo数据集,这是一个新的数据集,包含55个流程描述及对应9种不同PMRs的模型。

Automated Novelty Evaluation of Academic Paper: A Collaborative Approach Integrating Human and La...
新颖性是学术论文同行评审过程中的关键评估标准。传统上,新颖性由专家判断或通过独特的引用组合来衡量。两种方法都有局限性:专家的知识有限,且组合方法的有效性不确定。此外,独特的引用是否真能衡量新颖性尚不明确。大型语言模型(LLM)拥有丰富的知识,而人类专家则具备LLM所不具备的判断能力。因此,本研究整合了LLM和人类专家的知识与能力,以解决新颖性评估的局限性。学术论文中最常见的新颖性类型之一是新方法的引入。本文提出利用人类知识和LLM辅助预训练语言模型(PLMs,如BERT等)预测论文的方法新颖性。

Exploiting Primacy Effect To Improve Large Language Models
大型语言模型(LLMs)凭借广泛的预训练和微调,在许多自然语言处理(NLP)任务中已成为不可或缺的工具,并实现了较高的准确率。然而,与人类相似,LLMs也存在偏差,特别是位置偏差,如首因效应和近因效应,这些偏差可能会影响答案的准确性。首因效应——即首先呈现的项目更有可能被记住或选择——在多项选择问答(MCQA)中起着关键作用,其中答案选项的顺序会影响预测结果。本研究聚焦微调后的LLMs中的首因偏差:我们首先证明,微调会放大这种偏差,这可能是由于模型接触了类人的模式。

EXAONE 4.0: Unified Large Language Models Integrating Non-reasoning and Reasoning Modes
本文是LGAIResearch发布的技术报告,介绍了大语言模型EXAONE4.0的核心特性、技术细节与性能表现。该模型整合了非推理模式(NON-REASONING)和推理模式(REASONING),既保留了EXAONE3.5的高可用性,又继承了EXAONEDeep的高级推理能力。EXAONE4.0系列包含两个版本:320亿参数的中尺寸模型(优化高性能场景)和12亿参数的小尺寸模型(适用于端侧应用)。

Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
本文针对大型语言模型(LLMs)的价值观对齐问题,提出了一种名为的框架,旨在通过直接调控模型内部的价值表征,使LLMs与人类价值观(基于Schwartz的10种基本价值观理论)保持一致,同时避免牺牲模型性能和输出流畅性。上下文控制的价值向量识别:通过构建上下文可控的数据集(确保正负样本仅在目标价值观上对立,其他无关上下文一致),消除传统数据集的上下文偏差,准确识别模型潜在空间中编码价值观的向量。门控价值向量激活。

欢迎留下您的脚印