Loading...
近年来,开放词汇机器人映射方法通过预训练的视觉-语言特征丰富密集几何地图,实现了高细节描述,并能引导机器人根据开放词汇语言查询找到物体。尽管这类方法的可扩展性已受到一定关注,但另一个根本问题是:高细节物体映射会因物体频繁移动而迅速过时。在本研究中,我们开发了一种用于目标导航的映射与导航系统,从根本上考虑了查询物体可能已移动或完全未被映射的情况。我们不追求高保真的映射细节,而是认为地图的主要作用是提供环境锚定和上下文,并将其与LLM的语义先验结合,推理物体位置,同时采用主动在线方法导航至目标物体。
Graph Representations for Reading Comprehension Analysis using Large Language Model and Eye-Track...
本文聚焦于阅读理解分析,旨在通过大型语言模型(LLMs)与眼动追踪生物标志物,探索人类与LLMs在语言理解上的差异与一致性。研究背景:阅读理解是人类认知发展的核心技能,但全球约61%的青少年未达到基础阅读能力。此前研究利用LLMs标记单个单词与推理目标的相关性,并通过脑电图(EEG)和眼动追踪验证,但仅关注单个单词,难以捕捉句子的整体语义和关键短语的作用。研究方法:提出基于LLM的图表示方法,将阅读材料中的词或短语作为节点,语义/句法关系作为边,构建知识图谱;
What is the Best Process Model Representation? A Comparative Analysis for Process Modeling with L...
大型语言模型(LLMs)正越来越多地应用于流程建模(PMo)任务,如流程模型生成(PMG)。为支持这些任务,研究者们引入了多种流程模型表示(PMRs),作为模型抽象或生成目标。然而,这些PMRs在结构、复杂度和可用性上差异显著,且从未被系统比较过。此外,近年来的PMG方法依赖于不同的评估策略和生成技术,导致比较困难。本文提出了首个实证研究,在LLMs辅助的PMo场景下评估多种PMRs。我们引入了PMo数据集,这是一个新的数据集,包含55个流程描述及对应9种不同PMRs的模型。
Automated Novelty Evaluation of Academic Paper: A Collaborative Approach Integrating Human and La...
新颖性是学术论文同行评审过程中的关键评估标准。传统上,新颖性由专家判断或通过独特的引用组合来衡量。两种方法都有局限性:专家的知识有限,且组合方法的有效性不确定。此外,独特的引用是否真能衡量新颖性尚不明确。大型语言模型(LLM)拥有丰富的知识,而人类专家则具备LLM所不具备的判断能力。因此,本研究整合了LLM和人类专家的知识与能力,以解决新颖性评估的局限性。学术论文中最常见的新颖性类型之一是新方法的引入。本文提出利用人类知识和LLM辅助预训练语言模型(PLMs,如BERT等)预测论文的方法新颖性。
Exploiting Primacy Effect To Improve Large Language Models
大型语言模型(LLMs)凭借广泛的预训练和微调,在许多自然语言处理(NLP)任务中已成为不可或缺的工具,并实现了较高的准确率。然而,与人类相似,LLMs也存在偏差,特别是位置偏差,如首因效应和近因效应,这些偏差可能会影响答案的准确性。首因效应——即首先呈现的项目更有可能被记住或选择——在多项选择问答(MCQA)中起着关键作用,其中答案选项的顺序会影响预测结果。本研究聚焦微调后的LLMs中的首因偏差:我们首先证明,微调会放大这种偏差,这可能是由于模型接触了类人的模式。
EXAONE 4.0: Unified Large Language Models Integrating Non-reasoning and Reasoning Modes
本文是LGAIResearch发布的技术报告,介绍了大语言模型EXAONE4.0的核心特性、技术细节与性能表现。该模型整合了非推理模式(NON-REASONING)和推理模式(REASONING),既保留了EXAONE3.5的高可用性,又继承了EXAONEDeep的高级推理能力。EXAONE4.0系列包含两个版本:320亿参数的中尺寸模型(优化高性能场景)和12亿参数的小尺寸模型(适用于端侧应用)。
Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
本文针对大型语言模型(LLMs)的价值观对齐问题,提出了一种名为的框架,旨在通过直接调控模型内部的价值表征,使LLMs与人类价值观(基于Schwartz的10种基本价值观理论)保持一致,同时避免牺牲模型性能和输出流畅性。上下文控制的价值向量识别:通过构建上下文可控的数据集(确保正负样本仅在目标价值观上对立,其他无关上下文一致),消除传统数据集的上下文偏差,准确识别模型潜在空间中编码价值观的向量。门控价值向量激活。
LRCTI: A Large Language Model-Based Framework for Multi-Step Evidence Retrieval and Reasoning in ...
验证网络威胁情报(CTI)的可信度对于可靠的网络安全防御至关重要。然而,传统方法通常将该任务视为静态分类问题,依赖手工设计的特征或孤立的深度学习模型。这些方法往往缺乏处理不完整、异构或嘈杂情报的鲁棒性,且决策透明度有限——这些因素降低了它们在实际威胁环境中的有效性。为解决这些局限性,我们提出LRCTI,一种基于大语言模型(LLM)的框架,专为多步CTI可信度验证设计。该框架首先采用文本摘要模块,将复杂的情报报告提炼为简洁且可操作的威胁声明。
Evaluating the Effectiveness of Cost-Efficient Large Language Models in Benchmark Biomedical Tasks
本文对具有成本效益的大型语言模型(LLMs)在多种生物医学任务(涵盖文本和图像模态)中的有效性进行了全面评估。研究涉及闭源和开源LLMs,任务包括生物医学文本分类、生成、问答以及多模态图像处理等。没有单一LLM能在所有任务中持续优于其他模型,不同模型在特定任务中表现更优;部分闭源LLM在特定任务中表现强劲,但开源LLM在性能上可与之媲美(有时甚至更优),且具有推理速度更快、隐私性更强等额外优势;通过模型缩放实验发现,闭源模型增大规模通常能提升性能,而开源模型缩小规模会导致性能下降。
KROMA: Ontology Matching with Knowledge Retrieval and Large Language Models
本文提出了一种名为KROMA的新型本体匹配(OntologyMatching,OM)框架,旨在解决现有本体匹配系统依赖手工规则或专用模型、适应性有限的问题。KROMA将大型语言模型(LLMs)与检索增强生成(RAG)pipeline结合,通过动态富集结构、词汇和定义知识的语义上下文来优化本体匹配。为平衡性能与效率,KROMA集成了基于双相似性的概念匹配和轻量级本体优化步骤,可修剪候选概念并减少LLM调用的通信开销。
Large Language Models in the Travel Domain: An Industrial Experience
本文是一项关于在旅游领域集成大型语言模型(LLMs)的工业案例研究,以FERVENTO公司开发的酒店预订平台CALEIDOHOTELS为背景,旨在解决第三方数据源中住宿信息不完整、不一致的问题。研究评估了两种LLM模型的表现:通过QLoRA技术微调的Mistral7B,以及采用优化系统提示的Mixtral8x7B,重点关注模型生成描述的一致性、同质性和幻觉率(生成虚假信息的比例)。
Large Language Models as Innovators: A Framework to Leverage Latent Space Exploration for Novelty...
研究背景:大型语言模型(LLMs)在生成新颖且相关的创意时存在局限,常重复训练数据中的模式,现有方法依赖领域特定启发式或结构化提示,通用性差。核心框架:提出模型无关的潜在空间构思框架,通过探索连续的“想法嵌入空间”实现可控、可扩展的创造力。该框架包含语义编码器、潜在探索器、跨模态投影器、解码器LLM、评估器LLM等组件,可从文本brief或种子想法出发,通过迭代探索潜在空间生成新想法。工作流程。
Question-Answer Extraction from Scientific Articles Using Knowledge Graphs and Large Language Models
当学者决定阅读一篇论文或将其纳入自己的研究时,他们往往希望快速识别并理解其核心思想。本文旨在以问答对(QA)的形式从科学论文中提取这些关键概念和贡献。我们提出了两种不同的QA生成方法。第一种方法包括选择突出段落,使用大语言模型(LLM)生成问题,根据获得有意义答案的可能性对这些问题进行排序,然后生成答案。这种方法完全依赖于论文的内容。然而,评估一篇论文的新颖性通常需要与现有文献进行比较。因此,我们的第二种方法利用知识图谱(KG)生成QA对。
Impact of Code Context and Prompting Strategies on Automated Unit Test Generation with Modern Gen...
本文研究了代码上下文和提示策略对大型语言模型(LLMs)自动生成单元测试的质量和充分性的影响。研究选取了6个不同家族的LLM模型(如GPT系列、Claude、Gemini等),设计了12个自定义Python方法(模拟购物车系统)作为测试对象,通过两种提示策略(简单提示S1、思维链提示S2)和三种代码上下文(仅方法签名CF1、方法签名+文档字符串CF2、完整实现+文档字符串CF3),从编译成功率(CSR)、分支覆盖率(BC)、突变分数(MS)等多维度评估生成的单元测试质量。
LLMs: A Game-Changer for Software Engineers?
大语言模型(LLMs)正通过实现智能、自适应和自动化的威胁检测、漏洞评估和事件响应方法,改变网络安全领域。凭借其先进的语言理解和上下文推理能力,LLMs在解决物联网、区块链和硬件安全等领域的挑战方面超越了传统方法。本综述全面概述了LLMs在网络安全中的应用,重点关注两个核心领域:(1)LLMs与关键网络安全领域的整合;(2)LLMs自身的漏洞及缓解策略。通过综合近期进展并识别关键局限性,本研究为利用LLMs构建安全、可扩展且面向未来的网络防御系统提供了实用见解和战略建议。
A Comprehensive Review on Harnessing Large Language Models to Overcome Recommender System Challenges
传统推荐系统的局限性:传统推荐系统采用模块化架构(候选生成、多阶段排序、重排序),各模块独立训练,依赖人工设计特征和有监督目标,面临数据稀疏、冷启动、个性化深度有限、语义理解不足等持续挑战。LLMs在推荐系统中的应用基于提示的候选检索(prompt-drivencandidateretrieval);原生语言排序(language-nativeranking);检索增强生成(RAG);对话式推荐(conversationalrecommendation)。
Promptomatix: An Automatic Prompt Optimization Framework for Large Language Models
本文介绍了,一款自动提示词优化框架,旨在解决大型语言模型(LLMs)提示词工程中存在的手动操作、专业性要求高、效率低等问题。该框架能将自然语言任务描述自动转化为高质量提示词,无需用户手动调整或具备领域专业知识。分析用户意图,自动提取任务类型、输入输出结构等关键信息;生成高质量合成训练数据,解决数据稀缺问题;自动选择适配的提示策略(如思维链、程序链等);基于成本感知目标(平衡性能与计算开销)迭代优化提示词;支持轻量级元提示优化器和基于DSPy的编译器,模块化设计便于扩展至更多高级框架。
A Comparative Approach to Assessing Linguistic Creativity of Large Language Models and Humans
本文设计了一套综合语言创造力测试,旨在比较人类与大型语言模型(LLMs)的语言创造力。测试包含两部分共8项任务,聚焦构词法(派生、复合等)和隐喻语言使用能力,要求参与者生成原创词语或短语。研究对24名19-25岁的非英语母语大学生(英语水平B2及以上)和24个开源LLMs进行了测试,通过OCSAI工具从原创性(Originality)详尽性(Elaboration)灵活性(Flexibility)三个维度自动评估,并结合手动分析。LLMs在所有评估标准上均优于人类,且在8项任务中的6项表现更优;
Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large Language Models
指令遵循能力已成为大型语言模型(LLMs)的核心评估能力之一(Brown等人,2020;Bai等人,2023)。然而,现有数据集(如IFEval(Zhou等人,2023;Zeng等人,2024))要么以单语为主且聚焦英语,要么仅通过机器翻译转换为其他语言,限制了其在多语言场景中的适用性。本文提出了IFEval的一个精心构建的本地化多语言扩展版本——Marco-Bench-MIF,涵盖30种语言,每种语言都有不同程度的本地化处理。
Mixture of Experts in Large Language Models
理论基础与发展历程:追溯MoE从早期自适应学习系统到现代大规模稀疏激活架构的演变,重点梳理2020年后GShard、SwitchTransformer等里程碑模型推动MoE成为高效缩放方案的关键节点。核心架构与路由机制:分析MoE的核心组件(专家模块、门控函数、负载均衡策略),对比不同路由机制(如TokenChoicevs.ExpertChoice、学习型路由vs.固定路由),以及分层、异构等高级架构变体。元学习与知识转移。
