Loading...

KROMA: Ontology Matching with Knowledge Retrieval and Large Language Models
本文提出了一种名为KROMA的新型本体匹配(OntologyMatching,OM)框架,旨在解决现有本体匹配系统依赖手工规则或专用模型、适应性有限的问题。KROMA将大型语言模型(LLMs)与检索增强生成(RAG)pipeline结合,通过动态富集结构、词汇和定义知识的语义上下文来优化本体匹配。为平衡性能与效率,KROMA集成了基于双相似性的概念匹配和轻量级本体优化步骤,可修剪候选概念并减少LLM调用的通信开销。

Large Language Models in the Travel Domain: An Industrial Experience
本文是一项关于在旅游领域集成大型语言模型(LLMs)的工业案例研究,以FERVENTO公司开发的酒店预订平台CALEIDOHOTELS为背景,旨在解决第三方数据源中住宿信息不完整、不一致的问题。研究评估了两种LLM模型的表现:通过QLoRA技术微调的Mistral7B,以及采用优化系统提示的Mixtral8x7B,重点关注模型生成描述的一致性、同质性和幻觉率(生成虚假信息的比例)。

Large Language Models as Innovators: A Framework to Leverage Latent Space Exploration for Novelty...
研究背景:大型语言模型(LLMs)在生成新颖且相关的创意时存在局限,常重复训练数据中的模式,现有方法依赖领域特定启发式或结构化提示,通用性差。核心框架:提出模型无关的潜在空间构思框架,通过探索连续的“想法嵌入空间”实现可控、可扩展的创造力。该框架包含语义编码器、潜在探索器、跨模态投影器、解码器LLM、评估器LLM等组件,可从文本brief或种子想法出发,通过迭代探索潜在空间生成新想法。工作流程。

Question-Answer Extraction from Scientific Articles Using Knowledge Graphs and Large Language Models
当学者决定阅读一篇论文或将其纳入自己的研究时,他们往往希望快速识别并理解其核心思想。本文旨在以问答对(QA)的形式从科学论文中提取这些关键概念和贡献。我们提出了两种不同的QA生成方法。第一种方法包括选择突出段落,使用大语言模型(LLM)生成问题,根据获得有意义答案的可能性对这些问题进行排序,然后生成答案。这种方法完全依赖于论文的内容。然而,评估一篇论文的新颖性通常需要与现有文献进行比较。因此,我们的第二种方法利用知识图谱(KG)生成QA对。

Impact of Code Context and Prompting Strategies on Automated Unit Test Generation with Modern Gen...
本文研究了代码上下文和提示策略对大型语言模型(LLMs)自动生成单元测试的质量和充分性的影响。研究选取了6个不同家族的LLM模型(如GPT系列、Claude、Gemini等),设计了12个自定义Python方法(模拟购物车系统)作为测试对象,通过两种提示策略(简单提示S1、思维链提示S2)和三种代码上下文(仅方法签名CF1、方法签名+文档字符串CF2、完整实现+文档字符串CF3),从编译成功率(CSR)、分支覆盖率(BC)、突变分数(MS)等多维度评估生成的单元测试质量。

LLMs: A Game-Changer for Software Engineers?
大语言模型(LLMs)正通过实现智能、自适应和自动化的威胁检测、漏洞评估和事件响应方法,改变网络安全领域。凭借其先进的语言理解和上下文推理能力,LLMs在解决物联网、区块链和硬件安全等领域的挑战方面超越了传统方法。本综述全面概述了LLMs在网络安全中的应用,重点关注两个核心领域:(1)LLMs与关键网络安全领域的整合;(2)LLMs自身的漏洞及缓解策略。通过综合近期进展并识别关键局限性,本研究为利用LLMs构建安全、可扩展且面向未来的网络防御系统提供了实用见解和战略建议。

A Comprehensive Review on Harnessing Large Language Models to Overcome Recommender System Challenges
传统推荐系统的局限性:传统推荐系统采用模块化架构(候选生成、多阶段排序、重排序),各模块独立训练,依赖人工设计特征和有监督目标,面临数据稀疏、冷启动、个性化深度有限、语义理解不足等持续挑战。LLMs在推荐系统中的应用基于提示的候选检索(prompt-drivencandidateretrieval);原生语言排序(language-nativeranking);检索增强生成(RAG);对话式推荐(conversationalrecommendation)。

Promptomatix: An Automatic Prompt Optimization Framework for Large Language Models
本文介绍了,一款自动提示词优化框架,旨在解决大型语言模型(LLMs)提示词工程中存在的手动操作、专业性要求高、效率低等问题。该框架能将自然语言任务描述自动转化为高质量提示词,无需用户手动调整或具备领域专业知识。分析用户意图,自动提取任务类型、输入输出结构等关键信息;生成高质量合成训练数据,解决数据稀缺问题;自动选择适配的提示策略(如思维链、程序链等);基于成本感知目标(平衡性能与计算开销)迭代优化提示词;支持轻量级元提示优化器和基于DSPy的编译器,模块化设计便于扩展至更多高级框架。

A Comparative Approach to Assessing Linguistic Creativity of Large Language Models and Humans
本文设计了一套综合语言创造力测试,旨在比较人类与大型语言模型(LLMs)的语言创造力。测试包含两部分共8项任务,聚焦构词法(派生、复合等)和隐喻语言使用能力,要求参与者生成原创词语或短语。研究对24名19-25岁的非英语母语大学生(英语水平B2及以上)和24个开源LLMs进行了测试,通过OCSAI工具从原创性(Originality)详尽性(Elaboration)灵活性(Flexibility)三个维度自动评估,并结合手动分析。LLMs在所有评估标准上均优于人类,且在8项任务中的6项表现更优;

Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large Language Models
指令遵循能力已成为大型语言模型(LLMs)的核心评估能力之一(Brown等人,2020;Bai等人,2023)。然而,现有数据集(如IFEval(Zhou等人,2023;Zeng等人,2024))要么以单语为主且聚焦英语,要么仅通过机器翻译转换为其他语言,限制了其在多语言场景中的适用性。本文提出了IFEval的一个精心构建的本地化多语言扩展版本——Marco-Bench-MIF,涵盖30种语言,每种语言都有不同程度的本地化处理。

Mixture of Experts in Large Language Models
理论基础与发展历程:追溯MoE从早期自适应学习系统到现代大规模稀疏激活架构的演变,重点梳理2020年后GShard、SwitchTransformer等里程碑模型推动MoE成为高效缩放方案的关键节点。核心架构与路由机制:分析MoE的核心组件(专家模块、门控函数、负载均衡策略),对比不同路由机制(如TokenChoicevs.ExpertChoice、学习型路由vs.固定路由),以及分层、异构等高级架构变体。元学习与知识转移。

KptLLM++: Towards Generic Keypoint Comprehension with Large Language Model
本文提出了一种名为KptLLM++的新型多模态大语言模型,专门用于通用关键点理解(GenericKeypointComprehension)。该模型旨在解决现有多模态大语言模型(MLLMs)在细粒度语义信息(如对象关键点的精确识别与分析)上的不足,通过整合视觉和文本模态,结合用户定义的指令,实现对关键点的语义理解与精确定位。KptLLM++基于“先识别后检测”(identify-then-detect)范式,先解析关键点的语义,再通过结构化的思维链推理机制定位其精确位置。

LogTinyLLM: Tiny Large Language Models Based Contextual Log Anomaly Detection
本文聚焦于系统日志异常检测的挑战,提出了一种基于小型大型语言模型(TinyLLMs)的参数高效微调(PEFT)框架——LogTinyLLM,旨在通过低秩适应(LoRA)和适配器(Adapter)方法解决传统日志异常检测方法(如规则基于方法、深度学习方法)在处理大规模、复杂日志序列时的局限性(如计算成本高、难以捕捉上下文和时序信息)。日志解析:使用Drain算法将原始日志转换为结构化“日志键”,并通过滑动窗口技术构建日志序列;模型选择。

LLMATCH: A Unified Schema Matching Framework with Large Language Models
模式匹配是企业数据集成中的基础性任务,旨在对齐不同的数据源。传统方法能处理简单的一对一表映射,但在实际应用中常难以应对复杂的多表模式匹配。本文提出LLMatch,一个统一的模块化模式匹配框架。LLMatch将模式匹配分解为三个不同阶段:模式准备、表候选选择和列级对齐,支持组件级评估和面向未来的兼容性。它包含一种新颖的两阶段优化策略:Rollup模块将语义相关的列整合为高阶概念,随后Drilldown模块将这些概念重新展开以实现细粒度的列映射。

Absher: A Benchmark for Evaluating Large Language Models Understanding of Saudi Dialects
随着大型语言模型(LLMs)在阿拉伯语自然语言处理应用中日益占据核心地位,评估它们对区域方言和文化细微差别的理解变得至关重要,尤其是在沙特阿拉伯这样语言多样化的环境中。本文介绍了Absher,这一专门设计的综合基准,用于评估LLMs在主要沙特方言上的表现。Absher包含超过18,000个多选题,涵盖六个不同类别:意义识别、真假判断、填空、语境使用、文化解释和位置识别。这些问题源自精心筛选的沙特各地区方言词汇、短语和谚语数据集。

Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
本文针对Transformer架构的大型语言模型(LLMs)在长上下文推理中面临的计算与内存成本随序列长度增长的问题,以及后Transformer模型(如状态空间模型SSMs、线性注意力、循环神经网络RNNs)的兴起,提出了一种基于存内处理(PIM)的加速方案Pimba,以统一支持Transformer和后Transformer模型的高效服务。核心发现:Transformer的注意力机制和后Transformer的状态更新操作均受限于内存带宽,成为批处理推理的性能瓶颈。

Modeling Understanding of Story-Based Analogies Using Large Language Models
本文聚焦大型语言模型(LLMs)在基于故事的类比推理任务中的表现,通过与人类认知对比,深入探究LLMs的类比推理能力。语义表示:使用BERT的句子嵌入评估LLMs是否能捕捉源故事与真类比目标故事的相似性,以及与假类比干扰故事的差异性;提示策略:测试“两步增强提示法”(让模型自生成提示后再推理)能否提升LLMs与人类表现的一致性;细粒度对齐:从单个类比问题层面而非仅整体准确率,评估LLMs与人类对“难易问题”的判断是否一致;模型因素。

A Code Comprehension Benchmark for Large Language Models for Code
本文聚焦于大型语言模型(LLMs)的代码理解能力,指出尽管LLMs在代码生成、补全等任务中表现出色(得益于大规模代码数据训练及下一个token预测的预训练目标),但它们往往仅学习到代码的表层句法模式,缺乏对代码语义的深层理解,导致在代码调试、优化等需语义理解的任务中表现不佳。为解决这一问题,研究提出通过在大规模数据集上针对代码理解任务微调模型,以增强其对代码语义的稳健理解。

Enhancing the Capabilities of Large Language Models for API calls through Knowledge Graphs
本文聚焦气象等知识密集型领域中,大语言模型(LLM)通过API调用利用工具的能力不足问题,提出了名为KG2data的系统。该系统整合知识图谱、LLM、ReAct代理和工具使用技术,实现气象领域的智能数据获取与查询处理。通过虚拟API测试,将KG2data与chat2data(无知识模块)、RAG2data(用向量数据库替代知识图谱)对比,结果显示KG2data在名称识别失败率(1.43%)、幻觉识别失败率(0%)、API调用准确率(88.57%)等指标上均优于后两者。

Towards Applying Large Language Models to Complement Single-Cell Foundation Models
本文聚焦于大语言模型(LLMs)与单细胞基础模型(如scGPT)的互补应用,旨在解决单细胞基础模型无法利用生物文本信息的局限性。研究背景:单细胞基础模型(如scGPT)在单细胞组学任务中表现优异,但仅基于基因表达数据训练,无法利用海量生物文本知识;而LLMs因预训练时涵盖生物知识,被尝试用于单细胞分析,但现有研究多将其作为替代方案,对其性能驱动因素及与单细胞模型的互补性探索不足。核心方法通过可解释性方法(集成梯度、LIME)和消融实验,探究LLMs在单细胞数据分析中的性能机制;

欢迎留下您的脚印