Loading...

Efficient Temporal Tokenization for Mobility Prediction with Large Language Models
本文提出了一种名为RHYTHM(ReasoningwithHierarchicalTemporalTokenizationforHumanMobility)的框架,旨在利用大型语言模型(LLMs)进行人类移动性预测和轨迹推理。该框架的核心思路是通过结构化的时间抽象重构移动性建模,将轨迹分割为日常片段并编码为离散token,结合分层注意力机制捕捉每日和每周的依赖关系,同时大幅缩短序列长度。

Linguistic and Embedding-Based Profiling of Texts generated by Humans and Large Language Models
本文聚焦于人类撰写文本(HWT)与大型语言模型(LLMs)生成文本(MGT)的语言特征差异,通过多维度语言分析(形态学、句法、语义等)揭示两者的区别,并探讨模型输出的变异性与同质化趋势。研究使用RAID数据集(涵盖8个领域、11种LLMs的467,985条文本),提取了文本长度、句子长度、形态复杂度、依存深度、情感性等10项语言特征,结合统计分析、逻辑分类器和风格嵌入模型进行分析。人类文本倾向于句法结构更简单、语义内容更多样;人类与机器文本在不同领域均表现出风格多样性,但人类的特征变异性更大;

A Collaborative Framework Integrating Large Language Model and Chemical Fragment Space: Mutual In...
药物设计,尤其是铅化合物的发现,对对抗疾病和提升人类健康具有核心战略意义。然而,现有的计算方法难以有效整合领域特定知识,严重限制了其识别具有经验证结合模式和新骨架的新型铅化合物的能力。本文提出了AutoLeadDesign——一种铅化合物设计框架,该框架利用化学片段启发大语言模型中蕴含的丰富领域知识,以逐步实现对广阔化学空间的高效探索。综合实验表明,AutoLeadDesign的性能优于基准方法。

GOFAI meets Generative AI: Development of Expert Systems by means of Large Language Models
大型语言模型(LLMs)的发展成功改变了基于知识的系统(如开放域问答系统),这些系统能够自动生成大量看似连贯的信息。然而,这些模型存在一些缺点,例如会产生“幻觉”,即自信地生成错误或不可验证的事实。在本文中,我们提出了一种利用LLMs以可控且透明的方式开发专家系统的新方法。通过限制领域范围并采用结构化的基于提示的提取方法,我们生成了Prolog语言的符号化知识表示,这些表示可由人类专家验证和修正。该方法还保证了所开发专家系统的可解释性、可扩展性和可靠性。

Assessing the Reliability of Large Language Models for Deductive Qualitative Coding: A Comparativ...
本文聚焦大型语言模型(LLMs)在演绎定性编码中的可靠性评估,以ChatGPT为研究对象,通过比较议程项目(CAP)主编码手册,将美国最高法院案例摘要分类为21个主要政策领域,系统测试了四种干预策略(零样本、少样本、基于定义、分步任务分解)的效果。分步任务分解策略表现最优,准确率达0.775,Cohen’sκ为0.744,Krippendorff’sα为0.746,达到“实质性一致”阈值;干预策略对分类结果影响显著(如基于定义与少样本策略的Cramér’sV=0.613);

Aligning Large Language Models to Low-Resource Languages through LLM-Based Selective Translation:...
本文聚焦于多语言大语言模型(LLMs)在低资源语言(以印地语为例)中的性能差距问题,旨在通过基于LLM的选择性翻译技术提升模型在低资源语言上的对齐效果。研究背景指出,多语言LLMs在英语与非英语语言(尤其是低资源语言)间存在显著性能差异,核心瓶颈在于低资源语言缺乏高质量对齐数据。传统方法通过翻译英语对齐数据来补充,但常规翻译技术难以保留代码、数学表达式、JSON等非可翻译内容,导致数据失效。为此,本文提出基于LLM的选择性翻译:仅翻译文本中可翻译部分,同时保留非可翻译内容和句子结构。

Automated Interpretation of Non-Destructive Evaluation Contour Maps Using Large Language Models f...
桥梁的维护和安全对交通部门至关重要,无损检测(NDE)技术是评估结构完整性的关键。然而,解读NDE数据耗时且需要专业知识,可能延误决策。大型语言模型(LLMs)的最新进展为自动化和改进这种分析提供了新途径。本试点研究全面评估了LLM解释NDEcontour图的能力,并展示了LLMs在提供详细桥梁状况分析方面的有效性。研究建立了将LLMs整合到桥梁检测工作流的框架,表明LLM辅助分析可在不影响准确性的前提下提高效率。

osmAG-LLM: Zero-Shot Open-Vocabulary Object Navigation via Semantic Maps and Large Language Model...
近年来,开放词汇机器人映射方法通过预训练的视觉-语言特征丰富密集几何地图,实现了高细节描述,并能引导机器人根据开放词汇语言查询找到物体。尽管这类方法的可扩展性已受到一定关注,但另一个根本问题是:高细节物体映射会因物体频繁移动而迅速过时。在本研究中,我们开发了一种用于目标导航的映射与导航系统,从根本上考虑了查询物体可能已移动或完全未被映射的情况。我们不追求高保真的映射细节,而是认为地图的主要作用是提供环境锚定和上下文,并将其与LLM的语义先验结合,推理物体位置,同时采用主动在线方法导航至目标物体。

Graph Representations for Reading Comprehension Analysis using Large Language Model and Eye-Track...
本文聚焦于阅读理解分析,旨在通过大型语言模型(LLMs)与眼动追踪生物标志物,探索人类与LLMs在语言理解上的差异与一致性。研究背景:阅读理解是人类认知发展的核心技能,但全球约61%的青少年未达到基础阅读能力。此前研究利用LLMs标记单个单词与推理目标的相关性,并通过脑电图(EEG)和眼动追踪验证,但仅关注单个单词,难以捕捉句子的整体语义和关键短语的作用。研究方法:提出基于LLM的图表示方法,将阅读材料中的词或短语作为节点,语义/句法关系作为边,构建知识图谱;

What is the Best Process Model Representation? A Comparative Analysis for Process Modeling with L...
大型语言模型(LLMs)正越来越多地应用于流程建模(PMo)任务,如流程模型生成(PMG)。为支持这些任务,研究者们引入了多种流程模型表示(PMRs),作为模型抽象或生成目标。然而,这些PMRs在结构、复杂度和可用性上差异显著,且从未被系统比较过。此外,近年来的PMG方法依赖于不同的评估策略和生成技术,导致比较困难。本文提出了首个实证研究,在LLMs辅助的PMo场景下评估多种PMRs。我们引入了PMo数据集,这是一个新的数据集,包含55个流程描述及对应9种不同PMRs的模型。

Automated Novelty Evaluation of Academic Paper: A Collaborative Approach Integrating Human and La...
新颖性是学术论文同行评审过程中的关键评估标准。传统上,新颖性由专家判断或通过独特的引用组合来衡量。两种方法都有局限性:专家的知识有限,且组合方法的有效性不确定。此外,独特的引用是否真能衡量新颖性尚不明确。大型语言模型(LLM)拥有丰富的知识,而人类专家则具备LLM所不具备的判断能力。因此,本研究整合了LLM和人类专家的知识与能力,以解决新颖性评估的局限性。学术论文中最常见的新颖性类型之一是新方法的引入。本文提出利用人类知识和LLM辅助预训练语言模型(PLMs,如BERT等)预测论文的方法新颖性。

Exploiting Primacy Effect To Improve Large Language Models
大型语言模型(LLMs)凭借广泛的预训练和微调,在许多自然语言处理(NLP)任务中已成为不可或缺的工具,并实现了较高的准确率。然而,与人类相似,LLMs也存在偏差,特别是位置偏差,如首因效应和近因效应,这些偏差可能会影响答案的准确性。首因效应——即首先呈现的项目更有可能被记住或选择——在多项选择问答(MCQA)中起着关键作用,其中答案选项的顺序会影响预测结果。本研究聚焦微调后的LLMs中的首因偏差:我们首先证明,微调会放大这种偏差,这可能是由于模型接触了类人的模式。

EXAONE 4.0: Unified Large Language Models Integrating Non-reasoning and Reasoning Modes
本文是LGAIResearch发布的技术报告,介绍了大语言模型EXAONE4.0的核心特性、技术细节与性能表现。该模型整合了非推理模式(NON-REASONING)和推理模式(REASONING),既保留了EXAONE3.5的高可用性,又继承了EXAONEDeep的高级推理能力。EXAONE4.0系列包含两个版本:320亿参数的中尺寸模型(优化高性能场景)和12亿参数的小尺寸模型(适用于端侧应用)。

Internal Value Alignment in Large Language Models through Controlled Value Vector Activation
本文针对大型语言模型(LLMs)的价值观对齐问题,提出了一种名为的框架,旨在通过直接调控模型内部的价值表征,使LLMs与人类价值观(基于Schwartz的10种基本价值观理论)保持一致,同时避免牺牲模型性能和输出流畅性。上下文控制的价值向量识别:通过构建上下文可控的数据集(确保正负样本仅在目标价值观上对立,其他无关上下文一致),消除传统数据集的上下文偏差,准确识别模型潜在空间中编码价值观的向量。门控价值向量激活。

LRCTI: A Large Language Model-Based Framework for Multi-Step Evidence Retrieval and Reasoning in ...
验证网络威胁情报(CTI)的可信度对于可靠的网络安全防御至关重要。然而,传统方法通常将该任务视为静态分类问题,依赖手工设计的特征或孤立的深度学习模型。这些方法往往缺乏处理不完整、异构或嘈杂情报的鲁棒性,且决策透明度有限——这些因素降低了它们在实际威胁环境中的有效性。为解决这些局限性,我们提出LRCTI,一种基于大语言模型(LLM)的框架,专为多步CTI可信度验证设计。该框架首先采用文本摘要模块,将复杂的情报报告提炼为简洁且可操作的威胁声明。

Evaluating the Effectiveness of Cost-Efficient Large Language Models in Benchmark Biomedical Tasks
本文对具有成本效益的大型语言模型(LLMs)在多种生物医学任务(涵盖文本和图像模态)中的有效性进行了全面评估。研究涉及闭源和开源LLMs,任务包括生物医学文本分类、生成、问答以及多模态图像处理等。没有单一LLM能在所有任务中持续优于其他模型,不同模型在特定任务中表现更优;部分闭源LLM在特定任务中表现强劲,但开源LLM在性能上可与之媲美(有时甚至更优),且具有推理速度更快、隐私性更强等额外优势;通过模型缩放实验发现,闭源模型增大规模通常能提升性能,而开源模型缩小规模会导致性能下降。

KROMA: Ontology Matching with Knowledge Retrieval and Large Language Models
本文提出了一种名为KROMA的新型本体匹配(OntologyMatching,OM)框架,旨在解决现有本体匹配系统依赖手工规则或专用模型、适应性有限的问题。KROMA将大型语言模型(LLMs)与检索增强生成(RAG)pipeline结合,通过动态富集结构、词汇和定义知识的语义上下文来优化本体匹配。为平衡性能与效率,KROMA集成了基于双相似性的概念匹配和轻量级本体优化步骤,可修剪候选概念并减少LLM调用的通信开销。

Large Language Models in the Travel Domain: An Industrial Experience
本文是一项关于在旅游领域集成大型语言模型(LLMs)的工业案例研究,以FERVENTO公司开发的酒店预订平台CALEIDOHOTELS为背景,旨在解决第三方数据源中住宿信息不完整、不一致的问题。研究评估了两种LLM模型的表现:通过QLoRA技术微调的Mistral7B,以及采用优化系统提示的Mixtral8x7B,重点关注模型生成描述的一致性、同质性和幻觉率(生成虚假信息的比例)。

Large Language Models as Innovators: A Framework to Leverage Latent Space Exploration for Novelty...
研究背景:大型语言模型(LLMs)在生成新颖且相关的创意时存在局限,常重复训练数据中的模式,现有方法依赖领域特定启发式或结构化提示,通用性差。核心框架:提出模型无关的潜在空间构思框架,通过探索连续的“想法嵌入空间”实现可控、可扩展的创造力。该框架包含语义编码器、潜在探索器、跨模态投影器、解码器LLM、评估器LLM等组件,可从文本brief或种子想法出发,通过迭代探索潜在空间生成新想法。工作流程。

Question-Answer Extraction from Scientific Articles Using Knowledge Graphs and Large Language Models
当学者决定阅读一篇论文或将其纳入自己的研究时,他们往往希望快速识别并理解其核心思想。本文旨在以问答对(QA)的形式从科学论文中提取这些关键概念和贡献。我们提出了两种不同的QA生成方法。第一种方法包括选择突出段落,使用大语言模型(LLM)生成问题,根据获得有意义答案的可能性对这些问题进行排序,然后生成答案。这种方法完全依赖于论文的内容。然而,评估一篇论文的新颖性通常需要与现有文献进行比较。因此,我们的第二种方法利用知识图谱(KG)生成QA对。

欢迎留下您的脚印