Loading...
传统推荐系统的局限性:传统推荐系统采用模块化架构(候选生成、多阶段排序、重排序),各模块独立训练,依赖人工设计特征和有监督目标,面临数据稀疏、冷启动、个性化深度有限、语义理解不足等持续挑战。LLMs在推荐系统中的应用基于提示的候选检索(prompt-drivencandidateretrieval);原生语言排序(language-nativeranking);检索增强生成(RAG);对话式推荐(conversationalrecommendation)。
Promptomatix: An Automatic Prompt Optimization Framework for Large Language Models
本文介绍了,一款自动提示词优化框架,旨在解决大型语言模型(LLMs)提示词工程中存在的手动操作、专业性要求高、效率低等问题。该框架能将自然语言任务描述自动转化为高质量提示词,无需用户手动调整或具备领域专业知识。分析用户意图,自动提取任务类型、输入输出结构等关键信息;生成高质量合成训练数据,解决数据稀缺问题;自动选择适配的提示策略(如思维链、程序链等);基于成本感知目标(平衡性能与计算开销)迭代优化提示词;支持轻量级元提示优化器和基于DSPy的编译器,模块化设计便于扩展至更多高级框架。
A Comparative Approach to Assessing Linguistic Creativity of Large Language Models and Humans
本文设计了一套综合语言创造力测试,旨在比较人类与大型语言模型(LLMs)的语言创造力。测试包含两部分共8项任务,聚焦构词法(派生、复合等)和隐喻语言使用能力,要求参与者生成原创词语或短语。研究对24名19-25岁的非英语母语大学生(英语水平B2及以上)和24个开源LLMs进行了测试,通过OCSAI工具从原创性(Originality)详尽性(Elaboration)灵活性(Flexibility)三个维度自动评估,并结合手动分析。LLMs在所有评估标准上均优于人类,且在8项任务中的6项表现更优;
Marco-Bench-MIF: On Multilingual Instruction-Following Capability of Large Language Models
指令遵循能力已成为大型语言模型(LLMs)的核心评估能力之一(Brown等人,2020;Bai等人,2023)。然而,现有数据集(如IFEval(Zhou等人,2023;Zeng等人,2024))要么以单语为主且聚焦英语,要么仅通过机器翻译转换为其他语言,限制了其在多语言场景中的适用性。本文提出了IFEval的一个精心构建的本地化多语言扩展版本——Marco-Bench-MIF,涵盖30种语言,每种语言都有不同程度的本地化处理。
Mixture of Experts in Large Language Models
理论基础与发展历程:追溯MoE从早期自适应学习系统到现代大规模稀疏激活架构的演变,重点梳理2020年后GShard、SwitchTransformer等里程碑模型推动MoE成为高效缩放方案的关键节点。核心架构与路由机制:分析MoE的核心组件(专家模块、门控函数、负载均衡策略),对比不同路由机制(如TokenChoicevs.ExpertChoice、学习型路由vs.固定路由),以及分层、异构等高级架构变体。元学习与知识转移。
KptLLM++: Towards Generic Keypoint Comprehension with Large Language Model
本文提出了一种名为KptLLM++的新型多模态大语言模型,专门用于通用关键点理解(GenericKeypointComprehension)。该模型旨在解决现有多模态大语言模型(MLLMs)在细粒度语义信息(如对象关键点的精确识别与分析)上的不足,通过整合视觉和文本模态,结合用户定义的指令,实现对关键点的语义理解与精确定位。KptLLM++基于“先识别后检测”(identify-then-detect)范式,先解析关键点的语义,再通过结构化的思维链推理机制定位其精确位置。
LogTinyLLM: Tiny Large Language Models Based Contextual Log Anomaly Detection
本文聚焦于系统日志异常检测的挑战,提出了一种基于小型大型语言模型(TinyLLMs)的参数高效微调(PEFT)框架——LogTinyLLM,旨在通过低秩适应(LoRA)和适配器(Adapter)方法解决传统日志异常检测方法(如规则基于方法、深度学习方法)在处理大规模、复杂日志序列时的局限性(如计算成本高、难以捕捉上下文和时序信息)。日志解析:使用Drain算法将原始日志转换为结构化“日志键”,并通过滑动窗口技术构建日志序列;模型选择。
LLMATCH: A Unified Schema Matching Framework with Large Language Models
模式匹配是企业数据集成中的基础性任务,旨在对齐不同的数据源。传统方法能处理简单的一对一表映射,但在实际应用中常难以应对复杂的多表模式匹配。本文提出LLMatch,一个统一的模块化模式匹配框架。LLMatch将模式匹配分解为三个不同阶段:模式准备、表候选选择和列级对齐,支持组件级评估和面向未来的兼容性。它包含一种新颖的两阶段优化策略:Rollup模块将语义相关的列整合为高阶概念,随后Drilldown模块将这些概念重新展开以实现细粒度的列映射。
Absher: A Benchmark for Evaluating Large Language Models Understanding of Saudi Dialects
随着大型语言模型(LLMs)在阿拉伯语自然语言处理应用中日益占据核心地位,评估它们对区域方言和文化细微差别的理解变得至关重要,尤其是在沙特阿拉伯这样语言多样化的环境中。本文介绍了Absher,这一专门设计的综合基准,用于评估LLMs在主要沙特方言上的表现。Absher包含超过18,000个多选题,涵盖六个不同类别:意义识别、真假判断、填空、语境使用、文化解释和位置识别。这些问题源自精心筛选的沙特各地区方言词汇、短语和谚语数据集。
Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving
本文针对Transformer架构的大型语言模型(LLMs)在长上下文推理中面临的计算与内存成本随序列长度增长的问题,以及后Transformer模型(如状态空间模型SSMs、线性注意力、循环神经网络RNNs)的兴起,提出了一种基于存内处理(PIM)的加速方案Pimba,以统一支持Transformer和后Transformer模型的高效服务。核心发现:Transformer的注意力机制和后Transformer的状态更新操作均受限于内存带宽,成为批处理推理的性能瓶颈。
Modeling Understanding of Story-Based Analogies Using Large Language Models
本文聚焦大型语言模型(LLMs)在基于故事的类比推理任务中的表现,通过与人类认知对比,深入探究LLMs的类比推理能力。语义表示:使用BERT的句子嵌入评估LLMs是否能捕捉源故事与真类比目标故事的相似性,以及与假类比干扰故事的差异性;提示策略:测试“两步增强提示法”(让模型自生成提示后再推理)能否提升LLMs与人类表现的一致性;细粒度对齐:从单个类比问题层面而非仅整体准确率,评估LLMs与人类对“难易问题”的判断是否一致;模型因素。
A Code Comprehension Benchmark for Large Language Models for Code
本文聚焦于大型语言模型(LLMs)的代码理解能力,指出尽管LLMs在代码生成、补全等任务中表现出色(得益于大规模代码数据训练及下一个token预测的预训练目标),但它们往往仅学习到代码的表层句法模式,缺乏对代码语义的深层理解,导致在代码调试、优化等需语义理解的任务中表现不佳。为解决这一问题,研究提出通过在大规模数据集上针对代码理解任务微调模型,以增强其对代码语义的稳健理解。
Enhancing the Capabilities of Large Language Models for API calls through Knowledge Graphs
本文聚焦气象等知识密集型领域中,大语言模型(LLM)通过API调用利用工具的能力不足问题,提出了名为KG2data的系统。该系统整合知识图谱、LLM、ReAct代理和工具使用技术,实现气象领域的智能数据获取与查询处理。通过虚拟API测试,将KG2data与chat2data(无知识模块)、RAG2data(用向量数据库替代知识图谱)对比,结果显示KG2data在名称识别失败率(1.43%)、幻觉识别失败率(0%)、API调用准确率(88.57%)等指标上均优于后两者。
Towards Applying Large Language Models to Complement Single-Cell Foundation Models
本文聚焦于大语言模型(LLMs)与单细胞基础模型(如scGPT)的互补应用,旨在解决单细胞基础模型无法利用生物文本信息的局限性。研究背景:单细胞基础模型(如scGPT)在单细胞组学任务中表现优异,但仅基于基因表达数据训练,无法利用海量生物文本知识;而LLMs因预训练时涵盖生物知识,被尝试用于单细胞分析,但现有研究多将其作为替代方案,对其性能驱动因素及与单细胞模型的互补性探索不足。核心方法通过可解释性方法(集成梯度、LIME)和消融实验,探究LLMs在单细胞数据分析中的性能机制;
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Languag...
视频理解在将低级视觉信号与高级认知推理连接方面发挥着关键作用,并且是自动驾驶、具身人工智能以及更广泛的通用人工智能(AGI)追求的基础。大型语言模型(LLMs)的快速发展,特别是那些利用思维链(CoT)技术的模型,显著提升了视频推理能力。然而,当前方法主要依赖文本信息进行推理,忽视了实际视频推理过程中的视觉模态。相比之下,人类在推理时会自然地重新审视视觉内容。受此启发,我们提出了一种新型视频推理范式:视频-文本交织思维链(ViTCoT),它能促进更直观且与认知对齐的推理。
Enhancing Trading Performance Through Sentiment Analysis with Large Language Models: Evidence fro...
本文聚焦多模态大语言模型(MLLMs)在音频隐私安全领域的风险,首次系统研究了MLLMs通过音频数据推断敏感个人属性的能力(称为“音频隐私属性分析”),并提出了相应的数据集、框架和防御策略。研究背景与问题:MLLMs的发展带来了跨模态任务的突破,但也引发新的隐私风险。相比文本和图像,音频具有易被隐蔽采集、包含语调/音高等独特信息的特点,但其隐私属性分析尚未被充分研究。核心挑战缺乏带敏感属性标注的音频基准数据集;
The Man Behind the Sound: Demystifying Audio Private Attribute Profiling via Multimodal Large Lan...
本文聚焦多模态大语言模型(MLLMs)在音频隐私安全领域的风险,首次系统研究了MLLMs通过音频数据推断敏感个人属性的能力(称为“音频隐私属性分析”),并提出了相应的数据集、框架和防御策略。研究背景与问题:MLLMs的发展带来了跨模态任务的突破,但也引发新的隐私风险。相比文本和图像,音频具有易被隐蔽采集、包含语调/音高等独特信息的特点,但其隐私属性分析尚未被充分研究。核心挑战缺乏带敏感属性标注的音频基准数据集;
LLMalMorph: On The Feasibility of Generating Variant Malware using Large-Language-Models
本文提出了一个名为LLMalMorph的半自动化框架,旨在利用大型语言模型(LLMs)对恶意软件源代码进行修改,生成具有逃避检测能力的变体,同时保留其核心恶意功能。框架设计函数变异器(FunctionMutator):通过抽象语法树(AST)提取恶意软件源代码中的函数、头文件和全局变量,结合精心设计的提示词(Prompt)和代码转换策略,利用LLM(如Codestral-22B)对函数进行修改。变体合成器(VariantSynthesizer)
Persona-Based Synthetic Data Generation Using Multi-Stage Conditioning with Large Language Models...
本文针对情感识别领域高质量、多样化情感数据集稀缺的问题,提出了一种基于大语言模型(LLM)的新型框架PersonaGen。该框架通过多阶段角色条件控制基础角色构建:采样年龄、性别、职业、人格类型(如MBTI)等人口统计学属性,确保组合的合理性;社会文化背景整合:加入教育背景、居住地、家庭结构、宗教信仰、收入水平等维度,增强角色的真实性;情境与风格设置:定义具体场景(如地点、活动、交流对象)和语言风格(如礼貌用语、网络俚语);情感文本生成:基于上述角色和情境,引导LLM生成符合目标情感类别的文本。
Emergence of Hierarchical Emotion Organization in Large Language Models
LLMs自然形成情感层级结构:随着模型规模增大(如Llama3.18B到405B),其内部会涌现出更复杂的情感层级树,且与人类心理学中的情感层级模型(如Shaver等人1987年提出的情感轮)的一致性更强。情感层级复杂度与识别能力相关:模型情感层级的几何特征(如路径长度、平均深度)可预测其情感识别准确率,层级越复杂,识别能力越强。LLMs存在系统性情感识别偏差。
