Loading...
现实世界的任务和环境与大型语言模型(LLMs)通常所评估的静态数据集存在差异。这类任务可能涉及序列交互,需要根据新证据连贯地更新信念,并基于这些信念做出恰当决策。预测LLMs在这类动态环境中的表现至关重要,但仅通过静态场景的测量难以准确判断。本研究考察了LLM性能的两个关键维度:连贯更新信念的能力,以及所采取行动与信念的一致性程度。首先,我们发现LLMs的信念更新方式存在显著不一致性——模型直接得出的后验概率与基于先验的正确更新结果之间,平均差异可达30%。
Rdgai: Classifying transcriptional changes using Large Language Models with a test case from an A...
本文聚焦文本传统系统发育分析中存在的变体分类难题,提出并开发了一款名为Rdgai的软件包。传统系统发育方法常将所有文本变体视为等价,导致真实系统发育信号被干扰或引入偏差,而手动分类变体耗时费力,成为该类分析的主要障碍。
A Comprehensive Study of Implicit and Explicit Biases in Large Language Models
大型语言模型(LLMs)从其训练数据集中继承了显性和隐性偏见。识别并减轻LLMs中的偏见对于确保输出结果的公平性至关重要,因为这些偏见可能会强化有害的刻板印象和错误信息。本研究强调,在生成式人工智能快速发展的背景下,解决LLMs中的偏见问题具有迫切性。我们采用了StereoSet和CrowSPairs等特定于偏见的基准数据集,对BERT和GPT-3.5等多款生成式模型中的各类偏见进行了评估。
PathMind: A Retrieve-Prioritize-Reason Framework for Knowledge Graph Reasoning with Large Languag...
知识图谱推理(KGR)是通过在知识图谱上执行逻辑演绎来推断新知识的任务。近年来,大型语言模型(LLMs)在复杂推理任务中展现出卓越性能。尽管取得了令人瞩目的成果,但当前基于LLM的KGR方法仍面临两个关键局限:首先,现有方法往往不加区分地提取推理路径,未评估其不同的重要性,可能引入无关噪声误导LLMs;其次,部分方法利用LLMs动态探索潜在推理路径,但需要高昂的检索需求和频繁的LLM调用。
Large Language Model-based Data Science Agent: A Survey
大型语言模型(LLMs)的快速发展推动了其在多个领域的创新应用,其中基于LLM的代理已成为重要的探索方向。本综述对专为数据科学任务设计的基于LLM的代理进行了全面分析,总结了近期研究的洞见。从代理视角,我们讨论了关键设计原则,包括代理角色、执行方式、知识来源和反思方法;从数据科学视角,我们识别了基于LLM的代理所涉及的关键流程,包括数据预处理、模型开发、评估、可视化等。本文的主要贡献有二:(1)全面回顾了将基于LLM的代理应用于数据科学任务的最新进展;
ConfGuard: A Simple and Effective Backdoor Detection for Large Language Models
本文针对大型语言模型(LLMs)面临的后门攻击问题,提出了一种轻量且高效的后门检测方法ConfGuard。后门攻击通过在训练过程中植入隐藏触发器,使模型在正常输入下表现正常,但在特定触发器输入时生成攻击者指定的恶意输出。现有防御方法多针对分类任务,难以适应LLMs的自回归特性和庞大输出空间,存在性能差、延迟高的问题。研究发现,后门模型存在“序列锁定”(sequencelock)现象:在生成目标序列时,其输出token的置信度异常高且稳定,几乎无分支点;而良性模型生成时,置信度会因分支点波动。
SmallThinker: A Family of Efficient Large Language Models Natively Trained for Local Deployment
本文介绍了SmallThinker系列大语言模型(LLMs),该系列模型并非通过压缩云端模型适配本地设备,而是从底层原生设计,专为本地设备的弱计算能力、有限内存和低速存储等约束优化。核心目标:突破大语言模型依赖云端GPU部署的限制,实现本地设备(如消费级CPU、智能手机)上的高效运行,同时保证性能。模型架构:采用两级稀疏结构(细粒度混合专家(MoE)+稀疏前馈网络)减少计算需求;通过预注意力路由器(pre-attentionrouter)提前预测所需专家参数,与注意力计算并行预取,隐藏存储延迟;
Joint Lossless Compression and Steganography for Medical Images via Large Language Models
近年来,大型语言模型(LLMs)在无损图像压缩领域取得了显著进展。然而,将现有范式直接应用于医学图像时,压缩性能与效率之间的权衡不尽如人意。此外,现有基于LLM的压缩器往往忽视压缩过程的安全性,而这在现代医疗场景中至关重要。为此,我们提出了一种新颖的联合无损压缩与隐写术框架。受位平面切片(BPS)的启发,我们发现可以将隐私消息以隐形方式安全嵌入医学图像。基于这一见解,我们首先设计了自适应模态分解策略,将整个图像划分为两个部分,为后续的双路径无损压缩提供全局和局部模态。
EAC-MoE: Expert-Selection Aware Compressor for Mixture-of-Experts Large Language Models
本文针对混合专家模型(Mixture-of-Experts,MoE)在大语言模型(LLMs)中面临的两大核心挑战——高额GPU内存消耗(需加载所有专家权重)和推理加速与激活参数减少不匹配(低激活参数未转化为等效速度提升),提出了一种名为EAC-MoE的专家选择感知压缩方法。基于专家选择校准的量化(QESC):低比特量化会导致专家选择偏差(即路由器可能选错专家),QESC通过逐层校准MoE中的路由器,减轻这种偏差,从而保留量化模型的性能。基于专家选择频率的剪枝(PESF)
From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Lar...
本文聚焦大型语言模型(LLMs)对人类表达与思维的同质化效应,通过整合语言学、认知科学和计算机科学的跨学科证据,系统分析了LLMs如何影响认知多样性(体现为语言、视角和推理的差异)。认知多样性的重要性:认知多样性是创造力、集体智慧和社会适应性的核心,源于文化、历史和个体经验的差异,表现为语言风格、视角和推理方式的多样性。LLMs的同质化机制LLMs基于“下一个token预测”训练,倾向于复制训练数据中占主导地位的语言、文化和意识形态(如英语、全球北方视角),边缘化小众表达和推理方式。
Evaluating Position Bias in Large Language Model Recommendations
大型语言模型(LLMs)正被越来越多地探索作为推荐任务的通用工具,无需特定任务训练即可实现零样本和指令跟随能力。尽管研究界对LLMs抱有极大热情,但将其直接应用于推荐任务仍存在重要隐患。本文表明,基于LLM的推荐模型存在位置偏差——提示中候选项目的顺序会不成比例地影响LLM生成的推荐结果。首先,我们在真实世界数据集上分析了LLM推荐的位置偏差,结果揭示了LLM对输入顺序高度敏感的系统性偏差。此外,我们提出了一种新的提示策略来缓解LLM推荐模型的位置偏差,称为迭代选择排序(RISE)。
Isolating Culture Neurons in Multilingual Large Language Models
本文聚焦多语言大型语言模型(LLMs)中文化信息的编码机制,旨在定位并分离与文化相关的特定神经元(“文化神经元”),并探究其与语言特定神经元的关系。研究通过扩展已有的语言特定神经元识别方法,提出了识别“纯文化神经元”(即仅编码文化信息而不依赖语言的神经元)的方法论,并构建了包含6种文化、8520万tokens的多文化数据集MUREL以支持实验。实验结果表明:多语言LLMs中,不同文化的信息被编码在distinct神经元群体中,且这些神经元主要集中在模型的上层;
Zero-Shot Grammar Competency Estimation Using Large Language Model Generated Pseudo Labels
语法能力评估对于衡量书面和口语的语言熟练度至关重要;然而,口语模态因其自发性、无结构性和不流畅性而面临额外挑战。开发精准的语法评分模型还需要大量专家标注,这使得大规模数据构建难以实现。为解决这些局限性,我们提出一种零样本语法能力评估框架,该框架利用无标注数据和大型语言模型(LLMs),无需依赖人工标签。在训练过程中,我们通过基于语法能力评分准则的提示词,利用LLM对无标注数据生成预测结果。这些预测结果被视为伪标签,通过一种专为有效处理标签噪声设计的新型训练框架,用于训练基于Transformer的模型。
Multi-Agent Multimodal Large Language Model Framework for Automated Interpretation of Fuel Effici...
提升公共交通的燃油效率需要将复杂的多模态数据整合为可解释、与决策相关的洞见。然而,传统的分析和可视化方法往往产生碎片化的输出,需要大量人工解读,限制了可扩展性和一致性。本研究提出了一个多智能体框架,利用多模态大语言模型(LLM)实现数据叙事自动化和能源洞见生成。该框架协调三个专业化智能体(包括数据叙事智能体、LLM评估智能体和可选的人工介入评估器),将分析成果迭代转化为连贯的、面向利益相关者的报告。
Automated Construction of Medical Indicator Knowledge Graphs Using Retrieval Augmented Large Lang...
该研究聚焦于医疗指标知识图谱的自动化构建,旨在解决传统临床知识图谱依赖人工整理和规则提取、效率低且难以适配复杂医疗指南的问题。研究背景:人工智能(尤其是大语言模型LLMs)在医疗文本处理中作用显著,但医疗知识的有效应用需结构化表示;现有知识图谱构建方式受限于医疗指南的复杂性和语境模糊性,自动化程度低。核心框架:提出融合检索增强生成(RAG)与LLMs的自动化构建框架,包含五大模块:数据获取与整合:从权威机构收集临床指南,经标准化预处理(过滤、术语归一化等);
ForgeDAN: An Evolutionary Framework for Jailbreaking Aligned Large Language Models
多维度扰动策略:首次整合字符、词、句子三级文本扰动,采用插件化设计,支持动态扩展新策略,解决了现有方法突变多样性不足的问题。语义驱动的适应性评估:引入基于语义嵌入的相似度指标,替代传统词法或统计指标,实现更可解释、更精准的提示词筛选,确保对抗性提示词既保留有害意图又具备自然性。双维度越狱判断机制:分离“行为合规性”与“内容有害性”评估,通过LLM基分类器替代脆弱的关键词匹配,大幅降低假阳性和假阴性,提升越狱检测的可靠性。黑盒适配与高实用性:无需模型内部参数或梯度信息,适用于商业闭源模型;
GenSIaC: Toward Security-Aware Infrastructure-as-Code Generation with Large Language Models
近年来,基础设施即代码(IaC)已成为通过代码和自动化管理与配置IT基础设施的关键方法。IaC能帮助组织创建可扩展且一致的环境,有效管理服务器和开发配置。然而,云基础设施的复杂性日益增加,导致IaC脚本中配置错误和安全漏洞的风险上升。为解决这一问题,本文探索了大型语言模型(LLMs)在生成安全感知IaC代码方面的潜力,以避免开发人员和管理员引入的配置错误。尽管LLMs在自然语言处理和代码生成领域取得了显著进展,但它们生成安全IaC脚本的能力仍不明确。
Can Small GenAI Language Models Rival Large Language Models in Understanding Application Behavior?
该研究聚焦于小型生成式AI语言模型(SLMs)与大型语言模型(LLMs)在应用程序行为理解(以恶意软件检测为代表性任务)中的能力对比。研究团队以SBAN数据集的10,000个样本(含5,000个良性代码和5,000个恶意软件代码)为基础,选取DeepSeek、Phi、Llama、Qwen、Mistral系列的5个不同参数规模模型,通过分类头和基于提示词两种方法,从准确率、精确率、召回率、F1分数等维度进行系统评估。
Applying Large Language Models to Characterize Public Narratives
公共叙事(PNs)是领导力发展和公民动员的关键工具,但由于其主观解读特性和专家标注的高昂成本,对其进行系统化分析仍面临挑战。本研究提出了一种新颖的计算框架,利用大型语言模型(LLMs)实现公共叙事的自动化定性标注。通过与领域专家共同开发的标注手册,我们将LLM的性能与专家标注者进行了对比评估。研究结果表明,LLM能够达到接近人类专家的性能,在8个叙事样本和14个标注代码上的平均F1值为0.80。随后,我们将分析扩展到包含22个故事的更大规模数据集,实证探索了公共叙事框架要素的呈现模式。
Comparative Analysis of Large Language Model Inference Serving Systems: A Performance Study of vL...
大语言模型(LLM)在生产环境中的部署需要高效的推理服务系统,以平衡吞吐量、延迟和资源利用率。本文对两款主流开源LLM推理框架——vLLM和HuggingFace文本生成推理(TGI)进行了全面的实证评估。我们使用参数规模从70亿到700亿的LLaMA-2模型,在吞吐量性能、端到端延迟、GPU内存利用率和可扩展性等多个维度对这些系统进行基准测试。实验结果表明,通过其创新的PagedAttention机制,vLLM在高并发工作负载下的吞吐量比TGI高出24倍;而TGI在交互式单用户场景中表现出更低的尾部延迟。
