Loading...

Can Large Language Models Solve Path Constraints in Symbolic Execution?
符号执行是一项重要的软件分析技术,对软件测试和调试等下游任务具有重要意义。然而,若干局限阻碍了符号执行在实际软件中的应用,其中之一便是无法求解多样化的执行路径约束:传统基于SMT求解器的符号执行难以处理包含复杂数据结构或外部API调用的执行路径。本文聚焦于探索采用大型语言模型(LLM)替代符号执行中传统基于求解器的技术来解决路径约束问题的可能性。我们通过实证研究评估LLM在两类路径约束求解任务中的能力:生成测试输入以覆盖指定执行路径,以及判断给定执行路径是否可满足且不触发任何bug。

VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
我们提出了VideoPerceiver,这是一款新型视频多模态大语言模型(VMLLM),旨在增强视频理解中的细粒度感知能力,解决现有VMLLM在短片段短暂动作或长视频稀有瞬时事件推理上的局限。VideoPerceiver采用两阶段训练框架:在监督微调(SFT)阶段,我们通过从字幕中提取事件-动作关键词、识别对应关键帧并替换为相邻帧,构建“关键信息缺失”视频;

Towards Robust and Fair Next Visit Diagnosis Prediction under Noisy Clinical Notes with Large Lan...
人工智能(AI)十年间的快速发展为临床决策支持系统(CDSS)带来了新机遇,大型语言模型(LLMs)在时效性医疗任务中展现出强大的推理能力。然而,临床文本常因人为错误或自动处理流程缺陷而质量下降,引发了对AI辅助决策可靠性和公平性的担忧。尽管如此,此类质量退化的影响尚未得到充分研究,尤其是噪声导致的分布偏移如何加剧预测不确定性并对不同人口统计学亚组产生不均衡影响。本文针对多种文本损坏场景,对最先进的LLMs开展系统性研究,重点关注下次就诊诊断预测任务中的鲁棒性和公平性。

Large Language Model Enhanced Graph Invariant Contrastive Learning for Out-of-Distribution Recomm...
该研究针对图推荐系统中的分布外(OOD)泛化问题展开,核心挑战在于传统图神经网络(GNN)易学习训练数据中的虚假相关性,而非稳定的因果关系,导致数据分布发生偏移时推荐性能大幅下降。因果分数生成模块:通过环境提取器识别数据中的潜在环境,结合不变学习模块对用户-物品交互关系进行稳定性评估,生成因果置信分数矩阵,量化每个交互的因果关联强度。LLM校准的因果图编辑模块(LLMC2GE)

INTERLACE: Interleaved Layer Pruning and Efficient Adaptation in Large Vision-Language Models
我们提出了INTERLACE,这是一种新颖的框架,通过样本高效的微调在剪枝视觉语言模型(VLMs)冗余层的同时保持模型性能。现有层剪枝方法应用于视觉语言模型时会导致显著的性能下降。相比之下,我们通过分析连续三层(三元组)来识别局部冗余:删除前两层中冗余度最高的层,对剩余层进行微调以补偿丢失的容量,并冻结第三层以在微调过程中充当稳定锚点。我们发现,这种交错式微调-冻结设计能够在剪枝后通过极少数据实现快速收敛。

Rethinking Retrieval: From Traditional Retrieval Augmented Generation to Agentic and Non-Vector R...
研究背景:现有RAG技术在金融文档处理中缺乏向量型与非向量型架构的系统对比,且先进RAG技术对检索精度、答案质量、延迟和成本的实证影响尚不明确。金融文档(如SEC10-K、10-Q、8-K文件)具有篇幅长、术语专、多跳推理需求高等特点,给问答系统带来独特挑战。研究对象与方案对比两种检索架构:基于向量的智能体RAG(融合混合搜索与元数据过滤)和基于层级节点的推理系统(无嵌入,通过文档目录结构遍历检索)。评估两种先进增强技术:交叉编码器重排序(提升检索精度)和“从小到大”片段检索(保障上下文完整性)

The Catastrophic Paradox of Human Cognitive Frameworks in Large Language Model Evaluation: A Comp...
核心矛盾:模型在CHC框架下测得的人类IQ分数(85.0-121.4)与概念准确性评分严重脱节,二元精确匹配评分(按心理测量传统)与LLM作为评判者的概念准确性评分相关系数仅为0.175(p

Prompt Fencing: A Cryptographic Approach to Establishing Security Boundaries in Large Language Mo...
大型语言模型(LLMs)仍然容易受到提示注入攻击,这是生产部署中最严重的安全威胁。本文提出了提示围栏(PromptFencing),这是一种新颖的架构方法,应用密码学认证和数据架构原则在LLM提示中建立明确的安全边界。我们的方法为提示片段添加包含信任等级和内容类型的加密签名元数据,使LLM能够区分可信指令与不可信内容。

Simulated Self-Assessment in Large Language Models: A Psychometric Approach to AI Self-Efficacy
自我评估是可靠智能的关键方面,但大型语言模型(LLMs)的评估主要集中在任务准确性上。本研究改编了10项一般自我效能感量表(GSES),在四种条件(无任务、计算推理、社会推理和总结任务)下诱导10个LLM进行模拟自我评估。结果显示,GSES反应在重复测试和随机题目顺序下具有高度稳定性。然而,不同模型在各条件下的自我效能感水平存在显著差异,总得分低于人类常模。所有模型在计算推理和社会推理题目上均达到完美准确率,而总结任务的表现差异较大。

Consiglieres in the Shadow: Understanding the Use of Uncensored Large Language Models in Cybercrimes
人工智能技术(尤其是大型语言模型,LLMs)的发展不仅改变了计算领域,也带来了新的安全与隐私风险。已有研究表明,网络犯罪者正越来越多地将无审查大型语言模型(ULLMs)作为恶意服务的后端。然而,在HuggingFace等平台托管的海量开源LLM中识别ULLMs面临巨大挑战,这严重阻碍了对ULLMs的深入理解。本文首次对ULLMs展开系统性研究,通过建模开源LLM之间、LLM与相关数据(如微调/合并/压缩模型、含有害内容的数据集)之间的关系,成功克服这一挑战。

The Catastrophic Paradox of Human Cognitive Frameworks in Large Language Model Evaluation: A Comp...
核心矛盾:模型在CHC框架下测得的人类IQ分数(85.0-121.4)与概念准确性评分严重脱节,二元精确匹配评分(按心理测量传统)与LLM作为评判者的概念准确性评分相关系数仅为0.175(p

Large Language Models for the Summarization of Czech Documents: From History to the Present
文本摘要是将较长文本自动浓缩为更短、连贯的摘要,同时保留原始含义和关键信息的任务。尽管该任务在英语和其他高资源语言中已得到广泛研究,但捷克语摘要(尤其是历史文献语境下的摘要)仍未被充分探索。这主要归因于捷克语固有的语言复杂性以及高质量标注数据集的缺乏。在本研究中,我们利用大型语言模型(LLMs)的能力来填补这一空白,具体采用了Mistral和mT5模型——这些模型在多种自然语言处理任务和多语言场景中均表现出优异性能。

Gender Bias in Emotion Recognition by Large Language Models
大型语言模型(LLMs)的快速发展及其在日常生活中的日益普及,凸显了评估并确保其公平性的重要性。本研究聚焦情绪心智理论领域的公平性问题,探究当LLMs面对人物及其环境描述并被问及“此人感受如何”时,是否会表现出性别偏见。此外,我们提出并评估了多种去偏策略,结果表明,要实现有意义的偏见减少,需要基于训练的干预措施,而非仅依赖提示工程等推理时的提示类方法。

Layer-Wise High-Impact Parameter Ratio Optimization in Post-Training Quantization for Large Langu...
大型语言模型(LLMs)在自然语言处理领域取得了显著进展,但庞大的参数数量给部署过程带来了巨大的计算和内存挑战。训练后量化(PTQ)作为一种极具潜力的解决方案,能够以极小的开销缓解这些挑战。尽管现有PTQ方法能有效对LLMs进行量化,但在极低比特宽度下会出现严重的精度损失,这主要是由对量化性能有显著影响的高影响参数导致的。已有部分方法通过识别高影响参数并将其保留为FP16格式来解决该问题,但这些方法在所有层中均采用固定比例的高影响参数,忽略了层间的敏感性差异。

Data Mixing Optimization for Supervised Fine-Tuning of Large Language Models
优化大型语言模型(LLMs)有监督微调(SFT)的数据混合比例,对开发通用模型至关重要,但该领域的研究仍有待深入。本文将数据混合问题构建为优化问题,提出一种旨在最小化验证损失的新方法。我们的方法通过对“迁移有效数据”建模,并利用微调缩放定律,实现对损失的参数化。通过在各类小规模数据混合场景下进行实验,我们拟合出相关参数并推导得到最优领域权重。本文提供的数学证明与实证结果均表明,该算法在所有领域的整体性能和单项性能上均表现优异。

NNGPT: Rethinking AutoML with Large Language Models
构建自我改进的人工智能系统仍是人工智能领域的核心挑战。本文提出NNGPT,一个开源框架,其将大型语言模型(LLM)转化为用于神经网络开发的自我改进AutoML引擎,主要面向计算机视觉任务。与现有框架不同,NNGPT通过生成新模型扩展神经网络数据集,基于“生成-评估-自我改进”的闭环系统实现LLM的持续微调。

Training-Free Active Learning Framework in Materials Science with Large Language Models
主动学习(AL)通过优先开展信息最丰富的实验加速科学发现,但传统AL中使用的机器学习(ML)模型存在冷启动限制和领域特异性特征工程需求,制约了其泛化能力。大型语言模型(LLM)借助预训练知识和通用令牌表示,可直接从文本描述中提出实验建议,提供了一种新范式。本文提出一种基于LLM的主动学习框架(LLM-AL),该框架在迭代少样本场景下运行,并在四种不同的材料科学数据集上与传统ML模型进行基准测试。我们探索了两种提示策略:一种采用简洁的数值输入,适用于具有更多成分和结构化特征的数据集;

Active Slice Discovery in Large Language Models
大型语言模型(LLMs)常在特定数据子集上表现出系统性错误,这类子集被称为“错误切片”。例如,某一切片可能对应特定人群——模型在识别与该人群相关的毒性评论时表现不佳。识别错误切片对于理解和改进模型至关重要,但这一过程极具挑战性。一种极具吸引力的方法是主动对可能属于同一切片的错误进行分组,同时通过有限的标注者资源验证所选样本是否存在相同的模型错误模式,从而减少人工标注量。本文将该方法形式化为“主动切片发现”,并在毒性分类任务中对人工定义的切片进行实证探究。

Blu-WERP (Web Extraction and Refinement Pipeline): A Scalable Pipeline for Preprocessing Large La...
高质量训练数据是大型语言模型(LLM)性能的基础,但现有预处理管道往往难以有效去除网络规模语料库中的噪声和非结构化内容。本文提出Blu-WERP,这是一种新型数据预处理管道,旨在优化用于LLM训练的CommonCrawlWARC文件质量。我们证明,在多种模型规模和评估基准下,Blu-WERP的性能显著优于包括DCLM在内的现有基准方案。该管道处理CommonCrawlWARC数据,采用了先进的过滤和质量评估机制。

The Alignment Paradox of Medical Large Language Models in Infertility Care: Decoupling Algorithmi...
大语言模型(LLMs)在临床决策支持中的应用日益广泛,但如何使其与现实医疗中多维度的推理路径对齐仍是一项重大挑战。本研究利用8000余条不孕症治疗记录,通过结合自动基准测试与盲态医生介入评估的双层框架,系统评估了四种对齐策略:监督微调(SFT)、直接偏好优化(DPO)、组相对策略优化(GRPO)和上下文学习(ICL)。GRPO在多个决策维度上实现了最高的算法准确率,证实了基于强化学习的优化方法在结构化预测任务中的价值。

欢迎留下您的脚印