Loading...
医疗文献的快速增长给领域知识的规模化结构化与整合带来了日益严峻的挑战。知识图谱(KGs)为解决这一问题提供了广阔前景,它能够实现高效检索、自动推理和知识发现。然而,当前的知识图谱构建方法往往依赖泛化性有限的有监督流水线,或者简单地聚合大语言模型(LLMs)的输出结果。这些方法将生物医学语料视为静态数据,忽略了知识演化过程中的时间动态性和语境不确定性。为克服这些局限,我们提出了MedKGent——一个用于构建随时间演化的医疗知识图谱的大语言模型代理框架。
Scaling Item-to-Standard Alignment with Large Language Models: Accuracy, Limits, and Solutions
随着教育系统的发展,确保评估项目与内容标准保持对齐,对于维护公平性和教学相关性至关重要。传统人工对齐审核虽准确,但速度慢且劳动强度大,尤其在大规模题库场景中难以规模化。本研究探讨大型语言模型(LLMs)能否在不牺牲准确性的前提下加速这一过程。利用K-5年级的12,000余条项目-技能对,我们在三项模拟真实挑战的任务中测试了三款LLM(GPT-3.5Turbo、GPT-4o-mini和GPT-4o):识别错位项目、从全量标准中选择正确技能、分类前缩小候选列表范围。
A Systematic Analysis of Large Language Models with RAG-enabled Dynamic Prompting for Medical Err...
该研究聚焦临床文档中的医疗错误检测与修正问题,系统分析了三种提示策略(零样本提示、随机示例静态提示SPR、检索增强生成动态提示RDP)在9种指令微调大语言模型(含GPT系列、Claude、Gemini等)上的表现,通过MEDEC数据集完成错误标记检测、错误句子检测、错误修正三个子任务的评估。零样本提示在非典型错误和缩写密集型错误检测中召回率低;SPR虽提升召回率,但显著增加假阳性率(FPR);
LLM Weekly(2026.8.10-2026.8.16)
隐藏信息准确性从个体的近100%下降到17-36%,相互矛盾的指令升级为恶意软件和账户锁定,协调的智能体群组发现了266个漏洞,而并行独立运行的智能体仅发现21个。OpenAI发布了GPT-5.6-Cyber,这是一个基于GPT-5.6Sol构建的安全专用模型,用于漏洞研究、漏洞验证和渗透测试,在内部高级网络评估中完成了95%的请求。不同于蒸馏到权重中,一个更强的“构建器”模型使用5%的数据作为验证集,为较弱的目标模型迭代构建一个推理时的工具包。
Leveraging Large Language Models for Predictive Analysis of Human Misery
本研究探讨了利用大型语言模型(LLMs)从现实场景的自然语言描述中预测人类感知痛苦评分的方法。该任务被构建为回归问题,即模型为每个输入语句分配0-100的标量值。我们评估了多种提示策略,包括零样本提示、固定上下文少样本提示以及基于BERT句子嵌入的检索式提示。结果表明,少样本方法始终优于零样本基准模型,这凸显了上下文示例在情感预测中的价值。为突破静态评估的局限,我们借鉴电视节目形式,引入了新颖的游戏化框架——“痛苦游戏秀”(MiseryGameShow)。
ViTAD: Timing Violation-Aware Debugging of RTL Code using Large Language Models
在现代超大规模集成电路(VLSI)设计流程中,寄存器传输级(RTL)是实现时序优化的关键阶段。由于现代系统对速度要求不断提高,即使是微小的时序违规也可能导致功能故障或系统崩溃,因此在该早期阶段解决时序违规问题至关重要。然而,传统时序优化严重依赖人工经验,需要工程师反复分析时序报告并进行调试。为实现这一过程的自动化,本文提出一种名为ViTAD的方法,该方法可高效分析时序违规的根本原因,并动态生成针对性修复策略。具体而言,我们首先解析Verilog代码与时序报告,构建信号时序依赖图(STDG);
MHSNet:An MoE-based Hierarchical Semantic Representation Network for Accurate Duplicate Resume De...
为维护企业人才库,招聘人员需持续从第三方网站(如LinkedIn、Indeed)获取简历。然而,获取的简历往往存在信息不完整和不准确问题。为提升第三方简历质量并丰富企业人才库,关键在于将获取的简历与企业内部人才库已有的简历进行重复检测。由于简历文本存在语义复杂性、结构异质性和信息不完整性,这类重复检测任务具有较大挑战性。为此,本文提出MHSNet——一种基于混合专家(MoE)的分层语义表示网络,该网络通过对比学习对BGE-M3模型进行微调。
Can Large Language Models (LLMs) Describe Pictures Like Children? A Comparative Corpus Study
大型语言模型(LLMs)在教育领域的作用日益凸显,但人们对LLM生成文本是否与儿童语言相似的关注较少。本研究通过将LLM生成文本与德语儿童图片故事描述语料库进行对比,评估LLM对儿童语言的模拟效果。研究基于相同的图片故事,采用两种提示类型(零样本提示和指定儿童语料库中总体年龄的少样本提示),生成了两个LLM语料库。研究从心理语言学文本特征角度展开对比分析,涵盖词频、词汇丰富度、句长与词长、词性标注,以及基于词嵌入的语义相似性。
Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position
扩散大型语言模型(dLLMs)凭借其独特的训练与推理方式,近期已成为极具竞争力的非自回归范式。然而,目前针对这一新型架构的安全性研究仍属空白。本文首次对dLLMs的安全性能展开分析,并提出一种适配其独特生成特性的新型安全对齐方法。具体而言,我们发现防御者与攻击者在安全能力上存在关键不对称性:对防御者而言,响应的中间token(而非初始token)对dLLMs输出的整体安全性更为关键,这表明对齐中间token可能为防御者带来更大收益;
GALA: Can Graph-Augmented Large Language Model Agentic Workflows Elevate Root Cause Analysis?
微服务系统中的根本原因分析(RCA)具有挑战性,需要值班工程师快速跨指标、日志、追踪数据等异构遥测数据诊断故障。传统RCA方法往往聚焦于单一模态数据,或仅对可疑服务进行排序,无法提供可落地的诊断见解与修复指导。本文提出GALA,这是一种新颖的多模态框架,将统计因果推理与LLM驱动的迭代推理相结合,以提升RCA效果。在开源基准数据集上的评估表明,GALA相较于当前最优方法,准确率提升高达42.22%。
LLM-EDT: Large Language Model Enhanced Cross-domain Sequential Recommendation with Dual-phase Tra...
本文聚焦跨域序列推荐(CDSR)中的(某一领域交互数据占主导,难以捕捉其他领域特征)和(混合序列中难以捕捉跨域偏好,影响特定领域下一项预测),同时针对现有大语言模型(LLMs)增强型CDSR方法存在的无关噪声和粗糙用户画像问题,提出了一种基于双阶段训练的大语言模型增强跨域序列推荐框架(LLM-EDT)。
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
我们提出了VideoPerceiver,这是一款新型视频多模态大语言模型(VMLLM),旨在增强视频理解中的细粒度感知能力,解决现有VMLLM在短片段短暂动作或长视频稀有瞬时事件推理上的局限。VideoPerceiver采用两阶段训练框架:在监督微调(SFT)阶段,我们通过从字幕中提取事件-动作关键词、识别对应关键帧并替换为相邻帧,构建“关键信息缺失”视频;
DeCoT: Decomposing Complex Instructions for Enhanced Text-to-Image Generation with Large Language...
尽管文本到图像(T2I)模型已取得显著进展,但当前模型在处理复杂、长文本指令时仍面临挑战,往往无法准确呈现复杂细节、空间关系或特定约束。LongBench-T2I等基准测试凸显了这一局限,表明模型在构图、特定文本渲染和精细纹理处理方面存在不足。为解决该问题,本文提出DeCoT(Decomposition-CoT)框架——一种利用大型语言模型(LLMs)显著提升T2I模型对复杂指令理解与执行能力的新方法。
Extracting Disaster Impacts and Impact Related Locations in Social Media Posts Using Large Langua...
大规模灾害往往会对人员和基础设施造成灾难性后果。由现场传感器、遥感影像和/或地理数据等权威来源生成的灾害影响态势感知信息,常因大气不透明度、卫星重访周期和时间限制而受到局限,这往往导致地理时间信息缺口。相比之下,与灾害影响相关的社交媒体帖子可在灾害期间充当"地理传感器",人们会在其中描述具体的灾害影响及相关地点。然而,灾害相关社交媒体帖子中提及的并非所有地点都与灾害影响直接相关——只有受影响地点对有效调配资源至关重要。
EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Mo...
指令式视觉分割(IVS)任务要求根据自然语言指令分割图像或视频中的目标。尽管近年来多模态大语言模型(MLLMs)在IVS任务上取得了优异性能,但其推理成本仍是主要瓶颈,在视频任务中尤为突出。本文通过实证分析MLLMs中的视觉令牌采样过程,发现令牌子集的覆盖度与分割性能之间存在强相关性。这一发现启发我们设计了一种简单高效的令牌剪枝方法,该方法可筛选出紧凑且具有空间代表性的令牌子集,从而加速推理过程。
Discovering Expert-Level Nash Equilibrium Algorithms with Large Language Models
算法设计与分析是计算机科学的基石,但该领域面临一项重大挑战:传统上,要证明一种算法在所有输入下的性能保证,需要大量且往往容易出错的人工工作。尽管人工智能(AI)在求解特定问题实例方面已展现出巨大成功,但自动化发现具有此类可证明性能保证的通用算法,仍是一个难以逾越的障碍。这一挑战源于难以将算法设计的创造性过程与形式化分析的严谨过程相融合。为解决这一问题,我们提出了LegoNE框架——该框架将上述两个过程紧密结合,用于解决计算近似纳什均衡这一基础且极具挑战性的问题。
The Structural Sources of Verb Meaning Revisited: Large Language Models Display Syntactic Bootstr...
句法引导假说(Gleitman,1990)认为,儿童会利用动词所处的句法环境来学习动词含义。本文旨在验证大语言模型是否也表现出类似行为。为此,我们在去除句法信息的扰动数据集上训练RoBERTa和GPT-2两种模型。结果表明:与去除共现信息相比,去除句法线索对模型动词表征的破坏更大;此外,在人类动词学习中,句法引导对心理动词(如see、think)的习得尤为关键,而在本研究的训练设置中,心理动词的表征受句法去除的负面影响也显著大于物理动词(如take、push)。
Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation
大语言模型(LLMs)的最新进展为序列推荐开辟了新途径,其能够对用户行为序列进行自然语言推理。一种常见方法将推荐任务构建为语言建模任务:将交互历史转换为提示词,并通过有监督微调(SFT)学习用户偏好。然而,这些方法仅在文本模态下运作,往往会忽略用户的细粒度兴趣——尤其是当这些兴趣由产品图像、电影海报等丰富视觉信号塑造时。多模态大语言模型(MLLMs)通过在共享语义空间中对齐文本和视觉信息,提供了一种极具潜力的替代方案。
Can Large Language Models Solve Path Constraints in Symbolic Execution?
符号执行是一项重要的软件分析技术,对软件测试和调试等下游任务具有重要意义。然而,若干局限阻碍了符号执行在实际软件中的应用,其中之一便是无法求解多样化的执行路径约束:传统基于SMT求解器的符号执行难以处理包含复杂数据结构或外部API调用的执行路径。本文聚焦于探索采用大型语言模型(LLM)替代符号执行中传统基于求解器的技术来解决路径约束问题的可能性。我们通过实证研究评估LLM在两类路径约束求解任务中的能力:生成测试输入以覆盖指定执行路径,以及判断给定执行路径是否可满足且不触发任何bug。
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
我们提出了VideoPerceiver,这是一款新型视频多模态大语言模型(VMLLM),旨在增强视频理解中的细粒度感知能力,解决现有VMLLM在短片段短暂动作或长视频稀有瞬时事件推理上的局限。VideoPerceiver采用两阶段训练框架:在监督微调(SFT)阶段,我们通过从字幕中提取事件-动作关键词、识别对应关键帧并替换为相邻帧,构建“关键信息缺失”视频;
