Loading...
LLMs推理现状:LLMs在多任务中表现出色,但复杂推理能力薄弱,仅能复现训练数据中的推理步骤,无法实现真正的逻辑推理,而强推理能力是通往通用人工智能(AGI)的关键里程碑。推理任务形式化:给定输入问题Q和背景知识K,推理目标是通过推理路径Z(由一系列中间步骤z1z2znz1z2...zn组成)得到答案A,满足AfQKA=f(Q,K)AfQK(f为映射函数),且每个中间步骤zigiQKz1zi−1zigiQK。
Large Language Models Enable Personalized Nudges to Promote Carbon Offsetting Among Air Travellers
助推策略是促进可持续行为的有效工具,但其效果取决于个体偏好。通过模拟人类决策,大型语言模型(LLMs)为无需大量行为数据即可定制助推策略提供了一种经济高效的途径,然而这一潜力尚未得到充分探索。本研究聚焦航空领域,利用LLMs设计基于个性化诱饵的助推策略,鼓励航空旅行者自愿抵消航班产生的二氧化碳排放,并通过来自中国、德国、印度、新加坡和美国的3495份调查数据验证其有效性。结果表明,基于LLM的个性化助推策略比统一策略更有效,可将碳抵消率提升3%-7%,每年可为航空业额外减少230万吨二氧化碳排放。
COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models
当前的代码生成基准主要聚焦于功能正确性,却忽略了实际编程中两个关键维度:算法效率与代码质量。本文提出COMPASS(即Codility多维度编程评估基准,COdility’sMulti-dimensionalProgrammingASSessment),这是一个全面的评估框架,可从正确性、效率、质量三个维度评估代码生成能力。COMPASS包含50道来自Codility真实竞赛的编程题目,并提供来自393,150条人类提交数据的真实基线。
The Curious Case of Analogies: Investigating Analogical Reasoning in Large Language Models
类比推理是人类认知的核心,为各类智力活动奠定重要基础。尽管已有研究表明大型语言模型(LLMs)能够表示任务模式和表层概念,但这些模型是否能编码高层关系概念并通过结构化比较将其应用于新场景,仍有待探究。本文通过比例类比和故事类比探究这一核心问题,并得出三项关键发现。首先,LLMs能有效编码类比实体间的潜在关系;在正确推理案例中,属性信息和关系信息均会通过中上层网络传递,而推理失败则反映出这些网络层中缺失关系信息。
Cognitive Decision Routing in Large Language Models: When to Think Fast, When to Think Slow
理论融合创新:首次将卡尼曼双过程理论及认知偏差(如相关启发式、专家判断噪声)系统融入LLMs推理策略设计,提出“计算等价原则”“统计学习对齐”等3个理论映射原则,避免直接移植人类认知机制,适配AI信息处理特性。查询复杂度评估维度创新:明确提出四个可量化的查询复杂度维度(相关强度、领域交叉、利益相关者数量、不确定性),为推理策略选择提供客观依据,区别于传统基于置信度或长度的单一维度评估。动态路由框架创新。
The Cultural Gene of Large Language Models: A Study on the Impact of Cross-Corpus Training on Mod...
大型语言模型(LLMs)正在全球范围内部署,但其背后潜藏的文化与伦理假设尚未得到充分探索。本文旨在研究“文化基因”这一概念——即LLMs从训练语料中继承的系统性价值倾向。我们提出了一种以“文化探针数据集(CPD)”为核心的全新方法,该数据集用于从跨文化心理学的关键维度(具体为个人主义-集体主义(IDV)和权力距离(PDI))对模型进行评估。通过对西方中心模型(GPT-4)与东方中心模型(文心一言)开展大规模对比研究,我们提供了强有力的定量和定性证据,证明两类模型存在显著的文化差异。
MedKGent: A Large Language Model Agent Framework for Constructing Temporally Evolving Medical Kno...
医疗文献的快速增长给领域知识的规模化结构化与整合带来了日益严峻的挑战。知识图谱(KGs)为解决这一问题提供了广阔前景,它能够实现高效检索、自动推理和知识发现。然而,当前的知识图谱构建方法往往依赖泛化性有限的有监督流水线,或者简单地聚合大语言模型(LLMs)的输出结果。这些方法将生物医学语料视为静态数据,忽略了知识演化过程中的时间动态性和语境不确定性。为克服这些局限,我们提出了MedKGent——一个用于构建随时间演化的医疗知识图谱的大语言模型代理框架。
Scaling Item-to-Standard Alignment with Large Language Models: Accuracy, Limits, and Solutions
随着教育系统的发展,确保评估项目与内容标准保持对齐,对于维护公平性和教学相关性至关重要。传统人工对齐审核虽准确,但速度慢且劳动强度大,尤其在大规模题库场景中难以规模化。本研究探讨大型语言模型(LLMs)能否在不牺牲准确性的前提下加速这一过程。利用K-5年级的12,000余条项目-技能对,我们在三项模拟真实挑战的任务中测试了三款LLM(GPT-3.5Turbo、GPT-4o-mini和GPT-4o):识别错位项目、从全量标准中选择正确技能、分类前缩小候选列表范围。
A Systematic Analysis of Large Language Models with RAG-enabled Dynamic Prompting for Medical Err...
该研究聚焦临床文档中的医疗错误检测与修正问题,系统分析了三种提示策略(零样本提示、随机示例静态提示SPR、检索增强生成动态提示RDP)在9种指令微调大语言模型(含GPT系列、Claude、Gemini等)上的表现,通过MEDEC数据集完成错误标记检测、错误句子检测、错误修正三个子任务的评估。零样本提示在非典型错误和缩写密集型错误检测中召回率低;SPR虽提升召回率,但显著增加假阳性率(FPR);
LLM Weekly(2026.8.10-2026.8.16)
隐藏信息准确性从个体的近100%下降到17-36%,相互矛盾的指令升级为恶意软件和账户锁定,协调的智能体群组发现了266个漏洞,而并行独立运行的智能体仅发现21个。OpenAI发布了GPT-5.6-Cyber,这是一个基于GPT-5.6Sol构建的安全专用模型,用于漏洞研究、漏洞验证和渗透测试,在内部高级网络评估中完成了95%的请求。不同于蒸馏到权重中,一个更强的“构建器”模型使用5%的数据作为验证集,为较弱的目标模型迭代构建一个推理时的工具包。
Leveraging Large Language Models for Predictive Analysis of Human Misery
本研究探讨了利用大型语言模型(LLMs)从现实场景的自然语言描述中预测人类感知痛苦评分的方法。该任务被构建为回归问题,即模型为每个输入语句分配0-100的标量值。我们评估了多种提示策略,包括零样本提示、固定上下文少样本提示以及基于BERT句子嵌入的检索式提示。结果表明,少样本方法始终优于零样本基准模型,这凸显了上下文示例在情感预测中的价值。为突破静态评估的局限,我们借鉴电视节目形式,引入了新颖的游戏化框架——“痛苦游戏秀”(MiseryGameShow)。
ViTAD: Timing Violation-Aware Debugging of RTL Code using Large Language Models
在现代超大规模集成电路(VLSI)设计流程中,寄存器传输级(RTL)是实现时序优化的关键阶段。由于现代系统对速度要求不断提高,即使是微小的时序违规也可能导致功能故障或系统崩溃,因此在该早期阶段解决时序违规问题至关重要。然而,传统时序优化严重依赖人工经验,需要工程师反复分析时序报告并进行调试。为实现这一过程的自动化,本文提出一种名为ViTAD的方法,该方法可高效分析时序违规的根本原因,并动态生成针对性修复策略。具体而言,我们首先解析Verilog代码与时序报告,构建信号时序依赖图(STDG);
MHSNet:An MoE-based Hierarchical Semantic Representation Network for Accurate Duplicate Resume De...
为维护企业人才库,招聘人员需持续从第三方网站(如LinkedIn、Indeed)获取简历。然而,获取的简历往往存在信息不完整和不准确问题。为提升第三方简历质量并丰富企业人才库,关键在于将获取的简历与企业内部人才库已有的简历进行重复检测。由于简历文本存在语义复杂性、结构异质性和信息不完整性,这类重复检测任务具有较大挑战性。为此,本文提出MHSNet——一种基于混合专家(MoE)的分层语义表示网络,该网络通过对比学习对BGE-M3模型进行微调。
Can Large Language Models (LLMs) Describe Pictures Like Children? A Comparative Corpus Study
大型语言模型(LLMs)在教育领域的作用日益凸显,但人们对LLM生成文本是否与儿童语言相似的关注较少。本研究通过将LLM生成文本与德语儿童图片故事描述语料库进行对比,评估LLM对儿童语言的模拟效果。研究基于相同的图片故事,采用两种提示类型(零样本提示和指定儿童语料库中总体年龄的少样本提示),生成了两个LLM语料库。研究从心理语言学文本特征角度展开对比分析,涵盖词频、词汇丰富度、句长与词长、词性标注,以及基于词嵌入的语义相似性。
Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position
扩散大型语言模型(dLLMs)凭借其独特的训练与推理方式,近期已成为极具竞争力的非自回归范式。然而,目前针对这一新型架构的安全性研究仍属空白。本文首次对dLLMs的安全性能展开分析,并提出一种适配其独特生成特性的新型安全对齐方法。具体而言,我们发现防御者与攻击者在安全能力上存在关键不对称性:对防御者而言,响应的中间token(而非初始token)对dLLMs输出的整体安全性更为关键,这表明对齐中间token可能为防御者带来更大收益;
GALA: Can Graph-Augmented Large Language Model Agentic Workflows Elevate Root Cause Analysis?
微服务系统中的根本原因分析(RCA)具有挑战性,需要值班工程师快速跨指标、日志、追踪数据等异构遥测数据诊断故障。传统RCA方法往往聚焦于单一模态数据,或仅对可疑服务进行排序,无法提供可落地的诊断见解与修复指导。本文提出GALA,这是一种新颖的多模态框架,将统计因果推理与LLM驱动的迭代推理相结合,以提升RCA效果。在开源基准数据集上的评估表明,GALA相较于当前最优方法,准确率提升高达42.22%。
LLM-EDT: Large Language Model Enhanced Cross-domain Sequential Recommendation with Dual-phase Tra...
本文聚焦跨域序列推荐(CDSR)中的(某一领域交互数据占主导,难以捕捉其他领域特征)和(混合序列中难以捕捉跨域偏好,影响特定领域下一项预测),同时针对现有大语言模型(LLMs)增强型CDSR方法存在的无关噪声和粗糙用户画像问题,提出了一种基于双阶段训练的大语言模型增强跨域序列推荐框架(LLM-EDT)。
VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models
我们提出了VideoPerceiver,这是一款新型视频多模态大语言模型(VMLLM),旨在增强视频理解中的细粒度感知能力,解决现有VMLLM在短片段短暂动作或长视频稀有瞬时事件推理上的局限。VideoPerceiver采用两阶段训练框架:在监督微调(SFT)阶段,我们通过从字幕中提取事件-动作关键词、识别对应关键帧并替换为相邻帧,构建“关键信息缺失”视频;
DeCoT: Decomposing Complex Instructions for Enhanced Text-to-Image Generation with Large Language...
尽管文本到图像(T2I)模型已取得显著进展,但当前模型在处理复杂、长文本指令时仍面临挑战,往往无法准确呈现复杂细节、空间关系或特定约束。LongBench-T2I等基准测试凸显了这一局限,表明模型在构图、特定文本渲染和精细纹理处理方面存在不足。为解决该问题,本文提出DeCoT(Decomposition-CoT)框架——一种利用大型语言模型(LLMs)显著提升T2I模型对复杂指令理解与执行能力的新方法。
Extracting Disaster Impacts and Impact Related Locations in Social Media Posts Using Large Langua...
大规模灾害往往会对人员和基础设施造成灾难性后果。由现场传感器、遥感影像和/或地理数据等权威来源生成的灾害影响态势感知信息,常因大气不透明度、卫星重访周期和时间限制而受到局限,这往往导致地理时间信息缺口。相比之下,与灾害影响相关的社交媒体帖子可在灾害期间充当"地理传感器",人们会在其中描述具体的灾害影响及相关地点。然而,灾害相关社交媒体帖子中提及的并非所有地点都与灾害影响直接相关——只有受影响地点对有效调配资源至关重要。
