Loading...
信息提取从监管文档中使用大型语言模型时,在性能与计算资源之间存在关键权衡。我们在水电许可文档上评估了7个开源模型(参数规模0.6B-70B),以提供实证性部署指导。分析发现了一个显著的14B参数阈值:低于该阈值时验证方法无效(F1
W2S-AlignTree: Weak-to-Strong Inference-Time Alignment for Large Language Models via Monte Carlo ...
大语言模型(LLMs)展现出令人瞩目的能力,但由于弱监督的不足和缺乏细粒度控制,其输出往往与人类偏好存在偏差。基于人类反馈的强化学习(RLHF)等训练时对齐方法面临高昂的专家监督成本和固有的可扩展性限制,在推理阶段提供的动态控制有限。因此,迫切需要一种可扩展且适应性强的对齐机制。为解决这一问题,我们提出W2S-AlignTree——首个将蒙特卡洛树搜索(MCTS)与弱到强泛化范式协同结合的插件式推理时对齐框架。W2S-AlignTree将LLM对齐表述为生成搜索树内的最优启发式搜索问题。
Additive Large Language Models for Semi-Structured Text
该研究针对大型语言模型(LLM)在临床文本分类中预测不透明的问题,提出了一种具有内在可解释性的框架研究背景:现有LLM在医疗风险预测、诊断支持等临床任务中表现出色,但缺乏可解释性,无法让医生了解预测结果的关键驱动因素,限制了其在临床场景的实际应用;而传统可解释模型(如规则-based评分)虽透明但性能有限,且难以捕捉临床文本中的丰富语义信息。核心设计。
LLMLagBench: Identifying Temporal Training Boundaries in Large Language Models
大型语言模型(LLMs)的预训练基于特定时间截止点前的文本数据,这形成了严格的知识边界——超出该边界后,模型若不查询外部来源则无法提供准确信息。更隐蔽的是,当这一限制未被知晓或忽视时,LLMs在推理任务中可能无意中将过时的时间敏感信息与通用知识混合,进而影响响应准确性。本文提出LLMLagBench,一款LLM时效性基准测试工具,通过评估模型对近期事件的知识掌握情况,为识别LLM训练数据的最早可能时间边界提供系统化方法。我们将该基准应用于多款LLM的评估,包括明确声明和未声明训练截止日期的模型。
OAD-Promoter: Enhancing Zero-shot VQA using Large Language Models with Object Attribute Description
大语言模型(LLMs)已成为视觉问答(VQA)中处理少样本或零样本场景下知识密集型问题的关键工具。然而,它们对大规模训练数据集的依赖使其在知识获取过程中不可避免地继承了语言偏见。这一局限性给现有方法带来两大核心约束:(1)LLMs因利用偏见导致预测结果可靠性下降;(2)尽管具备强大的知识推理能力,LLMs在分布外(OOD)泛化任务中仍面临挑战。为解决这些问题,我们提出了目标属性描述促进器(OAD-Promoter),一种通过缓解语言偏见和提升领域迁移鲁棒性来增强基于LLM的VQA性能的新方法。
Reasoning Text-to-Video Retrieval via Digital Twin Video Representations and Large Language Models
该研究聚焦于推理型文本到视频检索(reasoningtext-to-videoretrieval)这一新兴任务,核心解决传统文本到视频检索无法处理隐含查询(需推理才能理解)和缺乏目标对象级定位的问题。任务定义:区别于传统显式查询(直接描述视觉内容),推理型文本到视频检索需处理隐含查询(涉及抽象语义、空间/时间关系等推理),同时返回满足查询条件的视频及对应目标对象的分割掩码(object-levelgroundingmasks)。核心挑战。
STaR: Towards Cognitive Table Reasoning via Slow-Thinking Large Language Models
表格推理是构建能够理解和分析结构化数据的智能系统的基础路径。尽管近年来大型语言模型(LLMs)在该领域取得了一定进展,但仍存在两大关键局限:(1)推理过程缺乏人类认知特有的深度和迭代优化特性;(2)推理过程存在不稳定性,影响下游应用的可靠性。本文提出STaR(Slow-ThinkingforTableReasoning)框架,旨在实现认知型表格推理——通过显式建模逐步推理过程和不确定性感知推理,为LLMs赋予慢思考能力。
Evaluating Large Language Models on Rare Disease Diagnosis: A Case Study using House M.D
研究背景:LLMs在多领域展现出强大能力,但在基于叙事性医学案例的罕见病诊断方面研究不足;现有医学数据集存在隐私限制、缺乏叙事驱动的诊断结构、规模有限等问题,而《豪斯医生》作为经医学教育验证的剧集,其叙事化病例可弥补这一缺口。数据集构建:从《豪斯医生》8季176集的公开维基内容中提取症状-诊断配对,经网页爬取、标准化病例转换、质量过滤三步流程,最终形成176个覆盖多医学专科、需多步推理的复杂病例数据集,且该数据集公开可获取。研究方法。
Simulating Misinformation Propagation in Social Networks using Large Language Models
社交媒体上的虚假信息借助惊奇感、情感共鸣和身份导向推理滋生蔓延,并常通过人类认知偏见被放大。为探究这些机制,本研究将大型语言模型(LLM)人格化为合成代理,模拟用户层面的偏见、意识形态倾向和信任启发式思维。在此框架下,我们引入“审计节点”体系,用于模拟和分析虚假信息在这类代理网络中传播时的演变过程。新闻文章在受人格条件约束的LLM节点网络中传播,每个节点会对接收的内容进行改写。随后,基于问答(QA)的审计器会在每个传播步骤中衡量事实保真度,实现对虚假信息失真的可解释、基于主张层面的追踪。
SAID: Empowering Large Language Models with Self-Activating Internal Defense
尽管大型语言模型(LLMs)在安全对齐方面取得了进展,但它们仍然容易受到旨在规避保护机制的越狱攻击。主流防御策略依赖外部干预(如输入过滤或输出修改),这些方法通常缺乏泛化能力,在损害模型可用性的同时还会产生显著的计算开销。在本研究中,我们提出了一种全新的无需训练的防御范式——自激活内部防御(SAID),该范式将防御任务从外部修正重构为内部能力激活。
Subnational Geocoding of Global Disasters Using Large Language Models
该研究聚焦全球灾害数据的国家级以下地理编码问题,针对EM-DAT等灾害数据库中位置信息多为非结构化文本、粒度不一致、拼写不规范等痛点,提出了一种基于大型语言模型(LLM)的全自动地理编码工作流。核心流程包括四步:1)利用GPT-4o解析EM-DAT中的自由文本位置信息,转化为层级化JSON结构(区分Admin1/2/3三级行政单位);2)通过GADM、OpenStreetMap、Wikidata三个独立地理信息源并行地理编码,生成候选几何图形;
Leveraging the Power of Large Language Models in Entity Linking via Adaptive Routing and Targeted...
实体链接(EL)传统上依赖大规模标注数据集和大量模型微调。尽管近年来的少样本方法通过提示工程利用大语言模型(LLMs)降低了训练需求,但由于基于LLM的推理成本高昂,这些方法往往存在效率问题。ARTER(自适应路由与目标实体推理)提出了一种结构化流水线,通过策略性组合候选生成、基于上下文的评分、自适应路由和选择性推理,在无需深度微调的情况下实现了高性能。ARTER对检索到的候选实体计算一组小型互补信号(包括嵌入特征和基于LLM的特征),将上下文提及划分为简单案例和复杂案例。
SSR: Socratic Self-Refine for Large Language Model Reasoning
大语言模型(LLMs)已展现出卓越的推理能力,但现有测试时框架往往依赖粗糙的自我验证和自我修正,限制了其在复杂任务上的效果。本文提出苏格拉底式自我优化(SSR),这是一种用于LLM推理细粒度评估和精准优化的新型框架。我们提出的SSR将模型响应分解为可验证的(子问题、子答案)对,通过受控重解和自一致性校验实现步骤级置信度评估。通过定位不可靠步骤并迭代优化,SSR能生成更准确、更具可解释性的推理链。在5个推理基准和3种LLM上的实证结果表明,SSR持续优于最先进的迭代自我优化基线。
LLM-as-a-Grader: Practical Insights from Large Language Model for Short-Answer and Report Evaluation
研究数据:收集约50名学生的5次简答题测验(共258份作答,每题侧重概念理解而非字面匹配,采用0.1分梯度计分),以及14个团队的项目报告(5-8页标准化结构,含摘要、方法、结果等8个评分模块)。研究方法:开发开源评分工具包LLM-as-a-Grader,通过Python脚本调用GPT-4oAPI,结合固定评分规则(如测验参考标准答案、报告遵循详细评分准则)进行自动评分;设置固定模型参数(温度0.0、top-p1.0)保证结果可复现,并由2名博士生担任人工评分员进行对比验证。核心结果。
OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models
随着多模态大语言模型(MLLMs)日益融入日常工具和智能代理,其可能输出不安全内容的问题引发了越来越多的关注——这些不安全内容包括有毒语言、偏见图像、隐私侵犯以及有害虚假信息等。现有安全基准在模态覆盖范围和性能评估方面仍存在很大局限,往往忽视了内容安全的广阔领域。在本研究中,我们提出了OutSafe-Bench,这是首个为多模态时代设计的最全面的内容安全评估套件。
LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models
本文针对老挝语这类东南亚低资源语言缺乏大型综合评估基准的问题,提出了首个大规模、多维度的老挝语大语言模型评估基准LaoBench。该基准包含超过17,000个精心筛选的样本,分为开源(Lao-7k、Lao-500)和闭源(Lao-10k)子集,覆盖三大核心维度:知识应用(历史、政治、文化、科学等领域)、K12基础教育(贴合老挝国家课程的人文、自然科学等内容)、老挝语-中文-英语双语翻译(涵盖国际事务、文化历史等场景)。
From Facts to Folklore: Evaluating Large Language Models on Bengali Cultural Knowledge
自然语言处理(NLP)研究的最新进展表明,大型语言模型(LLMs)在各类任务中展现出卓越能力。尽管近期的多语言基准已推动了LLMs的文化评估,但在捕捉低资源文化的细微特征方面仍存在关键缺口。本研究通过构建孟加拉语文化知识(BLanCK)数据集,涵盖民俗传统、烹饪艺术和地区方言等内容,旨在解决这些局限性。我们对多个多语言模型的研究发现:这些模型在非文化类别中表现良好,但在文化知识相关任务中存在显著困难;而当提供上下文信息时,所有模型的性能均得到大幅提升。
VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models
VP-Bench是一个针对多模态大语言模型(MLLM)视觉提示(VP)理解能力的两阶段综合基准测试框架。第一阶段聚焦模型对视觉提示的感知能力,覆盖8种VP形状、355种属性组合,基于30K+可视化提示构建问答对,核心评估存在性、计数、定位、指代四大任务;第二阶段探究VP对下游任务的影响,选取医疗图像分析、3D物体识别、面部情绪识别等6类实际场景任务,评估模型整合视觉提示与文本语境的能力。
Large Language Model enabled Mathematical Modeling
将大型语言模型(LLMs)融入供应链优化为提升运筹学(OR)决策能力开辟了广阔前景。传统优化方法(如线性规划、混合整数规划和仿真)需要领域专业知识将现实问题转化为可求解的数学模型。尽管Gurobi和COPT等优化求解器功能强大,但在定义目标、约束和变量结构时,人类专业知识仍然不可或缺。本研究探讨了LLMs(尤其是DeepSeek-R1模型)通过自然语言理解和代码生成弥补这一建模鸿沟的能力。
KARIPAP: Quantum-Inspired Tensor Network Compression of Large Language Models Using Infinite Proj...
该研究针对大型语言模型(LLMs)训练推理成本高、能耗大、难以终端部署的核心问题,提出了量子启发的张量网络压缩框架KARIPAP。其核心是结合无限投影纠缠对态(iPEPS)与张量重整化群(TRG)优化,通过结构化张量分解而非单纯减少神经元数量或降低权重精度,实现模型压缩。大型语言模型(LLMs)(如ChatGPT和LLaMA)的最新进展加速了生成式人工智能(AI)的发展,但它们前所未有的参数规模带来了巨大的计算和环境负担。过高的训练与推理成本、巨大的能源需求以及终端部署的局限性,持续限制着这类模型的可及性。
