Loading...
主动学习(AL)通过优先开展信息最丰富的实验加速科学发现,但传统AL中使用的机器学习(ML)模型存在冷启动限制和领域特异性特征工程需求,制约了其泛化能力。大型语言模型(LLM)借助预训练知识和通用令牌表示,可直接从文本描述中提出实验建议,提供了一种新范式。本文提出一种基于LLM的主动学习框架(LLM-AL),该框架在迭代少样本场景下运行,并在四种不同的材料科学数据集上与传统ML模型进行基准测试。我们探索了两种提示策略:一种采用简洁的数值输入,适用于具有更多成分和结构化特征的数据集;
Active Slice Discovery in Large Language Models
大型语言模型(LLMs)常在特定数据子集上表现出系统性错误,这类子集被称为“错误切片”。例如,某一切片可能对应特定人群——模型在识别与该人群相关的毒性评论时表现不佳。识别错误切片对于理解和改进模型至关重要,但这一过程极具挑战性。一种极具吸引力的方法是主动对可能属于同一切片的错误进行分组,同时通过有限的标注者资源验证所选样本是否存在相同的模型错误模式,从而减少人工标注量。本文将该方法形式化为“主动切片发现”,并在毒性分类任务中对人工定义的切片进行实证探究。
Blu-WERP (Web Extraction and Refinement Pipeline): A Scalable Pipeline for Preprocessing Large La...
高质量训练数据是大型语言模型(LLM)性能的基础,但现有预处理管道往往难以有效去除网络规模语料库中的噪声和非结构化内容。本文提出Blu-WERP,这是一种新型数据预处理管道,旨在优化用于LLM训练的CommonCrawlWARC文件质量。我们证明,在多种模型规模和评估基准下,Blu-WERP的性能显著优于包括DCLM在内的现有基准方案。该管道处理CommonCrawlWARC数据,采用了先进的过滤和质量评估机制。
The Alignment Paradox of Medical Large Language Models in Infertility Care: Decoupling Algorithmi...
大语言模型(LLMs)在临床决策支持中的应用日益广泛,但如何使其与现实医疗中多维度的推理路径对齐仍是一项重大挑战。本研究利用8000余条不孕症治疗记录,通过结合自动基准测试与盲态医生介入评估的双层框架,系统评估了四种对齐策略:监督微调(SFT)、直接偏好优化(DPO)、组相对策略优化(GRPO)和上下文学习(ICL)。GRPO在多个决策维度上实现了最高的算法准确率,证实了基于强化学习的优化方法在结构化预测任务中的价值。
Enhancing Large Language Models for Automated Homework Assessment in Undergraduate Circuit Analysis
本文聚焦于大型语言模型(LLMs)在本科电路分析课程作业自动评估中的应用优化,核心目标是提升模型的评估准确性与可靠性,为电气工程专业学生提供个性化学习支持。研究背景与现状:LLMs在教育领域的应用潜力显著,但现有模型(如GPT-4o、Llama370B)在电路分析作业评估中存在幻觉(如无法识别等效数值格式、误判完整性)、依赖规则化系统、难以处理电路图信息等问题。此前研究显示,GPT-4o在该领域表现最优,但基础准确率仍有提升空间。核心挑战。
QuantumChem-200K: A Large-Scale Open Organic Molecular Dataset for Quantum-Chemistry Property Scr...
双光子聚合(TPP)下一代光引发剂的发现受到阻碍,原因是缺乏包含光解离和激发态行为建模所需的量子化学与光物理性质的大型开放数据集。现有分子数据集通常仅提供基础物理化学描述符,因此无法支撑数据驱动的光引发剂筛选或人工智能辅助设计。为填补这一空白,我们引入QuantumChem-200K数据集——一个包含20多万个有机分子的大规模数据集,标注了11种量子化学性质,包括双光子吸收(TPA)截面、TPA光谱范围、单重态-三重态系间窜越(ISC)能量、毒性、合成可及性分数、亲水性、溶解度、沸点、分子量和芳香性。
Clinician-Directed Large Language Model Software Generation for Therapeutic Interventions in Phys...
该研究提出一种新的数字健康干预范式,核心是利用大型语言模型(LLMs)将临床医生的个性化运动处方自动转化为可执行的干预软件,应用于物理康复中的上肢训练。试验设计:每位治疗师针对标准化患者(右侧上肢无力)设计2套个性化运动方案,共生成40个程序、398条指令,LLM将这些处方实时转化为干预软件,通过增强现实设备(MetaQuest3)指导患者训练并监测表现。核心结果。
E$^3$-Pruner: Towards Efficient, Economical, and Effective Layer Pruning for Large Language Models
随着大型语言模型规模的不断扩大,层剪枝作为一种硬件友好的模型压缩方法受到了越来越多的关注。然而,现有层剪枝方法难以同时解决部署中的关键实际挑战,包括性能下降、训练成本高以及加速效果有限等问题。为克服这些局限性,我们提出了E3E^3E3-PRUNER——一种兼具任务有效性(task-Effective)、训练经济性(training-Economical)和推理高效性(inference-Efficient)的层剪枝框架。E3E^3E3。
Hallucinate Less by Thinking More: Aspect-Based Causal Abstention for Large Language Models
大语言模型(LLMs)经常生成流畅但事实错误的响应,这种现象被称为幻觉。回避机制(模型选择不回答而输出“我不知道”等表述)是一种常见的保障手段。然而,现有回避方法通常依赖生成后的信号(如生成变异或反馈),这限制了它们提前预防不可靠响应的能力。本文提出基于方面的因果回避(ABCA),这是一个新框架,通过因果推理分析LLM知识的内部多样性,实现生成前回避。这种多样性反映了从不同来源获取的参数化知识的多面性,代表了学科、法律背景或时间框架等不同方面。
Large Language Model Aided Birt-Hogg-Dube Syndrome Diagnosis with Multimodal Retrieval-Augmented ...
研究背景:BHD是一种常染色体显性遗传疾病,需通过胸部CT扫描识别囊性病变和气胸确诊,但它与淋巴管平滑肌瘤病(LAM)、肺朗格汉斯细胞组织细胞增生症(PLCH)、淋巴细胞性间质性肺炎(LIP)等弥漫性囊性肺病(DCLDs)影像学特征相似,且临床样本稀缺,导致传统深度学习方法诊断精度有限;多模态大语言模型(MLLMs)虽在少样本场景有潜力,但存在领域知识缺失和幻觉风险,影响诊断可靠性。框架设计。
Musical Score Understanding Benchmark: Evaluating Large Language Models‘ Comprehension of Complet...
该研究针对大型语言模型(LLMs)和视觉-语言模型(VLMs)在完整乐谱理解方面的研究空白,提出了首个大规模人工标注基准测试集MSU-Bench,用于评估模型在文本(ABC记谱法)和视觉(PDF乐谱)两种模态下的乐谱理解能力。理解完整乐谱需要对音高、节奏、和声、曲式等符号结构进行推理。尽管大型语言模型(LLMs)和视觉-语言模型(VLMs)在自然语言和多模态任务中取得了快速进展,但它们理解乐谱记谱法的能力仍未得到充分探索。
EfficientXpert: Efficient Domain Adaptation for Large Language Models via Propagation-Aware Pruning
大型语言模型(LLMs)的快速发展催生了对法律、医疗、金融等领域专用变体的迫切需求。然而,其庞大的模型规模仍是在资源受限环境中部署的主要障碍,且现有压缩方法要么无法跨领域泛化,要么会带来高昂的计算开销。本文提出EfficientXpert,这是一种轻量级领域剪枝框架,将传播感知剪枝准则(ForesightMask)与高效适配器更新算法(PartialBrainSurgeon)相结合。该框架嵌入LoRA微调过程,能够将通用预训练模型一步转化为稀疏化的领域适配专家。
Learning Multi-Access Point Coordination in Agentic AI Wi-Fi with Large Language Models
该研究针对下一代Wi-Fi(Wi-Fi8)中密集重叠基本服务集(OBSS)的多接入点协调(MAPC)问题展开,核心目标是解决传统MAPC协议依赖静态规则、难以适应动态网络环境(如干扰变化、拓扑调整)的局限性。文章提出了一种基于多大型语言模型(LLM)智能体的AgenticAIWi-Fi框架,将每个接入点(AP)建模为具备自主推理、记忆和工具使用能力的LLM智能体。系统模型。
Evaluating Large Language Models on the 2026 Korean CSAT Mathematics Exam: Measuring Mathematical...
本研究利用2026年韩国大学学术能力测试(CSAT)数学部分,系统评估了大型语言模型(LLMs)的数学推理能力,确保评估环境完全无数据污染。为解决现有基准测试中的数据泄露问题,我们在考试公开发布后的两小时内,完成了全部46道题目(22道必考题和24道选考题)的数字化处理,杜绝了这些题目被纳入模型训练数据的可能性。我们对24款最先进的LLM进行了全面评估,涵盖不同输入模态(纯文本、纯图像、文本+图形)和提示语言(韩语、英语)。
Towards Robust and Fair Next Visit Diagnosis Prediction under Noisy Clinical Notes with Large Lan...
人工智能(AI)十年间的快速发展为临床决策支持系统(CDSS)带来了新机遇,大型语言模型(LLMs)在时效性医疗任务中展现出强大的推理能力。然而,临床文本常因人为错误或自动处理流程缺陷而质量下降,引发了对AI辅助决策可靠性和公平性的担忧。尽管如此,此类质量退化的影响尚未得到充分研究,尤其是噪声导致的分布偏移如何加剧预测不确定性并对不同人口统计学亚组产生不均衡影响。本文针对多种文本损坏场景,对最先进的LLMs开展系统性研究,重点关注下次就诊诊断预测任务中的鲁棒性和公平性。
A Systematic Study of Compression Ordering for Large Language Models
大型语言模型(LLMs)需要大量计算资源,因此模型压缩对于在资源受限环境中高效部署至关重要。在主流压缩技术(知识蒸馏、结构化剪枝和低比特量化)中,它们的单独效果已得到充分研究,但它们之间的相互作用及最优组合顺序仍不明确。本研究系统探究了这些技术在Qwen2.5-3B模型上的独立应用效果与组合应用效果。我们以困惑度、G-Eval得分、清晰度、指令对齐度和压缩比为指标,评估了包括单技术基线在内的多种压缩流水线,并提出了三种技术组合的序列方案。
Efficient Robot Design with Multi-Objective Black-Box Optimization and Large Language Models
迄今为止,已开发出多种机器人设计优化方法,这些方法形式多样,涵盖数值优化到黑盒优化等类别。数值优化虽速度较快,但不适用于涉及复杂结构或离散值的场景,因此黑盒优化被广泛采用。然而,黑盒优化存在采样效率低的问题,需要大量采样迭代才能获得优质解。本研究提出一种利用大型语言模型(LLMs)提升基于黑盒优化的机器人本体设计效率的方法。在黑盒优化采样过程的同时,为LLM提供问题设定和丰富反馈并进行采样。我们通过实验验证该方法能更高效地探索设计方案,并对其特性与局限性进行了探讨。
Learning to Compress: Unlocking the Potential of Large Language Models for Text Representation
文本表示在聚类、检索及其他下游应用中发挥着关键作用。随着大型语言模型(LLMs)的兴起,利用其能力实现文本表示的关注度日益提升。然而,大多数LLMs本质上是因果模型,且针对下一个token预测进行优化,这使其在生成整体连贯的表示时并非最优。为解决这一问题,近期研究引入了pretext任务以适配LLMs用于文本表示。但这些任务大多依赖token级预测目标,例如LLM2Vec中使用的掩码下一个token预测(MNTP)。
R2Q: Towards Robust 2-Bit Large Language Models via Residual Refinement Quantization
大语言模型(LLMs)的快速发展带来了巨大的计算和内存需求,推动了低比特量化技术的应用。尽管8位和4位格式已得到广泛普及,但由于精度严重下降,将量化精度扩展到2位仍面临巨大挑战。为解决这一问题,我们提出了残差细化量化(ResidualRefinementQuantization,R2Q)——一种新型2位量化框架,该框架将量化过程分解为两个连续的1位子量化步骤,形成自适应量化网格。
PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese
大型语言模型(LLMs)在不同语言和文化背景下的性能存在显著差异,凸显了在多样化语言中进行系统评估的必要性。本研究提出了迄今为止规模最大的葡萄牙语LLM评估工作。借助新推出的PoETav2基准——一个包含40余项葡萄牙语任务的综合套件,我们对20余种涵盖不同训练规模和计算资源的模型进行了评估。研究揭示了计算投入和语言特异性适配对葡萄牙语性能的影响,同时分析了与英语等效任务的性能差距。通过该基准和相关分析,PoETav2为葡萄牙语建模与评估的未来研究奠定了基础。
