Loading...

Large Language Models for the Summarization of Czech Documents: From History to the Present
文本摘要是将较长文本自动浓缩为更短、连贯的摘要,同时保留原始含义和关键信息的任务。尽管该任务在英语和其他高资源语言中已得到广泛研究,但捷克语摘要(尤其是历史文献语境下的摘要)仍未被充分探索。这主要归因于捷克语固有的语言复杂性以及高质量标注数据集的缺乏。在本研究中,我们利用大型语言模型(LLMs)的能力来填补这一空白,具体采用了Mistral和mT5模型——这些模型在多种自然语言处理任务和多语言场景中均表现出优异性能。

Gender Bias in Emotion Recognition by Large Language Models
大型语言模型(LLMs)的快速发展及其在日常生活中的日益普及,凸显了评估并确保其公平性的重要性。本研究聚焦情绪心智理论领域的公平性问题,探究当LLMs面对人物及其环境描述并被问及“此人感受如何”时,是否会表现出性别偏见。此外,我们提出并评估了多种去偏策略,结果表明,要实现有意义的偏见减少,需要基于训练的干预措施,而非仅依赖提示工程等推理时的提示类方法。

Layer-Wise High-Impact Parameter Ratio Optimization in Post-Training Quantization for Large Langu...
大型语言模型(LLMs)在自然语言处理领域取得了显著进展,但庞大的参数数量给部署过程带来了巨大的计算和内存挑战。训练后量化(PTQ)作为一种极具潜力的解决方案,能够以极小的开销缓解这些挑战。尽管现有PTQ方法能有效对LLMs进行量化,但在极低比特宽度下会出现严重的精度损失,这主要是由对量化性能有显著影响的高影响参数导致的。已有部分方法通过识别高影响参数并将其保留为FP16格式来解决该问题,但这些方法在所有层中均采用固定比例的高影响参数,忽略了层间的敏感性差异。

Data Mixing Optimization for Supervised Fine-Tuning of Large Language Models
优化大型语言模型(LLMs)有监督微调(SFT)的数据混合比例,对开发通用模型至关重要,但该领域的研究仍有待深入。本文将数据混合问题构建为优化问题,提出一种旨在最小化验证损失的新方法。我们的方法通过对“迁移有效数据”建模,并利用微调缩放定律,实现对损失的参数化。通过在各类小规模数据混合场景下进行实验,我们拟合出相关参数并推导得到最优领域权重。本文提供的数学证明与实证结果均表明,该算法在所有领域的整体性能和单项性能上均表现优异。

NNGPT: Rethinking AutoML with Large Language Models
构建自我改进的人工智能系统仍是人工智能领域的核心挑战。本文提出NNGPT,一个开源框架,其将大型语言模型(LLM)转化为用于神经网络开发的自我改进AutoML引擎,主要面向计算机视觉任务。与现有框架不同,NNGPT通过生成新模型扩展神经网络数据集,基于“生成-评估-自我改进”的闭环系统实现LLM的持续微调。

Training-Free Active Learning Framework in Materials Science with Large Language Models
主动学习(AL)通过优先开展信息最丰富的实验加速科学发现,但传统AL中使用的机器学习(ML)模型存在冷启动限制和领域特异性特征工程需求,制约了其泛化能力。大型语言模型(LLM)借助预训练知识和通用令牌表示,可直接从文本描述中提出实验建议,提供了一种新范式。本文提出一种基于LLM的主动学习框架(LLM-AL),该框架在迭代少样本场景下运行,并在四种不同的材料科学数据集上与传统ML模型进行基准测试。我们探索了两种提示策略:一种采用简洁的数值输入,适用于具有更多成分和结构化特征的数据集;

Active Slice Discovery in Large Language Models
大型语言模型(LLMs)常在特定数据子集上表现出系统性错误,这类子集被称为“错误切片”。例如,某一切片可能对应特定人群——模型在识别与该人群相关的毒性评论时表现不佳。识别错误切片对于理解和改进模型至关重要,但这一过程极具挑战性。一种极具吸引力的方法是主动对可能属于同一切片的错误进行分组,同时通过有限的标注者资源验证所选样本是否存在相同的模型错误模式,从而减少人工标注量。本文将该方法形式化为“主动切片发现”,并在毒性分类任务中对人工定义的切片进行实证探究。

Blu-WERP (Web Extraction and Refinement Pipeline): A Scalable Pipeline for Preprocessing Large La...
高质量训练数据是大型语言模型(LLM)性能的基础,但现有预处理管道往往难以有效去除网络规模语料库中的噪声和非结构化内容。本文提出Blu-WERP,这是一种新型数据预处理管道,旨在优化用于LLM训练的CommonCrawlWARC文件质量。我们证明,在多种模型规模和评估基准下,Blu-WERP的性能显著优于包括DCLM在内的现有基准方案。该管道处理CommonCrawlWARC数据,采用了先进的过滤和质量评估机制。

The Alignment Paradox of Medical Large Language Models in Infertility Care: Decoupling Algorithmi...
大语言模型(LLMs)在临床决策支持中的应用日益广泛,但如何使其与现实医疗中多维度的推理路径对齐仍是一项重大挑战。本研究利用8000余条不孕症治疗记录,通过结合自动基准测试与盲态医生介入评估的双层框架,系统评估了四种对齐策略:监督微调(SFT)、直接偏好优化(DPO)、组相对策略优化(GRPO)和上下文学习(ICL)。GRPO在多个决策维度上实现了最高的算法准确率,证实了基于强化学习的优化方法在结构化预测任务中的价值。

Enhancing Large Language Models for Automated Homework Assessment in Undergraduate Circuit Analysis
本文聚焦于大型语言模型(LLMs)在本科电路分析课程作业自动评估中的应用优化,核心目标是提升模型的评估准确性与可靠性,为电气工程专业学生提供个性化学习支持。研究背景与现状:LLMs在教育领域的应用潜力显著,但现有模型(如GPT-4o、Llama370B)在电路分析作业评估中存在幻觉(如无法识别等效数值格式、误判完整性)、依赖规则化系统、难以处理电路图信息等问题。此前研究显示,GPT-4o在该领域表现最优,但基础准确率仍有提升空间。核心挑战。

QuantumChem-200K: A Large-Scale Open Organic Molecular Dataset for Quantum-Chemistry Property Scr...
双光子聚合(TPP)下一代光引发剂的发现受到阻碍,原因是缺乏包含光解离和激发态行为建模所需的量子化学与光物理性质的大型开放数据集。现有分子数据集通常仅提供基础物理化学描述符,因此无法支撑数据驱动的光引发剂筛选或人工智能辅助设计。为填补这一空白,我们引入QuantumChem-200K数据集——一个包含20多万个有机分子的大规模数据集,标注了11种量子化学性质,包括双光子吸收(TPA)截面、TPA光谱范围、单重态-三重态系间窜越(ISC)能量、毒性、合成可及性分数、亲水性、溶解度、沸点、分子量和芳香性。

Clinician-Directed Large Language Model Software Generation for Therapeutic Interventions in Phys...
该研究提出一种新的数字健康干预范式,核心是利用大型语言模型(LLMs)将临床医生的个性化运动处方自动转化为可执行的干预软件,应用于物理康复中的上肢训练。试验设计:每位治疗师针对标准化患者(右侧上肢无力)设计2套个性化运动方案,共生成40个程序、398条指令,LLM将这些处方实时转化为干预软件,通过增强现实设备(MetaQuest3)指导患者训练并监测表现。核心结果。

E$^3$-Pruner: Towards Efficient, Economical, and Effective Layer Pruning for Large Language Models
随着大型语言模型规模的不断扩大,层剪枝作为一种硬件友好的模型压缩方法受到了越来越多的关注。然而,现有层剪枝方法难以同时解决部署中的关键实际挑战,包括性能下降、训练成本高以及加速效果有限等问题。为克服这些局限性,我们提出了E3E^3E3-PRUNER——一种兼具任务有效性(task-Effective)、训练经济性(training-Economical)和推理高效性(inference-Efficient)的层剪枝框架。E3E^3E3。

Hallucinate Less by Thinking More: Aspect-Based Causal Abstention for Large Language Models
大语言模型(LLMs)经常生成流畅但事实错误的响应,这种现象被称为幻觉。回避机制(模型选择不回答而输出“我不知道”等表述)是一种常见的保障手段。然而,现有回避方法通常依赖生成后的信号(如生成变异或反馈),这限制了它们提前预防不可靠响应的能力。本文提出基于方面的因果回避(ABCA),这是一个新框架,通过因果推理分析LLM知识的内部多样性,实现生成前回避。这种多样性反映了从不同来源获取的参数化知识的多面性,代表了学科、法律背景或时间框架等不同方面。

Large Language Model Aided Birt-Hogg-Dube Syndrome Diagnosis with Multimodal Retrieval-Augmented ...
研究背景:BHD是一种常染色体显性遗传疾病,需通过胸部CT扫描识别囊性病变和气胸确诊,但它与淋巴管平滑肌瘤病(LAM)、肺朗格汉斯细胞组织细胞增生症(PLCH)、淋巴细胞性间质性肺炎(LIP)等弥漫性囊性肺病(DCLDs)影像学特征相似,且临床样本稀缺,导致传统深度学习方法诊断精度有限;多模态大语言模型(MLLMs)虽在少样本场景有潜力,但存在领域知识缺失和幻觉风险,影响诊断可靠性。框架设计。

Musical Score Understanding Benchmark: Evaluating Large Language Models‘ Comprehension of Complet...
该研究针对大型语言模型(LLMs)和视觉-语言模型(VLMs)在完整乐谱理解方面的研究空白,提出了首个大规模人工标注基准测试集MSU-Bench,用于评估模型在文本(ABC记谱法)和视觉(PDF乐谱)两种模态下的乐谱理解能力。理解完整乐谱需要对音高、节奏、和声、曲式等符号结构进行推理。尽管大型语言模型(LLMs)和视觉-语言模型(VLMs)在自然语言和多模态任务中取得了快速进展,但它们理解乐谱记谱法的能力仍未得到充分探索。

EfficientXpert: Efficient Domain Adaptation for Large Language Models via Propagation-Aware Pruning
大型语言模型(LLMs)的快速发展催生了对法律、医疗、金融等领域专用变体的迫切需求。然而,其庞大的模型规模仍是在资源受限环境中部署的主要障碍,且现有压缩方法要么无法跨领域泛化,要么会带来高昂的计算开销。本文提出EfficientXpert,这是一种轻量级领域剪枝框架,将传播感知剪枝准则(ForesightMask)与高效适配器更新算法(PartialBrainSurgeon)相结合。该框架嵌入LoRA微调过程,能够将通用预训练模型一步转化为稀疏化的领域适配专家。

Learning Multi-Access Point Coordination in Agentic AI Wi-Fi with Large Language Models
该研究针对下一代Wi-Fi(Wi-Fi8)中密集重叠基本服务集(OBSS)的多接入点协调(MAPC)问题展开,核心目标是解决传统MAPC协议依赖静态规则、难以适应动态网络环境(如干扰变化、拓扑调整)的局限性。文章提出了一种基于多大型语言模型(LLM)智能体的AgenticAIWi-Fi框架,将每个接入点(AP)建模为具备自主推理、记忆和工具使用能力的LLM智能体。系统模型。

Evaluating Large Language Models on the 2026 Korean CSAT Mathematics Exam: Measuring Mathematical...
本研究利用2026年韩国大学学术能力测试(CSAT)数学部分,系统评估了大型语言模型(LLMs)的数学推理能力,确保评估环境完全无数据污染。为解决现有基准测试中的数据泄露问题,我们在考试公开发布后的两小时内,完成了全部46道题目(22道必考题和24道选考题)的数字化处理,杜绝了这些题目被纳入模型训练数据的可能性。我们对24款最先进的LLM进行了全面评估,涵盖不同输入模态(纯文本、纯图像、文本+图形)和提示语言(韩语、英语)。

Towards Robust and Fair Next Visit Diagnosis Prediction under Noisy Clinical Notes with Large Lan...
人工智能(AI)十年间的快速发展为临床决策支持系统(CDSS)带来了新机遇,大型语言模型(LLMs)在时效性医疗任务中展现出强大的推理能力。然而,临床文本常因人为错误或自动处理流程缺陷而质量下降,引发了对AI辅助决策可靠性和公平性的担忧。尽管如此,此类质量退化的影响尚未得到充分研究,尤其是噪声导致的分布偏移如何加剧预测不确定性并对不同人口统计学亚组产生不均衡影响。本文针对多种文本损坏场景,对最先进的LLMs开展系统性研究,重点关注下次就诊诊断预测任务中的鲁棒性和公平性。

欢迎留下您的脚印