Loading...
该研究提出一种新的数字健康干预范式,核心是利用大型语言模型(LLMs)将临床医生的个性化运动处方自动转化为可执行的干预软件,应用于物理康复中的上肢训练。试验设计:每位治疗师针对标准化患者(右侧上肢无力)设计2套个性化运动方案,共生成40个程序、398条指令,LLM将这些处方实时转化为干预软件,通过增强现实设备(MetaQuest3)指导患者训练并监测表现。核心结果。
E$^3$-Pruner: Towards Efficient, Economical, and Effective Layer Pruning for Large Language Models
随着大型语言模型规模的不断扩大,层剪枝作为一种硬件友好的模型压缩方法受到了越来越多的关注。然而,现有层剪枝方法难以同时解决部署中的关键实际挑战,包括性能下降、训练成本高以及加速效果有限等问题。为克服这些局限性,我们提出了E3E^3E3-PRUNER——一种兼具任务有效性(task-Effective)、训练经济性(training-Economical)和推理高效性(inference-Efficient)的层剪枝框架。E3E^3E3。
Hallucinate Less by Thinking More: Aspect-Based Causal Abstention for Large Language Models
大语言模型(LLMs)经常生成流畅但事实错误的响应,这种现象被称为幻觉。回避机制(模型选择不回答而输出“我不知道”等表述)是一种常见的保障手段。然而,现有回避方法通常依赖生成后的信号(如生成变异或反馈),这限制了它们提前预防不可靠响应的能力。本文提出基于方面的因果回避(ABCA),这是一个新框架,通过因果推理分析LLM知识的内部多样性,实现生成前回避。这种多样性反映了从不同来源获取的参数化知识的多面性,代表了学科、法律背景或时间框架等不同方面。
Large Language Model Aided Birt-Hogg-Dube Syndrome Diagnosis with Multimodal Retrieval-Augmented ...
研究背景:BHD是一种常染色体显性遗传疾病,需通过胸部CT扫描识别囊性病变和气胸确诊,但它与淋巴管平滑肌瘤病(LAM)、肺朗格汉斯细胞组织细胞增生症(PLCH)、淋巴细胞性间质性肺炎(LIP)等弥漫性囊性肺病(DCLDs)影像学特征相似,且临床样本稀缺,导致传统深度学习方法诊断精度有限;多模态大语言模型(MLLMs)虽在少样本场景有潜力,但存在领域知识缺失和幻觉风险,影响诊断可靠性。框架设计。
Musical Score Understanding Benchmark: Evaluating Large Language Models‘ Comprehension of Complet...
该研究针对大型语言模型(LLMs)和视觉-语言模型(VLMs)在完整乐谱理解方面的研究空白,提出了首个大规模人工标注基准测试集MSU-Bench,用于评估模型在文本(ABC记谱法)和视觉(PDF乐谱)两种模态下的乐谱理解能力。理解完整乐谱需要对音高、节奏、和声、曲式等符号结构进行推理。尽管大型语言模型(LLMs)和视觉-语言模型(VLMs)在自然语言和多模态任务中取得了快速进展,但它们理解乐谱记谱法的能力仍未得到充分探索。
EfficientXpert: Efficient Domain Adaptation for Large Language Models via Propagation-Aware Pruning
大型语言模型(LLMs)的快速发展催生了对法律、医疗、金融等领域专用变体的迫切需求。然而,其庞大的模型规模仍是在资源受限环境中部署的主要障碍,且现有压缩方法要么无法跨领域泛化,要么会带来高昂的计算开销。本文提出EfficientXpert,这是一种轻量级领域剪枝框架,将传播感知剪枝准则(ForesightMask)与高效适配器更新算法(PartialBrainSurgeon)相结合。该框架嵌入LoRA微调过程,能够将通用预训练模型一步转化为稀疏化的领域适配专家。
Learning Multi-Access Point Coordination in Agentic AI Wi-Fi with Large Language Models
该研究针对下一代Wi-Fi(Wi-Fi8)中密集重叠基本服务集(OBSS)的多接入点协调(MAPC)问题展开,核心目标是解决传统MAPC协议依赖静态规则、难以适应动态网络环境(如干扰变化、拓扑调整)的局限性。文章提出了一种基于多大型语言模型(LLM)智能体的AgenticAIWi-Fi框架,将每个接入点(AP)建模为具备自主推理、记忆和工具使用能力的LLM智能体。系统模型。
Evaluating Large Language Models on the 2026 Korean CSAT Mathematics Exam: Measuring Mathematical...
本研究利用2026年韩国大学学术能力测试(CSAT)数学部分,系统评估了大型语言模型(LLMs)的数学推理能力,确保评估环境完全无数据污染。为解决现有基准测试中的数据泄露问题,我们在考试公开发布后的两小时内,完成了全部46道题目(22道必考题和24道选考题)的数字化处理,杜绝了这些题目被纳入模型训练数据的可能性。我们对24款最先进的LLM进行了全面评估,涵盖不同输入模态(纯文本、纯图像、文本+图形)和提示语言(韩语、英语)。
Towards Robust and Fair Next Visit Diagnosis Prediction under Noisy Clinical Notes with Large Lan...
人工智能(AI)十年间的快速发展为临床决策支持系统(CDSS)带来了新机遇,大型语言模型(LLMs)在时效性医疗任务中展现出强大的推理能力。然而,临床文本常因人为错误或自动处理流程缺陷而质量下降,引发了对AI辅助决策可靠性和公平性的担忧。尽管如此,此类质量退化的影响尚未得到充分研究,尤其是噪声导致的分布偏移如何加剧预测不确定性并对不同人口统计学亚组产生不均衡影响。本文针对多种文本损坏场景,对最先进的LLMs开展系统性研究,重点关注下次就诊诊断预测任务中的鲁棒性和公平性。
A Systematic Study of Compression Ordering for Large Language Models
大型语言模型(LLMs)需要大量计算资源,因此模型压缩对于在资源受限环境中高效部署至关重要。在主流压缩技术(知识蒸馏、结构化剪枝和低比特量化)中,它们的单独效果已得到充分研究,但它们之间的相互作用及最优组合顺序仍不明确。本研究系统探究了这些技术在Qwen2.5-3B模型上的独立应用效果与组合应用效果。我们以困惑度、G-Eval得分、清晰度、指令对齐度和压缩比为指标,评估了包括单技术基线在内的多种压缩流水线,并提出了三种技术组合的序列方案。
Efficient Robot Design with Multi-Objective Black-Box Optimization and Large Language Models
迄今为止,已开发出多种机器人设计优化方法,这些方法形式多样,涵盖数值优化到黑盒优化等类别。数值优化虽速度较快,但不适用于涉及复杂结构或离散值的场景,因此黑盒优化被广泛采用。然而,黑盒优化存在采样效率低的问题,需要大量采样迭代才能获得优质解。本研究提出一种利用大型语言模型(LLMs)提升基于黑盒优化的机器人本体设计效率的方法。在黑盒优化采样过程的同时,为LLM提供问题设定和丰富反馈并进行采样。我们通过实验验证该方法能更高效地探索设计方案,并对其特性与局限性进行了探讨。
Learning to Compress: Unlocking the Potential of Large Language Models for Text Representation
文本表示在聚类、检索及其他下游应用中发挥着关键作用。随着大型语言模型(LLMs)的兴起,利用其能力实现文本表示的关注度日益提升。然而,大多数LLMs本质上是因果模型,且针对下一个token预测进行优化,这使其在生成整体连贯的表示时并非最优。为解决这一问题,近期研究引入了pretext任务以适配LLMs用于文本表示。但这些任务大多依赖token级预测目标,例如LLM2Vec中使用的掩码下一个token预测(MNTP)。
R2Q: Towards Robust 2-Bit Large Language Models via Residual Refinement Quantization
大语言模型(LLMs)的快速发展带来了巨大的计算和内存需求,推动了低比特量化技术的应用。尽管8位和4位格式已得到广泛普及,但由于精度严重下降,将量化精度扩展到2位仍面临巨大挑战。为解决这一问题,我们提出了残差细化量化(ResidualRefinementQuantization,R2Q)——一种新型2位量化框架,该框架将量化过程分解为两个连续的1位子量化步骤,形成自适应量化网格。
PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese
大型语言模型(LLMs)在不同语言和文化背景下的性能存在显著差异,凸显了在多样化语言中进行系统评估的必要性。本研究提出了迄今为止规模最大的葡萄牙语LLM评估工作。借助新推出的PoETav2基准——一个包含40余项葡萄牙语任务的综合套件,我们对20余种涵盖不同训练规模和计算资源的模型进行了评估。研究揭示了计算投入和语言特异性适配对葡萄牙语性能的影响,同时分析了与英语等效任务的性能差距。通过该基准和相关分析,PoETav2为葡萄牙语建模与评估的未来研究奠定了基础。
Toward Trustworthy Difficulty Assessments: Large Language Models as Judges in Programming and Syn...
该研究聚焦于大型语言模型(LLMs)在编程任务难度评估中的可信度问题,通过对比GPT-4o与可解释的LightGBM集成模型在LeetCode题目难度分类(Easy/Medium/Hard)上的表现,揭示LLM作为难度评估器的核心缺陷,并通过合成问题生成实验进一步探究其内部难度判断逻辑。研究背景:LLMs在代码生成、辅导与评估中应用日益广泛,但在结构化的编程题目难度预测等任务中的表现尚未被充分探索。现有自动难度评估方法多依赖数值特征(如输入规模、通过率)和文本特征,且可解释性模型表现稳定。实验设计。
A Benchmark for Zero-Shot Belief Inference in Large Language Models
该研究聚焦大型语言模型(LLMs)在零样本场景下的信念推理能力,核心是构建了一个系统、可复现的基准测试框架,用于评估LLMs对人类在多样化主题上立场的预测效果。研究使用Debate.org数据集,提取了涵盖宗教、科学、体育、娱乐等23个类别的119,119条独特信念陈述,涉及5,712名用户,并设计了四种信息输入条件(无背景信息的“盲测”、仅人口统计学信息、仅已知信念、人口统计学+已知信念),对9个主流开源LLMs(如Gemma3、Llama3系列、Phi4等)进行测试。
Efficient Inference Using Large Language Models with Limited Human Data: Fine-Tuning then Rectifi...
本文聚焦于有限人类标注数据场景下,如何高效利用大语言模型(LLMs)进行推断的核心问题。传统LLM虽可作为人类受访者的替代者,降低调研成本,但存在输出偏差、对提示词敏感等缺陷;现有改进方法(微调FT、事后校正PPI)单独使用时,受限于标注数据稀缺性且存在边际效益递减问题。优化微调目标:摒弃传统最小化均方误差(MSE)的思路,提出以“最小化预测误差方差”为微调目标,适配下游PPI校正的需求(PPI对误差方差更敏感,而非偏差);样本最优分配。
Leveraging Language Models for Interpretable Analysis of Narratives in a Large Corpus
叙事驱动人类行为,是地缘政治的核心,但长期以来难以量化其重叠性与演变过程。本文提出一种可解释模型,整合成熟的词袋(BoW)主题表示与新型基于LLM的问答(Q&A)叙事模型,二者共享潜在的再生核希尔伯特空间表示,用于量化文本文档。该方法在无需LLM全量推断的前提下,缓解了使用LLM分析大规模语料时面临的成本、可解释性与泛化性挑战。我们推导了高效的函数梯度下降更新规则,这些规则具有可解释性,且在结构上与Transformer中的自注意力机制类似。
Understanding Counting Mechanisms in Large Language and Vision-Language Models
本文探讨了大型语言模型(LLMs)和大型视觉-语言模型(LVLMs)在计数任务中如何表示和计算数值信息。我们通过包含重复文本和视觉项目的受控实验,并借助因果中介分析和激活修补技术分析模型行为。为此,我们设计了一款名为CountScope的专用工具,用于数值内容的机制可解释性研究。结果表明,单个token或视觉特征会编码潜在的位置计数信息,这些信息可被提取并在不同上下文间传递。分层分析显示数值表征逐步涌现:低层编码小计数,高层表征大计数。
Large Language Models for Sentiment Analysis to Detect Social Challenges: A Use Case with South A...
该研究聚焦于利用大型语言模型(LLMs)对南非社交媒体帖子进行情感分析,以识别社会挑战。研究背景与目标:南非作为多语言国家(12种官方语言),低资源语言的情感分析工具匮乏,而社会挑战的精准识别对政府施策至关重要。研究旨在评估主流LLMs在英语、塞佩迪语(Sepedi)和茨瓦纳语(Setswana)中的零样本情感分析性能,覆盖就业、卫生、教育等10个南非政府重点关注的议题。实验设计。
