Loading...
该研究针对大型语言模型(LLMs)和视觉-语言模型(VLMs)在完整乐谱理解方面的研究空白,提出了首个大规模人工标注基准测试集MSU-Bench,用于评估模型在文本(ABC记谱法)和视觉(PDF乐谱)两种模态下的乐谱理解能力。理解完整乐谱需要对音高、节奏、和声、曲式等符号结构进行推理。尽管大型语言模型(LLMs)和视觉-语言模型(VLMs)在自然语言和多模态任务中取得了快速进展,但它们理解乐谱记谱法的能力仍未得到充分探索。
EfficientXpert: Efficient Domain Adaptation for Large Language Models via Propagation-Aware Pruning
大型语言模型(LLMs)的快速发展催生了对法律、医疗、金融等领域专用变体的迫切需求。然而,其庞大的模型规模仍是在资源受限环境中部署的主要障碍,且现有压缩方法要么无法跨领域泛化,要么会带来高昂的计算开销。本文提出EfficientXpert,这是一种轻量级领域剪枝框架,将传播感知剪枝准则(ForesightMask)与高效适配器更新算法(PartialBrainSurgeon)相结合。该框架嵌入LoRA微调过程,能够将通用预训练模型一步转化为稀疏化的领域适配专家。
Learning Multi-Access Point Coordination in Agentic AI Wi-Fi with Large Language Models
该研究针对下一代Wi-Fi(Wi-Fi8)中密集重叠基本服务集(OBSS)的多接入点协调(MAPC)问题展开,核心目标是解决传统MAPC协议依赖静态规则、难以适应动态网络环境(如干扰变化、拓扑调整)的局限性。文章提出了一种基于多大型语言模型(LLM)智能体的AgenticAIWi-Fi框架,将每个接入点(AP)建模为具备自主推理、记忆和工具使用能力的LLM智能体。系统模型。
Evaluating Large Language Models on the 2026 Korean CSAT Mathematics Exam: Measuring Mathematical...
本研究利用2026年韩国大学学术能力测试(CSAT)数学部分,系统评估了大型语言模型(LLMs)的数学推理能力,确保评估环境完全无数据污染。为解决现有基准测试中的数据泄露问题,我们在考试公开发布后的两小时内,完成了全部46道题目(22道必考题和24道选考题)的数字化处理,杜绝了这些题目被纳入模型训练数据的可能性。我们对24款最先进的LLM进行了全面评估,涵盖不同输入模态(纯文本、纯图像、文本+图形)和提示语言(韩语、英语)。
Towards Robust and Fair Next Visit Diagnosis Prediction under Noisy Clinical Notes with Large Lan...
人工智能(AI)十年间的快速发展为临床决策支持系统(CDSS)带来了新机遇,大型语言模型(LLMs)在时效性医疗任务中展现出强大的推理能力。然而,临床文本常因人为错误或自动处理流程缺陷而质量下降,引发了对AI辅助决策可靠性和公平性的担忧。尽管如此,此类质量退化的影响尚未得到充分研究,尤其是噪声导致的分布偏移如何加剧预测不确定性并对不同人口统计学亚组产生不均衡影响。本文针对多种文本损坏场景,对最先进的LLMs开展系统性研究,重点关注下次就诊诊断预测任务中的鲁棒性和公平性。
A Systematic Study of Compression Ordering for Large Language Models
大型语言模型(LLMs)需要大量计算资源,因此模型压缩对于在资源受限环境中高效部署至关重要。在主流压缩技术(知识蒸馏、结构化剪枝和低比特量化)中,它们的单独效果已得到充分研究,但它们之间的相互作用及最优组合顺序仍不明确。本研究系统探究了这些技术在Qwen2.5-3B模型上的独立应用效果与组合应用效果。我们以困惑度、G-Eval得分、清晰度、指令对齐度和压缩比为指标,评估了包括单技术基线在内的多种压缩流水线,并提出了三种技术组合的序列方案。
Efficient Robot Design with Multi-Objective Black-Box Optimization and Large Language Models
迄今为止,已开发出多种机器人设计优化方法,这些方法形式多样,涵盖数值优化到黑盒优化等类别。数值优化虽速度较快,但不适用于涉及复杂结构或离散值的场景,因此黑盒优化被广泛采用。然而,黑盒优化存在采样效率低的问题,需要大量采样迭代才能获得优质解。本研究提出一种利用大型语言模型(LLMs)提升基于黑盒优化的机器人本体设计效率的方法。在黑盒优化采样过程的同时,为LLM提供问题设定和丰富反馈并进行采样。我们通过实验验证该方法能更高效地探索设计方案,并对其特性与局限性进行了探讨。
Learning to Compress: Unlocking the Potential of Large Language Models for Text Representation
文本表示在聚类、检索及其他下游应用中发挥着关键作用。随着大型语言模型(LLMs)的兴起,利用其能力实现文本表示的关注度日益提升。然而,大多数LLMs本质上是因果模型,且针对下一个token预测进行优化,这使其在生成整体连贯的表示时并非最优。为解决这一问题,近期研究引入了pretext任务以适配LLMs用于文本表示。但这些任务大多依赖token级预测目标,例如LLM2Vec中使用的掩码下一个token预测(MNTP)。
R2Q: Towards Robust 2-Bit Large Language Models via Residual Refinement Quantization
大语言模型(LLMs)的快速发展带来了巨大的计算和内存需求,推动了低比特量化技术的应用。尽管8位和4位格式已得到广泛普及,但由于精度严重下降,将量化精度扩展到2位仍面临巨大挑战。为解决这一问题,我们提出了残差细化量化(ResidualRefinementQuantization,R2Q)——一种新型2位量化框架,该框架将量化过程分解为两个连续的1位子量化步骤,形成自适应量化网格。
PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese
大型语言模型(LLMs)在不同语言和文化背景下的性能存在显著差异,凸显了在多样化语言中进行系统评估的必要性。本研究提出了迄今为止规模最大的葡萄牙语LLM评估工作。借助新推出的PoETav2基准——一个包含40余项葡萄牙语任务的综合套件,我们对20余种涵盖不同训练规模和计算资源的模型进行了评估。研究揭示了计算投入和语言特异性适配对葡萄牙语性能的影响,同时分析了与英语等效任务的性能差距。通过该基准和相关分析,PoETav2为葡萄牙语建模与评估的未来研究奠定了基础。
Toward Trustworthy Difficulty Assessments: Large Language Models as Judges in Programming and Syn...
该研究聚焦于大型语言模型(LLMs)在编程任务难度评估中的可信度问题,通过对比GPT-4o与可解释的LightGBM集成模型在LeetCode题目难度分类(Easy/Medium/Hard)上的表现,揭示LLM作为难度评估器的核心缺陷,并通过合成问题生成实验进一步探究其内部难度判断逻辑。研究背景:LLMs在代码生成、辅导与评估中应用日益广泛,但在结构化的编程题目难度预测等任务中的表现尚未被充分探索。现有自动难度评估方法多依赖数值特征(如输入规模、通过率)和文本特征,且可解释性模型表现稳定。实验设计。
A Benchmark for Zero-Shot Belief Inference in Large Language Models
该研究聚焦大型语言模型(LLMs)在零样本场景下的信念推理能力,核心是构建了一个系统、可复现的基准测试框架,用于评估LLMs对人类在多样化主题上立场的预测效果。研究使用Debate.org数据集,提取了涵盖宗教、科学、体育、娱乐等23个类别的119,119条独特信念陈述,涉及5,712名用户,并设计了四种信息输入条件(无背景信息的“盲测”、仅人口统计学信息、仅已知信念、人口统计学+已知信念),对9个主流开源LLMs(如Gemma3、Llama3系列、Phi4等)进行测试。
Efficient Inference Using Large Language Models with Limited Human Data: Fine-Tuning then Rectifi...
本文聚焦于有限人类标注数据场景下,如何高效利用大语言模型(LLMs)进行推断的核心问题。传统LLM虽可作为人类受访者的替代者,降低调研成本,但存在输出偏差、对提示词敏感等缺陷;现有改进方法(微调FT、事后校正PPI)单独使用时,受限于标注数据稀缺性且存在边际效益递减问题。优化微调目标:摒弃传统最小化均方误差(MSE)的思路,提出以“最小化预测误差方差”为微调目标,适配下游PPI校正的需求(PPI对误差方差更敏感,而非偏差);样本最优分配。
Leveraging Language Models for Interpretable Analysis of Narratives in a Large Corpus
叙事驱动人类行为,是地缘政治的核心,但长期以来难以量化其重叠性与演变过程。本文提出一种可解释模型,整合成熟的词袋(BoW)主题表示与新型基于LLM的问答(Q&A)叙事模型,二者共享潜在的再生核希尔伯特空间表示,用于量化文本文档。该方法在无需LLM全量推断的前提下,缓解了使用LLM分析大规模语料时面临的成本、可解释性与泛化性挑战。我们推导了高效的函数梯度下降更新规则,这些规则具有可解释性,且在结构上与Transformer中的自注意力机制类似。
Understanding Counting Mechanisms in Large Language and Vision-Language Models
本文探讨了大型语言模型(LLMs)和大型视觉-语言模型(LVLMs)在计数任务中如何表示和计算数值信息。我们通过包含重复文本和视觉项目的受控实验,并借助因果中介分析和激活修补技术分析模型行为。为此,我们设计了一款名为CountScope的专用工具,用于数值内容的机制可解释性研究。结果表明,单个token或视觉特征会编码潜在的位置计数信息,这些信息可被提取并在不同上下文间传递。分层分析显示数值表征逐步涌现:低层编码小计数,高层表征大计数。
Large Language Models for Sentiment Analysis to Detect Social Challenges: A Use Case with South A...
该研究聚焦于利用大型语言模型(LLMs)对南非社交媒体帖子进行情感分析,以识别社会挑战。研究背景与目标:南非作为多语言国家(12种官方语言),低资源语言的情感分析工具匮乏,而社会挑战的精准识别对政府施策至关重要。研究旨在评估主流LLMs在英语、塞佩迪语(Sepedi)和茨瓦纳语(Setswana)中的零样本情感分析性能,覆盖就业、卫生、教育等10个南非政府重点关注的议题。实验设计。
VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models
本技术报告提出VibeThinker-3B,一款仅含30亿参数的紧凑型稠密大模型,旨在探究严格小模型体系下,可验证推理能力的性能上限。本文基于「频谱-信号」后训练范式,搭建一套优化完整训练流水线,通过课程式监督微调、多域强化学习、离线自蒸馏对模型推理能力进行系统性增强。大量实验证明,VibeThinker-3B在高难度可验证推理任务上达到行业前沿水平:在AIME26美国高中数学邀请赛取得94.3分,搭配声明级测试时缩放策略可提升至97.1;LiveCodeBenchv6代码基准一次通过率达80.2;
FastContext: Training Efficient Repository Explorer for Coding Agents
大语言模型(LLM)驱动的代码智能体在各类软件工程任务中已取得亮眼效果,但代码仓库探索环节仍是核心瓶颈:定位目标代码会消耗海量token,且大量无关代码片段会污染智能体上下文。现有绝大多数代码智能体采用单一模型同时完成仓库检索与问题求解,所有检索读取、搜索的中间过程都会残留在求解智能体的对话历史中。本文提出FastContext——一款专用探索子智能体,将仓库检索与任务求解彻底解耦。主智能体可按需调用FastContext,该子智能体并行执行多工具调用,仅输出精简的文件路径与代码行区间作为聚焦上下文。
Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models
本文聚焦大型语言模型(LLMs)的激活空间攻击风险,提出一种名为敏感度缩放导向(SSS)的白盒攻击方法。核心发现是解码器-onlyLLMs的中间激活层存在“注意力汇”(BOS令牌主导)和“压缩谷”(中层表示坍缩到低秩子空间),两者共同构成高增益区域,使微小扰动能通过自回归生成过程因果放大(因果放大效应CAE),实现行为渐变操控。SSS通过两阶段攻击实现高效操控:一是BOS锚定,在压缩谷层注入语义对齐的种子扰动;二是自适应强化,根据模型局部敏感度动态调整后续令牌的微扰强度。
LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling
循环Transformer通过重复复用共享模块扩展模型隐空间计算能力,但串行循环会随循环次数增加同步提升推理延迟与KV缓存内存占用。并行循环Transformer(PLT)通过跨循环位置偏移(CLP)和共享KV门控滑动窗口注意力缓解该开销,让循环次数成为可落地的设计参数。本文从收益-成本视角研究PLT的循环次数选择问题:额外循环虽能优化特征表征,但CLP机制会在每一处循环边界引入token位置不匹配损耗。
