Loading...

Towards Robust and Fair Next Visit Diagnosis Prediction under Noisy Clinical Notes with Large Lan...
人工智能(AI)十年间的快速发展为临床决策支持系统(CDSS)带来了新机遇,大型语言模型(LLMs)在时效性医疗任务中展现出强大的推理能力。然而,临床文本常因人为错误或自动处理流程缺陷而质量下降,引发了对AI辅助决策可靠性和公平性的担忧。尽管如此,此类质量退化的影响尚未得到充分研究,尤其是噪声导致的分布偏移如何加剧预测不确定性并对不同人口统计学亚组产生不均衡影响。本文针对多种文本损坏场景,对最先进的LLMs开展系统性研究,重点关注下次就诊诊断预测任务中的鲁棒性和公平性。

A Systematic Study of Compression Ordering for Large Language Models
大型语言模型(LLMs)需要大量计算资源,因此模型压缩对于在资源受限环境中高效部署至关重要。在主流压缩技术(知识蒸馏、结构化剪枝和低比特量化)中,它们的单独效果已得到充分研究,但它们之间的相互作用及最优组合顺序仍不明确。本研究系统探究了这些技术在Qwen2.5-3B模型上的独立应用效果与组合应用效果。我们以困惑度、G-Eval得分、清晰度、指令对齐度和压缩比为指标,评估了包括单技术基线在内的多种压缩流水线,并提出了三种技术组合的序列方案。

Efficient Robot Design with Multi-Objective Black-Box Optimization and Large Language Models
迄今为止,已开发出多种机器人设计优化方法,这些方法形式多样,涵盖数值优化到黑盒优化等类别。数值优化虽速度较快,但不适用于涉及复杂结构或离散值的场景,因此黑盒优化被广泛采用。然而,黑盒优化存在采样效率低的问题,需要大量采样迭代才能获得优质解。本研究提出一种利用大型语言模型(LLMs)提升基于黑盒优化的机器人本体设计效率的方法。在黑盒优化采样过程的同时,为LLM提供问题设定和丰富反馈并进行采样。我们通过实验验证该方法能更高效地探索设计方案,并对其特性与局限性进行了探讨。

Learning to Compress: Unlocking the Potential of Large Language Models for Text Representation
文本表示在聚类、检索及其他下游应用中发挥着关键作用。随着大型语言模型(LLMs)的兴起,利用其能力实现文本表示的关注度日益提升。然而,大多数LLMs本质上是因果模型,且针对下一个token预测进行优化,这使其在生成整体连贯的表示时并非最优。为解决这一问题,近期研究引入了pretext任务以适配LLMs用于文本表示。但这些任务大多依赖token级预测目标,例如LLM2Vec中使用的掩码下一个token预测(MNTP)。

R2Q: Towards Robust 2-Bit Large Language Models via Residual Refinement Quantization
大语言模型(LLMs)的快速发展带来了巨大的计算和内存需求,推动了低比特量化技术的应用。尽管8位和4位格式已得到广泛普及,但由于精度严重下降,将量化精度扩展到2位仍面临巨大挑战。为解决这一问题,我们提出了残差细化量化(ResidualRefinementQuantization,R2Q)——一种新型2位量化框架,该框架将量化过程分解为两个连续的1位子量化步骤,形成自适应量化网格。

PoETa v2: Toward More Robust Evaluation of Large Language Models in Portuguese
大型语言模型(LLMs)在不同语言和文化背景下的性能存在显著差异,凸显了在多样化语言中进行系统评估的必要性。本研究提出了迄今为止规模最大的葡萄牙语LLM评估工作。借助新推出的PoETav2基准——一个包含40余项葡萄牙语任务的综合套件,我们对20余种涵盖不同训练规模和计算资源的模型进行了评估。研究揭示了计算投入和语言特异性适配对葡萄牙语性能的影响,同时分析了与英语等效任务的性能差距。通过该基准和相关分析,PoETav2为葡萄牙语建模与评估的未来研究奠定了基础。

Toward Trustworthy Difficulty Assessments: Large Language Models as Judges in Programming and Syn...
该研究聚焦于大型语言模型(LLMs)在编程任务难度评估中的可信度问题,通过对比GPT-4o与可解释的LightGBM集成模型在LeetCode题目难度分类(Easy/Medium/Hard)上的表现,揭示LLM作为难度评估器的核心缺陷,并通过合成问题生成实验进一步探究其内部难度判断逻辑。研究背景:LLMs在代码生成、辅导与评估中应用日益广泛,但在结构化的编程题目难度预测等任务中的表现尚未被充分探索。现有自动难度评估方法多依赖数值特征(如输入规模、通过率)和文本特征,且可解释性模型表现稳定。实验设计。

A Benchmark for Zero-Shot Belief Inference in Large Language Models
该研究聚焦大型语言模型(LLMs)在零样本场景下的信念推理能力,核心是构建了一个系统、可复现的基准测试框架,用于评估LLMs对人类在多样化主题上立场的预测效果。研究使用Debate.org数据集,提取了涵盖宗教、科学、体育、娱乐等23个类别的119,119条独特信念陈述,涉及5,712名用户,并设计了四种信息输入条件(无背景信息的“盲测”、仅人口统计学信息、仅已知信念、人口统计学+已知信念),对9个主流开源LLMs(如Gemma3、Llama3系列、Phi4等)进行测试。

Efficient Inference Using Large Language Models with Limited Human Data: Fine-Tuning then Rectifi...
本文聚焦于有限人类标注数据场景下,如何高效利用大语言模型(LLMs)进行推断的核心问题。传统LLM虽可作为人类受访者的替代者,降低调研成本,但存在输出偏差、对提示词敏感等缺陷;现有改进方法(微调FT、事后校正PPI)单独使用时,受限于标注数据稀缺性且存在边际效益递减问题。优化微调目标:摒弃传统最小化均方误差(MSE)的思路,提出以“最小化预测误差方差”为微调目标,适配下游PPI校正的需求(PPI对误差方差更敏感,而非偏差);样本最优分配。

Leveraging Language Models for Interpretable Analysis of Narratives in a Large Corpus
叙事驱动人类行为,是地缘政治的核心,但长期以来难以量化其重叠性与演变过程。本文提出一种可解释模型,整合成熟的词袋(BoW)主题表示与新型基于LLM的问答(Q&A)叙事模型,二者共享潜在的再生核希尔伯特空间表示,用于量化文本文档。该方法在无需LLM全量推断的前提下,缓解了使用LLM分析大规模语料时面临的成本、可解释性与泛化性挑战。我们推导了高效的函数梯度下降更新规则,这些规则具有可解释性,且在结构上与Transformer中的自注意力机制类似。

Understanding Counting Mechanisms in Large Language and Vision-Language Models
本文探讨了大型语言模型(LLMs)和大型视觉-语言模型(LVLMs)在计数任务中如何表示和计算数值信息。我们通过包含重复文本和视觉项目的受控实验,并借助因果中介分析和激活修补技术分析模型行为。为此,我们设计了一款名为CountScope的专用工具,用于数值内容的机制可解释性研究。结果表明,单个token或视觉特征会编码潜在的位置计数信息,这些信息可被提取并在不同上下文间传递。分层分析显示数值表征逐步涌现:低层编码小计数,高层表征大计数。

Large Language Models for Sentiment Analysis to Detect Social Challenges: A Use Case with South A...
该研究聚焦于利用大型语言模型(LLMs)对南非社交媒体帖子进行情感分析,以识别社会挑战。研究背景与目标:南非作为多语言国家(12种官方语言),低资源语言的情感分析工具匮乏,而社会挑战的精准识别对政府施策至关重要。研究旨在评估主流LLMs在英语、塞佩迪语(Sepedi)和茨瓦纳语(Setswana)中的零样本情感分析性能,覆盖就业、卫生、教育等10个南非政府重点关注的议题。实验设计。

VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models
本技术报告提出VibeThinker-3B,一款仅含30亿参数的紧凑型稠密大模型,旨在探究严格小模型体系下,可验证推理能力的性能上限。本文基于「频谱-信号」后训练范式,搭建一套优化完整训练流水线,通过课程式监督微调、多域强化学习、离线自蒸馏对模型推理能力进行系统性增强。大量实验证明,VibeThinker-3B在高难度可验证推理任务上达到行业前沿水平:在AIME26美国高中数学邀请赛取得94.3分,搭配声明级测试时缩放策略可提升至97.1;LiveCodeBenchv6代码基准一次通过率达80.2;

FastContext: Training Efficient Repository Explorer for Coding Agents
大语言模型(LLM)驱动的代码智能体在各类软件工程任务中已取得亮眼效果,但代码仓库探索环节仍是核心瓶颈:定位目标代码会消耗海量token,且大量无关代码片段会污染智能体上下文。现有绝大多数代码智能体采用单一模型同时完成仓库检索与问题求解,所有检索读取、搜索的中间过程都会残留在求解智能体的对话历史中。本文提出FastContext——一款专用探索子智能体,将仓库检索与任务求解彻底解耦。主智能体可按需调用FastContext,该子智能体并行执行多工具调用,仅输出精简的文件路径与代码行区间作为聚焦上下文。

Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models
本文聚焦大型语言模型(LLMs)的激活空间攻击风险,提出一种名为敏感度缩放导向(SSS)的白盒攻击方法。核心发现是解码器-onlyLLMs的中间激活层存在“注意力汇”(BOS令牌主导)和“压缩谷”(中层表示坍缩到低秩子空间),两者共同构成高增益区域,使微小扰动能通过自回归生成过程因果放大(因果放大效应CAE),实现行为渐变操控。SSS通过两阶段攻击实现高效操控:一是BOS锚定,在压缩谷层注入语义对齐的种子扰动;二是自适应强化,根据模型局部敏感度动态调整后续令牌的微扰强度。

LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling
循环Transformer通过重复复用共享模块扩展模型隐空间计算能力,但串行循环会随循环次数增加同步提升推理延迟与KV缓存内存占用。并行循环Transformer(PLT)通过跨循环位置偏移(CLP)和共享KV门控滑动窗口注意力缓解该开销,让循环次数成为可落地的设计参数。本文从收益-成本视角研究PLT的循环次数选择问题:额外循环虽能优化特征表征,但CLP机制会在每一处循环边界引入token位置不匹配损耗。

AI systems out-persuade expert humans
诸多社会重大决策最终取决于说服博弈的结果。对话式人工智能是这场博弈中一股全新的强大力量,但学界此前尚不明确:AI的说服能力能否超越受过专业训练、拥有高额激励的人类说服者。本文开展四项预先注册的对照实验,共计6923名被试、18978场对话,将大语言模型与多类人类说服者正面比拼:普通民众、四轮线上说服锦标赛优胜者、职业街头游说员、世界锦标赛辩论选手。实验结果稳定证实:即便给予人类专家自主选题、前置调研、数小时结构化实战练习、最高1000英镑现金奖励等全部有利条件,AI的说服效果仍显著更强。

TestWeaver: Execution-aware, Feedback-driven Regression Testing Generation with Large Language Mo...
回归测试确保代码变更不会意外破坏现有功能。尽管大语言模型(LLMs)在自动化回归测试生成方面显示出潜力,但它们往往在程序执行推理上存在局限,导致覆盖增长停滞——这种现象被称为“覆盖停滞”。本文提出了TestWeaver,一种新颖的基于LLM的方法,它整合了轻量级程序分析以更有效地引导测试生成。TestWeaver引入了三项关键创新:(1)通过向LLM提供目标行的反向切片(而非完整程序上下文),减少幻觉并提高聚焦性;

Pier: Efficient Large Language Model pretraining with Relaxed Global Communication
本文针对大型语言模型(LLM)预训练中全局通信(如all-reduce、all-gather)成为性能瓶颈的问题,提出了一种高效可扩展的优化框架Pier。该框架基于DiLoCo的双层优化结构(组内局部优化器+组间全局优化器),通过改进技术解决了DiLoCo存在的性能下降问题,并优化了并行架构以支持复杂训练场景。问题背景:LLM预训练依赖大规模分布式GPU集群,传统优化器(如AdamW)的全局通信导致扩展效率低下(如32A100GPU上GPT-21.5B训练扩展效率仅42.7%);

LLM4AMC: Adapting Large Language Models for Adaptive Modulation and Coding
本文聚焦5G新空口(NR)中的自适应调制编码(AMC)技术,针对传统AMC方案中因信道质量指示符(CQI)时效性衰减(反馈延迟导致)引发的链路性能下降问题,提出了一种基于大语言模型(LLM)的信道质量预测与AMC优化方法——LLM4AMC。研究背景:AMC作为链路自适应的核心技术,通过根据信道条件(基于信号与干扰加噪声比SINR推导的CQI)动态选择调制编码方案(MCS),平衡传输效率与可靠性。

欢迎留下您的脚印