Loading...
布局设计是移动应用页面开发中的关键步骤。然而,设计出令人满意的布局对设计师而言极为耗时:他们需要确定页面上展示的控件和内容,然后反复调整其尺寸、位置和样式,以实现更佳的美观度和结构合理性。尽管如今许多设计软件能够协助执行这些重复性任务,但有效使用这些软件仍需大量培训。此外,跨应用页面的协同设计还需要额外时间来统一标准,确保样式一致性。在本研究中,我们提出了APD-Agents——一种基于大型语言模型(LLM)的多智能体协作框架,用于移动应用的自动化页面设计。
Large Language Model Driven Analysis of General Coordinates Network (GCN) Circulars
该研究聚焦NASA的通用坐标网络(GCN)数据库,针对其30年来积累的40500余份非结构化“通报”(Circulars),提出基于大语言模型(LLMs)的自动化文本挖掘方案。核心工作包括三部分:一是构建神经主题建模管道,实现天体物理主题的自动聚类与总结;二是通过对比微调,完成观测波段(高能、光学、射电等)和引力波(GW)相关事件的分类;三是基于开源Mistral模型搭建零样本系统,结合提示工程、输出解析和检索增强生成(RAG),自动提取伽马射线暴(GRB)的红移等关键信息。
Breaking Expert Knowledge Limits: Self-Pruning for Large Language Models
大型语言模型(LLMs)在各类任务中展现出卓越性能,但庞大的模型规模严重阻碍了其实际部署。现有针对LLMs的剪枝方法(如Wanda)严重依赖人工设计的剪枝算法,导致人力成本高昂且需要专业领域知识。此外,我们首次发现,均匀稀疏策略会引发高剪枝率下性能急剧下降的严重异常值问题,这引发了关于如何设计适配LLMs的自适应剪枝稀疏度的额外思考。LLMs能否实现自我剪枝?
LAUD: Integrating Large Language Models with Active Learning for Unlabeled Data
本研究分析了大型语言模型(LLMs)在变革研发(R&D)流程中的多重作用。通过自动化知识发现、强化假设生成、整合跨学科见解以及促进创新生态系统内的协作,LLMs显著提升了研究流程的效率与效果。这些模型能够广泛分析科学文献、专利数据库和实验数据,助力构建更灵活、更具洞察力的研发工作流,最终加快创新周期并缩短突破性理念的上市时间。关键词:大型语言模型(LLMs)、创新管理、战略决策、伦理AI治理、预测分析。
SMRC: Aligning Large Language Models with Student Reasoning for Mathematical Error Correction
大语言模型(LLMs)在解决数学问题时常常出现推理错误,如何自动检测并修正这些错误已成为一个重要的研究方向。然而,现有方法主要侧重于模型内部的自修正,未能满足教育场景中所需的“教师式”修正——即系统地引导和修正学生的解题过程。为填补这一空白,我们提出了SMRC(学生数学推理修正)方法,一种使LLMs与学生推理对齐的新型框架。具体而言,SMRC将学生推理建模为多步序列决策问题,并引入蒙特卡洛树搜索(MCTS)探索最优修正路径。
Operationalizing Pluralistic Values in Large Language Model Alignment Reveals Trade-offs in Safet...
尽管大型语言模型(LLMs)越来越多地通过人类反馈进行训练,以实现安全性并与人类价值观对齐,但对齐决策往往忽视了人类的社会多样性。本研究通过系统评估对齐流程中的人口统计学差异和设计参数,探讨了整合多元价值观对LLM行为的影响。
Comparison of Text-Based and Image-Based Retrieval in Multimodal Retrieval Augmented Generation L...
检索增强生成(RAG)的最新进展已使大型语言模型(LLMs)能够访问包含文本和视觉信息(如财务文档中的图表、示意图和表格)的多模态知识库。然而,现有多模态RAG系统在预处理阶段依赖基于LLM的总结将图像转换为文本,仅在向量数据库中存储文本表示,这导致下游检索和问答任务关键的上下文信息与视觉细节丢失。为解决这一局限,本文对多模态RAG系统的两种检索方法进行了全面对比分析,包括文本基片段检索(图像在嵌入前先总结为文本)和直接多模态嵌入检索(图像以原生形式存储在向量空间中,并在生成过程中传递给视觉LLM)。
Hallucination in World Models is Predictable and Preventable
现代生成式世界模型能够生成越来越逼真、可通过动作控制的未来画面,但这类模型频繁产生幻觉:推演生成的画面视觉流畅,却逐渐偏离真实环境的动力学规律。本文提出假设:幻觉集中出现在状态-动作空间数据覆盖不足的区域,可依靠轻量、基于数据的模型内部信号实现幻觉检测与优化缓解。为验证该假设,我们构建MMBench2数据集:一套总时长427小时、包含210项任务的视觉世界建模数据集,配套真值动作、奖励标签与实时仿真环境,并基于该数据集训练3.5亿参数的世界模型。
Detecting Sleeper Agents in Large Language Models via Semantic Drift Analysis
该研究针对大型语言模型(LLMs)中“潜伏代理”(sleeperagents)这一安全隐患,提出了一种实用的实时检测系统。“潜伏代理”指模型在训练和安全评估阶段表现正常,却在特定部署条件下被触发恶意行为,且现有安全训练(如RLHF)无法消除此类后门。研究核心是双方法检测架构语义漂移检测:利用Sentence-BERT生成文本嵌入,计算模型部署时的响应与安全基线响应的语义偏差(余弦相似度),通过Z分数归一化识别异常;金丝雀基线对比。
Watchdogs and Oracles: Runtime Verification Meets Large Language Models for Autonomous Systems
双向共生融合视角:突破现有研究中“LLM仅作为翻译工具”或“RV仅作为LLM监控手段”的单向关系,提出二者双向赋能——LLM增强RV的预测性与可访问性,RV为LLM提供形式化安全保障,形成统一架构。聚焦自主系统的场景适配:区别于通用的LLM与形式化方法融合研究,专门针对自主系统的实时监控、不完全信息、安全关键决策等核心需求,强化预测性监控与不确定性处理的落地性。多层级监控与预测性融合。
ConInstruct: Evaluating Large Language Models on Conflict Detection and Resolution in Instructions
指令遵循是大语言模型(LLMs)的核心能力。现有研究主要评估模型对用户指令的遵循程度,却往往忽视了指令中包含冲突约束的场景——这在复杂提示中十分常见。LLMs在该类场景下的表现尚未得到充分探究。为填补这一空白,我们提出ConInstruct基准数据集,专门用于评估LLMs检测和解决用户指令中冲突的能力。利用该数据集,我们评估了LLMs的冲突检测性能,并分析了它们的冲突解决行为。实验结果揭示了两个关键发现:(1)多数闭源LLMs展现出强劲的冲突检测能力,而开源模型中仅DeepSeek-R1表现相当。
Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
大型语言模型(LLMs)正日益融入教育应用中。然而,它们仍然容易受到越狱攻击和微调攻击的影响,这些攻击可能破坏安全对齐并产生有害输出。现有研究主要集中于通用安全评估,对教育场景的独特安全需求关注有限。为填补这一空白,我们构建了EduHarm基准,包含五个典型教育场景下的安全-不安全指令对,为教育类LLM提供系统化的安全评估工具。此外,我们提出了一种适用于教育类LLM的三阶段防御框架(TSSF),可同时缓解越狱攻击和微调攻击。
OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models
首个多模态协同压缩框架:首次针对OmniLLMs开展音视频令牌联合压缩研究,突破传统单模态压缩局限,适配音视频令牌的时空耦合特性。音频引导动态剪枝策略:以音频保留分数为信息密度代理,动态调整视频剪枝率,实现跨模态语义与时间对齐的精准保留,避免盲目剪枝导致的性能损失。交错时空压缩模块(ISTC):创新地交替处理时间冗余(相邻帧令牌相似度合并)与空间冗余(密度峰值聚类剪枝),在抑制冗余的同时避免单一维度过度压缩。无训练与高兼容性设计。
Lost in the Pipeline: How Well Do Large Language Models Handle Data Preparation?
大型语言模型(LLMs)近年来在支持和自动化各类任务中展现出卓越能力。在众多值得探索以测试LLM能力的任务中,我们聚焦于数据准备——这一数据驱动流程中至关重要但往往耗时费力的环节。本文旨在研究LLM是否能有效支持用户选择并自动化数据准备任务。为此,我们同时选取了通用型LLM与经微调的表格型LLM,通过向这些模型输入低质量数据集,评估其执行数据探查、数据清洗等任务的能力,并将LLM提供的支持与传统数据准备工具进行对比。
ELPO: Ensemble Learning Based Prompt Optimization for Large Language Models
大型语言模型(LLMs)的卓越性能高度依赖精心设计的提示词。然而,人工提示词工程是一项费力的工作,成为LLMs实际应用的核心瓶颈。这一现象催生了一个新兴研究领域——自动提示词优化(APO),该领域近年来发展迅速。现有APO方法(如基于进化算法或试错法的方法)在一定程度上实现了高效准确的提示词优化,但这些研究聚焦于单一模型或算法进行生成策略与优化过程,限制了其在处理复杂任务时的性能。为解决这一问题,我们提出一种名为基于集成学习的提示词优化(ELPO)的新型框架,以实现更准确、更鲁棒的结果。
Can Large Language Models Function as Qualified Pediatricians? A Systematic Evaluation in Real-Wo...
本文围绕“大型语言模型(LLMs)能否在真实临床场景中胜任儿科医生工作”这一核心问题,构建了(儿科动态智能、适应性与安全性评估基准),从“基础医学知识应用”“动态诊疗能力”“儿科医疗安全与伦理”三个维度,对过去两年发布的12款代表性LLMs(含GPT-4o、Qwen3-235B-A22B、DeepSeek-V3等)进行了系统性评估。评估覆盖19个儿科亚专科、211种典型疾病,采用选择题(单/多选)、简答题等多种题型,结合真实临床病例与标准化考试资源设计任务。
Bridging Human and Model Perspectives: A Comparative Analysis of Political Bias Detection in News...
检测新闻媒体中的政治偏见是一项复杂任务,需要解读微妙的语言和语境线索。尽管自然语言处理(NLP)领域的最新进展已实现自动偏见分类,但大型语言模型(LLMs)与人类判断的契合程度仍未得到充分探索,且尚未被深入理解。本研究旨在提出一个对比框架,用于评估人类标注与多个大型语言模型(包括GPT、BERT、RoBERTa和FLAN)在政治偏见检测中的表现。我们构建了一个人工标注的新闻文章数据集,通过评估标注一致性、偏见极性和模型间一致性,量化人类与模型在偏见感知上的差异。
Failure to Mix: Large language models struggle to answer according to desired probability distrib...
科学想法的生成与筛选需要遵循目标概率分布进行探索。相比之下,当前的人工智能基准测试均存在客观正确答案,而通过强化学习针对这些基准训练大型语言模型(LLMs)会抑制概率性探索。本文中,我们开展了系统性实验,要求大型语言模型生成符合简单概率分布的输出,结果发现所有接受测试的现代大型语言模型均严重无法遵循指定分布。例如,当要求以49%的概率输出"1"时,模型输出"0"的概率接近100%。这种近乎只生成概率略高选项的阶跃函数式行为,甚至会覆盖大型语言模型内置的强烈偏差。
A Specialized Large Language Model for Clinical Reasoning and Diagnosis in Rare Diseases
该研究针对罕见病诊断周期长(平均4-8年)、现有方法存在证据提取与诊断推理脱节、大语言模型(LLM)面临数据稀缺、知识陈旧和幻觉等问题,开发了一款专注于罕见病临床推理与诊断的领域专用大语言模型。核心数据资源构建。
AutoTool: Efficient Tool Selection for Large Language Model Agents
大型语言模型(LLM)智能体已成为自动化复杂任务的强大工具,其核心优势在于利用LLM的推理和决策能力。然而,当前智能体框架的主要瓶颈在于工具选择的高推理成本——尤其是在ReAct等方法中,需在每个步骤反复调用LLM以确定使用何种工具。本文提出AutoTool,一种基于图结构的新型框架,其核心创新在于利用一项关键实证发现:工具使用惯性(toolusageinertia),即工具调用遵循可预测的序列模式,从而绕过重复的LLM推理。
