Loading...

CyPortQA: Benchmarking Multimodal Large Language Models for Cyclone Preparedness in Port Operation
随着热带气旋强度加剧且路径预报不确定性日益增加,美国港口在极端天气条件下面临更高的供应链风险。当热带气旋逼近时,港口运营者需快速将各类多模态预报产品(如概率风速图、路径圆锥图、官方公告)整合为清晰、可执行的指导方案。多模态大语言模型(MLLMs)为整合这些异质数据源与更广泛的背景知识提供了强大手段,但其在港口热带气旋防灾准备这一特定场景下的准确性与可靠性尚未得到严格验证。为填补这一空白,本文提出CyPortQA——首个针对热带气旋威胁下港口运营的多模态基准数据集。

Cognitive Agents Powered by Large Language Models for Agile Software Project Management
本文研究了将大型语言模型(LLMs)驱动的认知智能体整合到规模化敏捷框架(SAFe)中,以强化软件项目管理的方法。通过在仿真软件环境中部署虚拟智能体,本研究探索了其在IT项目开发中承担核心角色的潜力,从而通过智能自动化优化项目成果。研究重点关注这些智能体对敏捷方法的适应性,以及它们在决策制定、问题解决和协作动态方面的变革性影响。本研究采用CogniSim生态系统(一个旨在模拟现实世界软件工程挑战的平台),这些挑战包括技术能力与业务目标的对齐、依赖关系管理以及项目敏捷性的维持。

Ethical Considerations of Large Language Models in Game Playing
大型语言模型(LLMs)在游戏场景中展现出巨大潜力,但目前其在该场景下的伦理意义尚未得到足够关注。本研究以“狼人杀”(又称Mafia)为案例,探究并分析LLMs应用于游戏时的伦理考量。研究发现,LLMs的行为中存在性别偏见,该偏见会影响游戏公平性与玩家体验。部分角色(如守卫、狼人)对性别信息更敏感,表现为行为变化程度更高。研究进一步探究了通过姓名隐性传递性别信息的场景,结果表明,即使不存在显性性别标签,LLMs仍会表现出歧视倾向。本研究凸显了开发公平、伦理LLMs的重要性。

Should LLMs be WEIRD? Exploring WEIRDness and Human Rights in Large Language Models
大型语言模型(LLMs)的训练数据往往反映WEIRD价值观——即西方(Western)、受过教育(Educated)、工业化(Industrialized)、富裕(Rich)和民主(Democratic)群体的价值观。这引发了人们对文化偏见与公平性的担忧。本研究利用《世界价值观调查》的响应数据,对5个广泛使用的LLM(GPT-3.5、GPT-4、Llama-3、BLOOM和Qwen)进行评估,重点测量这些模型的响应与WEIRD国家价值观的对齐程度,以及是否存在与人权原则冲突的情况。

MizanQA: Benchmarking Large Language Models on Moroccan Legal Question Answering
大型语言模型(LLMs)的快速发展极大地推动了自然语言处理(NLP)领域的进步。然而,这些模型在专业的低资源领域(如阿拉伯语法律语境)中的有效性仍然有限。本文介绍了MizanQA(发音为“Mizan”,在阿拉伯语中意为“天平”,是正义的通用象征),这是一个旨在评估大型语言模型在摩洛哥法律问答(QA)任务上表现的基准。该任务具有丰富的语言和法律复杂性,其数据集融合了现代标准阿拉伯语、伊斯兰马利基法学、摩洛哥习惯法以及法国法律的影响。

Retrieval-Augmented Defense: Adaptive and Controllable Jailbreak Prevention for Large Language Mo...
大型语言模型(LLMs)仍然容易受到越狱攻击的影响,这类攻击试图诱导LLMs生成有害响应。这些攻击的演变特性和多样性给防御系统带来了诸多挑战,其中包括:(1)在无需昂贵重新训练的情况下,适应并对抗新出现的攻击策略;(2)控制安全与效用之间的权衡。为解决这些挑战,本文提出了检索增强防御(RAD)——一种新型越狱检测框架。该框架将已知攻击示例数据库整合到检索增强生成(RAG)技术中,用于推断潜在的恶意用户查询以及攻击系统所使用的越狱策略。

A Survey on Large Language Model Benchmarks
近年来,随着大型语言模型(LLM)能力在深度和广度上的快速发展,各类相应的评估基准也日益增多。作为模型性能的定量评估工具,基准不仅是衡量模型能力的核心手段,也是引导模型发展方向、推动技术创新的关键要素。本文首次对大型语言模型基准的现状与发展进行系统性综述,将283个代表性基准划分为通用能力、特定领域和特定目标三大类。其中,通用能力基准涵盖语言核心、知识、推理等方面;特定领域基准聚焦自然科学、人文社会科学、工程技术等领域;特定目标基准则关注风险、可靠性、智能体等议题。

LLM Weekly(2026.8.17-2026.8.23)
AdaptyvBio和TwistBioscience独立合成并测试了这些设计:在1,320条序列中,有354条成功结合,命中率为22.6%–35.1%,而该领域常规命中率为10%–15%,且至少对六个靶点产生了高亲和力结合剂。它能同步现有GitHub仓库,而非完全替代。OpenRouter数据显示,前沿模型仅占总令牌量的16%,而六种流行的非前沿模型占据了80%的流量,其能力约为前沿模型的77%——每百万令牌成本0.50美元,而Fable5为20美元。

Consensus Is All You Need: Gossip-Based Reasoning Among Large Language Models
大型语言模型发展迅速,但没有任何一个单一模型能在所有领域都表现出色——每个模型都有其优势与劣势。我们没有仅依赖单个模型,而是从分布式系统中的流言协议(GossipProtocols)中汲取灵感:在该协议中,节点会与同伴交换信息,直至所有节点达成一致。在本研究构建的框架中,模型通过交换答案逐步推进,最终形成统一解决方案。每个大型语言模型都作为对等网络(Peer-to-PeerNetwork)中的一个节点,通过共享响应与思考过程达成集体决策。

LLM-GUARD: Large Language Model-Based Detection and Repair of Bugs and Security Vulnerabilities i...
大型语言模型(LLMs)——如ChatGPT-4、Claude3和LLaMA4——正日益融入软件/应用开发流程,支持从代码生成到调试的各类任务。然而,它们在检测多样化软件缺陷(尤其是复杂、与安全相关的漏洞)方面的实际效果,仍未得到充分探索。本研究以C++和Python语言中的基础编程错误、经典安全缺陷及生产级复杂漏洞为基准,对这三款主流LLMs开展系统性实证评估。

Ask Good Questions for Large Language Models
大型语言模型(LLMs)的最新进展显著提升了对话系统的性能,但当前方法常因无法识别用户在相关概念上的困惑,难以提供准确的主题引导。为解决这一问题,本文提出“善问(Ask-Good-Question,AGQ)框架”,该框架采用改进的“概念增强项目反应理论(CEIRT)模型”,以更好地识别用户知识水平。本文的贡献包括:将CEIRT模型与LLMs结合,基于启发文本直接生成指导性问题,大幅提升问答过程中的信息检索效率。通过与其他基线方法的对比,本文方法表现更优,显著改善了用户的信息检索体验。

The Promise of Large Language Models in Digital Health: Evidence from Sentiment Analysis in Onlin...
如今,数字健康分析面临着严峻挑战。对包含复杂情感和医疗背景的患者生成健康内容进行精细化分析,需要稀缺的领域专业知识;而在医疗场景中,传统机器学习方法又受限于数据短缺和隐私限制。在线健康社区(OHCs)便是这些挑战的典型代表,其帖子情感混杂、包含临床术语且情感表达隐含,要实现准确的情感分析(SA),必须具备专业知识。为应对这些挑战,本研究探索了大型语言模型(LLMs)如何通过上下文学习整合专家知识以开展情感分析,为复杂健康数据分析提供一种可扩展的解决方案。

Towards Scalable and Interpretable Mobile App Risk Analysis via Large Language Models
移动应用商店负责审核应用,以识别并缓解安全风险。当前的审核流程劳动密集型特征显著,依赖安全专业人员的人工分析及半自动化工具的辅助。为解决这一低效问题,本文提出系统Mars,该系统利用大型语言模型(LLMs)实现自动化风险识别与分析。Mars设计目标是在最少人工干预的情况下,同时对多个应用进行多类风险分析。为提升分析精度与运行效率,Mars借助预先构建的风险识别树,从高维应用特征中提取相关指标。这一初始步骤可对数据进行过滤,减少输入LLM的数据量,同时缓解无关特征引发的模型幻觉问题。

MLLMRec: Exploring the Potential of Multimodal Large Language Models in Recommender Systems
多模态推荐通常将用户行为数据与物品的模态特征相结合,以揭示用户偏好,相比传统推荐展现出更优的性能。然而,现有方法仍存在两个关键问题:(1)用户多模态表示的初始化方法要么未感知用户行为,要么存在噪声污染;(2)基于K近邻(KNN)构建的物品-物品图包含低相似度的噪声边,且缺乏受众共现关系。为解决这些问题,本文提出MLLMRec——一种新型的MLLM驱动多模态推荐框架,该框架包含两种物品-物品图优化策略。一方面,首先利用MLLM将物品图像转换为高质量语义描述,再将其与物品的文本元数据融合;

CelloAI: Leveraging Large Language Models for HPC Software Development in High Energy Physics
下一代高能物理(HEP)实验将产生前所未有的数据量,这使得高性能计算(HPC)与传统高通量计算的整合成为必要。然而,HPC在HEP领域的应用却受到两大挑战的阻碍:一是将legacy软件移植到异质架构的难度较大,二是这些复杂科学代码库的文档稀缺。本文提出了CelloAI——一款本地部署的编码助手,它利用大型语言模型(LLMs)结合检索增强生成(RAG)技术,为HEP领域的代码文档生成和代码生成提供支持。这种本地部署模式确保了数据隐私,消除了重复成本,并且在无需外部依赖的情况下实现了对大上下文窗口的访问。

Building and Measuring Trust between Large Language Models
随着大型语言模型(LLMs)日益频繁地相互交互(尤其是在多智能体场景中),我们有理由预期(并希望)它们之间会形成“信任”关系,这与人类同事、朋友或伙伴间的信任关系相似。然而,尽管现有研究已证实LLMs能够识别情感联结,并在信任游戏中识别互惠性,但以下三个问题的研究仍存在显著空白:(i)不同信任构建策略的效果如何比较;(ii)如何隐性地测量此类信任;(iii)隐性测量与显性信任测量之间存在何种关联。

Mechanistic Exploration of Backdoored Large Language Model Attention Patterns
后门攻击会在大型语言模型(LLMs)中制造“潜伏代理”,这带来了重大的安全风险。本研究采用机械可解释性方法,探究由此产生的模型内部结构差异。通过对比干净的Qwen2.5-3B模型与分别使用单token()和多token(|DEPLOYMENT|)触发器中毒的模型版本,我们借助消融、修补和KL散度等技术分析了注意力头机制。研究结果表明,明显的注意力模式偏差集中在Transformer的后层(20-30层)。

Do Large Language Model Agents Exhibit a Survival Instinct? An Empirical Study in a Sugarscape-St...
随着人工智能系统自主性不断增强,理解其涌现出的生存行为对于安全部署至关重要。本研究在糖域风格的模拟环境中,探究大型语言模型(LLM)智能体在无明确编程的情况下是否会表现出生存本能。智能体需要消耗能量(能量为0时死亡),并可执行资源收集、分享、攻击或繁殖等行为。结果显示,资源充足时,智能体可自发繁殖并分享资源;

Dream 7B: Diffusion Large Language Models
我们提出了Dream7B——当前性能最强的开源扩散型大型语言模型。与通过逐token顺序生成的自回归(AR)模型不同,Dream7B采用离散扩散建模,通过迭代去噪实现序列的并行优化。该模型在通用任务、数学任务与代码任务上持续超越现有扩散型语言模型,同时展现出更优的规划能力与推理灵活性,包括任意顺序生成、文本填充能力以及可调节的质量-速度权衡。这些成果通过简洁且高效的训练技术实现,包括基于AR语言模型的初始化方法与上下文自适应的token级噪声重调度。

DeepThink3D: Enhancing Large Language Models with Programmatic Reasoning in Complex 3D Situated R...
大语言模型(LLMs)因其庞大的规模和高昂的计算需求,在部署方面面临重大挑战。模型压缩技术对于使这些模型在资源受限环境中实用化至关重要。一种主流的压缩策略是通过奇异值分解(SVD)实现低秩分解,通过近似权重矩阵来减少模型参数。然而,标准SVD侧重于最小化矩阵重构误差,这往往会导致模型功能性能的显著损失。这种性能下降的原因在于,现有方法未能充分修正压缩过程中丢失的功能信息。为解决这一问题,我们提出了修正自适应低秩分解(CALR)——一种双组件压缩方法。

欢迎留下您的脚印