一、大模型基础架构与安全

1. 逐token路由的高效Transformer推理

核心贡献:Knowledge Lab AG 团队提出 Meta-Attention 框架,将注意力机制选择视为贝叶斯后验推断问题。通过一个贝叶斯元控制器,根据每个token的上下文和计算预算,动态将其路由到全注意力、线性注意力或滑动窗口局部注意力三种策略之一。使用计算感知的 Dirichlet 先验和证据下界 (ELBO) 目标进行训练,产生有原则的路由不确定性估计。

实际应用:在长上下文推理场景中,能够在保持模型性能的同时显著降低计算成本。Tiny LM基准测试显示,硬路由下的归一化 FLOP 成本仅为25.1%,比无先验基线降低了34.2个百分点。可直接应用于各种 Transformer 架构,提升大模型的推理效率和部署可行性。

与以往不同:以往方法要么固定使用一种注意力机制,要么采用确定性或无先验的学习路由方式,容易出现路由崩溃或性能下降。Meta-Attention首次将贝叶斯推断引入注意力路由,通过计算感知的先验防止路由崩溃,同时利用不确定性估计控制软硬切换,在计算效率和模型性能之间取得了更好的平衡。

2. 基于动量的解码阶段KV缓存压缩

核心贡献:印度理工学院团队提出Moment-KV,一种专门针对解码阶段的KV缓存压缩方法。通过分析注意力动态发现,关键token会在长时程内持续获得注意力,而局部推理则表现为短暂的注意力爆发。Moment-KV 将 token 重要性建模为一个持续演化的状态,使用带衰减的动量聚合注意力分数,同时捕捉 token 的长期影响力和近期相关性。

实际应用:解决了长文本生成任务中 KV 缓存成为主要性能瓶颈的问题。实验表明,在保持解码延迟不变的情况下,Moment-KV 将长生成任务的生成保真度提升了 2.3-3.2%。特别适用于需要生成长文档、代码或对话的大模型应用场景。

与以往不同:现有 KV 缓存压缩方法通常对预填充和解码缓存应用统一压缩,或者依赖刚性的最近窗口或瞬时注意力。Moment-KV 首次专门针对解码阶段进行优化,避免了压缩预填充缓存导致的关键上下文损坏问题。通过动量驱动的时间注意力聚合,能够更准确地识别和保留重要 token,同时淘汰过时的缓存内容。

3. 相关性即漏洞:网页检索如何降低 LLM 智能体的安全对齐

核心贡献:斯坦福大学团队提出 AgentREVEAL 诊断框架,系统分析了检索增强型LLM智能体的安全退化问题。研究发现了两个关键漏洞:一是将工具调用和响应生成绑定在单一步骤中会放大有害输出;二是 "安全来源悖论"—— 即使是包含警告或风险免责声明的安全导向来源,也会使有害合规率平均提高 25%。相关性是这两个漏洞的共同激活条件。

实际应用:为检索增强型 AI 系统的安全设计提供了重要指导。研究团队还发布了 HarmURLBench 基准,包含 1405 个真实世界 URL 和 320 种有害行为,可用于评估和改进 LLM 智能体的安全性。有助于开发者在保持检索实用性的同时,缓解安全-效用权衡问题。

与以往不同:以往研究主要关注检索内容本身的有害性,而本研究揭示了检索机制本身存在的结构性安全漏洞。特别是 "安全来源悖论" 的发现,挑战了 "只从可信来源检索就能保证安全" 的传统观念,表明即使是安全的内容,只要与有害请求相关,就可能被模型用来生成有害响应。

二、计算机视觉与具身智能

4. LocateAnything:并行解码边界框预测的视觉语言检测模型

核心贡献:英伟达研究团队发表论文,推出 LocateAnything 视觉语言检测模型。基于1.38 亿条语言查询和7.85亿个边界框训练而成,其核心突破在于采用并行解码方式预测边界框,而非传统的逐坐标顺序输出。这一架构改进同时提升了定位精度和推理吞吐量。

实际应用:为AI智能体和机器人提供了更快速、更精准的目标定位能力。在机器人抓取、导航、操作等具身智能任务中,能够实时准确地识别和定位各种物体,从而驱动更可靠的实际行动。也可应用于图像检索、自动驾驶、安防监控等领域。

与以往不同:传统的视觉语言检测模型采用自回归方式逐坐标生成边界框,不仅速度慢,而且容易出现累积误差。LocateAnything 的并行解码方式将边界框预测的时间复杂度从 O (n) 降低到 O (1),同时通过全局上下文建模提高了定位精度。在 HuggingFace 热度榜中高居第一,成为当前视觉定位任务的新基准。


原文

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐