WorldAttention:面向交互式视频世界模型的高效注意力架构
研究者提出 WorldAttention,一种通过专用注意力内核与分层 KV cache 协同设计实现高效推理的注意力架构,用于文本条件交互式视频世界模型。其 Hybrid Sparse Attention 结合线性全局注意力与头自适应稀疏注意力,Hierarchical KV Cache 将历史 KV 对按语义索引分页存放于多级内存。
研究者提出 WorldAttention,一种通过专用注意力内核与分层 KV cache 协同设计实现高效推理的注意力架构,用于文本条件交互式视频世界模型。其 Hybrid Sparse Attention 结合线性全局注意力与头自适应稀疏注意力,Hierarchical KV Cache 将历史 KV 对按语义索引分页存放于多级内存。
研究者提出自主智能体模型 Marathoner,通过后训练流程赋予基座模型超长时程执行能力,在 5 个超长时程任务基准上稳定超越基座模型,甚至超过强闭源模型。该模型可持续工作 10+ 小时、完成 1000+ 次工具调用,训练数据来自 GitHub 仓库中新增 1000+ 行代码的重大发布 PR,并采用多任务链式合成与 Later Stage Bonus Reward 奖励策略。
HybridCUA 提出让计算机使用智能体(CUA)同时编排 GUI 与 CLI 的混合范式,并构建了含 5K 混合轨迹与 3K 可验证 RLVR 任务的 HybridCUA-8K 数据集。
LongLive-Plug 是一个一次性蒸馏框架,将可复用能力以 LoRA 形式学习在基座模型上,实现免训练、即插即用地部署到兼容的下游模型。这些能力涵盖单次 classifier-free guidance、少步采样和自回归生成的长上下文纠错,即使下游模型新增条件分支或扩展输出通道,适配器仍可复用。
ROSS 通过选择性监督从自生成 rollout 中再学习,保留完整历史轨迹作为上下文,仅对选定的模型生成续写施加损失。在 Qwen3.6-35B-A3B 上,ROSS 将六基准 MOPD 平均分从 58.40% 提升至 62.20%,SWE-bench Verified 从 64.20% 提升至 68.40%。
EVO-WAM 让世界动作模型无需额外专家演示即可适应新任务,通过视觉语言模型筛选完成任务的前缀、用逆动力学模型验证视频-动作一致性,再迭代训练。在 RoboTwin 2.0 的 7 个未见任务上,Cosmos3 平均成功率从 26.9% 提升至 68.0%,DreamZero 从 28.5% 提升至 46.4%;真实世界 3 个长程复合任务中 Cosmos3 从 20.0% 提升至 76.7%。
研究提出智能体主动性的内容维度:水平主动性追求当前上下文已隐含但用户未明说的信息,垂直主动性追求只有早期证据才能揭示的需求。基于基准自身分解构建的“需求图”可在无模型评判的情况下对两种主动性及停止时机打分。所提 Q&D 方法在三个多跳问答基准的留出集上,同等检索开销下两种主动性均优于同模型提示版本,并在其中两个基准上超过参数量大 15 倍的提示模型。
SoL-Refiner 是一种单步视频精修器,可将低分辨率模型输出经一次去噪直接转为 4K 视频,方法结合高分辨率持续训练、RL 后训练与最终一步蒸馏。在约 2K 分辨率下,其单步效果在 VBench 与 UniPercept 均值上超过所有外部精修器,在 3840×2176 下两项指标均优于三步的 LTX-2.3 Refiner。
APM-Bench 将真实流式交互重构为多会话生活轨迹,包含 549 个会话、104 条轨迹和 2,719 个候选问题,覆盖客观题与开放题。评测显示现有方法难以同时兼顾可靠的长期召回、低开销与有效的主动协助,存在明显的效用—延迟—存储权衡。该基准还测试模型能否识别证据不足的情况。
研究者提出 AnisoWM 与 ΛReg,用可学习的对角协方差替换固定各向同性高斯目标,并施加固定迹与各向异性约束,预测目标、预测器架构和欧氏规划器均不变,目标仅在训练时使用。在四个视觉控制环境中,AnisoWM 的规划成功率全部优于 LeWorldModel,其潜在规划代价与任务结果也更一致。
研究团队提出 VoxPolyMem,一个面向多方语音对话的交互感知多模态记忆框架,结合增量说话人识别与交互记忆、事实记忆、参与者画像三层记忆结构,并将检索建模为智能体顺序决策。
Cloudflare 发布全新 CLI 工具 cf(开放 beta,npm i -g cf),将命令覆盖从 Wrangler 的约 280 个操作扩展到超过 3000 个 API 操作,基于 Forge 从 OpenAPI schema 生成。
针对 GRPO 等 RLVR 方法在 rollout 预算有限时出现全失败组、无梯度信号的问题,研究者提出 GRAFT,用同伴模型的轨迹替换全失败组,并通过序列级兼容性加权和 token 级重要性比裁剪控制跨模型失配。
Cloudflare 发布 Application Profiles,通过分析 HTTP 请求的结构与格式、识别偏离来实施正向安全策略,从而大幅缩小攻击面。
美团 LongCat 团队发布 LongCat-DeepResearch 深度研究系统,将增强版 LongCat 模型与多智能体工作流结合,通过规划与调查分离、分节并行撰写与全局审阅来生成有证据支撑的报告。
Cloudflare 发布 Threat Signals,面向所有账户免费开放,用智能体技能把用户选择的开源安全报告自动摘要、打标签、提取和规范化 IOC,并以 Threat Event 形式存入账户私有威胁情报数据集,可直接用于 WAF 策略。
Cloudflare 用前沿 LLM 构建自适应 WAF 测试系统,在授权的客户预发环境针对 XSS、SQLi、CMDi、SSRF、LFI、Log4j 六类攻击运行 45 个场景,记录 1,107 次尝试,经人工分流确认 49 项相关发现,其中 48 项属于 CMDi 和 SSRF。
研究团队提出 OmniTaskonomy 统一分类体系,覆盖 19 项图生图(I2I)生成任务与 25 项图生文(I2T)理解能力,系统探究视觉生成监督何时以及如何提升视觉理解。
Cloudflare 提出覆盖发现风险、治理访问、运行时防护、调查响应四阶段的自适应应用安全框架,把代码、流量与威胁情报连成持续系统。新能力包括用 LLM 对自家 WAF 做渗透测试、向所有客户开放威胁情报,以及自动部署正向安全的新功能。其依据是 7 月 AI 智能体在不到 13 小时内从 Hugging Face worker 拿到多个集群管理员权限的事件。
研究者提出异步 LLM 框架,让用户或智能体自身定义具有重叠内存状态的推理协程,从而把 LLM 从"读取—思考—回复"的串行循环推广为可适应多种并发类型的通用异步智能体。实验显示 Qwen 3.x 模型无需任务特定训练,即可完成流式视频理解、电子游戏和监控等异步任务。
Cloudflare 介绍内部 AI 工具 CryptoLabe,用于发现代码库中的密码学使用并规划后量子(PQ)迁移,目标 2029 年实现全面 PQ 就绪。
研究者发布 EngiWorld 基准,围绕完整设计闭环构建 1301 个专家任务,覆盖 CAD、CAE、CAM、BIM、EDA 和 3D 可视化 6 个工程领域、26 个专业软件平台,并提供 GUI 与 CLI 接口。
Cloudflare 发布面向 Agent 沙箱优化的 Containers 更新,推出 durable_object 调度策略,支持运行时选择镜像和实例类型,并公测文件系统快照。
针对 LLM 智能体在扁平语料中反复重新发现文档关系、遗漏互补证据且消耗大量 token 的问题,研究者提出 CorpusMap——围绕文档中反复出现的实体构建导航层,将每个实体表示为 Entity Page 并链接所有提及它的文档,形成可遍历的实体-文档图。
研究者提出 Grounded Entity Biographies(GEB)长视频记忆框架,将同一物理实例在不同片段中的视觉观察归组为可检索的"传记",并在问答时与情节证据一同检索。
LEGO-Anything 是一个 Image-to-Code 框架,让编码智能体迭代编写并执行 Blender 代码、检查场景与渲染结果并修订程序,把单图重建的 3D 场景表示为可检查、可编辑、可查询的场景程序。
研究者提出 Thinking Reward Model(TRM),先为每个样本定制评估标准再打分,输出细粒度的逐点奖励,在图像生成与编辑奖励建模基准上取得开源奖励模型中的 SOTA,并与闭源方案保持竞争力。团队同时提出 PD-GRPO,用成对监督缓解传统成对偏好优化导致的分数极化,在保留逐点打分的同时提升奖励区分度。将 TRM 用作强化学习奖励可持续改进多种视觉生成模型。
SAKI(Supervision Allocation with KL-constrained Interpolation)通过 KL 约束的教师引导 rollout 与最大耦合,将 token 级监督路由到接受与纠正两类位置,纠正概率恰为 TV(p_t, q_t)。
研究发现,Latent WAM 虽在分布内任务上与 Explicit WAM 持平,却丢失了 WAM 原本的泛化优势;在环境扰动、数据效率和任务泛化三个维度上均出现一致退化。
Anthropic 提出 Contextual Retrieval 方法,在嵌入前为每个文本块前置上下文说明,结合 Contextual Embeddings 与 Contextual BM25 将 top-20 检索失败率降低 49%(5.7%→2.9%),叠加 reranking 后降低 67%(5.7%→1.9%)。
PanoVLN 用 4B 骨干网络和纯 RGB 输入做全景视觉语言导航,在 R2R-CE 和 RxR-CE Val-Unseen 上成功率分别超越此前 SOTA 11.9% 和 8.7%。
Anthropic 基于与数十个团队合作的经验发布构建高效 Agent 的工程指南,主张用简单、可组合的模式而非复杂框架,并区分了工作流与 Agent 两类系统。文章给出增强 LLM 这一基础构件,以及提示链、路由、并行化、编排者-工作者、评估者-优化者五种工作流模式,并建议仅在简单方案失效时增加复杂度;附录还讲解了工具提示词工程与 Agent-计算机接口(ACI)设计实践。
推荐理由:Anthropic 基于大量客户实践总结了构建智能体的可组合模式与工具设计方法,开发者可直接对照自己的场景选用。
Anthropic 的升级版 Claude 3.5 Sonnet 在 SWE-bench Verified 上取得 49%,超过此前 SOTA 的 45%,模型本身未变而成绩来自围绕模型的 agent 脚手架。
研究者发布 VoxMem 基准,用于评测大型音频语言模型(LALM)的多模态记忆能力,包含 3,196 个评测实例、34,743 段语音会话(177 小时),覆盖语音语义、说话人身份、副语言线索与环境声四类声学证据,以及信息抽取、多会话推理、时序追踪和拒答四类记忆操作,上下文预算从 8K 到 64K tokens。
Anthropic 发布工程指南,介绍给 Claude 增加 "think" 工具的方法,让模型在长链工具调用和策略密集场景中停下来做结构化思考。在 τ-bench 航空域,think 工具加优化提示词的 pass^1 达 0.570,比基线 0.370 相对提升 54%;零售域仅加工具即达 0.812(基线 0.783)。
Anthropic 发布 Claude Code 智能体编码最佳实践指南,指出上下文窗口是最需要管理的资源,性能会随上下文填满而下降。指南覆盖给 Claude 提供可运行的验证标准、先探索再规划再编码、编写精简 CLAUDE.md、配置权限与 hooks、用子代理隔离调查、用 /clear 和 /rewind 管理会话,以及并行会话、非交互模式和对抗式审查等规模化用法。
推荐理由:Anthropic 官方系统梳理 Claude Code 使用模式,围绕上下文管理与验证闭环给出可直接套用的实践方法。
论文提出 Omni-IO Skills,一个即插即用的 Agent Harness,通过分层 Skills、标准化多模态执行接口、依赖感知编排和持久化 Asset Registry,让现有 Agent 无需改动推理核心即可原生处理多模态任务。
Anthropic 工程团队发布长文,复盘 Claude Research 多智能体研究系统从原型到生产的构建过程。系统采用 orchestrator-worker 架构,内部评估中 Claude Opus 4 主导加 Claude Sonnet 4 子代理的组合比单代理 Claude Opus 4 高出 90.2%,但多智能体消耗约 15 倍于普通对话的 token。
Anthropic 推出 Desktop Extensions,把 MCP 服务器连同依赖打包成 .mcpb 文件(发布时为 .dxt,2025 年 9 月起改名),在 Claude Desktop 中双击即可安装,无需终端、手动改配置文件或处理依赖冲突。
Anthropic 发布工程文章,讲解如何为 MCP 和 LLM 智能体编写高效工具,包括构建原型、运行评测、用 Claude Code 自动分析转录并改进工具的流程。