Cloudflare Containers 重构:durable_object 调度策略使启动快 6 倍并推出文件系统快照
Cloudflare 发布面向 Agent 沙箱优化的 Containers 更新,推出 durable_object 调度策略,支持运行时选择镜像和实例类型,并公测文件系统快照。
Cloudflare 发布面向 Agent 沙箱优化的 Containers 更新,推出 durable_object 调度策略,支持运行时选择镜像和实例类型,并公测文件系统快照。
Anthropic 发布工程指南,介绍给 Claude 增加 "think" 工具的方法,让模型在长链工具调用和策略密集场景中停下来做结构化思考。在 τ-bench 航空域,think 工具加优化提示词的 pass^1 达 0.570,比基线 0.370 相对提升 54%;零售域仅加工具即达 0.812(基线 0.783)。
Anthropic 工程团队发布长文,复盘 Claude Research 多智能体研究系统从原型到生产的构建过程。系统采用 orchestrator-worker 架构,内部评估中 Claude Opus 4 主导加 Claude Sonnet 4 子代理的组合比单代理 Claude Opus 4 高出 90.2%,但多智能体消耗约 15 倍于普通对话的 token。
Anthropic 推出 Desktop Extensions,把 MCP 服务器连同依赖打包成 .mcpb 文件(发布时为 .dxt,2025 年 9 月起改名),在 Claude Desktop 中双击即可安装,无需终端、手动改配置文件或处理依赖冲突。
Anthropic 复盘 8 月至 9 月初影响 Claude 响应质量的三个基础设施 bug:8 月 5 日上下文窗口路由错误最严重时影响 16% 的 Sonnet 4 请求。
Anthropic 应用 AI 团队发文阐述上下文工程,定义为在 LLM 推理过程中筛选和维护最优 token 集合的策略,将其视为提示工程的自然演进。文章指出所有模型都存在 context rot 现象,上下文应被当作边际收益递减的有限资源。
推荐理由:Anthropic 提出上下文工程是提示工程的演进,并给出压缩、结构化笔记、子智能体三种应对长任务的具体方法,可直接迁移到智能体开发。
Anthropic 在 Claude Code 中推出基于沙箱的两项新功能:沙箱化 bash 工具(beta 研究预览,可通过 /sandbox 启用并已开源)和 Claude Code on the web。
推荐理由:官方解释了沙箱如何用文件系统和网络双重隔离减少权限弹窗,内测减少 84%,并说明开源实现供其他 Agent 团队参考。
Anthropic 工程博客发布长文,系统讲解如何为 AI Agent 构建可靠的自动化评测。文章定义了任务、试验、grader、transcript、评测框架等核心概念,对比代码型、模型型和人工三类评测器的优劣,分别给出编码、对话、研究和计算机使用四类 Agent 的评测方法,并解释 pass@k 与 pass^k 两种指标在非确定性下的差异。
Anthropic 性能优化团队负责人 Tristan Hume 复盘其招聘用 take-home 测试被 Claude 模型逐步击穿的过程:超 1000 名候选人完成过该模拟加速器优化测试,Claude Opus 4 在相同时间内超过多数人类申请者,Claude Opus 4.5 在 2 小时内追平最佳人类成绩。
推荐理由:作者以一手迭代经验说明模型如何逐步击穿技术面试题,并给出设计抗 AI 评测的具体做法与开源挑战。
针对 MoE 模型批量解码时专家权重传输开销大的问题,研究者提出 BASE,按“移除某专家对 MoE 层输出的影响”对专家排序,并在校准阶段训练轻量线性预测器估计每个 token 的专家移除代价,配合定制 GPU kernel 完成代价预测与专家选择。
DSpine 是一种在骨干网络各层注入相邻因果条件的投机解码 drafter,通过门控相邻注入把前驱预测特征写入后继位置,使因果条件链随网络深度展开而所有位置并行更新。
Koa-action 是一个面向低延迟原子动作(分类、语义端点检测、布尔判断、打分)的框架,通过引入原子标签 token 与监督微调,把分类变成确定性的单 token 解码。
xAI 宣布 Grok Bot 面向企业开放,Grok 和 Cursor Enterprise 客户未来两周可免费使用,并可邀请整个组织包括没有现有席位的成员。每个 Bot 在云端独立运行,可按工作流学习任务、相互传递上下文,本次发布还新增访问、网络和审计管控;用户工作在相互隔离的安全环境中运行,Bot 默认无访问权限。
小米官网发布 MiMo Desktop 桌面 Agent 产品,把 PPT、文档、表格、定时与文件整理交给「Smart」调度,自动评估任务并路由到办公、代码或研究框架,复杂任务拆解为子任务多 Agent 并行推进,Self-Evolve 引擎持续优化自身代码。
TensorZero 团队发布开源方法,在每次 Git commit 时自动为 Cursor 的 LLM 推理计算反馈奖励。
TensorZero 完成 730 万美元种子轮融资,用于构建面向工业级 LLM 应用的开源基础设施。其 11.5K 星开源栈统一了 LLM 网关、可观测性、优化、评估与实验五大组件,可增量采用并形成数据与学习飞轮。该平台已在前沿 AI 初创公司和一家欧洲大型银行落地,并曾登上 GitHub 全球周趋势榜第一。
TensorZero 推出基于 Track-and-Stop 最佳臂识别的多臂老虎机算法,在 LLM 网关中实现自适应 A/B 实验,动态调整采样比例并用 anytime-valid 的 GLRT 停止规则避免 p-hacking。
推荐理由:文章用仿真和真实 NER 实验数据说明自适应实验相比均匀采样能减少约 37% 的判定时间,并给出可直接复用的配置方法。
TensorZero 指出每百万 token 单价($/MTok)不能反映 LLM API 真实成本,因为各家 tokenizer 对相同输入产生不同 token 数。
推荐理由:原文用实测数据说明 token 计数差异会让实际成本偏离标价,读者可据此修正自己比较模型价格的方法。
TensorZero 发文指出,输出级相关性低的噪声 LLM 评估器在离线 Agent 选型中仍然可靠,因为单输出噪声会随样本量平均消去。
Prime Intellect 推出 Prime Flash MoE,一组为 Blackwell 优化的 CUDA 内核,最高比 PyTorch grouped GEMM 快 2.4×,在 4k-128k token 区间约 2.3× 加速。
Prime Intellect 基于 NIXL 和 ModelExpress 重建了 prime-rl 的权重传输流程,把 GLM-5.2 的 RL 权重同步从 60-90 秒降至个位数秒,实测约 4 秒。
Prime Intellect 宣布 Prime Sandboxes 正式全面开放,这是一种为智能体 RL 训练设计的 MicroVM 沙盒,此前已创建约 30M 个沙盒。
RadixArk SGLang 团队与 Ant Ling Infra 团队在 4 张 NVIDIA Blackwell GPU 上为混合线性注意力 MoE 模型 Ling-3.0-flash 优化 batch-1 解码,NEXTN/MTP 路径将单请求吞吐从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。
千问(Qwen)团队开源 Qwen3.8-Flash-Next,一个多模态 MoE 模型,被视为 Qwen4 架构的早期预览。模型总参数 125B 加 51B N-gram Embedding,每 token 激活 6B,48 层中含 36 层 GDN 线性注意力和 12 层 QSA 稀疏注意力,MoE 使用 512 专家 top-10 路由。
推荐理由:原文给出该模型混合架构细节和 SGLang 的 day-0 推理支持数据,读者可以据此评估长上下文部署的实际收益。
SGLang Diffusion 团队发布 MiniMax-H3 视频生成基准,在 8× NVIDIA H200(141 GB)、SGLang v0.5.18。
LMSYS 团队(2026年8月28日)发布 Infer-forge 构建方法论,这是一套围绕 SGLang 独立开发的内部智能体工程系统,包含 MonoRepo 共享工作区、Harness 执行底座、Task Loop 与 Task Graph 三层累积结构,目前未开源。
LMSYS 的 SGLang 团队发布 SSD Expert Pack 路径,把装不进 VRAM 和内存的 MoE 路由专家放在 NVMe SSD 上,只加载 router 选中的专家,用 Expert Pack 布局、direct I/O、pinned 缓冲和 GPU 缓存把 SSD 容量变成可用的存储层。
推荐理由:原文给出在单张消费级 GPU 上运行超大 MoE 模型的完整方案和实测数据,读者可以评估这条 SSD 专家卸载路径是否适合自己的本地部署。
SGLang 和 Miles 团队发布对 DeepSeek-V4.1 的 Day-0 支持,解析其低比率压缩、滑动窗口注意力(SWA)、流形超连接(mHC)和 Engram 记忆等架构对推理栈的影响。
推荐理由:原文拆解了 DeepSeek-V4.1 新架构对推理栈的影响,并给出 SGLang 与 Miles 的 Day-0 支持方案和实测数字。
SGLang、Qwen 和 NVIDIA 团队在 SGLang 中实现了 NVFP4 KV cache,将 K/V 以 4 位 NVFP4 格式存储并在 decode 阶段于注意力 kernel 内即时反量化到 FP8。
SGLang 团队介绍用 /v1/score 接口为 JEV 类决策模型做标签打分,调用方通过 label_token_ids 显式指定标签,无需依赖生成结果的 top-k logprobs。
LlamaParse 团队推出开源文档解析工具 LiteParse,支持 PDF、DOCX、PPTX、XLSX 和图片,全程本地运行,无云端调用、无 LLM token 消耗。
推荐理由:原文来自产品官方,清晰给出了 LiteParse 的本地解析方式、支持格式与坐标输出等能力边界,便于与 LlamaParse 作取舍。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpot 草稿模型权重,通过投机解码在不改变输出质量的前提下大幅提升解码速度,草稿模型约为 3 亿参数。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,以约 280M 参数(增加 8.9% 内存占用)换取更快解码,GPU 解码吞吐最高提升 2.66 倍、边缘设备最高 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍。
来源显示 Qwen3.5 35B-A3B 这一模型标识,正文仅包含一段 API 返回的 JSON 示例,其中 model 字段为空,usage 记录 completion_tokens 145、prompt_tokens 38、total_tokens 183。原文未提供该模型的参数、benchmark 或可用性等更多信息。
智谱 GLM 5 出现在 Baseten Base Labs 的模型研究页面中,原始标题仅给出模型名,正文为一段 chat.completion 格式的 API 返回示例,包含 38 个 prompt_tokens、145 个 completion_tokens、共 183 个 total_tokens,模型字段为空。
Baseten Base Labs 模型研究页面列出 Llama 3.3 70B Instruct,正文仅给出一段 chat.completion 格式的 API 返回示例,其中 model 字段为空,completion_tokens 为 145、prompt_tokens 为 38、total_tokens 为 183。
Baseten 的部署(deployment)是模型在平台上运行的一个版本,拥有独立 API endpoint,每次 baseten model push 都会创建一个部署,同一模型可同时运行多个部署以便在不影响生产流量的情况下测试新版本。
Fireworks Research 发布专用模型 Ember-1,基于 Kimi K3 训练,在保持质量的同时减少约 35–50% 推理 token。团队做了 50 多次训练实验和 200 多次评估,在 Terminal Bench 2.1、SWE-bench Verified 等 7 个基准和两家客户生产流量的 A/B 测试中质量持平,每任务 token 约省 35%。
推荐理由:原文给出多组基准和生产 A/B 数据,读者可以据此评估用更低 token 成本跑 Kimi K3 级质量的可行路径。
Fireworks 发布 ARCv3 权重更新压缩器,在 1000 个生产 RL 权重更新 delta 上,BF16 权重载荷比 ARCv2 缩小近 50%,平均 delta 约为原始 BF16 权重的 0.19%,低于 ARCv2 的 0.36%,且可无损还原训练器的精确 BF16 权重。