Cloudflare Containers 重构:durable_object 调度策略使启动快 6 倍并推出文件系统快照
Cloudflare 发布面向 Agent 沙箱优化的 Containers 更新,推出 durable_object 调度策略,支持运行时选择镜像和实例类型,并公测文件系统快照。
Cloudflare 发布面向 Agent 沙箱优化的 Containers 更新,推出 durable_object 调度策略,支持运行时选择镜像和实例类型,并公测文件系统快照。
xAI 宣布 Grok Bot 面向企业开放,Grok 和 Cursor Enterprise 客户未来两周可免费使用,并可邀请整个组织包括没有现有席位的成员。每个 Bot 在云端独立运行,可按工作流学习任务、相互传递上下文,本次发布还新增访问、网络和审计管控;用户工作在相互隔离的安全环境中运行,Bot 默认无访问权限。
xAI 发布 Grok Bot 采购应用 Haggle Bot,接入 Slack、Notion、Drive、Gmail、Hex、Ramp 等工具,梳理约 125 个活跃供应商,已识别超过 10 万美元直接节省。
推荐理由:原文以自家用例给出 Grok Bot 在采购场景的完整配置与节省数字,读者可据此评估 Bot 在企业流程中的可复用方式。
xAI 为 Grok Build 推出记忆功能,在每轮对话完成后于后台记录约定、决策和项目事实,后续会话会先读取相关笔记再修改代码。记忆按项目保存并另有全局偏好集合,不记录任务状态、临时结论、密钥及仓库文档已覆盖的内容;新增 /memory 浏览命令和 /dream 整理命令,后者也会定期在后台运行。
xAI 推出 Team Bots,即能与团队共同工作和学习的 Grok Bots,今日起在 Teams 和 Enterprise 计划开放公测。每个 Bot 整合上下文、插件、凭证和记忆四类要素,个人对话保持私密,也可在 Slack 中协作。
推荐理由:官方详细说明了 Team Bots 的构成要素和四类内部用法,读者可以据此评估在自己团队工作流中的可行性。
小米官网发布 MiMo Desktop 桌面 Agent 产品,把 PPT、文档、表格、定时与文件整理交给「Smart」调度,自动评估任务并路由到办公、代码或研究框架,复杂任务拆解为子任务多 Agent 并行推进,Self-Evolve 引擎持续优化自身代码。
World Labs 发布 Spark,一款面向 THREE.js 的高级 3D Gaussian Splatting 渲染器,可与场景中的其他网格和 splat 集成,并在所有设备上实现快速渲染。该渲染器支持可编程的动态 splat 效果,兼容 ply、sogs、spz、splat、ksplat 等多种格式。
World Labs 上线 Marble Labs,汇集 Marble 在影视 VFX、虚拟制片、游戏、AR/VR 等场景的项目案例与构建教程。
TensorZero 推出基于 Track-and-Stop 最佳臂识别的多臂老虎机算法,在 LLM 网关中实现自适应 A/B 实验,动态调整采样比例并用 anytime-valid 的 GLRT 停止规则避免 p-hacking。
推荐理由:文章用仿真和真实 NER 实验数据说明自适应实验相比均匀采样能减少约 37% 的判定时间,并给出可直接复用的配置方法。
TensorZero 正在构建自动化 AI 工程师 TensorZero Autopilot,可分析 LLM 可观测性数据、搭建评测、优化提示词与模型并运行 A/B 测试,在软件工程、客服、数据抽取、医学、法律、天体物理、交互推理等任务上全部提升。
Suno 宣布自 2026 年 9 月 3 日起实施新的下载限制并更新服务条款。Free 用户终身最多 7 次试用下载,Pro 每月 20 次,Premier 每月 60 次;使用 Suno Studio 的 Premier 订阅者不设下载上限,超出部分可付费购买。
Suno 发布 Studio 2.0,为浏览器端 DAW 带来 MIDI 导入录制与编辑、wavetable 合成器、Chat(beta)、高级 stem 分离、音频效果与自定义插件以及自动化功能。MIDI 片段还可作为音频生成的提示词,Premier 订阅者可无限导出 32-bit/48kHz 多轨与 stems。
Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG 和 Believe 等行业伙伴合作开发,官方称其更快、更具表现力且质量更高。
推荐理由:原文给出 v6 三个模型分工、具体编辑控制能力和与 Warner Music Group 等的合作背景,读者可据此评估其创作工作流的变化。
UC Santa Barbara 与 UC Berkeley 团队推出基于 OpenSage 框架的 CTF 专用智能体 SageCTF,在 DEF CON CTF 2026 资格赛中尝试 15 题。
推荐理由:原文给出 SageCTF 在 DEF CON CTF 的具体成绩与 50 题对比数据,读者可以据此评估自主 Agent 在长程安全任务上的水平。
Berkeley RDI 于 2026 年 9 月推出 CUA-Lite,一个开发 computer-use agent 的开源平台,围绕 Lite.Gym 统一环境接口、Lite.Sample 统一监督数据格式和每模型一个、跨 eval/SFT/RL 共用的 harness 三大抽象构建。
推荐理由:平台由 Berkeley RDI 官方发布,给出三大抽象和已接入的基准、数据规模,读者可据此评估是否用于 CUA 开发。
Preferred Networks(PFN)展示其企业 AI 平台 PreferredAI Work Suite,以及从零自研的日英翻译大语言模型 PLaMo Translate,后者采用紧凑高效设计,支持本地部署并提供浏览器扩展。
微软推出 MAI-Code-1.1-Flash 模型,已用于 GitHub Copilot,在命令行编码和 .NET 开发任务上表现提升,用更少 token 完成任务且成本低于 6 月版本。微软还发布开源智能体框架 Orchard,为训练和评估能写代码、浏览网页的 AI 智能体提供可复用环境。此外,微软研究模型 CARE-X 可将多项放射学任务整合,在胸部 X 光任务和真实患者数据上表现良好。
MiniMax 发布语音模型 Speech 2.8,新增原生音效标签支持,可模拟 "um"、"uh" 等口语填充词及呼吸、停顿,并实现 10 秒样本的高保真声音克隆。该版本还重构处理引擎以消除背景噪声与合成失真,并率先修复普通话-日语跨语言场景中的口音串扰问题。Speech 2.8 现已上线。
AI 时尚应用 Alta Daily 基于 Meta 的 Segment Anything Model(SAM)完成服装分割与数字化,已处理超 2000 万张图片。
Meta 的 DINOv3 与 SAM 正被匹兹堡大学 RAMMP 项目用于辅助机器人,在电池供电的边缘设备上实现实时环境感知。RAMMP 的感知系统基于 RF-DETR,并用 DINOv2 嵌入微调、由 SAM 自动标注训练数据,实现 360 度环境感知与自适应物体检测。团队已把基于 DINO 的图像传感器查询功能集成进首个原型,可检测自动门按钮、杯子和路缘,目前正转向语音与触控输入。
来源显示 Qwen3.5 35B-A3B 这一模型标识,正文仅包含一段 API 返回的 JSON 示例,其中 model 字段为空,usage 记录 completion_tokens 145、prompt_tokens 38、total_tokens 183。原文未提供该模型的参数、benchmark 或可用性等更多信息。
智谱 GLM 5 出现在 Baseten Base Labs 的模型研究页面中,原始标题仅给出模型名,正文为一段 chat.completion 格式的 API 返回示例,包含 38 个 prompt_tokens、145 个 completion_tokens、共 183 个 total_tokens,模型字段为空。
Baseten Base Labs 模型研究页面列出 Llama 3.3 70B Instruct,正文仅给出一段 chat.completion 格式的 API 返回示例,其中 model 字段为空,completion_tokens 为 145、prompt_tokens 为 38、total_tokens 为 183。
Goodfire 面向学术与安全实验室开放 Silico 研究访问,价格为每月 1000 美元,企业访问需另行申请演示。团队正分批邀请研究人员,并将通过邮件跟进;研究人员可在其页面查看已有研究案例。
Goodfire Research 为 Silico 推出企业版定价,面向规模化部署 AI 研究的团队。企业版在 Academic & Safety 版基础上增加专属研究员支持、组织级计费与席位管理,并提供 Zero Data Retention 选项。
Goodfire Research 发布 Silico,一款用于机器人与视觉基础模型的物理 AI 研究工具,可在生成任何一帧前直接从潜空间验证模型是否学到真实物理结构。
Goodfire 发布 Silico for Life Sciences,可追踪模型内部可解释特征,验证预测依赖真实生物结构还是数据集伪相关,并从模型内部直接挖掘生物标志物与机制假设。该工具已用于 Mayo Clinic 合作项目,对 ClinVar 全部 420 万个变异给出可解释预测,其中 83.9 万个变异实现 SOTA 致病性预测,并开源可解释预测数据库。
Goodfire 发布面向 LLM 的可解释性工具 Silico,用模型内部表征的轻量探针作为奖励信号训练 Google Gemma 3 12B,幻觉降低 58% 且性能基准无退化,成本比 LLM-as-a-judge 低约 90 倍。该工具还支持基于探针定位有害行为对应的训练数据点,过滤后重训可使相关行为减少 63%,识别并剔除问题数据源后减少 84%。Silico 已提供 macOS 版下载。
Goodfire Research 发布可解释性智能体 Silico,可围绕研究目标自主制定实验计划、并行运行并监控进度,支持任意规模模型。它集成 auto-interp、探针与 SAE 训练、模型对比、因果分析、数据归因、神经几何和激活 verbalizer 等可解释性方法与库,用于解释模型行为、调试回归问题、构建多阶段护栏以及复现对齐研究。Silico 已提供 macOS 版本下载。
Fireworks AI 发布 Specialized Intelligence Index(SII),汇集开放、闭源和专用模型在医疗、法律、网络安全、金融、客服、生产力、软件七个领域的从业者设计基准上的表现。
Fireworks 发布 ARCv3 权重更新压缩器,在 1000 个生产 RL 权重更新 delta 上,BF16 权重载荷比 ARCv2 缩小近 50%,平均 delta 约为原始 BF16 权重的 0.19%,低于 ARCv2 的 0.36%,且可无损还原训练器的精确 BF16 权重。
Fireworks 推出 GLOBAL 多区域部署选项,让单一部署身份和端点跨区域调度 GPU 容量,避免将工作负载钉在单一区域造成容量上限。其调度不进入请求路径,由 DNS 就近选择健康网关并按预生成路由记录转发,支持 GLOBAL、US、EUROPE、APAC、CANADA 范围。七天生产观测显示,可全球部署客户部署的请求成功率从单区域的 99.269% 升至多区域的 99.992%。
Fireworks AI 推出 FireRouter with Opus,在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间按每轮任务做缓存感知路由,首次可作为独立 serverless 端点供任意 Fireworks 账号调用。
推荐理由:厂商给出内部 A/B 测试的成本与准确率数据,读者可以据此评估缓存感知路由在编码工作流中的省费空间。
Cursor 发布云端智能体自托管机器功能,工具执行可迁移到团队自管的基础设施,智能体循环、推理和规划仍留在 Cursor 云端。
推荐理由:原文给出了自托管机器的适用场景、worker 机制和沙箱合作生态,读者可以据此判断是否把智能体执行迁回自有环境。
Cursor 推出 Projects,让开发者以项目为单位承接功能开发、迁移和长期维护等工作,可维持数月上下文、向数千个子智能体委派任务并自动处理周期性工作。每个 Project 默认在云端运行并同步共享上下文,协调智能体只负责委派而不写代码,还可订阅 Slack 频道、按计划运行或跟踪 PR。
推荐理由:官方介绍了 Projects 的协调智能体机制和内部使用数据,读者可以对照自己的多 PR 工作流评估是否适用。
Cursor 推出两款软件开发 Bots,Rollouts 全程监控变更从 PR 到生产环境、自动标记回归并支持回滚,Security Reviewer 在每个 PR 上像安全工程师一样审查代码并支持一键修复。
推荐理由:原文来自官方,详细说明了两个 bot 的工作机制和适用场景,读者可对照自身部署与安全审查流程评估可用性。
Cohere 推出 Embed 5 系列前沿嵌入模型,定位为当前最优的检索(state-of-the-art retrieval),已在 Pro 和 Fast 两个档位上线。该系列属于 Cohere 的语义表示模型产品线,官方称其为新一代前沿嵌入模型家族。
Cognition 在 Devin Desktop 和 CLI 中开放 Fusion,一个由前沿模型主导规划审查、高性价比模型执行编码的双智能体 harness,官方称在主要编码基准上最高节省 39% 成本。
推荐理由:原文给出双智能体架构、实测成本数据与模型配对调优经验,读者可据此理解按任务定价与多智能体分工的设计取舍。
Anthropic 宣布 Claude Cowork 与聊天合并为一个 Claude,任务不再需要用户选择入口,可在合上电脑后继续完成。同时发布 Claude Docs 和 Claude Slides,Claude Design 也可在对话中直接使用,三者均在付费计划上处于 beta。
推荐理由:官方说明了 Cowork 与聊天合并的原因和落地方式,读者可以据此判断现有工作流会受哪些影响。
Anthropic 为企业版提供三种购买路径:可直接用信用卡在几分钟内自助结账升级 Enterprise;也可通过购买智能体咨询问题、获取个性化报价并当天结账,必要时可升级至销售团队;销售团队仅支持 500+ 席位部署和 BAA 等复杂交易。