跳到正文

#产品更新

今日 9 条
9月30日周三
  1. xAI:News(网页)56

    xAI 推出面向企业的 Grok Bot,企业客户两周内免费使用

    xAI 宣布 Grok Bot 面向企业开放,Grok 和 Cursor Enterprise 客户未来两周可免费使用,并可邀请整个组织包括没有现有席位的成员。每个 Bot 在云端独立运行,可按工作流学习任务、相互传递上下文,本次发布还新增访问、网络和审计管控;用户工作在相互隔离的安全环境中运行,Bot 默认无访问权限。

  2. xAI:News(网页)57

    Grok Build 推出记忆功能

    xAI 为 Grok Build 推出记忆功能,在每轮对话完成后于后台记录约定、决策和项目事实,后续会话会先读取相关笔记再修改代码。记忆按项目保存并另有全局偏好集合,不记录任务状态、临时结论、密钥及仓库文档已覆盖的内容;新增 /memory 浏览命令和 /dream 整理命令,后者也会定期在后台运行。

  3. xAI:News(网页)63

    xAI 发布 Team Bots:可与团队共同工作的 Grok Bots 开启公测

    xAI 推出 Team Bots,即能与团队共同工作和学习的 Grok Bots,今日起在 Teams 和 Enterprise 计划开放公测。每个 Bot 整合上下文、插件、凭证和记忆四类要素,个人对话保持私密,也可在 Slack 中协作。

    推荐理由:官方详细说明了 Team Bots 的构成要素和四类内部用法,读者可以据此评估在自己团队工作流中的可行性。

  4. 小米 MiMo:官网发布与博客53

    小米发布 MiMo Desktop 桌面 Agent 产品

    小米官网发布 MiMo Desktop 桌面 Agent 产品,把 PPT、文档、表格、定时与文件整理交给「Smart」调度,自动评估任务并路由到办公、代码或研究框架,复杂任务拆解为子任务多 Agent 并行推进,Self-Evolve 引擎持续优化自身代码。

  5. TensorZero:实验与工程博客66

    TensorZero 在 LLM 网关中引入多臂老虎机自适应 A/B 实验

    TensorZero 推出基于 Track-and-Stop 最佳臂识别的多臂老虎机算法,在 LLM 网关中实现自适应 A/B 实验,动态调整采样比例并用 anytime-valid 的 GLRT 停止规则避免 p-hacking。

    推荐理由:文章用仿真和真实 NER 实验数据说明自适应实验相比均匀采样能减少约 37% 的判定时间,并给出可直接复用的配置方法。

  6. Berkeley RDI:Blog(AI 安全与评测)66

    Berkeley RDI 发布 CUA-Lite:面向 computer-use agent 的开源平台

    Berkeley RDI 于 2026 年 9 月推出 CUA-Lite,一个开发 computer-use agent 的开源平台,围绕 Lite.Gym 统一环境接口、Lite.Sample 统一监督数据格式和每模型一个、跨 eval/SFT/RL 共用的 harness 三大抽象构建。

    推荐理由:平台由 Berkeley RDI 官方发布,给出三大抽象和已接入的基准、数据规模,读者可据此评估是否用于 CUA 开发。

  7. Microsoft AI:官方博客(网页)30

    Microsoft Signal 博客汇总:MAI-Code-1.1-Flash、CARE-X 与开源智能体框架 Orchard

    微软推出 MAI-Code-1.1-Flash 模型,已用于 GitHub Copilot,在命令行编码和 .NET 开发任务上表现提升,用更少 token 完成任务且成本低于 6 月版本。微软还发布开源智能体框架 Orchard,为训练和评估能写代码、浏览网页的 AI 智能体提供可复用环境。此外,微软研究模型 CARE-X 可将多项放射学任务整合,在胸部 X 光任务和真实患者数据上表现良好。

  8. MiniMax:Blog(网页)50

    MiniMax Speech 2.8 发布:原生音效标签与 10 秒高保真克隆

    MiniMax 发布语音模型 Speech 2.8,新增原生音效标签支持,可模拟 "um"、"uh" 等口语填充词及呼吸、停顿,并实现 10 秒样本的高保真声音克隆。该版本还重构处理引擎以消除背景噪声与合成失真,并率先修复普通话-日语跨语言场景中的口音串扰问题。Speech 2.8 现已上线。

  9. Meta AI:Blog(网页)32

    Meta AI 模型 DINOv3 与 SAM 如何助力匹兹堡大学改造辅助机器人

    Meta 的 DINOv3 与 SAM 正被匹兹堡大学 RAMMP 项目用于辅助机器人,在电池供电的边缘设备上实现实时环境感知。RAMMP 的感知系统基于 RF-DETR,并用 DINOv2 嵌入微调、由 SAM 自动标注训练数据,实现 360 度环境感知与自适应物体检测。团队已把基于 DINO 的图像传感器查询功能集成进首个原型,可检测自动门按钮、杯子和路缘,目前正转向语音与触控输入。

  10. Baseten Base Labs:模型研究15

    Qwen3.5 35B-A3B

    来源显示 Qwen3.5 35B-A3B 这一模型标识,正文仅包含一段 API 返回的 JSON 示例,其中 model 字段为空,usage 记录 completion_tokens 145、prompt_tokens 38、total_tokens 183。原文未提供该模型的参数、benchmark 或可用性等更多信息。

  11. Baseten Base Labs:模型研究18

    GLM 5

    智谱 GLM 5 出现在 Baseten Base Labs 的模型研究页面中,原始标题仅给出模型名,正文为一段 chat.completion 格式的 API 返回示例,包含 38 个 prompt_tokens、145 个 completion_tokens、共 183 个 total_tokens,模型字段为空。

  12. Baseten Base Labs:模型研究9

    Llama 3.3 70B Instruct

    Baseten Base Labs 模型研究页面列出 Llama 3.3 70B Instruct,正文仅给出一段 chat.completion 格式的 API 返回示例,其中 model 字段为空,completion_tokens 为 145、prompt_tokens 为 38、total_tokens 为 183。

  13. Goodfire Research(网页)37

    Goodfire 推出 Silico for Life Sciences:面向生命科学的模型可解释性工具

    Goodfire 发布 Silico for Life Sciences,可追踪模型内部可解释特征,验证预测依赖真实生物结构还是数据集伪相关,并从模型内部直接挖掘生物标志物与机制假设。该工具已用于 Mayo Clinic 合作项目,对 ClinVar 全部 420 万个变异给出可解释预测,其中 83.9 万个变异实现 SOTA 致病性预测,并开源可解释预测数据库。

  14. Goodfire Research(网页)50

    Goodfire 推出 Silico:用内部表征做奖励信号,幻觉降低 58%

    Goodfire 发布面向 LLM 的可解释性工具 Silico,用模型内部表征的轻量探针作为奖励信号训练 Google Gemma 3 12B,幻觉降低 58% 且性能基准无退化,成本比 LLM-as-a-judge 低约 90 倍。该工具还支持基于探针定位有害行为对应的训练数据点,过滤后重训可使相关行为减少 63%,识别并剔除问题数据源后减少 84%。Silico 已提供 macOS 版下载。

  15. Goodfire Research(网页)41

    Goodfire 推出可解释性智能体 Silico,面向团队提供前沿模型机制分析

    Goodfire Research 发布可解释性智能体 Silico,可围绕研究目标自主制定实验计划、并行运行并监控进度,支持任意规模模型。它集成 auto-interp、探针与 SAE 训练、模型对比、因果分析、数据归因、神经几何和激活 verbalizer 等可解释性方法与库,用于解释模型行为、调试回归问题、构建多阶段护栏以及复现对齐研究。Silico 已提供 macOS 版本下载。

  16. Fireworks AI(网页)47

    Fireworks 多区域部署:一次部署实现全球扩展

    Fireworks 推出 GLOBAL 多区域部署选项,让单一部署身份和端点跨区域调度 GPU 容量,避免将工作负载钉在单一区域造成容量上限。其调度不进入请求路径,由 DNS 就近选择健康网关并按预生成路由记录转发,支持 GLOBAL、US、EUROPE、APAC、CANADA 范围。七天生产观测显示,可全球部署客户部署的请求成功率从单区域的 99.269% 升至多区域的 99.992%。

  17. Fireworks AI(网页)68

    Fireworks AI 发布 FireRouter with Opus,编码成本降 57%

    Fireworks AI 推出 FireRouter with Opus,在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间按每轮任务做缓存感知路由,首次可作为独立 serverless 端点供任意 Fireworks 账号调用。

    推荐理由:厂商给出内部 A/B 测试的成本与准确率数据,读者可以据此评估缓存感知路由在编码工作流中的省费空间。

  18. Cursor Blog74

    Cursor 推出 Projects:用协调智能体承接大规模开发工作

    Cursor 推出 Projects,让开发者以项目为单位承接功能开发、迁移和长期维护等工作,可维持数月上下文、向数千个子智能体委派任务并自动处理周期性工作。每个 Project 默认在云端运行并同步共享上下文,协调智能体只负责委派而不写代码,还可订阅 Slack 频道、按计划运行或跟踪 PR。

    推荐理由:官方介绍了 Projects 的协调智能体机制和内部使用数据,读者可以对照自己的多 PR 工作流评估是否适用。

  19. Cursor Blog61

    Cursor 推出软件开发 Bots:Rollouts 与 Security Reviewer

    Cursor 推出两款软件开发 Bots,Rollouts 全程监控变更从 PR 到生产环境、自动标记回归并支持回滚,Security Reviewer 在每个 PR 上像安全工程师一样审查代码并支持一键修复。

    推荐理由:原文来自官方,详细说明了两个 bot 的工作机制和适用场景,读者可对照自身部署与安全审查流程评估可用性。

  20. Cognition 模型 / Devin 博客(网页)71

    Cognition 将 Fusion 双智能体 harness 引入 Devin Desktop 和 CLI

    Cognition 在 Devin Desktop 和 CLI 中开放 Fusion,一个由前沿模型主导规划审查、高性价比模型执行编码的双智能体 harness,官方称在主要编码基准上最高节省 39% 成本。

    推荐理由:原文给出双智能体架构、实测成本数据与模型配对调优经验,读者可据此理解按任务定价与多智能体分工的设计取舍。

  21. Claude:Blog(网页)72

    Claude 合并 Cowork 与聊天,并推出 Claude Docs、Slides 和 Design 集成

    Anthropic 宣布 Claude Cowork 与聊天合并为一个 Claude,任务不再需要用户选择入口,可在合上电脑后继续完成。同时发布 Claude Docs 和 Claude Slides,Claude Design 也可在对话中直接使用,三者均在付费计划上处于 beta。

    推荐理由:官方说明了 Cowork 与聊天合并的原因和落地方式,读者可以据此判断现有工作流会受哪些影响。