Google 发布 Groundsource:用 Gemini 把新闻报道转为历史洪水数据
Google Research 推出 Groundsource,利用 Gemini 从 80 种语言的新闻报告中提取结构化历史洪水事件,建成覆盖 150 多个国家、2000 年至今的 260 万条记录的开源数据集。
推荐理由:原文给出方法细节与验证准确率,读者可以据此了解用 LLM 把新闻转成灾害历史数据的可行路径。
Google Research 推出 Groundsource,利用 Gemini 从 80 种语言的新闻报告中提取结构化历史洪水事件,建成覆盖 150 多个国家、2000 年至今的 260 万条记录的开源数据集。
推荐理由:原文给出方法细节与验证准确率,读者可以据此了解用 LLM 把新闻转成灾害历史数据的可行路径。
Together AI 推出统一方案,在同一集群内共同部署 STT、LLM 和 TTS 基础设施来构建实时语音智能体,端到端延迟低于 500 毫秒(从用户说话结束到首个音频 token)。
Modem 面向所有用户上线 Event Automations,让自动化不再按时间表运行,而是在事件发生时唤醒同一个 Modem Agent 执行提示词。
NVIDIA Nemotron 3 Super 登陆 Together AI,模型为 120B 参数(12B 激活)、Transformer 与 Mamba 混合 MoE 架构,支持 1M-token 上下文窗口,生成速度较当前领先开源模型高 50% 以上。
Together AI 为 Together GPU Clusters(原 Instant Clusters)加入自动扩缩容、RBAC、全栈可观测性和自助节点修复。
browser-use 在 GitHub 上线 chat-ui-example 仓库,这是一个使用 Browser Use v3 SDK 构建的 AI 聊天应用示例。该仓库为开发者提供了将 Browser Use v3 SDK 集成到聊天界面的参考实现。
Together AI 在首届 AI Native Conf 上发布七项研究与产品成果,覆盖 Kernels、强化学习与算法推理优化三个方向。
Steve Yegge 宣布推出 Wasteland,一个把数千个 Gas Town 通过信任网络连接起来的联邦化协作系统,核心是共享的 wanted board 和基于 Git fork/merge 模型的 stamp 认证协议。
Together AI 提出缓存感知的预填充-解码分离架构 CPD,在延迟 SLO 下可持续 QPS 比现有分离式设计提升 35–40%,并在存在大型冷提示时保持更紧的尾延迟。
OpenBMB 发布 ArcLight,一个轻量级 LLM 推理框架。该框架以轻量为主要定位,具体参数规模、性能数据与可用方式尚未在现有信息中披露。
OpenBMB 为 MiniCPM-o 4.5 推出官方全功能 Web Demo,基于 PyTorch 与 CUDA 实现。该 Demo 以独立仓库形式发布在 GitHub,提供 MiniCPM-o 4.5 的完整功能演示。
OpenBMB 推出 EdgeClaw,一个基于 OpenClaw 的边缘-云协同个人 AI 助手。该仓库由清华 NLP 团队开源,定位为端云协同架构的个人助理项目。
browser-use 在 GitHub 上线 mix-eval-go,一个用 Go 编写的评测编排器,用于通过浏览器自动化智能体运行 Mix Eval 任务。该仓库目前仅给出这一句功能定位,未披露支持的模型、任务规模或性能数据。
browser-use 推出 Cloud SDK,用于接入其云端浏览器智能体能力。该 SDK 以 browser-use/sdk 仓库形式发布,具体功能与接口细节尚未在现有信息中披露。
Together AI 推出 Dedicated Container Inference,团队自带 Docker 容器部署视频生成、虚拟人合成、图像处理等自定义生成媒体模型,平台负责自动扩缩、队列、流量隔离和监控。
browser-use 推出 webagents.md,让网站直接在浏览器中向 AI 智能体暴露可调用的工具。该仓库目前仅给出这一句说明,未披露具体实现方式、支持的模型或可用范围。
FireRedTeam 推出 AI 视频剪辑智能体 FireRed-OpenStoryline,通过自然语言交互、LLM 驱动的规划与精准工具编排,将手动剪辑转变为意图驱动的导演式创作。该智能体支持人在回路中的透明创作流程,并提供可复用的 Style Skills,以保持叙事风格的一致与专业。
OpenAI 发布 Codex app,定位为基于智能体构建软件的指挥中心。它支持并行运行多个智能体并用 worktrees 隔离各自改动,可将工具和约定打包成可复用的 skills,还支持通过后台定时工作流把重复性工作交给 Codex。目前提供 macOS 下载(https://openai.com/codex),Windows 支持即将推出。
推荐理由:视频给出了 Codex app 的并行多任务、skills 打包和后台自动化等能力与 macOS 下载入口,读者可据此评估其对现有开发流程的影响。
Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的重大升级,由 Devstral 2 模型系列驱动。新增自定义 subagents、多选项澄清、slash 命令技能、统一 agent 模式和自动更新;产品现已在 Le Chat Pro 和 Team 套餐开放,支持按量付费或自带 API key。
推荐理由:官方宣布 Mistral Vibe 2.0 上线,列出 subagents、slash 命令技能等新能力和 Le Chat Pro/Team 套餐与 Devstral 2 定价,读者可据此评估工作流适配。
Sierra 发布 Expert Answers,可在 AI 智能体遇到知识缺口、转交人工客服解决后,自动从该次解决过程生成可审核的知识草稿并回灌给智能体。一家数字健康公司用其基于真实客服对话生成的文章做小流量测试,解决率提升 4% 且未增加客服工作量,随后全面铺开。该功能还可配合 Live Assist 将知识同步给整个客服团队。
OpenAI 宣布 Codex 现已可在 JetBrains IDE 中使用,并与 JetBrains 的 Gleb Melnikov 在一个真实的 Kotlin 多平台项目上演示。
OpenBMB 发布 AgentCPM,一个用于训练和评测各类 LLM 智能体的端到端基础设施。该仓库同时覆盖智能体的训练与评测环节,具体功能、支持模型及可用方式尚未在现有信息中披露。
OpenAI 上线面向开发者文档的公共 MCP 服务器,地址为 https://developers.openai.com/mcp,提供对 developers.openai.com、platform.openai.com 和 learn.chatgpt.com 文档的只读搜索与页面内容访问,可把文档拉入 agent 上下文,不会代用户调用 OpenAI API。
Sierra 发布 Workspaces,把 GitHub、Figma 式的协作模式引入 AI 智能体开发,让团队成员在各自 Workspace 中并行构建、测试,再通过合并生成 snapshot 并发布到 QA、staging 或生产环境。
Mistral 发布 Mistral OCR 3,整体在表单、扫描件、复杂表格和手写内容上对 Mistral OCR 2 达到 74% 胜率。
Sierra 发布 Visual Attachments,让聊天智能体在对话中直接嵌入进度条、安全输入框、快捷按钮等可视化 UI 组件,无需替换对话即可缩短完成路径。这些组件用 React 构建、可在 Agent Studio 中零代码部署,并支持无障碍、响应式与可测量。Rocket Mortgage 的预资格智能体采用后,客户转接银行专员时的转化率在再融资和购房流程中均提升 4 倍。
Gemini 3 Deep Think 模式现已面向 Ultra 用户上线。Noam Shazeer 表示该模式使用并行思考线时,在 ARC-AGI-2 和 HLE 等关键推理基准上有明显提升。
browser-use 上线 gemini-demo 仓库,用于演示 Gemini 3 填写一份模拟申请表。该 demo 展示了 Gemini 3 在浏览器中自动完成表单填写的能力,仓库已在 GitHub 公开。
OpenAI 的 Maja Trębacz 和 Romain Huet 演示如何设置 Codex 自动审查 GitHub 上的新拉取请求以及在 Codex CLI 中进行代码审查,并讨论了训练模型生成高质量代码审查的研究方法。视频还涵盖 Codex 代码审查与静态分析的区别、用 AGENTS.md 自定义审查,入口为 chatgpt.com/codex/code-review。
Mistral AI 推出 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。
Sora、ImageGen 与 Codex 被放在同一条多模态流水线中,串联视频、图像与代码生成工具,指向创意生产工作流。内容聚焦这些工具之间的衔接方式,而非单一模型的独立能力。
OpenAI 推出基于 Sora Video API 和 OpenAI SDK 的 NextJS 示例应用 Sora starter app,提供文本提示词加可选图像输入来生成和 remix 视频的简易 UI。
OpenAI 发布 ChatKit 入门模板仓库,包含两个参考实现:自托管 ChatKit 集成示例和托管 ChatKit 集成示例(含托管工作流)。两个应用均为最小化 ChatKit 集成,可直接运行。
Sam Altman 宣布 Sora 即将推出两项更新:一是给版权方更细粒度的角色生成控制,类似肖像的 opt-in 模式,并特别提到用户与日本内容的深度连接;二是因用户生成量超出预期,将尝试对视频生成收费,并与希望角色被生成的版权方分享部分收入。具体模式仍在试错,目标是先在 Sora 迭代,再在 OpenAI 各产品中统一应用。
Answer.AI 推出 Solveit 平台并开设五周课程 How to Solve it With Code,10 月 20 日前开放报名,此前已有 1000 名预览用户使用一年。
OpenAI 推出名为 Sora 的 App,由新模型 Sora 2 和视频创作分享产品组成,称其为创意的 ChatGPT 时刻。亮点包括 cameo 功能,可把自己和朋友放进视频并保持角色一致性;同时上线防深度伪造、有害内容防护和用户情绪健康定期检查等措施,并承诺优化长期用户满意度、允许用户控制信息流、优先创作和帮助用户实现长期目标。
推荐理由:原文给出 Sora 2 与社交 App 的核心功能、cast 佩戴与防止滥用等措施,以及产品原则,可帮助读者了解其定位与设计取舍。
OpenAI 推出 Agentic Commerce Protocol(ACP),一个连接商家与 ChatGPT 用户的开放标准。该协议支持 ChatGPT 摄取结构化商品目录数据、理解商家库存,并在对话中按上下文展示相关商品。
QwenLM 发布 Qwen3-ASR-Toolkit,这是 Qwen3-ASR API 的官方 Python 工具包,支持并行高吞吐调用、稳健的长音频转写和多采样率。该工具包面向需要批量调用 Qwen3-ASR 语音识别能力的开发者。
FireRedTeam 发布 FireRedChat,一套可完全自托管的全双工语音交互解决方案。该方案面向语音与多模态场景,支持用户自行部署运行,无需依赖外部服务。
上海人工智能实验室 InternLM 项目发布 GroupedGEMM,为 CUTLASS 和 CUBLAS 的分组 GEMM、Permute 与 Unpermute 提供 PyTorch 绑定。该库面向 MoE 等场景中的分组矩阵计算,可直接在 PyTorch 中调用上述算子。