#产品更新
#产品更新
今日 75 条
Google AI Developers@googleaidevsAI 评分4545
Google DeepMind:Blog(RSS)精选AI 评分7070 Google DeepMind 为 Gemini 推出 agentic 视频理解功能
Google DeepMind 推出 agentic video understanding,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,通过智能体循环动态调用原生视频工具按需检索画面、音频和字幕,而非固定帧率静态处理。
推荐理由:原文给出了具体降本增效数字、适用模型和接入方式,开发者可据此评估是否切换视频分析流程。
Z.ai@Zai_orgAI 评分2626
Galaxea Dynamics@GalaxeaDynamicsAI 评分1717不止是双臂。 具身 AI 的起点。 LEMO by Galaxea —— 一个平台,开箱即用,即刻开始构建。 🦾 让创造更快发生。

Hugging Face:Blog(RSS)AI 评分5858 Hugging Face 发布 @huggingface/kernels 及 207 个 WebGPU 内核
Hugging Face WebAI 团队发布 @huggingface/kernels 库和 207 个 Apache-2.0 许可的 WebGPU 内核,每个内核以独立版本化仓库形式发布在 Hub 上,包含 manifest、正确性测试、基准案例和 WGSL 着色器模板。
NVIDIA Technical Blog(开发者技术博客 · RSS)AI 评分3535 在 Claude Science 中运行 NVIDIA BioNeMo NIM 微服务进行蛋白质结构预测
NVIDIA 发布指南,介绍如何在 Claude Science 中运行 BioNeMo NIM 微服务完成蛋白质结构预测。该方案面向可读取论文、提出假设并调用模型的 AI 科学家,用于判断后续实验优先级。正文指出,科研比软件工程更依赖反复评估证据与修正假设,编码智能体已在生产代码中验证价值。
NVIDIA Technical Blog(开发者技术博客 · RSS)AI 评分3434 NVIDIA Omniverse NuRec 如何跨车型平台扩展自动驾驶感知
NVIDIA 介绍用 Omniverse NuRec 解决同一套感知软件换装到 SUV、轿车等不同车型后传感器布局、标定、视场与遮挡变化导致感知结果改变的问题。原文未披露具体版本号、参数规模或性能数字。
Galaxea Dynamics@GalaxeaDynamicsAI 评分3333
Unitree@UnitreeRoboticsAI 评分6565引用Thomas Wolf@Thom_WolfWe have a huge news to share today! Today we are unveiling the first truly accessible RL robot - welcome Microduck A 25 cm tiny open-source biped with 15 actuators and packed with sensors (camera, speaker, LiDAR, NFC, bluetooth, wifi, etc) that you train yourself with reinforcement learning. It's also playable out of the box with more than half a dozen fun and playful pre-trained policies to have it walk, sit, crouch, roller-skate, pick up objects with its articulated beak, and recover on its own. And all for less than $400. See all the details, play with the simulator and order it at: https://pollen-robotics.com/microduck/ (video with sound on 🔊)
Nous Research:GitHub 新仓库AI 评分3131 Nous Research 发布 Hermes Agent 的 BackSearch 插件
Nous Research 推出 Hermes Agent 的 BackSearch 插件,可在冻结的新闻存档上做时间点(point-in-time)网页搜索与抓取。该插件归属 General Reasoning 方向,仓库名为 NousResearch/hermes-plugin-backsearch。
Midjourney:Updates(RSS)AI 评分2828 Midjourney 更新 V8.2 图像编辑模型,提升画质
Midjourney 更新了 V8.2 编辑模型,图像质量得到提升。官方建议过去 24 小时内遇到问题的用户重新尝试,并继续反馈意见。更多更新即将推出。
Midjourney@midjourneyAI 评分3232我们更新了 V8.2 编辑模型,图像质量更好了。如果你在过去 24 小时内遇到任何问题,请再试一次,并继续给我们反馈。谢谢!更多更新即将到来。
NVIDIA Technical Blog(开发者技术博客 · RSS)AI 评分3939 NVIDIA TensorRT Model Connect:两条命令完成开源模型从 Checkpoint 到推理部署
NVIDIA TensorRT Model Connect 提供开源参考实现集合,让开发者用两条命令把开源模型从 checkpoint 直接跑成 TensorRT 推理。它面向原生 C++ 应用,省去针对具体模型的转换、预处理、后处理与运行时代码编写。
Midjourney@midjourneyAI 评分4545Hugging Face:Blog(RSS)AI 评分5151 Open ASR Leaderboard 新增 Monsoon 印地语与印度英语评测集
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 引入 Monsoon en-IN 和 Monsoon hi-IN 两套评测集,其中印地语是该多语言榜单首个印度语言。
Midjourney:Updates(RSS)精选AI 评分6565 Midjourney 开放测试首个 V8.2 图像编辑模型
Midjourney 开始让所有用户测试首个 V8.2 图像编辑模型。该模型支持用指令编辑图像、以最多 4 张图像参考生成新图(替代 omni-reference)、局部重绘(inpainting)与扩图(outpainting),并可用 personalization、moodboards 和 srefs。
推荐理由:官方宣布 V8.2 图像编辑模型开放测试,列出指令编辑、多图参考、局部重绘等能力变化和具体入口。
Google DeepMind:Blog(RSS)AI 评分5454 Google DeepMind 试点全球首个对前沿专有模型的双盲 AI 评估
Google DeepMind 推出全球首个针对专有前沿模型的双盲评估,将外部评估限制在密码学安全的"盒子"中,防止模型提前接触测试题导致基准污染。此次与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境中用机密基准测试一个 Gemini Flash Lite 模型。
Galaxea Dynamics@GalaxeaDynamicsAI 评分3030
Michael Truell@mntruellAI 评分5959引用Grok Bot@botAll SuperGrok and Cursor Pro subscribers now have access to Grok Bot. We're also resetting weekly usage limits for all users. Enjoy!
Lee Robinson@leerobAI 评分5757Lee Robinson 宣布 Bot 现已面向所有付费客户开放,定价每月 20 美元,并已为所有 Bot 客户重置每周用量上限。
引用Lee Robinson@leerobWe just increased the included usage of Grok models in Cursor! Demand has been increasing with the launch of Grok 4.6. We already doubled limits last month with more compute. And now we're raising limits again permanently. Enjoy!
Google DeepMind:Blog(RSS)精选AI 评分6565 Google DeepMind 发布 Gemini 3.5 Transcribe 语音转写模型
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可将原始音频直接转为整洁、带格式的文本。
推荐理由:原文来自官方发布,给出了 WER 数据、双 API 接入方式和开放入口,读者可以据此评估语音转写工作流是否值得迁移。
SpaceXAI@SpaceXAIAI 评分4343在 LiveKit 中使用 Grok Voice 模型,构建实用的语音智能体,全面支持 ZDR
引用LiveKit@livekitWe built a patient intake agent with @SpaceXAI that runs end to end on Grok voice models. Grok STT → Grok 4.3 → Grok TTS, cascaded through LiveKit Inference. Three model strings in one AgentSession. No separate API key, no separate billing, ZDR on every hop. Talk to it: https://xai.livekit.space
NVIDIA Technical Blog(开发者技术博客 · RSS)AI 评分4242 NVIDIA Dynamo 推出影子引擎恢复,LLM 推理容量秒级恢复
NVIDIA Dynamo 预览版新增影子引擎恢复功能,可在 LLM 引擎进程故障后数秒内恢复推理容量,替代需从存储加载权重到 HBM、编译 kernel 并捕获 NVIDIA CUDA graphs 的冷启动路径。大模型冷启动初始化通常耗时数分钟,期间存活 worker 需承接转移流量。
Andrew Ng@AndrewYNgAI 评分5858
Lee Robinson@leerobAI 评分4444我们刚刚提高了 Cursor 中 Grok 模型的包含用量! 随着 Grok 4.6 的发布,需求一直在增长。上个月我们已经通过增加算力将限额翻倍。现在我们将再次永久上调限额。 尽情享用!
NVIDIA Technical Blog(开发者技术博客 · RSS)AI 评分5151 NVIDIA 发布 CUDA Python 1.0:稳定 API、统一基础与完整平台访问
NVIDIA 技术博客宣布 CUDA Python 1.0,主打稳定 API、统一基础和对完整平台的访问。文章指出此前 Python 开发者要用 GPU 只有两条现实路径:学 CUDA C++ 写扩展并维护 Python 绑定,或依赖 PyTorch、CuPy、RAPIDS 等上层库,而后者虽有局限却推动了 Python GPU 生态的繁荣。
Nous Research:GitHub 新仓库AI 评分3636 Nous Research 发布 Hermes Agent 的 Sprites 终端后端插件
Nous Research 为 Hermes Agent 推出 Sprites 终端后端插件,基于 Fly.io 云沙箱提供有状态运行环境,支持 checkpoint 与 restore。该插件已在 GitHub 开源。
Meta Engineering Blog(RSS)AI 评分5252 Meta 发布首款内置 NIC 与通信卸载引擎的自研训练芯片 MTIA 300
Meta 在工程博客发布自研训练芯片 MTIA 300,这是 MTIA 家族中首款针对推荐与排序模型训练优化的加速器。
NVIDIA Technical Blog(开发者技术博客 · RSS)AI 评分2121 NVIDIA Groq 3 LPX 如何在 NVIDIA Vera Rubin 上实现长上下文超快交互
NVIDIA Groq 3 LPX 是 NVIDIA Vera Rubin 平台的交互式 AI 推理加速器,与 Vera Rubin NVL72 搭配可扩展该平台的长上下文交互能力。Vera Rubin NVL72 面向从小型到大型、开源与闭源的最广泛 AI 工作负载,兼顾高吞吐与交互性。
NVIDIA Technical Blog(开发者技术博客 · RSS)AI 评分2121 NVIDIA Vera CPU 如何解决智能体 AI 集群难题
NVIDIA 发文阐述用 Vera CPU 应对智能体 AI 集群挑战:GPU 负责运行模型,CPU 承担编排、工具执行与沙箱计算。文章指出,与传统负载稳定的运行特征不同,智能体工作负载不可预测且波动极大,AI 工厂的集群经济性取决于整个技术栈将电力与资本转化为已完成智能体任务的效率。
Michael Truell@mntruellAI 评分2828本周末我们将向一小部分企业开放 Grok Bot 访问权限。 如果你想让我们明天或周一去你旧金山的办公室为你的团队做上手培训,请回复。
Noah Zweben@noahzwebenAI 评分2525Midjourney:Updates(RSS)AI 评分2929 Midjourney alpha 站点更新:文件夹分组、Upscale/Zoom/Vary 回归与大量修复
Midjourney 为 alpha.midjourney.com 上线两周的大改版推送了一批 UX 改进与 bug 修复,侧边栏新增可折叠的文件夹树分组,支持双击重命名分组并把新文件夹直接归入其中。
NVIDIA Technical Blog(开发者技术博客 · RSS)AI 评分3333 NVIDIA AVO 在 ARC-AGI-3 上达到 100%,展示面向长时程自主智能体的前沿级通用架构
NVIDIA 的 AVO 在 ARC-AGI-3 上取得 100% 成绩,展示了一种面向长时程自主智能体的前沿级通用架构。该工作指出前沿语言模型只是 AI 智能体的一部分,真正决定模型如何接收上下文、使用工具、维持状态、响应反馈、从失败中恢复并在长任务中持续推进的,是外围的智能体系统(常称为 harness)。
Meituan LongCat@Meituan_LongCatAI 评分3131好消息!LongCat-2.0 搭配 Hermes Agent 的免费使用已再延长两周 🐱 在 @NousResearch Portal 上有更多时间体验!
引用Meituan LongCat@Meituan_LongCatLongCat-2.0 is now live on the @NousResearch Portal and free to try with Hermes Agent for one week! 🐱
World Labs@theworldlabsAI 评分3636在 LED 舞台上以全尺寸观看这些世界令人着迷。 从 16K LED 体积到实时制作工作流,以下是 Marble 在虚拟制作和 VFX 中的几种用法 ↓

Sierra:Blog(RSS)AI 评分4747 Sierra 为大规模智能体推出发布治理功能
Sierra 将发布治理直接内置到平台,用 Agent Checks、Simulations、合并审批工作流和分流发布,把变更从 Workspace 安全推进到线上客户对话。
Google Cloud:Databases(RSS)AI 评分3737 AlloyDB ScaNN 如何将向量搜索扩展至 100 亿向量
AlloyDB 的 ScaNN 索引通过新增四级树(preview)架构与内存优化,将向量搜索规模扩展至 100 亿向量。内部测试中,该索引在 100 亿向量下实现 ≤51 ms p95 延迟与 95% 召回率,搜索复杂度由三级树的 O(N^1/3) 降至 O(N^1/4)。四级树已开放 preview,可按快速入门指南部署。
Mistral AI:News(网页)精选AI 评分7171 Mistral 发布 Agentic Search,FinanceBench 准确率从 26.7% 升至 86%
Mistral 发布 Agentic Search,一种多步检索层,让模型在复杂文档中查找、翻阅并核实信息,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环的工具设计与两组基准数据,可对照一次性 RAG 判断适用边界。
vLLM 官方博客(RSS)AI 评分4343 VeRL-Omni v0.2.0 发布:更快的扩散模型 RL 与稳定的全模态训练
VeRL-Omni v0.2.0 发布,通过 vLLM-Omni 的请求级批处理让 Qwen-Image FlowGRPO rollout 的 GPU 利用率从约 80% 升至约 100%,单次生成时间从 226s 降至 108s,减少 52%。