Google DeepMind 发布 Gemini Omni 1.1 Flash,强化生成式视频控制能力
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 和 Google AI Studio 面向开发者提供新的创意控制与生成式视频能力。
推荐理由:原文来自官方,列出了各能力具体参数、速度和价格差异,开发者可据此评估是否接入自己的视频工作流。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 和 Google AI Studio 面向开发者提供新的创意控制与生成式视频能力。
推荐理由:原文来自官方,列出了各能力具体参数、速度和价格差异,开发者可据此评估是否接入自己的视频工作流。
All SuperGrok and Cursor Pro subscribers now have access to Grok Bot. We're also resetting weekly usage limits for all users. Enjoy!
Lee Robinson 宣布 Bot 现已面向所有付费客户开放,定价每月 20 美元,并已为所有 Bot 客户重置每周用量上限。
We just increased the included usage of Grok models in Cursor! Demand has been increasing with the launch of Grok 4.6. We already doubled limits last month with more compute. And now we're raising limits again permanently. Enjoy!
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可将原始音频直接转为整洁、带格式的文本。
推荐理由:原文来自官方发布,给出了 WER 数据、双 API 接入方式和开放入口,读者可以据此评估语音转写工作流是否值得迁移。
在 LiveKit 中使用 Grok Voice 模型,构建实用的语音智能体,全面支持 ZDR
We built a patient intake agent with @SpaceXAI that runs end to end on Grok voice models. Grok STT → Grok 4.3 → Grok TTS, cascaded through LiveKit Inference. Three model strings in one AgentSession. No separate API key, no separate billing, ZDR on every hop. Talk to it: https://xai.livekit.space
NVIDIA Dynamo 预览版新增影子引擎恢复功能,可在 LLM 引擎进程故障后数秒内恢复推理容量,替代需从存储加载权重到 HBM、编译 kernel 并捕获 NVIDIA CUDA graphs 的冷启动路径。大模型冷启动初始化通常耗时数分钟,期间存活 worker 需承接转移流量。
我们刚刚提高了 Cursor 中 Grok 模型的包含用量! 随着 Grok 4.6 的发布,需求一直在增长。上个月我们已经通过增加算力将限额翻倍。现在我们将再次永久上调限额。 尽情享用!
NVIDIA 技术博客宣布 CUDA Python 1.0,主打稳定 API、统一基础和对完整平台的访问。文章指出此前 Python 开发者要用 GPU 只有两条现实路径:学 CUDA C++ 写扩展并维护 Python 绑定,或依赖 PyTorch、CuPy、RAPIDS 等上层库,而后者虽有局限却推动了 Python GPU 生态的繁荣。
Nous Research 为 Hermes Agent 推出 Sprites 终端后端插件,基于 Fly.io 云沙箱提供有状态运行环境,支持 checkpoint 与 restore。该插件已在 GitHub 开源。
Hugging Face 发布 gr.Workflow 实用指南,介绍 Gradio 内置的工作流功能:用户把步骤描述为带类型的节点图,Gradio 提供可拖拽画布,每个节点可单独运行、中间结果可见,同一张图自动成为 REST API 并可一键部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.Workflow 的节点图构建、REST API 调用和 Spaces 部署的完整示例,读者可直接 Duplicate 改造成自己的流程。
NVIDIA Groq 3 LPX 是 NVIDIA Vera Rubin 平台的交互式 AI 推理加速器,与 Vera Rubin NVL72 搭配可扩展该平台的长上下文交互能力。Vera Rubin NVL72 面向从小型到大型、开源与闭源的最广泛 AI 工作负载,兼顾高吞吐与交互性。
NVIDIA 发文阐述用 Vera CPU 应对智能体 AI 集群挑战:GPU 负责运行模型,CPU 承担编排、工具执行与沙箱计算。文章指出,与传统负载稳定的运行特征不同,智能体工作负载不可预测且波动极大,AI 工厂的集群经济性取决于整个技术栈将电力与资本转化为已完成智能体任务的效率。
本周末我们将向一小部分企业开放 Grok Bot 访问权限。 如果你想让我们明天或周一去你旧金山的办公室为你的团队做上手培训,请回复。
Midjourney 为 alpha.midjourney.com 上线两周的大改版推送了一批 UX 改进与 bug 修复,侧边栏新增可折叠的文件夹树分组,支持双击重命名分组并把新文件夹直接归入其中。
NVIDIA 的 AVO 在 ARC-AGI-3 上取得 100% 成绩,展示了一种面向长时程自主智能体的前沿级通用架构。该工作指出前沿语言模型只是 AI 智能体的一部分,真正决定模型如何接收上下文、使用工具、维持状态、响应反馈、从失败中恢复并在长任务中持续推进的,是外围的智能体系统(常称为 harness)。
好消息!LongCat-2.0 搭配 Hermes Agent 的免费使用已再延长两周 🐱 在 @NousResearch Portal 上有更多时间体验!
LongCat-2.0 is now live on the @NousResearch Portal and free to try with Hermes Agent for one week! 🐱
在 LED 舞台上以全尺寸观看这些世界令人着迷。 从 16K LED 体积到实时制作工作流,以下是 Marble 在虚拟制作和 VFX 中的几种用法 ↓
Sierra 将发布治理直接内置到平台,用 Agent Checks、Simulations、合并审批工作流和分流发布,把变更从 Workspace 安全推进到线上客户对话。
AlloyDB 的 ScaNN 索引通过新增四级树(preview)架构与内存优化,将向量搜索规模扩展至 100 亿向量。内部测试中,该索引在 100 亿向量下实现 ≤51 ms p95 延迟与 95% 召回率,搜索复杂度由三级树的 O(N^1/3) 降至 O(N^1/4)。四级树已开放 preview,可按快速入门指南部署。
Mistral 发布 Agentic Search,一种多步检索层,让模型在复杂文档中查找、翻阅并核实信息,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环的工具设计与两组基准数据,可对照一次性 RAG 判断适用边界。
Hugging Face 在 GitHub 发布 huggingface/s2-cli 仓库,提供一个查询 Semantic Scholar 的命令行界面(CLI)和 Skill,面向智能体和人类使用。
VeRL-Omni v0.2.0 发布,通过 vLLM-Omni 的请求级批处理让 Qwen-Image FlowGRPO rollout 的 GPU 利用率从约 80% 升至约 100%,单次生成时间从 226s 降至 108s,减少 52%。
browser-use 在 GitHub 发布 macos-harness 仓库,定位是最简单、最精简的 harness,让大语言模型完全自由地控制一台 Mac。
vLLM-Omni 团队发布 Distributed Layerwise Offload,让超过单卡 HBM 的视频生成模型(如 Cosmos3-Super 64B / 124 GB)可在多块 NPU 或 GPU 上运行。
vLLM 在 PR #47808 中引入 DSpark 置信度调度验证(enable_adaptive_verification),让引擎逐步决定验证多少 draft token,而非按部署固定 num_speculative_tokens。
Google Cloud 为 BigQuery Graph 引入 measures(预览版),把受治理的指标与关系映射统一起来,让 AI 智能体在图上跨多跳依赖进行推理。
Nous Research 在 GitHub 发布 Hermes-Bot-Mode,为 Hermes 桌面端带来 Bot Mode,提供一组具名智能体,各自拥有独立聊天、头像、例程,并支持智能体间互发消息。该功能以桌面插件形式实现,无需修改核心代码。
推荐理由:原文给出 Harness 的插件化架构设计和 MIT 开源仓库入口,开发者可据此评估是否接入自己的 Agent 开发流程。
DeepSeek 在 GitHub 新建 deepseek-harness 仓库,核心理念是"一切皆插件"。该仓库以插件化架构组织功能,具体能力与可用性尚未在现有信息中披露。
AllenAI 的 OlmoEarth Studio 现已支持计算并导出 OlmoEarth 开源基础模型的 embedding 向量,源代码、模型权重和研究论文公开可查。
Google DeepMind 发布大规模多语言手语转文本模型 SL2T,为 Gboard 和 Pixel 11 的 Live Transcribe 带来手语转文字听写,首先支持 ASL 转英语,后续将扩展更多语言和设备。
推荐理由:原文解释了手语翻译的两类核心难题和 SL2T 的技术取舍,并给出基准分数与隐私设计,读者可了解可用手语 AI 的实现路径。
Sierra 称其 Horizon 智能体可为每位潜在客户配备一名 AI 智能体,持续数天、数周甚至数月主动跟进,直到客户购买或放弃。文中以车险为例,AI 智能体 Jamie 在客户保存报价后当晚即发短信,第 4 天解答保险条款问题,第 7 天完成通话并促成保单购买。Sierra 表示该智能体遵循企业合规要求,沟通内容由企业控制。