Midjourney 开放测试首个 V8.2 图像编辑模型
Midjourney 开始让所有用户测试首个 V8.2 图像编辑模型。该模型支持用指令编辑图像、以最多 4 张图像参考生成新图(替代 omni-reference)、局部重绘(inpainting)与扩图(outpainting),并可用 personalization、moodboards 和 srefs。
推荐理由:官方宣布 V8.2 图像编辑模型开放测试,列出指令编辑、多图参考、局部重绘等能力变化和具体入口。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
Midjourney 开始让所有用户测试首个 V8.2 图像编辑模型。该模型支持用指令编辑图像、以最多 4 张图像参考生成新图(替代 omni-reference)、局部重绘(inpainting)与扩图(outpainting),并可用 personalization、moodboards 和 srefs。
推荐理由:官方宣布 V8.2 图像编辑模型开放测试,列出指令编辑、多图参考、局部重绘等能力变化和具体入口。
Google DeepMind 发布 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可将原始音频直接转为整洁、带格式的文本。
推荐理由:原文来自官方发布,给出了 WER 数据、双 API 接入方式和开放入口,读者可以据此评估语音转写工作流是否值得迁移。
Mistral 发布 Agentic Search,一种多步检索层,让模型在复杂文档中查找、翻阅并核实信息,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环的工具设计与两组基准数据,可对照一次性 RAG 判断适用边界。
推荐理由:原文给出 Harness 的插件化架构设计和 MIT 开源仓库入口,开发者可据此评估是否接入自己的 Agent 开发流程。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的可用性承诺。
推荐理由:Mistral 把区域推理端点、SLA 优先级层与第三方开源模型接入放在同一套基础设施上,读者可据此判断主权 AI 的落地方式。
major price cuts today: *80% drop for GPT-5.6 Luna, now $0.20 per million input tokens and $1.20 per million output *20% drop for GPT-5.6 Terra, to $2/$12 *GPT-5.6 Sol gets Fast mode in the API, up to 2.5x the speed for 2x the price, same intelligence
推荐理由:OpenAI 首席研究官转述官方降价信息,读者可以据此更新 GPT-5.6 系列的 API 用量成本。
vLLM 宣布对月之暗面 Kimi K3 提供 Day-0 高效支持。Kimi K3 是 2.8 万亿参数的 MoE 多模态模型,每 token 激活 896 个专家中的 16 个,基于 Kimi Delta Attention 与 Attention Residuals,支持 1M token 上下文窗口。
推荐理由:vLLM 官方详述 Kimi K3 的服务适配与内核优化,读者可以据此了解 2.8T 混合 MoE 的生产部署配方和性能数据。
Hugging Face 宣布 Diffusers 原生支持 Nunchaku Lite,可像普通模型一样用 from_pretrained() 加载 SVDQuant 4-bit (W4A4) 检查点,无需单独推理引擎或本地 CUDA 编译,内核经 kernels 包从 Hub 下载。
推荐理由:Diffusers 原生支持 Nunchaku 4-bit 推理,附带基准数据和自己量化模型的完整流程,适合关注消费级显卡跑扩散模型的读者。
vLLM 发布 Kimi K3 生产级支持的预览博客,正与 Moonshot AI、NVIDIA、AMD 等推进最终集成,计划在 2026 年 7 月 27 日权重发布时提供 day-0 开源服务,包括模型实现、Docker 镜像和部署方案。
推荐理由:vLLM 团队详解 KDA 混合架构带来的前缀缓存改造与内核优化,对部署混合注意力模型的工程团队有可迁移参考价值。
Sierra 发布内部云智能体 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、组织和自动化云端 Agent 会话,底层由 app server、Agency 与 runner 三部分组成,沙箱内运行 Codex 或 Claude Code 并以 AG-UI 协议适配。
推荐理由:Sierra 自述内部云智能体的架构与落地数据,读者可以了解如何把员工经验沉淀为可复用的会话与技能。
vLLM 宣布 Day-0 支持 Thinking Machines Lab 的 1T 参数多模态模型 TML Inkling,提供 thinkingmachines/Inkling-NVFP4 和 BF16 两个版本。
推荐理由:官方详解了 Day-0 支持背后的 sconv 缓存、TP 分片和 MTP 处理等优化,读者可迁移到类似新架构的推理部署。
Hugging Face 宣布 vLLM 的 transformers 建模后端现在达到甚至超过 vLLM 原生实现的吞吐速度,模型作者无需移植代码即可用 --model-impl transformers 获得 vLLM 级推理性能。
推荐理由:官方给出了与 vLLM 原生实现对比的具体吞吐数字和使用方法,读者可以据此判断是否切换到自己已有的 transformers 模型工作流。
Microsoft Build 2026 上宣布 Foundry Managed Compute 以及 Hugging Face 模型精选目录,数千个开源权重模型每周更新,可一键部署到 Foundry Managed Compute,支持 NVIDIA A100、H100 和 AMD MI300X。
推荐理由:原文完整说明了精选模型目录、策展管线和运行时选择,读者可以据此评估在私有网络内部署开源模型的路径。
SkyPilot 与 Hugging Face 联合推出 store: hf,把 Hugging Face Storage 作为 SkyPilot 的一等存储后端,用一个 hf:// URL 和现有 HF_TOKEN 即可把 Bucket 或 Hub 仓库挂载进任意云上的任务。
推荐理由:两家联合发布 store: hf,给出了零出口费读取、MOUNT/COPY 用法和实测写入速度,读者可以据此评估多云 GPU 训练的存储方案。
Hugging Face 发布 LeRobot v0.6.0,引入 VLA-JEPA、FastWAM、LingBot-VA 等世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:发布方系统列出世界模型策略、奖励模型 API、新基准与部署 CLI 等更新,读者可以据此评估机器人学习工作流的变化。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,从此前的独立 Gemini 2.5 computer use 模型整合进主力 Flash 模型,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能在浏览器、移动和桌面环境操作的智能体。
推荐理由:原文给出 computer use 内置于 Gemini 3.5 Flash 的能力和安全措施,读者可据此评估在自动化任务中的可用性。
vLLM 宣布对 MiniMax M3 家族的 day-0 支持,涵盖 MiniMaxAI/MiniMax-M3 与 MiniMax-M3-MXFP8 两个检查点,支持 1M token 上下文和图像、视频多模态输入。
推荐理由:vLLM 团队自己拆解了 day-0 支持背后的 MSA 内核、缓存和部署细节,读者可以按需套用其部署配方。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70+ 语言的近实时语音到语音翻译,自动检测语言并保留说话人的语调、节奏和音高,全程仅落后说话人数秒。
推荐理由:原文来自 Google DeepMind 官方博客,说明了 Gemini 3.5 Live Translate 的能力细节和各端开放入口,读者可据此评估实时语音翻译的实际可用范围。
vLLM Semantic Router 发布 v0.3 版本 Themis,推出规范化 v0.3 配置契约、投影机制和首个生产可用的会话感知智能体路由(SAAR),并强化协议兼容、仪表盘运维控制台与 CLI。
推荐理由:版本把信号、投影、决策到模型选择收敛为统一契约,并引入会话感知路由,适合关注生产级流量治理的团队参考。
Mistral 发布统一 AI 智能体 Vibe,Le Chat 整体升级为 Vibe,原有对话、设置与套餐全部迁移。Work Mode 处理跨企业工具的多步骤长任务,如邮件日历跟进、深度研究、文档撰写和定时任务;Code Mode 从网页发起远程编码会话直至生成 PR,并推出 VS Code 扩展和更新的 CLI(新增 /teleport、权限控制等)。
推荐理由:官方发布说明写清了 Le Chat 升级为 Vibe 后的工作与编码两大模式、各端入口和定价,可据以评估是否替换现有工作流。