Gemini 3.7 Flash is here. It’s stronger for coding, knowledge work, and web development. 🧵
推荐理由:DeepMind 官方宣布 Gemini 3.7 Flash 发布,写明了能力方向和半价定价,读者可据此评估是否替换现有模型。
Gemini 3.7 Flash is here. It’s stronger for coding, knowledge work, and web development. 🧵
推荐理由:DeepMind 官方宣布 Gemini 3.7 Flash 发布,写明了能力方向和半价定价,读者可据此评估是否替换现有模型。
Google DeepMind 发布 Gemini 3.7 Flash,称其为迄今最智能的主力模型,面向编码与 Agent 场景,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方博客给出具体评测分数与限时定价,读者可以据此评估 Flash 系列在编码、Web 开发和知识工作上的实际提升。
FireRedTeam 发布 FireRedTTS3,一款支持多语言与多方言的语音克隆模型,同时具备指令引导的音色设计和语音编辑能力。该模型将语音克隆、音色设计与语音编辑整合在同一系统中,具体参数规模与可用性尚未在原文中披露。
Introducing Grok 4.6. It delivers frontier intelligence and is a significant improvement over Grok 4.5 at the same price.
推荐理由:转发并补充了 Grok 4.6 在难度任务和知识工作上更强、兼顾低成本低速度的定位,可作了解该版本能力方向的参考。
Google DeepMind 发布大规模多语言手语转文本模型 SL2T,为 Gboard 和 Pixel 11 的 Live Transcribe 带来手语转文字听写,首先支持 ASL 转英语,后续将扩展更多语言和设备。
推荐理由:原文解释了手语翻译的两类核心难题和 SL2T 的技术取舍,并给出基准分数与隐私设计,读者可了解可用手语 AI 的实现路径。
vLLM 宣布 Day-0 支持 Qwen3.8-2.4T-A95B,这是 Qwen 家族首个以开放权重发布的 Qwen-Max 级模型,基于 Qwen 3.5 架构开箱即用。
推荐理由:原文给出 Qwen3.8-2.4T-A95B 的架构细节、多精度权重和部署要求,读者可据此评估自建推理的成本与硬件门槛。
Introducing NVIDIA Nemotron 3.5 Lightning⚡ An open 30B MoE model with 3B active parameters, built for always-on agents to complete high-volume, specialized tasks faster. It delivers up to 4x the output speed of similar-sized models.
Moonshot AI's latest open-weight model, Kimi K3, is now available on Databricks through Unity AI Gateway. @Kimi_Moonshot Run Kimi K3 where your data already lives - governed, secure, and ready for custom AI apps and agents built with the data in your Lakehouse. Unity AI Gateway lets you deploy Kimi K3 with enterprise-grade access controls. Govern every call, monitor performance, and scale securely across your AI apps. Test Kimi K3 alongside other frontier models without changing your application code. The open-weight frontier just arrived on Databricks. Try it today. https://www.databricks.com/blog/kimi-k3-moonshot-ai-now-available-databricks-through-unity-ai-gateway
NVIDIA 发布 Magpie Multilingual TTS 开放权重模型(364M 参数),支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,可在自有基础设施部署并微调。
NVIDIA 与 vLLM 团队宣布 Day-0 支持 Nemotron 3.5 Lightning,这是一个面向常驻智能体的开源混合 MoE 模型,总参数 30B、每 token 激活 3B,上下文最长 1M token,从 Nemotron 3 Ultra 蒸馏而来。
Meta 发布 30B 参数多模态开源模型 Muse Glimmer,由 Muse 蒸馏而来,采用 Apache 2.0 许可,主打本地智能体用途如编码、文档分析和个人助理。
推荐理由:发布方提供了架构细节、完整基准对比和多种部署路径,读者可以据此评估它在本地智能体场景的适配性。
Mistral 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,将内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略,无需重训即可适配文本与图像审核。它以 Apache 2.0 协议开放权重,在文本安全上匹敌最大 7 倍于其体积的开放审核模型,可在单张 16GB NVIDIA GPU 上运行,并输出经校准的连续安全分数。
推荐理由:原文说明了将审核策略写成自然语言问题即可在推理时切换的机制,读者可据此评估它替代固定分类审核模型的可行性。
Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。
推荐理由:官方开源了环境服务和三条训练配方,小参数量模型在 SWE-bench Verified 等基准上的具体结果可直接对照复用。
美团 LongCat 发布 LongCat-Flash-Lite-Sparse,这是一个非思考型 MoE 模型,总参数 69B,每 token 激活约 3B,用 LongCat Sparse Attention(LSA)替换稠密 MLA,原生支持最长 1M token 上下文。
Today, we are releasing Inkling-Small. Inkling-Small achieves comparable performance to Inkling at a quarter of its size. It features 276B total parameters, 12B active. We are making the full weights available. https://thinkingmachines.ai/news/inkling-small/ Fine-tune it on Tinker today, or chat with it in text, image, and audio on Tinker Playground.
推荐理由:原文给出参数规模、权重开放和在 Tinker 上微调与对话的入口,读者可评估其部署与使用路径。
Google DeepMind 发布 Gemini Robotics ER 2,面向机器人的具身推理模型,支持视频理解、任务进度跟踪、工具编排与多机器人协作,并可将执行交给下层 VLA 模型。
推荐理由:官方发布给出进度分类、moment finding 等具体数字和公开 API 入口,读者可以据此评估其机器人编排与视频理解能力。
Google DeepMind 发布 Gemini Robotics 2 系列,包含全身控制的 VLA 模型、具身推理模型 ER 2 和可本地运行的 On-Device 2。
推荐理由:官方完整说明了三个模型的能力分工、适配速度与安全基准,读者可以据此了解具身智能模型的实际能力边界。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,通过 FlashDreams 推理库在单张 RTX PRO 6000 GPU 上运行,支持人与策略闭环交互控制。
Midjourney 推出 V8.2 图像模型,本次更新聚焦美学、图像质量与个性化。官方称图像将更具创意、大胆、精致、前卫和新颖,低质量图像的随机情况应会大幅减少。V8.2 的个性化档案拥有更大且更优的图像池,能更好理解用户个人品味,尤其适合在个人档案下积累了大量评分的用户。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款模型,面向大规模 AI agent 构建。
推荐理由:官方发布三款 Gemini Flash 模型,给出具体价格、token 效率与多项基准对比,读者可据此评估 agent 工作流的成本与选型。
OpenBMB(清华 NLP)在 GitHub 新建仓库 MiniCPM-Robot,定位为面向机器人的更智能、更快的端侧 AI 大脑。该仓库目前仅给出这一句定位描述,尚未披露模型参数规模、benchmark 分数或具体可用形式。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于快速发现、验证并修复漏洞,将通过限access试点先面向政府和可信伙伴经 CodeMender 开放。
推荐理由:以轻量模型多次调用替代单次大模型调用做漏洞挖掘,并用 Chrome 真实流水线等无污染基准展示对比结果,方法与数据都可参考。
Today, we are introducing Inkling. Inkling reasons efficiently across text, image, and audio modalities. We are making the full weights available. https://thinkingmachines.ai/news/introducing-inkling/ Available today for fine-tuning on Tinker. Play with it in the Inkling Playground. 🧵
Today, we are introducing Inkling. Inkling reasons efficiently across text, image, and audio modalities. We are making the full weights available. https://thinkingmachines.ai/news/introducing-inkling/ Available today for fine-tuning on Tinker. Play with it in the Inkling Playground. 🧵
推荐理由:Thinking Machines 发布首个模型 Inkling,开放全部权重并支持 Tinker 微调,可关注其跨模态推理的落地方式。
推荐理由:原文给出多模态能力、开放权重和两个可用入口,读者可以据此了解获取和试用方式。
Thinking Machines Lab 发布多模态 MoE 模型 Inkling,Together AI 在发布当天通过 Serverless 提供托管推理,支持 1M 上下文窗口和 OpenAI 兼容 API。
推荐理由:原文给出 Inkling 的架构细节、参数规模和初步评测数据,读者可以据此判断其推理与多模态能力是否适合接入。
Thinking Machines 在 Hugging Face 上发布开源多模态模型 Inkling,共 975B 总参数、41B 激活参数,支持 1M 上下文,原生接收图像、文本和音频输入,训练数据为 45 万亿 token,并同时发布 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:文章给出了 Inkling 的架构细节、各档位 VRAM 需求和多条部署路径,便于读者评估在自己的硬件上运行哪种变体。
Mistral 发布首个具身导航模型 Robostral Navigate,8B 参数,仅靠单个普通 RGB 摄像头、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单摄像头方案高 9.7 分、比最佳多传感器方案高 4.5 分。
美团发布 LongCat-2.0,总参数 1.6 万亿的 MoE 大语言模型,每 token 激活约 48B,权重以 MIT 协议开源。预训练覆盖超过 35 万亿 token,训练与部署全程基于 AI ASIC 超算集群;模型引入 LongCat Sparse Attention,并在 1M 上下文数据上训练,支持 GPU 与 NPU 部署。
美团发布 LongCat-2.0,一个总参数 1.6 万亿、每 token 激活约 480 亿的 MoE 大语言模型,训练与部署完全基于 AI ASIC 超节点,预训练消耗超过 35 万亿 token。
美团 LongCat 团队发布 LongCat-2.0,总参数 1.6 万亿、每 token 激活约 480 亿的 MoE 大语言模型,权重以 MIT 协议开源。
Mistral AI 发布 Apache-2.0 协议的 Leanstral 1.5,总参数 119B、激活 6B,专注 Lean 4 形式化证明工程。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),称其为 Nano Banana 家族中最快。
推荐理由:官方同时推出 Nano Banana 2 Lite 与 Gemini Omni Flash,给出了价格、延迟和限制等可核对的发布细节。
Google Research 发布面向表格数据分类与回归的零样本基础模型 TabFM,将表格预测框定为 ICL 问题,一次前向传播即可生成预测,无需手动训练、调参或特征工程。
Mistral 发布 OCR 4 文档解析模型,除提取文本外返回边界框、块类型分类和逐词置信度分数,支持 170 种语言,可单容器自托管部署。
推荐理由:官方说明新模型的结构化输出能力、定价和基准局限,读者可据此判断它在文档解析流程中的适配场景。
Midjourney 宣布经过测试和反馈后,默认模型已从 V7 更新为 V8.1。V8.1 更聪明、更连贯,更好地遵循详细提示词并渲染文字;开启 HD 模式后图像尺寸为 V7 的两倍、分辨率 4 倍,SD 模式 4 秒、HD 模式 12 秒出图。风格参考、个性化与美学在 V7 与 V8.1 间保持一致;V7 的 omni-reference 仍可使用,V8.0 alpha 将在两周后弃用。
Google DeepMind 发布实验性开源模型 DiffusionGemma,基于文本扩散方法,在专用 GPU 上实现最高 4 倍的文本生成提速。该模型为 26B 总参数的 MoE,推理时仅激活 3.8B 参数,量化后可装入 18GB 显存,单张 NVIDIA H100 上超过 1000 tokens 每秒,RTX 5090 上超过 700 tokens 每秒。
推荐理由:官方给出具体吞吐数字、显存占用和质量取舍,读者可据此判断它适不适合本地交互式工作流。
小米 MiMo 在 GitHub 上线新仓库 MiMo-Code,定位为模型与智能体协同进化。仓库标题为“MiMo Code: Where Models and Agents Co-Evolve”,目前公开信息仅包含仓库名称与这一主题表述。