QwenLM 发布 Qwen-Drive-1.0:面向自动驾驶的视觉语言基础模型
QwenLM 推出 Qwen-Drive-1.0,作为面向自动驾驶的视觉语言基础模型迈出的第一步。该模型定位为自动驾驶领域的视觉语言基础模型,具体参数规模、benchmark 分数与开放方式尚未在原文中披露。
QwenLM 推出 Qwen-Drive-1.0,作为面向自动驾驶的视觉语言基础模型迈出的第一步。该模型定位为自动驾驶领域的视觉语言基础模型,具体参数规模、benchmark 分数与开放方式尚未在原文中披露。
LongCat-2.0 now available in Go 1.6T/48B · 1M context · fully open source
推荐理由:LongCat 官方宣布模型接入 opencode,读者可以了解该开源模型在编码工具中的可用入口。
Qwen 团队(阿里巴巴集团)开发了基础模型 Qwen3.8-Flash-Next。该模型由 QwenLM 仓库发布,具体参数规模、上下文长度与可用方式尚未在原文中披露。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,采用推测解码,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍,输出质量不变。
推荐理由:原文给出各模型在 GPU 和端侧的实测加速数据与 llama.cpp、SGLang 接入命令,读者可直接评估是否用于部署。
SemiAnalysis 深度解读 Cerebras 新发布的第四代机架 CS-4:它沿用第三代 5nm WSE-3 晶圆级引擎,靠提高功耗和时钟频率、提升机架密度(每机架 3 个晶圆,TDP 约 125-135kW)实现性能翻倍,片外 I/O 从 1.2Tb/s 升至 2.4Tb/s,晶圆间延迟从 5 微秒降到 3 微秒。
Grok 4.6 在 DiligenceBench 金融测试中以约 52–53% 位列第 2,与 Claude Opus 5 基本持平,Sonnet 5 以 46.2% 落后。
蚂蚁 inclusionAI 在 GitHub 上线 ConceptEdit 项目,包含 ConceptEdit-12M 数据集与 ConceptEdit-Bench 基准。目前公开信息仅给出这两个名称,尚未披露模型规模、评测分数或使用方式等细节。
蚂蚁 inclusionAI 在 GitHub 上线 SingProbe 官方训练代码仓库。正文仅说明这是 SingProbe 的官方训练代码,未披露模型规模、训练数据或评测结果等细节。
Together AI 在 DeepSWE 全部 113 个任务上各跑 4 次试验,对比 DeepSeek V4 Pro 0813 与 Claude Fable 5。
推荐理由:原文基于 904 次 rollout 的实测数据,给出两模型在成本、失败模式和级联路由上的可迁移用法。
Gemini 3.7 Flash is here. It’s stronger for coding, knowledge work, and web development. 🧵
推荐理由:DeepMind 官方宣布 Gemini 3.7 Flash 发布,写明了能力方向和半价定价,读者可据此评估是否替换现有模型。
Google DeepMind 发布 Gemini 3.7 Flash,称其为迄今最智能的主力模型,面向编码与 Agent 场景,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方博客给出具体评测分数与限时定价,读者可以据此评估 Flash 系列在编码、Web 开发和知识工作上的实际提升。
FireRedTeam 发布 FireRedTTS3,一款支持多语言与多方言的语音克隆模型,同时具备指令引导的音色设计和语音编辑能力。该模型将语音克隆、音色设计与语音编辑整合在同一系统中,具体参数规模与可用性尚未在原文中披露。
Introducing Grok 4.6. It delivers frontier intelligence and is a significant improvement over Grok 4.5 at the same price.
推荐理由:转发并补充了 Grok 4.6 在难度任务和知识工作上更强、兼顾低成本低速度的定位,可作了解该版本能力方向的参考。
Google Research 推出基于 Gemini 和 Project Astra 的 AMIE (Video),可进行实时视频临床问诊,感知非语言视觉和听觉线索并引导虚拟体格检查。
推荐理由:原文给出三智能体架构和随机对照结果,读者可以据此了解实时视频问诊 AI 的设计思路与评估方法。
Introducing NVIDIA Nemotron 3.5 Lightning⚡ An open 30B MoE model with 3B active parameters, built for always-on agents to complete high-volume, specialized tasks faster. It delivers up to 4x the output speed of similar-sized models.
NVIDIA 发布 Magpie Multilingual TTS 开放权重模型(364M 参数),支持 12 种语言,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,可在自有基础设施部署并微调。
Meta 发布 30B 参数多模态开源模型 Muse Glimmer,由 Muse 蒸馏而来,采用 Apache 2.0 许可,主打本地智能体用途如编码、文档分析和个人助理。
推荐理由:发布方提供了架构细节、完整基准对比和多种部署路径,读者可以据此评估它在本地智能体场景的适配性。
Nous Research 在 GitHub 开源 hermes-toolperf-evals,为 hermes-agent #77056 的 15-PR 工具效率追踪提供核心工具集 A/B 评测框架与基准用例。该框架的数据来自 session-DB 挖掘、NeMo Relay traces 和生产错误分类体系。
Google DeepMind 在 Nature 发表 WeatherNext AI 模型研究,对气旋路径、强度和风结构的预报平均多出超过 24 小时提前量,相当于约十年的气象学进步。
推荐理由:官方介绍论文与开源模型的关键结果,读者可以据此评估其对气象预报和研究的可用性。
OpenAI 在 GitHub 上线 openai/ten-proofs 仓库,收录数学与理论计算机科学中十个证明的 Lean 证书。
Mistral 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,将内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略,无需重训即可适配文本与图像审核。它以 Apache 2.0 协议开放权重,在文本安全上匹敌最大 7 倍于其体积的开放审核模型,可在单张 16GB NVIDIA GPU 上运行,并输出经校准的连续安全分数。
推荐理由:原文说明了将审核策略写成自然语言问题即可在推理时切换的机制,读者可据此评估它替代固定分类审核模型的可行性。
Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。
推荐理由:官方开源了环境服务和三条训练配方,小参数量模型在 SWE-bench Verified 等基准上的具体结果可直接对照复用。
本期开源模型汇总收录多批新发布,包括 Thinking Machines 首个模型 Inkling(975B-A41B 多模态 MoE,另有 276B-A12B 版)。
美团 LongCat 发布 LongCat-Flash-Lite-Sparse,这是一个非思考型 MoE 模型,总参数 69B,每 token 激活约 3B,用 LongCat Sparse Attention(LSA)替换稠密 MLA,原生支持最长 1M token 上下文。
major price cuts today: *80% drop for GPT-5.6 Luna, now $0.20 per million input tokens and $1.20 per million output *20% drop for GPT-5.6 Terra, to $2/$12 *GPT-5.6 Sol gets Fast mode in the API, up to 2.5x the speed for 2x the price, same intelligence
推荐理由:OpenAI 首席研究官转述官方降价信息,读者可以据此更新 GPT-5.6 系列的 API 用量成本。
Today, we are releasing Inkling-Small. Inkling-Small achieves comparable performance to Inkling at a quarter of its size. It features 276B total parameters, 12B active. We are making the full weights available. https://thinkingmachines.ai/news/inkling-small/ Fine-tune it on Tinker today, or chat with it in text, image, and audio on Tinker Playground.
推荐理由:原文给出参数规模、权重开放和在 Tinker 上微调与对话的入口,读者可评估其部署与使用路径。
Google DeepMind 发布 Gemini Robotics ER 2,面向机器人的具身推理模型,支持视频理解、任务进度跟踪、工具编排与多机器人协作,并可将执行交给下层 VLA 模型。
推荐理由:官方发布给出进度分类、moment finding 等具体数字和公开 API 入口,读者可以据此评估其机器人编排与视频理解能力。
Google DeepMind 发布 Gemini Robotics 2 系列,包含全身控制的 VLA 模型、具身推理模型 ER 2 和可本地运行的 On-Device 2。
推荐理由:官方完整说明了三个模型的能力分工、适配速度与安全基准,读者可以据此了解具身智能模型的实际能力边界。
NVIDIA 推出 Cosmos-H-Dreams,一个面向手术机器人的实时、动作条件生成式仿真器,通过 FlashDreams 推理库在单张 RTX PRO 6000 GPU 上运行,支持人与策略闭环交互控制。
Midjourney 推出 V8.2 图像模型,本次更新聚焦美学、图像质量与个性化。官方称图像将更具创意、大胆、精致、前卫和新颖,低质量图像的随机情况应会大幅减少。V8.2 的个性化档案拥有更大且更优的图像池,能更好理解用户个人品味,尤其适合在个人档案下积累了大量评分的用户。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款模型,面向大规模 AI agent 构建。
推荐理由:官方发布三款 Gemini Flash 模型,给出具体价格、token 效率与多项基准对比,读者可据此评估 agent 工作流的成本与选型。
上海人工智能实验室 InternLM 开源 archspace 项目,目标是把 LLM 架构探索转化为社区可复用的知识。该项目以“让架构探索成为可复用知识”为定位,面向 LLM 架构研究场景。
OpenBMB(清华 NLP)在 GitHub 新建仓库 MiniCPM-Robot,定位为面向机器人的更智能、更快的端侧 AI 大脑。该仓库目前仅给出这一句定位描述,尚未披露模型参数规模、benchmark 分数或具体可用形式。
Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于快速发现、验证并修复漏洞,将通过限access试点先面向政府和可信伙伴经 CodeMender 开放。
推荐理由:以轻量模型多次调用替代单次大模型调用做漏洞挖掘,并用 Chrome 真实流水线等无污染基准展示对比结果,方法与数据都可参考。