智谱(Z.ai)发布 GLM-5.3-Flash,为原生多模态模型,拥有 1M-token 上下文窗口,参数规模 320B-A18B,以 MIT 许可开源权重。
推荐理由:官方公布了定价定位、1M 上下文、MIT 许可和国产芯片适配等关键细节,可帮助读者评估这款轻量模型的实际可用性。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
智谱(Z.ai)发布 GLM-5.3-Flash,为原生多模态模型,拥有 1M-token 上下文窗口,参数规模 320B-A18B,以 MIT 许可开源权重。
推荐理由:官方公布了定价定位、1M 上下文、MIT 许可和国产芯片适配等关键细节,可帮助读者评估这款轻量模型的实际可用性。
IBM Granite 团队发布 Granite 4.2 推理模型系列,包含 3B、8B、30B 三个 dense 版本,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文扩展到 512K),经 SFT 和多阶段 GRPO 强化学习训练,8B 和 30B 额外经历 SWE、终端、搜索三类真实环境 agentic RL。
推荐理由:官方完整披露了从预训练、SFT 到多阶段 GRPO 强化学习的训练细节,读者可以据此了解推理模型的完整构建流程。
LongCat-2.0 now available in Go 1.6T/48B · 1M context · fully open source
推荐理由:LongCat 官方宣布模型接入 opencode,读者可以了解该开源模型在编码工具中的可用入口。
Hugging Face 发布教程,介绍 Sentence Transformers v6.0 新增的第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索。
推荐理由:官方教程系统讲解多向量晚交互模型的使用、检索质量与索引体积权衡,并给出可直接运行的检索和重排方案。
Hugging Face 发布 2026 年 1 至 8 月开源模型生态观察报告,指出 Hub 公开模型仓库从 243 万增至 296 万、数据集突破 100 万,但 85.6% 的模型终身下载不足 200 次。
推荐理由:报告用 Hub 下载、许可证与衍生模型数据区分关注度与真实采用,读者可据此校准自己对开源模型生态的判断。
推荐理由:原文给出 Harness 的插件化架构设计和 MIT 开源仓库入口,开发者可据此评估是否接入自己的 Agent 开发流程。
Hugging Face 组织的 ICML 2026 Open Reproductions 挑战赛(7 月 15 日至 8 月 2 日)中,1,221 名社区成员用 Claude Code。
推荐理由:原文复现了 ICML 2026 约三分之一的论文并给出具体的证伪案例,读者可以借此了解智能体驱动大规模同行审查的可能与局限。
vLLM 宣布 Day-0 支持 Qwen3.8-2.4T-A95B,这是 Qwen 家族首个以开放权重发布的 Qwen-Max 级模型,基于 Qwen 3.5 架构开箱即用。
推荐理由:原文给出 Qwen3.8-2.4T-A95B 的架构细节、多精度权重和部署要求,读者可据此评估自建推理的成本与硬件门槛。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的可用性承诺。
推荐理由:Mistral 把区域推理端点、SLA 优先级层与第三方开源模型接入放在同一套基础设施上,读者可据此判断主权 AI 的落地方式。
Meta 发布 30B 参数多模态开源模型 Muse Glimmer,由 Muse 蒸馏而来,采用 Apache 2.0 许可,主打本地智能体用途如编码、文档分析和个人助理。
推荐理由:发布方提供了架构细节、完整基准对比和多种部署路径,读者可以据此评估它在本地智能体场景的适配性。
Google DeepMind 在 Nature 发表 WeatherNext AI 模型研究,对气旋路径、强度和风结构的预报平均多出超过 24 小时提前量,相当于约十年的气象学进步。
推荐理由:官方介绍论文与开源模型的关键结果,读者可以据此评估其对气象预报和研究的可用性。
Mistral 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,将内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略,无需重训即可适配文本与图像审核。它以 Apache 2.0 协议开放权重,在文本安全上匹敌最大 7 倍于其体积的开放审核模型,可在单张 16GB NVIDIA GPU 上运行,并输出经校准的连续安全分数。
推荐理由:原文说明了将审核策略写成自然语言问题即可在推理时切换的机制,读者可据此评估它替代固定分类审核模型的可行性。
Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。
推荐理由:官方开源了环境服务和三条训练配方,小参数量模型在 SWE-bench Verified 等基准上的具体结果可直接对照复用。
Together AI 发布 Kimi K3 开发者指南。Kimi K3 是 Moonshot AI 的 2.8 万亿参数开源权重模型,支持 1M 上下文、KDA 与 AttnRes 架构,API 兼容 OpenAI,定价为缓存命中输入每 1M token $0.30、未命中 $3.00、输出 $15.00。
推荐理由:Together AI 官方上手指南,覆盖 Kimi K3 的架构要点、推理与缓存等 API 细节和定价,便于开发者直接接入生产。
Thinking Machines 提出安全开放权重的框架,认为发布安全取决于模型本身与其进入的生态,并据此发布了 Inkling 和 Inkling-Small 两个开放权重语言模型。
推荐理由:Thinking Machines 结合自家 Inkling 的发布评估,给出了分层开放权重与生态准备的安全框架,并指出数据过滤等仍开放的问题。
推荐理由:原文给出参数规模、权重开放和在 Tinker 上微调与对话的入口,读者可评估其部署与使用路径。
IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 框架扩展出 MLX 后端,并设计结构化 CUDA-to-MLX 翻译层,让进化式内核搜索把已有 CUDA 内核当作知识库适配到 Apple Silicon。
推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,读者可了解跨平台内核搜索的方法与实测数据。
Together AI 宣布与 Moonshot AI 达成战略合作,成为其模型发布平台,Kimi K3 现已在 Together AI 上线,未来 Moonshot 的开放权重模型也将同步提供。
推荐理由:Together AI 官方公布与 Moonshot AI 的合作安排,开发者可据此了解 Kimi K3 的开放接入方式和推理、微调选项。
vLLM 宣布对月之暗面 Kimi K3 提供 Day-0 高效支持。Kimi K3 是 2.8 万亿参数的 MoE 多模态模型,每 token 激活 896 个专家中的 16 个,基于 Kimi Delta Attention 与 Attention Residuals,支持 1M token 上下文窗口。
推荐理由:vLLM 官方详述 Kimi K3 的服务适配与内核优化,读者可以据此了解 2.8T 混合 MoE 的生产部署配方和性能数据。
Hugging Face 宣布 Diffusers 原生支持 Nunchaku Lite,可像普通模型一样用 from_pretrained() 加载 SVDQuant 4-bit (W4A4) 检查点,无需单独推理引擎或本地 CUDA 编译,内核经 kernels 包从 Hub 下载。
推荐理由:Diffusers 原生支持 Nunchaku 4-bit 推理,附带基准数据和自己量化模型的完整流程,适合关注消费级显卡跑扩散模型的读者。