OpenBMB 发布 MiniCPM5-2B,登顶 4B 以下开源权重模型 Artificial Analysis 智能指数
OpenBMB 发布 2.6B 参数稠密推理模型 MiniCPM5-2B,以 Apache 2.0 协议开放权重,在 Artificial Analysis Intelligence Index v4.2 得分 15,为 4B 以下总参数开源权重模型最高。
OpenBMB 发布 2.6B 参数稠密推理模型 MiniCPM5-2B,以 Apache 2.0 协议开放权重,在 Artificial Analysis Intelligence Index v4.2 得分 15,为 4B 以下总参数开源权重模型最高。
Tomer Tunguz 分析称企业、应用和销售各层买家正在用更便宜的开源模型替代前沿闭源模型,省下的钱并未缩小 AI 账单,而是被再投入到指数级增长的 token 用量。
推荐理由:作者用 Coinbase、Lindy、Harvey 等实例说明开源模型替代闭源模型后节省被再投入更多 token,提供一个理解 AI 成本结构的框架。
一位 VC 博主归纳一个 500+ 评论的 HN 讨论指出,本地编码栈正快速成熟:Qwen 3.6 35B-A3B 以 33% 的提及率主导模型选择,Pi 以 49% 领先 Agent 提名。
推荐理由:作者基于 HN 讨论归纳本地编码模型与 Agent 的当前格局,并给出与云端模型的对比视角。
ARC Prize 官方公布 2024 年获奖名单并发布技术报告,共 1,430 支团队提交 17,789 份方案,大奖仍未被认领。the ARChitects 以 53.5% 获第一名并获 2.5 万美元,Kaggle 竞赛期间 ARC-AGI-1 SOTA 从 33% 升至 55.5%(MindsAI 因未开源不符获奖资格)。
ARC Prize 介绍 2024 年 ARC Prize 竞赛末期两个登上 ARC-AGI 公开榜单新 SOTA 的开源方案。
Theory Ventures 领投 Ollama 的 6500 万美元 B 轮融资,Benchmark、YC 等参投。
Theory Ventures 在成立三周年回顾中提出,AI 正在压缩时间:新模型每 41 天发布一次,企业以创纪录速度达到 1 亿美元营收,推理已成为 AI 的主导市场。该机构认为 seed 轮规模已从 100 万美元延伸至 5 亿美元,传统融资阶段分类不再代表公司成熟度;闭源与开源、云端与本地模型的差距也在收窄,本地运行可降低成本、改善延迟并减少数据治理顾虑。
Tom Tunguz 撰文指出,Slate Auto 售价 $24,950 的 Blank Slate 电动皮卡与 Thinking Machines Lab 开源的 975B 参数模型 Inkling 采用同一策略:以廉价、通用的基础产品入市,靠客户定制创造价值。
Tomer Tunguz 撰文认为开源权重模型已多次追平闭源前沿模型,从 DeepSeek R1 到 GLM-4.6、GLM-5.2 和 Kimi K3,但 GPT-5.2 级闭源模型与 Opus 仍率先制造跃迁时刻。
ARC Prize 开放其 ARC-AGI 社区入口,Discord 已有 10,000+ 成员讨论 ARC-AGI 研究思路并协作解题。社区提供 YouTube 讲座、Newsletter、Twitter/X、GitHub 数据集与社区排行榜、线下活动等渠道,并列出参赛 ARC Prize 2026、入门指南、资源页、研究资助、交互式任务练习等参与方式。
ARC Prize 官方公布 2026 年竞赛,总奖金 200 万美元,设 ARC-AGI-3 交互推理基准、ARC-AGI-2 静态推理基准和论文奖三条赛道。
Anthropic 推出面向零售、旅游、电信和娱乐行业的 Claude Commerce agents,提供可 fork 的开源蓝图仓库,包含两类智能体、四个垂直行业参考实现和一个 Claude Code 插件。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源 TTS 模型的可懂度、速度和说话人相似度,将评估周期从数周缩到数小时。
Zyphra 推出面向持续增长训练语料的增量模糊去重系统 PUFFER,在十小时吞吐测试中处理最多 10 亿文档,较现有 CPU 去重方法提速 11x-35x,单进程 1.75 小时可摄入 10 亿文档,已在超 300 亿文档的生产环境部署,并以 Apache 2.0 开源。
Preferred Networks(PFN)发布 PLaMo 系列部分大语言模型及其他经额外数据微调的 LLM 作为开放模型,这些模型通过日本经产省与 NEDO 主导的 GENIAC 项目开发。PFN 同时开源 Optuna 自动超参数优化框架、CuPy GPU 矩阵计算库等研究成果,相关开放模型已在 Hugging Face 上提供。
Baseten 上线 DeepSeek V4 Pro 0813,一个 1.7T 参数的前沿开放权重模型。它可与较小的 V4 Flash 0731 搭配用于 coding agent,由 Pro 驱动主 agent、Flash 运行子 agent,使整个编码栈跑在开放权重模型上。
Eugene Yan 整理了一份可商用许可的开源 LLM 清单,起因是他想微调一个带商用许可的 LLM 以规避使用第三方 LLM 的法律与隐私问题。清单涵盖面向代码微调的模型,发布两天内社区提交了八个 PR,新增了上下文长度列并纠正了一个实际不具备商用许可的模型。
NVIDIA 在 8 月举办本地 AI 博客专题,联合 Perplexity、MiniMax、DeepSeek、Poolside AI 等伙伴推进可在本地运行的开源模型与智能体。
Baseten 宣布与 OpenAI 合作,成为 OpenAI B2B 市场首批开源模型推理服务提供商之一,企业用户可通过 Codex 或 Responses API 调用 Kimi K3、GLM 5.3 等开源模型,中国开源模型首次进入 OpenAI 企业采购体系。
哔哩哔哩 Index LLM 团队发布基于 Qwen3.5 的 Index-Translate 多语言翻译模型家族,2B / 9B / 35B-A3B(preview)权重已在 Hugging Face 与 ModelScope 开放。
Docent 团队发布技术演示,展示如何在生产环境的编码智能体流量中测量失准行为。该团队此前已将 Docent 以 Apache 2.0 协议开源,并与 SWE-Bench 合作实现对智能体轨迹的可扩展分析。Docent 是用于分析和干预智能体行为的系统。
World Labs 发布 Spark,一款面向 THREE.js 的高级 3D Gaussian Splatting 渲染器,可与场景中的其他网格和 splat 集成,并在所有设备上实现快速渲染。该渲染器支持可编程的动态 splat 效果,兼容 ply、sogs、spz、splat、ksplat 等多种格式。
TensorZero 完成 730 万美元种子轮融资,用于构建面向工业级 LLM 应用的开源基础设施。其 11.5K 星开源栈统一了 LLM 网关、可观测性、优化、评估与实验五大组件,可增量采用并形成数据与学习飞轮。该平台已在前沿 AI 初创公司和一家欧洲大型银行落地,并曾登上 GitHub 全球周趋势榜第一。
TensorZero 正在构建自动化 AI 工程师 TensorZero Autopilot,可分析 LLM 可观测性数据、搭建评测、优化提示词与模型并运行 A/B 测试,在软件工程、客服、数据抽取、医学、法律、天体物理、交互推理等任务上全部提升。
Sarvam AI 于 2026 年 3 月 6 日开源 Sarvam 30B 和 Sarvam 105B 两个从零训练的 MoE 推理模型,训练完全在 IndiaAI 任务的算力上于印度完成,权重可从 AI Kosh 和 Hugging Face 下载。
推荐理由:官方发布开源推理模型,给出完整训练与推理细节和基准对比,可了解印度本土全栈模型的做法。
Prime Intellect 推出 Prime Flash MoE,一组为 Blackwell 优化的 CUDA 内核,最高比 PyTorch grouped GEMM 快 2.4×,在 4k-128k token 区间约 2.3× 加速。
Prime Intellect 在 nanoGPT optimizer speedrun 上开展 153 次自主运行、覆盖 18 个前沿模型,每次运行使用 8xH200s、最长持续八天,baseline 为 3,290 steps,人类纪录为 2,600。
推荐理由:实验规模和全部 trace 公开,模型差距主要来自实验执行而非想法本身,这个发现值得一看。
MiniMax 正式开源下一代通用视频模型 MiniMax H3,支持文本、图像、视频、音频的多模态统一理解,可生成最长 15 秒、768p(经 H3-Regenerate-2K 可达 2K)、24 FPS 并带 32 kHz 立体声音频的视频。
推荐理由:官方开源公告给出了完整的三模块系统结构、模型规格和本地部署方式,读者可以据此评估在自己的视频生成流程中如何接入。
千问(Qwen)团队开源 Qwen3.8-Flash-Next,一个多模态 MoE 模型,被视为 Qwen4 架构的早期预览。模型总参数 125B 加 51B N-gram Embedding,每 token 激活 6B,48 层中含 36 层 GDN 线性注意力和 12 层 QSA 稀疏注意力,MoE 使用 512 专家 top-10 路由。
推荐理由:原文给出该模型混合架构细节和 SGLang 的 day-0 推理支持数据,读者可以据此评估长上下文部署的实际收益。
LMSYS 的 SGLang 团队发布 SSD Expert Pack 路径,把装不进 VRAM 和内存的 MoE 路由专家放在 NVMe SSD 上,只加载 router 选中的专家,用 Expert Pack 布局、direct I/O、pinned 缓冲和 GPU 缓存把 SSD 容量变成可用的存储层。
推荐理由:原文给出在单张消费级 GPU 上运行超大 MoE 模型的完整方案和实测数据,读者可以评估这条 SSD 专家卸载路径是否适合自己的本地部署。
SGLang 和 Miles 团队发布对 DeepSeek-V4.1 的 Day-0 支持,解析其低比率压缩、滑动窗口注意力(SWA)、流形超连接(mHC)和 Engram 记忆等架构对推理栈的影响。
推荐理由:原文拆解了 DeepSeek-V4.1 新架构对推理栈的影响,并给出 SGLang 与 Miles 的 Day-0 支持方案和实测数字。
Meta 介绍其开源模型 Segment Anything Model 3(SAM 3)和 DINOv3 成为由能源部 Genesis Mission 旗下 SYNAPS-I 项目分割管线的核心。
LlamaParse 团队推出开源文档解析工具 LiteParse,支持 PDF、DOCX、PPTX、XLSX 和图片,全程本地运行,无云端调用、无 LLM token 消耗。
推荐理由:原文来自产品官方,清晰给出了 LiteParse 的本地解析方式、支持格式与坐标输出等能力边界,便于与 LlamaParse 作取舍。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpot 草稿模型权重,通过投机解码在不改变输出质量的前提下大幅提升解码速度,草稿模型约为 3 亿参数。
Cognition 宣布 Jonathan Kelley 及整个 Dioxus 团队加入,将继续支持 Dioxus、Blitz、Taffy 和 Subsecond 开源项目,并加大对 Dioxus-Native 和 Blitz 的投入。
NVIDIA 宣布已同意以 $12,930,300,000 收购 Hugging Face。Hugging Face 拥有超过 1800 万开发者、300 万模型、50 万数据集和 100 万应用,超过 20 万企业在用。
推荐理由:收购方官方说明了交易金额和对平台开放性的承诺,读者可以据此评估开源模型生态的走向。
Baseten 推出开源模型库,支持将模型在数秒内以 API endpoint 形式部署。库中涵盖 LLM、语音合成、转录、图像生成与嵌入向量等类别,包括 DeepSeek V4.1 Flash。
Black Forest Labs 联合创始人兼 CEO Robin Rombach 在 G7 峰会向 Macron、Trump、Merz、von der Leyen 等领导人呼吁,让开放且负责任的 AI 开发成为常态而非例外。
Black Forest Labs 发布多模态基础模型 FLUX 3,基于 Self-Flow 方法在统一架构内联合学习图像、视频和音频,现已开放 Early Access。
推荐理由:原文给出 FLUX 3 的多模态架构、早期对比评测数字和分阶段开放计划,读者可据此评估其对创作与具身场景的适用性。
Ant Group 发布基于 Ling-3.0-flash 的金融开源权重模型 Ling-3.0-flash-Fin,MIT 协议,124B 总参数、每 token 激活 5.1B(MoE),256K 上下文,纯文本输入输出,可经 OpenRouter 调用。