蚂蚁 inclusionAI 发布基于 gpt-oss-20b 的流式安全探针 SingProbe
蚂蚁 inclusionAI 在 Hugging Face 发布 SingProbe,这是一个基于 openai/gpt-oss-20b 的轻量流式安全探针,在生成过程中复用基座模型隐状态,逐 token 输出查询意图、回答不安全度和幻觉风险三类分数。
蚂蚁 inclusionAI 在 Hugging Face 发布 SingProbe,这是一个基于 openai/gpt-oss-20b 的轻量流式安全探针,在生成过程中复用基座模型隐状态,逐 token 输出查询意图、回答不安全度和幻觉风险三类分数。
蚂蚁 inclusionAI 基于 zai-org/GLM-5.2 推出内置流式护栏 SingProbe,复用基座模型隐藏状态,在生成时逐 token 对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
Nathan Lambert 在 Interconnects 发布开源 AI 与开放模型阅读清单,收录近几年他认为是该领域最佳的文章,并称可作为了解该领域现状的全面概览。
Together AI 扩展 Together Fine-Tuning 服务,新增 GLM 5.3、Kimi K2.7、DeepSeek-V4-Flash、Qwen 3.8-27B、Gemma 4 等开源权重模型支持,并通过 API、CLI 和 UI 提供逐步训练指标实时追踪。
Microsoft 在 GitHub 新建 microsoft/glintlabs 仓库,用于支撑 Glintlabs 站点。该仓库为对外公开仓库,目前仅说明其用途是服务 Glintlabs 网站,未披露更多技术细节。
Microsoft 在 GitHub 新建仓库 microsoft/amplifier-smart-tool-team-pulse,为 Amplifier 项目提供智能工具。原文仅说明该工具面向 Amplifier 项目,未披露具体功能、模型或版本信息。
Nous Research 在 GitHub 新建仓库 hermes-desktop-accent-picker,为 Hermes Desktop 状态栏提供 OKLCH 强调色选择器。该工具面向主题创作,可实时为整个应用重新着色。
Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境内用专有数据训练自有模型,所有权归企业所有。Cloudera 平台承载 30 exabytes 客户管理数据,双方瞄准金融、制造、电信等受监管行业的主权 AI 需求。
现在你可以在 Hugging Face 上体验 Ling 的 VL 模型了,由我们的 day0 合作伙伴 @novita_labs 提供支持
🤗 Novita now supports Ling-3.0-flash-VL on @huggingface. 🎁 Free for 14 days. • 124B total parameters · 5.5B active parameters per token • Native image and video understanding • Built for multimodal reasoning and agentic workflows
QwenLM 为 Qwen-MM-Plugins 推出文档项目 qwen-mm-plugins-hub。该仓库用于说明 Qwen 多模态插件相关内容,目前公开信息仅为一份文档。
Together AI 发布长文,解析开发者从闭源模型转向开源模型所需的 AI 编码栈,提出由模型、推理、网关与路由、Harness、工具(Skills 与 MCP)组成的 MIGHT 五层框架。
推荐理由:Together AI 把开源编码栈拆为 MIGHT 五层,给出大小模型分工和分层组合的具体实践方法。
本期开源模型汇总介绍了 Motif-3(MIT 许可)、GLM-5.3、Qwen3.8-Flash-Next、GLM-5.3-Flash、Hy4-preview 等发布,并重点分析许可证趋势。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 和 PSG Equity 联合领投。Mistral 称这是欧洲科技公司完成的最大规模股权融资,资金将用于扩展前沿研究、算力、基础设施和商业增长。公司目前业务覆盖 20 个国家,服务 125 家以上全球企业,包括 Airbus、ASML 和 HSBC。
推荐理由:Mistral 完成欧洲科技公司规模最大的股权融资,读者可了解其主权 AI 全栈路线与投资方结构。
vLLM 推出 TT Plugin,通过 out-of-tree 平台插件机制将 Tenstorrent 加速器接入 vLLM,安装后只要 ttnn 可导入即自动注册为 vLLM 平台,OpenAI 兼容 API 与请求格式保持不变。
Introducing GLM-5.3-Flash - Leading capabilities at a highly competitive price - Natively multimodal with a 1M-token context window - A 320B-A18B model released under the MIT License - Previously previewed as Ox Alpha, running entirely on Chinese AI chips Blog: http://z.ai/blog/glm-5.3-flash Available now across all official platforms: Weights: http://huggingface.co/zai-org/GLM-5.3-Flash API: http://docs.z.ai/guides/llm/glm-5.3-flash Coding Plan: http://z.ai/subscribe ZCode: http://zcode.z.ai/en Chat: http://chat.z.ai AutoClaw: http://autoclaw.z.ai
推荐理由:原文给出本地推理提速的具体配置和硬件门槛,读者可以直接复用到自己的 GLM-5.3-Flash 部署中。
Hermes Desktop now sets up local models in one click. It automatically reads your hardware, picks the best model for you, then downloads it and configures the runtime.
推荐理由:作者亲述收购立场,并给出官方博客链接,读者可借此了解其对开放模型生态价值的判断。
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等 coding agent 提供基于本机已有会话日志的持久记忆层。
推荐理由:官方介绍 funes 如何把本机已有 agent 会话变成可检索的本地记忆,给出安装方式、跨 agent 共享和成本对比。
OpenAI 在 GitHub 发布新仓库 openai/LongGapsBetweenPrimes,用 Lean 形式化了一个关于素数长间隔的界。仓库标题与描述均未给出具体界值、作者或论文出处。
LongCat-2.0 is now free in Command Code. 1.6T params. 1M context. 48B activate. Available on all plans to all subscribers. npm i -g command-code 🐐
🐶🏁 Three models. One race. We independently tested H3 Max by @fal, minimax H3 by @MiniMax_AI, and FastH3 preview by @haoailab @haozhangml @wlsaidhi across robotics, animation, movies, and ads. H3 Max takes the overall lead 🏆. FastH3_preview, meanwhile, is a community OSS effort that’s already keeping up surprisingly well, even beating H3 on overall Prompt Adherence 🥳 The bigger gaps show up in Visual Integrity and Human Preference. Full evaluation: https://physionlabs.ai/blog/minimax-h3-evaluation
🎬Video generation faster than playback! 🚀MiniMax H3 on vLLM-Omni + FastVideo's FastH3: a complete 10.1s MP4 - video AND synchronized audio - rendered in 8.7s!⚡️ Thanks to @MiniMax_AI for the great Minimax H3 release, the FastVideo team @haoailab for open-sourcing FastH3 and helping on the serving integration, and @NVIDIAAI for the continued sponsorship and joint optimization efforts!
Hugging Face WebAI 团队发布 @huggingface/kernels 库和 207 个 Apache-2.0 许可的 WebGPU 内核,每个内核以独立版本化仓库形式发布在 Hub 上,包含 manifest、正确性测试、基准案例和 WGSL 着色器模板。
Google Research 发布时间序列基础模型 TimesFM-3,原生支持零样本多变量预测,参数量 3.3 亿,预训练数据超过 1 万亿个时间点。
MIT 研究项目 Julia 已发展为拥有超 100 万用户的免费开源编程语言,被全球数千家公司和大学用于科学计算与复杂系统建模。Julia 依靠即时编译(just-in-time compilation)兼顾易用性与高性能,其联合创始团队还创办了 JuliaHub,并于 4 月推出 AI 平台 Dyad 3.0,帮助工程团队以智能体方式加速火箭、热泵、卫星等物理系统设计。
推荐理由:原文给出了 GLM-5.3 的参数规模、开源状态和基准表现,读者可以据此评估是否迁移现有工作流。
推荐理由:智谱官方宣布 GLM-5.3 开放权重,定位为智能体编码与网络防御能力最强的模型,附权重与博客入口。
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 引入 Monsoon en-IN 和 Monsoon hi-IN 两套评测集,其中印地语是该多语言榜单首个印度语言。
阿里巴巴发布 Qwen3.8-Flash-Next 模型权重,作为即将到来的 Qwen4 架构的预览,供开发者实验和评估。该模型是多模态混合专家(MoE)模型,主模型 125B 参数,附加 51B N-gram embeddings,每 token 激活 6B 参数;原生上下文窗口 262,144 token,可扩展至 1M token。
智谱(Z.ai)发布 GLM-5.3-Flash,为原生多模态模型,拥有 1M-token 上下文窗口,参数规模 320B-A18B,以 MIT 许可开源权重。
推荐理由:官方公布了定价定位、1M 上下文、MIT 许可和国产芯片适配等关键细节,可帮助读者评估这款轻量模型的实际可用性。
IBM Granite 团队发布 Granite 4.2 推理模型系列,包含 3B、8B、30B 三个 dense 版本,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文扩展到 512K),经 SFT 和多阶段 GRPO 强化学习训练,8B 和 30B 额外经历 SWE、终端、搜索三类真实环境 agentic RL。
推荐理由:官方完整披露了从预训练、SFT 到多阶段 GRPO 强化学习的训练细节,读者可以据此了解推理模型的完整构建流程。
Nous Research 为 Hermes Agent 推出 Sprites 终端后端插件,基于 Fly.io 云沙箱提供有状态运行环境,支持 checkpoint 与 restore。该插件已在 GitHub 开源。
Mistral 与 HUMAIN 宣布在 AI 基础设施、先进模型开发和 AI 解决方案部署上展开战略合作,聚焦网络安全与语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还将在沙特面向受监管行业制定联合市场策略。
LongCat-2.0 now available in Go 1.6T/48B · 1M context · fully open source
推荐理由:LongCat 官方宣布模型接入 opencode,读者可以了解该开源模型在编码工具中的可用入口。
Qwen 团队(阿里巴巴集团)开发了基础模型 Qwen3.8-Flash-Next。该模型由 QwenLM 仓库发布,具体参数规模、上下文长度与可用方式尚未在原文中披露。
🚢 Marin 535B-A23B started training this week! As usual, the whole process is open. Voyage plan: pretraining (80%) + midtraining (20%) on 18.75T tokens on 11 x GB200 NVL72 for ~3 months (2.7e24 FLOPs). Post-training will follow. Before kicking off the run, we trained a 4-rung scaling ladder from 1.6B-A61M (48B tokens) to 27.7B-A1.2B (926B tokens) to debug issues, and to make a forecast of our hero run. This is by far our biggest run, so definitely expecting the unexpected.