蚂蚁 inclusionAI 发布 MiniMax-M2.7-singprobe 流式安全探针
蚂蚁 inclusionAI 发布 MiniMax-M2.7-singprobe,这是基于 MiniMaxAI/MiniMax-M2.7 的流式安全探针,仅 6.17M 参数,复用基座模型隐藏状态逐 token 输出 8 类意图、不安全与幻觉评分,解码开销低于 0.5%。
蚂蚁 inclusionAI 发布 MiniMax-M2.7-singprobe,这是基于 MiniMaxAI/MiniMax-M2.7 的流式安全探针,仅 6.17M 参数,复用基座模型隐藏状态逐 token 输出 8 类意图、不安全与幻觉评分,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 HuggingFace 发布 GLM-5.3-singprobe,这是一个基于 zai-org/GLM-5.3 的流式安全探针,复用基座模型隐藏状态,逐 token 输出查询意图、回复不安全和幻觉风险评分,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 Hugging Face 发布 SingProbe,一个构建在 Qwen/Qwen3.6-35B-A3B 之上的轻量流式安全防护探针,复用基座模型隐藏状态在每个 token 上打分查询意图、回复不安全性与幻觉风险。
蚂蚁 inclusionAI 开源 Qwen3.6-27B-singprobe,一个基于 Qwen/Qwen3.6-27B 的流式安全探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
蚂蚁 inclusionAI 发布 SingProbe,这是一个构建在 Qwen/Qwen3.5-122B-A10B 之上的轻量级流式安全防护探针,复用基座模型生成时的隐状态,在每个 token 上输出 8 类查询意图、响应不安全度和幻觉风险评分,探针参数仅 6.17M,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 HuggingFace 发布 Qwen3.5-35B-A3B-singprobe,一个基于 Qwen/Qwen3.5-35B-A3B 的流式安全探针,仅 4.2M 参数,复用基座模型隐藏状态逐 token 输出 8 类意图、不安全与幻觉风险评分,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 HuggingFace 发布 Qwen3.5-27B-singprobe,这是基于 Qwen/Qwen3.5-27B 的流式护栏探针,复用基座模型隐藏状态,逐 token 输出查询意图、回复不安全和幻觉风险评分,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 HuggingFace 发布 Qwen3.5-9B-singprobe,一个基于 Qwen/Qwen3.5-9B 的流式护栏探针,复用基座模型隐藏状态,逐 token 对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
蚂蚁 inclusionAI 推出基于 Qwen/Qwen3.5-2B 的流式护栏探针 SingProbe,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 HuggingFace 发布 Qwen3.5-0.8B-singprobe,一个基于 Qwen/Qwen3.5-0.8B 的流式安全探针,复用基座模型隐藏状态,逐 token 输出查询意图、回复不安全和幻觉风险三类评分,仅 2.23M 探针参数、解码开销低于 0.5%。
蚂蚁 inclusionAI 在 HuggingFace 发布 Qwen3-8B-singprobe,这是一个基于 Qwen/Qwen3-8B 的内在流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
蚂蚁 inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3-4B-Instruct-2507 上的内在流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 HuggingFace 发布 Qwen3-0.6B-singprobe,一个基于 Qwen/Qwen3-0.6B 的内在流式护栏,复用基座模型隐藏状态,逐 token 对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 Hugging Face 发布 SingProbe 探针,基于 meta-llama/Llama-3.2-1B-Instruct 构建,复用基座模型隐藏状态在每个 token 上输出查询意图、回复不安全性与幻觉风险评分。
蚂蚁 inclusionAI 在 Hugging Face 发布 SingProbe,这是一个基于 openai/gpt-oss-20b 的轻量流式安全探针,在生成过程中复用基座模型隐状态,逐 token 输出查询意图、回答不安全度和幻觉风险三类分数。
蚂蚁 inclusionAI 基于 zai-org/GLM-5.2 推出内置流式护栏 SingProbe,复用基座模型隐藏状态,在生成时逐 token 对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
Together AI 扩展 Together Fine-Tuning 服务,新增 GLM 5.3、Kimi K2.7、DeepSeek-V4-Flash、Qwen 3.8-27B、Gemma 4 等开源权重模型支持,并通过 API、CLI 和 UI 提供逐步训练指标实时追踪。
Nous Research 在 GitHub 新建仓库 hermes-desktop-accent-picker,为 Hermes Desktop 状态栏提供 OKLCH 强调色选择器。该工具面向主题创作,可实时为整个应用重新着色。
Mistral 与 Cloudera 建立合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境内用专有数据训练自有模型,所有权归企业所有。Cloudera 平台承载 30 exabytes 客户管理数据,双方瞄准金融、制造、电信等受监管行业的主权 AI 需求。
Together AI 发布长文,解析开发者从闭源模型转向开源模型所需的 AI 编码栈,提出由模型、推理、网关与路由、Harness、工具(Skills 与 MCP)组成的 MIGHT 五层框架。
推荐理由:Together AI 把开源编码栈拆为 MIGHT 五层,给出大小模型分工和分层组合的具体实践方法。
Mistral 宣布完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由三星电子领投,Scaleup Europe Fund 和 PSG Equity 联合领投。Mistral 称这是欧洲科技公司完成的最大规模股权融资,资金将用于扩展前沿研究、算力、基础设施和商业增长。公司目前业务覆盖 20 个国家,服务 125 家以上全球企业,包括 Airbus、ASML 和 HSBC。
推荐理由:Mistral 完成欧洲科技公司规模最大的股权融资,读者可了解其主权 AI 全栈路线与投资方结构。
vLLM 推出 TT Plugin,通过 out-of-tree 平台插件机制将 Tenstorrent 加速器接入 vLLM,安装后只要 ttnn 可导入即自动注册为 vLLM 平台,OpenAI 兼容 API 与请求格式保持不变。
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi、Hermes 等 coding agent 提供基于本机已有会话日志的持久记忆层。
推荐理由:官方介绍 funes 如何把本机已有 agent 会话变成可检索的本地记忆,给出安装方式、跨 agent 共享和成本对比。
LongCat-2.0 is now free in Command Code. 1.6T params. 1M context. 48B activate. Available on all plans to all subscribers. npm i -g command-code 🐐
Hugging Face WebAI 团队发布 @huggingface/kernels 库和 207 个 Apache-2.0 许可的 WebGPU 内核,每个内核以独立版本化仓库形式发布在 Hub 上,包含 manifest、正确性测试、基准案例和 WGSL 着色器模板。
Google Research 发布时间序列基础模型 TimesFM-3,原生支持零样本多变量预测,参数量 3.3 亿,预训练数据超过 1 万亿个时间点。
MIT 研究项目 Julia 已发展为拥有超 100 万用户的免费开源编程语言,被全球数千家公司和大学用于科学计算与复杂系统建模。Julia 依靠即时编译(just-in-time compilation)兼顾易用性与高性能,其联合创始团队还创办了 JuliaHub,并于 4 月推出 AI 平台 Dyad 3.0,帮助工程团队以智能体方式加速火箭、热泵、卫星等物理系统设计。
推荐理由:原文给出了 GLM-5.3 的参数规模、开源状态和基准表现,读者可以据此评估是否迁移现有工作流。
推荐理由:智谱官方宣布 GLM-5.3 开放权重,定位为智能体编码与网络防御能力最强的模型,附权重与博客入口。
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 引入 Monsoon en-IN 和 Monsoon hi-IN 两套评测集,其中印地语是该多语言榜单首个印度语言。
阿里巴巴发布 Qwen3.8-Flash-Next 模型权重,作为即将到来的 Qwen4 架构的预览,供开发者实验和评估。该模型是多模态混合专家(MoE)模型,主模型 125B 参数,附加 51B N-gram embeddings,每 token 激活 6B 参数;原生上下文窗口 262,144 token,可扩展至 1M token。
智谱(Z.ai)发布 GLM-5.3-Flash,为原生多模态模型,拥有 1M-token 上下文窗口,参数规模 320B-A18B,以 MIT 许可开源权重。
推荐理由:官方公布了定价定位、1M 上下文、MIT 许可和国产芯片适配等关键细节,可帮助读者评估这款轻量模型的实际可用性。
IBM Granite 团队发布 Granite 4.2 推理模型系列,包含 3B、8B、30B 三个 dense 版本,基于 Granite-4.1 基座(约 15T tokens 预训练,上下文扩展到 512K),经 SFT 和多阶段 GRPO 强化学习训练,8B 和 30B 额外经历 SWE、终端、搜索三类真实环境 agentic RL。
推荐理由:官方完整披露了从预训练、SFT 到多阶段 GRPO 强化学习的训练细节,读者可以据此了解推理模型的完整构建流程。
Nous Research 为 Hermes Agent 推出 Sprites 终端后端插件,基于 Fly.io 云沙箱提供有状态运行环境,支持 checkpoint 与 restore。该插件已在 GitHub 开源。
Mistral 与 HUMAIN 宣布在 AI 基础设施、先进模型开发和 AI 解决方案部署上展开战略合作,聚焦网络安全与语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还将在沙特面向受监管行业制定联合市场策略。
LongCat-2.0 now available in Go 1.6T/48B · 1M context · fully open source
推荐理由:LongCat 官方宣布模型接入 opencode,读者可以了解该开源模型在编码工具中的可用入口。