蚂蚁 inclusionAI 发布 GLM-5.3-singprobe:基于 GLM-5.3 的流式安全探针
蚂蚁 inclusionAI 在 HuggingFace 发布 GLM-5.3-singprobe,这是一个基于 zai-org/GLM-5.3 的流式安全探针,复用基座模型隐藏状态,逐 token 输出查询意图、回复不安全和幻觉风险评分,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 HuggingFace 发布 GLM-5.3-singprobe,这是一个基于 zai-org/GLM-5.3 的流式安全探针,复用基座模型隐藏状态,逐 token 输出查询意图、回复不安全和幻觉风险评分,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 Hugging Face 发布 SingProbe,一个构建在 Qwen/Qwen3.6-35B-A3B 之上的轻量流式安全防护探针,复用基座模型隐藏状态在每个 token 上打分查询意图、回复不安全性与幻觉风险。
蚂蚁 inclusionAI 开源 Qwen3.6-27B-singprobe,一个基于 Qwen/Qwen3.6-27B 的流式安全探针,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
蚂蚁 inclusionAI 发布 SingProbe,这是一个构建在 Qwen/Qwen3.5-122B-A10B 之上的轻量级流式安全防护探针,复用基座模型生成时的隐状态,在每个 token 上输出 8 类查询意图、响应不安全度和幻觉风险评分,探针参数仅 6.17M,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 HuggingFace 发布 Qwen3.5-35B-A3B-singprobe,一个基于 Qwen/Qwen3.5-35B-A3B 的流式安全探针,仅 4.2M 参数,复用基座模型隐藏状态逐 token 输出 8 类意图、不安全与幻觉风险评分,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 HuggingFace 发布 Qwen3.5-27B-singprobe,这是基于 Qwen/Qwen3.5-27B 的流式护栏探针,复用基座模型隐藏状态,逐 token 输出查询意图、回复不安全和幻觉风险评分,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 HuggingFace 发布 Qwen3.5-9B-singprobe,一个基于 Qwen/Qwen3.5-9B 的流式护栏探针,复用基座模型隐藏状态,逐 token 对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
蚂蚁 inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3.5-4B 之上的内在流式护栏探针,复用基座模型隐藏状态在每个 token 上输出查询意图、响应不安全度和幻觉风险评分。
蚂蚁 inclusionAI 推出基于 Qwen/Qwen3.5-2B 的流式护栏探针 SingProbe,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 HuggingFace 发布 Qwen3.5-0.8B-singprobe,一个基于 Qwen/Qwen3.5-0.8B 的流式安全探针,复用基座模型隐藏状态,逐 token 输出查询意图、回复不安全和幻觉风险三类评分,仅 2.23M 探针参数、解码开销低于 0.5%。
蚂蚁 inclusionAI 在 HuggingFace 发布 Qwen3-8B-singprobe,这是一个基于 Qwen/Qwen3-8B 的内在流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
蚂蚁 inclusionAI 发布 SingProbe,一个构建在 Qwen/Qwen3-4B-Instruct-2507 上的内在流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 HuggingFace 发布 Qwen3-0.6B-singprobe,一个基于 Qwen/Qwen3-0.6B 的内在流式护栏,复用基座模型隐藏状态,逐 token 对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 Hugging Face 发布 SingProbe 探针,基于 meta-llama/Llama-3.2-1B-Instruct 构建,复用基座模型隐藏状态在每个 token 上输出查询意图、回复不安全性与幻觉风险评分。
蚂蚁 inclusionAI 发布 SingProbe,一个基于 meta-llama/Llama-3.1-8B-Instruct 的内在流式护栏,复用基座模型隐藏状态逐 token 打分查询意图、回复安全性与幻觉风险,仅增加不到 0.5% 解码开销。
蚂蚁 inclusionAI 发布 Hy3-singprobe,一个构建在 tencent/Hy3 上的轻量流式安全探针,复用基座模型隐藏状态在每个 token 上评分查询意图、回复不安全性和幻觉风险。
蚂蚁 inclusionAI 在 Hugging Face 发布 SingProbe,这是一个基于 openai/gpt-oss-20b 的轻量流式安全探针,在生成过程中复用基座模型隐状态,逐 token 输出查询意图、回答不安全度和幻觉风险三类分数。
蚂蚁 inclusionAI 基于 zai-org/GLM-5.2 推出内置流式护栏 SingProbe,复用基座模型隐藏状态,在生成时逐 token 对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
蚂蚁 inclusionAI 在 HuggingFace 发布 gemma-4-E4B-it-singprobe,这是一个基于 google/gemma-4-E4B-it 的流式安全探针,复用基座模型隐藏状态逐 token 输出 8 类意图、不安全与幻觉评分,解码开销低于 0.5%。
蚂蚁 inclusionAI 发布 SingProbe,一个基于 google/gemma-4-31B-it 的内在流式护栏,复用基座模型隐藏状态,在每个 token 上对查询意图、回复不安全和幻觉风险打分,解码开销低于 0.5%。
蚂蚁 inclusionAI 发布 SingProbe,一个构建在 google/gemma-4-26B-A4B-it 上的内在流式护栏,复用基座模型隐藏状态逐 token 打分,探针参数仅 5.67M,解码开销低于 0.5%。
推荐理由:上线方直接给出参数结构、上下文窗口、KV cache 对比和许可证信息,读者可据此评估实际部署选型。
你确定吗?找到最优模型规模很棘手:数据量、激活参数量、环境数量,以及目标推理成本。模型性能还取决于许多其他因素,每个因素都带来各自的变数。
Fable is probably ~2-2.5T parameters, not 10T. Kimi K3 is 2.8T params, trained on maybe 20–30k Blackwell-equivalents. It lands within spitting distance of Fable 5 in terms of capabilities (5, not 5.1). Anthropic has far more compute than Moonshot, better rl environments, better architecture and better optimizers and all of that adds to capability per parameter. So if Fable is only slightly ahead of K3 with this in mind, it's almost certainly a smaller model. GPT-5.5 and 5.6 are smaller still (I'll say more on that later)
OpenAI 在 API 中推出 GPT‑Live‑1,提供自然的全双工语音对话能力。模型具备更强的指令遵循、自定义语音和电话(telephony)支持。
推荐理由:官方公告给出 GPT‑Live‑1 的核心能力清单,读者可以据此评估其语音应用场景的适配性。
OpenAI 发布 GPT-6 Astra,定位为面向商务的最强模型。该模型具备高级推理和计算机使用能力,写作与设计判断也更强。
推荐理由:官方发布了面向商务场景的新模型,点出推理、计算机使用和写作设计判断三项能力方向。
OpenAI 首席研究官 Mark Chen 宣布 GPT-6 Astra 发布,称其汇集多年预训练、强化学习和后训练工作,是该团队迄今能力最强、对齐程度最高的模型。
This is GPT-6 Astra. Anything you can do on a computer, Astra can do for you. Fast.
推荐理由:OpenAI 首席研究官亲自说明 GPT-6 Astra 的能力变化与对齐工作,可帮助读者了解官方对 Computer Use 和 Agent 监督的进展表述。
WeatherNext 3 是我们在全球天气预报方式上的一项重大突破。⛅ 该模型与 @GoogleResearch 联合开发,直接从真实世界的实时观测中学习,从而更快地给出更本地化、高度准确的预测。🧵
Google DeepMind 与 Google Research 发布 WeatherNext 3 全球天气 AI 模型,直接学习实时地球静止卫星数据,每小时生成一次预报,地表变量分辨率达 5 公里,整体比 WeatherNext 2 的 25 公里网格清晰约 5 倍。
推荐理由:对比前代的分辨率、更新频率与降水评分提升,可了解实时卫星数据如何改变全球天气预报的精度边界。
H Company 发布 NeoMME 系列多语言多模态编码器,提供 260M 和 800M 两种规格,用单个双向 Transformer 处理文本和 32×32 图像 patch,以 masked discrete-diffusion 目标从零预训练,不依赖预训练视觉塔或因果语言模型。
Google DeepMind 发布 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两款模型,前者面向长时程编码与自主智能体,后者面向漏洞发现与自动修复。
推荐理由:官方给出两款 Flash 变体的能力、定价与开放渠道,可据此判断长时程编码与安全场景的选型。
上海人工智能实验室 InternLM 团队发布 InternLumina-U2,一个面向全视觉理解、图像生成与编辑的多码本扩散大语言模型。该模型将扩散生成能力与语言建模统一在同一框架内,可同时处理视觉理解与图像生成、编辑任务。
Google Research 发布时间序列基础模型 TimesFM-3,原生支持零样本多变量预测,参数量 3.3 亿,预训练数据超过 1 万亿个时间点。
微软研究院联合华盛顿大学和 Providence 发布 GigaPath-Flash 与 GigaTIME-Flash,两者均以 Apache 2.0 许可在 Hugging Face 开放权重。
推荐理由:原文给出了 GLM-5.3 的参数规模、开源状态和基准表现,读者可以据此评估是否迁移现有工作流。
推荐理由:智谱官方宣布 GLM-5.3 开放权重,定位为智能体编码与网络防御能力最强的模型,附权重与博客入口。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 和 Google AI Studio 面向开发者提供新的创意控制与生成式视频能力。
推荐理由:原文来自官方,列出了各能力具体参数、速度和价格差异,开发者可据此评估是否接入自己的视频工作流。
更多好消息:GLM-5.3 的权重将于明天发布。 https://huggingface.co/zai-org/GLM-5.3