Mistral 在 Studio 发布 Connectors,支持内置与自定义 MCP 连接器
Mistral AI 在 Studio 发布 Connectors 公测,内置连接器和自定义 MCP 均可通过 API/SDK 用于所有模型和 Agent 调用。新功能包括直接工具调用、requires_confirmation 人工审批流和连接器的程序化管理;连接器 centrally 注册后可在 LeChat 和 AI Studio 间复用,并支持与 CRM、知识库等企业系统集成。
Mistral AI 在 Studio 发布 Connectors 公测,内置连接器和自定义 MCP 均可通过 API/SDK 用于所有模型和 Agent 调用。新功能包括直接工具调用、requires_confirmation 人工审批流和连接器的程序化管理;连接器 centrally 注册后可在 LeChat 和 AI Studio 间复用,并支持与 CRM、知识库等企业系统集成。
Together AI 发布面向编码智能体的高并发推理基准,用 4×NVIDIA B200 在 Kimi K2.5 上对比 Together Inference Engine、TensorRT-LLM 与 SGLang。
阿里巴巴在 GitHub 开源代码审查工具 alibaba/open-code-review,采用确定性流水线加 LLM Agent 的混合架构,支持精确到行级的审查评论。内置多语言规则集覆盖 NPE、线程安全、XSS、SQL 注入,兼容 OpenAI 与 Anthropic 接口,并称已在阿里内部规模场景下验证。
Together AI 与 Pearl Research Labs 达成独家合作,推出首个由 Pearl Network 驱动的推理端点 Gemma-4-31B-it-pearl,价格折扣超过 25%,由加密代币 ¶PRL 的未来排放价值抵消。
阿里巴巴在 GitHub 新建 alibaba/ray 仓库,将 Ray 定位为 AI 计算引擎,由核心分布式运行时和一组用于加速机器学习工作负载的 AI 库组成。该仓库为 fork,用于向上游提交 PR 贡献代码。
阿里巴巴开源 FlagTree,一个支持多种 AI 芯片后端的统一编译器,用于自定义深度学习算子。该仓库为贡献用 Fork,所有改动计划提交上游 PR。
Together AI 发文解析 DeepSeek-V4 的服务化挑战,认为其核心变化是在 token 轴压缩 KV cache 的混合注意力设计(CSA、HCA、SWA),使模型支持 1M token 上下文窗口。
推荐理由:原文基于 Together 在 HGX B200 上的实际 bring-up,给出 KV cache 布局和缓存策略如何决定 DeepSeek-V4 长上下文吞吐的具体经验。
NousResearch 在 GitHub 发布 agent-governance-toolkit 开源仓库,面向自主 AI 智能体提供策略执行、零信任身份、执行沙箱和可靠性工程能力。仓库说明覆盖 10/10 OWASP Agentic Top 10。
开发者用 CLI 智能体 Goose 配合 Together 的 dedicated containers 技能,仅凭一句提示词就为 Netflix 新发布的 void-model 生成了可在 Together Dedicated Container Inference(DCI)上运行的完整容器配置,把从模型发布到实际部署的滞后压缩到近乎为零。
Google DeepMind 发布 AlphaEvolve(基于 Gemini 的编码智能体)一年来的影响汇总。
推荐理由:原文系统汇总了 AlphaEvolve 一年来在科研、基础设施与商业中的落地案例,附具体数字,可作为评估此类编码智能体实用价值的参照。
Johann Rehberger 发布 DEF CON Singapore 演讲全文,披露 M365 Copilot 与消费版 Copilot 的多条漏洞链,MSRC 编号 CVE-2026-24299,问题已修复。
推荐理由:作者亲历披露全链路攻击并给出修复时间线,读者可以借此理解间接提示词注入与内存持久化的实际风险。
Together AI 提出以研究、系统工程与硬件优化叠加的方式降低大规模推理成本,其 FlashAttention、ThunderKittens 与开源自适应推测解码系统 Aurora 可实现最高 1.25x 的 LLM 推理加速。
Together AI 在生产环境中处置了 Linux 内核 crypto 子系统漏洞 Copy Fail(CVE-2026-31431),该漏洞位于 algif_aead AF_ALG 接口,允许任意非特权本地用户向系统上任意可读文件的 page cache 做精确 4 字节写入,且不改变磁盘文件、不标记脏页,可绕过传统文件完整性检查并借此提权到 root。
Together AI 宣布 DeepSeek-V4 Pro 上线,提供 Serverless Inference(512K 上下文)与 Dedicated 部署(完整 1M 上下文、预留容量)。
推荐理由:原文给出部署形态、定价与基准数字,读者可以据此评估在 512K 上下文上运行 DeepSeek-V4 Pro 的实际成本与路径。
Mistral AI 发布 Workflows 公开预览版,一个面向企业 AI 的编排层,提供持久执行、可观测性、容错和人工审批,ASML、ABANCA、CMA-CGM 等客户已在用它自动化关键业务流程。
推荐理由:官方公布 API 缓存命中输入价格降至原价十分之一,并给出各型号具体单价,可据此估算构建成本变化。
阿里巴巴在 GitHub 发布 obz-cli,一个面向 metrics、logs、traces 的多后端可观测性 CLI,提供统一接口并适配 AI Agent 使用。该工具将多种可观测性数据源的查询整合到同一命令行界面中。
面向 AI 原生团队的多租户 GPU 集群设计需同时满足池化容量、租户隔离与自助访问三项要求,避免为每个团队单独建集群导致 GPU 夜间和周末闲置。架构上采用共享层加租户层的两层模式,共享层由集中控制面管理高性能存储与 InfiniBand/Ethernet 网络,租户层为每个团队提供专属 GPU 节点、存储 PVC 及自选编排层(Kubernetes、Slurm 等)。
browser-use 在 GitHub 发布新仓库 browser-use/browser-harness,定位为一个自愈式 harness,使 LLM 能够完成任意任务。材料仅含仓库简介,未提供更多功能细节。
OpenAI 发布 API 部署检查清单,指导开发者基于 Responses API 和 GPT-6 模型族(gpt-6-astra、gpt-6.1-sol、gpt-6-luna)配置生产工作负载。
阿里巴巴在 GitHub 新建 aiconfigurator 仓库,用于对分离式 Dynamo 图进行离线优化。该仓库为 fork 版本,所有改动计划以上游 PR 形式贡献回主项目。
Together AI 提出 AI Native Cloud 概念,指围绕 AI 全生命周期(预训练、微调、评估、大规模推理)垂直整合的云平台,而非为 Web 应用优化的传统 CPU 云。其核心特征包括从 GPU、NVLink/RDMA 高速互联到训练与推理框架的统一全栈,以及持续吸收前沿研究、快速将研究转化为生产的能力。
Sierra 发布两款自研搜索模型 Linnaeus(检索)与 Darwin(重排序),称其解决率最高提升 16 个百分点。Linnaeus 直接基于完整对话检索,recall@5 提升 20%、recall@30 约 95%,每次搜索延迟最多降低约 800ms;Darwin 负责重排序,兼顾精度与成本。Sierra 智能体每天执行超 200 万次搜索,P90 延迟与搜索成本均下降超 75%。
Together AI 提出 DBPlanBench,将 Apache DataFusion 的物理执行计划暴露给 LLM,把查询优化从统计计算转为语义推理。其序列化层将计划压缩约 10 倍,LLM 通过 JSON Patch 做局部改写而非重生成整个计划。
蚂蚁 inclusionAI 在 GitHub 开源 cuLA,提供多种线性注意力变体的 CUDA 内核,使用 CuTe DSL 与 CUTLASS C++ 编写。该仓库目前仅披露技术栈,未公布支持的模型、性能数据或开源许可等细节。
Together AI 内核团队在获得 NVIDIA Blackwell GPU 一周内,基于 ThunderKittens 库开发出部分最快的 FP4 和 FP8 GEMM 内核,相比 H100 上的 cuBLAS 最高提速 2 倍。
Together AI 开源 Aurora,一个基于 RL 的推测解码框架,可从实时推理轨迹中持续学习并异步更新 draft 模型,在 Qwen3 和 Llama3 等模型上比静态 speculator 额外提速 1.25 倍。
Google Research 发布压缩算法 TurboQuant,在零精度损失下大幅压缩模型体积,可同时用于 KV cache 压缩与向量搜索。它结合 PolarQuant 与 QJL 两种方法:前者通过随机旋转与极坐标量化消除传统量化每块数据需全精度存储常数的内存开销,后者仅用 1 bit 残差纠偏。
Together AI 推出统一方案,在同一集群内共同部署 STT、LLM 和 TTS 基础设施来构建实时语音智能体,端到端延迟低于 500 毫秒(从用户说话结束到首个音频 token)。
NVIDIA Nemotron 3 Super 登陆 Together AI,模型为 120B 参数(12B 激活)、Transformer 与 Mamba 混合 MoE 架构,支持 1M-token 上下文窗口,生成速度较当前领先开源模型高 50% 以上。
Together AI 为 Together GPU Clusters(原 Instant Clusters)加入自动扩缩容、RBAC、全栈可观测性和自助节点修复。
Together AI 在首届 AI Native Conf 上发布七项研究与产品成果,覆盖 Kernels、强化学习与算法推理优化三个方向。
Together AI 等团队发布 FlashAttention-4,通过算法与内核协同设计在 Blackwell B200 上最大化 matmul 与其他资源瓶颈的重叠。
Together AI 提出缓存感知的预填充-解码分离架构 CPD,在延迟 SLO 下可持续 QPS 比现有分离式设计提升 35–40%,并在存在大型冷提示时保持更紧的尾延迟。
OpenBMB 发布 ArcLight,一个轻量级 LLM 推理框架。该框架以轻量为主要定位,具体参数规模、性能数据与可用方式尚未在现有信息中披露。
Together AI 提出一致性扩散语言模型 CDLM,通过轨迹蒸馏、块级因果注意力与三项联合训练目标,让扩散语言模型在少步推理下保持质量,并支持精确的块级 KV 缓存。在 Dream-7B-Instruct 上,CDLM 将精炼步数减少约 4.1x–7.7x,GSM8K-CoT 延迟最高降低 11.2x,MBPP-Instruct 最高降低 14.5x,多数任务准确率变化很小。
Sierra 构建了 Multi-Model Router(MMR)与拥塞感知的 provider 选择器两层基础设施,在 provider 出现限流或故障时保持智能体行为一致。
Together AI 推出 Dedicated Container Inference,团队自带 Docker 容器部署视频生成、虚拟人合成、图像处理等自定义生成媒体模型,平台负责自动扩缩、队列、流量隔离和监控。
美团发布 LongCat-Flash-Lite,非思考型 68.5B 参数 MoE 模型,激活参数约 3B,支持 256k 上下文,权重以 MIT 协议开源在 HuggingFace。模型集成 N-gram 嵌入表提升性能与推理速度,官方评测显示其 SWE-Bench 达 54.40,agentic 与编码能力在同规模模型中具竞争力,并给出 transformers 与 SGLang 部署方案。
Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的重大升级,由 Devstral 2 模型系列驱动。新增自定义 subagents、多选项澄清、slash 命令技能、统一 agent 模式和自动更新;产品现已在 Le Chat Pro 和 Team 套餐开放,支持按量付费或自带 API key。
推荐理由:官方宣布 Mistral Vibe 2.0 上线,列出 subagents、slash 命令技能等新能力和 Le Chat Pro/Team 套餐与 Devstral 2 定价,读者可据此评估工作流适配。