跳到正文

#部署/工程

今日 41 条
5月22日周五
  1. Mistral AI:News(网页)59

    Mistral 在 Studio 发布 Connectors,支持内置与自定义 MCP 连接器

    Mistral AI 在 Studio 发布 Connectors 公测,内置连接器和自定义 MCP 均可通过 API/SDK 用于所有模型和 Agent 调用。新功能包括直接工具调用、requires_confirmation 人工审批流和连接器的程序化管理;连接器 centrally 注册后可在 LeChat 和 AI Studio 间复用,并支持与 CRM、知识库等企业系统集成。

5月19日周二
5月18日周一
5月15日周五
5月14日周四
5月11日周一
  1. Together AI 研究与产品博客(RSS)68

    Together AI 解析 DeepSeek-V4 服务化:百万 token 上下文为何是推理系统工程问题

    Together AI 发文解析 DeepSeek-V4 的服务化挑战,认为其核心变化是在 token 轴压缩 KV cache 的混合注意力设计(CSA、HCA、SWA),使模型支持 1M token 上下文窗口。

    推荐理由:原文基于 Together 在 HGX B200 上的实际 bring-up,给出 KV cache 布局和缓存策略如何决定 DeepSeek-V4 长上下文吞吐的具体经验。

5月8日周五
5月6日周三
5月4日周一
4月30日周四
  1. Together AI 研究与产品博客(RSS)61

    Together AI 复盘处置 Linux 内核漏洞 Copy Fail(CVE-2026-31431)的生产应急响应

    Together AI 在生产环境中处置了 Linux 内核 crypto 子系统漏洞 Copy Fail(CVE-2026-31431),该漏洞位于 algif_aead AF_ALG 接口,允许任意非特权本地用户向系统上任意可读文件的 page cache 做精确 4 字节写入,且不改变磁盘文件、不标记脏页,可绕过传统文件完整性检查并借此提权到 root。

4月29日周三
4月27日周一
  1. DeepSeek66

    DeepSeek 宣布即刻起整个 API 系列的输入缓存命中价格降至原价的 1/10。图中显示 DeepSeek-V4-Pro 缓存命中输入价为 $0.003625,DeepSeek-V4-Flash 为 $0.0028;DeepSeek-V4-Pro 75% 折扣促销持续至 2026 年 5 月 5 日 15:59(UTC)。

    推荐理由:官方公布 API 缓存命中输入价格降至原价十分之一,并给出各型号具体单价,可据此估算构建成本变化。

4月24日周五
4月21日周二
  1. Together AI 研究与产品博客(RSS)31

    面向 AI 原生团队的多租户 GPU 集群设计指南:如何做到容量共享而不冲突

    面向 AI 原生团队的多租户 GPU 集群设计需同时满足池化容量、租户隔离与自助访问三项要求,避免为每个团队单独建集群导致 GPU 夜间和周末闲置。架构上采用共享层加租户层的两层模式,共享层由集中控制面管理高性能存储与 InfiniBand/Ethernet 网络,租户层为每个团队提供专属 GPU 节点、存储 PVC 及自选编排层(Kubernetes、Slurm 等)。

4月17日周五
4月13日周一
4月7日周二
  1. Together AI 研究与产品博客(RSS)25

    什么是 AI Native Cloud?

    Together AI 提出 AI Native Cloud 概念,指围绕 AI 全生命周期(预训练、微调、评估、大规模推理)垂直整合的云平台,而非为 Web 应用优化的传统 CPU 云。其核心特征包括从 GPU、NVLink/RDMA 高速互联到训练与推理框架的统一全栈,以及持续吸收前沿研究、快速将研究转化为生产的能力。

4月4日周六
  1. Sierra:Blog(RSS)42

    Sierra 推出 Linnaeus 与 Darwin 搜索模型,解决率最高提升 16 个百分点

    Sierra 发布两款自研搜索模型 Linnaeus(检索)与 Darwin(重排序),称其解决率最高提升 16 个百分点。Linnaeus 直接基于完整对话检索,recall@5 提升 20%、recall@30 约 95%,每次搜索延迟最多降低约 800ms;Darwin 负责重排序,兼顾精度与成本。Sierra 智能体每天执行超 200 万次搜索,P90 延迟与搜索成本均下降超 75%。

4月3日周五
4月2日周四
4月1日周三
3月31日周二
3月25日周三
3月12日周四
3月11日周三
3月10日周二
3月5日周四
3月4日周三
3月2日周一
2月19日周四
  1. Together AI 研究与产品博客(RSS)48

    Together AI 的 CDLM 让扩散语言模型推理最高提速 14 倍且不牺牲质量

    Together AI 提出一致性扩散语言模型 CDLM,通过轨迹蒸馏、块级因果注意力与三项联合训练目标,让扩散语言模型在少步推理下保持质量,并支持精确的块级 KV 缓存。在 Dream-7B-Instruct 上,CDLM 将精炼步数减少约 4.1x–7.7x,GSM8K-CoT 延迟最高降低 11.2x,MBPP-Instruct 最高降低 14.5x,多数任务准确率变化很小。

2月14日周六
2月12日周四
2月6日周五
  1. 美团 LongCat:HuggingFace 新模型55

    美团开源 LongCat-Flash-Lite:68.5B 参数 MoE 模型,主打 N-gram 嵌入与推理效率

    美团发布 LongCat-Flash-Lite,非思考型 68.5B 参数 MoE 模型,激活参数约 3B,支持 256k 上下文,权重以 MIT 协议开源在 HuggingFace。模型集成 N-gram 嵌入表提升性能与推理速度,官方评测显示其 SWE-Bench 达 54.40,agentic 与编码能力在同规模模型中具竞争力,并给出 transformers 与 SGLang 部署方案。

1月28日周三
  1. Mistral AI:News(网页)62

    Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,搭载 Devstral 2

    Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的重大升级,由 Devstral 2 模型系列驱动。新增自定义 subagents、多选项澄清、slash 命令技能、统一 agent 模式和自动更新;产品现已在 Le Chat Pro 和 Team 套餐开放,支持按量付费或自带 API key。

    推荐理由:官方宣布 Mistral Vibe 2.0 上线,列出 subagents、slash 命令技能等新能力和 Le Chat Pro/Team 套餐与 Devstral 2 定价,读者可据此评估工作流适配。