蚂蚁 inclusionAI 发布 AKernel:面向智能体的可编程数据中心级基础设施
蚂蚁 inclusionAI 在 GitHub 新建仓库 AKernel,定位为面向 Agents 的可编程数据中心级基础设施。该仓库目前仅给出这一句项目描述,未披露模型、参数或性能细节。
蚂蚁 inclusionAI 在 GitHub 新建仓库 AKernel,定位为面向 Agents 的可编程数据中心级基础设施。该仓库目前仅给出这一句项目描述,未披露模型、参数或性能细节。
蚂蚁 inclusionAI 在 GitHub 上线新仓库 sandboxd,定位为沙箱运行时守护进程(sandbox runtime daemon)。目前仓库仅提供这一句说明,未披露具体功能、支持平台或开源许可等细节。
vLLM 生态的强化学习框架 vime 现已支持 ROCm,可在 AMD Instinct MI355X GPU 上原生运行大规模 RL 后训练。vime 采用 Megatron 训练、vLLM 推理与数据缓冲三段解耦架构,整条流水线已在 ROCm 上完成端到端验证,并同步上游 ROCm 相关修复、提供预构建容器。
Mistral Studio 即日起为 Prompts 和 Skills 提供集中式系统记录,每个资产都具备版本管理、归属和可追溯性。版本一经发布即不可更改,支持任意两版对比、分钟级回滚,并默认记录审计日志与分类标签。Skills 可直接以 MCP 服务器形式从 Studio 调用,确保生产环境执行的是受治理的同一资产。
Hugging Face 宣布 vLLM 的 transformers 建模后端现在达到甚至超过 vLLM 原生实现的吞吐速度,模型作者无需移植代码即可用 --model-impl transformers 获得 vLLM 级推理性能。
推荐理由:官方给出了与 vLLM 原生实现对比的具体吞吐数字和使用方法,读者可以据此判断是否切换到自己已有的 transformers 模型工作流。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者可在支持的模型页点击 Customize on SageMaker AI 或 Deploy on SageMaker AI,一键进入 SageMaker Studio 并预加载所选模型。
Microsoft Build 2026 上宣布 Foundry Managed Compute 以及 Hugging Face 模型精选目录,数千个开源权重模型每周更新,可一键部署到 Foundry Managed Compute,支持 NVIDIA A100、H100 和 AMD MI300X。
推荐理由:原文完整说明了精选模型目录、策展管线和运行时选择,读者可以据此评估在私有网络内部署开源模型的路径。
SkyPilot 与 Hugging Face 联合推出 store: hf,把 Hugging Face Storage 作为 SkyPilot 的一等存储后端,用一个 hf:// URL 和现有 HF_TOKEN 即可把 Bucket 或 Hub 仓库挂载进任意云上的任务。
推荐理由:两家联合发布 store: hf,给出了零出口费读取、MOUNT/COPY 用法和实测写入速度,读者可以据此评估多云 GPU 训练的存储方案。
Hugging Face 发布 LeRobot v0.6.0,引入 VLA-JEPA、FastWAM、LingBot-VA 等世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:发布方系统列出世界模型策略、奖励模型 API、新基准与部署 CLI 等更新,读者可以据此评估机器人学习工作流的变化。
腾讯混元 AI Infra 团队的 HPC-Ops 算子库中的 Attention 和 MoE 内核已合入 vLLM 主分支,成为一等后端,针对 NVIDIA Hopper 架构优化,在 H20 上效果最好。
Hugging Face 为 Kernels 项目引入 Hub 上的 "kernel" 新仓库类型,并默认只加载受信任发布者的内核,非信任来源需显式传入 trust_remote_code=True。
Nous Research 为 Hermes Agent 推出 Telegram Business Mode 插件,以秘书机器人形式运行,每条草拟回复都需经所有者批准后才会发送给客户。该插件采用 observe-with-approval 机制,目前已在 GitHub 开源。
Hugging Face 与 Cerebras 展示了一套开源、模块化的实时语音到语音流水线:Nvidia Parakeet 做语音识别,Google DeepMind 的 Gemma 4 31B 在 Cerebras 上推理,阿里 Qwen3TTS 合成语音回复。
Sierra 在 Agent Studio 中推出 Experiments,为团队提供运行、审查和发布 A/B 测试的统一界面,每项智能体改动都需经实验验证。实验默认以解决率和流失率等业务指标评估,仪表盘展示统计显著性、效果出现时间及稳定性,支持逐步放量后全量发布。Ghostwriter 会分析全部对话、提炼假设并在数分钟内将其转化为实验,使测试频率从每季度一次提升至持续迭代。
Google Research 将建筑级屋顶反射率数据集从 14 个城市扩展至 50+ 个城市,覆盖 9 个国家,并通过新的 Heat Resilience Earth Engine App 开放访问。该方法融合 Sentinel-2 与 30-cm 高分辨率卫星影像,在 Boulder 验证中 RMSE 仅 0.04,建模显示针对性冷屋顶规划可使全球城市极端高温降低最多 0.5°C。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,评测结果可跨平台发布并回溯至完整记录。EEE 数据存储已收录约 229,000 条评测结果,覆盖超 22,000 个模型和 2,200 个基准,来自 31 种报告格式。贡献者可通过转换器将 EEE 记录提交至 Community Evals,经组织官方账号提交的结果会显示验证标记。
vLLM Semantic Router 团队推出 Micro-Agent 能力,把单次模型 API 调用变成服务层内有界的多模型协作,用户仍只调用一个模型名 vllm-sr/auto。
Midjourney 为 V8.1 草稿模式加入随机风格探索功能,在提示词中加入 --sref random 即可生成 24 张不同风格的图像。开启草稿模式可点击提示词栏的 ⚡ 图标,或在提示词中加入 --draft。
Google DeepMind 宣布 computer use 成为 Gemini 3.5 Flash 的内置工具,从此前的独立 Gemini 2.5 computer use 模型整合进主力 Flash 模型,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能在浏览器、移动和桌面环境操作的智能体。
推荐理由:原文给出 computer use 内置于 Gemini 3.5 Flash 的能力和安全措施,读者可据此评估在自动化任务中的可用性。
Mistral 为 Connectors 推出多项新能力:按 workspace 或组织分配连接器访问权限、可单独开关工具的管理员控制,以及带连接器作用域的 API key,均已 GA。多账号连接器(GA)支持一个连接器绑定多个账号,Connectors Debugger(公开预览)可分 11 步定位 MCP 连接故障。目录现有 60 多个预置集成,并支持自定义 MCP 连接器。
Midjourney 为 V8.1 推出 Draft mode,每次生成 24 张低分辨率低质量图片,消耗的 fast hours 为 V8.1 SD 任务的一半,可对选中图片点击 Vary 以全质量全分辨率渲染,通过菜单栏 ⚡ 按钮开启。
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转化为可操作的树篱、石墙与林地清单,覆盖英国超 13 万平方公里。
vLLM Semantic Router 团队发布 Fusion API,让一条路由可以运行多个面板模型、由 judge 模型分析共识与分歧并合成单个回答。
Sierra 于 3 月推出 Ghostwriter,让构建和优化 AI 智能体无需点击或写代码,只需描述需求。三个月后,支持主管、运营经理、QA 团队等从未写过代码的人开始直接改进客户体验。Sierra 同时推出优化智能体的 Explorer,持续分析客户对话并找出客户流失、处理不佳的问题及 CSAT 下滑点,再由 Ghostwriter 将洞察转化为改进。
Modem 面向所有用户开放 Zendesk 集成 beta 版,可在 Settings → Integrations → Zendesk 中通过 OAuth 连接。
vLLM 宣布对 MiniMax M3 家族的 day-0 支持,涵盖 MiniMaxAI/MiniMax-M3 与 MiniMax-M3-MXFP8 两个检查点,支持 1M token 上下文和图像、视频多模态输入。
推荐理由:vLLM 团队自己拆解了 day-0 支持背后的 MSA 内核、缓存和部署细节,读者可以按需套用其部署配方。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70+ 语言的近实时语音到语音翻译,自动检测语言并保留说话人的语调、节奏和音高,全程仅落后说话人数秒。
推荐理由:原文来自 Google DeepMind 官方博客,说明了 Gemini 3.5 Live Translate 的能力细节和各端开放入口,读者可据此评估实时语音翻译的实际可用范围。
Google 在 Gemini Enterprise Agent Platform 上推出基于 Agentic RAG 的 Cross-Corpus Retrieval,通过多智能体协作处理多源、多跳查询,相比标准 RAG 在事实性数据集上准确率最高提升 34%。
vLLM Semantic Router 发布 v0.3 版本 Themis,推出规范化 v0.3 配置契约、投影机制和首个生产可用的会话感知智能体路由(SAAR),并强化协议兼容、仪表盘运维控制台与 CLI。
推荐理由:版本把信号、投影、决策到模型选择收敛为统一契约,并引入会话感知路由,适合关注生产级流量治理的团队参考。
Modem 面向所有用户开放 Notion 集成,智能体可创建页面、填充数据库行、更新属性并向已有页面追加内容,所有写入操作均需用户确认后执行。该集成通过 OAuth 授权,访问令牌加密存储,可在 Settings 中随时断开。用户还能把 Notion 中的文档、PRD 等资料结合技能与自动化,构建 UTM 生成、Bug 分诊、客户研究等智能体工作流。
vLLM Semantic Router 新增会话感知智能体路由(SAAR),在语义路由之上加入路由器会话记忆、工具循环硬锁、安全重置边界、前缀缓存感知的切换定价与可回放轨迹。在 21,600 个确定性轮次中,SAAR 将模型切换减少 79.29%,消除 3,836 次不安全切换,物理模型成本估算降低 78.71%;在 2,896 个 AMD ROCm 实时请求中保持会话连续性,未观察到违规。
Google Research 在 I/O 2026 上发布 Gemini for Science 科研工具套件,包含基于 ERA 与 AlphaEvolve 的 Computational Discovery、基于 Co-Scientist 的 Hypothesis Generation 以及基于 NotebookLM 的 Literature Insights。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的整合 AI 栈,与 Airbus、BMW 和 ASML 合作优化设计、仿真与生产,并收购 Emmi 补充科学能力。Vibe 智能体升级为统一智能体,可处理收件箱与日历、深度研究、编码到合并 PR 等长程多步任务;Les Ulis 新的 10 MW 推理数据中心计划于 Q3 2026 启用,以增强算力控制与安全。
Mistral 发布统一 AI 智能体 Vibe,Le Chat 整体升级为 Vibe,原有对话、设置与套餐全部迁移。Work Mode 处理跨企业工具的多步骤长任务,如邮件日历跟进、深度研究、文档撰写和定时任务;Code Mode 从网页发起远程编码会话直至生成 PR,并推出 VS Code 扩展和更新的 CLI(新增 /teleport、权限控制等)。
推荐理由:官方发布说明写清了 Le Chat 升级为 Vibe 后的工作与编码两大模式、各端入口和定价,可据以评估是否替换现有工作流。
Mistral AI 发布开源 Search Toolkit 公开预览版,这是一个用于构建 AI 应用生产级搜索管线的可组合框架。
推荐理由:原文给出框架的具体模块构成、内置检索与评测指标,以及可复用的 starter 模板命令,读者可据此评估是否替代自建检索管线。
Midjourney 改进 Web 端对话模式,语音会话启动时可访问 Image Prompts、Style References、侧边栏设置和最近任务,Image Prompts 现可从托盘和侧边栏使用,托盘图片在语音提交间保留。
Mistral 将 Emmi AI 团队纳入麾下,推出面向工业工程的物理 AI 基础能力,可从几何与边界条件直接预测完整物理场,单 GPU 单次前向推理将仿真从数小时压缩到秒级。该能力面向设计迭代而非替代传统求解器,合作方包括 ASML、Airbus、Safran 和 Siemens Energy,覆盖产品设计、工装工艺与实时数字孪生三类场景。
Mistral AI 在 Studio 发布 Connectors 公测,内置连接器和自定义 MCP 均可通过 API/SDK 用于所有模型和 Agent 调用。新功能包括直接工具调用、requires_confirmation 人工审批流和连接器的程序化管理;连接器 centrally 注册后可在 LeChat 和 AI Studio 间复用,并支持与 CRM、知识库等企业系统集成。
Google 发布 ERA 研究工具并宣布在 I/O 开始开放基于 AlphaEvolve 与 ERA 构建的 Computational Discovery,相关论文发表于 Nature。
推荐理由:原文给出 ERA 在多个学科基准上的专家级表现和八个应用案例,还提供了 Computational Discovery 的注册入口,读者可据此评估科学编码工具的实际进展。
Modem 向所有用户开放 Automation Templates,可在 Automations 页面浏览并一键安装经过测试的现成智能体自动化。安装后模板会生成预填提示词、调度和输出目标的自动化,未编辑提示词时还能随官方改进持续更新,用户也可随时 fork 自行定制。模板覆盖 GitHub PR 合并后通知 Slack、每日新面孔识别、每周更新日志草稿等场景。