Together GPU Clusters 新增被动健康检查、自动节点修复与 Slinky 1.0
Together 为 GPU Clusters 推出被动健康检查、自动节点修复和基于 Slinky 1.0 重建的 Slurm-on-K8s 2.0 栈。被动检查持续监控 GPU 掉总线、热降频、Xid 错误等故障,自动节点修复提供 Reboot、Reprovision、Failover、Remove 四种操作,由人工确认后执行。
Together 为 GPU Clusters 推出被动健康检查、自动节点修复和基于 Slinky 1.0 重建的 Slurm-on-K8s 2.0 栈。被动检查持续监控 GPU 掉总线、热降频、Xid 错误等故障,自动节点修复提供 Reboot、Reprovision、Failover、Remove 四种操作,由人工确认后执行。
Thinking Machines 在 Hugging Face 上发布开源多模态模型 Inkling,共 975B 总参数、41B 激活参数,支持 1M 上下文,原生接收图像、文本和音频输入,训练数据为 45 万亿 token,并同时发布 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:文章给出了 Inkling 的架构细节、各档位 VRAM 需求和多条部署路径,便于读者评估在自己的硬件上运行哪种变体。
MIT LIDS 首席研究员 Devavrat Shah 基于其实验室多年研究,为衍生公司 Ikigai Labs 构建了面向表格与时序数据的基础模型,可从企业多源数据持续学习并实时预测。
MIT 航空航天系举办 JARVIS Challenge,让 31 名本科生分 7 队在四周内设计、制造并测试可产生 50–100 磅推力的单轴微型涡喷发动机,以 AI 为主要工程伙伴。
Modem 面向所有用户开放 Stripe 集成 beta,可在 Settings → Integrations → Stripe 通过官方 Stripe App 的 OAuth 只读接入,无需 API key。
vLLM 通过 V1 的公开 connector 接口接入 TileRT 作为专用 decode 引擎,随 TileRT 0.1.5 发布,prefill、调度、前缀缓存与 API 均保持原生 vLLM 不变。
Sierra 宣布与 SoftBank Corp. 建立合作,SoftBank 将作为 Sierra 在日本的独家销售伙伴推动日本企业采用其对话式 AI 客服平台。
MIT 网络安全诊所自 2019 年开设 11.074/11.274 课程以来,已为新英格兰地区市政和医疗机构完成 40 多份免费保密的安全评估。课程由 Jungwoo Chun 与 Lawrence Susskind 主持,学生通过认证考试后组队为客户排查漏洞并提交改进建议,其“防御性社会工程”方法强调人仍是最主要的攻击入口。
Google DeepMind 在印度启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为 Tinkering Lab 教育者提供 24/7 备课与培训助手。该工具基于 NotebookLM 组织 12 个核心模块内容,支持 10 个模块的项目生成,并首发支持 8 种语言。底层由 Gemini 3.5 Flash 提供智能支持,首批覆盖全国 100 所试点学校。
MIT 与儿童安全非营利组织 Thorn 合作提出一种新的模型审计方法,通过 Gaussian probing 检查 LoRA 微调对模型内部表示的改变,在不生成任何输出的情况下判断模型是否被专门化用于生成 CSAM 等有害图像。
vLLM 与 AMD Quark 团队展示了在 AMD Instinct MI355X GPU 上训练和部署 EAGLE3 投机解码的完整流程,覆盖 Kimi-K2.5 与 MiniMax-M2.5,并用 InferenceX 做基准测试。
蚂蚁 inclusionAI 在 GitHub 新建仓库 AKernel,定位为面向 Agents 的可编程数据中心级基础设施。该仓库目前仅给出这一句项目描述,未披露模型、参数或性能细节。
蚂蚁 inclusionAI 在 GitHub 上线新仓库 sandboxd,定位为沙箱运行时守护进程(sandbox runtime daemon)。目前仓库仅提供这一句说明,未披露具体功能、支持平台或开源许可等细节。
蚂蚁 inclusionAI 在 GitHub 发布新仓库 distill-fs,这是一个只读 FUSE 文件系统,可直接挂载原始磁盘镜像和 Nydus RAFS 镜像。该工具面向镜像内容的只读访问场景,目前仓库信息仅说明其支持的两类镜像格式。
Thinking Machines Lab exists to empower humanity through advancing collaborative general intelligence. We're building multimodal AI that works with how you naturally interact with the world - through conversation, through sight, through the messy way we collaborate. We're excited that in the next couple months we’ll be able to share our first product, which will include a significant open source component and be useful for researchers and startups developing custom models. Soon, we’ll also share our best science to help the research community better understand frontier AI systems. To accelerate our progress, we’re happy to confirm that we’ve raised $2B led by a16z with participation from NVIDIA, Accel, ServiceNow, CISCO, AMD, Jane Street and more who share our mission. We’re always looking for extraordinary talent that learns by doing, turning research into useful things. We believe AI should serve as an extension of individual agency and, in the spirit of freedom, be distributed as widely and equitably as possible. We hope this vision resonates with those who share our commitment to advancing the field. If so, join us. https://thinkingmachines.paperform.co/
蚂蚁 inclusionAI 在 GitHub 新建仓库 inclusionAI/vllm,定位为面向 LLM 的高吞吐、内存高效推理与服务引擎。该仓库目前仅给出这一句项目描述,未披露具体模型支持、性能数据或版本信息。
蚂蚁 inclusionAI 在 GitHub 新建 sglang 仓库,定位为面向大语言模型和多模态模型的高性能服务框架。该仓库目前仅给出这一定位描述,未披露具体版本号、性能数据或开源许可等细节。
Thinking Machines Lab 发表文章,主张构建延伸人类意志与判断的 AI,认为当前多数模型集中训练后固化,未受使用者塑造。公司提出训练强模型、提供可微调模型权重的工具、开发原生多模态交互模型、发布研究等四个技术方向,并将对齐视为分散在多元模型生态中的持续过程。
Hugging Face 发布 Profiling in PyTorch 系列第三篇,用 profiler trace 对比手写注意力、in-place 掩码、SDPA math/efficient/flash/cuDNN 各后端的 kernel 表现。
推荐理由:原文用 profiler trace 逐一对比 PyTorch 各注意力实现的 kernel 差异,读者可以学到一套先猜测再看 trace 的可迁移分析方法。
vLLM 生态的强化学习框架 vime 现已支持 ROCm,可在 AMD Instinct MI355X GPU 上原生运行大规模 RL 后训练。vime 采用 Megatron 训练、vLLM 推理与数据缓冲三段解耦架构,整条流水线已在 ROCm 上完成端到端验证,并同步上游 ROCm 相关修复、提供预构建容器。
Sierra 分享把全公司接入 AI 智能体的经验:工程团队用 git worktrees、Claude Code 和 Codex 并行跑 agent,部分任务产出达 5 倍,随后成立六人团队推进全员采用。
推荐理由:Sierra 复盘了内部全员 Agent 化的落地过程,单一入口、上下文瓶颈和成果度量三处经验可迁移到其他团队。
MIT 团队发布 FloatForm 系统,由 21 厘米见方的方形机器人船组成,可自主组装成刚性结构、拆解并重组,单次运行耗时 4 至 8 分钟。该系统仅需轻量中央规划器分配最终位置,其余导航与避碰由机器人自身完成,仿真显示可平滑扩展至 64 艘的集群。相关论文已发表于 Nature Communications。
Mistral Studio 即日起为 Prompts 和 Skills 提供集中式系统记录,每个资产都具备版本管理、归属和可追溯性。版本一经发布即不可更改,支持任意两版对比、分钟级回滚,并默认记录审计日志与分类标签。Skills 可直接以 MCP 服务器形式从 Studio 调用,确保生产环境执行的是受治理的同一资产。
Google Research 发布 SensorFM,一个大传感器基础模型,用来自 500 万名同意参与研究者的超过一万亿分钟无标签多模态可穿戴数据进行自监督预训练,覆盖 100 多个国家、20 多种 Fitbit 和 Pixel Watch 设备。
Mistral 发布首个具身导航模型 Robostral Navigate,8B 参数,仅靠单个普通 RGB 摄像头、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单摄像头方案高 9.7 分、比最佳多传感器方案高 4.5 分。
Hugging Face 宣布 vLLM 的 transformers 建模后端现在达到甚至超过 vLLM 原生实现的吞吐速度,模型作者无需移植代码即可用 --model-impl transformers 获得 vLLM 级推理性能。
推荐理由:官方给出了与 vLLM 原生实现对比的具体吞吐数字和使用方法,读者可以据此判断是否切换到自己已有的 transformers 模型工作流。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者可在支持的模型页点击 Customize on SageMaker AI 或 Deploy on SageMaker AI,一键进入 SageMaker Studio 并预加载所选模型。
Google Research 在 Nature Cities 发表首个大规模真实世界研究,通过修改 Google Maps 算法将不到 2% 的行程引导至相近耗时的替代路线,在美国 10 座城市测试六个月。结果显示目标路段行驶速度中位数提升约 2%,油耗率中位数下降 0.5% 至 1.0%,每座城市每年可减少数千吨 CO2e 排放。
Microsoft Build 2026 上宣布 Foundry Managed Compute 以及 Hugging Face 模型精选目录,数千个开源权重模型每周更新,可一键部署到 Foundry Managed Compute,支持 NVIDIA A100、H100 和 AMD MI300X。
推荐理由:原文完整说明了精选模型目录、策展管线和运行时选择,读者可以据此评估在私有网络内部署开源模型的路径。
MIT 理论粒子物理学家 Jesse Thaler 被任命为核科学实验室(LNS)主任,8 月 1 日生效,接任执掌该实验室十年的 Bolek Wyslouch。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,推理成本正快速趋近于零——GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,基准测试中推理价格年降幅在 9x 到 900x 之间,中位数约 50x。
SkyPilot 与 Hugging Face 联合推出 store: hf,把 Hugging Face Storage 作为 SkyPilot 的一等存储后端,用一个 hf:// URL 和现有 HF_TOKEN 即可把 Bucket 或 Hub 仓库挂载进任意云上的任务。
推荐理由:两家联合发布 store: hf,给出了零出口费读取、MOUNT/COPY 用法和实测写入速度,读者可以据此评估多云 GPU 训练的存储方案。
Hugging Face 发布 LeRobot v0.6.0,引入 VLA-JEPA、FastWAM、LingBot-VA 等世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:发布方系统列出世界模型策略、奖励模型 API、新基准与部署 CLI 等更新,读者可以据此评估机器人学习工作流的变化。
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合而成,用 VLM 重新生成图像长描述,再转为可流式读取的语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天),并采用 Lance 构建、MDS 流式的双格式流程,图像统一以 JPEG quality 92 编码。
Microsoft 首席人力官 Amy Coleman 宣布裁减约 4,800 个岗位,约占全球员工的 2.1%,主要集中在 Commercial 和 XBOX 组织,另将四个游戏工作室移交新管理以保留知识产权和进行中项目。公司过去一年已将超过 4,000 名员工重新部署到新岗位,超过 30% 的符合条件的员工参加了自愿退休计划,并表示这些岗位并未被 AI 取代。
推荐理由:首席人力官亲述裁员规模、安置措施与四大游戏工作室转管安排,并明确这些岗位未被 AI 取代。
蚂蚁 inclusionAI 在 GitHub 开源 PIBench,一个用于评估 AI 编程智能体在真实端到端支付集成任务中表现的基准。该基准聚焦支付集成这一实际开发场景,目前以开源形式发布。
蚂蚁 inclusionAI 在 GitHub 上线新仓库 Avernet,定位为分布式智能体协调平台,让智能体在其中共同生存、连接、协调、执行与演化。该平台目前以开源仓库形式发布,具体功能细节与可用性尚未在仓库描述中展开。
在首尔 ICML 见,以及周四晚上的 AMI × SBVA mixer!期待与大家见面 :) https://luma.com/rv0q6b5q
腾讯混元 AI Infra 团队的 HPC-Ops 算子库中的 Attention 和 MoE 内核已合入 vLLM 主分支,成为一等后端,针对 NVIDIA Hopper 架构优化,在 H20 上效果最好。
Hugging Face 为 Kernels 项目引入 Hub 上的 "kernel" 新仓库类型,并默认只加载受信任发布者的内核,非信任来源需显式传入 trust_remote_code=True。