Nous Research 发布 Hermes Agent 的 Sprites 终端后端插件
Nous Research 为 Hermes Agent 推出 Sprites 终端后端插件,基于 Fly.io 云沙箱提供有状态运行环境,支持 checkpoint 与 restore。该插件已在 GitHub 开源。
Nous Research 为 Hermes Agent 推出 Sprites 终端后端插件,基于 Fly.io 云沙箱提供有状态运行环境,支持 checkpoint 与 restore。该插件已在 GitHub 开源。
Sierra 宣布在首尔开设办公室,将其客户服务 AI 平台带入韩国市场。该平台已与全球三分之一领先银行及 40% 的 Fortune 50 企业合作,按结果而非使用量收费。其 Horizon 智能体可跨系统长期运行,Singtel 10 周上线后解决率超 70%,Next 6 周上线覆盖 48 种语言、83 个国家,BBVA 30 天内部署首个 Horizon 智能体。
Hugging Face 发布 gr.Workflow 实用指南,介绍 Gradio 内置的工作流功能:用户把步骤描述为带类型的节点图,Gradio 提供可拖拽画布,每个节点可单独运行、中间结果可见,同一张图自动成为 REST API 并可一键部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.Workflow 的节点图构建、REST API 调用和 Spaces 部署的完整示例,读者可直接 Duplicate 改造成自己的流程。
Meta 发布 MetaRoCE,一个为 AI 工作负载在商品化以太网上从零设计的 RDMA 传输协议,将通过 OCP 开放规范、参考软件实现和合规测试套件。
MIT 工程师提出名为 Extreme Event Aware(η-learning)的机器学习方法,无需依赖历史极端事件数据即可生成合理的极端天气与最坏情景,并给出其规模、强度和持续时间。
Meta 在工程博客发布自研训练芯片 MTIA 300,这是 MTIA 家族中首款针对推荐与排序模型训练优化的加速器。
Mistral 与 HUMAIN 宣布在 AI 基础设施、先进模型开发和 AI 解决方案部署上展开战略合作,聚焦网络安全与语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还将在沙特面向受监管行业制定联合市场策略。
生成式 AI 推动分布式模型训练扩展至数十万块 GPU,节点间的 scale-out 网络已成为首要性能瓶颈。NVIDIA 在技术博客中解析 Spectrum-X Ethernet 如何针对这一瓶颈改写传统以太网的规则。
NVIDIA 称 Vera Rubin 与 Blackwell 为智能体 AI 的每瓦性能树立新标准。OpenRouter 的 State of AI 报告基于 100 万亿 token 的真实使用数据发现,平均每请求提示词 token 数增长约四倍,反映 AI 智能体已从单轮交互扩展到多步工作流。
NVIDIA Groq 3 LPX 是 NVIDIA Vera Rubin 平台的交互式 AI 推理加速器,与 Vera Rubin NVL72 搭配可扩展该平台的长上下文交互能力。Vera Rubin NVL72 面向从小型到大型、开源与闭源的最广泛 AI 工作负载,兼顾高吞吐与交互性。
NVIDIA 发文阐述用 Vera CPU 应对智能体 AI 集群挑战:GPU 负责运行模型,CPU 承担编排、工具执行与沙箱计算。文章指出,与传统负载稳定的运行特征不同,智能体工作负载不可预测且波动极大,AI 工厂的集群经济性取决于整个技术栈将电力与资本转化为已完成智能体任务的效率。
NVIDIA 发布 DSX MaxLPS,用于提升 AI 工厂的每瓦性能。AI 工厂是受功耗约束的工业系统,对 AI 推理负载而言,应用层每瓦性能已成为衡量 AI 工厂效率的关键指标,因为配电、冷却等环节会消耗部分兆瓦电力,并非每兆瓦都能转化为产生收入的算力。
NVIDIA BlueField-4 为智能体 AI 工厂提供新型 Scale-In 网络基础设施,面向每服务器多太比特带宽的加速计算场景。传统云基础设施面向可预测的通用工作负载和标准接口,而智能体 AI 工厂需连接多样用户、智能体、应用、数据源与存储系统,因此专用 DPU 处理对线速网络、存储和安全至关重要。
LongCat-2.0 now available in Go 1.6T/48B · 1M context · fully open source
推荐理由:LongCat 官方宣布模型接入 opencode,读者可以了解该开源模型在编码工具中的可用入口。
vLLM 官方博客解析投机解码的 draft-and-verify 机制,对比 native MTP、Gemma 4 MTP、EAGLE-3、DFlash、DSpark 五种起草方法的差异。
感谢我们的全球合作伙伴,在北京 WRC 2026 共度了一个美妙的夜晚。精彩的对话、大胆的想法,以及对具身智能的共同愿景。下次见!#EmbodiedAI #WRC2026 #Galaxea
vLLM 推出基于 Ray Direct Transport(RDT)的原生分片权重传输引擎,在 48 个 8xH100 节点(32 训练、16 推理)上以 BF16 完成 Kimi K2 的权重传输仅需 7.53 秒。
Google 发布 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。
Midjourney 为 alpha.midjourney.com 上线两周的大改版推送了一批 UX 改进与 bug 修复,侧边栏新增可折叠的文件夹树分组,支持双击重命名分组并把新文件夹直接归入其中。
NVIDIA 提出 GPU 加速的矩阵分解算法 AdaptGrow,可将滚动相关性与尾部依赖矩阵转化为硬聚类、软因子载荷和结构突变信号,支持单 GPU 与多节点规模。该算法面向量化策略中的投资组合构建、风险聚合、统计套利与交易监控等场景,错误的工具分组会带来问题。
GLM-5.3 × ZCode Weekend Build, Round 2 🚀 New users: log in to ZCode for the first time from Aug 22, 00:00 to Aug 24, 09:00 (UTC+8) and automatically get 100M free GLM-5.3 tokens. 50,000 packs, first come, first served; ZCode only. Unused tokens expire when the event ends. Grab yours: http://zcode.z.ai
NVIDIA 的 AVO 在 ARC-AGI-3 上取得 100% 成绩,展示了一种面向长时程自主智能体的前沿级通用架构。该工作指出前沿语言模型只是 AI 智能体的一部分,真正决定模型如何接收上下文、使用工具、维持状态、响应反馈、从失败中恢复并在长任务中持续推进的,是外围的智能体系统(常称为 harness)。
NVIDIA 的 AI 安全团队结合与 NVIDIA OpenShell、智能体开发者、开源项目及生态伙伴的合作,阐述了对新兴 AI 智能体栈的看法,包括各层所扮演的角色。随着 AI 智能体能力增强、运行周期变长,在其驱动的应用中内建安全与信任变得愈发重要。
Google DeepMind 回顾了从 DQN 玩 Atari 到 AlphaStar 打 StarCraft II 的 15 年游戏 AI 研究历程,并宣布与游戏开发商合作打造新玩法原型。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名化移动性数据与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
An excellent history of scaling laws from @jietang. In 2020, we explored the limits of sparsity in Switch Transformers by routing each token to only 1 out of 2048 experts (in retrospect, a bold choice). The model had fewer than 3B activated parameters, but 1.6T total parameters (comparable to today's frontier models). The 1.6T model achieved better C4 perplexities than the T5 models using far less compute, set a new SOTA on TriviaQA, but was dumb as bricks on reasoning tasks like SuperGLUE. The lesson was that the optimal tokens-per-parameter ratio is highly task-dependent. Or as @NShazeer had already intuited: FLOPs were intelligence; parameters were knowledge!
好消息!LongCat-2.0 搭配 Hermes Agent 的免费使用已再延长两周 🐱 在 @NousResearch Portal 上有更多时间体验!
LongCat-2.0 is now live on the @NousResearch Portal and free to try with Hermes Agent for one week! 🐱
Hugging Face 发布研究,用三类测试量化 ASR 模型的基准优化(benchmaxxing)现象,评估了 11 个开源模型。
推荐理由:研究用三类探针量化语音识别模型的基准优化行为,并给出模型选型与基准设计的具体建议。
Together AI 在 DeepSWE 的 113 个任务上各跑 4 次试验对比 GLM-5.3 与 Claude Fable 5,pass@1 分别为 69.0% 和 69.7%,属统计平手,但 GLM-5.3 每次 rollout 成本 $3.99,比 Fable 的 $21.63 低 5.4 倍。
推荐理由:原文基于同一批次 904 次 rollout 给出成本与 pass@k 对比,可帮助读者在两个相近模型间做默认与升级的路由选择。
SkyRL 提出 IsoExec,通过跨框架统一执行抽象消除 RL 训练与推理引擎之间的数值不匹配,包含执行契约与对齐的批不变内核两部分,已在 SkyRL 中结合 vLLM 和 Megatron 实现。
Hugging Face 详解 Papers with Code 论文搜索引擎的架构:用 PostgreSQL 全文检索加 pgvector 语义召回,经加权 RRF 融合为混合搜索,已为超过 11 万篇 arXiv 论文维护嵌入向量。
推荐理由:作者亲述 Papers with Code 混合搜索的架构与生产经验,读者可以借鉴其离线批量与在线查询分离的设计方法。
Together AI 在全部 113 个 DeepSWE 任务上对 GLM-5.3 (max) 与 GPT-5.6 Sol (max) 各跑 4 次试验,共 904 次 rollout。
推荐理由:原文基于904次实测给出两模型在成本、速度和任务类型上的具体差异,并提供了可直接套用的级联路由方案。
MIT 研究人员开发出一种预测电化学合成氨催化剂的方法,通过密度泛函理论先评估材料的微观性质,而非逐一试错数百万种合金组合,从而大幅加快筛选进程。相关开放获取成果于 8 月 11 日发表在 Royal Society of Chemistry 期刊 EES Catalysis 上。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,采用推测解码,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍,输出质量不变。
推荐理由:原文给出各模型在 GPU 和端侧的实测加速数据与 llama.cpp、SGLang 接入命令,读者可直接评估是否用于部署。
Sierra 将发布治理直接内置到平台,用 Agent Checks、Simulations、合并审批工作流和分流发布,把变更从 Workspace 安全推进到线上客户对话。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据比首个公开版本多 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol,精度超过当前领先的全局(范围分离)杂化泛函而保持半局域泛函的计算成本。