好消息!LongCat-2.0 搭配 Hermes Agent 的免费使用已再延长两周 🐱 在 @NousResearch Portal 上有更多时间体验!
LongCat-2.0 is now live on the @NousResearch Portal and free to try with Hermes Agent for one week! 🐱
好消息!LongCat-2.0 搭配 Hermes Agent 的免费使用已再延长两周 🐱 在 @NousResearch Portal 上有更多时间体验!
LongCat-2.0 is now live on the @NousResearch Portal and free to try with Hermes Agent for one week! 🐱
Sierra 将发布治理直接内置到平台,用 Agent Checks、Simulations、合并审批工作流和分流发布,把变更从 Workspace 安全推进到线上客户对话。
Mistral 发布 Agentic Search,一种多步检索层,让模型在复杂文档中查找、翻阅并核实信息,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环的工具设计与两组基准数据,可对照一次性 RAG 判断适用边界。
VeRL-Omni v0.2.0 发布,通过 vLLM-Omni 的请求级批处理让 Qwen-Image FlowGRPO rollout 的 GPU 利用率从约 80% 升至约 100%,单次生成时间从 226s 降至 108s,减少 52%。
vLLM-Omni 团队发布 Distributed Layerwise Offload,让超过单卡 HBM 的视频生成模型(如 Cosmos3-Super 64B / 124 GB)可在多块 NPU 或 GPU 上运行。
Together AI 在平台上推出端点级 LLM A/B 测试功能,让团队用真实用户流量比较候选模型与现网模型,而非只看 benchmark 或影子流量。实验挂在端点上,须有一个 control 和一至多个 variant,variant 部署权重须为 0,百分比为固定流量份额且与副本数无关。
vLLM 在 PR #47808 中引入 DSpark 置信度调度验证(enable_adaptive_verification),让引擎逐步决定验证多少 draft token,而非按部署固定 num_speculative_tokens。
Nous Research 在 GitHub 发布 Hermes-Bot-Mode,为 Hermes 桌面端带来 Bot Mode,提供一组具名智能体,各自拥有独立聊天、头像、例程,并支持智能体间互发消息。该功能以桌面插件形式实现,无需修改核心代码。
推荐理由:原文给出 Harness 的插件化架构设计和 MIT 开源仓库入口,开发者可据此评估是否接入自己的 Agent 开发流程。
AllenAI 的 OlmoEarth Studio 现已支持计算并导出 OlmoEarth 开源基础模型的 embedding 向量,源代码、模型权重和研究论文公开可查。
Sierra 称其 Horizon 智能体可为每位潜在客户配备一名 AI 智能体,持续数天、数周甚至数月主动跟进,直到客户购买或放弃。文中以车险为例,AI 智能体 Jamie 在客户保存报价后当晚即发短信,第 4 天解答保险条款问题,第 7 天完成通话并促成保单购买。Sierra 表示该智能体遵循企业合规要求,沟通内容由企业控制。
WhatsApp 推出可选的 Scam Alert 功能,在设备端运行机器学习模型,对非联系人消息进行诈骗概率分类,消息内容不出设备、不自动上报。模型下载经 Cloudflare Ed25519 签名与第三方 append-only 透明账本校验,遥测数据经 TEE、OHTTP 与差分隐私聚合处理;该功能已在 Beta 有限推出,并扩展了 Bug Bounty 计划。
Sierra 宣布其平台上的 Agent 可开箱即用地导航复杂的 IVR 电话系统,官方评测中整体通过率从 57% 提升至 85%,增幅约 49%。该能力覆盖通话时机、多级菜单、DTMF 按键音、静默处理和识别真人,配合记忆与智能重试逐步提升成功率;已有医疗支付方、数字药房和收入周期管理公司在使用,文章还展望了 Agent 可信身份认证的长期方向。
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的可用性承诺。
推荐理由:Mistral 把区域推理端点、SLA 优先级层与第三方开源模型接入放在同一套基础设施上,读者可据此判断主权 AI 的落地方式。
Moonshot AI's latest open-weight model, Kimi K3, is now available on Databricks through Unity AI Gateway. @Kimi_Moonshot Run Kimi K3 where your data already lives - governed, secure, and ready for custom AI apps and agents built with the data in your Lakehouse. Unity AI Gateway lets you deploy Kimi K3 with enterprise-grade access controls. Govern every call, monitor performance, and scale securely across your AI apps. Test Kimi K3 alongside other frontier models without changing your application code. The open-weight frontier just arrived on Databricks. Try it today. https://www.databricks.com/blog/kimi-k3-moonshot-ai-now-available-databricks-through-unity-ai-gateway
Sierra 发布 Voice Personas,让企业为同一个 AI 智能体配置不同语音人格,覆盖多语言、多品牌与多市场场景。该功能结合语音、个性与语言感知行为,并接入 Sierra Agent SDK,支持调整语速、应对打断及对话中切换语音或语言。Sierra 称某智能体搭配自然语音与人格后问题解决率提升近 50%,Voice Personas 现已上线。
vLLM 社区完成 Qwen3.5 混合注意力架构的分离式服务优化,在 GB200 NVL72 系统上实现超过 25K 总 TPS/GPU。
Baseten 正式加入 Hugging Face Hub 的 Inference Provider 生态,首批支持对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重模型。
Sierra 发布 Context Engine,将客户关系及其产生的上下文转化为企业竞争优势,并驱动 Horizon 智能体持续数天、数周乃至数月追逐业务结果。
major price cuts today: *80% drop for GPT-5.6 Luna, now $0.20 per million input tokens and $1.20 per million output *20% drop for GPT-5.6 Terra, to $2/$12 *GPT-5.6 Sol gets Fast mode in the API, up to 2.5x the speed for 2x the price, same intelligence
推荐理由:OpenAI 首席研究官转述官方降价信息,读者可以据此更新 GPT-5.6 系列的 API 用量成本。
Modem 的 MCP 服务器和公共 API 向所有用户开放,MCP 客户端可连接 https://mcp.modem.dev/mcp,公共 API 位于 api.modem.dev/v1。
Sierra 发布 Agency,一个基于 Kubernetes 的智能体沙箱编排层,为 Pinecone 和 Ghostwriter 的每个会话与任务提供安全运行环境。Agency 分无状态控制平面与有状态 runner 两层,通过 IAM 鉴权、DynamoDB 记录状态,每个 runner 配备 8+ 核、24GiB 内存和持久化存储。默认不向智能体暴露任何 API key 或密钥。
Google DeepMind 发布最新音乐生成模型 Lyria 3.5,即日起在 Google Flow Music 中上线。模型改进包括更自然丰富的旋律结构、更高歌词质量与提示词遵循度、更真实且情感细腻的人声与发音,并新增对输出节奏 tempo 和时长的控制。
vLLM 与 Speculators 为 P-EAGLE、DFlash、DSpark 三种并行草稿(parallel drafting)算法提供完整开源支持,相关模型已发布在 RedHatAI HuggingFace Hub 的 Speculators Collection 中。
微软发布智能体安全系统 Project Perception,通过红队、蓝队、绿队三类专用智能体组成闭环防御,用 AI 对抗 AI,并将于 8 月 3 日进入公开预览。
vLLM 宣布对月之暗面 Kimi K3 提供 Day-0 高效支持。Kimi K3 是 2.8 万亿参数的 MoE 多模态模型,每 token 激活 896 个专家中的 16 个,基于 Kimi Delta Attention 与 Attention Residuals,支持 1M token 上下文窗口。
推荐理由:vLLM 官方详述 Kimi K3 的服务适配与内核优化,读者可以据此了解 2.8T 混合 MoE 的生产部署配方和性能数据。
Hugging Face 宣布 Diffusers 原生支持 Nunchaku Lite,可像普通模型一样用 from_pretrained() 加载 SVDQuant 4-bit (W4A4) 检查点,无需单独推理引擎或本地 CUDA 编译,内核经 kernels 包从 Hub 下载。
推荐理由:Diffusers 原生支持 Nunchaku 4-bit 推理,附带基准数据和自己量化模型的完整流程,适合关注消费级显卡跑扩散模型的读者。
Together AI 推出 Dedicated Model Inference 平台,为在生产中运行开放权重、授权闭源权重和微调模型提供统一服务。
vLLM 推出实验性外部插件 vLLM AFD Plugin,将 MoE 模型中的 Attention 与 FFN 拆分为可独立部署和扩缩的服务,同时保留 vLLM 原有请求生命周期与 OpenAI 兼容接口。
vLLM 发布 Kimi K3 生产级支持的预览博客,正与 Moonshot AI、NVIDIA、AMD 等推进最终集成,计划在 2026 年 7 月 27 日权重发布时提供 day-0 开源服务,包括模型实现、Docker 镜像和部署方案。
推荐理由:vLLM 团队详解 KDA 混合架构带来的前缀缓存改造与内核优化,对部署混合注意力模型的工程团队有可迁移参考价值。
Pollen Robotics 发布开源低成本系统 Grabette,用手持夹持器录制约 490€ 的演示数据,无需机器人或遥操作设备,即可自动转成 LeRobot 格式的机器人可用数据集。
vLLM Semantic Router 提出 Mixture-of-Models(MoM)架构,目标是在同一版本化契约下把独立模型、策略、偏好与执行路径组合成可训练、评估、导出、部署和调用的模型系统。
Sierra 发布 Horizon 平台,让智能体能够追求贷款发起、医疗预授权等长周期目标,跨数天、数周甚至数月主动与客户互动。Horizon 在 Agent OS 之上加入长周期规划与上下文引擎,智能体可从每次互动中学习优化决策,且按业务成果而非 token 计费。
Sierra 发布内部云智能体 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、组织和自动化云端 Agent 会话,底层由 app server、Agency 与 runner 三部分组成,沙箱内运行 Codex 或 Claude Code 并以 AG-UI 协议适配。
推荐理由:Sierra 自述内部云智能体的架构与落地数据,读者可以了解如何把员工经验沉淀为可复用的会话与技能。
vLLM 宣布 Day-0 支持 Thinking Machines Lab 的 1T 参数多模态模型 TML Inkling,提供 thinkingmachines/Inkling-NVFP4 和 BF16 两个版本。
推荐理由:官方详解了 Day-0 支持背后的 sconv 缓存、TP 分片和 MTP 处理等优化,读者可迁移到类似新架构的推理部署。
Together 为 GPU Clusters 推出被动健康检查、自动节点修复和基于 Slinky 1.0 重建的 Slurm-on-K8s 2.0 栈。被动检查持续监控 GPU 掉总线、热降频、Xid 错误等故障,自动节点修复提供 Reboot、Reprovision、Failover、Remove 四种操作,由人工确认后执行。
Modem 面向所有用户开放 Stripe 集成 beta,可在 Settings → Integrations → Stripe 通过官方 Stripe App 的 OAuth 只读接入,无需 API key。
vLLM 通过 V1 的公开 connector 接口接入 TileRT 作为专用 decode 引擎,随 TileRT 0.1.5 发布,prefill、调度、前缀缓存与 API 均保持原生 vLLM 不变。
Google DeepMind 在印度启动 ATL Saathi 试点,这是一款由 Gemini 驱动的 Web 应用,为 Tinkering Lab 教育者提供 24/7 备课与培训助手。该工具基于 NotebookLM 组织 12 个核心模块内容,支持 10 个模块的项目生成,并首发支持 8 种语言。底层由 Gemini 3.5 Flash 提供智能支持,首批覆盖全国 100 所试点学校。