#产品更新
#产品更新
今日 75 条
Galaxea Dynamics@GalaxeaDynamicsAI 评分2323
Google AI Developers@googleaidevsAI 评分3131
Google AI Developers@googleaidevsAI 评分2626
Google AI Developers@googleaidevsAI 评分3131
vLLM 官方博客(RSS)AI 评分5050 vLLM-Omni 推出分布式逐层卸载,可在多卡上高效运行 200B+ 级 DiT 模型
vLLM-Omni 团队发布 Distributed Layerwise Offload,让超过单卡 HBM 的视频生成模型(如 Cosmos3-Super 64B / 124 GB)可在多块 NPU 或 GPU 上运行。
Together AI 研究与产品博客(RSS)AI 评分5151 Together AI 推出端点级 LLM A/B 测试功能
Together AI 在平台上推出端点级 LLM A/B 测试功能,让团队用真实用户流量比较候选模型与现网模型,而非只看 benchmark 或影子流量。实验挂在端点上,须有一个 control 和一至多个 variant,variant 部署权重须为 0,百分比为固定流量份额且与副本数无关。
vLLM 官方博客(RSS)AI 评分4343 vLLM 推出 DSpark 自适应验证:按置信度调度投机解码预算
vLLM 在 PR #47808 中引入 DSpark 置信度调度验证(enable_adaptive_verification),让引擎逐步决定验证多少 draft token,而非按部署固定 num_speculative_tokens。
Noah Zweben@noahzwebenAI 评分4848Google Cloud:Databases(RSS)AI 评分4444 Google Cloud 用 BigQuery Graph 的 measures 支撑可信智能体工作负载
Google Cloud 为 BigQuery Graph 引入 measures(预览版),把受治理的指标与关系映射统一起来,让 AI 智能体在图上跨多跳依赖进行推理。
Nous Research:GitHub 新仓库AI 评分3737 Nous Research 发布 Hermes-Bot-Mode:Hermes 桌面端 Bot Mode
Nous Research 在 GitHub 发布 Hermes-Bot-Mode,为 Hermes 桌面端带来 Bot Mode,提供一组具名智能体,各自拥有独立聊天、头像、例程,并支持智能体间互发消息。该功能以桌面插件形式实现,无需修改核心代码。
DeepSeek@deepseek_ai精选AI 评分7373推荐理由:原文给出 Harness 的插件化架构设计和 MIT 开源仓库入口,开发者可据此评估是否接入自己的 Agent 开发流程。
DeepSeek:GitHub 新仓库AI 评分4545 DeepSeek 发布 deepseek-harness:一切皆插件
DeepSeek 在 GitHub 新建 deepseek-harness 仓库,核心理念是"一切皆插件"。该仓库以插件化架构组织功能,具体能力与可用性尚未在现有信息中披露。
Hugging Face:Blog(RSS)AI 评分5353 OlmoEarth Studio 推出自定义 embedding 导出用于下游分析
AllenAI 的 OlmoEarth Studio 现已支持计算并导出 OlmoEarth 开源基础模型的 embedding 向量,源代码、模型权重和研究论文公开可查。
Sierra:Blog(RSS)AI 评分2929 Sierra 谈 Horizon 智能体:跟进就是成交
Sierra 称其 Horizon 智能体可为每位潜在客户配备一名 AI 智能体,持续数天、数周甚至数月主动跟进,直到客户购买或放弃。文中以车险为例,AI 智能体 Jamie 在客户保存报价后当晚即发短信,第 4 天解答保险条款问题,第 7 天完成通话并促成保单购买。Sierra 表示该智能体遵循企业合规要求,沟通内容由企业控制。
Meta Engineering Blog(RSS)AI 评分5656 WhatsApp 推出端侧 Scam Alert 功能,在端到端加密下实现可验证的诈骗提醒
WhatsApp 推出可选的 Scam Alert 功能,在设备端运行机器学习模型,对非联系人消息进行诈骗概率分类,消息内容不出设备、不自动上报。模型下载经 Cloudflare Ed25519 签名与第三方 append-only 透明账本校验,遥测数据经 TEE、OHTTP 与差分隐私聚合处理;该功能已在 Beta 有限推出,并扩展了 Bug Bounty 计划。
Michael Truell@mntruellAI 评分4848Grok Bot 现已上线!迈向能干又讨喜的数字同事的早期一步。
引用Grok Bot@botIntroducing Grok Bot, now in early beta. Bots are AI teammates that do real work for you. They sign in to your tools, use them just like you do, and come back with finished work.
Google Cloud:Databases(RSS)AI 评分3737 Google Cloud 在 Database Migration Service 中用 Gemini 加速 PostgreSQL 迁移
Google Cloud 的 Database Migration Service(DMS)现已内置由 Gemini 驱动的 AI 代码转换功能,可将 Oracle PL/SQL、SQL Server T-SQL 的存储过程、触发器和自定义函数转换为 PostgreSQL PL/pgSQL。
Sierra:Blog(RSS)AI 评分5050 Sierra 为 Agent 推出开箱即用的 IVR 电话导航能力
Sierra 宣布其平台上的 Agent 可开箱即用地导航复杂的 IVR 电话系统,官方评测中整体通过率从 57% 提升至 85%,增幅约 49%。该能力覆盖通话时机、多级菜单、DTMF 按键音、静默处理和识别真人,配合记忆与智能重试逐步提升成功率;已有医疗支付方、数字药房和收入周期管理公司在使用,文章还展望了 Agent 可信身份认证的长期方向。
Mistral AI:News(网页)精选AI 评分6060 Mistral 推出区域推理端点与优先级层,并接入第三方开源模型 GLM-5.2
Mistral 宣布三项推进 AI 主权的举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,为关键业务负载提供自定义速率限制和带 SLA 的可用性承诺。
推荐理由:Mistral 把区域推理端点、SLA 优先级层与第三方开源模型接入放在同一套基础设施上,读者可据此判断主权 AI 的落地方式。
Kimi.ai@Kimi_MoonshotAI 评分3737引用Databricks@databricksMoonshot AI's latest open-weight model, Kimi K3, is now available on Databricks through Unity AI Gateway. @Kimi_Moonshot Run Kimi K3 where your data already lives - governed, secure, and ready for custom AI apps and agents built with the data in your Lakehouse. Unity AI Gateway lets you deploy Kimi K3 with enterprise-grade access controls. Govern every call, monitor performance, and scale securely across your AI apps. Test Kimi K3 alongside other frontier models without changing your application code. The open-weight frontier just arrived on Databricks. Try it today. https://www.databricks.com/blog/kimi-k3-moonshot-ai-now-available-databricks-through-unity-ai-gateway
Sierra:Blog(RSS)AI 评分4444 Sierra 推出 Voice Personas:为 AI 智能体打造品牌专属语音人格
Sierra 发布 Voice Personas,让企业为同一个 AI 智能体配置不同语音人格,覆盖多语言、多品牌与多市场场景。该功能结合语音、个性与语言感知行为,并接入 Sierra Agent SDK,支持调整语速、应对打断及对话中切换语音或语言。Sierra 称某智能体搭配自然语音与人格后问题解决率提升近 50%,Voice Personas 现已上线。
vLLM 官方博客(RSS)AI 评分4242 vLLM 在 Qwen3.5 上实现 25K 总 TPS/GPU
vLLM 社区完成 Qwen3.5 混合注意力架构的分离式服务优化,在 GB200 NVL72 系统上实现超过 25K 总 TPS/GPU。
Hugging Face:Blog(RSS)AI 评分4343 Baseten 成为 Hugging Face Hub 支持的 Inference Provider
Baseten 正式加入 Hugging Face Hub 的 Inference Provider 生态,首批支持对话与文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重模型。
Sierra:Blog(RSS)AI 评分4141 Sierra 推出 Context Engine,把客户关系变成竞争优势
Sierra 发布 Context Engine,将客户关系及其产生的上下文转化为企业竞争优势,并驱动 Horizon 智能体持续数天、数周乃至数月追逐业务结果。
Google Cloud:Databases(RSS)AI 评分5151 Google Cloud 推出 Database Onboarding Agent 与 Database Observability Agent 两款 AI 数据库智能体
Google Cloud 在 Next '26 的 Agentic Data Cloud 发布中推出两款 AI 数据库智能体。
Google Cloud:Databases(RSS)AI 评分3333 Google Cloud DMS 如何自动完成 SQL Server 到 PostgreSQL 的多结果集转换
Google Cloud 的 Database Migration Service(DMS)可自动将 SQL Server 多结果集存储过程转换为 PostgreSQL 的 SETOF refcursor 结构。
Google Cloud:Databases(RSS)AI 评分3030 Target 如何用 Spanner Graph 提升零售发现体验并将数据库维护成本降低 50%
Target 基于 Spanner Graph 构建企业本体,将图关系、向量嵌入、全文检索与事务数据统一到同一数据库引擎,替代原有 Elasticsearch 加 NoSQL 的碎片化架构。迁移采用零停机四阶段方案,完成后下线旧 Elasticsearch 集群,数据库维护成本降低 50%。该平台为 Gift Finder 等对话式购物助手提供结构化上下文,支撑 GraphRAG 式商品发现。
Google Cloud:Databases(RSS)AI 评分4141 Google 将 Data Commons 迁至 Spanner Graph,并预览 Data Commons Platform
Google 宣布 Data Commons on Spanner Graph 正式可用,并预览新的 Data Commons Platform,用于把企业私有知识与公共数据集知识图谱打通。
Nathan Lambert:Interconnects(RSS)AI 评分5050 Interconnects 推出 Artifacts Hub 与 Adoption Dashboard 两个开源模型数据工具
Nathan Lambert 的 Interconnects 推出 Artifacts Hub 和 Adoption Dashboard 两个免费工具。
Mark Chen@markchen90精选AI 评分8181引用Sam Altman@samamajor price cuts today: *80% drop for GPT-5.6 Luna, now $0.20 per million input tokens and $1.20 per million output *20% drop for GPT-5.6 Terra, to $2/$12 *GPT-5.6 Sol gets Fast mode in the API, up to 2.5x the speed for 2x the price, same intelligence
推荐理由:OpenAI 首席研究官转述官方降价信息,读者可以据此更新 GPT-5.6 系列的 API 用量成本。
Google Cloud:Databases(RSS)AI 评分3838 AlloyDB 新增 IAM 群组认证,为 AI 智能体提供安全访问
Google Cloud 为 AlloyDB 推出 IAM 群组认证预览版,将身份驱动的访问控制引入企业级工作负载,并与 Cloud SQL 统一安全策略。该功能支持定义最多 200 个 Google Groups,让 AI 智能体传递终端用户身份,使数据库按用户权限授权并记录精确审计日志。Bilt 已采用该方案消除共享凭证风险。
Modem:Blog(RSS)AI 评分5656 Modem 开放 MCP 服务器与公共 API,让编码 Agent 直接检索去重后的用户反馈
Modem 的 MCP 服务器和公共 API 向所有用户开放,MCP 客户端可连接 https://mcp.modem.dev/mcp,公共 API 位于 api.modem.dev/v1。
browser-use:GitHub 新仓库AI 评分2222 browser-use 推出官方 xAI 插件市场 plugin-marketplace
browser-use 上线官方插件市场 plugin-marketplace,首个上架的是 xAI 官方插件。该仓库定位为浏览器智能体的插件分发入口,目前仅披露 xAI 这一官方插件来源,具体插件数量与功能未公布。
Sierra:Blog(RSS)AI 评分4848 Sierra 推出 Agency:为 AI 智能体打造安全可扩展的沙箱基础设施
Sierra 发布 Agency,一个基于 Kubernetes 的智能体沙箱编排层,为 Pinecone 和 Ghostwriter 的每个会话与任务提供安全运行环境。Agency 分无状态控制平面与有状态 runner 两层,通过 IAM 鉴权、DynamoDB 记录状态,每个 runner 配备 8+ 核、24GiB 内存和持久化存储。默认不向智能体暴露任何 API key 或密钥。
Google DeepMind:Blog(RSS)AI 评分5050 Google DeepMind 在 Flow Music 中推出 Lyria 3.5 音乐生成模型
Google DeepMind 发布最新音乐生成模型 Lyria 3.5,即日起在 Google Flow Music 中上线。模型改进包括更自然丰富的旋律结构、更高歌词质量与提示词遵循度、更真实且情感细腻的人声与发音,并新增对输出节奏 tempo 和时长的控制。
vLLM 官方博客(RSS)AI 评分4343 vLLM 与 Speculators 开源支持 P-EAGLE、DFlash、DSpark 三种并行草稿算法
vLLM 与 Speculators 为 P-EAGLE、DFlash、DSpark 三种并行草稿(parallel drafting)算法提供完整开源支持,相关模型已发布在 RedHatAI HuggingFace Hub 的 Speculators Collection 中。
Microsoft:Official Blog(RSS)AI 评分5050 微软推出 Project Perception:面向 AI 时代的智能体安全系统
微软发布智能体安全系统 Project Perception,通过红队、蓝队、绿队三类专用智能体组成闭环防御,用 AI 对抗 AI,并将于 8 月 3 日进入公开预览。
vLLM 官方博客(RSS)精选AI 评分7272 vLLM 发布 Kimi K3 Day-0 支持,2.8T MoE 模型最高 370 tok/s
vLLM 宣布对月之暗面 Kimi K3 提供 Day-0 高效支持。Kimi K3 是 2.8 万亿参数的 MoE 多模态模型,每 token 激活 896 个专家中的 16 个,基于 Kimi Delta Attention 与 Attention Residuals,支持 1M token 上下文窗口。
推荐理由:vLLM 官方详述 Kimi K3 的服务适配与内核优化,读者可以据此了解 2.8T 混合 MoE 的生产部署配方和性能数据。
Hugging Face:Blog(RSS)精选AI 评分6969 Diffusers 原生集成 Nunchaku Lite 4-bit 扩散模型推理
Hugging Face 宣布 Diffusers 原生支持 Nunchaku Lite,可像普通模型一样用 from_pretrained() 加载 SVDQuant 4-bit (W4A4) 检查点,无需单独推理引擎或本地 CUDA 编译,内核经 kernels 包从 Hub 下载。
推荐理由:Diffusers 原生支持 Nunchaku 4-bit 推理,附带基准数据和自己量化模型的完整流程,适合关注消费级显卡跑扩散模型的读者。
Together AI 研究与产品博客(RSS)AI 评分5555 Together AI 发布 Dedicated Model Inference 开放权重模型推理生产平台
Together AI 推出 Dedicated Model Inference 平台,为在生产中运行开放权重、授权闭源权重和微调模型提供统一服务。