跳到正文

全部动态

今日 45 条
8月25日周二
  1. Sierra:Blog(RSS)31

    Sierra 在韩国首尔设立办公室,推出面向大型企业的 AI 智能体

    Sierra 宣布在首尔开设办公室,将其客户服务 AI 平台带入韩国市场。该平台已与全球三分之一领先银行及 40% 的 Fortune 50 企业合作,按结果而非使用量收费。其 Horizon 智能体可跨系统长期运行,Singtel 10 周上线后解决率超 70%,Next 6 周上线覆盖 48 种语言、83 个国家,BBVA 30 天内部署首个 Horizon 智能体。

  2. Hugging Face:Blog(RSS)70

    Gradio gr.Workflow 指南:用节点图搭建并部署 AI 工作流

    Hugging Face 发布 gr.Workflow 实用指南,介绍 Gradio 内置的工作流功能:用户把步骤描述为带类型的节点图,Gradio 提供可拖拽画布,每个节点可单独运行、中间结果可见,同一张图自动成为 REST API 并可一键部署到 Hugging Face Spaces。

    推荐理由:原文给出 gr.Workflow 的节点图构建、REST API 调用和 Spaces 部署的完整示例,读者可直接 Duplicate 改造成自己的流程。

  3. Mistral AI:News(网页)32

    Mistral 与 HUMAIN 达成战略合作,推进沙特及中东主权 AI

    Mistral 与 HUMAIN 宣布在 AI 基础设施、先进模型开发和 AI 解决方案部署上展开战略合作,聚焦网络安全与语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还将在沙特面向受监管行业制定联合市场策略。

8月24日周一
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)21

    NVIDIA Vera CPU 如何解决智能体 AI 集群难题

    NVIDIA 发文阐述用 Vera CPU 应对智能体 AI 集群挑战:GPU 负责运行模型,CPU 承担编排、工具执行与沙箱计算。文章指出,与传统负载稳定的运行特征不同,智能体工作负载不可预测且波动极大,AI 工厂的集群经济性取决于整个技术栈将电力与资本转化为已完成智能体任务的效率。

  2. NVIDIA Technical Blog(开发者技术博客 · RSS)24

    NVIDIA DSX MaxLPS 如何最大化 AI 工厂每瓦性能

    NVIDIA 发布 DSX MaxLPS,用于提升 AI 工厂的每瓦性能。AI 工厂是受功耗约束的工业系统,对 AI 推理负载而言,应用层每瓦性能已成为衡量 AI 工厂效率的关键指标,因为配电、冷却等环节会消耗部分兆瓦电力,并非每兆瓦都能转化为产生收入的算力。

  3. NVIDIA Technical Blog(开发者技术博客 · RSS)35

    NVIDIA BlueField-4 为智能体 AI 工厂提供新型 Scale-In 网络基础设施

    NVIDIA BlueField-4 为智能体 AI 工厂提供新型 Scale-In 网络基础设施,面向每服务器多太比特带宽的加速计算场景。传统云基础设施面向可预测的通用工作负载和标准接口,而智能体 AI 工厂需连接多样用户、智能体、应用、数据源与存储系统,因此专用 DPU 处理对线速网络、存储和安全至关重要。

  4. Meituan LongCat65

    美团 LongCat 官方宣布 LongCat-2.0 已上线 opencode 的 Go,邀请用户试用并反馈用其构建了什么。引用内容显示 LongCat-2.0 为 1.6T/48B 参数、支持 1M 上下文、完全开源。

    引用OpenCode@opencode

    LongCat-2.0 now available in Go 1.6T/48B · 1M context · fully open source

    推荐理由:LongCat 官方宣布模型接入 opencode,读者可以了解该开源模型在编码工具中的可用入口。

8月23日周日
8月22日周六
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)26

    NVIDIA 用 GPU 加速的 AdaptGrow 实现大规模金融工具聚类

    NVIDIA 提出 GPU 加速的矩阵分解算法 AdaptGrow,可将滚动相关性与尾部依赖矩阵转化为硬聚类、软因子载荷和结构突变信号,支持单 GPU 与多节点规模。该算法面向量化策略中的投资组合构建、风险聚合、统计套利与交易监控等场景,错误的工具分组会带来问题。

  2. Z.ai35

    社区已经用 ZCode + GLM-5.3 构建了这么多有趣的项目。 为感谢大家的支持,我们将 Build Week 变成一个持续进行的系列。 从现在起到 8 月 23 日下午 6 点(太平洋时间),我们将为 50,000 名新的 ZCode 用户每人赠送 1 亿免费 GLM-5.3 token。

    引用ZCode@zcode_ai

    GLM-5.3 × ZCode Weekend Build, Round 2 🚀 New users: log in to ZCode for the first time from Aug 22, 00:00 to Aug 24, 09:00 (UTC+8) and automatically get 100M free GLM-5.3 tokens. 50,000 packs, first come, first served; ZCode only. Unused tokens expire when the event ends. Grab yours: http://zcode.z.ai

8月21日周五
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)33

    NVIDIA AVO 在 ARC-AGI-3 上达到 100%,展示面向长时程自主智能体的前沿级通用架构

    NVIDIA 的 AVO 在 ARC-AGI-3 上取得 100% 成绩,展示了一种面向长时程自主智能体的前沿级通用架构。该工作指出前沿语言模型只是 AI 智能体的一部分,真正决定模型如何接收上下文、使用工具、维持状态、响应反馈、从失败中恢复并在长任务中持续推进的,是外围的智能体系统(常称为 harness)。

  2. NVIDIA Technical Blog(开发者技术博客 · RSS)40

    NVIDIA 谈安全在 AI 智能体栈中的位置

    NVIDIA 的 AI 安全团队结合与 NVIDIA OpenShell、智能体开发者、开源项目及生态伙伴的合作,阐述了对新兴 AI 智能体栈的看法,包括各层所扮演的角色。随着 AI 智能体能力增强、运行周期变长,在其驱动的应用中内建安全与信任变得愈发重要。

  3. jietang46

    精彩评论:FLOPs 是智能;参数是知识!

    引用Liam Fedus@LiamFedus

    An excellent history of scaling laws from @jietang. In 2020, we explored the limits of sparsity in Switch Transformers by routing each token to only 1 out of 2048 experts (in retrospect, a bold choice). The model had fewer than 3B activated parameters, but 1.6T total parameters (comparable to today's frontier models). The 1.6T model achieved better C4 perplexities than the T5 models using far less compute, set a new SOTA on TriviaQA, but was dumb as bricks on reasoning tasks like SuperGLUE. The lesson was that the optimal tokens-per-parameter ratio is highly task-dependent. Or as @NShazeer had already intuited: FLOPs were intelligence; parameters were knowledge!

  4. Together AI 研究与产品博客(RSS)69

    Together AI 实测 GLM-5.3 与 Claude Fable 5 在 DeepSWE 上的成本、编码与路由表现

    Together AI 在 DeepSWE 的 113 个任务上各跑 4 次试验对比 GLM-5.3 与 Claude Fable 5,pass@1 分别为 69.0% 和 69.7%,属统计平手,但 GLM-5.3 每次 rollout 成本 $3.99,比 Fable 的 $21.63 低 5.4 倍。

    推荐理由:原文基于同一批次 904 次 rollout 给出成本与 pass@k 对比,可帮助读者在两个相近模型间做默认与升级的路由选择。

  5. Hugging Face:Blog(RSS)62

    Hugging Face 解析 Papers with Code 混合搜索背后的架构实践

    Hugging Face 详解 Papers with Code 论文搜索引擎的架构:用 PostgreSQL 全文检索加 pgvector 语义召回,经加权 RRF 融合为混合搜索,已为超过 11 万篇 arXiv 论文维护嵌入向量。

    推荐理由:作者亲述 Papers with Code 混合搜索的架构与生产经验,读者可以借鉴其离线批量与在线查询分离的设计方法。

  6. Hugging Face:Blog(RSS)66

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,采用推测解码,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍,输出质量不变。

    推荐理由:原文给出各模型在 GPU 和端侧的实测加速数据与 llama.cpp、SGLang 接入命令,读者可直接评估是否用于部署。

  7. Microsoft Research 博客(RSS)41

    微软 Skala 1.1 发布:训练数据增 2.5 倍,已接入 CP2K 并推进 Psi4、FHI-aims、ORCA、VASP 集成

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据比首个公开版本多 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol,精度超过当前领先的全局(范围分离)杂化泛函而保持半局域泛函的计算成本。