Higgs Audio v3 TTS 在 SGLang-Omni 上实现端到端实时语音服务
SGLang-Omni 团队宣布为 Boson AI 的 Higgs Audio v3 TTS 提供端到端推理服务。该模型约 4B 参数,基于 Qwen3-4B 骨干,支持流式合成和 100 种语言的个位数 WER/CER,开发者可通过文本流内嵌控制标签调节情绪、风格、韵律和音效。
SGLang-Omni 团队宣布为 Boson AI 的 Higgs Audio v3 TTS 提供端到端推理服务。该模型约 4B 参数,基于 Qwen3-4B 骨干,支持流式合成和 100 种语言的个位数 WER/CER,开发者可通过文本流内嵌控制标签调节情绪、风格、韵律和音效。
MOSS-TTS-Local-Transformer-v1.5 已在 SGLang-Omni 上实现端到端服务,与 MOSI 和 OpenMOSS 团队合作完成。
DeepSeek-V4 Flash 的 RL 训练现已在 AMD Instinct MI355X GPU 上通过 Miles 与 ROCm 支持,完成四节点端到端验证。
SGLang 团队与 Thinking Machines Lab 合作,为 975B 参数、1M 上下文的多模态模型 Inkling 提供Day-0推理与 RL 支持,并为 Modal 训练的 DFlash 草稿模型提供投机解码。
推荐理由:原文出自 SGLang 团队,给出针对 Inkling 新架构的具体优化手段和实测吞吐数字,读者可评估其对自建推理或 RL 流程的参考价值。
RadixArk 与 Google Cloud 宣布合作,把开源推理框架 SGLang 带到 Google TPU 上。
SGLang 团队与 Meta Superintelligence Labs 合作,为 30B 参数多模态稠密模型 Muse Glimmer 提供 Day-0 支持,面向本地硬件上的智能体工作流推理。
推荐理由:原文给出 Muse Glimmer 在 SGLang 上的多硬件部署方案和分平台实测数据,读者可据此评估本地智能体推理的可行配置。
SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning,这是一款可定制的开源模型,总参数 30B、每 token 仅激活 3B,上下文最长 100 万 token,由 Nemotron 3 Ultra 蒸馏而来。
SGLang 团队宣布与 Qwen、阿里百炼、NVIDIA 和 AMD 合作,在 SGLang 和 Miles 中于发布当日支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B。
推荐理由:原文给出 Qwen3.8 混合注意力架构的推理支撑细节和实测性能数字,读者可据此评估新模型在自建推理栈上的部署可行性。
RadixArk 发布 Miles v0.1,一个面向前沿后训练的全栈生产级系统,是首个 Miles 版本的继任者。它基于 slime 设计,用 SGLang 做 rollout、NVIDIA Megatron-LM 或 FSDP 做训练,支持全异步 RL、三种评估模式和可插拔智能体环境,并附带智能体编码与终端任务的端到端配方。
蚂蚁集团基础设施团队联合阿里巴巴与 SGLang 团队推出 Weight Cache Daemon,通过 CUDA IPC 零拷贝映射将常驻 GPU 的量化后权重直接提供给新的 SGLang 引擎实例。
Liquid AI 表示目前不提供自托管 API,其 LFM 模型可通过 playground(免费限速)和 OpenRouter(付费更高限额)使用,全部模型可在 Hugging Face 直接下载。多数模型支持通过 LEAP 平台定制与部署,并提供本地推理与定制两套软件栈。年营收不超过 $10M 的组织可获商业使用豁免,超过则需联系销售团队定制定价。
Liquid AI 提出端侧 AI 智能体需模型与 harness 协同设计,以在内存、功耗和延迟的硬约束下实现主动式本地推理。其指出云端智能体依赖昂贵的前沿模型,任务越长延迟与 token 成本越叠加,而每次云端回退都会增加成本并把个人上下文送出设备。Liquid 称每个 LFM 都针对设备能力定制,通过本地推理循环持续收集屏幕、车内传感器等上下文,实现无需提示即可自主行动的主动式智能体。
Liquid AI 推出面向国防战术边缘的端侧 AI 方案,其多模态模型完全在设备本地运行,支持威胁检测、自主导航和实时 ISR,推理留在本地以保持速度和断网可用性。该方案针对国防场景的 SWaP 约束调优,适配手持设备、头显、地面车辆和小型 UAS 的 NPU 与 CPU,避免将敏感数据发送至云端带来的安全风险与 ITAR 违规。
Liquid AI 推出面向工业与机器人领域的本地 AI 平台,用硬件感知的定制多模态模型在现有设备上离线运行,为一线工人提供实时免手操作辅助。其智能体 LFMs 可打通 IT 与 OT 数据孤岛,跨 SCADA、PLC 和企业系统进行推理,实现实时分析、预测性维护与自主工作流。模型可直接运行在边缘 CPU、NPU、GPU 上,具备亚毫秒级响应。
Liquid AI 推出面向医疗健康与生命科学的 SLM 方案,可在医院内网或 VPC 私有部署,让敏感数据留在本地。该系列模型针对临床与制药场景定制,支持文本、音频和图像的多模态处理,并采用支持 HIPAA、SaMD 变更控制模式与可审计性的架构。
Liquid AI 面向金融服务推出可在数据中心、边缘或云端运行的模型,驱动反欺诈、客服与风控等智能体工作流,主打低延迟和银行级隐私,成本仅为前沿模型的一小部分。其 SLM 完全托管在客户自有硬件上,数据不出本地,并按业务职能定制多个小模型而非一个通用 LLM。
Liquid AI 推出面向电商行业的定制多模态 AI 模型,以毫秒级响应支撑语义搜索、站内智能体和商家 Copilot。其意图原生搜索可理解自然语言、图像查询与结构化筛选,并实时调用商家 API 返回商品;站内智能体接入购物车、结账、订阅、订单状态等 API,可引导客户并完成购买流程。商家侧 SLM 基于分析数据、营销活动和商品目录训练,用于总结表现、建议行动并生成商品调整。
Liquid AI 面向消费电子厂商推出端侧 AI 方案,其高效 SLM 可为 PC、智能手机、智能扫地机器人等设备定制适配 NPU、CPU、RAM 和功耗的模型,无需新芯片即可实现智能通知、离线助手和功耗摘要等功能。该方案支持调用厂商自有 API 以打开应用、修改设置并编排设备功能,仅在复杂推理时交由云端 LLM 处理,同时以单一多模态模型覆盖文本、音频和视觉。
Liquid AI 推出面向汽车行业的车载 AI 助手方案,其多模态模型完全运行在量产车已有的 CPU 和 NPU 上,无需云端依赖或新增硬件。方案采用边缘优先的 SLM 与混合智能体架构,单个模型支持 20+ 种语言,速度达现有方案的 5 倍,可实现亚秒级响应与自然语音、座舱视觉交互。
Liquid AI 展示五套基于 LFM 的可运行系统,每套将微调后的 Liquid 模型部署在手机、边缘 GPU 或用户自控 VPC 中,支持断网运行。模型覆盖文本、视觉与音频,量化与推理引擎按目标硬件联合选型并在用户实际硬件上做性能剖析。训练在单张 GPU 上数小时完成,并以留出集评分。
Liquid AI 发布面向端侧 AI 的开发者平台 LEAP,并推出轻量级 iOS 应用 Liquid Apollo,让用户在手机上本地测试小语言模型。
Liquid AI 宣布其 Liquid Edge AI Platform(LEAP)原生支持 AMD 最新 Ryzen 和 Ryzen AI 处理器,基于 llama.cpp 推理引擎,可在本地运行 LFM 模型。
Goodfire Research 为 Silico 推出企业版,团队可在前沿基础设施与算力上运行长周期、异步实验。页面提供演示申请入口,提交后团队会通过邮件跟进是否符合合作条件,同时可查看研究人员在 Silico 上运行的项目。
Fireworks 发布 FireRouter with Opus,将常规轮次路由到开源模型、仅在需要的轮次保留 Claude Opus 5.5,单次会话成本降低 57%,并支持缓存感知路由。
Fireworks 宣布 Kimi K3 支持其 Serverless Training 的 Multi-LoRA 服务与训练,进入私测阶段。K3 是总参数约 2.8T 的 MoE 模型,原文称其为首个达到 3T 规模的开源权重模型。
Fireworks 成为 Voyage AI by MongoDB 首个且唯一合作的专用推理平台,Voyage 4 系列、voyage-multimodal-3.5 与 rerank-2.5 现已原生运行于 Fireworks,检索到生成全流程可在同一 API 上完成。
Fireworks AI 宣布 Training API 正式可用,并推出 Fireworks Lab 服务。
Cursor 推出构建功能,在后台预先准备可直接使用的开发环境副本,智能体启动即可运行,无需额外费用。默认每小时创建一次新构建,环境损坏时智能体沿用上一次成功构建;Cursor 内部环境启动速度提升 10 倍、首个 token 生成速度提升 3 倍。8 月 17 日起所有新建和现有环境将默认启用构建。
推荐理由:官方原文给出启动速度倍数、构建频率和失败回退机制,读者可据此评估其对云端智能体工作流的影响。
Claude 推出插件市场,收录 340 个插件,可一键安装为 Claude 添加工具、技能和集成。示例包括 GitHub 官方 MCP 服务器、Playwright 浏览器自动化、Figma 设计转代码、Supabase、Vercel 集成,以及代码审查、语言服务器和 CLAUDE.md 维护等开发类插件。
推荐理由:页面列出了插件市场的主要品类和代表性插件,读者可以据此了解 Claude 现有可扩展能力的范围。
Anthropic 为 Claude 上线 Connectors 与 Claude Marketplace,把用户已有的工具接入每一段 Claude 对话,目前共 872 个连接器。
Claude 介绍 Artifacts 功能,可在对话旁生成设计、演示文稿、文档、仪表盘或小型交互工具,支持画布编辑、链接分享(默认私有)和导出为 PowerPoint、PDF、HTML 等格式。
推荐理由:官方页面对 Artifacts 及 Claude Design、Claude Slides、Claude Docs 的功能、协作与导出方式做了较完整说明,便于了解可用范围。
Anthropic 公布 Claude 的 Free、Pro、Max 三档订阅方案,Free 档 $0 面向所有用户,可在 web、iOS、Android 和桌面端使用,支持联网搜索、跨对话记忆以及创建文件并执行代码。
Anthropic 发布 beta 版 Salesforce in Claude 插件,由双方共同构建,在既有 Salesforce 权限下将客户的账户、商机和管线引入 Claude,包含 37 项面向销售的技能,如账户调研、电话准备、管线回顾和 CRM 更新。
Anthropic 改版 Claude Code 的 Projects 功能,用户描述目标后由 Claude 负责拆解任务、并行协调多个线程、审查输出并汇总结果,例如按仓库开线程迁移调用、跑测试并开 PR。
推荐理由:官方介绍了 Projects 从文件夹到对话的改版机制,读者可以了解多线程协调与共享记忆如何改变 Claude Code 的长任务工作流。
Anthropic 于 9 月 23 日上线 Claude Marketplace,将插件与连接器、智能体和服务伙伴集中到一个入口。
推荐理由:Anthropic 官方发布,明确列出三类入口、2,000 多个连接器插件和承诺支出抵扣方式,便于评估它对采购与工作流的实际影响。
CodeRabbit、Power Digital 和 ThoughtSpot 通过 Claude Marketplace 用已有的 Anthropic 承诺额度扩展了 Vercel 与 Snowflake 用量。
Anthropic 宣布 Claude Tag(beta)支持个人连接器:在 Slack 频道中让 Claude 使用成员自己账号连接的工具,如 Google Drive、日历、CRM 或 staging 部署,此前只能使用管理员附加到频道的连接器。
Claude 推出插件目录提交门户,插件可打包 MCP 连接器、Agent Skills 或两者,经审核通过后上架 Claude 目录,成为第三方扩展的主要形式。
推荐理由:官方说明插件提交流程、审核与使用分析功能,开发者可据此了解如何为 Claude 构建第三方扩展。
NVIDIA 发布 Open Agent Safety Platform,Anthropic 与其合作,将 NVIDIA 开源软件 OpenShell 引入 Claude Managed Agents 的智能体安全体系。
推荐理由:Anthropic 官方说明与 NVIDIA OpenShell 的分层安全设计,读者可以据此评估企业智能体的权限控制方案。
Anthropic 销售团队基于 Claude Managed Agents(beta)构建了一个购买智能体,每天承接数千次对话,将客户从咨询直接引导至结账。该智能体转交的线索转化为商机的概率是旧表单的两倍以上,成交速度快约五天,且客户可选择与智能体或销售代表沟通。一名工程师用几周时间完成初版,销售与内容团队可直接在 Console 中修改系统提示词,上线后每周持续迭代提示词。