Baseten 上线 Qwen3-TTS-12Hz 语音合成模型部署
Baseten 发布 Qwen3-TTS-12Hz 流式文本转语音模型,支持十种主要语言、3 秒参考音频快速克隆音色,并可依据文本内容调整语气、节奏和情感表达。模型支持流式与非流式生成,收到单个字符即可输出首个音频包,提供 0.6B 和 1.7B 两个 Base 版本模型卡,页面附有基于 WebSocket 的完整调用脚本,可进行语音管理和 PCM 流式合成。
Baseten 发布 Qwen3-TTS-12Hz 流式文本转语音模型,支持十种主要语言、3 秒参考音频快速克隆音色,并可依据文本内容调整语气、节奏和情感表达。模型支持流式与非流式生成,收到单个字符即可输出首个音频包,提供 0.6B 和 1.7B 两个 Base 版本模型卡,页面附有基于 WebSocket 的完整调用脚本,可进行语音管理和 PCM 流式合成。
Baseten Base Labs 推出 MARS8-Flash 语音生成模型,支持流式输出音频,默认输出格式为 flac,也可选 wav、adts 或无头 PCM。
Canopy Labs 推出 Orpheus TTS(Orpheus v1),为其 Orpheus TTS 的继任模型,需以约 83 tokens/秒生成才能实现实时流式输出。该实现支持流式生成,在 H100 MIG GPU 上可支持 16 路并发实时流(可变流量)、24 路并发实时流(稳定流量),以及 128 路并发非实时生成以进行低成本批处理。
Microsoft 在西雅图和 Redmond 的发布活动上宣布新 Copilot,将聊天、代码、Office 和名为 Autopilot 的常驻智能体合并到一个界面,取代此前分开的消费者与工作聊天应用。
Baseten 模型库现已提供 DeepSeek V4.1 Flash、GLM-5.3 Fast、GLM-5.3、GLM-5.3-Flash 和 Kimi K3 等热门模型,可部署在 API 端点后直接调用。
Eugene Yan 发布 AlignEval(aligneval.com),把构建 LLM 评测器简化为四步:上传含 input、output 列的 CSV,标注样本为 pass 或 fail,定义评测标准并运行 LLM 评测器,再用 dev-test 划分半自动优化。
Cloudflare 发布全新 CLI 工具 cf(开放 beta,npm i -g cf),将命令覆盖从 Wrangler 的约 280 个操作扩展到超过 3000 个 API 操作,基于 Forge 从 OpenAPI schema 生成。
Cloudflare 发布 Application Profiles,通过分析 HTTP 请求的结构与格式、识别偏离来实施正向安全策略,从而大幅缩小攻击面。
Cloudflare 发布 Threat Signals,面向所有账户免费开放,用智能体技能把用户选择的开源安全报告自动摘要、打标签、提取和规范化 IOC,并以 Threat Event 形式存入账户私有威胁情报数据集,可直接用于 WAF 策略。
Cloudflare 提出覆盖发现风险、治理访问、运行时防护、调查响应四阶段的自适应应用安全框架,把代码、流量与威胁情报连成持续系统。新能力包括用 LLM 对自家 WAF 做渗透测试、向所有客户开放威胁情报,以及自动部署正向安全的新功能。其依据是 7 月 AI 智能体在不到 13 小时内从 Hugging Face worker 拿到多个集群管理员权限的事件。
Cloudflare 发布面向 Agent 沙箱优化的 Containers 更新,推出 durable_object 调度策略,支持运行时选择镜像和实例类型,并公测文件系统快照。
Anthropic 推出 Desktop Extensions,把 MCP 服务器连同依赖打包成 .mcpb 文件(发布时为 .dxt,2025 年 9 月起改名),在 Claude Desktop 中双击即可安装,无需终端、手动改配置文件或处理依赖冲突。
Anthropic 在 Claude 开发者平台发布三项 beta 功能:Tool Search Tool 按需发现工具、Programmatic Tool Calling 用代码编排工具调用、Tool Use Examples 在工具定义中提供示例。
推荐理由:官方给出了三项工具调用新功能的机制说明和内部测试数字,读者可以据此评估大工具库场景下的上下文与准确性权衡。
地平线正式发布 HSD 全场景辅助驾驶系统 V2.1,首批搭载车型 iCAR V27 将于 10 月 8 日起分批推送升级。该版本国内量产首发端到端全场景倒车 Beta,并新增闪灯鸣笛警示、自定义车位遥控泊入泊出、实体钥匙遥控泊车等功能。主动安全方面升级视觉神经网络,提升横穿、转弯低速跟车和目标 Cut in 等场景的避撞能力。
小米米家三筒洗衣机健康洗 Pro 14kg 系列今日开售,洗烘款首发价 5999 元、国补后 4998.85 元,滚筒款 4999 元、国补后 3999.25 元。
荣耀公布 MagicOS 11 十月体验升级,一碰传将支持与 OPPO、vivo、小米手机跨品牌分享,无需安装 App,预计 10 月中旬支持 MagicOS 11 产品,具体上线时间依赖对方手机升级支持。
彭博社马克·古尔曼称,苹果计划于当地时间 10 月 13 日推出首款智能家居控制中枢(Home Hub),以及 2027 款 HomePod mini 和新款 Apple TV。
磐镭 YO2 迷你工作站开启预约,搭载 AMD 锐龙 AI MAX+ PRO 495 处理器,192GB 内存 + 2TB SSD 售价 49999 元。
Sonos 推出 Beam Ultra 回音壁和 Ace Ultra 耳机,评测显示该品牌已完全走出 2024 年 app 风波。这两款新品被视为 Sonos 品牌复苏的标志。
三星发布 Galaxy Tab S12+ 与 Tab S12 Ultra 两款平板,均搭载联发科天玑 9500 芯片,配备 12.6/14.6 英寸 Dynamic AMOLED 2X 屏幕,峰值亮度 1600 尼特,运行基于 Android 17 的 One UI 9,10 月 7 日起全球陆续上市。
Docent 团队发布技术演示,展示如何在生产环境的编码智能体流量中测量失准行为。该团队此前已将 Docent 以 Apache 2.0 协议开源,并与 SWE-Bench 合作实现对智能体轨迹的可扩展分析。Docent 是用于分析和干预智能体行为的系统。
Transluce 推出 Docent,可将 AI 智能体对话记录转化为可靠、可追溯的行为测量,用于安全评估、监控 RL 训练或迭代生产环境智能体。
xAI 宣布 Grok Bot 面向企业开放,Grok 和 Cursor Enterprise 客户未来两周可免费使用,并可邀请整个组织包括没有现有席位的成员。每个 Bot 在云端独立运行,可按工作流学习任务、相互传递上下文,本次发布还新增访问、网络和审计管控;用户工作在相互隔离的安全环境中运行,Bot 默认无访问权限。
xAI 发布 Grok Bot 采购应用 Haggle Bot,接入 Slack、Notion、Drive、Gmail、Hex、Ramp 等工具,梳理约 125 个活跃供应商,已识别超过 10 万美元直接节省。
推荐理由:原文以自家用例给出 Grok Bot 在采购场景的完整配置与节省数字,读者可据此评估 Bot 在企业流程中的可复用方式。
xAI 为 Grok Build 推出记忆功能,在每轮对话完成后于后台记录约定、决策和项目事实,后续会话会先读取相关笔记再修改代码。记忆按项目保存并另有全局偏好集合,不记录任务状态、临时结论、密钥及仓库文档已覆盖的内容;新增 /memory 浏览命令和 /dream 整理命令,后者也会定期在后台运行。
xAI 推出 Team Bots,即能与团队共同工作和学习的 Grok Bots,今日起在 Teams 和 Enterprise 计划开放公测。每个 Bot 整合上下文、插件、凭证和记忆四类要素,个人对话保持私密,也可在 Slack 中协作。
推荐理由:官方详细说明了 Team Bots 的构成要素和四类内部用法,读者可以据此评估在自己团队工作流中的可行性。
广告做完了。版本还没。 不同尺寸。不同市场。同一广告活动。 用 Luma 的 Ad Variants 让你的广告走得更远。
小米官网发布 MiMo Desktop 桌面 Agent 产品,把 PPT、文档、表格、定时与文件整理交给「Smart」调度,自动评估任务并路由到办公、代码或研究框架,复杂任务拆解为子任务多 Agent 并行推进,Self-Evolve 引擎持续优化自身代码。
World Labs 发布 Spark,一款面向 THREE.js 的高级 3D Gaussian Splatting 渲染器,可与场景中的其他网格和 splat 集成,并在所有设备上实现快速渲染。该渲染器支持可编程的动态 splat 效果,兼容 ply、sogs、spz、splat、ksplat 等多种格式。
World Labs 上线 Marble Labs,汇集 Marble 在影视 VFX、虚拟制片、游戏、AR/VR 等场景的项目案例与构建教程。
TensorZero 推出基于 Track-and-Stop 最佳臂识别的多臂老虎机算法,在 LLM 网关中实现自适应 A/B 实验,动态调整采样比例并用 anytime-valid 的 GLRT 停止规则避免 p-hacking。
推荐理由:文章用仿真和真实 NER 实验数据说明自适应实验相比均匀采样能减少约 37% 的判定时间,并给出可直接复用的配置方法。
TensorZero 正在构建自动化 AI 工程师 TensorZero Autopilot,可分析 LLM 可观测性数据、搭建评测、优化提示词与模型并运行 A/B 测试,在软件工程、客服、数据抽取、医学、法律、天体物理、交互推理等任务上全部提升。
Suno 宣布自 2026 年 9 月 3 日起实施新的下载限制并更新服务条款。Free 用户终身最多 7 次试用下载,Pro 每月 20 次,Premier 每月 60 次;使用 Suno Studio 的 Premier 订阅者不设下载上限,超出部分可付费购买。
Suno 发布 Studio 2.0,为浏览器端 DAW 带来 MIDI 导入录制与编辑、wavetable 合成器、Chat(beta)、高级 stem 分离、音频效果与自定义插件以及自动化功能。MIDI 片段还可作为音频生成的提示词,Premier 订阅者可无限导出 32-bit/48kHz 多轨与 stems。
Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG 和 Believe 等行业伙伴合作开发,官方称其更快、更具表现力且质量更高。
推荐理由:原文给出 v6 三个模型分工、具体编辑控制能力和与 Warner Music Group 等的合作背景,读者可据此评估其创作工作流的变化。
Sarvam AI 开放 Indus 限量测试版,这是体验其模型的界面,由 105B 主权模型驱动,规模明显小于当前全球消费级聊天应用背后的前沿模型。现阶段团队优先聚焦印度语境下的准确性、实用性与对齐,之后再训练更大的基础模型。Indus 正逐步放量,初期可能需排队等待。
Sarvam AI 汇总首届 Sarvam Epoch 活动上发布的全部内容,覆盖模型、推理、Agent 平台与硬件。
UC Santa Barbara 与 UC Berkeley 团队推出基于 OpenSage 框架的 CTF 专用智能体 SageCTF,在 DEF CON CTF 2026 资格赛中尝试 15 题。
推荐理由:原文给出 SageCTF 在 DEF CON CTF 的具体成绩与 50 题对比数据,读者可以据此评估自主 Agent 在长程安全任务上的水平。
Berkeley RDI 于 2026 年 9 月推出 CUA-Lite,一个开发 computer-use agent 的开源平台,围绕 Lite.Gym 统一环境接口、Lite.Sample 统一监督数据格式和每模型一个、跨 eval/SFT/RL 共用的 harness 三大抽象构建。
推荐理由:平台由 Berkeley RDI 官方发布,给出三大抽象和已接入的基准、数据规模,读者可据此评估是否用于 CUA 开发。
Preferred Networks(PFN)展示其企业 AI 平台 PreferredAI Work Suite,以及从零自研的日英翻译大语言模型 PLaMo Translate,后者采用紧凑高效设计,支持本地部署并提供浏览器扩展。