用 vLLM-Omni 在 SageMaker AI 上构建实时语音应用(Part 1)
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并用 Gradio 应用验证。
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并用 Gradio 应用验证。
AWS 发布 vLLM-Omni 图像视频生成示例,在同一 vLLM-Omni DLC 上部署两个 SageMaker AI 端点:实时端点跑 FLUX.2-klein-4B 文生图,异步端点跑 Wan2.1-VACE-1.3B 图生视频。
Google 介绍 Gemini 3.8 Flash 相比 3.7 Flash 在软件工程、Agent 任务和专业领域多步推理上有显著提升,性能常接近更高成本的 frontier 模型。
推荐理由:文章展示了四个社区用 Gemini 3.8 Flash 做出的具体项目,读者可以借此了解模型在多步推理和多模态任务上的实际用法。
AWS 博客介绍用 Amazon Nova Act 配合 Amazon Bedrock AgentCore 构建智能体驱动的合成监控方案,以自然语言动作替代 Selenium、Playwright 的 DOM 选择器脚本。
AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的方案,提供 CloudFormation 和 Terraform 模板、跨账户适配器提升流程、生产安全配置及文档预分类路由模式。
布鲁克林 Edy's Grocer 店主 Edy Massih 用 Gemini 将家族黎巴嫩菜谱直接换算成大型宴会批量配方,避免手工计算香料与酥皮比例出错。Gemini 还能把活动菜单转成分区陈列的采购清单、汇总共用食材并提前排好备餐日程,并针对无麸质、无坚果等饮食限制给出保留风味的替换方案。Edy 表示 Gemini 释放了他的时间,让他少做行政事务、多推广黎巴嫩饮食文化。
从 DeepSeek 官方 API 处统计的数据来看,约有 60% 的 DeepSeek Harness 用户使用了至少一个第三方插件。第三方插件是 DeepSeek Harness 用户体验中最具特色且不可缺少的一部分。DeepSeek Harness 团队将持续支持第三方插件生态的繁荣发展,并推动插件 API 趋于稳定,在将来减少和尽量避免破坏性更新。 接下来的几天我个人将每天推荐一个优质的 DSH 第三方插件,欢迎 DSH 插件作者在本 thread 下自荐。我会结合插件质量及后台实际统计到的插件使用量择优推荐。 DeepSeek Harness 团队祝大家中秋快乐阖家幸福! (注:在用户使用官方 API 及模型时,DSH 会向官方 API 上报实际使用的插件包名和版本。此类上报不额外消耗 tokens。)
Databricks 博客梳理了营销与数据工程团队最常理解不一致的 24 个营销数据术语,围绕活动数据来源、客户记录代表谁、受众何时可激活等五个执行问题展开。每个术语都给出营销侧与数据工程侧的两套定义,例如“实时”在营销眼中是每 15 分钟刷新,在数据团队眼中则是秒级更新,涉及新基础设施与持续成本。文章建议在开工前先对齐“客户”“受众就绪”“信号新鲜度”等含义,避免误解变成活动返工。
我觉得 Opus 5.5 不抽大麻,做不出这种东西。 看完你就懂 PPO, GRPO, DPO! Better than expected.
BestBlogs 09-28 早报精讲三篇:Elixir 创造者 José Valim 提出 AI 时代编程语言应提供更强程序保证,并建议把符号、调用图、类型等暴露为可查询的程序数据库。
我觉得 Opus 5.5 不抽大麻,做不出这种东西。 看完你就懂 PPO, GRPO, DPO! Better than expected.
Simon Willison 用 Opus 5.5 开发了一款 Bluesky 回复机器人检测工具,可分析任意 Bluesky 账号是否存在自动回复机器人迹象。
Simon Willison 用 Claude Opus 5.5 将三张 kākāpō 鹦鹉照片生成 HTML5 canvas 像素动画 Kākāpō Party,画面中至少 20 只鹦鹉跳跃派对并伴随彩纸效果。他随后让本地 Claude Code 会话用 Playwright 加载该页面、在 3 秒后分散点击可点击区域,录制出 15 秒视频用于 Keynote 收尾幻灯片。
Use Claude Code as your Video Editor Believe it or not, every video you see below was vibe coded by Claude Code. 🧵 here’s how you can do it too:
推荐理由:作者给出 Opus 5.5 相对 Opus 5 的价格降幅,并提供成本计算器,读者可自行估算 Claude Code 任务成本变化。
GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义界面,用户只需在 agent 会话中输入 /create-canvas 技能并用自然语言描述需求,即可生成看板、发布清单或仪表盘等界面,无需编写代码或手动设计。
AWS 提出在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 模型强化学习训练的架构,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行的异步 RL 负载,用 DeepEP 优化专家并行(EP)在 EFA 上的 all-to-all 通信,缓解跨节点带宽瓶颈。适用于 RLHF、PPO 和 GRPO 等大规模 RL 训练流程。
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型进行多轮强化学习后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
NarrateAI 在 Amazon Bedrock 上通过五项技术实现约 99% 的数值准确率并实时流式返回结果,服务超过 4000 名 AWS 高管。这五项技术分别是自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,其中约 90% 的查询走单次快速路径,仅约 10% 的复杂查询进入并行批处理路径。
AWS 博客演示如何通过 SageMaker JumpStart 将 Qwen3-TTS-12Hz-1.7B-Base 部署到实时推理端点,用几秒参考音频和转录文本克隆说话人音色,无需重训模型。
S&P Global Energy 在 Databricks 博客详解如何让覆盖 LNG、Chemicals、Crude Oil、Refined Products、Gas & Power 等的结构化数据资产可供 AI 智能体对话。
Amazon SageMaker HyperPod 搭配 Qumulo 的 Cloud Native Qumulo(CNQ)与 Cloud Data Fabric(CDF),可让训练集群直接读取另一 AWS Region 或本地数据中心的数据集,无需复制数据或修改代码。
很多人想知道如何用我们新的编辑模型来实现一致的角色等等——所以我们为你们做了一个视频 <3
AWS 发布 WhisperX Deep Learning Container(DLC),在 OpenAI Whisper 基础上加入 wav2vec2 强制对齐的逐词时间戳和说话人分离,可部署到 Amazon SageMaker AI 实时或异步端点,无需自建镜像。
NVIDIA 技术博客解析了生物基础模型的高效 MoE 训练方案:相比每个 token 都要过全部层的稠密 Transformer,MoE 用多个专家子网络、每个 token 只激活其中一小部分,从而降低训练与推理算力开销。文章指出,随着语言模型规模增长,稠密架构的扩展成本越来越高。
一位工程师在 Databricks 上构建了基于智能体的安全审查层,用 7 个各司其职的智能体承接可重复的审查工作,把人工判断留给高风险和模糊决策。
We made claude.ai 3x faster in two weeks. Here’s how we use Claude to measure, debug and improve performance. Prompts and methods included. https://claude.dev/blog/how-we-made-claude-ai-faster/
推荐理由:Anthropic 团队分享了用 Claude 测量、调试并让 claude.ai 在两周内提速 3x 的具体方法,文中附带了可直接复用的提示词。
NVIDIA 指出 GPU 集群即使所有 GPU、网络链路和 pod 均报告健康,512-GPU 训练任务仍可能性能不达标或失败,原因可能是单个慢速 GPU、负载下性能劣化的链路,或悄悄将流量导向慢速路径的配置。运维人员往往要到训练运行数小时后才会发现问题。
NVIDIA Warp 与 MuJoCo Warp(MJWarp)可将兼容的 MuJoCo 模型扩展到最多 2,048 个并行 GPU 环境,本文以 SO-101 机械臂为例演示从 CPU MuJoCo 工作流迁移到 GPU 批量仿真的过程。
GitHub Copilot 应用重建了 pull request 视图,用一个含 2200 个文件、超 100 万行改动和 400 多条行内评论的开源 PR 做压力测试。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确计算,评论高度则按需测量、修正幅度小且锚定在用户当前查看位置,从而避免滚动跳动。
智能体在工作前后喜欢大量读取以收集上下文,所以针对读取做优化会带来很大差别! 如果你在构建智能体,我强烈推荐读一读这个(或者把它交给你的智能体,让它去实现这些发现)
We've reduced token costs in Cursor by 7% with no drop in agent quality. Savings came from tighter prompts, selective tool loading, better caching, and compressed file reads.
一篇用可交互示例讲解 shadow roots 的教程,演示了样式封装、继承、slots、parts 以及 JavaScript 访问方式。内容展示 shadow roots 如何创建带有私有样式表和元素的隔离 DOM 树,并以特定且受控的方式与页面 DOM 交互。
Together AI 发布教程,演示如何以 Qwen3.5 4B 为基础模型,用 MultiNLI、BoolQ、Banking77 等 6 个数据源共 37,840 条样本微调一个 Jev 式分类模型,训练成本约 $17.0,耗时约 25 分钟。
肝不动了....GPT的几个和后端/Agent性能测试明天再说吧.....
@karminski3 效率也太高了!你不睡觉的吗😳
如何在 60 秒内在 @CloudflareDev AI Gateway 上配置来自 @typesafeai 的 Jev。
NVIDIA 提出 AI 智能体评估需从单次工具调用打分转向整项任务完成度打分,核心是看智能体能否在真实环境中连续执行数十次工具调用并在某步失败后恢复。仅评估模型回答是否"听起来对",几乎无法反映工作是否真正完成。