Chips and Cheese 在 AMD Advancing AI 2026 采访 Alan Smith 谈 CDNA5 架构
Chips and Cheese 在 AMD Advancing AI 2026 活动上采访了 AMD 企业院士、数据中心 GPU 首席架构师 Alan Smith,谈新发布的 CDNA5 架构(用于 MI455 和 Helios)。
Chips and Cheese 在 AMD Advancing AI 2026 活动上采访了 AMD 企业院士、数据中心 GPU 首席架构师 Alan Smith,谈新发布的 CDNA5 架构(用于 MI455 和 Helios)。
Ethan Mollick 在其定期更新的 AI 使用指南中提出,用 AI 做事已从聊天转向 agent 系统,做正经工作首选 ChatGPT 或 Claude,每月 $20 起。
推荐理由:作者基于自己的实际使用给出选型建议和权限管理提醒,读者可据此判断当前 agent 工具的分工与取舍。
DaoCloud 团队在 3 台 8 卡 B300 服务器(共 24 GPU)上以 4 Prefill + 1 Decode 分离拓扑部署 GLM-5.2-NVFP4,在 mean TTFT ≤ 2.5s、mean TPOT ≤ 20ms 的 SLA 下,将 16K 输入的 mean TPOT 从约 40ms 优化到约 17ms。
Sierra 工程师 Mihai Parparita 发布长文,复盘公司内部 MCP Gateway 的构建过程,该网关基于 Model Context Protocol 将 AI 智能体安全接入内部工具。
推荐理由:作者以第一手复盘提炼七条工程经验,覆盖权限设计、Agent 校验与身份管理,方法对自建 Agent 基础设施可直接借鉴。
Hugging Face 发布 AIFS-single-2.0 的补丁与教程,支持通过 Hugging Face jobs 或本地环境在各类 GPU 上运行该模型。仓库名为 huggingface/AIFS-single-2.0-on-all-GPUs,内容为运行补丁与操作教程。
Modem 发布《Writing Code for Agents》系列第一篇,解释 Claude Code、Codex 等编码智能体主要靠 ripgrep 文本搜索导航代码库,并给出命名、类型、注释位置等可发现的写码建议。
Sebastian Raschka 撰文讲解推理模型如何支持多档推理力度(reasoning effort)设置。
vLLM 团队介绍其如何在高合并节奏下保持发布稳定:2026 年 6 月共合并 1,918 个 commit(日均 64 个),CI 包含 37 个测试组、266 个任务,使用共享容器镜像和 pip-compile 锁定依赖,并依赖 58 个 runner 队列的异构硬件。
IBM Research 分享在智能体系统中构建模型路由的经验,认为路由不应被当作分类问题而是系统优化问题。在 AppWorld Test Challenge 上用 CodeAct 智能体实测 417 个任务,Claude Sonnet 4.6 总成本 $79($0.19/任务),反而低于单价更低的 GPT-4.1 的 $155($0.37/任务),差异源于缓存命中。
推荐理由:作者基于 AppWorld 实测给出路由成本、难度与延迟被低估的三点原因,并分享了可迁移的优化思路。
vLLM 与 AMD Quark 团队展示了在 AMD Instinct MI355X GPU 上训练和部署 EAGLE3 投机解码的完整流程,覆盖 Kimi-K2.5 与 MiniMax-M2.5,并用 InferenceX 做基准测试。
Hugging Face 发布 Profiling in PyTorch 系列第三篇,用 profiler trace 对比手写注意力、in-place 掩码、SDPA math/efficient/flash/cuDNN 各后端的 kernel 表现。
推荐理由:原文用 profiler trace 逐一对比 PyTorch 各注意力实现的 kernel 差异,读者可以学到一套先猜测再看 trace 的可迁移分析方法。
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合而成,用 VLM 重新生成图像长描述,再转为可流式读取的语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天),并采用 Lance 构建、MDS 流式的双格式流程,图像统一以 JPEG quality 92 编码。
Lilian Weng 在 Lil'Log 发表长文,梳理 harness 工程研究如何服务于递归自我改进(RSI)。
推荐理由:作者系统梳理了 harness 工程与递归自我改进的关系,并给出可迁移的设计模式、优化路径和七大未解瓶颈。
vLLM-Omni 将 Qwen3-Omni 拆成 Thinker、Talker、Code2Wav 三阶段流水线,并通过 OpenAI 兼容的 /v1/chat/completions 提供文本与语音生成。
Sebastian Raschka 发布长篇教程,讲解如何用 Ollama 服务 Qwen3.6 35B-A3B 等开源权重模型,并接入 Qwen Code、Codex、Claude Code 三种编码 agent harness,评测代码在 https://github.com/rasbt/local-coding-agent-evals。
Google 宣布将 Multi-Token Prediction(MTP)改造性地部署到已冻结的 Gemini Nano v3 模型上,并已向 Pixel 9 和 10 系列推送。
Lilian Weng 撰文梳理 Scaling Laws 的经验基础,指出训练损失 L 随模型规模 N、数据量 D 和算力 C 按幂律下降,在对数坐标上呈直线,核心是在 N 与 D 之间最优分配算力,常用近似为 C ≈ 6ND。
vLLM-Omni 已支持 Qwen3-TTS、VoxCPM2、Fish Speech S2 Pro 和 Higgs Audio V3 等 TTS 系统,并针对各模型瓶颈采用不同优化策略。
vLLM 联合 Red Hat 和 Andrew Ng 的 DeepLearning.AI 推出课程《Fast & Efficient LLM Inference with vLLM》,现已免费上线,时长约 1.5 小时,含 9 节视频和 3 个 JupyterLab 动手实验。
Intel 的 AutoRound 训练后量化算法已完整集成进 vLLM-Omni,支持 W4A16 量化并实现"一次量化、直接部署"流程。Qwen3-Omni-30B-A3B 的 checkpoint 从 66 GB 降至 25 GB,体积减少最多 62%,其 W4A16 版本在 OmniBench 上得分略优于 BF16 参考,文生图质量漂移仅约 1.3%。
Together AI 详细解析其为 MiniMax M3 做的生产级推理优化,M3 支持 1M token 上下文窗口、原生多模态和 MiniMax Sparse Attention(MSA)架构,MSA 使 prefill 提速超过 9x、decode 提速超过 15x。
小米 MiMo-V2.5 与 MiMo-V2.5-Pro 基于 Hybrid SWA 架构,将 KVCache 存储压缩至 Full Attention 的约 1/7。
Together AI 通过 TensorRT 多 profile 编译、GPU 端条件分支和减少 CPU 拷贝,打造出全球最快的语音转文字技术栈。
Dwarkesh Patel 发布与 MatX CEO Reiner Pope 的黑板讲座,从逻辑门出发逐层讲解 AI 芯片如何工作,直至解释 GPU、TPU、FPGA 和人脑各自的设计形态。
Sierra 构建了一套动态路由多家供应商的转录平台,通过并行查询多个转录模型并融合输出,内部基准显示可将话语错误率平均降低约 25%,在转录提升空间更大的语言中最高降低 37%。该平台还支持 70 多种语言,并将对话上下文注入转录过程,使金融服务智能体的输入验证率提升超 25%,整体解决率最高提升 1%、重大转录错误最多减少 15%。
Sebastian Raschka 梳理 2026 年 4 至 5 月主要开源权重 LLM 的架构变化,核心主题是长上下文效率。
http://x.com/i/article/2052796100608974848
Together AI 发文解析 DeepSeek-V4 的服务化挑战,认为其核心变化是在 token 轴压缩 KV cache 的混合注意力设计(CSA、HCA、SWA),使模型支持 1M token 上下文窗口。
推荐理由:原文基于 Together 在 HGX B200 上的实际 bring-up,给出 KV cache 布局和缓存策略如何决定 DeepSeek-V4 长上下文吞吐的具体经验。
开发者用 CLI 智能体 Goose 配合 Together 的 dedicated containers 技能,仅凭一句提示词就为 Netflix 新发布的 void-model 生成了可在 Together Dedicated Container Inference(DCI)上运行的完整容器配置,把从模型发布到实际部署的滞后压缩到近乎为零。
Sierra 提出"上下文工程"是构建复杂 AI 智能体的核心,通过渐进式披露只向模型提供当下最相关的信息,避免上下文窗口内无关 token 稀释注意力。
OpenAI 发布 gpt-realtime-2 实时语音模型提示词指南,该模型是用于低延迟语音到语音应用的推理模型。上下文窗口从 32k 扩展到 128k tokens,指南建议从最小提示词起步按测试补指令、用低推理档位、用 preamble 管理等待体验,并在调用工具前逐位确认订单号、邮箱等高精度标识符。
推荐理由:原文给出 gpt-realtime-2 的提示词设计规则,覆盖推理档位、工具确认和实体捕获等可落地做法。
Sierra 宣布重构工程面试流程,取消了编码和算法面试,改用由 Plan、Build、Review 三环节组成的 AI-native onsite,候选人可在 2 小时内自选 AI 工具完成搭建。公司还把电话初筛换成系统设计面试,并试点考察 1 到 N 迭代能力的 debugging 面试。作者称新流程信号更丰富、体验更好,不过开放式格式难以标准化,需配套评估标准和双人面试来校准。
面向 AI 原生团队的多租户 GPU 集群设计需同时满足池化容量、租户隔离与自助访问三项要求,避免为每个团队单独建集群导致 GPU 夜间和周末闲置。架构上采用共享层加租户层的两层模式,共享层由集中控制面管理高性能存储与 InfiniBand/Ethernet 网络,租户层为每个团队提供专属 GPU 节点、存储 PVC 及自选编排层(Kubernetes、Slurm 等)。
Sebastian Raschka 撰文介绍自己为文章和 LLM-Gallery 绘制 LLM 架构图的工作流。他从官方技术报告入手,但指出如今论文尤其工业界开放权重模型的论文细节变少,因此通常直接查看 Hugging Face Model Hub 上的 config 文件和 transformers 库参考实现来获取架构细节。
OpenAI 发布 API 部署检查清单,指导开发者基于 Responses API 和 GPT-6 模型族(gpt-6-astra、gpt-6.1-sol、gpt-6-luna)配置生产工作负载。
Sebastian Raschka 发文讲解编码智能体与 coding harness 的整体设计,提出六大组件:实时仓库上下文、提示词结构与缓存复用、结构化工具与权限校验、控制上下文膨胀、结构化会话记忆、带边界的子智能体委派。
Steve Yegge 撰文分享他作为 Beads(20k stars)和 Gas Town(13k stars)维护者、每天接收约 50 个社区 PR(99% 为 AI 生成)的 vibe maintainer 工作流。
Sebastian Raschka 发布 LLM 架构画廊(含 45 个条目和可视化模型卡),并撰文图解现代开源权重模型中的注意力变体。