跳到正文

#教程/实践

今日 45 条
7月28日周二
7月24日周五
7月23日周四
7月22日周三
7月21日周二
7月20日周一
7月18日周六
7月16日周四
  1. Hugging Face:Blog(RSS)61

    IBM Research:模型路由看似简单,实则是系统优化问题

    IBM Research 分享在智能体系统中构建模型路由的经验,认为路由不应被当作分类问题而是系统优化问题。在 AppWorld Test Challenge 上用 CodeAct 智能体实测 417 个任务,Claude Sonnet 4.6 总成本 $79($0.19/任务),反而低于单价更低的 GPT-4.1 的 $155($0.37/任务),差异源于缓存命中。

    推荐理由:作者基于 AppWorld 实测给出路由成本、难度与延迟被低估的三点原因,并分享了可迁移的优化思路。

7月13日周一
7月10日周五
  1. Hugging Face:Blog(RSS)68

    Hugging Face 发布 Profiling in PyTorch 系列第三篇:用 profiler 对比各注意力实现

    Hugging Face 发布 Profiling in PyTorch 系列第三篇,用 profiler trace 对比手写注意力、in-place 掩码、SDPA math/efficient/flash/cuDNN 各后端的 kernel 表现。

    推荐理由:原文用 profiler trace 逐一对比 PyTorch 各注意力实现的 kernel 差异,读者可以学到一套先猜测再看 trace 的可迁移分析方法。

7月6日周一
  1. Hugging Face:Blog(RSS)45

    PRX Part 4:我们的数据策略

    PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合而成,用 VLM 重新生成图像长描述,再转为可流式读取的语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天),并采用 Lance 构建、MDS 流式的双格式流程,图像统一以 JPEG quality 92 编码。

7月4日周六
7月1日周三
6月27日周六
6月26日周五
  1. Lilian Weng46

    一篇拖了很久(3 年多?)的缩放定律文章。 算力很贵。缩放定律帮我们在投入大规模训练之前,推理数据与模型规模之间的最优算力分配。 文章涵盖:缩放定律预测了什么、算力最优分配如何运作、Kaplan et al. 与 Chinchilla 为何结论不一致,以及数据限制 + 拟合细节如何让外推变得棘手。 https://lilianweng.github.io/posts/2026-06-24-scaling-laws/

6月24日周三
6月23日周二
6月3日周三
6月2日周二
5月30日周六
5月29日周五
5月22日周五
5月19日周二
  1. Sierra:Blog(RSS)34

    Sierra 谈语音 AI 的转录难题:多供应商集成与上下文感知如何降低错误率

    Sierra 构建了一套动态路由多家供应商的转录平台,通过并行查询多个转录模型并融合输出,内部基准显示可将话语错误率平均降低约 25%,在转录提升空间更大的语言中最高降低 37%。该平台还支持 70 多种语言,并将对话上下文注入转录过程,使金融服务智能体的输入验证率提升超 25%,整体解决率最高提升 1%、重大转录错误最多减少 15%。

5月16日周六
5月12日周二
  1. Andrej Karpathy65

    Andrej Karpathy 分享技巧:在查询末尾要求 LLM "structure your response as HTML",再用浏览器查看生成的文件,也可要求输出为幻灯片。他进一步提出,音频是人类偏好的输入而视觉是 AI 偏好的输出,输出形式将从文本、markdown 演进到 HTML,最终可能是扩散神经网络直接生成的交互式视频;输入端还缺少指向屏幕等交互方式。

    引用Thariq@trq212

    http://x.com/i/article/2052796100608974848

5月11日周一
  1. Together AI 研究与产品博客(RSS)68

    Together AI 解析 DeepSeek-V4 服务化:百万 token 上下文为何是推理系统工程问题

    Together AI 发文解析 DeepSeek-V4 的服务化挑战,认为其核心变化是在 token 轴压缩 KV cache 的混合注意力设计(CSA、HCA、SWA),使模型支持 1M token 上下文窗口。

    推荐理由:原文基于 Together 在 HGX B200 上的实际 bring-up,给出 KV cache 布局和缓存策略如何决定 DeepSeek-V4 长上下文吞吐的具体经验。

5月8日周五
5月5日周二
  1. OpenAI Developers(RSS)66

    OpenAI 发布 gpt-realtime-2 语音模型提示词指南

    OpenAI 发布 gpt-realtime-2 实时语音模型提示词指南,该模型是用于低延迟语音到语音应用的推理模型。上下文窗口从 32k 扩展到 128k tokens,指南建议从最小提示词起步按测试补指令、用低推理档位、用 preamble 管理等待体验,并在调用工具前逐位确认订单号、邮箱等高精度标识符。

    推荐理由:原文给出 gpt-realtime-2 的提示词设计规则,覆盖推理档位、工具确认和实体捕获等可落地做法。

4月22日周三
  1. Sierra:Blog(RSS)62

    Sierra 重塑工程面试流程,用 AI-native onsite 替代编码与算法面试

    Sierra 宣布重构工程面试流程,取消了编码和算法面试,改用由 Plan、Build、Review 三环节组成的 AI-native onsite,候选人可在 2 小时内自选 AI 工具完成搭建。公司还把电话初筛换成系统设计面试,并试点考察 1 到 N 迭代能力的 debugging 面试。作者称新流程信号更丰富、体验更好,不过开放式格式难以标准化,需配套评估标准和双人面试来校准。

4月21日周二
  1. Together AI 研究与产品博客(RSS)31

    面向 AI 原生团队的多租户 GPU 集群设计指南:如何做到容量共享而不冲突

    面向 AI 原生团队的多租户 GPU 集群设计需同时满足池化容量、租户隔离与自助访问三项要求,避免为每个团队单独建集群导致 GPU 夜间和周末闲置。架构上采用共享层加租户层的两层模式,共享层由集中控制面管理高性能存储与 InfiniBand/Ethernet 网络,租户层为每个团队提供专属 GPU 节点、存储 PVC 及自选编排层(Kubernetes、Slurm 等)。

4月18日周六
4月17日周五
4月4日周六
3月31日周二
3月22日周日