跳到正文

全部动态

今日 46 条
今天10月1日周四
  1. Google AI:DEV 作者专属(RSS)73

    工程师复盘十个月围绕 Claude Code 搭建守护框架的经验与教训

    一位工程师复盘十个月为 Claude Code 逐步搭建 hooks、门禁和守护框架的经历,核心结论是“仪表会撒谎”,提示词只是请求,真正有效的是代码边界。

    推荐理由:作者用十个月的真实失败数据说明提示词为何挡不住模型,并给出可复用的 Claude Code hooks 种子。

  2. NVIDIA AI33

    你的智能体得到了正确答案。它花了多少功夫才走到那一步? 我们与 @NousResearch/@Teknium 合作,带来一篇 NVIDIA NeMo Relay 的实操演练,为 Hermes Agent 收集追踪数据。运行两个示例场景,跟随智能体的调用与重试,并在 Arize Phoenix 中查看完整追踪。 博客还探讨了 Nous 如何利用追踪和任务结果,在重复运行中评估修复效果。 TechBlog: https://nvda.ws/47tKxjQ 📽️ 来自我们自家的 @Picomoorhead:

9月30日周三
  1. Anthropic:Transformer Circuits(可解释性研究)46

    Anthropic 详解可解释性工具 Garçon:面向大模型的基础设施

    Anthropic 公开其可解释性研究基础设施 Garçon,用于在超出单节点规模的大模型上做机制可解释性实验。用户可通过 `python -m garcon.launch` 启动服务器并连接模型,借助 probe points 与 probe 函数在任意层读取、修改或消融内部激活,并支持前向与反向传播。服务器按连接保存数据,空闲 1 小时后自动关闭。

  2. Anthropic:Transformer Circuits(可解释性研究)39

    Anthropic 可解释性研究:逆向工程 Transformer 的参数级练习

    Anthropic 的 Transformer Circuits 团队发布了一组练习,用于理解神经网络如何在参数层面实现算法,作为其逆向工程 Transformer 数学框架的补充材料。练习要求手动写出注意力头的 W_Q、W_K、W_V、W_out 权重矩阵,涵盖虚拟注意力头、归纳头(指针算术版与前一 token K-Composition 版)等实现,并附有解答。

  3. TensorZero:实验与工程博客32

    某大型银行如何用 LLM 与 TensorZero 自动化代码变更日志

    欧洲一家大型银行的 DevOps 工程师 Mark 借助开源平台 TensorZero 构建变更日志自动化系统,接入 GitLab merge request 与 CI/CD 流程,并用 Ollama 实现全自托管部署,数据不出内网。系统利用内置的动态上下文学习(DICL),将工程师对 AI 生成日志的修改自动用于优化后续推理,无需微调或标注数据集。

  4. TensorZero:实验与工程博客42

    从 NER 到智能体:自动化提示词工程能否扩展到复杂任务?

    TensorZero 团队测试了 MIPRO 自动化提示词优化方法在从命名实体识别(CoNLL++)、多跳检索(HoVer)到文本游戏导航(BabyAI)和智能体工具调用客服(τ-bench)等任务上的表现,探究其随任务复杂度提升的效果变化。MIPRO 通过贝叶斯优化器搜索指令与少样本示例,无需梯度或细粒度标签,团队用约 200 行代码重实现独立版本,指令生成使用 OpenAI 的 o1 模型。

  5. Suno:Blog(网页)17

    Suno 呼吁创作者发布作品:为什么该按下发布键

    Suno 产品经理 Katelynn Kyker 发文呼吁创作者把作品从私人曲库中发布出来,让平台上数百万听众听到。文章给出三个理由:触达数百万听众、通过真实听众反馈了解作品共鸣点、开放作品供社区 remix 并激发他人。作者强调发布不必等到作品完美,早期且持续发布的创作者成长最快。

  6. LMSYS:Blog(Chatbot Arena 团队)45

    SGLang 流水线并行(PP)实现:面向百万级 Token 上下文与超长序列推理

    SGLang 推出高度优化的流水线并行(PP)实现,结合分块流水线并行、异步 P2P 通信与动态分块机制,专攻超长上下文推理。在 H20 集群上以 PP4 TP8 部署 DeepSeek-V3.1,分块预填充设为 12K 时预填充吞吐达 TP8 的 3.31 倍,比 TP32 方案高 30.5%,TTFT 最多降低 67.9%,强扩展效率 82.8%。

  7. LMSYS:Blog(Chatbot Arena 团队)44

    SGLang 集成 Elastic EP:为 DeepSeek MoE 部署实现部分故障容错

    SGLang 框架集成 Elastic EP,通过解耦专家与 GPU 的固定映射实现部分故障容错,DeepSeek V3.2 在 32 GPU、256 冗余专家配置下服务中断控制在 10 秒内,较完整重启的 2-3 分钟减少 90%。该方案静态性能与标准 DeepEP 持平,系统吞吐 3560.21 tokens/sec,由 Mooncake EP 提供容错通信层支持。

  8. LMSYS:Blog(Chatbot Arena 团队)46

    HiSparse:用分层内存为稀疏注意力提速,GLM-5.1-FP8 长上下文吞吐最高提升 5 倍

    LMSYS 团队提出 HiSparse 分层内存系统,将不活跃的 KV cache 卸载到主机内存、在 GPU HBM 保留热缓冲区,缓解稀疏注意力的显存容量瓶颈。在 GLM-5.1-FP8 上,8×H200 部署下 256 并发请求吞吐达基线 3 倍以上,长上下文场景最高提升 5 倍。目前支持 DeepSeek-V3.2 与 GLM-5.1 等采用 DSA 的模型,属实验性功能。