跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

129条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 121–129 条 · 共 129 条
1月21日周三
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)76

    Anthropic 工程师复盘如何设计抗 AI 的技术评测

    Anthropic 性能优化团队负责人 Tristan Hume 复盘其招聘用 take-home 测试被 Claude 模型逐步击穿的过程:超 1000 名候选人完成过该模拟加速器优化测试,Claude Opus 4 在相同时间内超过多数人类申请者,Claude Opus 4.5 在 2 小时内追平最佳人类成绩。

    推荐理由:作者以一手迭代经验说明模型如何逐步击穿技术面试题,并给出设计抗 AI 评测的具体做法与开源挑战。

11月11日周二
  1. TensorZero:实验与工程博客66

    TensorZero 在 LLM 网关中引入多臂老虎机自适应 A/B 实验

    TensorZero 推出基于 Track-and-Stop 最佳臂识别的多臂老虎机算法,在 LLM 网关中实现自适应 A/B 实验,动态调整采样比例并用 anytime-valid 的 GLRT 停止规则避免 p-hacking。

    推荐理由:文章用仿真和真实 NER 实验数据说明自适应实验相比均匀采样能减少约 37% 的判定时间,并给出可直接复用的配置方法。

10月20日周一
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)76

    Anthropic 为 Claude Code 推出沙箱功能并开源沙箱运行时

    Anthropic 在 Claude Code 中推出基于沙箱的两项新功能:沙箱化 bash 工具(beta 研究预览,可通过 /sandbox 启用并已开源)和 Claude Code on the web。

    推荐理由:官方解释了沙箱如何用文件系统和网络双重隔离减少权限弹窗,内测减少 84%,并说明开源实现供其他 Agent 团队参考。

10月1日周三
  1. Answer.AI 官方研发博客(RSS)65

    Answer.AI 开源 cachy:缓存 LLM 响应让 notebook 测试提速 60 倍

    Answer.AI 开源 cachy 包,通过修改 httpx 的 send 方法把 LLM 响应缓存到本地文件,无需手写 mock。测试运行从 2 分钟缩短到约 2 秒,并让 CI/CD 测试和 notebook diff 更干净。

    推荐理由:开源工具 cachy 通过拦截 httpx 缓存 LLM 响应,测试从 2 分钟降到约 2 秒,方法可直接迁移到自己的项目。

9月29日周一
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)76

    Anthropic 工程博客详解 AI 智能体的有效上下文工程方法

    Anthropic 应用 AI 团队发文阐述上下文工程,定义为在 LLM 推理过程中筛选和维护最优 token 集合的策略,将其视为提示工程的自然演进。文章指出所有模型都存在 context rot 现象,上下文应被当作边际收益递减的有限资源。

    推荐理由:Anthropic 提出上下文工程是提示工程的演进,并给出压缩、结构化笔记、子智能体三种应对长任务的具体方法,可直接迁移到智能体开发。

9月10日周三
  1. Thinking Machines Lab:官方博客(RSS)66

    Thinking Machines Lab 解析 LLM 推理非确定性的真正成因并发布批不变 kernel

    Thinking Machines Lab 的 Horace He 发文指出,LLM 推理非确定性的主因不是并发加浮点误差,而是服务器负载变化导致 batch size 变化,使非批不变的 kernel 输出随批次改变。

    推荐理由:原文指出 LLM 推理不确定性的真正根源是批大小变化而非并发原子加,并给出可复现的批不变 kernel 方案。

7月23日周三
5月7日周三
3月7日周五