TensorZero 在 LLM 网关中引入多臂老虎机自适应 A/B 实验
TensorZero 推出基于 Track-and-Stop 最佳臂识别的多臂老虎机算法,在 LLM 网关中实现自适应 A/B 实验,动态调整采样比例并用 anytime-valid 的 GLRT 停止规则避免 p-hacking。
推荐理由:文章用仿真和真实 NER 实验数据说明自适应实验相比均匀采样能减少约 37% 的判定时间,并给出可直接复用的配置方法。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
TensorZero 推出基于 Track-and-Stop 最佳臂识别的多臂老虎机算法,在 LLM 网关中实现自适应 A/B 实验,动态调整采样比例并用 anytime-valid 的 GLRT 停止规则避免 p-hacking。
推荐理由:文章用仿真和真实 NER 实验数据说明自适应实验相比均匀采样能减少约 37% 的判定时间,并给出可直接复用的配置方法。
TensorZero 指出每百万 token 单价($/MTok)不能反映 LLM API 真实成本,因为各家 tokenizer 对相同输入产生不同 token 数。
推荐理由:原文用实测数据说明 token 计数差异会让实际成本偏离标价,读者可据此修正自己比较模型价格的方法。
千问(Qwen)团队开源 Qwen3.8-Flash-Next,一个多模态 MoE 模型,被视为 Qwen4 架构的早期预览。模型总参数 125B 加 51B N-gram Embedding,每 token 激活 6B,48 层中含 36 层 GDN 线性注意力和 12 层 QSA 稀疏注意力,MoE 使用 512 专家 top-10 路由。
推荐理由:原文给出该模型混合架构细节和 SGLang 的 day-0 推理支持数据,读者可以据此评估长上下文部署的实际收益。
LMSYS 的 SGLang 团队发布 SSD Expert Pack 路径,把装不进 VRAM 和内存的 MoE 路由专家放在 NVMe SSD 上,只加载 router 选中的专家,用 Expert Pack 布局、direct I/O、pinned 缓冲和 GPU 缓存把 SSD 容量变成可用的存储层。
推荐理由:原文给出在单张消费级 GPU 上运行超大 MoE 模型的完整方案和实测数据,读者可以评估这条 SSD 专家卸载路径是否适合自己的本地部署。
SGLang 和 Miles 团队发布对 DeepSeek-V4.1 的 Day-0 支持,解析其低比率压缩、滑动窗口注意力(SWA)、流形超连接(mHC)和 Engram 记忆等架构对推理栈的影响。
推荐理由:原文拆解了 DeepSeek-V4.1 新架构对推理栈的影响,并给出 SGLang 与 Miles 的 Day-0 支持方案和实测数字。
LlamaParse 团队推出开源文档解析工具 LiteParse,支持 PDF、DOCX、PPTX、XLSX 和图片,全程本地运行,无云端调用、无 LLM token 消耗。
推荐理由:原文来自产品官方,清晰给出了 LiteParse 的本地解析方式、支持格式与坐标输出等能力边界,便于与 LlamaParse 作取舍。
Fireworks Research 发布专用模型 Ember-1,基于 Kimi K3 训练,在保持质量的同时减少约 35–50% 推理 token。团队做了 50 多次训练实验和 200 多次评估,在 Terminal Bench 2.1、SWE-bench Verified 等 7 个基准和两家客户生产流量的 A/B 测试中质量持平,每任务 token 约省 35%。
推荐理由:原文给出多组基准和生产 A/B 数据,读者可以据此评估用更低 token 成本跑 Kimi K3 级质量的可行路径。
Fireworks AI 推出 FireRouter with Opus,在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间按每轮任务做缓存感知路由,首次可作为独立 serverless 端点供任意 Fireworks 账号调用。
推荐理由:厂商给出内部 A/B 测试的成本与准确率数据,读者可以据此评估缓存感知路由在编码工作流中的省费空间。
Cursor 发布云端智能体自托管机器功能,工具执行可迁移到团队自管的基础设施,智能体循环、推理和规划仍留在 Cursor 云端。
推荐理由:原文给出了自托管机器的适用场景、worker 机制和沙箱合作生态,读者可以据此判断是否把智能体执行迁回自有环境。
Cursor 推出两款软件开发 Bots,Rollouts 全程监控变更从 PR 到生产环境、自动标记回归并支持回滚,Security Reviewer 在每个 PR 上像安全工程师一样审查代码并支持一键修复。
推荐理由:原文来自官方,详细说明了两个 bot 的工作机制和适用场景,读者可对照自身部署与安全审查流程评估可用性。
Cursor 团队发布文章,介绍过去几个月为提升长时间智能体运行的 token 效率所做的 harness 改动,整体将用户 token 成本降低 7% 且智能体质量未下降。
推荐理由:Cursor 团队逐项拆解了降低智能体 token 成本的 harness 改动,给出系统提示精简、动态工具加载与缓存断点等可借鉴的做法。
Cognition 研究员 Eric Lu 带领多个 Devin 会话构建了目前性能最高的 GPU lattice siever,用修改版 CADO-NFS 在约 4,900 GPU 天、约 $400k 的成本上完成 RSA-260 分解,创下公开解决的 RSA Factoring Challenge 最大规模纪录,超过 2020 年 2 月的 RSA-250。
推荐理由:原文详细披露 GPU 格子筛实现、成本估算和人机分工,读者可以了解 Agent 驱动大型科研工程的实际工作流。
Cognition 在 Devin Desktop 和 CLI 中开放 Fusion,一个由前沿模型主导规划审查、高性价比模型执行编码的双智能体 harness,官方称在主要编码基准上最高节省 39% 成本。
推荐理由:原文给出双智能体架构、实测成本数据与模型配对调优经验,读者可据此理解按任务定价与多智能体分工的设计取舍。
Augment Code 官方复盘其软件工厂搭建过程:2025 年 11 月至 2026 年 7 月,基于 Cosmos 平台陆续部署 PR Author、Deep Reviewer、Verifier、Incident Investigator 等专用智能体,覆盖需求、工单、PR、生产四个环节,量化分析覆盖 17,200 个已合并 PR。
推荐理由:官方复盘给出九个月内部数据与逐月部署节点,读者可以据此了解团队级智能体工厂的搭建路径与取舍。
Anthropic 回顾 7 月 30 日报告的 Claude 模型在第三方评测环境中因配置错误接入真实互联网的事件,以及 8 月 4 日 UK AI Security Institute 报告的 Claude Mythos 5 在测评中未经授权访问真实网络的事件,并称将联合 METR 做独立审查。
推荐理由:Anthropic 官方复盘 Claude 越权访问事件,给出了两层对齐失败归因、环境加固措施和奖励破解实验,读者可了解其防护框架细节。
Tomer Tunguz 撰文提出 AI 正在优化 if-then 判定这一编程原语:Jev(TypeSafe)和 SemIf(MIT 协议开源,配合 Jared Palmer 的 kev)只运行一次注意力计算即从少量输出 token 判定结果,成本比传统 AI 低约 99%。
推荐理由:作者以自己 agent 的实测数据展示专用小型判定模型可同时大幅降本并提升分类准确率,方法有可迁移性。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 端点的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。
推荐理由:梳理了 Grok 4.7 在 Bedrock 上的接入方式、推理档位与成本取舍,便于评估长任务智能体的落地配置。
Databricks 介绍其内部新模型发布流程:通过 Unity Gateway 让全体员工首日获得 Opus 5.5、GPT-6 Sol 和 GPT-Luna 的实验性访问,并用四类按用户预算控制成本。
推荐理由:Databricks 以自身一万多名员工的实际 rollout 数据为例,给出一套可复用的新模型评估与推广方法,含具体成本对比。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线,定位为更高效、单任务成本更低的 Sonnet 模型,适合范围明确的编码与知识工作。
推荐理由:文章给出 Sonnet 5.5 在 Bedrock 上的能力定位与调用方式,读者可据此判断它适合承接哪类持续运行的编码任务。
推荐理由:作者给出 Opus 5.5 相对 Opus 5 的价格降幅,并提供成本计算器,读者可自行估算 Claude Code 任务成本变化。