TensorZero 用 tree-sitter 和树编辑距离从每次 Git commit 自动评估 Cursor 推理效果
TensorZero 团队发布开源方法,在每次 Git commit 时自动为 Cursor 的 LLM 推理计算反馈奖励。
TensorZero 团队发布开源方法,在每次 Git commit 时自动为 Cursor 的 LLM 推理计算反馈奖励。
TensorZero 完成 730 万美元种子轮融资,用于构建面向工业级 LLM 应用的开源基础设施。其 11.5K 星开源栈统一了 LLM 网关、可观测性、优化、评估与实验五大组件,可增量采用并形成数据与学习飞轮。该平台已在前沿 AI 初创公司和一家欧洲大型银行落地,并曾登上 GitHub 全球周趋势榜第一。
TensorZero 推出基于 Track-and-Stop 最佳臂识别的多臂老虎机算法,在 LLM 网关中实现自适应 A/B 实验,动态调整采样比例并用 anytime-valid 的 GLRT 停止规则避免 p-hacking。
推荐理由:文章用仿真和真实 NER 实验数据说明自适应实验相比均匀采样能减少约 37% 的判定时间,并给出可直接复用的配置方法。
TensorZero 指出每百万 token 单价($/MTok)不能反映 LLM API 真实成本,因为各家 tokenizer 对相同输入产生不同 token 数。
推荐理由:原文用实测数据说明 token 计数差异会让实际成本偏离标价,读者可据此修正自己比较模型价格的方法。
TensorZero 发文指出,输出级相关性低的噪声 LLM 评估器在离线 Agent 选型中仍然可靠,因为单输出噪声会随样本量平均消去。
RadixArk SGLang 团队与 Ant Ling Infra 团队在 4 张 NVIDIA Blackwell GPU 上为混合线性注意力 MoE 模型 Ling-3.0-flash 优化 batch-1 解码,NEXTN/MTP 路径将单请求吞吐从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。
千问(Qwen)团队开源 Qwen3.8-Flash-Next,一个多模态 MoE 模型,被视为 Qwen4 架构的早期预览。模型总参数 125B 加 51B N-gram Embedding,每 token 激活 6B,48 层中含 36 层 GDN 线性注意力和 12 层 QSA 稀疏注意力,MoE 使用 512 专家 top-10 路由。
推荐理由:原文给出该模型混合架构细节和 SGLang 的 day-0 推理支持数据,读者可以据此评估长上下文部署的实际收益。
SGLang Diffusion 团队发布 MiniMax-H3 视频生成基准,在 8× NVIDIA H200(141 GB)、SGLang v0.5.18。
LMSYS 团队(2026年8月28日)发布 Infer-forge 构建方法论,这是一套围绕 SGLang 独立开发的内部智能体工程系统,包含 MonoRepo 共享工作区、Harness 执行底座、Task Loop 与 Task Graph 三层累积结构,目前未开源。
LMSYS 的 SGLang 团队发布 SSD Expert Pack 路径,把装不进 VRAM 和内存的 MoE 路由专家放在 NVMe SSD 上,只加载 router 选中的专家,用 Expert Pack 布局、direct I/O、pinned 缓冲和 GPU 缓存把 SSD 容量变成可用的存储层。
推荐理由:原文给出在单张消费级 GPU 上运行超大 MoE 模型的完整方案和实测数据,读者可以评估这条 SSD 专家卸载路径是否适合自己的本地部署。
SGLang 和 Miles 团队发布对 DeepSeek-V4.1 的 Day-0 支持,解析其低比率压缩、滑动窗口注意力(SWA)、流形超连接(mHC)和 Engram 记忆等架构对推理栈的影响。
推荐理由:原文拆解了 DeepSeek-V4.1 新架构对推理栈的影响,并给出 SGLang 与 Miles 的 Day-0 支持方案和实测数字。
SGLang、Qwen 和 NVIDIA 团队在 SGLang 中实现了 NVFP4 KV cache,将 K/V 以 4 位 NVFP4 格式存储并在 decode 阶段于注意力 kernel 内即时反量化到 FP8。
SGLang 团队介绍用 /v1/score 接口为 JEV 类决策模型做标签打分,调用方通过 label_token_ids 显式指定标签,无需依赖生成结果的 top-k logprobs。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpot 草稿模型权重,通过投机解码在不改变输出质量的前提下大幅提升解码速度,草稿模型约为 3 亿参数。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,以约 280M 参数(增加 8.9% 内存占用)换取更快解码,GPU 解码吞吐最高提升 2.66 倍、边缘设备最高 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍。
来源显示 Qwen3.5 35B-A3B 这一模型标识,正文仅包含一段 API 返回的 JSON 示例,其中 model 字段为空,usage 记录 completion_tokens 145、prompt_tokens 38、total_tokens 183。原文未提供该模型的参数、benchmark 或可用性等更多信息。
智谱 GLM 5 出现在 Baseten Base Labs 的模型研究页面中,原始标题仅给出模型名,正文为一段 chat.completion 格式的 API 返回示例,包含 38 个 prompt_tokens、145 个 completion_tokens、共 183 个 total_tokens,模型字段为空。
Baseten Base Labs 模型研究页面列出 Llama 3.3 70B Instruct,正文仅给出一段 chat.completion 格式的 API 返回示例,其中 model 字段为空,completion_tokens 为 145、prompt_tokens 为 38、total_tokens 为 183。
Baseten 的部署(deployment)是模型在平台上运行的一个版本,拥有独立 API endpoint,每次 baseten model push 都会创建一个部署,同一模型可同时运行多个部署以便在不影响生产流量的情况下测试新版本。
Fireworks Research 发布专用模型 Ember-1,基于 Kimi K3 训练,在保持质量的同时减少约 35–50% 推理 token。团队做了 50 多次训练实验和 200 多次评估,在 Terminal Bench 2.1、SWE-bench Verified 等 7 个基准和两家客户生产流量的 A/B 测试中质量持平,每任务 token 约省 35%。
推荐理由:原文给出多组基准和生产 A/B 数据,读者可以据此评估用更低 token 成本跑 Kimi K3 级质量的可行路径。
Fireworks 发布 ARCv3 权重更新压缩器,在 1000 个生产 RL 权重更新 delta 上,BF16 权重载荷比 ARCv2 缩小近 50%,平均 delta 约为原始 BF16 权重的 0.19%,低于 ARCv2 的 0.36%,且可无损还原训练器的精确 BF16 权重。
Fireworks 推出 GLOBAL 多区域部署选项,让单一部署身份和端点跨区域调度 GPU 容量,避免将工作负载钉在单一区域造成容量上限。其调度不进入请求路径,由 DNS 就近选择健康网关并按预生成路由记录转发,支持 GLOBAL、US、EUROPE、APAC、CANADA 范围。七天生产观测显示,可全球部署客户部署的请求成功率从单区域的 99.269% 升至多区域的 99.992%。
Fireworks AI 推出 FireRouter with Opus,在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间按每轮任务做缓存感知路由,首次可作为独立 serverless 端点供任意 Fireworks 账号调用。
推荐理由:厂商给出内部 A/B 测试的成本与准确率数据,读者可以据此评估缓存感知路由在编码工作流中的省费空间。
NVIDIA 用机密计算(CC)在 Blackwell GPU 上跑生产级 LLM 推理,TensorRT LLM 通过 CC 感知优化把吞吐保留在基线的 96.1%–98.2%,平均 TPOT 开销仅 1.2%–4.3%。测试基于单台 DGX B200(8 张 B200)、DeepSeek-R1-0528-NVFP4、32K 输入/1K 输出、TP=8,并发 1–16。
NVIDIA 联合 SGLang 团队推出 SWE-Serve 基准,从 83 个已合并的 SGLang pull request 中构建 53 个可执行任务,用于评估智能体对推理服务软件仓库级改动的真实效果。
Cursor 宣布 Firetiger 团队加入 Cursor。Firetiger 由 Rustam Lalkaka 和 Achille Roussel 于 2024 年创立,构建的智能体可在软件上线后监控发布、发现回归、调查事件并将发现反馈给编程智能体。
Cursor 工程师 Vicent Martí 撰文介绍其 Git 存储系统 Continuity:以 S3 中兼容对象存储的预写日志(WAL)作为唯一事实来源,本地副本为 NVMe 上的普通 Git 仓库,通过 S3 CAS 与 UDP gossip 实现乐观复制,无需路由表和共识选举,所有 push 线性化且完全持久化前不确认。
Cursor 发布云端智能体自托管机器功能,工具执行可迁移到团队自管的基础设施,智能体循环、推理和规划仍留在 Cursor 云端。
推荐理由:原文给出了自托管机器的适用场景、worker 机制和沙箱合作生态,读者可以据此判断是否把智能体执行迁回自有环境。
Cursor 推出两款软件开发 Bots,Rollouts 全程监控变更从 PR 到生产环境、自动标记回归并支持回滚,Security Reviewer 在每个 PR 上像安全工程师一样审查代码并支持一键修复。
推荐理由:原文来自官方,详细说明了两个 bot 的工作机制和适用场景,读者可对照自身部署与安全审查流程评估可用性。
Cursor 团队发布文章,介绍过去几个月为提升长时间智能体运行的 token 效率所做的 harness 改动,整体将用户 token 成本降低 7% 且智能体质量未下降。
推荐理由:Cursor 团队逐项拆解了降低智能体 token 成本的 harness 改动,给出系统提示精简、动态工具加载与缓存断点等可借鉴的做法。
Cognition 研究员 Eric Lu 带领多个 Devin 会话构建了目前性能最高的 GPU lattice siever,用修改版 CADO-NFS 在约 4,900 GPU 天、约 $400k 的成本上完成 RSA-260 分解,创下公开解决的 RSA Factoring Challenge 最大规模纪录,超过 2020 年 2 月的 RSA-250。
推荐理由:原文详细披露 GPU 格子筛实现、成本估算和人机分工,读者可以了解 Agent 驱动大型科研工程的实际工作流。
Cognition 在 Devin Desktop 和 CLI 中开放 Fusion,一个由前沿模型主导规划审查、高性价比模型执行编码的双智能体 harness,官方称在主要编码基准上最高节省 39% 成本。
推荐理由:原文给出双智能体架构、实测成本数据与模型配对调优经验,读者可据此理解按任务定价与多智能体分工的设计取舍。
Cloudflare 为 AI Gateway 的 User Insights 新增模型过度使用(Overkill)视图,可识别所选模型能力超出任务需求的情况,并展示关联用户、智能体与应用。
Cloudflare Registrar 推出全新域名搜索,支持全部 420+ 扩展、即时响应、排序过滤和透明定价,并在 Birthday Week 对 .io、.dev、.app、.tech 等提供首年注册折扣。
Cloudflare 为 Workers 推出内置错误监控功能 Issues,现处开放测试阶段。无需额外 SDK,一行配置即可自动归组重复异常、5xx 响应和错误日志。
Cloudflare 发布 Auto Router 公测,通过 AI Gateway 使用,将模型设为 cloudflare/auto 即可自动把每个请求路由到能力足够的最便宜模型。
Baseten 发布训练 SDK Loops(早期访问),支持 256K+ 序列长度、2T+ 参数模型训练与异步 RL,训练完成后一条命令即可部署到 Baseten 推理栈。
Baseten 发布 Model APIs,在 Baseten Inference Stack 上按需运行 DeepSeek V4.1 Flash、DeepSeek V4 Pro 0813、Kimi K3、GLM-5.3 系列及 NVIDIA Nemotron 3 Ultra 等前沿开源模型。
Baseten 推出 Dedicated Inference 专用推理部署,基于 Baseten Inference Stack 支持跨云自动扩缩容,官方称可实现 6 倍 GPU 利用率提升和 5-10 倍成本降低。
Baseten 是一个模型推理与训练平台,提供兼容 OpenAI 的 API 调用托管模型,也支持在专属基础设施上部署自有模型或训练模型并部署生成的 checkpoint。