跳到正文
热点事件持续更新

APEX推测解码控制器论文提交arXiv

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Manvi Jha等作者向arXiv提交预印本,介绍APEX——一种学习型推测解码控制器,通过请求级专家选择与块级深度自适应,在解码速度与草稿token浪费之间取得平衡,并已集成进vLLM。 据论文,APEX用Qwen3-8B在六个工作负载上测试,最高实现5.24倍加速;聚合评测中APEX-S达4.27倍,APEX-B达3.27倍,且相比k=16固定n-gram投机,将浪费token占比相对降低41.0%。

AI 根据报道生成 · 1 小时前更新

最新进展10月7日 12:00
APEX:更聪明地推测,而非更深

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.LG
    APEX:更聪明地推测,而非更深

    APEX 是一种学习型控制器,通过请求级专家选择和块级深度自适应,在投机解码中平衡速度与草稿 token 浪费,并已集成进 vLLM。它用 Qwen3-8B 在六个工作负载上测试,最高实现 5.24X 加速;聚合评测中 APEX-S 达 4.27X,APEX-B 达 3.27X 且相比 k=16 固定 n-gram 投机将浪费 token 占比相对降低 41.0%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。