跳到正文
原文
Together AI 研究与产品博客(RSS)·· 2026-05-04AI 评分34

Together AI 如何用基础研究支撑大规模高效推理

Foundational research powering efficient inference at scale

AI 导读

Together AI 提出以研究、系统工程与硬件优化叠加的方式降低大规模推理成本,其 FlashAttention、ThunderKittens 与开源自适应推测解码系统 Aurora 可实现最高 1.25x 的 LLM 推理加速。

来源:Together AI 研究与产品博客(RSS) · together.ai