Baseten 工程博客(网页)·· 14 小时前AI 评分18
Baseten Inference Runtime:可配置的模型推理运行时
Model Runtimes
AI 导读
Baseten 推出 Inference Runtime,将 TensorRT、SGLang、vLLM、TGI、TEI 等开源推理框架与自研优化整合进单一可配置运行时,宣称可在数分钟内完成配置。该运行时原生支持 Medusa、Eagle 等投机解码技术,并通过 KV cache 卸载与缓存感知路由、prefill 优先调度、TP 与 EP 混合并行等手段降低延迟。
来源:Baseten 工程博客(网页) · baseten.co