Google AI:DEV 作者专属(RSS)· Throttle·· 4 小时前AI 评分53
租 A100 实测一个 vLLM 参数:max_num_seqs 从 1 调到 8 让每 token 成本降约 68%
I rented an A100 to test one vLLM flag
AI 导读
作者租用 A100 不到一小时,测试 vLLM 的 max_num_seqs 参数对每 token 成本的影响。在 Qwen2.5-0.5B、8 个并发请求、$1.39/hr 条件下,max_num_seqs 从 1 改为 8 后,每百万输出 token 成本从约 $0.746 降到约 $0.237,便宜约 68%。
来源:Google AI:DEV 作者专属(RSS) · dev.to