LMSYS:Blog(Chatbot Arena 团队)·· 13 小时前AI 评分39
Miles 团队详解智能体 RL 中的 Token-In-Token-Out(TITO)原则
Blog No Token Left Behind: Demystifying Token-In-Token-Out in Miles In agentic RL, a rollout is not a single generation. It is a chain of model calls, tool outputs, harness messages, and resumed generations. Token-In-Token-Out (TITO) is a design principle that address... Miles Team: Jiajun Li, Yuzhen Zhou, Shi Dong, Yanbin Jiang, Mao Cheng, Yusheng Su, Yueming Yuan, Zhichen Zeng, Banghua Zhu June 5, 2026
AI 导读
Miles 团队提出 Token-In-Token-Out(TITO)原则,要求智能体 RL 中每一轮的总 token 序列(prompt + response)必须是下一轮 prompt token 序列的逐位完美前缀,以保证训练与推理一致。
来源:LMSYS:Blog(Chatbot Arena 团队) · lmsys.org