STEPGATE:小模型智能体步骤级接管框架
热点事件持续更新
STEPGATE:小模型智能体步骤级接管框架
1 篇报道1 个报道来源5 小时前更新
先了解这件事
AI 综述
Abolfazl Younesi 提出并评测了 STEPGATE——一种不确定性感知的步骤级接管框架:本地小语言模型(SLM)对每一步动作打分,只把困难步骤升级给更强的云端模型。在 52 项 BFCL 单步测试中,Qwen2.5-1.5B/7B 组合以 30.8% 升级率取得 82.7% 任务成功率,高于纯本地的 67.3% 和随机升级的 75.4%(后者升级率 33.8%)。 另一项多轮评测中,STEPGATE 仅用 30.0% 云端动作即达 69.0% 轨迹成功率和 84.0% 动作成功率,对比纯本地 48.0%/70.5%、随机升级 60.0%/78.2%、查询级路由 57.0%/77.1%;纯强模型 100% 云端动作时为 82.0% 轨迹成功率。 作者称评测仅限于单一模型族、单一更强后端和脚本化任务,测试集规模小,多轮比较依赖配对区间与统计检验,其风险分级也只是研究标注,不构成正式安全保证。
AI 根据报道生成 · 57 分钟前更新
最新进展10月7日 12:00
STEPGATE:面向小语言模型智能体的不确定性感知步骤级云端接管报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- arXiv:cs.LGSTEPGATE:面向小语言模型智能体的不确定性感知步骤级云端接管
STEPGATE 是一种不确定性感知的步骤级接管框架,对本地 SLM 每一步动作打分并选择性升级到更强模型。在 52 项 BFCL 单步测试中,Qwen2.5-1.5B/7B 组合以 30.8% 升级率取得 82.7% 任务成功率,高于纯本地的 67.3% 和随机升级的 75.4%。多轮评测中仅用 30.0% 云端动作即达 69.0% 轨迹成功率,但研究仅限单一模型族与脚本化任务。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。