跳到正文
热点事件持续更新

TypedBench:类型化决策模型基准发布

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Rahul Sharma 等作者发布 TypedBench,一个面向 Jev 等类型化决策模型的评测基准,由 7 个策略标注生成器和 9 个评测套件构成,考察策略遵循、表述鲁棒性、概率质量与决策成本。 评测覆盖一个托管模型、一个开源编码器以及 0.8B–9B 参数的开源解码器。结果显示:托管模型能遵循策略,但表述敏感且系统性欠自信,在非对称成本下直接取最高答案反而优于使用其概率;开源解码器路由精确,但选项或问题增多时变慢,且在策略问题上准确率最低。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.AI
    TypedBench:面向 System One 决策模型的校准、表述敏感性与成本基准

    TypedBench 是面向 Jev 等类型化决策模型的基准,基于 7 个策略标注生成器和 9 个评测套件构建,同时考察策略遵循、表述鲁棒性、概率质量与决策成本。评测覆盖一个托管模型、一个开源编码器及 0.8B-9B 参数的开源解码器:托管模型遵循策略但表述敏感且系统性欠自信,在非对称成本下用其概率反而不如直接取最高答案。解码器路由精确,但随选项或问题增多而变慢,在策略问题上准确率最低。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。