跳到正文
热点事件持续更新

Harvey LAB-AA v1.1 加入幻觉检验

3 篇报道3 个报道来源1 小时前更新

先了解这件事

AI 综述

Artificial Analysis 联合 Harvey 发布 Harvey LAB-AA v1.1,为法律智能体基准 LAB 的评分方法加入幻觉检验:正确回答不得含重大错误陈述,并新增头条指标“幻觉门控全通过率”,只有交付物满足全部评分标准且无重大幻觉,任务才计入通过。据 Artificial Analysis 称,轻微幻觉单独报告,不影响该头条分数。 据 Artificial Analysis 称,Grok 4.7 (xhigh) 以 9.4% 的幻觉门控全通率位列第一;其称在发布时测试的模型中,超过 60% 原本通过的结果含有一处重大幻觉。该机构称这是改进 Harvey LAB-AA 方法的第一步,未来将与 Harvey 合作纳入风格、语气等律师看重的可用性因素。

AI 根据报道生成 · 33 分钟前更新

最新进展10月9日 03:18
Harvey LAB 新增幻觉检查更新

事件进展

2 个进展

  1. 10月9日 02:54 · 1 篇报道
    Grok 4.7在Harvey LAB-AA v1.1法律基准中排名第一
    Elon Musk:Grok 4.7 法律任务排名第一
  2. 10月9日 02:33 · 2 篇报道
    Artificial Analysis发布Harvey LAB-AA v1.1评测方法
    Artificial Analysis:Harvey LAB-AA v1.1 法律智能体评测新增幻觉检验

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. Sherwin Wu
    Harvey LAB 新增幻觉检查更新

    很高兴看到 LAB 的这个更新版本!最初的 LAB 结果让我们摸不着头脑。 Astra 在最低幻觉率上与最优模型并列——这在法律实务中尤为重要。

  2. Elon Musk
    Grok 4.7 法律任务排名第一

    Grok 4.7 在法律事务中排名第一

  3. Artificial Analysis
    Harvey LAB-AA v1.1 法律智能体评测新增幻觉检验

    Artificial Analysis 联合 Harvey 发布 Harvey LAB-AA v1.1,为法律智能体基准(LAB)加入幻觉检验,新指标"幻觉门控全通过率"要求交付物满足全部评分标准且无重大幻觉。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。