Harvey LAB-AA v1.1 加入幻觉检验
热点事件持续更新
Harvey LAB-AA v1.1 加入幻觉检验
3 篇报道3 个报道来源1 小时前更新
先了解这件事
AI 综述
Artificial Analysis 联合 Harvey 发布 Harvey LAB-AA v1.1,为法律智能体基准 LAB 的评分方法加入幻觉检验:正确回答不得含重大错误陈述,并新增头条指标“幻觉门控全通过率”,只有交付物满足全部评分标准且无重大幻觉,任务才计入通过。据 Artificial Analysis 称,轻微幻觉单独报告,不影响该头条分数。 据 Artificial Analysis 称,Grok 4.7 (xhigh) 以 9.4% 的幻觉门控全通率位列第一;其称在发布时测试的模型中,超过 60% 原本通过的结果含有一处重大幻觉。该机构称这是改进 Harvey LAB-AA 方法的第一步,未来将与 Harvey 合作纳入风格、语气等律师看重的可用性因素。
AI 根据报道生成 · 33 分钟前更新
最新进展10月9日 03:18
Harvey LAB 新增幻觉检查更新事件进展
2 个进展
- 10月9日 02:54 · 1 篇报道Grok 4.7在Harvey LAB-AA v1.1法律基准中排名第一Elon Musk:Grok 4.7 法律任务排名第一
- 10月9日 02:33 · 2 篇报道Artificial Analysis发布Harvey LAB-AA v1.1评测方法Artificial Analysis:Harvey LAB-AA v1.1 法律智能体评测新增幻觉检验
报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- Sherwin WuHarvey LAB 新增幻觉检查更新
很高兴看到 LAB 的这个更新版本!最初的 LAB 结果让我们摸不着头脑。 Astra 在最低幻觉率上与最优模型并列——这在法律实务中尤为重要。
- Artificial AnalysisHarvey LAB-AA v1.1 法律智能体评测新增幻觉检验
Artificial Analysis 联合 Harvey 发布 Harvey LAB-AA v1.1,为法律智能体基准(LAB)加入幻觉检验,新指标"幻觉门控全通过率"要求交付物满足全部评分标准且无重大幻觉。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。