跳到正文

#评测/基准

今日 2 条
3月23日周一
3月19日周四
3月17日周二
2月9日周一
  1. Baichuan AI49

    📊 SOTA 全面领先: HealthBench 65.1 / Hard 44.4 🥇 幻觉率 3.5%(低于 ChatGPT)🛡️✨ ScanBench 全站第一:74.9 / 72.1 / 74.4 🏆

    引用Baichuan AI@BaichuanAI

    Baichuan-M3 Technical Report is live. 🚀 Report:https://arxiv.org/abs/2602.06570 Models: https://hf.co/collections/baichuan-inc/baichuan-m3 Try: https://ying.ai Built for clinical decision support, not trivia QA, optimized on the real outpatient workflow: Inquiry → Lab Testing → Diagnosis 🧑⚕️→🔬→🧾

1月23日周五
8月13日周三
7月21日周一
6月5日周四
5月30日周五
4月9日周三
1月8日周三
  1. Answer.AI 官方研发博客(RSS)79

    Answer.AI 团队实测 Devin 一个月:20 个任务仅 3 个成功

    Answer.AI 团队对 Devin 进行一个月真实任务实测,20 个任务中 14 个失败、3 个无结论、仅 3 个成功,且无法预测哪些任务会成功。Devin 在处理现有代码库、研究类任务中常陷入技术死胡同或幻觉出不存在的功能,团队结论是其自主性反而成为负担,更倾向使用 Cursor 等由开发者主导的 AI 辅助工作流。

    推荐理由:作者团队用一个月、20 个真实任务实测 Devin,给出了成败分布和与 Cursor 类工作流的对比,可作为评估自主编码智能体的参照。