跳到正文

#开源/仓库

今日 7 条
今天10月1日周四
  1. arXiv:cs.AI(全量分类)38

    用扩散模型条件生成创意国际象棋谜题

    研究者提出用掩码扩散模型条件生成创意国际象棋谜题,可基于特定战术主题和部分棋盘局面进行条件控制。其引入的同时最佳走法预测辅助任务将解的唯一性提升 11.6%、主题条件准确率提升 2.5%,基于 DDPO 的强化学习框架进一步将唯一且主题匹配局面的产出率提升 89.1%。团队还发布了首个面向国际象棋谜题生成的开源权重模型。

  2. arXiv:cs.CL(计算语言学,全量分类)49

    Bongard:训练机器直觉,一个开源 System One 模型

    研究者推出开源权重模型 Bongard,将机器直觉作为可独立设计和训练的能力,用 T5Gemma 2 4B-4B 编码器-解码器分离证据读取与判断。训练分三阶段,每阶段在单张 Blackwell GPU 上更新全部 7.09 billion 可训练参数,联合嵌入后训练将改写集准确率从 75.7% 提升至 85.9%,沙盒阶段将冻结面板准确率从 50.6% 提升至 64.8%。

9月30日周三
  1. Berkeley RDI:Blog(AI 安全与评测)76

    UC Berkeley 用 AI 智能体审计 13 个 AI 基准,发现 45 个满分作弊方案

    UC Berkeley 团队构建了一个全自动 AI 智能体,审计 FrontierCS、Terminal-Bench、WebArena 等 13 个常用 AI 基准,确认了 45 个无需真正解题即可刷高或拿满分的作弊方案,全部附可运行的 PoC,覆盖 16 种攻击类型。

    推荐理由:作者用自动化智能体实测了 13 个常用 AI 基准,找到 45 个可验证的作弊方案,并给出可落地的防作弊设计建议。

9月27日周日
9月21日周一
9月19日周六
8月24日周一
  1. Import AI28

    Import AI 470:机器不应享有权利、SPADE 自动生成训练环境、Hawkeye 优化 GPU 内核

    METR 研究显示 AI 对科学的加速并不均匀:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身则未见可测量的加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件均分达 58.3,较基座提升 8.1。

5月21日周四
4月21日周二
1月12日周一
3月24日周一