用扩散模型条件生成创意国际象棋谜题
研究者提出用掩码扩散模型条件生成创意国际象棋谜题,可基于特定战术主题和部分棋盘局面进行条件控制。其引入的同时最佳走法预测辅助任务将解的唯一性提升 11.6%、主题条件准确率提升 2.5%,基于 DDPO 的强化学习框架进一步将唯一且主题匹配局面的产出率提升 89.1%。团队还发布了首个面向国际象棋谜题生成的开源权重模型。
研究者提出用掩码扩散模型条件生成创意国际象棋谜题,可基于特定战术主题和部分棋盘局面进行条件控制。其引入的同时最佳走法预测辅助任务将解的唯一性提升 11.6%、主题条件准确率提升 2.5%,基于 DDPO 的强化学习框架进一步将唯一且主题匹配局面的产出率提升 89.1%。团队还发布了首个面向国际象棋谜题生成的开源权重模型。
SimTrace 通过基于真实用户轨迹与给定 Web 环境的 computer-use 客户端智能体,生成细粒度合成多模态点击流,为在线用户建模提供可共享的隐私安全替代数据。
研究者推出开源权重模型 Bongard,将机器直觉作为可独立设计和训练的能力,用 T5Gemma 2 4B-4B 编码器-解码器分离证据读取与判断。训练分三阶段,每阶段在单张 Blackwell GPU 上更新全部 7.09 billion 可训练参数,联合嵌入后训练将改写集准确率从 75.7% 提升至 85.9%,沙盒阶段将冻结面板准确率从 50.6% 提升至 64.8%。
GraphForge 是一个基于证据图的工作型智能体训练框架,从职业种子出发为每个种子组装真实文件工作区并构建证据图,任务描述与评分标准均由此图派生,使每条标准都锚定到可验证的文件。
Doc2LoRA 提出用 Doc-to-LoRA 超网络为每篇论文生成一个 LoRA 适配器,使空间中的每个点(包括混合点)都对应一个可用自然语言提问和指令的大语言模型。
PatchHolmes 用列表式选择让智能体一次性读取前 100 个候选 commit,再通过四个带预算的工具打开单个 commit,最终提交唯一答案,Recall@1 达 59.95%,高于逐点系统的 34.61% 和通用检索推理基线的 28.55%。
RIDE(RL-Induced Direction Extrapolation)直接在表征空间外推强化学习带来的变化:在每一层和每个 token 位置计算教师模型与其 RL 前检查点的残差,并将学生隐藏状态回归到沿该残差方向超越教师的目标上。
UC Berkeley 团队构建了一个全自动 AI 智能体,审计 FrontierCS、Terminal-Bench、WebArena 等 13 个常用 AI 基准,确认了 45 个无需真正解题即可刷高或拿满分的作弊方案,全部附可运行的 PoC,覆盖 16 种攻击类型。
推荐理由:作者用自动化智能体实测了 13 个常用 AI 基准,找到 45 个可验证的作弊方案,并给出可落地的防作弊设计建议。
Prime Intellect 推出 SYNTHETIC-1,基于 DeepSeek-R1 生成 140 万条覆盖数学、编程、软件工程、STEM 和合成代码理解的任务与验证器,目标是构建最大的开源验证推理数据集。
Prime Intellect 发布 SYNTHETIC-1,一个由全球算力贡献者协作生成、基于 DeepSeek-R1 的 200 万条推理轨迹开放数据集,覆盖数学、编码和科学任务,并用任务专属验证器确认正确性。
Prime Intellect 发布开源数据集 SYNTHETIC-2,包含 400 万条经过验证的推理轨迹,覆盖迄今最全面的复杂强化学习任务与验证器。数据由全球算力贡献者通过流水线并行分布式推理生成,3 天内共有 1,253 块 GPU 参与,涵盖 4090 到 H200。
Prime Intellect 发布系统化 reward hacking 研究,提出其本质是梯度动力学问题而非单纯的规格问题:在 Llama 3.2-1B-Instruct 上用 backdoor-ifeval 环境植入隐藏关键词奖励。
METR 公开 Example Task Suite,包含 31 个示例任务、覆盖 10 个任务族,另有 186 个任务的摘要信息,用于评测 AI 智能体的危险自主能力。
HuggingFace 上发布了一个用 Claude Opus 5.5 生成的覆盖 2194 种疾病的模拟医患对话数据集,平均每段 33 轮,从描述症状、检查聊到治疗和后续安排。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型用学习式集成策略融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 的排序预测。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流(middle-mile)配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 开放。
METR 研究显示 AI 对科学的加速并不均匀:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身则未见可测量的加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件均分达 58.3,较基座提升 8.1。
阿里巴巴在 GitHub 上线 EfficientRL,为 ICML 2026 论文《Long Live The Balance: Information Bottleneck Driven Tree-based Policy Optimization》的官方代码仓库。该工作以信息瓶颈驱动树式策略优化,具体参数与评测结果原文未披露。
Sierra 开源 μ-Bench,包含五种语言 locale、五家 provider、来自 250 段真实 8 kHz 电话录音的 4,270 条人工标注语料。
OpenBMB(清华 NLP)公开 MetaMem 代码仓库,对应其 ACL '26 Findings 论文《MetaMem: Evolving Meta-Memory for Knowledge Utilization through Self-Reflective Symbolic Optimization》。该方法通过自反思符号优化演化元记忆,以提升知识利用能力。
FireRedTeam 提出 CQ-DINO,通过类别查询缓解广词表目标检测中的梯度稀释问题。该方法针对词表规模庞大时检测性能下降的痛点,用类别查询机制改善梯度传播。