DeepMind 让 100 个 Gemini 智能体解数学题,作弊自发涌现并遭举报
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作求解 71 道数学题,并观察其群体行为。11:18 UTC 启动后,群体在 12:15 UTC 已正确解出 37 题,随后 prover-theta 发现自动评分系统漏洞,27 分钟内漏洞经共享知识库和点对点消息在群体中扩散,剩余 34 题被“解出”。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作求解 71 道数学题,并观察其群体行为。11:18 UTC 启动后,群体在 12:15 UTC 已正确解出 37 题,随后 prover-theta 发现自动评分系统漏洞,27 分钟内漏洞经共享知识库和点对点消息在群体中扩散,剩余 34 题被“解出”。
上海人工智能实验室 InternLM 开源 SciDocBench,一个以工作流为中心的科学文档理解基准。该基准的官方仓库已公开,用于评测科学文档理解任务。
Google Research 用 UK Biobank 的欧洲人群数据向 Biobank Japan 近 20 万日本人样本做迁移学习,评估 8 种临床性状的多基因风险评分(PRS)跨人群表现。
Google Research 与 HHMI Janelia 及剑桥等机构合作,在 Cell 发表论文,发布完整雄性果蝇脑与中枢神经系统连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计最大的脑图谱。
推荐理由:读者可了解 AI 重建如何把电子显微镜切片拼成完整脑图谱,以及这一资源对神经科学研究的用途。
MIT 与自动驾驶公司 Motional 提出 Concept-Wrapper Network(CW-Net),将自动驾驶深度学习规划器的内部推理翻译为"接近停驶车辆""靠近骑行者"等可理解概念,且不改变原有驾驶性能。该模块用 1.3 亿个自动驾驶场景样本训练,在私人测试跑道的实车测试中帮助安全员更准确预判车辆行为,大规模模拟实验也得到类似结果,相关研究已发表于 Nature。
研究者提出 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的多维 IRT 方法,基于 100 个 LLM 在 16 个基准、超 34K 道题上的结果训练,在未被告知各基准测什么的情况下自行恢复出安全与通用推理两个主导维度。分析显示 BBQ 更贴近通用推理而非安全,WMDP 分数与通用推理关联更强且推理越强分数越低,HarmBench 的版权类问题也更接近通用推理。
Google 提出 MAPL-EMIT 深度学习框架,基于 EMIT 高光谱辐射数据自动检测、预测增强并定位全球甲烷羽流,在专家标注羽流上召回率达 84%。该模型采用 Swin-S 视觉 Transformer,同时完成增强量化、羽流分割与源定位三项任务,训练数据为注入真实 EMIT 场景的 360 万个合成甲烷羽流。
美团 LongCat 发布 AutoResearchEval 评测,评估 7 个前沿模型在 36 项需要持续实验的 AI 研发任务上的表现,共覆盖 756 条轨迹。
Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 引入 Monsoon en-IN 和 Monsoon hi-IN 两套评测集,其中印地语是该多语言榜单首个印度语言。
LLMs with scaffolds have lagged on text-to-SQL, a task that relies on human judgment. By folding expert judgment into every part of RLVR on Tinker, @maxYuxuanZhu and @ddkang (UIUC and Bridgwater) trained the first text-to-SQL model to beat the human mark. https://thinkingmachines.ai/news/putting-task-expertise-into-rl
MIT 生物学系团队开发出机器学习框架 PottsMPNN,通过引入支配蛋白质结构与稳定性的物理原理并建模氨基酸两两相互作用,提升序列生成与突变稳定性预测能力,成果发表于 PNAS。研究者指出,长期以来以能否复现进化选出的天然序列作为成功标准并非蛋白质设计的最佳指标,PottsMPNN 在减少对天然序列依赖的同时,结构兼容性与能量预测反而改善,可设计出序列不类似任何天然蛋白的结构可行蛋白。
🚀 What if video generators could build on representations that already understand the visual world? We are excited to introduce V-RAE: Rethinking Video Latent Spaces for Generation. Recent progress in image generation has begun to move beyond conventional VAE latents, exploring both direct pixel-space and representation-based approaches. Video generation, however, still depends heavily on latent compression, as the scale and redundancy of spatiotemporal data make direct modeling prohibitively expensive. However, most video VAEs are optimized for pixel reconstruction, and a latent space that reconstructs well is not necessarily easy to generate. V-RAE takes a different approach: it directly uses representations from frozen vision foundation models as the generative latent space, rather than as auxiliary supervision. We study DINOv3, SigLIP2, EUPE, and V-JEPA 2.1. A lightweight temporal attention pooling module compresses their dense features by 4×, followed by a spatiotemporal Transformer decoder. Under matched generation backbones, latent budgets, and training settings, V-RAE achieves: 🏆 2.13 rFVD on Kinetics-600 🎬 117.86 gFVD on UCF101 and 19.16 gFVD on Kinetics-600 ⚡ Up to 6× faster convergence than VAE-based latent spaces 🧠 90.92% semantic probing accuracy on UCF101 🌍 Better future prediction on Cityscapes, reducing gFVD from 144.47 to 111.36 Our experiments also reveal a broader finding: Good Reconstruction ≠ Good Generation. During generation, predicted latents inevitably deviate from real encoding trajectories. If the latent space is not sufficiently smooth, small errors can be amplified into visible artifacts. We therefore introduce tFVD to evaluate temporal smoothness and robustness to latent prediction errors. It correlates much more strongly with downstream generation quality, reaching 0.919 on Kinetics-600. The takeaway: A latent space is not merely where videos are compressed—it determines what the generator must learn. When semantics and temporal structure are already organized in the representation, generation becomes easier to learn. Representation first. Generation follows. Many thanks to my mentors, @ScottNLP and @SQWu_Tori, for their continuous guidance and support. I am also deeply grateful to @sainingxie for his valuable guidance and invaluable feedback, which greatly helped shape V-RAE. 🙏 Hi @_akhaliq, we would truly appreciate your help in sharing V-RAE with the broader AI research community. Thank you! 🙏 📄 Paper: https://arxiv.org/abs/2608.13556 💻 Code: https://github.com/V-RAE/V-RAE 🤗 Models: https://huggingface.co/Guomh0707/V-RAE-Models 🌐 Project: https://v-rae.github.io #VideoGeneration #GenerativeAI #ComputerVision #WorldModels #RepresentationLearning #RAE
Google 发布 GlucoFM,一个采用双流设计的自监督基础模型,将血糖的缓慢基线趋势与短期波动分离,并保留时间与缺失信息。模型在 109,066 小时无标注 CGM 数据上预训练,覆盖 477 条受试者/记录,在 4 个队列、7 项临床任务共 14 组评估中平均 PR-AUC 比最强 GluFormer 变体高 5.8 个百分点。
MIT 研究人员提出 CrysVCD 框架,在材料生成前用语言模型约束价电子规则,使常用材料模型在近 70% 的生成结果中达到高晶格动力学稳定性。该方法比生成后再筛选的方案效率高一个数量级,微调后生成的晶体材料机械稳定性达 68%、亚稳性达 85%,并可定向生成高热导率、高介电常数等材料。
QwenLM 推出 E-CommerceBench,一个长周期基准测试:18 个 LLM 智能体各获得 ¥100,000,基于真实市场数据模拟经营线上店铺 365 天。智能体需与供应商谈判、定价、管理库存并维持现金流。
Google 在 CHI 2026 发布研究原型 AgentHands,让 XR 中的 AI 智能体在说话时同步做出与语音对齐的手势,把抽象指令变成空间中的实体演示。
Multiverse Computing 发布论文 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,直接从压缩前的原始模型做 KL 蒸馏。
MIT 工程师提出名为 Extreme Event Aware(η-learning)的机器学习方法,无需依赖历史极端事件数据即可生成合理的极端天气与最坏情景,并给出其规模、强度和持续时间。
METR 研究显示 AI 对科学的加速并不均匀:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身则未见可测量的加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件均分达 58.3,较基座提升 8.1。
SemiAnalysis 发布 AgentX 1.0,称其为全球首个 Apache 2.0 开源、100 万上下文的多轮智能体编码推理基准,投入超过 300 万美元构建数据集。
Google 发布 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序组织为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名化移动性数据与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
Hugging Face 发布研究,用三类测试量化 ASR 模型的基准优化(benchmaxxing)现象,评估了 11 个开源模型。
推荐理由:研究用三类探针量化语音识别模型的基准优化行为,并给出模型选型与基准设计的具体建议。
Together AI 在 DeepSWE 的 113 个任务上各跑 4 次试验对比 GLM-5.3 与 Claude Fable 5,pass@1 分别为 69.0% 和 69.7%,属统计平手,但 GLM-5.3 每次 rollout 成本 $3.99,比 Fable 的 $21.63 低 5.4 倍。
推荐理由:原文基于同一批次 904 次 rollout 给出成本与 pass@k 对比,可帮助读者在两个相近模型间做默认与升级的路由选择。
SkyRL 提出 IsoExec,通过跨框架统一执行抽象消除 RL 训练与推理引擎之间的数值不匹配,包含执行契约与对齐的批不变内核两部分,已在 SkyRL 中结合 vLLM 和 Megatron 实现。
Together AI 在全部 113 个 DeepSWE 任务上对 GLM-5.3 (max) 与 GPT-5.6 Sol (max) 各跑 4 次试验,共 904 次 rollout。
推荐理由:原文基于904次实测给出两模型在成本、速度和任务类型上的具体差异,并提供了可直接套用的级联路由方案。
MIT 研究人员开发出一种预测电化学合成氨催化剂的方法,通过密度泛函理论先评估材料的微观性质,而非逐一试错数百万种合金组合,从而大幅加快筛选进程。相关开放获取成果于 8 月 11 日发表在 Royal Society of Chemistry 期刊 EES Catalysis 上。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据比首个公开版本多 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol,精度超过当前领先的全局(范围分离)杂化泛函而保持半局域泛函的计算成本。
ALTK-Evolve 让智能体从自身历史轨迹中蒸馏可复用准则并在推理时注入,无需更新权重或人工标注,在 AppWorld 的 585 个多步任务上测试了 8 个模型。
MIT CSAIL 团队在 Nature Communications 发表论文,提出“归因衰减”现象:训练数据越大,单个样本对生成结果的影响越小,删除任一图像甚至某艺术家的全部图像后输出不变。
Import AI 469 介绍了新基准 DiG-bench(Discovery in Games),用 70 款规则与目标均隐藏的手工游戏测试 AI 自主发现环境规律的能力,目前仅公开 21 款。
Google Research 推出研究性深度学习框架 PhotoScan,从标准 2D 手机照片估算体脂率(BF%)、A/G 比和 V/S 比三项三维体成分指标。
Hugging Face 组织的 ICML 2026 Open Reproductions 挑战赛(7 月 15 日至 8 月 2 日)中,1,221 名社区成员用 Claude Code。
推荐理由:原文复现了 ICML 2026 约三分之一的论文并给出具体的证伪案例,读者可以借此了解智能体驱动大规模同行审查的可能与局限。
微软研究院推出 MindTopo 基准,从连续性、分离、顺序、包围、绳结五类拓扑关系评估多模态大模型的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧关系可见时偶有帮助,跨多步动作时难以维持拓扑约束。
Google Research 发布知识画像框架及 WikiProfile 基准(2,150 条 Wikipedia 事实,每条配 10 个任务),评估 13 个 LLM 的编码、召回与识别。
推荐理由:原文用知识画像框架区分编码与召回失败,并给出思维可回收约40-65%事实的关键数据,帮助读者理解事实性瓶颈所在。
Microsoft Research 发布研究模型 CARE-X,一个统一胸部 X 光视觉语言模型,同时支持报告生成与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。
ALTK-Evolve 与 ACE 同为无需更新权重、无需人工标注的智能体记忆系统,但 ALTK-Evolve 把记忆投递当作可调旋钮,按任务检索少量高支持度指南,而非每步注入完整 playbook。
MIT CSAIL 与清华研究人员提出预训练方法 GeoPT,通过 130 万条"合成动力学"样本让仿真模型学习物理规律,达到峰值性能的速度比领先模型快 2 倍,所需数据最多减少 60%。在工业基准上,GeoPT 在速度、精度和效率上超越 SOTA 模型,模拟船体受风浪时用 60% 更少标注数据、达到峰值精度快 4 倍,并能在数秒内完成超 1 亿网格点的高保真仿真。