Cognition 发布 SWE-1.6 预览,SWE-Bench Pro 得分较 SWE-1.5 高 11%
Cognition 分享正在训练中的 SWE-1.6 早期预览:当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%(51.7% 对 40.1%),推理速度同为 950 tok/s,并向小部分用户开放早期访问。
Cognition 分享正在训练中的 SWE-1.6 早期预览:当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%(51.7% 对 40.1%),推理速度同为 950 tok/s,并向小部分用户开放早期访问。
Cognition 与 Applied Compute 合作 RL 训练了专用 bug 检测模型 SWE-check,在内部 in-distribution 评测中对 Opus 4.6 的 delta F1 从 0.09 降到 0,out-of-distribution 的 delta F1 从 0.49 降到 0.29,同时运行时间快约 10 倍且推理更便宜。
Cognition 构建了一套自动估算 Devin 会话相当于多少有效人工工程工时的系统,并用 AI 智能体审查每个会话、换算成美元价值,已随客户投入运行。系统基于 126 位用户、258 个会话的人工标注数据训练,在 233 个held-out会话上达到 rlog 0.74,且经对数空间校准后刻意偏保守低估;单项估计噪声约 2-3 倍,但聚合后误差相互抵消。
Cognition 发布 SWE-1.7,称其为自己训练过的最强模型,以更低成本达到前沿级智能,已通过 Cerebras(1000 TPS)在 Devin 的 Web、Desktop 和 CLI 中可用。
Tomer Tunguz 撰文分析转售推理的公司如何保持 30 点以上毛利,指出成本加成定价会随推理商品化而压缩至零,客户会绕开加价直接对接原始 API。
Tomer Tunguz 分析称 Anthropic 的算力支出约为其薪酬总额的 2.3 倍,约 5000 名员工对应 2026 年约 $10b 推理与训练支出,即每人每年约 $2m;而软件行业前 1% 公司每工程师每年 AI 支出为 $89k,中位数仅 $137。
VC Tomer Tunguz 撰文分析 AI 时代企业数据外流风险,引用 Satya Nadella 的“反向信息悖论”与 Palantir CEO Alex Karp 关于前沿实验室“窃取业务权重与 alpha”的言论。
Tomer Tunguz 分析,超大规模云厂商在 2026 年 Q2 财报电话会上称 AI 产能持续受限,HBM3e 内存涨价 20%、HBM4 预计翻倍。
推荐理由:作者用各实验室定价与算力供给数据,解释分层定价如何维持杰文斯悖论,并指出路由层可能成为新的战略环节。
ARC Prize 公布 2025 年赛事合作伙伴生态,Lambda、Modal、Google Cloud、Groq、Hyperbolic、Strong Compute、RunPod 提供算力支持,AI21 提供模型额度,Granola 提供生产力工具。
Tom Tunguz 分析 OpenRouter 与 Ramp 数据指出,尽管 SOTA 模型比去年 11 月聪明三分之二且平均每三天有两个新模型发布,OpenRouter 上 84% 的 token 并非 SOTA。
推荐理由:作者用 OpenRouter 和 Ramp 数据分析 SOTA 模型的份额与价格弹性,指出应用部署正转向以价格优先的模型选择。
测试时训练让模型在回答提示词时就地做梯度更新,权重随使用而改变,从而把不断增长的 KV-cache 折叠为固定大小的权重,内存占用不再随上下文线性增长。斯坦福针对小模型的研究显示其推理速度最高可提升 2.7 倍,In-Place TTT 还能免重训把 4b 模型提升到有竞争力的 128k 上下文表现。
Tomer Tunguz 分析 Meta 昨日发布的 Muse Spark 模型及其新定价体系:标准档 muse-spark-1.3 输入 $1.25/m、输出 $4.25/m tokens 且不用于训练。
推荐理由:作者用两档价差算出 Meta 对训练数据的每 token 定价,为理解以数据换补贴的商业模式提供一个可核算的框架。
Google 开发者倡导者 Yufeng Guo 撰文介绍深度学习在天体粒子物理中的应用,这类研究依赖覆盖数千平方公里的巨型观测站,如面积 3000 km²、含 1500 多个探测站的 Pierre Auger Observatory。探测器以纳秒级分辨率记录波形,形成类似图像的数据结构,天然适合深度学习处理,可用于提升仪器灵敏度、发现隐藏模式和搜索信号异常。
Zyphra 推出面向持续增长训练语料的增量模糊去重系统 PUFFER,在十小时吞吐测试中处理最多 10 亿文档,较现有 CPU 去重方法提速 11x-35x,单进程 1.75 小时可摄入 10 亿文档,已在超 300 亿文档的生产环境部署,并以 Apache 2.0 开源。
Preferred Networks 发布基于 Rust 的 Optuna 实现 Rustuna,并同步推出 Optuna v5.0。内部基准显示 Rustuna 速度最高可达 Optuna 的 1,000 倍,Matlantis CSP 的替换测试中 10 万次 trial 的内存消耗降低约 50%。
Eugene Yan 撰文分析复杂度偏见为何存在,指出复杂方案通过信号化努力、掌控力、创新和功能多样性而更受论文评审和晋升机制青睐,而简单方案更易采用、构建、扩展和运维。文章举例说明简单机器学习方法常不逊于复杂方法,如点积在推荐检索上优于神经协同过滤、树模型在 45 个中型表格数据集上超过深度神经网络,并建议聚焦问题复杂度而非方案复杂度,善用奥卡姆剃刀。
Eugene Yan 发文探讨数据与机器学习管道的测试为何频繁失效,并以行为日志到批量推理的示例管道演示单元、schema 和集成测试。
Eugene Yan 总结了提升机器学习项目成功率的四种机制:为每个项目设置 pilot 和 copilot 以发现关键缺陷,copilot 约投入 pilot 10% 的时间。
Eugene Yan 基于多篇行业论文和技术博客,总结出构建内容审核与欺诈检测系统的五个模式:通过 human-in-the-loop 收集 ground truth、数据增强、级联模式拆分问题、结合监督与无监督学习、以及可解释性。
Eugene Yan 总结撰写数据标注指南的方法,提出好指南应回答 Why、What、How 三层问题:任务为何重要、任务是什么、术语如何定义、标注员如何决策、任务如何执行。文章引用 Google 和 Bing Search 的指南实例,包括查询意图分类、页面质量评估因素、匹配质量决策树和标注示例讲解,并建议用 Cohen's kappa 衡量标注员之间的一致性来迭代改进指南。
Eugene Yan 总结了将大语言模型集成到系统与产品中的七大实用模式:Evals、RAG、微调、缓存、Guardrails、防御性 UX 和收集用户反馈,按提升性能与降低成本/风险、靠近数据与靠近用户两个维度组织。
在 Factual Inconsistency Benchmark(FIB)上,先用 Wikipedia 摘要微调 3 个 epoch 再在 FIB 上微调 10 个 epoch,PR AUC 达 0.85,比仅在 FIB 上微调提升 23%。
Eugene Yan 发表长文,系统讲解如何生成和使用合成数据进行预训练、指令微调与偏好微调。文章将方法分为从更强模型蒸馏(如 Unnatural Instructions。
Eugene Yan 与 Jason 分享招聘 ML/AI 工程师的方法,把面试当作评估系统,主张可靠、有效、低噪声。
Eugene Yan 回顾 2024 年,将 2023 年的原型规模化落地为服务客户的 ML/LLM 生产系统,并发布 6 篇长文,其中与友人合写的《What We've Learned From a Year of Building with LLMs》还由 O'Reilly 出版成书。
Andrej Karpathy 的 Google 暑期实习工作最终成为 CVPR 2014 Oral 论文《Large-scale Video Classification with Convolutional Neural Networks》。
Andrej Karpathy 发文讲解 RNN/LSTM 的原理与应用,并同步在 Github 发布基于多层 LSTM 的字符级语言模型代码 char-rnn(MIT 协议)。
EasyPPO 通过仅对 actor 做过长过滤、按采样回报标准差倒数对 critic 回归加权、以及适度缩小 critic mini-batch,解决了 PPO 训练大语言模型时 critic 的两类失稳问题。
ROSS 通过选择性监督从自生成 rollout 中再学习,保留完整历史轨迹作为上下文,仅对选定的模型生成续写施加损失。在 Qwen3.6-35B-A3B 上,ROSS 将六基准 MOPD 平均分从 58.40% 提升至 62.20%,SWE-bench Verified 从 64.20% 提升至 68.40%。
SAKI(Supervision Allocation with KL-constrained Interpolation)通过 KL 约束的教师引导 rollout 与最大耦合,将 token 级监督路由到接受与纠正两类位置,纠正概率恰为 TV(p_t, q_t)。
研究提出关系型上下文学习(ICL)中的"支持集目标泄漏"问题:带标签支持集含目标衍生(leaker)列而查询集干净,与数据集构建、时序切分或表示学习阶段的泄漏不同。
HyperZip 是一个基于扩散 LLM(dLLM)与 Multi-Token Prediction 的 LLM 数据压缩框架,通过超网络从上下文表示生成数据专属更新,无需微调即可适配目标数据。它针对扩散压缩中解码吞吐量提升会降低压缩率的权衡,实现了低压缩率与高吞吐的兼顾,在压缩率与速度的权衡上优于现有 SOTA 基线。
研究用固定通用概率决策模型 Jev 在 WISDM、UCI341、PAMAP2 的 1800 个类平衡加速度窗口上测试免训练人类活动识别,最强表示 macro-F1 仅 0.038、0.118、0.089,远低于监督模型的 0.686 至 0.907。
研究者提出 Structured Matrix Attention(SMat-Attention),用一类行支撑集 VC 维度为 d 的因果掩码连接 softmax 注意力与线性注意力。
研究者提出 Mirror-Score,一个面向异手性 D-肽/L-蛋白复合物的校准式纯推理打分框架,并发布覆盖四个靶点家族、含 31 个晶体复合物(其中 18 个有文献验证亲和力)的公开基准。
PowerZooJax 是一个基于 JAX 的强化学习电力系统基准套件,提供覆盖发电、输电、配电、分布式能源和数据中心微电网的五个约束马尔可夫决策过程任务。它将潮流计算、经济调度、市场出清和设备动态改写为 JAX 计算图,使整个训练与评估循环留在 GPU 上,实验显示相较 CPU 仿真有显著加速。该开源基准支持对策略回报、安全违规和分布外压力条件进行标准化评估。
COFFEE 是一个即插即用框架,通过将序列依赖与目标分离,避免枚举所有未解析 token 组合带来的指数级计算,从而为离散扩散模型提供序列级引导。它用无目标载体吸收去噪器预测的边际分布构建联合模型,并用编译的有限状态模型记录 token 组合对序列级偏好的影响,无需重训练即可将全局偏好传递给未解析位置。该框架在符号、语言和生物多个基准上取得强控制效果,并支持显式硬约束与学习到的软目标。
剑桥大学与 Models2 AI 的 Haomin Luo 对自发现 RL 规则 Disco103 做了首次因果机制审计,围绕经验时代五大支柱检验学习历史何时是资产、何时是负担。
研究显示,矩阵 Muon 的极坐标归一化更新步长由梯度秩而非范数决定,在稳定性边缘会进入持续数千步的周期-2 损失振荡:周期均值损失持平或上升,但权重仍在移动、学到的特征持续对齐教师子空间。在 33 组 ReLU、GELU 和 SiLU 教师配置中,学生 AGOP 在振荡期间始终对齐或持续对齐教师子空间,投影头重拟合表明这些方向对预测有用。
一项控制论视角的理论研究证明,Transformer 中自注意力之后的前馈层可作为一个独立控制项,无论 key、query、value 矩阵如何取值,都能将 token 驱动到任意接近共识的状态。该结论可扩展至多簇收敛与多头注意力情形,作者通过数值实验验证了结果,并将理论给出的阈值行为与真实 LLM 进行了对比。