Databricks IP Functions 正式 GA,为 Lakehouse 带来高性能网络分析
Databricks 宣布 IP Functions 正式 GA,将 IP 地址分析变为 Lakehouse 上原生高性能 SQL 工作负载,可统一处理 IPv4 与 IPv6、原生支持 CIDR 表示法并由 Photon 加速。
Databricks 宣布 IP Functions 正式 GA,将 IP 地址分析变为 Lakehouse 上原生高性能 SQL 工作负载,可统一处理 IPv4 与 IPv6、原生支持 CIDR 表示法并由 Photon 加速。
Databricks 发布新的 AI Function ai_decide,由 TypeSafe AI 的决策模型 Jev 驱动,对文本评估一个问题或多个问题,在不到一秒内返回概率、命名选项中的选择或有序量表上的分数,延迟和成本低于用 LLM 做同类任务。
NVIDIA 将 cuObject 纳入 xio-sig,与 cuFile 并列,并宣布 cuObject 客户端与服务器库正式可用,开发者可基于其 API 和 RDMA 线协议构建加速对象存储应用。新的 SCADA Server SDK 让存储厂商构建响应 GPU 发起请求的 SCADA 服务器,IBM 已用集成 SCADA 与 IBM Storage Scale 的原型验证互操作性。
微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可在风险出现前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、纬度、地质电导率和电网数据,评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。
UC Berkeley 等机构发布论文(arXiv:2509.21016),提出合成编程任务套件 DELTA 与两阶段奖励策略,证明 RL 可以让基础模型在 pass@128=0 的任务上出现 grokking 式相变,准确率跳升至约 100%。方法先用逐测试密集奖励脱离全零区,再切换二值全通过奖励巩固策略;迁移实验显示学会的技能可组合外推,但在需要新不变量的变换性变化上较弱。
SGLang RL 团队联合 InfiXAI、蚂蚁 Asystem & AQ Infra、slime、RadixArk 团队,在 slime 框架上落地了 INT4 QAT 端到端流程,训练用 fake quantization、推理用 W4A16,实现与 BF16 全精度相当的训练-推理一致性与稳定性。
Miles 强化学习框架现已支持 AMD Instinct GPU(含 MI300/350 系列),可在 ROCm 上原生运行大规模 RL 后训练。Miles 基于 SGLang 与 Slime 生态,支持 GRPO/PPO、Ray 编排及 Megatron-LM 集成,并提供预构建容器。在单节点 8 卡 MI300X 上,团队用 GRPO 训练了 Qwen3-30B-A3B。
Miles 团队提出 Token-In-Token-Out(TITO)原则,要求智能体 RL 中每一轮的总 token 序列(prompt + response)必须是下一轮 prompt token 序列的逐位完美前缀,以保证训练与推理一致。
Miles 将 On-Policy Distillation(OPD)集成进 rollout 与训练流程,支持纯蒸馏和结合 GRPO/PPO 的 RL 增强蒸馏两种模式,并新增稀疏的逐位置候选 token 打分流程,避免 O(R²K) 的密集 payload。
SGLang 提出基于 Scheme 的量化架构重构(issue #15194),将量化路径拆分为 Quant Config、Linear/MoE Method、Scheme、Kernel 四层,使 checkpoint 格式与硬件后端可独立演进。
Miles 团队在 Miles 中实现了两种 Blackwell 原生 RL 方案:端到端 MXFP8,以及面向 MoE 专家的 per-token NVFP4,覆盖 checkpoint 转换、Megatron 训练、SGLang rollout 与实时权重更新。
RadixArk 发布 Miles v0.1,一个面向前沿后训练的全栈生产级系统,是首个 Miles 版本的继任者。它基于 slime 设计,用 SGLang 做 rollout、NVIDIA Megatron-LM 或 FSDP 做训练,支持全异步 RL、三种评估模式和可插拔智能体环境,并附带智能体编码与终端任务的端到端配方。
Mooncake 社区发布博客,介绍 Mooncake 如何为大规模强化学习框架 Miles 解决 rollout 数据传输瓶颈。
METR 正在招募 ML 研究工程师和科学家,推进针对 AI R&D 能力的评估开发,目标是在 AI 智能体可能大幅自我提升、引发危险能力"爆炸"之前提供早期预警。METR 已开始开发阈值评估,用于判断 AI R&D 能力是否达到需要信息安保等防护措施的程度,并计划逐步建立能平滑追踪进展的评估体系。该机构称,具备丰富 ML 研发经验的研究者和工程师是当前评估进展的主要瓶颈。
METR 审阅了 OpenAI 在发布 gpt-oss-120b 前开展的对抗性恶意微调(MFT)实验方法,共提出 17 条建议,其中 6 条为高紧急度,覆盖 Preparedness Framework (v2) 中生物化学与网络安全两个追踪类别。
Liquid AI 提出基于进化算法的 STAR 方法,可自动合成定制化神经网络架构,并已用其生成数百种设计,在质量上超过强 Transformer 与混合架构基线,同时缓存和参数量更小。
斯坦福 HAI 发文梳理 AI 加速科学发现的进展:Brian Hie 团队打造的 Evo 2 是迄今最大的生物学 DNA 语言模型,基于 9 万亿碱基对、400 亿参数训练,可像聊天机器人一样补全基因序列。Emma Lundberg 团队则正构建模拟人类细胞的基础模型,用于加速药物发现与个性化医疗,并为此开发了 Biomni 供生物学家交互分析数据。
斯坦福 Marlowe 超算配备 248 块 NVIDIA H100 GPU、31 个计算节点,横跨全部七所学院服务 190 多个研究组,30 天平均分配率 95%,累计交付 315 万 GPU-hours。
Fireworks 宣布 Kimi K3 支持其 Serverless Training 的 Multi-LoRA 服务与训练,进入私测阶段。K3 是总参数约 2.8T 的 MoE 模型,原文称其为首个达到 3T 规模的开源权重模型。
Fireworks AI 在 Qwen3.5-9B 上用 Placement、寄存器分配和 Nexa VM 三个可自动验证任务做对照实验,提出在把 LoRA 换成 FullFT 前先依次测试数据覆盖、学习率等训练配方和 adapter rank。实验显示单任务场景下调数据或配方基本消除 FullFT 优势,固定预算混合任务中 FullFT 仍领先 4.29 个百分点,并将进一步发布后续实验。
Harvey 发布首个模型 Tenet,基于 Kimi K3 用 Fireworks Training API 的异步强化学习后训练,面向长周期法律工作。
Fireworks AI 宣布 Training API 正式可用,并推出 Fireworks Lab 服务。
Genspark 与 Fireworks Lab 合作,将开放权重多模态模型 MiniMax M3 后训练为 Gen-1 Slides,可端到端规划、撰写并自查幻灯片。
Cognition 分享正在训练中的 SWE-1.6 早期预览:当前 checkpoint 在 SWE-Bench Pro 上比 SWE-1.5 高 11%(51.7% 对 40.1%),推理速度同为 950 tok/s,并向小部分用户开放早期访问。
Cognition 与 Applied Compute 合作 RL 训练了专用 bug 检测模型 SWE-check,在内部 in-distribution 评测中对 Opus 4.6 的 delta F1 从 0.09 降到 0,out-of-distribution 的 delta F1 从 0.49 降到 0.29,同时运行时间快约 10 倍且推理更便宜。
Cognition 构建了一套自动估算 Devin 会话相当于多少有效人工工程工时的系统,并用 AI 智能体审查每个会话、换算成美元价值,已随客户投入运行。系统基于 126 位用户、258 个会话的人工标注数据训练,在 233 个held-out会话上达到 rlog 0.74,且经对数空间校准后刻意偏保守低估;单项估计噪声约 2-3 倍,但聚合后误差相互抵消。
Cognition 发布 SWE-1.7,称其为自己训练过的最强模型,以更低成本达到前沿级智能,已通过 Cerebras(1000 TPS)在 Devin 的 Web、Desktop 和 CLI 中可用。
Tomer Tunguz 撰文分析转售推理的公司如何保持 30 点以上毛利,指出成本加成定价会随推理商品化而压缩至零,客户会绕开加价直接对接原始 API。
Tomer Tunguz 分析称 Anthropic 的算力支出约为其薪酬总额的 2.3 倍,约 5000 名员工对应 2026 年约 $10b 推理与训练支出,即每人每年约 $2m;而软件行业前 1% 公司每工程师每年 AI 支出为 $89k,中位数仅 $137。
VC Tomer Tunguz 撰文分析 AI 时代企业数据外流风险,引用 Satya Nadella 的“反向信息悖论”与 Palantir CEO Alex Karp 关于前沿实验室“窃取业务权重与 alpha”的言论。
Tomer Tunguz 分析,超大规模云厂商在 2026 年 Q2 财报电话会上称 AI 产能持续受限,HBM3e 内存涨价 20%、HBM4 预计翻倍。
推荐理由:作者用各实验室定价与算力供给数据,解释分层定价如何维持杰文斯悖论,并指出路由层可能成为新的战略环节。
ARC Prize 公布 2025 年赛事合作伙伴生态,Lambda、Modal、Google Cloud、Groq、Hyperbolic、Strong Compute、RunPod 提供算力支持,AI21 提供模型额度,Granola 提供生产力工具。
Tom Tunguz 分析 OpenRouter 与 Ramp 数据指出,尽管 SOTA 模型比去年 11 月聪明三分之二且平均每三天有两个新模型发布,OpenRouter 上 84% 的 token 并非 SOTA。
推荐理由:作者用 OpenRouter 和 Ramp 数据分析 SOTA 模型的份额与价格弹性,指出应用部署正转向以价格优先的模型选择。
测试时训练让模型在回答提示词时就地做梯度更新,权重随使用而改变,从而把不断增长的 KV-cache 折叠为固定大小的权重,内存占用不再随上下文线性增长。斯坦福针对小模型的研究显示其推理速度最高可提升 2.7 倍,In-Place TTT 还能免重训把 4b 模型提升到有竞争力的 128k 上下文表现。
Tomer Tunguz 分析 Meta 昨日发布的 Muse Spark 模型及其新定价体系:标准档 muse-spark-1.3 输入 $1.25/m、输出 $4.25/m tokens 且不用于训练。
推荐理由:作者用两档价差算出 Meta 对训练数据的每 token 定价,为理解以数据换补贴的商业模式提供一个可核算的框架。
Google 开发者倡导者 Yufeng Guo 撰文介绍深度学习在天体粒子物理中的应用,这类研究依赖覆盖数千平方公里的巨型观测站,如面积 3000 km²、含 1500 多个探测站的 Pierre Auger Observatory。探测器以纳秒级分辨率记录波形,形成类似图像的数据结构,天然适合深度学习处理,可用于提升仪器灵敏度、发现隐藏模式和搜索信号异常。
Zyphra 推出面向持续增长训练语料的增量模糊去重系统 PUFFER,在十小时吞吐测试中处理最多 10 亿文档,较现有 CPU 去重方法提速 11x-35x,单进程 1.75 小时可摄入 10 亿文档,已在超 300 亿文档的生产环境部署,并以 Apache 2.0 开源。
Preferred Networks 发布基于 Rust 的 Optuna 实现 Rustuna,并同步推出 Optuna v5.0。内部基准显示 Rustuna 速度最高可达 Optuna 的 1,000 倍,Matlantis CSP 的替换测试中 10 万次 trial 的内存消耗降低约 50%。
Meta AI 推出 Brain2Qwerty v2,可从非侵入式脑记录(MEG)实时解码完整句子,词准确率 61%,远高于其他非侵入式方法的 8%,最佳参与者达 78%。
Liquid AI 发布 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 的 4-bit Q4_0 检查点,采用量化感知蒸馏(QAD)训练,四款模型均保留约 97% 的 BF16 平均性能。