跳到正文

#部署/工程

今日 3 条
今天10月1日周四
9月30日周三
  1. Epoch AI:研究、数据与评测51

    Epoch AI 发布 AI 芯片所有权分布数据集与开放研究项目

    Epoch AI 上线 AI chip owners 探索器,基于公司披露和第三方分析师估算全球 AI 算力在主要公司和客户类别间的分布,数据于 2026 年 5 月 12 日更新。该项目追踪的是芯片所有权而非使用情况,多数前沿 AI 开发者的训练和推理芯片并非自有;数据、方法论及按设计商、芯片类型划分的 CSV 数据集均公开可下载。

9月24日周四
  1. Microsoft Research 博客(RSS)62

    微软研究:把物理 AI 推理卸载出机器人可提升任务成功率与续航

    微软研究院对移动机器人操作负载做系统性测量,发现把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现与电池续航。

    推荐理由:微软对移动操作机器人推理负载的系统性测量,给出了卸载到边缘或云端 GPU 在任务成功率与续航上的量化差异。

9月18日周五
  1. MiniMax (official)40

    Nunchux AI 与多校研究者推出 VC-Attention,为 MiniMax-H3 带来免训练低比特注意力加速,在 B200 上比 FlashAttention-4 快 1.6×、B300 上快 1.5×,保真度优于 SageAttention2。

    引用Nunchux AI@NunchuxAI

    Introducing VC-Attention: fast and accurate low-bit attention without retraining. On MiniMax-H3, VC-Attention speeds up attention by 1.6× on B200 and 1.5× on B300 over FlashAttention-4, with better fidelity than SageAttention2. It also works with existing sparse attention methods. Two key innovations: • V-Smooth reduces value quantization error. • ExpCast-FP8 speeds up softmax. Nunchux Attention, our proprietary extension, pushes the speedup to 1.9× on B200 and 1.8× on B300. Blog: http://www.nunchux.ai/blog/attention-is-the-video-bottleneck Technical Report: http://arxiv.org/pdf/2609.15810 Joint work by researchers at MIT, CMU, UC Berkeley, Stanford, and NVIDIA.

9月16日周三
  1. Apple Machine Learning Research(RSS)38

    Glyph:面向企业数据目录列描述与敏感本体标注的多策略智能体系统

    Apple 研究团队提出 Glyph,一个将列描述生成与列类型标注建模为有状态图编排的多智能体 LLM 生产系统。其 Descriptor 通过推理-行动工具循环从企业 GitHub 按需检索管道源码来支撑生成,Tagger 并行运行描述、业务线正则与元数据三种策略,并用 RRF 融合排序结果,从 275 叶节点的数据分类本体中打标。

9月14日周一
8月25日周二
8月24日周一
8月21日周五
  1. Together AI 研究与产品博客(RSS)69

    Together AI 实测 GLM-5.3 与 Claude Fable 5 在 DeepSWE 上的成本、编码与路由表现

    Together AI 在 DeepSWE 的 113 个任务上各跑 4 次试验对比 GLM-5.3 与 Claude Fable 5,pass@1 分别为 69.0% 和 69.7%,属统计平手,但 GLM-5.3 每次 rollout 成本 $3.99,比 Fable 的 $21.63 低 5.4 倍。

    推荐理由:原文基于同一批次 904 次 rollout 给出成本与 pass@k 对比,可帮助读者在两个相近模型间做默认与升级的路由选择。

8月6日周四
  1. Meta Engineering Blog(RSS)47

    Meta 广告排序的多阶段序列模型:从用户序列到 LLM 式缩放定律

    Meta 为广告排序提出多阶段序列模型,将离线用户建模与在线排序解耦,并引入稠密 tokenization 与 target-aware attention,使序列模型呈现可预测的 LLM 式缩放定律。该平台已带来 Instagram 转化率 6%、Facebook 转化率 3%、Facebook 广告点击 3.5% 的累计提升,并成为 Meta 生成式广告推荐模型 GEM 的核心组件。

7月29日周三
  1. BAIR:Berkeley AI Research Blog62

    从 CUDA 到 MLX:K-Search 如何把数十年内核经验带到 Apple Silicon

    IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 框架扩展出 MLX 后端,并设计结构化 CUDA-to-MLX 翻译层,让进化式内核搜索把已有 CUDA 内核当作知识库适配到 Apple Silicon。

    推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,读者可了解跨平台内核搜索的方法与实测数据。

6月30日周二
6月27日周六
6月25日周四
  1. Google Research47

    Google 用线性弹性缓存优化云成本,Spanner 内存占用降 15.5%

    Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小以最小化总拥有成本。在 Spanner 生产环境测试数月后,内存占用降低 15.5%,缓存未命中仅增加 5.5%,TCO 降低约 5%,实际 I/O 成本影响仅 0.5%。该方案用可转为几行 C++ 代码的浅层决策树预测页面 TTL,并在缓存写满时回退到 LRU 淘汰。

6月23日周二
5月19日周二
4月3日周五
3月25日周三
3月5日周四
2月19日周四
  1. Together AI 研究与产品博客(RSS)48

    Together AI 的 CDLM 让扩散语言模型推理最高提速 14 倍且不牺牲质量

    Together AI 提出一致性扩散语言模型 CDLM,通过轨迹蒸馏、块级因果注意力与三项联合训练目标,让扩散语言模型在少步推理下保持质量,并支持精确的块级 KV 缓存。在 Dream-7B-Instruct 上,CDLM 将精炼步数减少约 4.1x–7.7x,GSM8K-CoT 延迟最高降低 11.2x,MBPP-Instruct 最高降低 14.5x,多数任务准确率变化很小。

9月29日周一
8月30日周六