Google AI:DEV 作者专属(RSS)· james hurley·· 4 小时前AI 评分34
ARM Matmul 续篇:用 BFMMLA 实现 bf16 矩阵乘法
ARM Matmul Continued: BFMMLA Edition
AI 导读
这篇 ARM NEON 矩阵乘法续篇用 BFMMLA 指令在 bf16 输入上实现 2x4 @ 4x2 matmul,结果以 F32 累加器存入单个浮点寄存器的 2x2 矩阵。
来源:Google AI:DEV 作者专属(RSS) · dev.to