跳到正文

端侧 AI

跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。

最新精选

第 1–20 条 · 共 20 条
今天10月1日周四
  1. Google AI:DEV 作者专属(RSS)66

    TensorFlow.js 浏览器端超分优化:一次新张量形状为何耗时 8-17 秒,以及如何消除 40 秒页面冻结

    作者分享在浏览器端用 TensorFlow.js on WebGL 做照片超分(不上传图片)的优化过程:初版用 UpscalerJS,1.2 MP 照片需 60-110 秒并冻结页面约 40 秒。

    推荐理由:作者用自己浏览器端超分项目的实测数字,拆解了 WebGL 上张量形状触发着色器重编译等坑和对应修法。

9月30日周三
  1. Liquid AI 模型与工程博客(网页)65

    Liquid AI 发布端侧基础模型 LFM2,含 0.35B、0.7B 和 1.2B 三个版本

    Liquid AI 发布新一代 Liquid Foundation Models(LFM2),定位市场上最快的端侧生成式 AI 基础模型,采用混合架构,包含 10 个双门控短程卷积块和 6 个分组查询注意力块。

    推荐理由:官方博客给出了 LFM2 的架构细节、CPU 推理对比和训练方法,读者可以据此评估它在端侧部署中的实际取舍。

  2. Liquid AI 模型与工程博客(网页)66

    Liquid AI 发布 LFM2.5-8B-A1B 端侧 MoE 模型,128K 上下文主打工具调用

    Liquid AI 发布 LFM2.5-8B-A1B 端侧 MoE 模型,上下文窗口从 32,768 扩展到 128K tokens,预训练从 12T 增至 38T tokens,词表翻倍到 128,000 以提升非拉丁文字的编码效率。

    推荐理由:官方详细给出上下文、训练管线和实测基准,读者可以据此评估这款端侧 MoE 模型是否适合本地 Agent 工作流。

  3. Liquid AI 模型与工程博客(网页)72

    Liquid AI 发布端侧智能体模型 LFM2.5-2.6B

    Liquid AI 发布 LFM2.5-2.6B,一个可完全在设备端运行的 2.6B 参数智能体模型,Base 与后训练版本已在 Hugging Face 开放。

    推荐理由:原文给出完整的四阶段后训练流程、多基准对比和 CPU 与手机端实测速度,读者可据此评估它对端侧 Agent 部署的适配度。

  4. Tomer Tunguz 博客(VC 分析)70

    Tom Tunguz 实测 Qwen3.8-27B 本地模型, birds fly like bumblebees 而非飞机

    Tom Tunguz 用 25 个 VC 任务对比 DeepSeek V4 云端模型与两个本地模型,judge 模型盲评显示三者质量接近(8.0 左右),但路径不同。

    推荐理由:作者以 25 个真实 VC 任务实测云端与本地模型,用质量、token 用量和延迟数据解释小模型靠更多推理弥补知识差距。

  5. Google Developers Blog(RSS)66

    Google 发布在 Raspberry Pi 5 上用 LiteRT 部署 Gemma 的端侧 AI 指南

    Google 介绍如何在 Raspberry Pi 5 上用 LiteRT 和 Gemma 模型实现完全离线的实时端侧 AI,并以 Reachy Mini 机器人演示目标检测、语音识别、推理和语音合成的完整本地流水线。

    推荐理由:原文给出 Gemma 各型号在 Raspberry Pi 5 上的实测数据和完整部署流程,读者可以据此选择合适的端侧模型并复现本地推理。

  6. Google Developers Blog(RSS)61

    Antigravity SDK 支持本地模型,首发接入 Gemma 4 26B A4B 与 LiteRT

    Google 宣布 Antigravity SDK 支持本地模型工作流,首发支持基于 Google AI Edge LiteRT 的 Gemma 4 26B A4B,可完全离线运行智能体辅助,建议机器配备超过 24GB VRAM 或统一内存。

    推荐理由:官方给出了本地智能体工作流的完整上手步骤和混合编排演示,含具体 token 与硬件数据,可直接照做复现。

9月22日周二
  1. vLLM 官方博客(RSS)76

    vLLM 官方发布 vllm-metal v0.28.0:在 Apple Silicon 上实现并发推理服务

    vLLM 官方宣布 vllm-metal 首个正式版本 v0.28.0,将上游 vLLM 的 V1 调度器、分页 KV cache 和 OpenAI 兼容服务带到 Apple Silicon,模型执行由 MLX 和 Metal 完成。

    推荐理由:官方详解 vllm-metal 的架构与跨引擎实测数据,读者可据此评估 Apple Silicon 上多并发推理是否值得切换。

9月10日周四
  1. Apple:Newsroom(RSS)61

    Apple 发布 Apple Watch Series 12 与 Ultra 4 健康功能,重新设计的 Health app 将引入 Longevity 标签页

    Apple 宣布为 Apple Watch 和 iPhone 推出升级的健康与健身体验。Apple Watch Series 12 和 Apple Watch Ultra 4 引入新 Health Sensing System。

    推荐理由:官方新闻稿列出新健康传感系统、Longevity 标签页和在家运动评估等功能的设备要求,可帮助读者判断升级与自家设备的关联。

8月21日周五
  1. Hugging Face:Blog(RSS)66

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,采用推测解码,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍,输出质量不变。

    推荐理由:原文给出各模型在 GPU 和端侧的实测加速数据与 llama.cpp、SGLang 接入命令,读者可直接评估是否用于部署。

8月12日周三
  1. Google DeepMind:Blog(RSS)68

    Google DeepMind 发布手语转文本模型 SL2T,落地 Gboard 与 Live Transcribe

    Google DeepMind 发布大规模多语言手语转文本模型 SL2T,为 Gboard 和 Pixel 11 的 Live Transcribe 带来手语转文字听写,首先支持 ASL 转英语,后续将扩展更多语言和设备。

    推荐理由:原文解释了手语翻译的两类核心难题和 SL2T 的技术取舍,并给出基准分数与隐私设计,读者可了解可用手语 AI 的实现路径。

6月9日周二
  1. Google DeepMind:Blog(RSS)77

    Google DeepMind 发布 Gemma 4 12B:无编码器统一多模态模型,可在 16GB 内存笔记本本地运行

    Google DeepMind 发布 Gemma 4 12B,定位于在笔记本上本地运行的智能体多模态模型,性能接近其 26B MoE 模型而内存占用不到一半。

    推荐理由:官方介绍了无编码器统一架构和 16GB 内存本机运行等细节,适合关注端侧多模态部署的开发者参考。

4月3日周五
  1. Google DeepMind:Blog(RSS)86

    Google DeepMind 发布 Gemma 4 开源模型,含 E2B、E4B、26B MoE 和 31B 四个尺寸

    Google DeepMind 发布 Gemma 4 开源模型,主打高级推理与智能体工作流,采用 Apache 2.0 许可,提供 E2B、E4B、26B MoE 和 31B Dense 四个尺寸。

    推荐理由:官方给出四个尺寸、榜单排名、上下文长度和开放许可等具体信息,读者可以据此判断选型与部署空间。

12月3日周三
  1. Mistral AI:News(网页)80

    Mistral 发布 Mistral 3 系列:含 Mistral Large 3 与 Ministral 3 小模型,全部 Apache 2.0 开源

    Mistral 发布新一代模型系列 Mistral 3,包括 Mistral Large 3(41B 激活、675B 总参数的 MoE 模型)和 Ministral 3 的 3B、8B、14B 三种小模型,全部以 Apache 2.0 许可开源。

    推荐理由:官方发布了完整模型规格、开源许可和部署路径,读者可以据此评估这批开源模型在自己的场景中是否可用。

3月17日周一