跳到正文

#端侧

今日 17 条
9月30日周三
  1. Liquid AI 模型与工程博客(网页)44

    Liquid AI 的 LFM 系列模型:面向端侧部署的高效基础模型

    Liquid AI 的 Liquid Foundation Models(LFMs)主打在真实约束下运行,可在 GPU、CPU、NPU 上无缝部署于可穿戴设备、机器人、手机、笔记本、汽车等终端。每个 LFM 均可免费下载、运行和微调(含商用),直到公司年收入超过 $10M。模型面向毫秒级延迟、端侧韧性与数据隐私设计,支持本地、云端及混合 AI 部署。

  2. Google Developers Blog(RSS)61

    Antigravity SDK 支持本地模型,首发接入 Gemma 4 26B A4B 与 LiteRT

    Google 宣布 Antigravity SDK 支持本地模型工作流,首发支持基于 Google AI Edge LiteRT 的 Gemma 4 26B A4B,可完全离线运行智能体辅助,建议机器配备超过 24GB VRAM 或统一内存。

    推荐理由:官方给出了本地智能体工作流的完整上手步骤和混合编排演示,含具体 token 与硬件数据,可直接照做复现。

9月29日周二
9月28日周一
9月26日周六
9月25日周五
9月24日周四
  1. Ars Technica:AI(RSS)50

    Meta 推出无摄像头 Ray-Ban 眼镜与新款 VR 眼镜,Muse 助手即将登陆眼镜端

    Meta 发布一款不带摄像头的 Ray-Ban 眼镜,用户只能通过语音与 Meta 的 AI 助手交互,并称 Muse 助手很快会上线眼镜端。同一场发布中的新款 VR 眼镜将于明年春季上市,售价 1,300 美元,比前代 Quest 3 轻五倍,眼镜用户还能用全息数字分身代替自己出现在视频通话中。

  2. Apple Machine Learning Research(RSS)37

    Apple 如何通过潜空间蒸馏压缩流式神经音频编码器

    Apple 提出一种潜空间蒸馏方法压缩流式神经音频编码器:不监督离散 token 或输出分布,而是让学生编码器回归教师模型每帧的量化前潜表示,并用单层仿射层吸收师生宽度差异。在 2.8× 压缩下,六组师生配对中有五组无需微调即保持在教师 1.9% 相对 WER 以内,并比同容量独立训练编码器相对提升 3.9%。该方案同时适用于单独预训练和与语言模型联合训练的 tokenizer。

  3. Meta Engineering Blog(RSS)49

    Meta 将 Private Processing 机密计算引入 AI 眼镜

    Meta 把用于 WhatsApp 和 Meta AI 应用的 Private Processing 机密计算基础设施扩展到 AI 眼镜,让流式转录、上下文搜索和长期回忆等云端 AI 负载在机密虚拟机(CVM)内运行,Meta 自身也无法读取用户数据。该方案基于 CPU 与 GPU 的 TEE 硬件隔离,客户端通过远程证明校验软件镜像,并叠加不可定向性与加密存储。

9月23日周三
  1. elsewhere:文章(RSS)34

    弋途科技完成近亿元 Pre-B 轮融资,AICAR 正式上线

    弋途科技(EXTURING)近日完成近亿元 Pre-B 轮融资,由上海半导体装备材料产业投资基金与 Sands Talk Capital 联合领投,AICAR 正式上线。公司已服务超 70% 的国内头部车企及主流合资品牌,数十款车型规模化量产上车,累计交付达百万级。本轮融资将用于加速 AICAR 规模化推广,并推动结合自研端侧模型的下一代 AICAR 落地。

9月22日周二
  1. OpenBMB40

    太棒了!用 Pi Zero 跑完整感知栈,实时喂给 MiniCPM-o4.5,这是个非常酷的用例。很喜欢看到与个人机器人的实时交互!

    引用Mr Goodman@mrgoodmantweets

    I gave eyes and ears to my robot. I hooked up a Raspberry Pi Zero W2 (webcam + ambient mic), streaming real-time audio/video back and forth to MiniCPM-o 4.5 @OpenBMB open source model running locally on my PC. Zero cloud APIs, full duplex interaction. Project on my git

  2. vLLM 官方博客(RSS)76

    vLLM 官方发布 vllm-metal v0.28.0:在 Apple Silicon 上实现并发推理服务

    vLLM 官方宣布 vllm-metal 首个正式版本 v0.28.0,将上游 vLLM 的 V1 调度器、分页 KV cache 和 OpenAI 兼容服务带到 Apple Silicon,模型执行由 MLX 和 Metal 完成。

    推荐理由:官方详解 vllm-metal 的架构与跨引擎实测数据,读者可据此评估 Apple Silicon 上多并发推理是否值得切换。

  3. Hugging Face:Blog(RSS)23

    oMLX 作者 Jun Kim 加入 Hugging Face,支持 MLX 社区

    oMLX 创作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 生态建设。oMLX 将保持 Apache 2.0 开源协议,由 Jun 继续领导,从副业转为有资金支持的正式项目,以获得更高稳定性与更快开发。Hugging Face 计划让 oMLX 成为新想法的试验场,并推动 transformers 模型定义快速转为可被各引擎使用的 MLX 参考实现。

9月17日周四
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)30

    TensorRT Edge-LLM 在 Jetson AGX Thor 上以 6.4 倍速度完成 MLPerf Edge Agentic Benchmark

    NVIDIA 的 TensorRT Edge-LLM 在 Jetson AGX Thor 上完成 MLPerf Edge Agentic Benchmark,速度提升 6.4 倍。该方案面向从云端数据中心迁移至车辆、机器人等边缘设备的 AI 智能体,针对其多步骤工具调用、结果评估与长对话推理带来的边缘推理新需求,实现快速 token 生成。

9月12日周六
9月10日周四
  1. Apple:Newsroom(RSS)61

    Apple 发布 Apple Watch Series 12 与 Ultra 4 健康功能,重新设计的 Health app 将引入 Longevity 标签页

    Apple 宣布为 Apple Watch 和 iPhone 推出升级的健康与健身体验。Apple Watch Series 12 和 Apple Watch Ultra 4 引入新 Health Sensing System。

    推荐理由:官方新闻稿列出新健康传感系统、Longevity 标签页和在家运动评估等功能的设备要求,可帮助读者判断升级与自家设备的关联。

9月8日周二
9月5日周六
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)34

    NVIDIA Jetson 如何部署与优化前沿推理模型

    NVIDIA 发布技术指南,介绍如何在 Jetson 边缘设备上部署和优化具备多步推理能力的模型。此前这类模型体积过大,无法在边缘硬件本地运行,开发者只能将推理请求路由至数据中心,带来网络依赖、成本上升与数据外泄风险。该指南称这一限制正在被打破。

9月4日周五
  1. Unsloth AI52

    Unsloth AI 宣布用户现在可以通过 Hermes 一键在本地运行 Unsloth GGUF 模型。引用的 Nous Research 内容称 Hermes Desktop 会自动读取硬件、挑选合适模型并下载配置运行时。正文提到支持 Qwen3.8-27B、Qwen3.8-Flash、DeepSeek-V4-Flash 等模型。

    引用Nous Research@NousResearch

    Hermes Desktop now sets up local models in one click. It automatically reads your hardware, picks the best model for you, then downloads it and configures the runtime.

9月3日周四
8月29日周六
8月21日周五
  1. Hugging Face:Blog(RSS)66

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,采用推测解码,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍,输出质量不变。

    推荐理由:原文给出各模型在 GPU 和端侧的实测加速数据与 llama.cpp、SGLang 接入命令,读者可直接评估是否用于部署。

8月20日周四