Liquid AI 发布 LFM2.5 Q4_0 量化感知蒸馏检查点,面向边缘部署
Liquid AI 发布 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 的 4-bit Q4_0 检查点,采用量化感知蒸馏(QAD)训练,四款模型均保留约 97% 的 BF16 平均性能。
Liquid AI 发布 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 的 4-bit Q4_0 检查点,采用量化感知蒸馏(QAD)训练,四款模型均保留约 97% 的 BF16 平均性能。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpot 草稿模型权重,通过投机解码在不改变输出质量的前提下大幅提升解码速度,草稿模型约为 3 亿参数。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,以约 280M 参数(增加 8.9% 内存占用)换取更快解码,GPU 解码吞吐最高提升 2.66 倍、边缘设备最高 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍。
Liquid AI 的 Liquid Foundation Models(LFMs)主打在真实约束下运行,可在 GPU、CPU、NPU 上无缝部署于可穿戴设备、机器人、手机、笔记本、汽车等终端。每个 LFM 均可免费下载、运行和微调(含商用),直到公司年收入超过 $10M。模型面向毫秒级延迟、端侧韧性与数据隐私设计,支持本地、云端及混合 AI 部署。
NVIDIA 在 IFA 2026 宣布与 Microsoft 及伙伴合作加速本地 AI,包括 Hermes Agent、OpenClaw 和 Perplexity Portable Computer 的简化本地模型配置,llama.cpp 与 vLLM 带来最高 1.9x 推理提升,并推出开源工具 NVIDIA PAIR 在局域网内分发推理请求。
Perplexity 在 Windows 版应用中推出 Portable Computer,可在兼容的 NVIDIA GeForce RTX PC 和 RTX PRO Workstation 上本地运行,此前已支持 DGX Spark 和 Linux RTX PC。
Artificial Analysis 发布开源工具 AA-AgentPerf-Local,通过回放真实 Agent 轨迹(默认 8 个任务、168 轮、上下文增长至约 56K tokens)测试笔记本和工作站上的本地模型推理性能。
Google 宣布 Antigravity SDK 支持本地模型工作流,首发支持基于 Google AI Edge LiteRT 的 Gemma 4 26B A4B,可完全离线运行智能体辅助,建议机器配备超过 24GB VRAM 或统一内存。
推荐理由:官方给出了本地智能体工作流的完整上手步骤和混合编排演示,含具体 token 与硬件数据,可直接照做复现。
ACEMAGIC 在海外市场推出 RX16 笔记本,搭载英特尔酷睿 Ultra X7 358H 处理器,16 核心最高睿频 4.8GHz,NPU 算力 50 TOPS,售价 1,159 美元。该机配备 24GB LPDDR5-7467 内存与 1TB PCIe 4.0 固态硬盘,双风扇双热管设计可实现 65W 性能释放,屏幕为 16 英寸 1920*1200 60Hz。
研究者提出一种神经符号路由器,用 L* 语法推断算法学习确定性有限自动机(DFA),将结构化查询分派给确定性求解器,仅把开放式应用题留给小语言模型(SLM)。
本地 AI:在 DGX Spark 与 Station 上运行 Nemotron | Nemotron Labs https://x.com/i/broadcasts/1RKZzBOEWMNKB
在云端 Claw 类助手(为强大模型提供虚拟计算机)日益成为个人 AI 前进方向的世界里,这似乎确实表明 Apple 为 Siri 所做的选择(端侧、能力有限)可能是错误的方向。
微软本周发布的新 Surface PC 不再使用 "Copilot+ PC" 品牌标识,尽管这些设备仍满足该标签的全部要求。Surface 部门企业副总裁 Brett Ostrum 确认,新品仍主打端侧 AI 与混合方案。
Google 在 Google Health 应用中推出 Health Guardian 功能,Pixel Watch 用户可设置血压趋势、胰岛素抵抗趋势和睡眠呼吸质量指标,本周开始启用,首批趋势报告将于 10 月初送达。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,设备端解码最高提速 3.13x、H100 上 2.66x,端到端最高提升 2.62x 和 2.27x。
Meta 发布一款不带摄像头的 Ray-Ban 眼镜,用户只能通过语音与 Meta 的 AI 助手交互,并称 Muse 助手很快会上线眼镜端。同一场发布中的新款 VR 眼镜将于明年春季上市,售价 1,300 美元,比前代 Quest 3 轻五倍,眼镜用户还能用全息数字分身代替自己出现在视频通话中。
FIT-GGUF 为 MiniCPM5-2B 提供可控尺寸的混合精度量化,开发者 @Scorp1o_117 据此构建了 4 个 GGUF 变体,体积从约 1.14 GiB 到 1.46 GiB。
Apple 提出一种潜空间蒸馏方法压缩流式神经音频编码器:不监督离散 token 或输出分布,而是让学生编码器回归教师模型每帧的量化前潜表示,并用单层仿射层吸收师生宽度差异。在 2.8× 压缩下,六组师生配对中有五组无需微调即保持在教师 1.9% 相对 WER 以内,并比同容量独立训练编码器相对提升 3.9%。该方案同时适用于单独预训练和与语言模型联合训练的 tokenizer。
Meta 把用于 WhatsApp 和 Meta AI 应用的 Private Processing 机密计算基础设施扩展到 AI 眼镜,让流式转录、上下文搜索和长期回忆等云端 AI 负载在机密虚拟机(CVM)内运行,Meta 自身也无法读取用户数据。该方案基于 CPU 与 GPU 的 TEE 硬件隔离,客户端通过远程证明校验软件镜像,并叠加不可定向性与加密存储。
弋途科技(EXTURING)近日完成近亿元 Pre-B 轮融资,由上海半导体装备材料产业投资基金与 Sands Talk Capital 联合领投,AICAR 正式上线。公司已服务超 70% 的国内头部车企及主流合资品牌,数十款车型规模化量产上车,累计交付达百万级。本轮融资将用于加速 AICAR 规模化推广,并推动结合自研端侧模型的下一代 AICAR 落地。
Apple 宣布新款 Mac mini 和 Mac Studio 今日上市。Mac mini 搭载 M6(4x AI 性能、2x 图形和存储、40% CPU 性能提升。
推荐理由:官方公告给出两款新 Mac 的芯片、AI 性能倍数、统一内存上限和定价,读者可以据此评估端侧 AI 与升级选择。
太棒了!用 Pi Zero 跑完整感知栈,实时喂给 MiniCPM-o4.5,这是个非常酷的用例。很喜欢看到与个人机器人的实时交互!
I gave eyes and ears to my robot. I hooked up a Raspberry Pi Zero W2 (webcam + ambient mic), streaming real-time audio/video back and forth to MiniCPM-o 4.5 @OpenBMB open source model running locally on my PC. Zero cloud APIs, full duplex interaction. Project on my git
vLLM 官方宣布 vllm-metal 首个正式版本 v0.28.0,将上游 vLLM 的 V1 调度器、分页 KV cache 和 OpenAI 兼容服务带到 Apple Silicon,模型执行由 MLX 和 Metal 完成。
推荐理由:官方详解 vllm-metal 的架构与跨引擎实测数据,读者可据此评估 Apple Silicon 上多并发推理是否值得切换。
Hugging Face 为 transformers 加入 GGUF 模型支持,用户可从 Hub 选取 GGUF 检查点,通过 from_pretrained 传入 gguf_file 在本地生成。
推荐理由:Hugging Face 把 GGUF 量化模型接入 transformers,读者可据此判断本地推理工作流会如何变化。
oMLX 创作者兼维护者 Jun Kim 加入 Hugging Face,全职投入 MLX 生态建设。oMLX 将保持 Apache 2.0 开源协议,由 Jun 继续领导,从副业转为有资金支持的正式项目,以获得更高稳定性与更快开发。Hugging Face 计划让 oMLX 成为新想法的试验场,并推动 transformers 模型定义快速转为可被各引擎使用的 MLX 参考实现。
NVIDIA 的 TensorRT Edge-LLM 在 Jetson AGX Thor 上完成 MLPerf Edge Agentic Benchmark,速度提升 6.4 倍。该方案面向从云端数据中心迁移至车辆、机器人等边缘设备的 AI 智能体,针对其多步骤工具调用、结果评估与长对话推理带来的边缘推理新需求,实现快速 token 生成。
Apple 发布 iPhone 18 Pro 和 iPhone 18 Pro Max,搭载 48MP 可变光圈 Fusion 主摄、A20 Pro 与新一代均热板,随 iOS 27 以 beta 推出 Siri AI。
Apple 宣布为 Apple Watch 和 iPhone 推出升级的健康与健身体验。Apple Watch Series 12 和 Apple Watch Ultra 4 引入新 Health Sensing System。
推荐理由:官方新闻稿列出新健康传感系统、Longevity 标签页和在家运动评估等功能的设备要求,可帮助读者判断升级与自家设备的关联。
Arm 公布 C2-Ultra CPU 核心、G2-Ultra NX GPU IP 和面向数据中心的 Neoverse CSS N4 IP,其中 G2-Ultra 已用于 8 月 24 日发布的小米 XRING O3。
NVIDIA 发布技术指南,介绍如何在 Jetson 边缘设备上部署和优化具备多步推理能力的模型。此前这类模型体积过大,无法在边缘硬件本地运行,开发者只能将推理请求路由至数据中心,带来网络依赖、成本上升与数据外泄风险。该指南称这一限制正在被打破。
Hermes Desktop now sets up local models in one click. It automatically reads your hardware, picks the best model for you, then downloads it and configures the runtime.
三星在 Hot Chips 2026 上介绍了其 LPDDR5X-PIM 方案,在 16 个 bank 中各放置一个 PIM 块,通过 MAC 阵列利用芯片内部带宽,合计可达 614 GB/s,而常规 DRAM 访问最高仅 76.8 GB/s。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,采用推测解码,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍,输出质量不变。
推荐理由:原文给出各模型在 GPU 和端侧的实测加速数据与 llama.cpp、SGLang 接入命令,读者可直接评估是否用于部署。
NVIDIA 探索通用编程智能体能否借助 HoloHub 中的示例、文档和开发工具来开发 Holoscan 边缘实时 AI 应用。Holoscan 是面向医疗影像、机器人等边缘实时 AI 应用的平台,HoloHub 是其配套仓库,汇集了不断增长的参考应用与组件。