browser-use 开源 macos-harness:让 LLM 完全自由地控制 Mac
browser-use 在 GitHub 发布 macos-harness 仓库,定位是最简单、最精简的 harness,让大语言模型完全自由地控制一台 Mac。
browser-use 在 GitHub 发布 macos-harness 仓库,定位是最简单、最精简的 harness,让大语言模型完全自由地控制一台 Mac。
Google DeepMind 发布大规模多语言手语转文本模型 SL2T,为 Gboard 和 Pixel 11 的 Live Transcribe 带来手语转文字听写,首先支持 ASL 转英语,后续将扩展更多语言和设备。
推荐理由:原文解释了手语翻译的两类核心难题和 SL2T 的技术取舍,并给出基准分数与隐私设计,读者可了解可用手语 AI 的实现路径。
WhatsApp 推出可选的 Scam Alert 功能,在设备端运行机器学习模型,对非联系人消息进行诈骗概率分类,消息内容不出设备、不自动上报。模型下载经 Cloudflare Ed25519 签名与第三方 append-only 透明账本校验,遥测数据经 TEE、OHTTP 与差分隐私聚合处理;该功能已在 Beta 有限推出,并扩展了 Bug Bounty 计划。
OpenBMB(清华 NLP)在 GitHub 新建仓库 MiniCPM-Robot,定位为面向机器人的更智能、更快的端侧 AI 大脑。该仓库目前仅给出这一句定位描述,尚未披露模型参数规模、benchmark 分数或具体可用形式。
Sebastian Raschka 发布长篇教程,讲解如何用 Ollama 服务 Qwen3.6 35B-A3B 等开源权重模型,并接入 Qwen Code、Codex、Claude Code 三种编码 agent harness,评测代码在 https://github.com/rasbt/local-coding-agent-evals。
Google 宣布将 Multi-Token Prediction(MTP)改造性地部署到已冻结的 Gemini Nano v3 模型上,并已向 Pixel 9 和 10 系列推送。
MIT 研究人员推出名为 Gleanmer 的系统级芯片,能让小型自主机器人仅用约 6 毫瓦功耗实时构建详细 3D 环境地图,功耗仅相当于一颗 LED。该芯片结合 GMMap 算法与专用硬件,用高斯椭球体替代传统体素表示障碍物与自由空间,单次处理深度图像即可生成高斯分布,无需存储整张图像。该成果已在 IEEE VLSI Symposium 上展示,也有望用于轻量 AR 头显。
Google DeepMind 发布 Gemma 4 12B,定位于在笔记本上本地运行的智能体多模态模型,性能接近其 26B MoE 模型而内存占用不到一半。
推荐理由:官方介绍了无编码器统一架构和 16GB 内存本机运行等细节,适合关注端侧多模态部署的开发者参考。
Google 提出一种零信任隐私分析方案,将新型单消息密码学聚合协议与 TEE 结合,使设备只需一次性提交数据,无需多轮在线交互。该设计保证 Google 只能获得匿名聚合结果,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 证明机制则验证聚合代码按公开代码正确执行。
OpenBMB 发布 MiniCPM-Desk-Pet,一款由 MiniCPM5 驱动的本地优先(local-first)桌面宠物。该仓库主打在本地运行,强调数据与推理不依赖云端。
Google DeepMind 发布 Gemma 4 开源模型,主打高级推理与智能体工作流,采用 Apache 2.0 许可,提供 E2B、E4B、26B MoE 和 31B Dense 四个尺寸。
推荐理由:官方给出四个尺寸、榜单排名、上下文长度和开放许可等具体信息,读者可以据此判断选型与部署空间。
OpenBMB 推出 EdgeClaw,一个基于 OpenClaw 的边缘-云协同个人 AI 助手。该仓库由清华 NLP 团队开源,定位为端云协同架构的个人助理项目。
Mistral 发布新一代模型系列 Mistral 3,包括 Mistral Large 3(41B 激活、675B 总参数的 MoE 模型)和 Ministral 3 的 3B、8B、14B 三种小模型,全部以 Apache 2.0 许可开源。
推荐理由:官方发布了完整模型规格、开源许可和部署路径,读者可以据此评估这批开源模型在自己的场景中是否可用。
Mistral AI 发布 Mistral Small 3.1,改进文本性能、新增多模态理解,上下文窗口扩展至 128k tokens,推理速度达每秒 150 tokens,并以 Apache 2.0 许可开源。
推荐理由:官方给出基准对比与部署门槛,读者可以据此评估它在小参数量开源模型中的实际位置。