Meta Muse 上线 22 天美国下载量破 500 万次,超过 ChatGPT 同期速度
据 Sensor Tower 数据,Meta 的智能体 AI 助手 Muse 上线约三周,于 9 月 30 日(耗时 22 天)美国下载量突破 500 万次,登顶 App Store 免费榜并连续 12 天保持榜首,速度快于 ChatGPT(56 天)、Grok(103 天)和 Claude(492 天)。
据 Sensor Tower 数据,Meta 的智能体 AI 助手 Muse 上线约三周,于 9 月 30 日(耗时 22 天)美国下载量突破 500 万次,登顶 App Store 免费榜并连续 12 天保持榜首,速度快于 ChatGPT(56 天)、Grok(103 天)和 Claude(492 天)。
据彭博社报道,谷歌开始逐步推出旗舰模型 Gemini 4 Argon,先向一小批网络安全合作伙伴开放,之后优先面向付费订阅用户。谷歌称该模型多项基准测试靠前,安全测试成绩超过 OpenAI 的 Astra,但知情人士称其实际处理部分代码任务表现不佳,尤其前端设计能力参差不齐,且模型体量庞大、运行成本高。
‼️The Bitter Lesson for context management: Giving LMs unrestricted control over their context beats human-designed SOTA! Introducing 🩵Context Language Models (CLMs)🩵 - Natively manage their own context - Treat context as a file - Learn policies in CLM weights, no harness
这篇每日汇总整理了十月初的七条AI行业动态。OpenAI计划一轮融资至少300亿美元,投前估值约1.4万亿美元,年化收入运行率接近700亿美元;NVIDIA于9月28日发布Open Agent Safety Platform。
约 24 家科技公司签署白宫自愿协议,承诺接受独立安全审计、定期会商安全标准,覆盖网络安全、生物安全和化学威胁等风险。协议无法律约束力,Anthropic、Google 和 OpenAI 部分承诺此前已有。
The Verge 分析称,OpenAI 和 Meta 都在用可爱的软件智能体为实体 AI 硬件试水。OpenAI 与 Jony Ive 合作开发硬件,据公开文件计划最早 2027 年 2 月出货,并在 DevDay 发布了带彩色眼睛团子形象的智能体平台 Dots,Altman 称未来把它做进硬件是合理假设。
Muse still crushing the charts:
Meta将AI数据中心归类为试点模型、Nvidia芯片列为实验材料,2025年据此获得39亿美元研究税收抵免,为上市公司中最大受益者,此前两年分别为20亿和7亿美元。该抵免源于1981年法律,Meta在SEC文件中提示可能被IRS追缴,相关准备金已增至187.4亿美元;其审计方EY参与了方案设计,并向其他公司推销同样做法。
特朗普在宴请科技巨头后宣布,Google、Anthropic、Meta、OpenAI、xAI 和 Nvidia 签署“前沿责任联合承诺”,一份“道德约束”性质的安全自律协议,取代联邦 AI 监管。
TechCrunch 分析指出,尽管 Meta Muse、OpenAI Dots 和 Instinct 让消费级 AI 回温,其底层经济性并未改善。截至 5 月仅 2.2% 的消费者为 AI 付费,月均支出 31 美元;即使按 Netflix 式 3.25 亿订阅规模测算,约 34 美元客单价也只带来 110 亿美元年收入,不足 OpenAI 运营成本的三分之一。
Meta 否认记者 Jason Aten 关于其 AI 智能体 Muse 未经许可读取用户 Messages 私人信息的指控。Meta 高管 Andy Stone 称 Muse Mac 应用的 Messages 集成完全需要用户主动开启,David Singleton 则解释读取消息需经过三层应用级权限和 macOS 系统级保护,即使应用有 bug 也无法绕过。
METR 发布参考文件,汇总加州 SB 53、欧盟 Code of Practice、纽约 RAISE Act 和伊利诺伊 SB 315 对前沿 AI 开发者的安全与安保义务,涵盖事件报告、模型评估、安全缓解、内部治理与举报人保护。
SGLang 推出 Encoder-Prefill-Decode(EPD)分离架构,将视觉语言模型(VLM)的视觉编码与语言处理拆分为三层,使编码器服务器可独立横向扩展。
METR 自 2026 年 2 月起开展试点评估,测试前沿 AI 开发商内部使用的 Agent 的错位风险,Anthropic、Google、Meta 和 OpenAI 参与。
推荐理由:报告给出多家前沿实验室参与的真实评估结果,读者可以据此了解当前模型在开放式任务和红队测试中的实际能力边界。
SGLang 团队与 Meta Superintelligence Labs 合作,为 30B 参数多模态稠密模型 Muse Glimmer 提供 Day-0 支持,面向本地硬件上的智能体工作流推理。
推荐理由:原文给出 Muse Glimmer 在 SGLang 上的多硬件部署方案和分平台实测数据,读者可据此评估本地智能体推理的可行配置。
METR 汇总了多家 AI 公司发布的前沿 AI 安全政策清单,涵盖 Amazon、Anthropic、Google DeepMind、G42、Meta、Microsoft、OpenAI 和 xAI。该清单发布于 2025 年 2 月 8 日,原文为西班牙语,可阅读英文版本。
METR 发布了一份由 AI 公司发布的前沿安全政策清单,涵盖 Amazon、Anthropic、Google DeepMind、G42、Meta、Microsoft、OpenAI 和 xAI。
Instagram 宣布其独立 Edits 应用新增 AI 创作助手,可调取用户账号的点赞、观看、留存和分享等数据,回答热门趋势、内容表现差异等问题,并给出选题、脚本、文案、音频等方面的建议。
Meta 发布 Muse AI 智能体,宣称可帮用户处理邮件、在线购物等任务,用户需交出数据甚至信用卡才能使用。此后 Meta 宣布了类似电子宠物的 Muse Charm 配件、面向企业的 Muse Enterprise Platform、Mac 应用和智能眼镜支持,并修补了一个可让攻击者控制该智能体的漏洞;Amazon 屏蔽了 Muse 智能体。
Meta 发布 Muse Glimmer 30B 开源模型(Apache 2.0),并已在 Fireworks 提供 serverless 和按需部署。
推荐理由:原文给出 Muse Glimmer 的架构细节、基准对比和推荐参数,读者可据此评估它是否适合长期运行的多轮 Agent 工作流。
Epoch AI 评估,受美国出口管制限制最关键扩产手段,华为 2026 年 AI 算力产量不足 Nvidia 的 4%,若无法获得外国存储,2028 年这一份额可能降至约 1%。该机构还估计,截至 2025 年约有 29 万至 160 万 H100 等效算力(中位数 66 万)被走私至中国,约占中国总算力的三分之一。
Epoch AI 更新了其 AI 公司数据库,涵盖前沿 AI 主要参与者的收入、融资、员工和算力数据,并推出 AI Chip Users Explorer,首次展示五家领先实验室的算力使用估算(以 Nvidia H100-equivalents 计)。
Tomer Tunguz 撰文称 2026 年 CIO 的优先级清晰:资金流向 AI 栈,其余被削减。
推荐理由:作者用公开市场分板块数据拆解 AI 时期的软件股分化,指出决定估值的是品类而非增速,分析框架可复用。
ARC Prize 测试了各大实验室的 AI 推理系统,在 ARC-AGI-1 上得出准确率与成本的 Pareto 前沿,没有单一赢家:追求最高准确率选 OpenAI o3-medium/o3-high(o3-preview low 为 75.7% 但单任务 $200)。
推荐理由:ARC Prize 用统一基准横向比较各大推理系统,给出按准确率、成本和效率选型的具体建议,可直接用于模型选型。
Tomer Tunguz 撰文认为开源权重模型已多次追平闭源前沿模型,从 DeepSeek R1 到 GLM-4.6、GLM-5.2 和 Kimi K3,但 GPT-5.2 级闭源模型与 Opus 仍率先制造跃迁时刻。
Tomer Tunguz 分析 Meta 昨日发布的 Muse Spark 模型及其新定价体系:标准档 muse-spark-1.3 输入 $1.25/m、输出 $4.25/m tokens 且不用于训练。
推荐理由:作者用两档价差算出 Meta 对训练数据的每 token 定价,为理解以数据换补贴的商业模式提供一个可核算的框架。
PersonaDose 通过特质描述与目标平均强度来控制语言模型的人格表达,在 Llama-3.1-8B、Qwen3-8B 和 Gemma-3-4B 上,其核心特质表达在 Persona Vectors 75 连贯性下限处分别比对比激活加法高出 33.2、18.3 和 17.8 分。
研究用两阶段实验设计在社交媒体信息流中测试了 Gemma-3-4b-it、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 和 GPT-5-nano 四个 LLM 的重复曝光效应,共收集 336,000 条真实性、重要性、情感和兴趣评分。
研究在固定提示词长度下改变任务串行步数,测量17个开源权重模型每一层注意力头活动是集中还是分散。多数模型在接近中层前的层集中活动、后续层分散,且模型间差异可复现;Qwen2.5 0.5B至7B比平均模型更分散,Llama 1B至8B与OLMo-2则在第二半部分分散,Llama-3.1-70B与Qwen2.5-72B的对比在层数与头数相同时依然成立。
ThinQuant 通过基于激活凸包几何结构的数据选择与精确降维优化,实现 LLM 低比特权重和激活量化中的高效旋转学习。Llama-3-70B 在 W4A4KV4 下旋转校准不到 12 分钟,WikiText-2 困惑度 5.63,优于 DartQuant 的 7.55(需 111 分钟)。
据纽约时报报道,Meta 在税务申报中将耗资数十亿美元的 AI 数据中心归类为试制模型,套用研发税收抵免政策,仅去年一年节省近 40 亿美元税款,并成为美股上市公司中该项优惠的最大受益者。Meta 自家财务人员承认该策略法律支撑不足,节税面临被 IRS 推翻的风险;此前 IRS 正通过司法途径追缴 Meta 借类似避税手段所得的 3.55 亿美元。
AI 时尚应用 Alta Daily 基于 Meta 的 Segment Anything Model(SAM)完成服装分割与数字化,已处理超 2000 万张图片。
Meta Superintelligence Labs 发布 Muse 系列首个模型 Muse Spark,为原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排,已在 meta.ai 和 Meta AI 应用上线,并向部分用户开放私有 API 预览。
推荐理由:官方披露了预训练效率、RL 与测试时推理三条扩展路径的具体结果,以及 Apollo Research 关于评估意识的独立发现,可据此了解其技术栈现状。
Meta 发布升级版 Advanced AI Scaling Framework,取代原 Frontier AI Framework,新增"失控风险"评估,并首次推出 Safety & Preparedness Reports。
Meta AI 推出 Brain2Qwerty v2,可从非侵入式脑记录(MEG)实时解码完整句子,词准确率 61%,远高于其他非侵入式方法的 8%,最佳参与者达 78%。
Meta Superintelligence Labs 发布 Muse Image 并预览 Muse Video,均为该实验室首批媒体生成模型。
Meta 介绍其开源模型 Segment Anything Model 3(SAM 3)和 DINOv3 成为由能源部 Genesis Mission 旗下 SYNAPS-I 项目分割管线的核心。
Meta 的 DINOv3 与 SAM 正被匹兹堡大学 RAMMP 项目用于辅助机器人,在电池供电的边缘设备上实现实时环境感知。RAMMP 的感知系统基于 RF-DETR,并用 DINOv2 嵌入微调、由 SAM 自动标注训练数据,实现 360 度环境感知与自适应物体检测。团队已把基于 DINO 的图像传感器查询功能集成进首个原型,可检测自动门按钮、杯子和路缘,目前正转向语音与触控输入。