跳到正文

#Meta

今日 12 条
今天10月1日周四
  1. IT之家(RSS)61

    谷歌推出 Gemini 4 Argon 旗舰模型,内部员工质疑其实战编码表现

    据彭博社报道,谷歌开始逐步推出旗舰模型 Gemini 4 Argon,先向一小批网络安全合作伙伴开放,之后优先面向付费订阅用户。谷歌称该模型多项基准测试靠前,安全测试成绩超过 OpenAI 的 Astra,但知情人士称其实际处理部分代码任务表现不佳,尤其前端设计能力参差不齐,且模型体量庞大、运行成本高。

  2. Rohan Paul40

    Meta 论文提出让 AI 智能体自行管理上下文,无需硬编码遗忘规则,模型能判断哪些内容仍重要并保留,效果更好且算力更省。在深度研究基准上,该方法比 Codex 式摘要得分高 11.4%,算力消耗少 21.5%,且无需训练、现有模型即可实现。

    引用Rulin Shao@RulinShao

    ‼️The Bitter Lesson for context management: Giving LMs unrestricted control over their context beats human-designed SOTA! Introducing 🩵Context Language Models (CLMs)🩵 - Natively manage their own context - Treat context as a file - Learn policies in CLM weights, no harness

  3. The Decoder:AI News(RSS)74

    Meta将AI数据中心申报为试点模型,2025年省税39亿美元

    Meta将AI数据中心归类为试点模型、Nvidia芯片列为实验材料,2025年据此获得39亿美元研究税收抵免,为上市公司中最大受益者,此前两年分别为20亿和7亿美元。该抵免源于1981年法律,Meta在SEC文件中提示可能被IRS追缴,相关准备金已增至187.4亿美元;其审计方EY参与了方案设计,并向其他公司推销同样做法。

  4. TechCrunch:AI(RSS)62

    消费级 AI 的难看账本:付费率低迷推动行业转向企业业务

    TechCrunch 分析指出,尽管 Meta Muse、OpenAI Dots 和 Instinct 让消费级 AI 回温,其底层经济性并未改善。截至 5 月仅 2.2% 的消费者为 AI 付费,月均支出 31 美元;即使按 Netflix 式 3.25 亿订阅规模测算,约 34 美元客单价也只带来 110 亿美元年收入,不足 OpenAI 运营成本的三分之一。

9月30日周三
  1. METR:Research(网页)70

    METR 发布前沿 AI 风险试点评估报告,Anthropic、Google、Meta 和 OpenAI 参与

    METR 自 2026 年 2 月起开展试点评估,测试前沿 AI 开发商内部使用的 Agent 的错位风险,Anthropic、Google、Meta 和 OpenAI 参与。

    推荐理由:报告给出多家前沿实验室参与的真实评估结果,读者可以据此了解当前模型在开放式任务和红队测试中的实际能力边界。

  2. LMSYS:Blog(Chatbot Arena 团队)67

    SGLang 为 Meta 30B 多模态模型 Muse Glimmer 提供 Day-0 支持

    SGLang 团队与 Meta Superintelligence Labs 合作,为 30B 参数多模态稠密模型 Muse Glimmer 提供 Day-0 支持,面向本地硬件上的智能体工作流推理。

    推荐理由:原文给出 Muse Glimmer 在 SGLang 上的多硬件部署方案和分平台实测数据,读者可据此评估本地智能体推理的可行配置。

  3. The Verge:AI(RSS)56

    Meta Muse AI 智能体动态汇总:发布、扩展与漏洞修补

    Meta 发布 Muse AI 智能体,宣称可帮用户处理邮件、在线购物等任务,用户需交出数据甚至信用卡才能使用。此后 Meta 宣布了类似电子宠物的 Muse Charm 配件、面向企业的 Muse Enterprise Platform、Mac 应用和智能眼镜支持,并修补了一个可让攻击者控制该智能体的漏洞;Amazon 屏蔽了 Muse 智能体。

  4. Epoch AI:研究、数据与评测35

    Epoch AI:华为到 2030 年能否追上 Nvidia?

    Epoch AI 评估,受美国出口管制限制最关键扩产手段,华为 2026 年 AI 算力产量不足 Nvidia 的 4%,若无法获得外国存储,2028 年这一份额可能降至约 1%。该机构还估计,截至 2025 年约有 29 万至 160 万 H100 等效算力(中位数 66 万)被走私至中国,约占中国总算力的三分之一。

  5. ARC Prize:官方博客70

    ARC Prize 实测各大推理模型:ARC-AGI-1 无明显赢家,ARC-AGI-2 仍未被攻克

    ARC Prize 测试了各大实验室的 AI 推理系统,在 ARC-AGI-1 上得出准确率与成本的 Pareto 前沿,没有单一赢家:追求最高准确率选 OpenAI o3-medium/o3-high(o3-preview low 为 75.7% 但单任务 $200)。

    推荐理由:ARC Prize 用统一基准横向比较各大推理系统,给出按准确率、成本和效率选型的具体建议,可直接用于模型选型。

  6. Tomer Tunguz 博客(VC 分析)72

    Tomer Tunguz 分析 Meta Muse Spark 双轨定价如何把广告模式引入 AI

    Tomer Tunguz 分析 Meta 昨日发布的 Muse Spark 模型及其新定价体系:标准档 muse-spark-1.3 输入 $1.25/m、输出 $4.25/m tokens 且不用于训练。

    推荐理由:作者用两档价差算出 Meta 对训练数据的每 token 定价,为理解以数据换补贴的商业模式提供一个可核算的框架。

  7. arXiv:cs.LG(机器学习,全量分类)37

    语言模型在串行任务需求下如何重新分配注意力头活动

    研究在固定提示词长度下改变任务串行步数,测量17个开源权重模型每一层注意力头活动是集中还是分散。多数模型在接近中层前的层集中活动、后续层分散,且模型间差异可复现;Qwen2.5 0.5B至7B比平均模型更分散,Llama 1B至8B与OLMo-2则在第二半部分分散,Llama-3.1-70B与Qwen2.5-72B的对比在层数与头数相同时依然成立。

  8. IT之家(RSS)65

    Meta 被曝将 AI 数据中心包装成实验性质以获取税收优惠,去年节省近 40 亿美元

    据纽约时报报道,Meta 在税务申报中将耗资数十亿美元的 AI 数据中心归类为试制模型,套用研发税收抵免政策,仅去年一年节省近 40 亿美元税款,并成为美股上市公司中该项优惠的最大受益者。Meta 自家财务人员承认该策略法律支撑不足,节税面临被 IRS 推翻的风险;此前 IRS 正通过司法途径追缴 Meta 借类似避税手段所得的 3.55 亿美元。

  9. Meta AI:Blog(网页)80

    Meta Superintelligence Labs 发布 Muse Spark 多模态推理模型

    Meta Superintelligence Labs 发布 Muse 系列首个模型 Muse Spark,为原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排,已在 meta.ai 和 Meta AI 应用上线,并向部分用户开放私有 API 预览。

    推荐理由:官方披露了预训练效率、RL 与测试时推理三条扩展路径的具体结果,以及 Apollo Research 关于评估意识的独立发现,可据此了解其技术栈现状。

  10. Meta AI:Blog(网页)32

    Meta AI 模型 DINOv3 与 SAM 如何助力匹兹堡大学改造辅助机器人

    Meta 的 DINOv3 与 SAM 正被匹兹堡大学 RAMMP 项目用于辅助机器人,在电池供电的边缘设备上实现实时环境感知。RAMMP 的感知系统基于 RF-DETR,并用 DINOv2 嵌入微调、由 SAM 自动标注训练数据,实现 360 度环境感知与自适应物体检测。团队已把基于 DINO 的图像传感器查询功能集成进首个原型,可检测自动门按钮、杯子和路缘,目前正转向语音与触控输入。