跳到正文

#Meta

今日 1 条
今天10月1日周四
  1. Rohan Paul40

    Meta 论文提出让 AI 智能体自行管理上下文,无需硬编码遗忘规则,模型能判断哪些内容仍重要并保留,效果更好且算力更省。在深度研究基准上,该方法比 Codex 式摘要得分高 11.4%,算力消耗少 21.5%,且无需训练、现有模型即可实现。

    引用Rulin Shao@RulinShao

    ‼️The Bitter Lesson for context management: Giving LMs unrestricted control over their context beats human-designed SOTA! Introducing 🩵Context Language Models (CLMs)🩵 - Natively manage their own context - Treat context as a file - Learn policies in CLM weights, no harness

9月30日周三
  1. METR:Research(网页)70

    METR 发布前沿 AI 风险试点评估报告,Anthropic、Google、Meta 和 OpenAI 参与

    METR 自 2026 年 2 月起开展试点评估,测试前沿 AI 开发商内部使用的 Agent 的错位风险,Anthropic、Google、Meta 和 OpenAI 参与。

    推荐理由:报告给出多家前沿实验室参与的真实评估结果,读者可以据此了解当前模型在开放式任务和红队测试中的实际能力边界。

  2. ARC Prize:官方博客70

    ARC Prize 实测各大推理模型:ARC-AGI-1 无明显赢家,ARC-AGI-2 仍未被攻克

    ARC Prize 测试了各大实验室的 AI 推理系统,在 ARC-AGI-1 上得出准确率与成本的 Pareto 前沿,没有单一赢家:追求最高准确率选 OpenAI o3-medium/o3-high(o3-preview low 为 75.7% 但单任务 $200)。

    推荐理由:ARC Prize 用统一基准横向比较各大推理系统,给出按准确率、成本和效率选型的具体建议,可直接用于模型选型。

  3. arXiv:cs.LG(机器学习,全量分类)37

    语言模型在串行任务需求下如何重新分配注意力头活动

    研究在固定提示词长度下改变任务串行步数,测量17个开源权重模型每一层注意力头活动是集中还是分散。多数模型在接近中层前的层集中活动、后续层分散,且模型间差异可复现;Qwen2.5 0.5B至7B比平均模型更分散,Llama 1B至8B与OLMo-2则在第二半部分分散,Llama-3.1-70B与Qwen2.5-72B的对比在层数与头数相同时依然成立。

8月6日周四
  1. Meta Engineering Blog(RSS)47

    Meta 广告排序的多阶段序列模型:从用户序列到 LLM 式缩放定律

    Meta 为广告排序提出多阶段序列模型,将离线用户建模与在线排序解耦,并引入稠密 tokenization 与 target-aware attention,使序列模型呈现可预测的 LLM 式缩放定律。该平台已带来 Instagram 转化率 6%、Facebook 转化率 3%、Facebook 广告点击 3.5% 的累计提升,并成为 Meta 生成式广告推荐模型 GEM 的核心组件。