‼️The Bitter Lesson for context management: Giving LMs unrestricted control over their context beats human-designed SOTA! Introducing 🩵Context Language Models (CLMs)🩵 - Natively manage their own context - Treat context as a file - Learn policies in CLM weights, no harness
#Meta
#Meta
今日 1 条
Rohan Paul@rohanpaul_aiAI 评分4040引用Rulin Shao@RulinShao
METR:Research(网页)精选AI 评分7070 METR 发布前沿 AI 风险试点评估报告,Anthropic、Google、Meta 和 OpenAI 参与
METR 自 2026 年 2 月起开展试点评估,测试前沿 AI 开发商内部使用的 Agent 的错位风险,Anthropic、Google、Meta 和 OpenAI 参与。
推荐理由:报告给出多家前沿实验室参与的真实评估结果,读者可以据此了解当前模型在开放式任务和红队测试中的实际能力边界。
ARC Prize:官方博客精选AI 评分7070 ARC Prize 实测各大推理模型:ARC-AGI-1 无明显赢家,ARC-AGI-2 仍未被攻克
ARC Prize 测试了各大实验室的 AI 推理系统,在 ARC-AGI-1 上得出准确率与成本的 Pareto 前沿,没有单一赢家:追求最高准确率选 OpenAI o3-medium/o3-high(o3-preview low 为 75.7% 但单任务 $200)。
推荐理由:ARC Prize 用统一基准横向比较各大推理系统,给出按准确率、成本和效率选型的具体建议,可直接用于模型选型。
arXiv:cs.AI(全量分类)AI 评分4242 PersonaDose:用校准激活引导实现分级人格特质控制
PersonaDose 通过特质描述与目标平均强度来控制语言模型的人格表达,在 Llama-3.1-8B、Qwen3-8B 和 Gemma-3-4B 上,其核心特质表达在 Persona Vectors 75 连贯性下限处分别比对比激活加法高出 33.2、18.3 和 17.8 分。
arXiv:cs.AI(全量分类)AI 评分4545 基于 LLM 的社交媒体模拟中重复效应因模型而异:幻觉真相还是单纯曝光?
研究用两阶段实验设计在社交媒体信息流中测试了 Gemma-3-4b-it、Qwen2.5-7B-Instruct、Llama-3.1-8B-Instruct 和 GPT-5-nano 四个 LLM 的重复曝光效应,共收集 336,000 条真实性、重要性、情感和兴趣评分。
arXiv:cs.LG(机器学习,全量分类)AI 评分3737 语言模型在串行任务需求下如何重新分配注意力头活动
研究在固定提示词长度下改变任务串行步数,测量17个开源权重模型每一层注意力头活动是集中还是分散。多数模型在接近中层前的层集中活动、后续层分散,且模型间差异可复现;Qwen2.5 0.5B至7B比平均模型更分散,Llama 1B至8B与OLMo-2则在第二半部分分散,Llama-3.1-70B与Qwen2.5-72B的对比在层数与头数相同时依然成立。
arXiv:cs.LG(机器学习,全量分类)AI 评分4040 ThinQuant:面向 LLM 权重与激活量化的可扩展旋转学习
ThinQuant 通过基于激活凸包几何结构的数据选择与精确降维优化,实现 LLM 低比特权重和激活量化中的高效旋转学习。Llama-3-70B 在 W4A4KV4 下旋转校准不到 12 分钟,WikiText-2 困惑度 5.63,优于 DartQuant 的 7.55(需 111 分钟)。
Meta AI:Blog(网页)AI 评分6161 Meta AI 发布 Brain2Qwerty v2:非侵入式脑信号实时解码句子,词准确率达 61%
Meta AI 推出 Brain2Qwerty v2,可从非侵入式脑记录(MEG)实时解码完整句子,词准确率 61%,远高于其他非侵入式方法的 8%,最佳参与者达 78%。
arXiv:cs.LG(机器学习,全量分类)AI 评分4141 GapFT:利用 Pass@K 与 Pass@1 之间的差距进行微调
研究者提出 GapFT,按源检查点的单样本结果筛选训练数据,专门微调 Pass@K 与 Pass@1 之间的差距,即策略单次失败但 K 次采样内能解决的问题。
Meta Engineering Blog(RSS)AI 评分4747 Meta 广告排序的多阶段序列模型:从用户序列到 LLM 式缩放定律
Meta 为广告排序提出多阶段序列模型,将离线用户建模与在线排序解耦,并引入稠密 tokenization 与 target-aware attention,使序列模型呈现可预测的 LLM 式缩放定律。该平台已带来 Instagram 转化率 6%、Facebook 转化率 3%、Facebook 广告点击 3.5% 的累计提升,并成为 Meta 生成式广告推荐模型 GEM 的核心组件。