跳到正文

#论文/研究

今日 6 条
6月17日周三
6月16日周二
6月13日周六
6月11日周四
6月8日周一
  1. Google DeepMind:Blog(RSS)66

    Google DeepMind 发布塞拉利昂 AI 辅助学习试验结果:Gemini Guided Learning 提升数学成绩

    Google DeepMind 公布在塞拉利昂开展的预注册对照试验结果,使用 Gemini Guided Learning 的学生数学成绩提升 0.258 个标准差,约等于 1.2 至 1.7 年的正常学习进度,教师将 Gemini 纳入约一半课时(目标 12 小时)的班级进步更高,约 1.8 至 2.5 年。

    推荐理由:原文给出塞拉利昂预注册试验的核心数据,读者可以了解教师主导下 AI 辅助学习的真实效果与局限。

6月5日周五
  1. Google Research71

    Google Research 发布 PHRM 系统用手机前置摄像头被动监测心率与静息心率

    Google Research 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前置摄像头视频在日常用机时后台估计心率与每日静息心率。

    推荐理由:这项研究覆盖近700名不同肤色的参与者并在真实生活场景验证,读者可以据此了解手机摄像头被动测心率的精度与局限。

6月3日周三
  1. Saining Xie42

    大脑如何从(可能不完整且有噪声的)视觉观察中构建并追踪世界的内部状态? 我相信视觉状态追踪将成为未来几年视觉领域的重大挑战,我希望这个基准能成为一个有用的起点。enjoy!

    引用Sihyun Yu@sihyun_yu

    Can MLLMs actually track what's happening in a video? Introducing VSTAT 🎯, our new benchmark for visual state tracking. The tasks are simple: count cups, read typed words, count page flips. Humans solve them easily. MLLMs don't. https://vision-x-nyu.github.io/vstat-site/ 🧵 [1/11]

5月28日周四
  1. Google Research43

    Google 如何用零信任聚合实现隐私分析

    Google 提出一种零信任隐私分析方案,将新型单消息密码学聚合协议与 TEE 结合,使设备只需一次性提交数据,无需多轮在线交互。该设计保证 Google 只能获得匿名聚合结果,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 证明机制则验证聚合代码按公开代码正确执行。

5月27日周三
  1. Saining Xie44

    📸cambrian系列最新作品:cambrian-p,p代表pose。 我认为pose可能是我们需要的、用于稳健视频多模态模型的最小充分3D信号(而且很容易获取!)——联合建模帧和pose,将图像序列转变为全局有根基的结构。

    引用Jihan Yang@jihanyang13

    Camera pose matters for video understanding! Today's MLLMs excel at recognizing activities, but still struggle with the underlying space and ego/object dynamics in video. We trace this gap to a missing piece: camera pose. Introducing Cambrian-P: a multimodal LLM natively grounded in camera pose. (1/n)

5月16日周六
5月14日周四
5月12日周二
  1. Google DeepMind:Blog(RSS)62

    Google DeepMind 发表 Co-Scientist 多智能体科学假设生成系统,并通过 Hypothesis Generation 开放研究者注册

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,通过生成、辩论和进化假设来加速复杂科学问题研究,并将在未来几周通过 labs.google/science 向个人研究者开放。

    推荐理由:原文给出多智能体架构、想法锦标赛机制和多个实验室应用结果,读者可了解它如何辅助科学假设生成与验证。

5月8日周五
5月7日周四
  1. OpenAI:Alignment 研究博客(RSS)66

    OpenAI 调查 RL 训练中意外评分 CoT 的后果

    OpenAI 报告其自动检测系统发现多个已发布模型在 RL 训练中意外受到有限的 CoT 评分,涉及 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini,GPT-5.5 未受影响。

    推荐理由:OpenAI 自曝已发布模型在 RL 中出现过意外 CoT 评分,并给出检测系统与影响分析,读者可了解其监控性保护实践。

5月2日周六
  1. Sierra:Blog(RSS)67

    Sierra 发布 𝜏-voice 基准:在真实音频条件下评测实时语音智能体

    Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。

    推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。

4月30日周四
  1. Google DeepMind:Blog(RSS)64

    Google DeepMind 发布 AI co-clinician 医疗协作智能体研究

    Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生临床监督下辅助患者照护的 AI 智能体。在 98 个真实初级保健问题的盲评中,该系统在 97 例中零关键错误,优于两种医生广泛使用的 AI 系统;在 OpenFDA RxQA 开放式用药问答上超越其他前沿模型。

    推荐理由:原文给出盲评与模拟问诊的测试结果和局限,读者可以了解医疗 AI 在辅助医生与患者场景中的实际表现边界。

4月24日周五
  1. Together AI 研究与产品博客(RSS)45

    Together AI 用分布感知推测解码将 RL rollout 加速最高 50%

    Together AI 提出分布感知推测解码(DAS),在 RL 后训练中最高减少 50% 的 rollout 时间且不改变模型输出。DAS 由自适应后缀树草稿器和长度感知调度两部分组成,前者无需梯度更新即可持续适配策略变化,后者通过跨 GPU 负载均衡与 GPU 内推测预算分配削减长尾请求。

4月22日周三
4月20日周一
4月16日周四
4月15日周三
  1. Together AI 研究与产品博客(RSS)48

    Together AI 推出 Parcae:稳定循环架构用一半参数追平 1.3B Transformer

    Together AI 提出稳定循环架构 Parcae,通过将激活多次穿过同一批层来增加计算量,验证困惑度较此前大规模循环模型最多降低 6.3%。770M Parcae 在相同数据上追平 1.3B 参数 Transformer 的质量,参数约减半。团队还首次建立循环的缩放定律,发现计算最优训练需同步提升循环次数与数据量。

4月9日周四
4月7日周二
4月3日周五
4月1日周三
3月26日周四
3月25日周三
  1. Google Research40

    Google Research 推出 S2Vec:用自监督嵌入学习城市建成环境

    Google Research 发布自监督框架 S2Vec,将道路、建筑、商业设施等建成环境特征栅格化为多层图像,再用掩码自编码(MAE)学习通用嵌入向量。在 US-wide 人口密度、收入中位数等社会经济预测的零样本地理外推任务中,S2Vec 通常是最佳单一模型,与图像嵌入做多模态融合后效果普遍优于任一单模态;但在树木覆盖、海拔等环境任务上仍需改进。

3月22日周日
3月18日周三
3月17日周二
3月13日周五
  1. BAIR:Berkeley AI Research Blog34

    伯克利提出 SPEX 与 ProxySPEX:大规模识别 LLM 特征交互

    伯克利 AI 研究团队提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 的关键交互。SPEX 利用稀疏性与低阶性,将交互搜索转化为稀疏恢复问题;ProxySPEX 进一步利用层次结构,以约少 10 倍的消融次数达到 SPEX 的性能。在情感分析任务上,SPEX 在上下文扩展至数千特征时仍保持高忠实度,优于 LIME、Banzhaf 等边际方法。