跳到正文

#论文/研究

今日 173 条
7月16日周四
7月15日周三
7月13日周一
7月9日周四
  1. MIT News(RSS)48

    MIT 推出 FloatForm:小型机器人船群自组装水上漂浮结构

    MIT 团队发布 FloatForm 系统,由 21 厘米见方的方形机器人船组成,可自主组装成刚性结构、拆解并重组,单次运行耗时 4 至 8 分钟。该系统仅需轻量中央规划器分配最终位置,其余导航与避碰由机器人自身完成,仿真显示可平滑扩展至 64 艘的集群。相关论文已发表于 Nature Communications。

7月8日周三
  1. Google Research49

    Google Research 用 Google Maps 路线干预缓解城市拥堵

    Google Research 在 Nature Cities 发表首个大规模真实世界研究,通过修改 Google Maps 算法将不到 2% 的行程引导至相近耗时的替代路线,在美国 10 座城市测试六个月。结果显示目标路段行驶速度中位数提升约 2%,油耗率中位数下降 0.5% 至 1.0%,每座城市每年可减少数千吨 CO2e 排放。

7月1日周三
  1. Jim Fan49

    ENPIRE -> ASPIRE,我们 Physical AutoResearch 系列的第二项工作。我们正在构建机器人自我改进的组件,一次一个 /skill。

    引用Jim Fan@DrJimFan

    Today, we give robots a /skills library that self-evolves and compounds indefinitely! Introducing ASPIRE: a robot solving its 100th task is no longer as clueless as solving its first. Coding agents observe multimodal sensory traces from simulation and real robots, launch an evolutionary search over control programs, and distill the best know-how into an ever-expanding library. ASPIRE is a new type of continual learning: "training" is skill refinement instead of gradient descent. "Trained model" is a repo of sensorimotor skills instead of floating weights. “Distributed training” is a panel of agents each practicing a different skill instead of sharded minibatches. Here's the beauty: ASPIRE gives the tired terms "sim2real transfer" and "cross-embodiment transfer" a whole new meaning. Bridging the sim-to-real gap is notoriously brutal. An end-to-end policy has to swallow both the visual shift (sim looks toyish next to a real camera) and the subtle contact physics it never quite gets right. ASPIRE sidesteps the mess, because it doesn't ship pixels or weights across the gap, but ships the know-how. The robot still has to practice in the real world, not zero-shot, but it gets there way faster because it isn't rediscovering the strategy from scratch. Same for going single-arm to bimanual hardware, which usually requires new data and retraining from zero. ASPIRE achieves up to ~10x cut in "transfer learning” tokens (yes, tokens are the new unit of *training* compute ;) Check out our gallery of 150+ tasks and 90+ skills the robots taught themselves, all on the website! Kind of wild that we can ship the "learned weights" as an HTML page rather than a GGUF. We'll open-source the full stack so your own robot library starts compounding from ours! Deep dive in thread:

  2. Jim Fan47

    Jim Fan 团队发布 ASPIRE,让编码智能体观察仿真与真实机器人的多模态感知轨迹,通过进化搜索控制程序并将最优经验蒸馏进持续扩张的技能库。ASPIRE 把"训练"重新定义为技能精炼而非梯度下降,跨仿真到真实与跨本体迁移时只传技能知识而非像素或权重,迁移学习 token 消耗最多降低约 10x。团队展示了 150+ 任务、90+ 技能,并将开源全栈。

6月30日周二
6月25日周四
  1. Google Research47

    Google 用线性弹性缓存优化云成本,Spanner 内存占用降 15.5%

    Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小以最小化总拥有成本。在 Spanner 生产环境测试数月后,内存占用降低 15.5%,缓存未命中仅增加 5.5%,TCO 降低约 5%,实际 I/O 成本影响仅 0.5%。该方案用可转为几行 C++ 代码的浅层决策树预测页面 TTL,并在缓存写满时回退到 LRU 淘汰。

6月23日周二
  1. MIT News(RSS)43

    MIT 新型芯片 Gleanmer 可助微型机器人实时构建 3D 地图

    MIT 研究人员推出名为 Gleanmer 的系统级芯片,能让小型自主机器人仅用约 6 毫瓦功耗实时构建详细 3D 环境地图,功耗仅相当于一颗 LED。该芯片结合 GMMap 算法与专用硬件,用高斯椭球体替代传统体素表示障碍物与自由空间,单次处理深度图像即可生成高斯分布,无需存储整张图像。该成果已在 IEEE VLSI Symposium 上展示,也有望用于轻量 AR 头显。

6月22日周一
  1. Import AI66

    Import AI 462:AI说服力超越人类专家、自我维持AI时间线与DeepMind探讨通向ASI的路径

    Import AI 第462期报道多项研究:牛津、UK AISI、斯坦福与LSE的实验(4项研究、18,978段对话、6,923人)显示AI文本说服力稳定超越专家人类,Opus 4.1和Opus 4.6最强,AI为Save the Children募集真实捐款的效果约为专业募捐员的3倍;限制AI写作速度和长度可抹平差距。

6月20日周六
6月19日周五
  1. OpenAI:Alignment 研究博客(RSS)53

    OpenAI 研究:针对有益特质的强化学习可实现广泛且持久的对齐泛化

    OpenAI 对齐研究团队发布论文,发现对健康等真实场景中有益特质(诚实、认知谦逊、可纠偏等)做强化学习,可在 44/53 个分布外公开和内部评测上提升对齐表现,涵盖欺骗、reward hacking、有害建议等。仅用单一健康领域训练也能改善非健康域的对齐,且模型在对抗提示和有害微调下更难被推向有害行为,同时保持对正常指令的可操控性。

6月18日周四
6月17日周三
6月16日周二
6月13日周六
6月11日周四
6月8日周一
  1. Google DeepMind:Blog(RSS)66

    Google DeepMind 发布塞拉利昂 AI 辅助学习试验结果:Gemini Guided Learning 提升数学成绩

    Google DeepMind 公布在塞拉利昂开展的预注册对照试验结果,使用 Gemini Guided Learning 的学生数学成绩提升 0.258 个标准差,约等于 1.2 至 1.7 年的正常学习进度,教师将 Gemini 纳入约一半课时(目标 12 小时)的班级进步更高,约 1.8 至 2.5 年。

    推荐理由:原文给出塞拉利昂预注册试验的核心数据,读者可以了解教师主导下 AI 辅助学习的真实效果与局限。

6月6日周六
  1. Ahead of AI(RSS)49

    LLM 研究论文:2026 年清单(1 月至 5 月)

    Ahead of AI 发布 2026 年 1 月至 5 月的 LLM 研究论文精选清单,按架构与模型设计、高效训练与扩展、推理效率与 KV Cache、稀疏注意力与长上下文、推理与测试时计算、强化学习与 RLVR、智能体系统与工具使用、编码智能体与软件工程、扩散语言模型、模型评估与基准等类别整理。

6月5日周五
  1. Google Research71

    Google Research 发布 PHRM 系统用手机前置摄像头被动监测心率与静息心率

    Google Research 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前置摄像头视频在日常用机时后台估计心率与每日静息心率。

    推荐理由:这项研究覆盖近700名不同肤色的参与者并在真实生活场景验证,读者可以据此了解手机摄像头被动测心率的精度与局限。

6月3日周三
  1. Saining Xie42

    大脑如何从(可能不完整且有噪声的)视觉观察中构建并追踪世界的内部状态? 我相信视觉状态追踪将成为未来几年视觉领域的重大挑战,我希望这个基准能成为一个有用的起点。enjoy!

    引用Sihyun Yu@sihyun_yu

    Can MLLMs actually track what's happening in a video? Introducing VSTAT 🎯, our new benchmark for visual state tracking. The tasks are simple: count cups, read typed words, count page flips. Humans solve them easily. MLLMs don't. https://vision-x-nyu.github.io/vstat-site/ 🧵 [1/11]

5月28日周四
  1. Google Research43

    Google 如何用零信任聚合实现隐私分析

    Google 提出一种零信任隐私分析方案,将新型单消息密码学聚合协议与 TEE 结合,使设备只需一次性提交数据,无需多轮在线交互。该设计保证 Google 只能获得匿名聚合结果,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 证明机制则验证聚合代码按公开代码正确执行。

5月27日周三
  1. Saining Xie44

    📸cambrian系列最新作品:cambrian-p,p代表pose。 我认为pose可能是我们需要的、用于稳健视频多模态模型的最小充分3D信号(而且很容易获取!)——联合建模帧和pose,将图像序列转变为全局有根基的结构。

    引用Jihan Yang@jihanyang13

    Camera pose matters for video understanding! Today's MLLMs excel at recognizing activities, but still struggle with the underlying space and ego/object dynamics in video. We trace this gap to a missing piece: camera pose. Introducing Cambrian-P: a multimodal LLM natively grounded in camera pose. (1/n)

5月22日周五
  1. 美团 LongCat:HuggingFace 新模型30

    美团 LongCat 发布 WBench-weights:交互式视频世界模型评测权重

    美团 LongCat 在 HuggingFace 发布 WBench-weights,整合了 WBench 交互式视频世界模型评测框架所需的模型权重,方便社区直接部署。WBench 从视频质量、设定遵循、交互遵循、一致性和物理合规五个维度评测世界模型,包含 289 个测试用例和 1,058 轮交互。权重仅限学术研究与评测用途,可通过 huggingface-cli 下载。

5月21日周四
5月18日周一
5月16日周六
5月14日周四
5月12日周二
  1. Google DeepMind:Blog(RSS)62

    Google DeepMind 发表 Co-Scientist 多智能体科学假设生成系统,并通过 Hypothesis Generation 开放研究者注册

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,通过生成、辩论和进化假设来加速复杂科学问题研究,并将在未来几周通过 labs.google/science 向个人研究者开放。

    推荐理由:原文给出多智能体架构、想法锦标赛机制和多个实验室应用结果,读者可了解它如何辅助科学假设生成与验证。