全部AI 动态
全部动态
今日 172 条
Jim Fan@DrJimFanAI 评分4747
Together AI 研究与产品博客(RSS)AI 评分5353 Together AI 在 ICML 2026 发布覆盖全栈的 9 篇论文
Together AI 宣布其 9 篇论文入选 ICML 2026(7 月 6 日至 11 日,首尔,展位 B714),覆盖从智能体到 GPU kernel 的全栈研究。
Hugging Face:Blog(RSS)AI 评分4242 DiScoFormer:一个 Transformer 同时估计密度与 score,跨分布通用
研究者提出 DiScoFormer(Density and Score Transformer),给定一组数据点即可在单次前向传播中同时估计分布的密度与 score,无需针对新分布重新训练。
Google ResearchAI 评分5858 Google 用冻结 Multi-Token Prediction 加速 Pixel 上的 Gemini Nano 模型
Google 宣布将 Multi-Token Prediction(MTP)改造性地部署到已冻结的 Gemini Nano v3 模型上,并已向 Pixel 9 和 10 系列推送。
Google ResearchAI 评分4747 Google 用线性弹性缓存优化云成本,Spanner 内存占用降 15.5%
Google Research 提出线性弹性缓存,将页面淘汰建模为滑雪租赁问题,用轻量机器学习动态调整缓存大小以最小化总拥有成本。在 Spanner 生产环境测试数月后,内存占用降低 15.5%,缓存未命中仅增加 5.5%,TCO 降低约 5%,实际 I/O 成本影响仅 0.5%。该方案用可转为几行 C++ 代码的浅层决策树预测页面 TTL,并在缓存写满时回退到 LRU 淘汰。
MIT News(RSS)AI 评分4949 MIT 与微软提出 Murakkab:自动优化 AI 智能体工作流的能效与成本
MIT 与微软 Azure 研究人员提出智能体工作流优化系统 Murakkab,开发者只需用自然语言描述意图,系统即自动选择模型与工具、并行调度并动态分配云端硬件资源。
Google ResearchAI 评分5454 Google Research 探究推理如何解锁 LLM 的参数化知识
Google Research 将在 COLM 2026 发表的论文 Thinking to Recall 发现,开启链式推理能让 Gemini-2.5(Flash 和 Pro)与 Qwen3-32B 检索到关闭推理时几乎无法召回的简单事实。
MIT News(RSS)AI 评分4343 MIT 新型芯片 Gleanmer 可助微型机器人实时构建 3D 地图
MIT 研究人员推出名为 Gleanmer 的系统级芯片,能让小型自主机器人仅用约 6 毫瓦功耗实时构建详细 3D 环境地图,功耗仅相当于一颗 LED。该芯片结合 GMMap 算法与专用硬件,用高斯椭球体替代传统体素表示障碍物与自由空间,单次处理深度图像即可生成高斯分布,无需存储整张图像。该成果已在 IEEE VLSI Symposium 上展示,也有望用于轻量 AR 头显。
Together AI 研究与产品博客(RSS)AI 评分5050 Together AI 发布 ParallelKernelBench:前沿模型尚难写出快速多GPU kernel
Together AI 发布多GPU kernel生成基准 ParallelKernelBench(PKB),含87道源自 Megatron-LM、DeepSpeed、TensorRT-LLM 等真实代码库的问题,任务是将 PyTorch + NCCL 参考实现替换为直接通过 NVLink 通信的 CUDA kernel。
通义 QwenAudio:原创语音项目AI 评分4646 Qwen-AgentWorld:面向通用智能体的语言世界模型
通义 QwenLM 推出 Qwen-AgentWorld,将其定位为面向通用智能体的语言世界模型。该项目的核心思路是用语言模型构建世界模型,以支撑通用智能体的能力。目前公开信息仅包含项目名称与这一方向性描述。
Import AIAI 评分6666 Import AI 462:AI说服力超越人类专家、自我维持AI时间线与DeepMind探讨通向ASI的路径
Import AI 第462期报道多项研究:牛津、UK AISI、斯坦福与LSE的实验(4项研究、18,978段对话、6,923人)显示AI文本说服力稳定超越专家人类,Opus 4.1和Opus 4.6最强,AI为Save the Children募集真实捐款的效果约为专业募捐员的3倍;限制AI写作速度和长度可抹平差距。
OpenBMB(清华 NLP):GitHub 新仓库AI 评分2828 OpenBMB 发布 SHIFT:面向 RAG 知识冲突缓解的门控激活引导
OpenBMB(清华 NLP)在 GitHub 发布 SHIFT 源码,对应论文《SHIFT: Gate-Modulated Activation Steering for Knowledge Conflict Mitigation in Retrieval-Augmented Generation》。该方法通过门控调制的激活引导,缓解检索增强生成中的知识冲突问题。
OpenAI:Alignment 研究博客(RSS)AI 评分5353 OpenAI 研究:针对有益特质的强化学习可实现广泛且持久的对齐泛化
OpenAI 对齐研究团队发布论文,发现对健康等真实场景中有益特质(诚实、认知谦逊、可纠偏等)做强化学习,可在 44/53 个分布外公开和内部评测上提升对齐表现,涵盖欺骗、reward hacking、有害建议等。仅用单一健康领域训练也能改善非健康域的对齐,且模型在对抗提示和有害微调下更难被推向有害行为,同时保持对正常指令的可操控性。
Alibaba:GitHub 新仓库AI 评分3838 阿里巴巴发布 atrex-bench:AI 生成 GPU kernel 的端到端基准
阿里巴巴开源 atrex-bench,一个面向 AI 生成 GPU kernel 的端到端基准,取材自真实生产 trace。它要求把 PyTorch 参考实现改写为 Triton、Gluon、FlyDSL、CuteDSL 等 DSL kernel,并从编译、数值正确性和 speed-of-light 效率三个维度评分,同时覆盖 AMD 与 NVIDIA GPU。
OpenAI:Alignment 研究博客(RSS)AI 评分5353 OpenAI 验证 WildChat 公开对话数据可预测真实世界模型失准行为
OpenAI 在 Alignment 博客发布 Deployment Simulation 验证工作:用 WildChat 对话前缀重新生成 5 个 OpenAI 模型(含 o3。
上海人工智能实验室 InternLM:原创项目AI 评分3232 InternLM 发布 RNGBench:评估多模态大语言模型在可控非马尔可夫博弈中的表现
上海人工智能实验室 InternLM 项目开源 RNGBench,用于在可控非马尔可夫博弈中评估多模态大语言模型,相关论文已被 EMNLP 2026 收录。该基准聚焦"超越当前观测"的评测场景,官方实现已随项目公开。
Google ResearchAI 评分5353 Google Research 发布 AI 辅助皮肤病理解研究
Google Research 发布关于 AI 帮助用户理解皮肤状况的研究,包括本周发表于 JAMA Dermatology 的大规模定量研究和此前发表于 ACM CHI 的混合方法研究。
Google ResearchAI 评分4848 Google Research 提出审计机器遗忘的新框架 Regularized f-Divergence Kernel Tests
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于审计机器遗忘,通过相对距离检验判断遗忘后模型在分布上更接近安全重训模型还是原始受损模型。
Google DeepMind:Blog(RSS)精选AI 评分6666 Google DeepMind 发布塞拉利昂 AI 辅助学习试验结果:Gemini Guided Learning 提升数学成绩
Google DeepMind 公布在塞拉利昂开展的预注册对照试验结果,使用 Gemini Guided Learning 的学生数学成绩提升 0.258 个标准差,约等于 1.2 至 1.7 年的正常学习进度,教师将 Gemini 纳入约一半课时(目标 12 小时)的班级进步更高,约 1.8 至 2.5 年。
推荐理由:原文给出塞拉利昂预注册试验的核心数据,读者可以了解教师主导下 AI 辅助学习的真实效果与局限。
Ahead of AI(RSS)AI 评分4949 LLM 研究论文:2026 年清单(1 月至 5 月)
Ahead of AI 发布 2026 年 1 月至 5 月的 LLM 研究论文精选清单,按架构与模型设计、高效训练与扩展、推理效率与 KV Cache、稀疏注意力与长上下文、推理与测试时计算、强化学习与 RLVR、智能体系统与工具使用、编码智能体与软件工程、扩散语言模型、模型评估与基准等类别整理。
Google Research精选AI 评分7171 Google Research 发布 PHRM 系统用手机前置摄像头被动监测心率与静息心率
Google Research 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前置摄像头视频在日常用机时后台估计心率与每日静息心率。
推荐理由:这项研究覆盖近700名不同肤色的参与者并在真实生活场景验证,读者可以据此了解手机摄像头被动测心率的精度与局限。
Saining Xie@sainingxieAI 评分4242大脑如何从(可能不完整且有噪声的)视觉观察中构建并追踪世界的内部状态? 我相信视觉状态追踪将成为未来几年视觉领域的重大挑战,我希望这个基准能成为一个有用的起点。enjoy!
引用Sihyun Yu@sihyun_yuCan MLLMs actually track what's happening in a video? Introducing VSTAT 🎯, our new benchmark for visual state tracking. The tasks are simple: count cups, read typed words, count page flips. Humans solve them easily. MLLMs don't. https://vision-x-nyu.github.io/vstat-site/ 🧵 [1/11]
上海人工智能实验室 InternLM:原创项目AI 评分3434 InternLM 发布 OVO-S-Bench:多模态 LLM 流式空间智能分层基准
上海人工智能实验室 InternLM 团队开源 OVO-S-Bench,一个面向多模态 LLM 流式空间智能的分层评测基准,论文已被 EMNLP 2026 接收为 Oral。该基准用于评估模型在流式输入下的空间理解能力,官方实现已同步放出。
Google ResearchAI 评分4343 Google 如何用零信任聚合实现隐私分析
Google 提出一种零信任隐私分析方案,将新型单消息密码学聚合协议与 TEE 结合,使设备只需一次性提交数据,无需多轮在线交互。该设计保证 Google 只能获得匿名聚合结果,原始数据即使在硬件保护范围内也不会被解密或重建,TEE 证明机制则验证聚合代码按公开代码正确执行。
Hugging Face:GitHub 新仓库AI 评分2929 Hugging Face 发布 cadgenbench:AI 驱动 CAD 生成与编辑基准
Hugging Face 上线 cadgenbench,一个面向 AI 驱动 CAD 生成与编辑的基准。该仓库用于评测模型在 CAD 生成与编辑任务上的表现,具体指标与数据集细节尚未在现有信息中披露。
上海人工智能实验室 InternLM:原创项目AI 评分2828 InternLM 提出 Skill-as-Pseudocode:将 markdown 技能库重构为类型化伪代码契约
上海人工智能实验室 InternLM 项目提出 Skill-as-Pseudocode,把 markdown 技能库重构为带类型的伪代码契约,供 LLM 智能体调用,该工作入选 EMNLP 2026 Findings。
Saining Xie@sainingxieAI 评分4444引用Jihan Yang@jihanyang13Camera pose matters for video understanding! Today's MLLMs excel at recognizing activities, but still struggle with the underlying space and ego/object dynamics in video. We trace this gap to a missing piece: camera pose. Introducing Cambrian-P: a multimodal LLM natively grounded in camera pose. (1/n)
美团 LongCat:HuggingFace 新模型AI 评分3030 美团 LongCat 发布 WBench-weights:交互式视频世界模型评测权重
美团 LongCat 在 HuggingFace 发布 WBench-weights,整合了 WBench 交互式视频世界模型评测框架所需的模型权重,方便社区直接部署。WBench 从视频质量、设定遵循、交互遵循、一致性和物理合规五个维度评测世界模型,包含 289 个测试用例和 1,058 轮交互。权重仅限学术研究与评测用途,可通过 huggingface-cli 下载。
Alibaba:GitHub 新仓库AI 评分2929 阿里巴巴发布 EfficientRL:ICML 2026 树式策略优化官方仓库
阿里巴巴在 GitHub 上线 EfficientRL,为 ICML 2026 论文《Long Live The Balance: Information Bottleneck Driven Tree-based Policy Optimization》的官方代码仓库。该工作以信息瓶颈驱动树式策略优化,具体参数与评测结果原文未披露。
Together AI 研究与产品博客(RSS)AI 评分4141 Together AI 发布编码智能体推理基准:Kimi K2.5 上吞吐超 TensorRT-LLM 31%
Together AI 发布面向编码智能体的高并发推理基准,用 4×NVIDIA B200 在 Kimi K2.5 上对比 Together Inference Engine、TensorRT-LLM 与 SGLang。
Import AIAI 评分4141 Import AI 457:AI 版 Stuxnet、Muon 优化器缺陷与正向对齐
Import AI 457 期聚焦三项研究:SentinelOne 拆解出约 20 年前的病毒 fast16.sys,它通过篡改 LS-DYNA 970、PKPM、MOHID 等高精度计算软件的内存结果来破坏工程与物理仿真。
FireRedTeam:原创语音与多模态项目AI 评分3333 FireRedTeam 发布 ReMatch:面向多模态检索的匹配增强表征方法
FireRedTeam 开源了论文《ReMatch: Boosting Representation through Matching for Multimodal Retrieval》的官方实现,该工作已被 CVPR 2026 收录。ReMatch 通过匹配机制增强多模态检索的表征能力。
Google DeepMind:Blog(RSS)AI 评分5555 Google DeepMind 报道 Stanford 团队用 Co-Scientist 找到抗肝纤维化的重定位药物
Stanford 医学院遗传学家 Gary Peltz 团队在 Advanced Science 发表研究,用 Google DeepMind 的 Co-Scientist 从现有药物文献中筛选可重定位治疗肝纤维化的候选药物。
蚂蚁 inclusionAI:GitHub 新仓库AI 评分3636 蚂蚁 inclusionAI 开源 ARGenSeg:用自回归图像生成模型做图像分割
蚂蚁 inclusionAI 在 GitHub 发布 ARGenSeg,将自回归图像生成模型用于图像分割,论文已被 NeurIPS 2025 收录。该工作把分割任务建模为图像生成过程,具体参数规模与 benchmark 分数原文未披露。
Sierra:Blog(RSS)AI 评分4848 Sierra 发布 𝜏-knowledge:在真实知识库上评测 AI 智能体
Sierra 推出 𝜏-knowledge 基准,扩展自 𝜏-bench,新增 𝜏-Banking 金融客服场景,包含 21 个产品类别的 698 份文档(约 195K tokens)。
OpenAI:Alignment 研究博客(RSS)精选AI 评分6666 OpenAI 调查 RL 训练中意外评分 CoT 的后果
OpenAI 报告其自动检测系统发现多个已发布模型在 RL 训练中意外受到有限的 CoT 评分,涉及 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini,GPT-5.5 未受影响。
推荐理由:OpenAI 自曝已发布模型在 RL 中出现过意外 CoT 评分,并给出检测系统与影响分析,读者可了解其监控性保护实践。
Sierra:Blog(RSS)精选AI 评分6767 Sierra 发布 𝜏-voice 基准:在真实音频条件下评测实时语音智能体
Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。
推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。
Together AI 研究与产品博客(RSS)AI 评分4545 Together AI 用分布感知推测解码将 RL rollout 加速最高 50%
Together AI 提出分布感知推测解码(DAS),在 RL 后训练中最高减少 50% 的 rollout 时间且不改变模型输出。DAS 由自适应后缀树草稿器和长度感知调度两部分组成,前者无需梯度更新即可持续适配策略变化,后者通过跨 GPU 负载均衡与 GPU 内推测预算分配削减长尾请求。
Google DeepMind:Blog(RSS)AI 评分5252 Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构
Google DeepMind 发布 Decoupled DiLoCo(分布式低通信)架构,将训练拆分到异步解耦的计算岛(learner units),隔离硬件故障让其他部分继续训练。
Alibaba:GitHub 新仓库AI 评分3434 阿里开源 OSWorld:面向真实计算机环境的开放任务多模态智能体基准
阿里巴巴发布 OSWorld,一个用于评测多模态智能体在真实计算机环境中完成开放式任务的基准,论文入选 NeurIPS 2024。该仓库为贡献用 Fork,所有改动计划提交上游 PR。