@scaling01 i actually filmed and edited the video myself 😅 also implemented the 3d visualization technical deep dive, it all runs in a browser in realtime!
全部AI 动态
全部动态
今日 44 条
Saining Xie@sainingxieAI 评分2525引用David@DavidSHolzOpenAI:Alignment 研究博客(RSS)AI 评分5353 OpenAI 研究:针对有益特质的强化学习可实现广泛且持久的对齐泛化
OpenAI 对齐研究团队发布论文,发现对健康等真实场景中有益特质(诚实、认知谦逊、可纠偏等)做强化学习,可在 44/53 个分布外公开和内部评测上提升对齐表现,涵盖欺骗、reward hacking、有害建议等。仅用单一健康领域训练也能改善非健康域的对齐,且模型在对抗提示和有害微调下更难被推向有害行为,同时保持对正常指令的可操控性。
Noam Shazeer@NoamShazeerAI 评分2626我很高兴分享,我将加入 OpenAI,期待与那里卓越的团队共事。 离开是一个艰难的决定。我为 Google 出色的团队以及我们共同构建的一切感到无比自豪。能与大家共事是我的荣幸,也是一段愉快的经历。
Together AI 研究与产品博客(RSS)AI 评分5353 Together AI 实测 Kimi K2.7 Code 与 Claude Fable 5 生成落地页,成本约低94%
Together AI 让 Kimi K2.7 Code 和 Claude Fable 5 各生成12个落地页对比,Kimi 平均比 Fable 便宜约16倍、比 Opus 便宜约8倍,整体成本低约94%,质量接近但评分略低。通过自定义 MCP 服务器提供截图和设计参考,Kimi 生成的页面层级、排版和构图明显改善,所有页面及成本、token 用量和生成时间明细已发布在 OVSC 网站。
Midjourney:Updates(RSS)AI 评分2121 Midjourney 将直播揭晓首个秘密硬件项目
Midjourney 将于 6 月 17 日周三直播揭晓其首个秘密硬件项目,直播时间为太平洋时间下午 6 点,在 Discord 和 X 同步进行。该项目被描述为雄心勃勃、体积庞大且出人意料。
Midjourney:Updates(RSS)AI 评分5555 Midjourney V8.1 推出 Draft mode 并开放 --preview 新功能测试
Midjourney 为 V8.1 推出 Draft mode,每次生成 24 张低分辨率低质量图片,消耗的 fast hours 为 V8.1 SD 任务的一半,可对选中图片点击 Vary 以全质量全分辨率渲染,通过菜单栏 ⚡ 按钮开启。
Google DeepMind:Blog(RSS)AI 评分4343 Google DeepMind 与英国政府用 Gemini 打造 AI 规划原型,目标将审批时间减半
Google DeepMind 正与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 地方规划部门合作,基于 Gemini 共同开发一款 AI 规划原型工具,目标是将住户规划申请的处理时间缩短 50%。
OpenAI:Alignment 研究博客(RSS)AI 评分5353 OpenAI 验证 WildChat 公开对话数据可预测真实世界模型失准行为
OpenAI 在 Alignment 博客发布 Deployment Simulation 验证工作:用 WildChat 对话前缀重新生成 5 个 OpenAI 模型(含 o3。
Google ResearchAI 评分4141 Google Earth AI 如何用高分辨率深度学习框架绘制英国乡村树篱与林地
Google Research 发布矢量化数据集,将 Farmscapes 2020 的高分辨率栅格地图转化为可操作的树篱、石墙与林地清单,覆盖英国超 13 万平方公里。
Google DeepMind:Blog(RSS)精选AI 评分6565 Google DeepMind 发布 AI Control Roadmap 框架,防御可能未对齐的内部 AI 智能体
Google DeepMind 发布 AI Control Roadmap,提出在传统模型对齐之外增加系统级安全层,将内部 AI 智能体视为可能未对齐的内部威胁进行管理。
推荐理由:原文给出了 Google DeepMind 内部部署 AI 智能体的纵深防御框架细节,包括威胁建模、监控指标和百万条智能体轨迹的分析经验。
上海人工智能实验室 InternLM:原创项目AI 评分3232 InternLM 发布 RNGBench:评估多模态大语言模型在可控非马尔可夫博弈中的表现
上海人工智能实验室 InternLM 项目开源 RNGBench,用于在可控非马尔可夫博弈中评估多模态大语言模型,相关论文已被 EMNLP 2026 收录。该基准聚焦"超越当前观测"的评测场景,官方实现已随项目公开。
vLLM 官方博客(RSS)AI 评分6060 vLLM Semantic Router 推出 Fusion API,将多模型面板编排为路由原语
vLLM Semantic Router 团队发布 Fusion API,让一条路由可以运行多个面板模型、由 judge 模型分析共识与分歧并合成单个回答。
Sierra:Blog(RSS)AI 评分3131 Sierra:客户团队如何成为智能体构建者
Sierra 于 3 月推出 Ghostwriter,让构建和优化 AI 智能体无需点击或写代码,只需描述需求。三个月后,支持主管、运营经理、QA 团队等从未写过代码的人开始直接改进客户体验。Sierra 同时推出优化智能体的 Explorer,持续分析客户对话并找出客户流失、处理不佳的问题及 CSAT 下滑点,再由 Ghostwriter 将洞察转化为改进。
Modem:Blog(RSS)AI 评分3636 Modem 新增 Zendesk 集成,支持工单实时接入与智能体查询
Modem 面向所有用户开放 Zendesk 集成 beta 版,可在 Settings → Integrations → Zendesk 中通过 OAuth 连接。
Sierra:Blog(RSS)AI 评分2929 Sierra 博客:AI 在客户体验(CX)中的可能性探索
Vivid Seats 上线 AI 客服不到四周,问题解决率提升 40%、客户满意度提升 35%,CX 团队从处理排队转向根因修复和产品洞察。Wilson 的 AI 智能体可追问身高与偏好来推荐手套等具体产品,Minted 则用 AI 打通各客户平台识别趋势。Sierra 博客称客户对话正从成本项变为产品改进与业务增长的洞察来源。
Google ResearchAI 评分5353 Google Research 发布 AI 辅助皮肤病理解研究
Google Research 发布关于 AI 帮助用户理解皮肤状况的研究,包括本周发表于 JAMA Dermatology 的大规模定量研究和此前发表于 ACM CHI 的混合方法研究。
vLLM 官方博客(RSS)精选AI 评分7575 vLLM 发布 MiniMax M3 day-0 支持,覆盖 1M 上下文与多模态推理服务
vLLM 宣布对 MiniMax M3 家族的 day-0 支持,涵盖 MiniMaxAI/MiniMax-M3 与 MiniMax-M3-MXFP8 两个检查点,支持 1M token 上下文和图像、视频多模态输入。
推荐理由:vLLM 团队自己拆解了 day-0 支持背后的 MSA 内核、缓存和部署细节,读者可以按需套用其部署配方。
Midjourney:Updates(RSS)AI 评分5858 Midjourney 将默认模型从 V7 切换为 V8.1
Midjourney 宣布经过测试和反馈后,默认模型已从 V7 更新为 V8.1。V8.1 更聪明、更连贯,更好地遵循详细提示词并渲染文字;开启 HD 模式后图像尺寸为 V7 的两倍、分辨率 4 倍,SD 模式 4 秒、HD 模式 12 秒出图。风格参考、个性化与美学在 V7 与 V8.1 间保持一致;V7 的 omni-reference 仍可使用,V8.0 alpha 将在两周后弃用。
Sierra:Blog(RSS)AI 评分4848 Sierra 与 Knox Systems 合作获得 FedRAMP High 认证
Sierra 与 Knox Systems 合作获得 FedRAMP High 认证,距其成立仅两年多,快于多数企业的认证周期。该认证使其 AI 智能体可服务美国联邦机构,此前已有 40% 的 Fortune 50 企业采用其技术。Sierra 支持语音、聊天、邮件多渠道及 58 种语言,Cigna 用八周上线智能体并将患者认证时间缩短 80%。
Google ResearchAI 评分4848 Google Research 提出审计机器遗忘的新框架 Regularized f-Divergence Kernel Tests
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于审计机器遗忘,通过相对距离检验判断遗忘后模型在分布上更接近安全重训模型还是原始受损模型。
Google DeepMind:Blog(RSS)精选AI 评分7676 Google DeepMind 发布开源实验模型 DiffusionGemma,GPU 文本生成最高提速 4 倍
Google DeepMind 发布实验性开源模型 DiffusionGemma,基于文本扩散方法,在专用 GPU 上实现最高 4 倍的文本生成提速。该模型为 26B 总参数的 MoE,推理时仅激活 3.8B 参数,量化后可装入 18GB 显存,单张 NVIDIA H100 上超过 1000 tokens 每秒,RTX 5090 上超过 700 tokens 每秒。
推荐理由:官方给出具体吞吐数字、显存占用和质量取舍,读者可据此判断它适不适合本地交互式工作流。
小米 MiMo:GitHub 新仓库(模型发布)AI 评分3030 小米 MiMo 发布 MiMo-Code:模型与智能体协同进化
小米 MiMo 在 GitHub 上线新仓库 MiMo-Code,定位为模型与智能体协同进化。仓库标题为“MiMo Code: Where Models and Agents Co-Evolve”,目前公开信息仅包含仓库名称与这一主题表述。
Google DeepMind:Blog(RSS)精选AI 评分6161 Google DeepMind 联合多方发起最高 1000 万美元多智能体 AI 安全研究资助
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,宣布面向全球研究者的多智能体 AI 安全研究资助,总额最高 1000 万美元。
推荐理由:原文列出了四个优先研究方向和申请时间线,研究者可以直接据此判断是否提交多智能体安全方向的提案。
Together AI 研究与产品博客(RSS)AI 评分2828 Together AI 获 ISO 27001:2022 认证,覆盖其全球 AI 平台
Together AI 已通过 ANAB 认可认证机构 A-LIGN 的 ISO 27001:2022 认证,确认其信息安全管理体系(ISMS)符合最新国际标准。该认证覆盖 Together AI 全球平台及第三方数据中心的系统、流程与控制,客户可在 trust.together.ai 索取证书及控制环境文档。认证与既有 SOC 2 等框架控制互补,面向在受监管行业运行 AI 工作负载的客户。
vLLM 官方博客(RSS)精选AI 评分7575 vLLM 原生支持 Google DeepMind 26B 扩散语言模型 DiffusionGemma
Google DeepMind 与 vLLM 团队合作,将 26B 参数、基于 Gemma4 的离散扩散语言模型 DiffusionGemma 接入 vLLM,这是 vLLM 首个原生支持的 dLLM。
推荐理由:原文详解了扩散语言模型的解码机制和 vLLM 的 ModelState 接入方案,并给出 H200 上的吞吐数据,对推理工程实践有直接参考价值。
Google DeepMind:Blog(RSS)精选AI 评分7676 Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译音频模型
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,支持 70+ 语言的近实时语音到语音翻译,自动检测语言并保留说话人的语调、节奏和音高,全程仅落后说话人数秒。
推荐理由:原文来自 Google DeepMind 官方博客,说明了 Gemini 3.5 Live Translate 的能力细节和各端开放入口,读者可据此评估实时语音翻译的实际可用范围。
Google DeepMind:Blog(RSS)精选AI 评分7777 Google DeepMind 发布 Gemma 4 12B:无编码器统一多模态模型,可在 16GB 内存笔记本本地运行
Google DeepMind 发布 Gemma 4 12B,定位于在笔记本上本地运行的智能体多模态模型,性能接近其 26B MoE 模型而内存占用不到一半。
推荐理由:官方介绍了无编码器统一架构和 16GB 内存本机运行等细节,适合关注端侧多模态部署的开发者参考。
Google DeepMind:Blog(RSS)AI 评分3838 Google DeepMind 启动欧洲机器人加速器,15 家初创入选
Google DeepMind 推出为期三个月的 Robotics 加速器,从欧洲选出 15 家机器人初创公司,本周在伦敦启动,它们将获得 Google DeepMind 与 Google 的技术指导,并可使用其 AI 技术栈和 Gemini 机器人模型。
蚂蚁 inclusionAI:GitHub 新仓库AI 评分3535 蚂蚁 inclusionAI 开源 AReno:单节点扩展 RL 后训练工具包
蚂蚁 inclusionAI 在 GitHub 开源 AReno,一个易用且快速的工具包,用于在单节点上扩展强化学习后训练。该工具定位为轻量级 RL post-training 方案,具体性能数据与支持模型尚未在仓库说明中披露。
vLLM 官方博客(RSS)AI 评分5555 vLLM 社区发布 RL 后训练框架 vime,基于 slime 训练栈并接入 vLLM 推理
vLLM 社区发布开源 RL 后训练框架 vime(Apache 2.0),基于 slime 的训练栈和数据生成设计,将 Megatron 训练与 vLLM 推理接入同一条解耦管线。
Jakub Pachocki@merettmAI 评分2323
Google DeepMind:Blog(RSS)精选AI 评分6666 Google DeepMind 发布塞拉利昂 AI 辅助学习试验结果:Gemini Guided Learning 提升数学成绩
Google DeepMind 公布在塞拉利昂开展的预注册对照试验结果,使用 Gemini Guided Learning 的学生数学成绩提升 0.258 个标准差,约等于 1.2 至 1.7 年的正常学习进度,教师将 Gemini 纳入约一半课时(目标 12 小时)的班级进步更高,约 1.8 至 2.5 年。
推荐理由:原文给出塞拉利昂预注册试验的核心数据,读者可以了解教师主导下 AI 辅助学习的真实效果与局限。
Yann LeCun@ylecunAI 评分00
Google ResearchAI 评分4848 Gemini Enterprise Agent Platform 如何用 Agentic RAG 提升回答可靠性
Google 在 Gemini Enterprise Agent Platform 上推出基于 Agentic RAG 的 Cross-Corpus Retrieval,通过多智能体协作处理多源、多跳查询,相比标准 RAG 在事实性数据集上准确率最高提升 34%。
vLLM 官方博客(RSS)精选AI 评分6969 vLLM Semantic Router v0.3 Themis 发布:从信号到有状态的生产级路由
vLLM Semantic Router 发布 v0.3 版本 Themis,推出规范化 v0.3 配置契约、投影机制和首个生产可用的会话感知智能体路由(SAAR),并强化协议兼容、仪表盘运维控制台与 CLI。
推荐理由:版本把信号、投影、决策到模型选择收敛为统一契约,并引入会话感知路由,适合关注生产级流量治理的团队参考。
Google Research精选AI 评分7171 Google Research 发布 PHRM 系统用手机前置摄像头被动监测心率与静息心率
Google Research 在 Nature 发表 PHRM 研究系统,利用人脸解锁后的前置摄像头视频在日常用机时后台估计心率与每日静息心率。
推荐理由:这项研究覆盖近700名不同肤色的参与者并在真实生活场景验证,读者可以据此了解手机摄像头被动测心率的精度与局限。
Modem:Blog(RSS)AI 评分4141 Modem 上线 Notion 集成,智能体可直接写入页面与数据库
Modem 面向所有用户开放 Notion 集成,智能体可创建页面、填充数据库行、更新属性并向已有页面追加内容,所有写入操作均需用户确认后执行。该集成通过 OAuth 授权,访问令牌加密存储,可在 Settings 中随时断开。用户还能把 Notion 中的文档、PRD 等资料结合技能与自动化,构建 UTM 生成、Bug 分诊、客户研究等智能体工作流。
vLLM 官方博客(RSS)精选AI 评分6767 NVIDIA Nemotron 3 Ultra 在 vLLM 获 Day-0 支持
NVIDIA 宣布 Nemotron 3 Ultra 在 vLLM 上获得 Day-0 支持。该开源模型采用混合 Transformer-Mamba 潜在 MoE 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 精度,面向长时程自主智能体工作流。
推荐理由:官方给出架构细节、显存配置和 vLLM 部署命令,读者可以直接照此在自有环境里跑通该模型。
Google ResearchAI 评分5353 Google Research 在 GitHub 开源水文模型框架,供各国气象水文部门构建 AI 洪水预报
Google Research 将驱动 Flood Hub 的水文模型框架在 GitHub 以 Apache 2.0 许可证开源,供各国气象水文部门训练 AI 洪水预报模型。
Sierra:Blog(RSS)AI 评分6262 Sierra 谈结果定价:企业软件将从生产力工具转向按结果收费
Sierra 复盘其 2024 年 12 月提出的结果定价(outcome-based pricing)理念,指出自那以来 S&P 500 上涨约 30%,而代表 SaaS 指数的 WCLD 下跌约 15%,市场正在消化企业软件从团队生产力工具转向交付结果的 AI 智能体。
最多提供 50 页,更早的内容请使用搜索或主题页。