OpenAI 扩展 Codex 能力:可操作 Mac 应用并承接持续任务
OpenAI 发布视频介绍 Codex 的能力更新。Codex 现在可以操作 Mac 上的应用、连接更多工具、生成图像、从之前的操作中学习、记住用户的工作偏好,并承接持续和可重复的任务。
推荐理由:OpenAI 官方列出 Codex 的能力更新方向,读者可以据此了解它在 Mac 应用操作和持续任务上的变化。
OpenAI 发布视频介绍 Codex 的能力更新。Codex 现在可以操作 Mac 上的应用、连接更多工具、生成图像、从之前的操作中学习、记住用户的工作偏好,并承接持续和可重复的任务。
推荐理由:OpenAI 官方列出 Codex 的能力更新方向,读者可以据此了解它在 Mac 应用操作和持续任务上的变化。
Sierra 为每个客户从昨日对话中采样数千条匿名搜索样本,用前沿 LLM 多阶段流水线筛选出理想文章构成 golden 数据集,并以 recall、precision、nDCG 等指标每日衡量检索质量。发布检索与重排序模型 Linnaeus 和 Darwin 后,客户 recall 逐日提升,相关解决率最高提升 16 个百分点。
Google 发布研究实验 Vantage,通过生成式 AI 在模拟环境中创建对话,评估高中和大学生的未来技能,现已上线 Google Labs 并开放英文注册。Vantage 与纽约大学合作开发,由 Executive LLM 动态引导对话、AI Evaluator 依据评分标准打分,188 名 18-25 岁美国测试者的研究显示其评分与人类专家一致。
阿里巴巴在 GitHub 发布 Harbor 框架,用于运行智能体评测以及创建和使用 RL 环境。该仓库为贡献用 fork,所有改动计划提交上游 PR。
Together AI 发布 EinsteinArena,一个让智能体在开放科学问题上互动、讨论和竞争的平台,含实时 API、验证器和公开排行榜,并完全开源。截至 2026 年 4 月 11 日,平台上的智能体已取得 11 项新 SOTA,包括将 11 维 kissing number 下界从 AlphaEvolve 的 593 推进到 604,该结果由多个智能体在 48 小时内接力优化协作完成。
browser-use 在 GitHub 上线新仓库 video-use,主打用编程智能体(coding agents)编辑视频。该仓库目前仅给出这一句功能描述,未披露支持的模型、参数规模或可用方式。
Google Research 推出 ConvApparel 数据集,包含服装购物领域超 4000 段人机多轮对话、近 15000 轮交互,用于量化 LLM 用户模拟器与真实人类的真实感差距。
阿里巴巴在 GitHub 开源 loongsuite-js,为基于 JavaScript 的 AI 编程智能体提供 OpenTelemetry 埋点插件。它可以从 Claude Code 和 OpenClaw 采集 traces、工具调用和 LLM 指标,无需修改代码。
Google 发布两个学术智能体框架:PaperVizAgent 用于生成论文配图,ScholarPeer 用于自动同行评审。PaperVizAgent 由检索、规划、风格、可视化和评审五个智能体协作,在 0-100 分评测中总分 60.2,超过 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any 等基线,是唯一超过 50.0 人类基线的框架。
安全研究员 Johann Rehberger 分析 Anthropic 发布的 Mythos Preview 模型:据其公告,Opus 4.6 在数百次尝试中仅两次成功利用 Firefox JS 引擎漏洞,Mythos Preview 成功 181 次,还发现了 27 年历史的 OpenBSD SACK 漏洞和 17 年历史的 FreeBSD NFS RCE。
Sierra 发布面向 AI 智能体的支付功能,成为首个 Level 1 PCI 合规的对话式 AI 平台,并获 Visa Global Service Provider Registry 验证。
Sebastian Raschka 发文讲解编码智能体与 coding harness 的整体设计,提出六大组件:实时仓库上下文、提示词结构与缓存复用、结构化工具与权限校验、控制上下文膨胀、结构化会话记忆、带边界的子智能体委派。
Steve Yegge 宣布 Gas Town 和 Beads 同日发布 v1.0.0。Gas Town 上线 3 个月获 13k GitHub stars,已进入维护模式一个月以上;Beads 上线约 5 个月跨过 20k stars,在完成向嵌入式 Dolt 的迁移后达到 v1.0。后续重点转向 Gas City,目前处于 alpha 测试并计划快速 GA。
Google DeepMind 发布 Gemma 4 开源模型,主打高级推理与智能体工作流,采用 Apache 2.0 许可,提供 E2B、E4B、26B MoE 和 31B Dense 四个尺寸。
推荐理由:官方给出四个尺寸、榜单排名、上下文长度和开放许可等具体信息,读者可以据此判断选型与部署空间。
Sierra 发布 Explorer,一款与构建智能体的 Ghostwriter 配合、主动指出智能体待修复与改进之处的"智能体优化智能体"。它像 ChatGPT deep research,但研究对象是客户对话,可诊断性能问题、验证假设并预测趋势,每周推送变化简报,并支持一键在 Ghostwriter 中落地建议。
Ethan Mollick 撰文指出,AI 能力被聊天机器人界面拖累,一篇让金融从业者用 GPT-4o 做估值任务的研究发现,AI 输出的大量文本增加了认知负荷,抵消了部分生产力收益。
Mistral AI 发布 Spaces CLI,一个从内部平台工具演化而来、可脚手架项目、启动开发环境并部署的项目工具。
Steve Yegge 撰文分享他作为 Beads(20k stars)和 Gas Town(13k stars)维护者、每天接收约 50 个社区 PR(99% 为 AI 生成)的 vibe maintainer 工作流。
Sierra 宣布收购东京企业 AI 初创公司 Opera Tech,其联合创始人森川馨太与國井清人将加入 Sierra。Sierra 称日本是对企业软件要求最高的市场之一,Opera 团队拥有服务日本大型企业的本地关系与经验。
OpenBMB 推出 ClawXMemory,一个为 OpenClaw 设计的多层级记忆插件,主打长期上下文能力。该插件通过多层级记忆结构管理长期上下文,具体参数与可用方式尚未在现有信息中披露。
Modem 面向所有用户上线 Intercom 集成,通过 webhooks 实时将对话、回复、内部笔记、状态变更和 CSAT 评分汇入其 topic 系统,并与 Slack、Discord、GitHub 讨论并列。
Sierra 发布 Ghostwriter,一个能构建智能体的智能体,用户通过自然语言、SOP、通话记录等输入即可生成覆盖语音、聊天、邮件及 30 多种语言的 production-ready 客服 Agent。
Sierra 宣布在澳大利亚悉尼开设办公室,此前已扩展至新加坡、东京、马德里、巴黎和伦敦。其平台上的 AI 智能体支持 30 多种语言、全天候无等待服务,覆盖产品发现、注册登录、故障排查和流失管理。美国 Rocket Mortgage 每月贷款规模达 $1BN,使用其智能体的购房者完成流程的可能性高出四倍。
上海人工智能实验室 InternLM 项目推出 WildClawBench,一个面向生产环境(production harness)中 AI 智能体的 in-the-wild 基准测试。该基准聚焦智能体在真实部署环境下的表现评估,目前随 InternLM 项目开源发布。
OpenAI Alignment 团队提出 self-incrimination 训练方法,让智能体在暗中失范时主动调用 report_scheming() 工具自报行为。
Sierra 发布 𝜏³-Bench,在 𝜏-Bench 基础上新增 𝜏-Knowledge 和 𝜏-Voice 两个评测域,并合并社区对原有领域的修正。
Modem 面向所有用户上线 PostHog 集成,连接后其智能体可通过 API 实时查询产品分析、功能开关和 A/B 实验数据。用户用自然语言提问,智能体自动生成查询并返回事件计数、漏斗、留存、HogQL 趋势及实验统计显著性结果,还可与 Modem 的 topic 数据交叉比对。
Together AI 扩展 Together Fine-Tuning,新增工具调用、推理和视觉语言模型(VLM)微调支持,训练栈升级后支持 100B+ 参数模型,吞吐最高提升 6×,数据集支持最大 100GB。
Google Research 在 The Check Up 活动上公布多项医疗 AI 进展,包括与 Fitbit 合作研究的 Personal Health Agent(PHA),可整合数据科学家、领域专家与健康教练角色提供长期健康支持。
Mistral AI 推出 Forge,让企业基于自有专有知识训练前沿级 AI 模型,支持预训练、后训练与强化学习全流程。Forge 同时支持 dense 与 MoE 架构,并可按需支持多模态输入,模型可运行在企业自有基础设施内以保留控制权。该平台以智能体优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数、调度任务并生成合成数据。
安全研究者 Johann Rehberger 发布 Agent Commander,一个用自然语言命令控制被劫持智能体的 C2 系统,演示通过间接提示词注入让 OpenClaw、Kimi Claw 和 NanoClaw 加入提示词版僵尸网络。
Mistral 发布 Leanstral,一个面向 Lean 4 的开源代码智能体,权重以 Apache 2.0 许可开放,同时在 Mistral Vibe 中以 agent 模式提供,并通过免费 API 端点 labs-leanstral-2603 开放。
推荐理由:原文给出 FLTEval 分数和与 Claude 系列的成本对比,读者可据此评估它在形式化证明工程中的性价比。
Together AI 在 NVIDIA GTC 2026 上宣布多项进展:其推理栈已采用 NVIDIA Dynamo 1.0,并与 NVIDIA 合作推出基于 NemoClaw 和 OpenShell 运行时的智能体部署方案。
Ethan Mollick 撰文认为 AI 已进入由 Claude Code、OpenAI Codex 等 Agent 驱动的管理 AI 新阶段,多项基准如 GPval、Humanity's Last Exam 显示能力持续指数级提升。
对话式 AI 平台 Sierra 宣布在西班牙马德里开设办公室,并已与多家西班牙大型企业合作构建 AI 客户体验。Sierra 智能体可覆盖产品推荐、注册、账户管理、故障排查、忠诚度计划与流失管理等场景。其客户 Next 六周上线、覆盖 83 个国家 48 种语言,Cigna 八周投产并将患者认证时间缩短 80%,Singtel 十周上线、解决率超 70%。
Together AI 推出统一方案,在同一集群内共同部署 STT、LLM 和 TTS 基础设施来构建实时语音智能体,端到端延迟低于 500 毫秒(从用户说话结束到首个音频 token)。
Modem 面向所有用户上线 Event Automations,让自动化不再按时间表运行,而是在事件发生时唤醒同一个 Modem Agent 执行提示词。
Mistral AI 基于 open-source 编码助手 Vibe 构建了一个自主智能体,可读取 Rails 源文件、生成或改进 RSpec 测试,并通过 RuboCop 和 SimpleCov 自定义工具在 CI/CD 中无人工干预运行。
推荐理由:Mistral 详述了在 Vibe 上构建 Rails 测试智能体的上下文工程与自定义工具方案,给出可复用的步骤和实测分数。