Modem 推出 Agent Skills:团队共享的可复用智能体指令集
Modem 向所有用户推出 Agent Skills,即可复用的智能体指令集,由 slug、一句触发描述和指令正文三部分组成,在 chat、Slack 和 automations 中统一生效,并与全组织共享。
Modem 向所有用户推出 Agent Skills,即可复用的智能体指令集,由 slug、一句触发描述和指令正文三部分组成,在 chat、Slack 和 automations 中统一生效,并与全组织共享。
browser-use 发布新仓库 terminal,一个用于在浏览器中完成任务的终端 UI。该工具以终端界面形式操作浏览器,具体功能与可用性细节尚未在仓库描述中展开。
阿里巴巴在 GitHub 上线 UnifiedModel,一个让 AI 智能体理解企业数据的语义层。该模型只需定义一次实体与关系,即可通过 SPL/MCP/REST 查询,并把遥测、服务与业务对象连入同一对象图。
OpenAI 在 GitHub 新建仓库 openai/openai-cli,定位为 OpenAI API 的官方 CLI。仓库目前仅有一句说明,未披露具体命令、支持模型或发布时间。
OpenAI 推出 OpenAI Developers 插件,帮助开发者在 ChatGPT 和 Codex 中构建 AI 应用与智能体,并提供 OpenAI API 接入与配置指引。
Mistral AI 发布 Workflows 公开预览版,一个面向企业 AI 的编排层,提供持久执行、可观测性、容错和人工审批,ASML、ABANCA、CMA-CGM 等客户已在用它自动化关键业务流程。
推荐理由:官方公布 API 缓存命中输入价格降至原价十分之一,并给出各型号具体单价,可据此估算构建成本变化。
Gas City 本周发布 v1.0.0,由 Julian Knutsen 和 Chris Sells 基于 Steve Yegge 的构想开发,将 Gas Town 整个栈重构为可组合的声明式 SDK,用于搭建自主协作的 agent 团队(即所谓 dark factory)。
Google 宣布其新方法已在 Google Photos 的 Auto frame 功能中上线,用 ML 模型估计 3D 点图和相机参数,再用生成式扩散模型补全新视角下原先未拍到的内容,实现拍摄后的视角重排。方法分 3D 场景与相机估计、生成式修补两阶段,可自动调整人像构图并校正广角前置镜头的透视畸变,对含人物的合格照片提供单次操作的备选 rendition。
推荐理由:原文拆解了 3D 场景估计与生成修补的两阶段方法,读者可以理解这种视角重排与普通生成式修图的区别。
browser-use 在 GitHub 上线新仓库 browsercode,定位为浏览器原生(browser-native)的智能体框架。该仓库目前仅给出这一句描述,未披露模型支持、参数规模或可用性细节。
OpenAI 在 GitHub 新建 privacy-filter 仓库,目前仅公开仓库名,未披露模型规模、benchmark 分数或可用方式。
browser-use 发布 desktop 桌面应用,将浏览器智能体能力带入桌面端。该仓库名为 browser-use/desktop,目前仅披露应用名称 Browser Use Desktop App,具体功能、支持平台与可用性尚未公布。
browser-use 发布 go-harnessless,用 Go 重写 harnessless,实现基于守护进程的 Chrome DevTools Protocol 桥接。该项目借助 goroutine、channel 和 sync.RWMutex 支持并发浏览器自动化。
OpenAI 发布视频介绍 Codex 的能力更新。Codex 现在可以操作 Mac 上的应用、连接更多工具、生成图像、从之前的操作中学习、记住用户的工作偏好,并承接持续和可重复的任务。
推荐理由:OpenAI 官方列出 Codex 的能力更新方向,读者可以据此了解它在 Mac 应用操作和持续任务上的变化。
OpenAI 在 GitHub 新建 homebrew-tools 仓库,为 OpenAI CLI 提供 Homebrew 安装方式。仓库描述为“Homebrew for the OpenAI CLI”,目前正文未披露更多功能细节。
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,提升语音质量、表现力与可控性。
推荐理由:官方给出了模型能力细节、榜单成绩和开放入口,读者可以判断它对语音应用开发的实际改动。
OpenAI 发布开源项目 euphony,可在浏览器中可视化 harmony 聊天数据与 Codex 会话。该仓库以 openai/euphony 形式托管于 GitHub,具体功能细节与使用方式尚未在现有信息中展开。
Google 发布研究实验 Vantage,通过生成式 AI 在模拟环境中创建对话,评估高中和大学生的未来技能,现已上线 Google Labs 并开放英文注册。Vantage 与纽约大学合作开发,由 Executive LLM 动态引导对话、AI Evaluator 依据评分标准打分,188 名 18-25 岁美国测试者的研究显示其评分与人类专家一致。
Together AI 发布 EinsteinArena,一个让智能体在开放科学问题上互动、讨论和竞争的平台,含实时 API、验证器和公开排行榜,并完全开源。截至 2026 年 4 月 11 日,平台上的智能体已取得 11 项新 SOTA,包括将 11 维 kissing number 下界从 AlphaEvolve 的 593 推进到 604,该结果由多个智能体在 48 小时内接力优化协作完成。
browser-use 在 GitHub 上线新仓库 video-use,主打用编程智能体(coding agents)编辑视频。该仓库目前仅给出这一句功能描述,未披露支持的模型、参数规模或可用方式。
阿里巴巴在 GitHub 开源 loongsuite-js,为基于 JavaScript 的 AI 编程智能体提供 OpenTelemetry 埋点插件。它可以从 Claude Code 和 OpenClaw 采集 traces、工具调用和 LLM 指标,无需修改代码。
Google 发布两个学术智能体框架:PaperVizAgent 用于生成论文配图,ScholarPeer 用于自动同行评审。PaperVizAgent 由检索、规划、风格、可视化和评审五个智能体协作,在 0-100 分评测中总分 60.2,超过 GPT-Image-1.5、Nano-Banana-Pro、Paper2Any 等基线,是唯一超过 50.0 人类基线的框架。
Sierra 发布面向 AI 智能体的支付功能,成为首个 Level 1 PCI 合规的对话式 AI 平台,并获 Visa Global Service Provider Registry 验证。
Introducing Project Glasswing: an urgent initiative to help secure the world’s most critical software. It’s powered by our newest frontier model, Claude Mythos Preview, which can find software vulnerabilities better than all but the most skilled humans. https://anthropic.com/glasswing
OpenAI 在 GitHub 新建仓库 openai-imagegen-demo,这是一个用 OpenAI Image API 构建的 Next.js 照相亭(Photobooth)应用。仓库以 demo 形式展示该 Image API 的实际调用方式,目前未披露更多功能细节。
Sierra 发布两款自研搜索模型 Linnaeus(检索)与 Darwin(重排序),称其解决率最高提升 16 个百分点。Linnaeus 直接基于完整对话检索,recall@5 提升 20%、recall@30 约 95%,每次搜索延迟最多降低约 800ms;Darwin 负责重排序,兼顾精度与成本。Sierra 智能体每天执行超 200 万次搜索,P90 延迟与搜索成本均下降超 75%。
Steve Yegge 宣布 Gas Town 和 Beads 同日发布 v1.0.0。Gas Town 上线 3 个月获 13k GitHub stars,已进入维护模式一个月以上;Beads 上线约 5 个月跨过 20k stars,在完成向嵌入式 Dolt 的迁移后达到 v1.0。后续重点转向 Gas City,目前处于 alpha 测试并计划快速 GA。
Sierra 发布 Explorer,一款与构建智能体的 Ghostwriter 配合、主动指出智能体待修复与改进之处的"智能体优化智能体"。它像 ChatGPT deep research,但研究对象是客户对话,可诊断性能问题、验证假设并预测趋势,每周推送变化简报,并支持一键在 Ghostwriter 中落地建议。
Mistral AI 发布 Spaces CLI,一个从内部平台工具演化而来、可脚手架项目、启动开发环境并部署的项目工具。
OpenAI 在 GitHub 新建仓库 openai/codex-plugin-cc,让用户在 Claude Code 中调用 Codex 来审查代码或委派任务。该插件打通了两个 AI 编程工具之间的调用链路。
Google DeepMind 发布 AI 指针实验方案,让指针借助 Gemini 理解所指内容与用户意图,并提出保持流、看即说、用 this/that、像素变实体四条交互原则。用户已可在 Google AI Studio 和 Gemini in Chrome 中通过指向加语音操作网页,Googlebook 将推出 Magic Pointer。
推荐理由:原文给出 AI 指针的四条交互原则及其在 Chrome 和 Googlebook 中的落地入口,读者可据此理解指向加语音的新交互方式。
OpenBMB 推出 ClawXMemory,一个为 OpenClaw 设计的多层级记忆插件,主打长期上下文能力。该插件通过多层级记忆结构管理长期上下文,具体参数与可用方式尚未在现有信息中披露。
Modem 面向所有用户上线 Intercom 集成,通过 webhooks 实时将对话、回复、内部笔记、状态变更和 CSAT 评分汇入其 topic 系统,并与 Slack、Discord、GitHub 讨论并列。
Sierra 发布 Ghostwriter,一个能构建智能体的智能体,用户通过自然语言、SOP、通话记录等输入即可生成覆盖语音、聊天、邮件及 30 多种语言的 production-ready 客服 Agent。
Google 发布 Vibe Coding XR 工作流,结合 Gemini 的长上下文推理与基于 WebXR、three.js、LiteRT.js 的 XR Blocks 框架,可将自然语言在 60 秒内转化为可运行的 Android XR 应用。
Modem 面向所有用户上线 PostHog 集成,连接后其智能体可通过 API 实时查询产品分析、功能开关和 A/B 实验数据。用户用自然语言提问,智能体自动生成查询并返回事件计数、漏斗、留存、HogQL 趋势及实验统计显著性结果,还可与 Modem 的 topic 数据交叉比对。
Together AI 扩展 Together Fine-Tuning,新增工具调用、推理和视觉语言模型(VLM)微调支持,训练栈升级后支持 100B+ 参数模型,吞吐最高提升 6×,数据集支持最大 100GB。
Mistral AI 推出 Forge,让企业基于自有专有知识训练前沿级 AI 模型,支持预训练、后训练与强化学习全流程。Forge 同时支持 dense 与 MoE 架构,并可按需支持多模态输入,模型可运行在企业自有基础设施内以保留控制权。该平台以智能体优先设计,Mistral Vibe 等自主智能体可用其微调模型、寻找最优超参数、调度任务并生成合成数据。
Google 宣布在 Flood Hub 上推出城市山洪预报,可提前最多 24 小时预测城市山洪风险,属于 Google Earth AI 家族并支持 Crisis Resilience 工作。
Google Research 推出 Groundsource,利用 Gemini 从 80 种语言的新闻报告中提取结构化历史洪水事件,建成覆盖 150 多个国家、2000 年至今的 260 万条记录的开源数据集。
推荐理由:原文给出方法细节与验证准确率,读者可以据此了解用 LLM 把新闻转成灾害历史数据的可行路径。