推荐理由:官方公布 API 缓存命中输入价格降至原价十分之一,并给出各型号具体单价,可据此估算构建成本变化。
产品更新
全部主题AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
最新精选
第 181–200 条 · 共 202 条
DeepSeek@deepseek_ai精选AI 评分6666
Google Research精选AI 评分6969 Google Photos Auto frame 上线 3D 视角重排功能,可改变照片拍摄视角
Google 宣布其新方法已在 Google Photos 的 Auto frame 功能中上线,用 ML 模型估计 3D 点图和相机参数,再用生成式扩散模型补全新视角下原先未拍到的内容,实现拍摄后的视角重排。方法分 3D 场景与相机估计、生成式修补两阶段,可自动调整人像构图并校正广角前置镜头的透视畸变,对含人物的合格照片提供单次操作的备选 rendition。
推荐理由:原文拆解了 3D 场景估计与生成修补的两阶段方法,读者可以理解这种视角重排与普通生成式修图的区别。
OpenAI Developers(RSS)精选AI 评分6565 OpenAI 扩展 Codex 能力:可操作 Mac 应用并承接持续任务
OpenAI 发布视频介绍 Codex 的能力更新。Codex 现在可以操作 Mac 上的应用、连接更多工具、生成图像、从之前的操作中学习、记住用户的工作偏好,并承接持续和可重复的任务。
推荐理由:OpenAI 官方列出 Codex 的能力更新方向,读者可以据此了解它在 Mac 应用操作和持续任务上的变化。
Google DeepMind:Blog(RSS)精选AI 评分6161 Google DeepMind 发布 Gemini 3.1 Flash TTS,新增 audio tags 精细语音控制
Google DeepMind 发布文本转语音模型 Gemini 3.1 Flash TTS,提升语音质量、表现力与可控性。
推荐理由:官方给出了模型能力细节、榜单成绩和开放入口,读者可以判断它对语音应用开发的实际改动。
Google DeepMind:Blog(RSS)精选AI 评分6464 Google DeepMind 推出由 Gemini 驱动的 AI 指针交互
Google DeepMind 发布 AI 指针实验方案,让指针借助 Gemini 理解所指内容与用户意图,并提出保持流、看即说、用 this/that、像素变实体四条交互原则。用户已可在 Google AI Studio 和 Gemini in Chrome 中通过指向加语音操作网页,Googlebook 将推出 Magic Pointer。
推荐理由:原文给出 AI 指针的四条交互原则及其在 Chrome 和 Googlebook 中的落地入口,读者可据此理解指向加语音的新交互方式。
Suno:Blog(网页)精选AI 评分6060 Suno 发布 v5.5,推出 Voices、Custom models 和 My Taste
Suno 发布 v5.5 模型,同时推出 Voices、Custom models 和 My Taste 三项个性化功能。
推荐理由:原文给出 Voices 的验证与隐私细节和两项新个性化功能,读者可以判断这些能力如何改变自己的创作流程。
Google Research精选AI 评分6161 Google 发布 Groundsource:用 Gemini 把新闻报道转为历史洪水数据
Google Research 推出 Groundsource,利用 Gemini 从 80 种语言的新闻报告中提取结构化历史洪水事件,建成覆盖 150 多个国家、2000 年至今的 260 万条记录的开源数据集。
推荐理由:原文给出方法细节与验证准确率,读者可以据此了解用 LLM 把新闻转成灾害历史数据的可行路径。
Modal 官方工程博客(RSS)精选AI 评分7272 Modal 上线 GLM-5 免费端点并发布部署指南
Modal 与 Z.ai 合作,为开源权重模型 GLM-5 提供免费端点(限单并发请求,开放至 4 月底),并给出可复现的自部署代码。
推荐理由:Modal 官方给出 GLM-5 的部署细节和免费端点,读者可以据此了解开源前沿模型的自托管方案。
OpenAI Developers(RSS)精选AI 评分6565 OpenAI 发布 Codex app,支持多智能体并行协作
OpenAI 发布 Codex app,定位为基于智能体构建软件的指挥中心。它支持并行运行多个智能体并用 worktrees 隔离各自改动,可将工具和约定打包成可复用的 skills,还支持通过后台定时工作流把重复性工作交给 Codex。目前提供 macOS 下载(https://openai.com/codex),Windows 支持即将推出。
推荐理由:视频给出了 Codex app 的并行多任务、skills 打包和后台自动化等能力与 macOS 下载入口,读者可据此评估其对现有开发流程的影响。
Mistral AI:News(网页)精选AI 评分6262 Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,搭载 Devstral 2
Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的重大升级,由 Devstral 2 模型系列驱动。新增自定义 subagents、多选项澄清、slash 命令技能、统一 agent 模式和自动更新;产品现已在 Le Chat Pro 和 Team 套餐开放,支持按量付费或自带 API key。
推荐理由:官方宣布 Mistral Vibe 2.0 上线,列出 subagents、slash 命令技能等新能力和 Le Chat Pro/Team 套餐与 Devstral 2 定价,读者可据此评估工作流适配。
Anthropic:Engineering(事故复盘 + 工程实践 · 网页)精选AI 评分7979 Anthropic 在 Claude 开发者平台推出 Tool Search Tool、Programmatic Tool Calling 和 Tool Use Examples
Anthropic 在 Claude 开发者平台发布三项 beta 功能:Tool Search Tool 按需发现工具、Programmatic Tool Calling 用代码编排工具调用、Tool Use Examples 在工具定义中提供示例。
推荐理由:官方给出了三项工具调用新功能的机制说明和内部测试数字,读者可以据此评估大工具库场景下的上下文与准确性权衡。
TensorZero:实验与工程博客精选AI 评分6666 TensorZero 在 LLM 网关中引入多臂老虎机自适应 A/B 实验
TensorZero 推出基于 Track-and-Stop 最佳臂识别的多臂老虎机算法,在 LLM 网关中实现自适应 A/B 实验,动态调整采样比例并用 anytime-valid 的 GLRT 停止规则避免 p-hacking。
推荐理由:文章用仿真和真实 NER 实验数据说明自适应实验相比均匀采样能减少约 37% 的判定时间,并给出可直接复用的配置方法。
OpenAI Developers(RSS)精选AI 评分6767 OpenAI 演示在代码编辑器中使用 Codex
OpenAI 展示如何将 Codex 与主流代码编辑器搭配使用,简化编辑器内的工作流,内容涉及 codex 与 IDE 扩展。
推荐理由:官方演示了 Codex 与主流代码编辑器的搭配方式,可帮助开发者了解如何把工作流收进编辑器内完成。
Answer.AI 官方研发博客(RSS)精选AI 评分6565 Answer.AI 开源 cachy:缓存 LLM 响应让 notebook 测试提速 60 倍
Answer.AI 开源 cachy 包,通过修改 httpx 的 send 方法把 LLM 响应缓存到本地文件,无需手写 mock。测试运行从 2 分钟缩短到约 2 秒,并让 CI/CD 测试和 notebook diff 更干净。
推荐理由:开源工具 cachy 通过拦截 httpx 缓存 LLM 响应,测试从 2 分钟降到约 2 秒,方法可直接迁移到自己的项目。
Sam Altman:Blog(RSS)精选AI 评分8585 Sam Altman 宣布推出 Sora 2 模型及同名视频社交 App
OpenAI 推出名为 Sora 的 App,由新模型 Sora 2 和视频创作分享产品组成,称其为创意的 ChatGPT 时刻。亮点包括 cameo 功能,可把自己和朋友放进视频并保持角色一致性;同时上线防深度伪造、有害内容防护和用户情绪健康定期检查等措施,并承诺优化长期用户满意度、允许用户控制信息流、优先创作和帮助用户实现长期目标。
推荐理由:原文给出 Sora 2 与社交 App 的核心功能、cast 佩戴与防止滥用等措施,以及产品原则,可帮助读者了解其定位与设计取舍。
通义 QwenAudio:原创语音项目精选AI 评分7070 Qwen-Image 开源:支持复杂文字渲染与精确图像编辑的图像生成基础模型
QwenLM 发布 Qwen-Image,一个图像生成基础模型,主打复杂文字渲染和精确图像编辑能力,代码发布在 GitHub(https://github.com/QwenLM/Qwen-Image)。
OpenAI Developers(RSS)精选AI 评分7070 OpenAI 开源 Computer Use API 示例应用,含浏览器与桌面两个智能体
OpenAI 发布 Computer Use API 的示例应用 openai-cua-sample-app,包含两个计算机操作智能体:一个用 JavaScript 和 Playwright 控制浏览器,另一个用 Python 和 PyAutoGUI 通过截图、鼠标和键盘控制桌面。
推荐理由:OpenAI 官方开源了计算机操作智能体的示例应用,读者可以据此了解用代码驱动浏览器和桌面的模式。
Suno:Blog(网页)精选AI 评分6161 Suno 发布升级版 Song Editor 与 stem 拆分等创作控制功能
Suno 推出升级版 Song Editor,可在波形上逐段重排、重写和重制曲目,并可将曲目拆分为 12 个干净 stem 供预览和下载。同时支持最长 8 分钟的整曲上传,新增三个创意滑块控制生成风格,可继续在 DAW 中编辑或在 Suno 内完成曲目。
推荐理由:官方介绍升级版 Song Editor、12 轨 stem 拆分和 8 分钟上传等新能力,可帮助创作者评估其在音乐工作流中的用法。
Mistral AI:News(网页)精选AI 评分6767 Mistral 发布 Agents API,内置连接器与智能体编排
Mistral AI 发布新的 Agents API,将语言模型与代码执行、网页搜索、图像生成、文档库和 MCP 工具等内置连接器结合,并支持跨对话的持久记忆与多智能体编排。
推荐理由:官方原文给出内置连接器、有状态对话和智能体编排的具体能力,还附 SimpleQA 对比数字,便于评估它在实际工作流中的用法。
Answer.AI 官方研发博客(RSS)精选AI 评分6868 fastai 团队发布 nbsanity,一行 URL 即可将 GitHub 上的 Jupyter Notebook 渲染为精美网页
fastai 团队发布免费服务 nbsanity,将 GitHub 仓库或 Gist 中的公开 Jupyter Notebook 渲染为精美网页,只需把 URL 中的 github.com 替换为 nbsanity.com,或使用提供的书签工具。
推荐理由:原文来自开发团队,说明工具的用法、基于 Quarto 的能力边界和限制,读者可据此判断是否适合分享自己的 notebook。