#Agent
#Agent
今日 14 条
Sakana AI@SakanaAILabsAI 评分3535Artificial Analysis 完整文章(网页)AI 评分5252 Upstage 发布 Solar Mini 4:Artificial Analysis 实测 24 分推理模型,单任务成本约为 GPT-6 Luna 的 5 倍
韩国 AI 公司 Upstage 发布专有推理模型 Solar Mini 4,Artificial Analysis 智能指数得分 24,高于上代旗舰 Solar Pro 3 的 8 分,每百万 token 定价 $0.10/$0.40。
Artificial Analysis 完整文章(网页)精选AI 评分7979 Artificial Analysis 评测 Gemini 4 Argon:Google 重回智能前三
Artificial Analysis 评测 Google DeepMind 新模型 Gemini 4 Argon,其在 Artificial Analysis Intelligence Index 得 53 分,追平 GPT-6 Astra(max),高于 GPT-6.1 Sol(52),为 Google 超 7 个月来首个高于 Flash 档的专有模型。
推荐理由:第三方评测给出了智能指数、单位任务成本、幻觉率等多项横向数据,可用于比较 Gemini 4 Argon 与竞品的实际表现。
Apple Machine Learning Research(RSS)AI 评分4545 Apple 提出 SCLATE:面向持续学习智能体训练与评估的执行底座
Apple 研究团队提出 SCLATE,一个让基准测试与未经修改的智能体各自通过适配器向同一开放事件调度器注册事件的执行底座,用混合模拟时钟把长达一个月的场景压缩到数小时。
METR:Blog(网页)精选AI 评分7070 METR 主席 Chris Painter 就 OpenAI / Hugging Face 智能体事件向美国参议院作证
2026年9月30日,METR 主席 Chris Painter 在美国参议院国土安全委员会小组听证会上就 OpenAI / Hugging Face 事件作证。
推荐理由:这是当事机构负责人在参议院听证会的完整证词,以第一手视角拆解了 OpenAI / Hugging Face 事件的三要素框架,并给出行业共性观察。
Claude:Blog(网页)AI 评分4949 Claude for Government 正式面向联邦与州政府机构开放
Anthropic 宣布 Claude for Government 正式可用,面向联邦和州政府机构提供 FedRAMP High 授权环境下的 Claude 编码与智能体能力,此前自 7 月起处于公开测试。
MiniMax (official)@MiniMax_AIAI 评分4343引用Creatify Labs@Creatify_LabsIntroducing Boreal-H3 — a video model built for ads and our next step toward recursive self-improvement in video generation. A good-looking video isn’t enough. The product has to stay the same. The actor has to stay the same. The label has to be right. And the action in the brief actually has to happen. So we post-trained MiniMax H3 specifically for advertising. But this isn’t a one-off SFT or LoRA fine-tune. We built a closed-loop system that learns what to improve next. Human-calibrated evaluation diagnoses failures and guides the next intervention: targeted data collection, reinforcement learning, or inference optimization. When the feedback is unreliable, we revise the evaluator or reward—not just the generator. Every experiment feeds into shared memory, informing the next training decision. The model improves, and so does the process that produces its successor. The results: → 85.3% reference fidelity — highest among the frontier video generation models we evaluated → Brief success: 28% → 50% → Identity match: 83% → 94% → Visible defects per clip: down 70% → Generation time and estimated cost: down 20% Boreal-H3 doesn’t just make better-looking video. It makes more usable ads. Credit to the @MiniMax_AI team for the foundation we’re building on. This launch is a checkpoint, not the finish line. We’re building more than a better video model. We’re building a system that learns how to make the next one better.
NVIDIA AI@NVIDIAAIAI 评分3535
OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分3939 OpenAI 与美国 SBDC 合作,帮助小企业用上 AI
OpenAI 宣布与美国 SBDC 合作,计划通过 OpenAI Academy 社区培训师项目培训约 150 名小企业发展中心顾问,并以线下工作坊等形式触达至少 1000 家小企业。
Databricks:Blog(RSS)AI 评分3434 Databricks 如何在不制造 AI 蔓延的前提下扩展智能体应用
Databricks 联合 OpenAI 和 Stellantis 探讨企业级智能体应用的规模化路径,核心结论是智能体越自主,其周边基础设施越关键,需同时提供模型与框架选择、受治理的企业上下文,以及贯穿每次操作的控制能力。
Google Blog:AI(RSS)精选AI 评分6666 Gemini 全球上线 skills 功能,将逐步取代 Gems
Google 将 skills 功能直接推向 Gemini 聊天的全球用户,并将在未来几周内面向 Google Workspace 商业、企业、非营利和教育客户开放。
推荐理由:官方公告说明了 skills 的使用方式、可用范围和 Gems 退出时间表,用户可据此安排迁移。
NVIDIA AI@NVIDIAAIAI 评分3333
NVIDIA Technical Blog(开发者技术博客 · RSS)AI 评分3636 NVIDIA NeMo Relay 如何追踪 AI 智能体执行框架行为
NVIDIA NeMo Relay 可追踪 AI 智能体执行框架(agent harness)的行为,揭示智能体在完成任务时走过的低效路径。失败的搜索会触发另一次搜索,被截断的文件读取会导致命令重复获取相同内容,这些多余步骤虽被正确答案掩盖,却增加延迟并消耗 token。
NVIDIA AI@NVIDIAAIAI 评分2222构建边缘 AI 的新方式:在 NVIDIA Jetson 上进行智能体开发 https://x.com/i/broadcasts/1yJAPwpzakzGb
xAI:News(网页)精选AI 评分6464 xAI 发布 grok-voice-think-fast-1.0 旗舰语音模型并开放 API
xAI 发布旗舰语音模型 grok-voice-think-fast-1.0,可通过 API 使用。该模型面向客服、销售等复杂多步骤语音工作流,原生支持 25+ 种语言,在 τ-voice Bench 排行榜上排名第一。后台推理不影响响应延迟。该模型已为 Starlink 提供电话客服与销售:销售转化率 20%,客服自主解决率 70%,单个智能体使用 28 个工具。
推荐理由:官方给出了基准成绩、多语言支持和 Starlink 实际运营数据,可帮助读者评估这款语音模型在真实客服场景的可用性。
xAI:News(网页)AI 评分4545 xAI 将 Grok 接入 Nous Research 开源 Hermes Agent
xAI 宣布 Grok 订阅可直接在 Nous Research 的开源自改进智能体 Hermes Agent 中使用,所有订阅档位均可接入。接入后可用 Grok 4.3 进行文本对话与高级推理、Grok Text-to-Speech 语音回复,以及 Grok Imagine 生成图像和视频。
xAI:News(网页)精选AI 评分6868 xAI 为 Grok 推出 Skills 功能
xAI 推出 Skills 功能,教 Grok 一次即可在所有对话中记住偏好和工作流,内置 Word、演示文稿、表格、PDF 和 Skill Creator 等技能,无需设置。用户可通过对话或上传文件自定义技能,自己的版本优先于内置版本。Skills 已在 Grok 4.3 上的 grok.com、iOS 和 Android 上线。
推荐理由:官方公告写明了 Skills 的内置能力、自定义方式和可用平台,读者可据此判断是否纳入自己的工作流。
xAI:News(网页)AI 评分4242 xAI 支持在 OpenClaw 中使用 Grok,SuperGrok 与 X Premium 订阅可直接登录
xAI 宣布即日起 SuperGrok 或 X Premium 订阅用户可在开源、本地优先的智能体 OpenClaw 中登录使用 Grok 模型,所有订阅档位均可接入。
xAI:News(网页)精选AI 评分6767 xAI 发布终端编码智能体 Grok Build 早期测试版
xAI 发布终端编码智能体 Grok Build 的早期测试版,面向所有 SuperGrok 和 X Premium Plus 订阅者开放。它支持计划模式审批、AGENTS.md、hooks、skills 和 MCP 服务器开箱即用,可将任务分派给并行运行的子代理,并提供 headless 模式(-p)与完整 ACP 支持。用户可输入 /feedback 提交反馈。
推荐理由:官方介绍覆盖计划模式、并行子代理和 headless 模式等能力,读者可据此判断如何接入现有终端工作流。
xAI:News(网页)AI 评分3838 xAI 将 Grok 接入 Kilo Code,SuperGrok 与 X Premium+ 订阅可直接使用
xAI 宣布 Grok 订阅可直接在开源智能体编程平台 Kilo Code 中使用,SuperGrok 或 X Premium+ 用户无需单独的 API key 即可连接 Grok 账号,调用包括 Grok Build 在内的最新模型。
xAI:News(网页)精选AI 评分6262 xAI 发布编码模型 grok-build-0.1,API 公测上线
xAI 将编码模型 grok-build-0.1 以公开测试形式上线 xAI API,该模型专为智能体编码任务训练,支持 Web 开发、调试和 MCP,也是驱动 Grok Build 的同一模型。
推荐理由:xAI 官方公告给出了 grok-build-0.1 的定位、速度、定价和适配工具,读者可据此评估是否接入自己的编码工作流。
xAI:News(网页)AI 评分5454 xAI 推出 Grok Build Plugin Marketplace 插件市场
xAI 于 6 月 11 日推出 Grok Build Plugin Marketplace,这是内置在 Grok Build 中的插件市场。插件将技能、slash 命令、agents、hooks、MCP 服务器和 LSP 打包为一个可安装包,可在终端内浏览、安装和更新,输入 /marketplace 即可使用,按 i 安装。
xAI:News(网页)AI 评分3939 xAI 将 Grok 接入 Warp:SuperGrok 与 X Premium 订阅可直接使用
xAI 宣布 Grok 与 X Premium 订阅可在 Warp 终端智能体开发环境中直接使用,覆盖近百万开发者。用户连接 SuperGrok 订阅后即可调用 Grok 模型,包括驱动 Grok Build 的 grok-build-0.1。更多智能体与集成即将面向 SuperGrok 和 X Premium 订阅者推出。
xAI:News(网页)AI 评分5656 xAI 为 Grok Build 推出 Agent Dashboard,支持同时管理多个编码会话
xAI 为 Grok Build 推出 Agent Dashboard,把所有会话集中到一屏,支持并行运行、按状态排序并优先处理等待输入的会话。用户可在 shell 运行 grok dashboard,或在会话内用 /dashboard(Ctrl+\)打开;支持不离开面板查看并回复输出、底部输入框派发新会话、接管任意会话,关闭面板后所有会话继续运行。
xAI:News(网页)AI 评分3838 Grok 4.3 正式上线 Amazon Bedrock
xAI 宣布 Grok 4.3 在 Amazon Bedrock 正式可用,支持 100 万 token 上下文窗口和可配置推理强度(none/low/medium/high)。该模型在 Artificial Analysis Omniscience 与 Tau2 Telecom 等基准上排名第一,定价为输入 $1.25、输出 $2.50 每百万 token。
xAI:News(网页)AI 评分2323 Grok 模型上线 Databricks Agent Bricks
Grok 模型现已在 Databricks 的开发者智能体平台 Agent Bricks 上原生可用,这是 Databricks 2026 Data + AI Summit 期间宣布的合作。
xAI:News(网页)AI 评分5858 xAI 在 Grok Build 推出 /goal 长时自主任务执行模式
xAI 在 Grok Build 中推出 /goal 模式,支持长时自主执行任务,智能体会持续工作直到任务完成并验证,包括审查代码、检查网页或执行脚本。用户只需一行给出目标,智能体会规划方案、把工作拆成进度清单并开始执行,期间可继续追加指令,另有新命令用于监控和引导长时任务,完成后面板显示 Complete 且清单全部勾选。
xAI:News(网页)精选AI 评分7373 xAI 开源 Grok Build 编码 Agent 与 TUI
xAI 宣布开源 Grok Build 的编码 Agent 与 TUI,源码已发布在 GitHub。
推荐理由:源码公开了 agent loop、工具、TUI 和扩展系统的实现细节,还支持本地编译和接自有推理服务。
xAI:News(网页)精选AI 评分6060 Grok 推出 Automations 定时与邮件触发自动化功能
xAI 推出 Automations,用户用一段聊天式描述创建任务,Grok 可按计划(一次性、每天、工作日、每周、每月、每年)或邮件触发自动运行,每次运行都是完整对话并保存历史,可通过邮件、应用通知或不通知回报结果。Automations 已在 grok.com 和 iOS、Android 应用开放:定时自动化对所有用户可用,邮件触发需 SuperGrok。
推荐理由:官方原文说明了定时与邮件触发两种运行方式和各档位可用范围,读者可以据此评估是否把它接入自己的日常流程。
xAI:News(网页)精选AI 评分7878 xAI 发布 Grok 4.5,主打编码、智能体任务与知识工作
xAI 于 7 月 16 日发布 Grok 4.5,定位为其最强模型,面向编码、智能体任务和知识工作,与 Cursor 联合训练。
推荐理由:官方发布页给出了基准分数、定价、token 效率和免费入口等具体数据,读者可据此与其他模型比较并选择使用场景。
xAI:News(网页)精选AI 评分6767 xAI 推出 Grok for Outlook 插件
xAI 将 Grok 引入 Microsoft Outlook,作为 Microsoft 365 插件在收件箱旁提供智能体能力:总结长邮件串并给出决策、负责人和待办事项,按用户语气起草回复,批量整理积压邮件(归档已完成会话、过滤垃圾邮件、标出需回复的邮件),还能读取附件并搜索网页和 X。
推荐理由:官方介绍了 Grok Outlook 插件的整理邮件、代拟回复等具体能力与获取方式,读者可据此评估它对邮箱工作流的影响。
xAI:News(网页)精选AI 评分7373 Grok Build 推出 Workflows 功能,可编排数百个并行 agent 后台完成任务
xAI 宣布 Grok Build 支持 Workflows,用自然语言描述任务后由 Grok 规划并在后台分发给数百个并行 agent 执行,完成后汇报结果。
推荐理由:官方说明了 workflows 的编排方式、agent 预算和复用机制,读者可据此判断它适合哪类多智能体任务。
xAI:News(网页)AI 评分5858 xAI 发布 Grok for Google Workspace 插件,覆盖 Sheets、Slides 和 Docs
xAI 推出 Grok for Google Workspace 免费插件,一次安装即可在 Sheets、Slides 和 Docs 中直接使用 Grok。
xAI:News(网页)AI 评分5151 xAI 推出 Build Mode:用对话创建并发布网站、应用、游戏和仪表盘
xAI 推出 Build Mode,用户用自然语言描述想法,Grok 在对话中直接写出代码并生成可运行的预览,可继续修改布局、功能和样式。完成后可发布为 grok.me 链接或自定义域名。Build Mode 以 Early Beta 形式面向 SuperGrok Heavy 订阅用户开放,覆盖 grok.com、iOS 和 Android。
xAI:News(网页)精选AI 评分6868 xAI 发布 Grok Voice Think Fast 2.0 语音模型
xAI 发布 Grok Voice Think Fast 2.0,称其在 Artificial Analysis 语音到语音质量指数达 82.9%,高于上代 75.7% 及对比模型;出声延迟 0.70s,转录准确率较 Deepgram Nova 3 和 ElevenLabs Scribe v2 提升 1.5–2.0×,推理 token 效率为上代 0.4×。
推荐理由:原文给出 Artificial Analysis 对比数据和价格迁移细节,读者可据此评估它在语音智能体场景的替换成本。
xAI:News(网页)精选AI 评分7373 xAI 发布 Grok Bot:可长期自主工作的云端 Agent 队
xAI 发布 Grok Bot,一组可全天候工作的 AI 智能体,拥有自己的云端计算机,能登录用户已有工具和应用中端到端完成任务,仅在需要审批时回报。产品处于 beta 阶段,面向 SuperGrok 和 Cursor 多档订阅用户开放桌面与 iOS 端,使用量与现有 Grok 和 Cursor 套餐分开计算;企业用户可加入等待名单。
推荐理由:xAI 官方发布,读者可以据此了解 Grok Bot 的运行方式、订阅范围和与现有 Agent 产品的差异。
xAI:News(网页)精选AI 评分7878 xAI 发布 Grok 4.6,聚焦长程智能体与视觉交互任务
xAI 发布 Grok 4.6,在 Grok 4.5 基础上重点提升长程智能体和交互视觉类任务能力,在 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平(61 分)。
推荐理由:官方公告给出了各基准对比数字、API 定价和开放入口,读者可据此评估 Grok 4.6 在智能体编码上的位置。
xAI:News(网页)精选AI 评分7070 Grok Build 全量开放:网页与移动端所有套餐可用
xAI 宣布 Grok Build 在网页、iOS 和 Android 上向所有套餐开放,用户在 Grok 对话中描述应用、游戏、网站或仪表盘即可生成可运行版本。
推荐理由:原文列出了从 Early Beta 到全量开放的发布与分享、Remix、自定义域名等具体变化,读者可据此判断是否纳入自己的应用搭建流程。
xAI:News(网页)AI 评分4444 Grok 4.6 上线 Amazon Bedrock
xAI 的旗舰模型 Grok 4.6 现已在 Amazon Bedrock 正式可用,面向长时间运行的智能体及交互与视觉任务,支持 500k 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度。定价为输入 $2 / 百万 tokens、缓存输入 $0.50 / 百万 tokens、输出 $6 / 百万 tokens,已在支持的 AWS 区域向所有开发者开放。
xAI:News(网页)AI 评分4343 Grok 4.6 上线 Gemini Enterprise Agent Platform
xAI 的旗舰模型 Grok 4.6 现已在 Gemini Enterprise Agent Platform 的 Model Garden 中开放给开发者使用。该模型面向长时间运行的智能体及交互与视觉任务,提供 500k 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度。定价为输入 $2、缓存输入 $0.50、输出 $6 每 100 万 tokens。