跳到正文

#Agent

今日 177 条
8月21日周五
  1. NVIDIA Technical Blog(开发者技术博客 · RSS)33

    NVIDIA AVO 在 ARC-AGI-3 上达到 100%,展示面向长时程自主智能体的前沿级通用架构

    NVIDIA 的 AVO 在 ARC-AGI-3 上取得 100% 成绩,展示了一种面向长时程自主智能体的前沿级通用架构。该工作指出前沿语言模型只是 AI 智能体的一部分,真正决定模型如何接收上下文、使用工具、维持状态、响应反馈、从失败中恢复并在长任务中持续推进的,是外围的智能体系统(常称为 harness)。

  2. NVIDIA Technical Blog(开发者技术博客 · RSS)40

    NVIDIA 谈安全在 AI 智能体栈中的位置

    NVIDIA 的 AI 安全团队结合与 NVIDIA OpenShell、智能体开发者、开源项目及生态伙伴的合作,阐述了对新兴 AI 智能体栈的看法,包括各层所扮演的角色。随着 AI 智能体能力增强、运行周期变长,在其驱动的应用中内建安全与信任变得愈发重要。

8月20日周四
8月19日周三
8月18日周二
8月17日周一
8月15日周六
  1. Nathan Lambert:Interconnects(RSS)71

    Nathan Lambert 解析 GLM-5.3 与中国实验室如何跟上前沿

    Z.ai 发布 GLM-5.3,目前仅在编码计划中提供,即将上线 API 并在两周后于 Hugging Face 开放权重,模型约 750B 参数,在多个 agentic coding 基准上超越 Kimi K3,部分超越 Claude Fable 5 或 GPT-5.6-Sol。

    推荐理由:作者以第一手分析解释中国实验室如何保持前沿,给出发布节奏、RL 环境数据产业和模型定位等可迁移的判断框架。

  2. Pragmatic Engineer(RSS)33

    Meta 自食其果的“离职潮”

    Meta 的裁员与强制调岗引发未被波及的工程师也开始求职,形成“离职潮”,公司如今以大额股权留人却收效甚微。Cursor 团队发布通用 AI harness Grok Bot,被形容为“面向知识工作的 Codex 体验”,作者用它自动化了大量日常工作流。

8月14日周五
  1. Hugging Face:Blog(RSS)69

    Hugging Face 发布 2026 夏季开源模型生态观察报告

    Hugging Face 发布 2026 年 1 至 8 月开源模型生态观察报告,指出 Hub 公开模型仓库从 243 万增至 296 万、数据集突破 100 万,但 85.6% 的模型终身下载不足 200 次。

    推荐理由:报告用 Hub 下载、许可证与衍生模型数据区分关注度与真实采用,读者可据此校准自己对开源模型生态的判断。

  2. Sierra:Blog(RSS)39

    Sierra 谈智能体时代的纵深防御:如何用 AI 守护 AI

    Sierra 提出在基于目标与护栏构建的智能体上沿用纵深防御原则,让每条客户消息在回复前经过内容、规则与政策、Supervisor 模型、确定性护栏等多层检查,单条消息可触发多达六项校验。Sierra 还通过第三方对抗评估与红队测试、平台级 Threat Detection 与单智能体 Agent Monitors 持续监控,并用 Simulations 在上线前压测护栏回归。

8月13日周四
  1. Pragmatic Engineer(RSS)47

    Charity Majors:2026 年不该再对 AI 开发持怀疑态度

    Honeycomb CTO Charity Majors 认为,2025 年对 AI 持怀疑尚属合理,但 2026 年 AI 正在改变整个行业,怀疑空间越来越小。她称自己的转折点是 2025 年 11 月的 Opus 4.5,并认为 Claude Code 这类 harness 带来的改变更大。她还提出代码审查被高估、非确定性系统需要更多工程纪律。

8月12日周三
  1. Sierra:Blog(RSS)29

    Sierra 谈 Horizon 智能体:跟进就是成交

    Sierra 称其 Horizon 智能体可为每位潜在客户配备一名 AI 智能体,持续数天、数周甚至数月主动跟进,直到客户购买或放弃。文中以车险为例,AI 智能体 Jamie 在客户保存报价后当晚即发短信,第 4 天解答保险条款问题,第 7 天完成通话并促成保单购买。Sierra 表示该智能体遵循企业合规要求,沟通内容由企业控制。

8月11日周二
  1. Jensen Huang57

    NVIDIA 发布 Nemotron 3.5 Lightning,一个开放权重的 30B MoE 模型,活跃参数 3B,面向持续运行、高吞吐的智能体任务。官方称其输出速度可达同规模模型的 4 倍。Jensen Huang 转发该发布并称其 smart、fast、efficient and open。

    引用NVIDIA AI@NVIDIAAI

    Introducing NVIDIA Nemotron 3.5 Lightning⚡ An open 30B MoE model with 3B active parameters, built for always-on agents to complete high-volume, specialized tasks faster. It delivers up to 4x the output speed of similar-sized models.

  2. Sierra:Blog(RSS)50

    Sierra 为 Agent 推出开箱即用的 IVR 电话导航能力

    Sierra 宣布其平台上的 Agent 可开箱即用地导航复杂的 IVR 电话系统,官方评测中整体通过率从 57% 提升至 85%,增幅约 49%。该能力覆盖通话时机、多级菜单、DTMF 按键音、静默处理和识别真人,配合记忆与智能重试逐步提升成功率;已有医疗支付方、数字药房和收入周期管理公司在使用,文章还展望了 Agent 可信身份认证的长期方向。

8月10日周一
  1. Import AI62

    Import AI 468:23 条 RSI 政策建议、PostTrainBench+ 与 AI 竞速中的信任和透明度

    Import AI 第 468 期汇总了多项 AI 研究进展。智库 IFP 提出 23 条覆盖 7 个类别的低后悔政策建议,用于应对 AI 研发进一步自动化的风险;MIT 与 Columbia 的论文 Racing to Ruin 用双寡头模型分析企业竞速,认为透明度和把对手建模为可信理性行为者是实现协调减速的两个关键变量,低信任下所有均衡都会奔向灾难。