跳到正文

#Agent

今日 14 条
8月7日周五
8月5日周三
8月4日周二
  1. Microsoft Research 博客(RSS)75

    Microsoft Research 开源 Orchard 智能体框架并发布三个领域模型

    Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。

    推荐理由:官方开源了环境服务和三条训练配方,小参数量模型在 SWE-bench Verified 等基准上的具体结果可直接对照复用。

8月3日周一
  1. Sierra:Blog(RSS)44

    Plaid 与 Sierra 合作,让 AI 智能体从对话走向业务成果

    Plaid 与 Sierra 达成合作,客户可在 Sierra 的 AI 智能体内直接安全连接银行账户,无需离开对话即可完成支付或财务验证。Sierra 上月推出的 Horizon 平台支持智能体跨数天、数周甚至数月主动推进再融资、催收、保险理赔等长周期任务。该集成以消费者明确授权为前提,并配备合规监控与人工介入机制。

8月1日周六
  1. Together AI 研究与产品博客(RSS)82

    Together AI 发布 Kimi K3 开发者完整指南

    Together AI 发布 Kimi K3 开发者指南。Kimi K3 是 Moonshot AI 的 2.8 万亿参数开源权重模型,支持 1M 上下文、KDA 与 AttnRes 架构,API 兼容 OpenAI,定价为缓存命中输入每 1M token $0.30、未命中 $3.00、输出 $15.00。

    推荐理由:Together AI 官方上手指南,覆盖 Kimi K3 的架构要点、推理与缓存等 API 细节和定价,便于开发者直接接入生产。

7月31日周五
7月30日周四
  1. Sierra:Blog(RSS)48

    Sierra 推出 Agency:为 AI 智能体打造安全可扩展的沙箱基础设施

    Sierra 发布 Agency,一个基于 Kubernetes 的智能体沙箱编排层,为 Pinecone 和 Ghostwriter 的每个会话与任务提供安全运行环境。Agency 分无状态控制平面与有状态 runner 两层,通过 IAM 鉴权、DynamoDB 记录状态,每个 runner 配备 8+ 核、24GiB 内存和持久化存储。默认不向智能体暴露任何 API key 或密钥。

7月29日周三
  1. BAIR:Berkeley AI Research Blog62

    从 CUDA 到 MLX:K-Search 如何把数十年内核经验带到 Apple Silicon

    IBM Research 基于 UC Berkeley Sky Lab 的 K-Search 框架扩展出 MLX 后端,并设计结构化 CUDA-to-MLX 翻译层,让进化式内核搜索把已有 CUDA 内核当作知识库适配到 Apple Silicon。

    推荐理由:K-Search 把 CUDA 内核优化经验迁移到 Apple Silicon,读者可了解跨平台内核搜索的方法与实测数据。

7月28日周二
7月27日周一
7月26日周日
  1. BAIR:Berkeley AI Research Blog32

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 智能体的摘要以自然语言"信念状态"形式隔离并监督其信息内容,替代完整交互历史作为工作上下文。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将自摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值上下文 token 长度也低于全上下文设置。

7月24日周五
  1. Sierra:Blog(RSS)60

    Sierra 宣布收购 Takeoff,双方将共建 Horizon 平台

    Sierra 宣布收购 Takeoff,Takeoff 今年初以来从 0 美元 ARR 做到近 8 位数营收,双方将共建名为 Horizon 的新平台。Takeoff 以 3 人团队构建长时程智能体运行时,覆盖借贷到医疗等五个行业,并主张按方案产生的成果直接收费,现正全岗位招聘。

7月23日周四
7月22日周三
7月21日周二
7月20日周一
7月17日周五
  1. Google DeepMind:Blog(RSS)61

    Google DeepMind 发布网络安全模型 Gemini 3.5 Flash Cyber

    Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于快速发现、验证并修复漏洞,将通过限access试点先面向政府和可信伙伴经 CodeMender 开放。

    推荐理由:以轻量模型多次调用替代单次大模型调用做漏洞挖掘,并用 Chrome 真实流水线等无污染基准展示对比结果,方法与数据都可参考。

7月16日周四
  1. Hugging Face:Blog(RSS)84

    Hugging Face 披露由自主 AI 智能体发起的基础设施入侵事件

    Hugging Face 披露一起由自主 AI 智能体系统端到端驱动的生产基础设施入侵事件,攻击者通过恶意数据集利用两条代码执行路径获得处理节点访问权,窃取了部分内部数据集和服务凭证,未发现公开模型、数据集或 Spaces 被篡改,供应链验证无污染。

    推荐理由:防御方用自托管开源模型做取证、绕开商业模型护栏锁死的经验,为安全团队提供了可直接借鉴的做法。

  2. Sierra:Blog(RSS)67

    Sierra 推出内部云智能体 Pinecone

    Sierra 发布内部云智能体 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、组织和自动化云端 Agent 会话,底层由 app server、Agency 与 runner 三部分组成,沙箱内运行 Codex 或 Claude Code 并以 AG-UI 协议适配。

    推荐理由:Sierra 自述内部云智能体的架构与落地数据,读者可以了解如何把员工经验沉淀为可复用的会话与技能。

  3. Hugging Face:Blog(RSS)61

    IBM Research:模型路由看似简单,实则是系统优化问题

    IBM Research 分享在智能体系统中构建模型路由的经验,认为路由不应被当作分类问题而是系统优化问题。在 AppWorld Test Challenge 上用 CodeAct 智能体实测 417 个任务,Claude Sonnet 4.6 总成本 $79($0.19/任务),反而低于单价更低的 GPT-4.1 的 $155($0.37/任务),差异源于缓存命中。

    推荐理由:作者基于 AppWorld 实测给出路由成本、难度与延迟被低估的三点原因,并分享了可迁移的优化思路。

7月15日周三
  1. Hugging Face:Blog(RSS)81

    Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 上发布开源多模态模型 Inkling,共 975B 总参数、41B 激活参数,支持 1M 上下文,原生接收图像、文本和音频输入,训练数据为 45 万亿 token,并同时发布 276B 总参数、12B 激活参数的 Inkling-Small。

    推荐理由:文章给出了 Inkling 的架构细节、各档位 VRAM 需求和多条部署路径,便于读者评估在自己的硬件上运行哪种变体。

7月14日周二
7月11日周六
7月10日周五
  1. Sierra:Blog(RSS)65

    Sierra 复盘全公司 AI 智能体化:从并行 agent 到统一 Pinecone 的经验

    Sierra 分享把全公司接入 AI 智能体的经验:工程团队用 git worktrees、Claude Code 和 Codex 并行跑 agent,部分任务产出达 5 倍,随后成立六人团队推进全员采用。

    推荐理由:Sierra 复盘了内部全员 Agent 化的落地过程,单一入口、上下文瓶颈和成果度量三处经验可迁移到其他团队。

7月9日周四
  1. Mistral AI:News(网页)47

    Mistral Studio 为 Prompts 和 Skills 提供系统级记录管理

    Mistral Studio 即日起为 Prompts 和 Skills 提供集中式系统记录,每个资产都具备版本管理、归属和可追溯性。版本一经发布即不可更改,支持任意两版对比、分钟级回滚,并默认记录审计日志与分类标签。Skills 可直接以 MCP 服务器形式从 Studio 调用,确保生产环境执行的是受治理的同一资产。

7月7日周二