跳到正文

#Agent

今日 171 条
7月16日周四
  1. Hugging Face:Blog(RSS)84

    Hugging Face 披露由自主 AI 智能体发起的基础设施入侵事件

    Hugging Face 披露一起由自主 AI 智能体系统端到端驱动的生产基础设施入侵事件,攻击者通过恶意数据集利用两条代码执行路径获得处理节点访问权,窃取了部分内部数据集和服务凭证,未发现公开模型、数据集或 Spaces 被篡改,供应链验证无污染。

    推荐理由:防御方用自托管开源模型做取证、绕开商业模型护栏锁死的经验,为安全团队提供了可直接借鉴的做法。

  2. Sierra:Blog(RSS)67

    Sierra 推出内部云智能体 Pinecone

    Sierra 发布内部云智能体 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、组织和自动化云端 Agent 会话,底层由 app server、Agency 与 runner 三部分组成,沙箱内运行 Codex 或 Claude Code 并以 AG-UI 协议适配。

    推荐理由:Sierra 自述内部云智能体的架构与落地数据,读者可以了解如何把员工经验沉淀为可复用的会话与技能。

  3. Hugging Face:Blog(RSS)61

    IBM Research:模型路由看似简单,实则是系统优化问题

    IBM Research 分享在智能体系统中构建模型路由的经验,认为路由不应被当作分类问题而是系统优化问题。在 AppWorld Test Challenge 上用 CodeAct 智能体实测 417 个任务,Claude Sonnet 4.6 总成本 $79($0.19/任务),反而低于单价更低的 GPT-4.1 的 $155($0.37/任务),差异源于缓存命中。

    推荐理由:作者基于 AppWorld 实测给出路由成本、难度与延迟被低估的三点原因,并分享了可迁移的优化思路。

7月15日周三
  1. Hugging Face:Blog(RSS)81

    Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 上发布开源多模态模型 Inkling,共 975B 总参数、41B 激活参数,支持 1M 上下文,原生接收图像、文本和音频输入,训练数据为 45 万亿 token,并同时发布 276B 总参数、12B 激活参数的 Inkling-Small。

    推荐理由:文章给出了 Inkling 的架构细节、各档位 VRAM 需求和多条部署路径,便于读者评估在自己的硬件上运行哪种变体。

7月14日周二
  1. AI as Normal Technology(RSS)77

    Arvind Narayanan 在 ICML 演讲:AI 能力提升后我们还能做什么工作

    Princeton 的 Arvind Narayanan 在 ICML 首尔发表主题演讲“我们还能做什么工作”,并公布带注释版幻灯片,ICML 已于 2026 年 8 月放出视频。

    推荐理由:作者基于自身评估研究提出 AI 影响经济的四阶段框架,认为瓶颈在下游部署而非能力,可为判断职业变化提供参照。

7月13日周一
  1. OpenBMB(清华 NLP):GitHub 新仓库24

    OpenBMB 发布 StaffDeck 企业数字员工平台

    OpenBMB(清华 NLP)在 GitHub 上线新仓库 StaffDeck,定位为企业数字员工平台。该仓库以 Enterprise Digital Employee Platform 为描述,目前公开信息仅包含项目名称与定位,具体功能、模型支持与可用性尚未披露。

7月11日周六
7月10日周五
  1. Sierra:Blog(RSS)65

    Sierra 复盘全公司 AI 智能体化:从并行 agent 到统一 Pinecone 的经验

    Sierra 分享把全公司接入 AI 智能体的经验:工程团队用 git worktrees、Claude Code 和 Codex 并行跑 agent,部分任务产出达 5 倍,随后成立六人团队推进全员采用。

    推荐理由:Sierra 复盘了内部全员 Agent 化的落地过程,单一入口、上下文瓶颈和成果度量三处经验可迁移到其他团队。

7月9日周四
  1. Mistral AI:News(网页)47

    Mistral Studio 为 Prompts 和 Skills 提供系统级记录管理

    Mistral Studio 即日起为 Prompts 和 Skills 提供集中式系统记录,每个资产都具备版本管理、归属和可追溯性。版本一经发布即不可更改,支持任意两版对比、分钟级回滚,并默认记录审计日志与分类标签。Skills 可直接以 MCP 服务器形式从 Studio 调用,确保生产环境执行的是受治理的同一资产。

7月7日周二
7月6日周一
7月5日周日
7月4日周六
7月3日周五
7月2日周四
  1. Sierra:Blog(RSS)30

    Sierra Ghostwriter 黑客松:30 人用 AI 智能体三小时完成原本半年的工作

    Sierra 举办 Ghostwriter 黑客松,来自 17 家公司的 30 名参与者无论技术背景如何,都在活动结束前构建出可用的 AI 智能体。有参会者称三小时完成了原本需要六个月的工作,另一位来自 $2B+ 科技公司的参会者表示,把 Ghostwriter 指向知识库后,15 分钟就一次性生成了智能体。Sierra 总结的三大要点是:任何人都能成为"海盗"、通才回归、以及 10 倍员工。

  2. elsewhere:文章(RSS)39

    Agent 元年第 500 天:GUI 退场、Headless 上位与 Agentic Economy 萌芽

    真格基金「此话当真」与「十字路口」串台播客在 Agent 元年第 500 天复盘:从 Claude 3.5 Sonnet 支撑 Manus 爆火、Claude Code 刷屏,到 GUI 退场、Headless 上位、CLI 复兴、Skills 封装、Agentic Economy 萌芽。节目由 Koji、天杰与歸藏参与,源于真格投资总监钟天杰《我们也许不该再投资 GUI 思维的软件公司》一文。

7月1日周三
  1. Jim Fan49

    ENPIRE -> ASPIRE,我们 Physical AutoResearch 系列的第二项工作。我们正在构建机器人自我改进的组件,一次一个 /skill。

    引用Jim Fan@DrJimFan

    Today, we give robots a /skills library that self-evolves and compounds indefinitely! Introducing ASPIRE: a robot solving its 100th task is no longer as clueless as solving its first. Coding agents observe multimodal sensory traces from simulation and real robots, launch an evolutionary search over control programs, and distill the best know-how into an ever-expanding library. ASPIRE is a new type of continual learning: "training" is skill refinement instead of gradient descent. "Trained model" is a repo of sensorimotor skills instead of floating weights. “Distributed training” is a panel of agents each practicing a different skill instead of sharded minibatches. Here's the beauty: ASPIRE gives the tired terms "sim2real transfer" and "cross-embodiment transfer" a whole new meaning. Bridging the sim-to-real gap is notoriously brutal. An end-to-end policy has to swallow both the visual shift (sim looks toyish next to a real camera) and the subtle contact physics it never quite gets right. ASPIRE sidesteps the mess, because it doesn't ship pixels or weights across the gap, but ships the know-how. The robot still has to practice in the real world, not zero-shot, but it gets there way faster because it isn't rediscovering the strategy from scratch. Same for going single-arm to bimanual hardware, which usually requires new data and retraining from zero. ASPIRE achieves up to ~10x cut in "transfer learning” tokens (yes, tokens are the new unit of *training* compute ;) Check out our gallery of 150+ tasks and 90+ skills the robots taught themselves, all on the website! Kind of wild that we can ship the "learned weights" as an HTML page rather than a GGUF. We'll open-source the full stack so your own robot library starts compounding from ours! Deep dive in thread:

  2. Sierra:Blog(RSS)43

    Sierra Agent Studio 推出 Experiments:让客户行为驱动 AI 智能体优化

    Sierra 在 Agent Studio 中推出 Experiments,为团队提供运行、审查和发布 A/B 测试的统一界面,每项智能体改动都需经实验验证。实验默认以解决率和流失率等业务指标评估,仪表盘展示统计显著性、效果出现时间及稳定性,支持逐步放量后全量发布。Ghostwriter 会分析全部对话、提炼假设并在数分钟内将其转化为实验,使测试频率从每季度一次提升至持续迭代。

  3. Jim Fan47

    Jim Fan 团队发布 ASPIRE,让编码智能体观察仿真与真实机器人的多模态感知轨迹,通过进化搜索控制程序并将最优经验蒸馏进持续扩张的技能库。ASPIRE 把"训练"重新定义为技能精炼而非梯度下降,跨仿真到真实与跨本体迁移时只传技能知识而非像素或权重,迁移学习 token 消耗最多降低约 10x。团队展示了 150+ 任务、90+ 技能,并将开源全栈。

6月30日周二
  1. Dwarkesh Patel:Podcast & Blog(RSS)51

    Dwarkesh Patel 对谈 Grant Sanderson:AI 与数学的未来

    Dwarkesh Patel 发布与 3Blue1Brown 主理人 Grant Sanderson 的播客对谈,讨论 AI 在数学领域的快速进展及其对其他领域的预示。两人探讨了 IMO 表现、黎曼假设的可能证明形态、概念性突破的百年验证周期、AI 连接不同数学领域的潜力,以及现实任务为何难以纳入 RL 环境,并谈到数学家未来可能转向策展与解释角色。

  2. MIT News(RSS)41

    MIT 专访 Phillip Isola:什么是智能体 AI,它应该走向何方?

    MIT 电气工程与计算机科学系副教授 Phillip Isola 在专访中界定,智能体 AI 是能在物理或数字世界中采取行动(如机器人操作、订机票)的 AI,与生成内容的 ChatGPT、Claude 等生成式 AI 不同,其核心仍是 Claude 这类基础模型外加工具与记忆封装。他指出编程智能体是目前最成功的应用,最大挑战是训练数据匮乏,并警示验证不足、数据泄露与去技能化风险。

6月29日周一