Sierra 发布 Horizon:面向长周期目标的 AI 智能体平台
Sierra 发布 Horizon 平台,让智能体能够追求贷款发起、医疗预授权等长周期目标,跨数天、数周甚至数月主动与客户互动。Horizon 在 Agent OS 之上加入长周期规划与上下文引擎,智能体可从每次互动中学习优化决策,且按业务成果而非 token 计费。
Sierra 发布 Horizon 平台,让智能体能够追求贷款发起、医疗预授权等长周期目标,跨数天、数周甚至数月主动与客户互动。Horizon 在 Agent OS 之上加入长周期规划与上下文引擎,智能体可从每次互动中学习优化决策,且按业务成果而非 token 计费。
作者报告的 macOS Terminal 问题已在 macOS Tahoe 26.1(2025 年 11 月 3 日发布)中修复,此前特定 ANSI 转义码序列(如 \e]7;file://...\a)可让 Terminal 发出 DNS 请求实现数据外泄。
Hugging Face 披露一起由自主 AI 智能体系统端到端驱动的生产基础设施入侵事件,攻击者通过恶意数据集利用两条代码执行路径获得处理节点访问权,窃取了部分内部数据集和服务凭证,未发现公开模型、数据集或 Spaces 被篡改,供应链验证无污染。
推荐理由:防御方用自托管开源模型做取证、绕开商业模型护栏锁死的经验,为安全团队提供了可直接借鉴的做法。
Sierra 发布内部云智能体 Pinecone,让员工在浏览器、Slack、Linear 或手机上创建、组织和自动化云端 Agent 会话,底层由 app server、Agency 与 runner 三部分组成,沙箱内运行 Codex 或 Claude Code 并以 AG-UI 协议适配。
推荐理由:Sierra 自述内部云智能体的架构与落地数据,读者可以了解如何把员工经验沉淀为可复用的会话与技能。
IBM Research 分享在智能体系统中构建模型路由的经验,认为路由不应被当作分类问题而是系统优化问题。在 AppWorld Test Challenge 上用 CodeAct 智能体实测 417 个任务,Claude Sonnet 4.6 总成本 $79($0.19/任务),反而低于单价更低的 GPT-4.1 的 $155($0.37/任务),差异源于缓存命中。
推荐理由:作者基于 AppWorld 实测给出路由成本、难度与延迟被低估的三点原因,并分享了可迁移的优化思路。
Thinking Machines 在 Hugging Face 上发布开源多模态模型 Inkling,共 975B 总参数、41B 激活参数,支持 1M 上下文,原生接收图像、文本和音频输入,训练数据为 45 万亿 token,并同时发布 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:文章给出了 Inkling 的架构细节、各档位 VRAM 需求和多条部署路径,便于读者评估在自己的硬件上运行哪种变体。
MIT 航空航天系举办 JARVIS Challenge,让 31 名本科生分 7 队在四周内设计、制造并测试可产生 50–100 磅推力的单轴微型涡喷发动机,以 AI 为主要工程伙伴。
Sierra 宣布与 SoftBank Corp. 建立合作,SoftBank 将作为 Sierra 在日本的独家销售伙伴推动日本企业采用其对话式 AI 客服平台。
Princeton 的 Arvind Narayanan 在 ICML 首尔发表主题演讲“我们还能做什么工作”,并公布带注释版幻灯片,ICML 已于 2026 年 8 月放出视频。
推荐理由:作者基于自身评估研究提出 AI 影响经济的四阶段框架,认为瓶颈在下游部署而非能力,可为判断职业变化提供参照。
browser-use 开源 browser-harness-tui 仓库,将 OpenAI Codex fork 后嵌入为内置浏览器智能体。它提供 Terminal 风格的 TUI,并集成原生的 browser-harness 工具。
OpenBMB(清华 NLP)在 GitHub 上线新仓库 StaffDeck,定位为企业数字员工平台。该仓库以 Enterprise Digital Employee Platform 为描述,目前公开信息仅包含项目名称与定位,具体功能、模型支持与可用性尚未披露。
蚂蚁 inclusionAI 在 GitHub 新建仓库 AKernel,定位为面向 Agents 的可编程数据中心级基础设施。该仓库目前仅给出这一句项目描述,未披露模型、参数或性能细节。
Sierra 分享把全公司接入 AI 智能体的经验:工程团队用 git worktrees、Claude Code 和 Codex 并行跑 agent,部分任务产出达 5 倍,随后成立六人团队推进全员采用。
推荐理由:Sierra 复盘了内部全员 Agent 化的落地过程,单一入口、上下文瓶颈和成果度量三处经验可迁移到其他团队。
Mistral Studio 即日起为 Prompts 和 Skills 提供集中式系统记录,每个资产都具备版本管理、归属和可追溯性。版本一经发布即不可更改,支持任意两版对比、分钟级回滚,并默认记录审计日志与分类标签。Skills 可直接以 MCP 服务器形式从 Studio 调用,确保生产环境执行的是受治理的同一资产。
Google Research 发布 SensorFM,一个大传感器基础模型,用来自 500 万名同意参与研究者的超过一万亿分钟无标签多模态可穿戴数据进行自监督预训练,覆盖 100 多个国家、20 多种 Fitbit 和 Pixel Watch 设备。
UC Berkeley 的 Aditya G. Parameswaran 等人提出,推理成本正快速趋近于零——GPT-4 级能力从 2023 年初的约 $30/百万 token 降至如今不到 $1,部分厂商已低于 $0.10,基准测试中推理价格年降幅在 9x 到 900x 之间,中位数约 50x。
Import AI 464 期报道:Fable 在 RTX PRO 6000 Blackwell 上写出 CUDA megakernel,相比优化 PyTorch 基线取得 18.71X 加速。
蚂蚁 inclusionAI 在 GitHub 开源 PIBench,一个用于评估 AI 编程智能体在真实端到端支付集成任务中表现的基准。该基准聚焦支付集成这一实际开发场景,目前以开源形式发布。
蚂蚁 inclusionAI 在 GitHub 上线新仓库 Avernet,定位为分布式智能体协调平台,让智能体在其中共同生存、连接、协调、执行与演化。该平台目前以开源仓库形式发布,具体功能细节与可用性尚未在仓库描述中展开。
Nous Research 为 Hermes Agent 推出 Telegram Business Mode 插件,以秘书机器人形式运行,每条草拟回复都需经所有者批准后才会发送给客户。该插件采用 observe-with-approval 机制,目前已在 GitHub 开源。
美团发布 LongCat-2.0,总参数 1.6 万亿的 MoE 大语言模型,每 token 激活约 48B,权重以 MIT 协议开源。预训练覆盖超过 35 万亿 token,训练与部署全程基于 AI ASIC 超算集群;模型引入 LongCat Sparse Attention,并在 1M 上下文数据上训练,支持 GPU 与 NPU 部署。
Lilian Weng 在 Lil'Log 发表长文,梳理 harness 工程研究如何服务于递归自我改进(RSI)。
推荐理由:作者系统梳理了 harness 工程与递归自我改进的关系,并给出可迁移的设计模式、优化路径和七大未解瓶颈。
美团发布 LongCat-2.0,一个总参数 1.6 万亿、每 token 激活约 480 亿的 MoE 大语言模型,训练与部署完全基于 AI ASIC 超节点,预训练消耗超过 35 万亿 token。
美团 LongCat 团队发布 LongCat-2.0,总参数 1.6 万亿、每 token 激活约 480 亿的 MoE 大语言模型,权重以 MIT 协议开源。
Nous Research 在 GitHub 新建仓库 harbor-fork,定位为评估和改进 AI 智能体的框架。该仓库目前仅给出这一句功能描述,未披露具体模型、参数规模或评测基准信息。
Mistral AI 发布 Apache-2.0 协议的 Leanstral 1.5,总参数 119B、激活 6B,专注 Lean 4 形式化证明工程。
Sierra 举办 Ghostwriter 黑客松,来自 17 家公司的 30 名参与者无论技术背景如何,都在活动结束前构建出可用的 AI 智能体。有参会者称三小时完成了原本需要六个月的工作,另一位来自 $2B+ 科技公司的参会者表示,把 Ghostwriter 指向知识库后,15 分钟就一次性生成了智能体。Sierra 总结的三大要点是:任何人都能成为"海盗"、通才回归、以及 10 倍员工。
真格基金「此话当真」与「十字路口」串台播客以"GUI 退场 → Headless 上位 → CLI 复兴 → Skills 封装 → Agentic Economy 萌芽"为主线,梳理 Agent 元年 500 天的变化。
真格基金「此话当真」与「十字路口」串台播客在 Agent 元年第 500 天复盘:从 Claude 3.5 Sonnet 支撑 Manus 爆火、Claude Code 刷屏,到 GUI 退场、Headless 上位、CLI 复兴、Skills 封装、Agentic Economy 萌芽。节目由 Koji、天杰与歸藏参与,源于真格投资总监钟天杰《我们也许不该再投资 GUI 思维的软件公司》一文。
ENPIRE -> ASPIRE,我们 Physical AutoResearch 系列的第二项工作。我们正在构建机器人自我改进的组件,一次一个 /skill。
Today, we give robots a /skills library that self-evolves and compounds indefinitely! Introducing ASPIRE: a robot solving its 100th task is no longer as clueless as solving its first. Coding agents observe multimodal sensory traces from simulation and real robots, launch an evolutionary search over control programs, and distill the best know-how into an ever-expanding library. ASPIRE is a new type of continual learning: "training" is skill refinement instead of gradient descent. "Trained model" is a repo of sensorimotor skills instead of floating weights. “Distributed training” is a panel of agents each practicing a different skill instead of sharded minibatches. Here's the beauty: ASPIRE gives the tired terms "sim2real transfer" and "cross-embodiment transfer" a whole new meaning. Bridging the sim-to-real gap is notoriously brutal. An end-to-end policy has to swallow both the visual shift (sim looks toyish next to a real camera) and the subtle contact physics it never quite gets right. ASPIRE sidesteps the mess, because it doesn't ship pixels or weights across the gap, but ships the know-how. The robot still has to practice in the real world, not zero-shot, but it gets there way faster because it isn't rediscovering the strategy from scratch. Same for going single-arm to bimanual hardware, which usually requires new data and retraining from zero. ASPIRE achieves up to ~10x cut in "transfer learning” tokens (yes, tokens are the new unit of *training* compute ;) Check out our gallery of 150+ tasks and 90+ skills the robots taught themselves, all on the website! Kind of wild that we can ship the "learned weights" as an HTML page rather than a GGUF. We'll open-source the full stack so your own robot library starts compounding from ours! Deep dive in thread:
Ethan Mollick 撰文指出 AI 能力正以超指数速度提升,Opus 4.7 独立工作 14 小时完成相当于人类工程师 2-17 周的软件包,成本 251 美元 token,他自己的实验中 Fable 自主运行 9 小时完成复杂软件项目。
Hugging Face 发布开源基准 ScarfBench,用于评估 AI 智能体在企业级 Java 框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现、204 项迁移任务和 1,331 个专家测试。
Sierra 在 Agent Studio 中推出 Experiments,为团队提供运行、审查和发布 A/B 测试的统一界面,每项智能体改动都需经实验验证。实验默认以解决率和流失率等业务指标评估,仪表盘展示统计显著性、效果出现时间及稳定性,支持逐步放量后全量发布。Ghostwriter 会分析全部对话、提炼假设并在数分钟内将其转化为实验,使测试频率从每季度一次提升至持续迭代。
Dwarkesh Patel 发布与 3Blue1Brown 主理人 Grant Sanderson 的播客对谈,讨论 AI 在数学领域的快速进展及其对其他领域的预示。两人探讨了 IMO 表现、黎曼假设的可能证明形态、概念性突破的百年验证周期、AI 连接不同数学领域的潜力,以及现实任务为何难以纳入 RL 环境,并谈到数学家未来可能转向策展与解释角色。
MIT 电气工程与计算机科学系副教授 Phillip Isola 在专访中界定,智能体 AI 是能在物理或数字世界中采取行动(如机器人操作、订机票)的 AI,与生成内容的 ChatGPT、Claude 等生成式 AI 不同,其核心仍是 Claude 这类基础模型外加工具与记忆封装。他指出编程智能体是目前最成功的应用,最大挑战是训练数据匮乏,并警示验证不足、数据泄露与去技能化风险。
Together AI 宣布其 9 篇论文入选 ICML 2026(7 月 6 日至 11 日,首尔,展位 B714),覆盖从智能体到 GPU kernel 的全栈研究。
vLLM Semantic Router 团队推出 Micro-Agent 能力,把单次模型 API 调用变成服务层内有界的多模型协作,用户仍只调用一个模型名 vllm-sr/auto。