跳到正文

全部动态

今日 395 条
9月30日周三
  1. Cognition 模型 / Devin 博客(网页)69

    Cognition 宣布年化收入运行率突破 10 亿美元

    Cognition 宣布年化收入运行率突破 $1B。公司成立于 2024 年 1 月,Devin 正式开放不到两年,已在 GE Aerospace、Rivian、Rohlik、Exa 等公司的工程团队中协作使用,官方称这一里程碑属于客户。

    推荐理由:Cognition 官方宣布 ARR 突破 10 亿美元,并列出 GE Aerospace、Rivian 等客户,可据此了解 Devin 的商业化进展。

  2. Claude:Blog(网页)72

    Claude 合并 Cowork 与聊天,并推出 Claude Docs、Slides 和 Design 集成

    Anthropic 宣布 Claude Cowork 与聊天合并为一个 Claude,任务不再需要用户选择入口,可在合上电脑后继续完成。同时发布 Claude Docs 和 Claude Slides,Claude Design 也可在对话中直接使用,三者均在付费计划上处于 beta。

    推荐理由:官方说明了 Cowork 与聊天合并的原因和落地方式,读者可以据此判断现有工作流会受哪些影响。

  3. Claude:Blog(网页)27

    Anthropic 推出 Claude 平台 Console:Messages 直连模型,Managed Agents 托管智能体

    Anthropic 上线 Claude 平台 Console,提供两种开发方式:Messages 为直连模型,需自行构建每轮对话、管理会话状态并编写工具循环;Managed Agents 提供全托管智能体基础设施,支持有状态会话与持久事件历史。平台同时提供 Claude 模型家族选型指引,涵盖研究、编码、写作等场景,Haiku 4.5 主打最快速度与最低成本。

  4. Claude:Blog(网页)44

    Claude Code 开发者文档:入门指南

    Anthropic 发布 Claude Code 入门文档,该智能体编程工具可读取代码库、编辑文件、运行命令,支持终端、IDE、桌面应用和浏览器四种使用界面。终端 CLI、VS Code 和 JetBrains 插件还支持第三方模型提供商,多数界面需 Claude 订阅或 Anthropic Console 账户。

  5. Claude:Blog(网页)73

    Claude 桌面与移动端应用提供 macOS、Windows、Linux、iOS、Android 下载

    Claude 提供桌面与移动端应用下载,覆盖 macOS、Windows(含 arm64)、Linux(beta,支持 Ubuntu 和 Debian)以及 iOS 和 Android,所有套餐(Free、Pro、Max、Team、Enterprise)均可使用,部分功能仅限付费计划。

    推荐理由:原文汇总了 Claude 桌面与移动端应用的下载入口、各平台支持范围和付费限制,读者可据此判断是否迁移工作流。

  6. Trail of Bits:AI安全研究74

    Trail of Bits实测:GPT 5.6-Cyber三次逃出QEMU/KVM虚拟机,VM沙箱不再可靠

    Trail of Bits作者在Patch the Planet项目中获得GPT 5.6-Cyber预览权,让它在CTF任务中逃出自己Debian 12机器上的QEMU/KVM虚拟机,结果它三次成功逃逸。

    推荐理由:作者以一手实验展示GPT 5.6-Cyber三次逃出VM的具体漏洞链,指出单靠虚拟机隔离AI智能体已不可靠。

  7. Trail of Bits:AI安全研究70

    Trail of Bits 批评 1Password 的 AI 补丁基准有误导性,并发布两个补丁验证 Agent 技能

    Trail of Bits 发文批评 1Password 2026 年 8 月 6 日报告的 26% 干净修复率有误导性,指出其样本被挑选为复杂修复、22% 数据使用故意指示错误修复的提示词、36% 试验禁止编译测试,并披露评分规则与人工审查的分歧。

    推荐理由:作者用自有的 Patch the Planet 合并率和开发者首次修复失败率作对照,说明该基准在样本、指令和评分上的问题。

  8. Trail of Bits:AI安全研究68

    Trail of Bits 复盘 Miden zkVM 审计:用智能体自建工具链与 Lean 形式化模型

    Trail of Bits 在审计 Miden zkVM 前,用智能体在六个月内从零构建了 MASM 的 LSP 服务器、反编译器、静态分析引擎和 Lean 形式化模型。

    推荐理由:作者复盘如何让智能体在审计前自建 LSP、反编译器、静态分析和 Lean 形式化模型,方法可迁移到其他安全审计场景。

  9. CMU:Machine Learning Blog46

    LumberChunker:面向长篇叙事文档的分段方法

    CMU 提出 LumberChunker,让 LLM 在连续段落中判断叙事最早发生语义转折的位置,从而切分出更自然的文本块。在 100 本公版书、3000 道大海捞针式问题的 GutenQA 基准上,其 DCG@20 达 62.1%、Recall@20 达 77.9%,优于语义分段、段落级、递归分段和命题级方法。token 预算 θ≈550 时检索质量最佳,平均块长约 334 tokens。

  10. Cloudflare Blog37

    Cloudflare Impact 捐赠服务规模达 1 亿美元

    Cloudflare 的 Impact 公益项目累计捐赠服务规模达到 1 亿美元,覆盖记者、公民社会组织、州和地方政府、选举管理机构及公立学校等数千家机构。其 Project Galileo 目前覆盖 120 多个国家的 3500 多个域名,2025 年拦截超 385 亿次针对参与者的网络攻击。

  11. CMU:Machine Learning Blog28

    CMU 在 ICLR 2026:194 篇论文概览

    CMU 研究团队将在 ICLR 2026 展示 194 篇论文,会议于 4 月 23 日至 27 日在巴西里约热内卢 Riocentro 会议中心举行。论文涵盖应用、计算机视觉、深度学习、优化、强化学习、社会影响与理论等方向,其中 EditBench、UALM、Agent Data Protocol、MotionStream、OpenThoughts 等被列为 Oral 论文。

  12. Cloudflare Blog77

    Cloudflare:互联网出现第二个受众,智能体流量增长超 1700% 并推动内容付费新机制

    Cloudflare 发文指出互联网出现了由软件代理人类访问的第二个受众:其网络 HTTP 请求从 2024 年底的每秒 6300 万增至近 1.15 亿,一年内 AI 智能体日请求增长超 1700%,今年首次过半流量非人类。

    推荐理由:Cloudflare 用自家网络数据说明智能体流量如何改变流量与收入的关系,并给出可控授权和按使用付费的应对思路。

  13. CMU:Machine Learning Blog48

    医疗 LLM 基准为何在部署时失效:CMU 提出 BenchmarkCards 框架

    CMU 研究指出医疗 LLM 基准的评估与部署存在 61 个百分点差距,根源是评估协议中隐含的任务与结果两类假设在真实场景中不成立。研究将差距拆解为查询分布 12 点、交互类型 19 点、决策中介 30 点,并提出 BenchmarkCards 框架显式化这些假设,配合分阶段评估判断基准结果能否迁移到部署。

  14. Baseten 工程博客(网页)17

    Baseten 客户案例:Parallel、Speechify 等如何用其推理基础设施跑高吞吐 AI 产品

    Baseten 公布了一批客户案例,展示其推理基础设施在高吞吐 AI 产品中的表现。Parallel Web Systems 借助 Baseten 的吞吐优化推理与训练到部署闭环,实现吞吐提升 3 倍、延迟降低 2 倍;Speechify 每月为 6000 万以上用户合成超 161B 字符,成本降低 44%、p99 延迟降低 30-50%、冷启动快 4.5 倍。