跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

114条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 21–40 条 · 共 114 条
9月30日周三
  1. Claude:Blog(网页)60

    Claude Code 推出 Artifacts:把会话工作变成可共享的实时网页

    Claude Code 推出 Artifacts,可基于会话完整上下文(代码库、连接器、对话)生成实时可共享的网页,如 PR 讲解、事故页、仪表盘和发布清单,页面随会话进展原地刷新,每次发布为新版本并支持历史回滚。

    推荐理由:官方说明了 Artifacts 的构建方式、版本共享机制和权限策略,读者可以判断它能否替换团队现有的状态同步流程。

  2. Cognition 模型 / Devin 博客(网页)65

    Cognition 发布 SWE-grep 和 SWE-grep-mini,用 RL 训练快速并行上下文检索模型

    Cognition 训练了 SWE-grep 和 SWE-grep-mini 两个快速智能体模型,专攻高度并行的上下文检索,检索能力匹敌前沿编码模型,耗时低一个数量级。

    推荐理由:官方公布了模型设计、RL 训练细节和评测数字,读者可以借此了解并行上下文检索的实现路径。

  3. Anthropic:The Institute(旗舰研究长文 · 网页)67

    Claude 正式登陆 Microsoft Foundry,可通过 Azure 账单计费并计入 MACC

    Claude 现已在 Microsoft Foundry 正式可用,企业可用现有 Azure 认证、计费与治理体系构建生产应用和企业智能体,用量计入 Azure 账单,符合条件的支出可计入 MACC。

    推荐理由:原文说明 Claude 在 Microsoft Foundry 正式可用后的计费、合规与部署方式,读者可据此评估接入 Azure 工作流的可行性。

  4. Tomer Tunguz 博客(VC 分析)63

    Tomer Tunguz:OpenRouter 上 GPT-OSS-120b 仍占 Claude Opus 4.8 三分之一流量,token 市场加速分层

    Tomer Tunguz 撰文指出,OpenRouter 数据显示发布于 2025 年 8 月的 GPT-OSS-120b 仍承载 Claude Opus 4.8 约 36% 的日 token 量,GLM 5.2 以每日 495B token 超过前沿模型,token 市场正按成本、速度和准确度分层。

    推荐理由:作者用 OpenRouter 流量数据和自己本地实测,说明 token 市场正按成本、速度与准确度分层,MoE 正在抬高端侧模型上限。

  5. Anthropic:The Institute(旗舰研究长文 · 网页)71

    Anthropic 发布 Claude 桌面与移动应用统一下载页

    Anthropic 上线 Claude 应用的统一下载页,提供 macOS、Windows、Linux(beta)桌面端和 iOS、Android 移动端。桌面应用内可直接运行 Claude Code,支持远程控制、跨设备记忆同步、Chrome 等扩展连接本地工具,并面向企业提供 MSIX/PKG 安装包和 SSO 部署;Linux 端暂不支持 Computer Use 和听写功能。

    推荐理由:页面汇总了 Claude 桌面与移动应用的下载入口、各平台支持情况和常见使用限制,方便读者判断适配自己的版本。

  6. Anthropic:The Institute(旗舰研究长文 · 网页)67

    Anthropic 发布 Claude Science 科研工作台公测版

    Anthropic 发布 Claude Science,一款面向科学家的 AI 工作台应用,目前为 macOS、Windows 和 Linux 上的公开 beta,面向 Pro、Max、Team 和 Enterprise 计划。

    推荐理由:官方产品页列出可复现分析、60+ 科学数据库连接和 HPC 计算管理等具体能力,读者可据此判断它对科研工作流的影响。

  7. Google Developers Blog(RSS)66

    Google 发布在 Raspberry Pi 5 上用 LiteRT 部署 Gemma 的端侧 AI 指南

    Google 介绍如何在 Raspberry Pi 5 上用 LiteRT 和 Gemma 模型实现完全离线的实时端侧 AI,并以 Reachy Mini 机器人演示目标检测、语音识别、推理和语音合成的完整本地流水线。

    推荐理由:原文给出 Gemma 各型号在 Raspberry Pi 5 上的实测数据和完整部署流程,读者可以据此选择合适的端侧模型并复现本地推理。

  8. Google Developers Blog(RSS)62

    Google 用 ADK 构建零信任 AI Agent 的三层安全实践

    Google 开源了基于 ADK 和 Gemini 的客服退款 Agent 示例,演示提示词注入可导致超额退款、密钥泄露等风险。文章提出三层零信任防护:用 Cloud KMS 硬件签名保证写入不可抵赖,用 gVisor 沙箱零网络出口隔离动态生成代码,用确定性语义网关加 CI/CD 回归测试校验输入输出;完整代码见 zero-trust-agents 仓库。

    推荐理由:文章用开源示例和代码讲解三层零信任防护的具体做法,读者可以直接在本地复现攻击与防御流程。

  9. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)76

    Anthropic 工程博客详解 AI 智能体的有效上下文工程方法

    Anthropic 应用 AI 团队发文阐述上下文工程,定义为在 LLM 推理过程中筛选和维护最优 token 集合的策略,将其视为提示工程的自然演进。文章指出所有模型都存在 context rot 现象,上下文应被当作边际收益递减的有限资源。

    推荐理由:Anthropic 提出上下文工程是提示工程的演进,并给出压缩、结构化笔记、子智能体三种应对长任务的具体方法,可直接迁移到智能体开发。

  10. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)76

    Anthropic 为 Claude Code 推出沙箱功能并开源沙箱运行时

    Anthropic 在 Claude Code 中推出基于沙箱的两项新功能:沙箱化 bash 工具(beta 研究预览,可通过 /sandbox 启用并已开源)和 Claude Code on the web。

    推荐理由:官方解释了沙箱如何用文件系统和网络双重隔离减少权限弹窗,内测减少 84%,并说明开源实现供其他 Agent 团队参考。

  11. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)76

    Anthropic 工程师复盘如何设计抗 AI 的技术评测

    Anthropic 性能优化团队负责人 Tristan Hume 复盘其招聘用 take-home 测试被 Claude 模型逐步击穿的过程:超 1000 名候选人完成过该模拟加速器优化测试,Claude Opus 4 在相同时间内超过多数人类申请者,Claude Opus 4.5 在 2 小时内追平最佳人类成绩。

    推荐理由:作者以一手迭代经验说明模型如何逐步击穿技术面试题,并给出设计抗 AI 评测的具体做法与开源挑战。