跳到正文

#部署/工程

今日 28 条
今天10月1日周四
  1. Google AI:DEV 作者专属(RSS)29

    产品图背景移除预设:2026 年的治理与例外处理

    产品图背景移除应采用命名、带版本的转换预设来保证可复现,仅对无复用价值的孤立图片走直接处理。预设作为可审计、可下线的策略,需将源图、衍生输出与异步任务状态分开存储,并记录归属与生命周期。直接处理须限制可改参数、绑定源资产 ID 与请求方,并保留幂等键与人工复核,避免一次性例外变成未受控的策略分支。

  2. Google AI:DEV 作者专属(RSS)66

    TensorFlow.js 浏览器端超分优化:一次新张量形状为何耗时 8-17 秒,以及如何消除 40 秒页面冻结

    作者分享在浏览器端用 TensorFlow.js on WebGL 做照片超分(不上传图片)的优化过程:初版用 UpscalerJS,1.2 MP 照片需 60-110 秒并冻结页面约 40 秒。

    推荐理由:作者用自己浏览器端超分项目的实测数字,拆解了 WebGL 上张量形状触发着色器重编译等坑和对应修法。

  3. Google AI:DEV 作者专属(RSS)52

    Verax 的 Agent 权限策略:没有规则时默认拒绝

    Verax 对 AI Agent 的请求采取默认拒绝策略,没有规则的调用一律拒绝,包括 Agent 换工具名重试的情况。策略只列 memory.get、memory.put、audit.explain、message.read 四个工具,同一工具出现两条规则会在加载时被拒绝;拒绝记录与批准记录同样签名留档,可用 verax verify 离线验证。

  4. NVIDIA Technical Blog:Agentic AI / Generative AI41

    NVIDIA 扩展 xio-sig 加入 cuObject,并发布 SCADA Server SDK

    NVIDIA 将 cuObject 纳入 xio-sig,与 cuFile 并列,并宣布 cuObject 客户端与服务器库正式可用,开发者可基于其 API 和 RDMA 线协议构建加速对象存储应用。新的 SCADA Server SDK 让存储厂商构建响应 GPU 发起请求的 SCADA 服务器,IBM 已用集成 SCADA 与 IBM Storage Scale 的原型验证互操作性。

  5. Google AI:DEV 作者专属(RSS)39

    Sentinel-IR:AI 智能体运营省下数百万成本的非技术指南

    Sentinel-IR 是一种确定性数据压缩层,把代码、API 载荷和文档压缩成超紧凑的中间表示再喂给 LLM,充当上下文窗口的 ZIP 压缩。在 1,366 行的 12-billing-platform 测试文件上,原始 11,635 tokens 被压到 1,332 tokens,节省 88.6%;但 303 tokens(约 34 行)以下的微文件因压缩开销反而更贵。

  6. Google AI:DEV 作者专属(RSS)37

    图像质量评测:内容感知裁剪与居中裁剪的三种配方场景对比

    针对菜谱站点头像与菜品卡片,内容感知裁剪应作为默认方案,它能保留居中裁剪经常切掉的主体,但需存储裁剪框并提供人工调整路径。居中裁剪仅适用于拍摄时强制居中构图的流程,其确定性几何在异构上传中会稳定地切掉偏离中心的人脸或餐盘。Cloudinary、Imgix、ImageKit 等托管方案在运营边界上各有取舍,智能裁剪输出仍需审核与覆盖。

  7. Databricks:Blog(RSS)40

    Lakebase Postgres 成本优化实用指南

    Databricks 的 Lakebase Postgres 通过存储与计算分离架构实现成本优化:分支共享底层存储、自动扩缩容支持 scale to zero(数百毫秒恢复),关闭后按基线容量 25% 折扣计费。同步 Lakehouse 数据时建议只同步应用所需的活跃子集(如 60 天滚动窗口),并按数据新鲜度选择 Snapshot、Triggered 或 Continuous 三种同步模式。

  8. SemiAnalysis38

    AMD 首次公开 Helios 的 TH6 scale up 交换芯片设计,可见其依赖 Broadcom 的以太网 retimer 和 scale up 交换芯片。这暴露了 AMD 缺乏完整硅产品组合,scale up 机架所需的交换芯片需外购。retimer 还会增加 scale up 路径延迟,未来 AMD 将与 UALink 交换芯片厂商合作。

    引用AMD@AMD

    POV: You’re an engineer building AMD Helios.   Next up: putting it to the test. Episode 2 drops today 👀

  9. NVIDIA AI33

    你的智能体得到了正确答案。它花了多少功夫才走到那一步? 我们与 @NousResearch/@Teknium 合作,带来一篇 NVIDIA NeMo Relay 的实操演练,为 Hermes Agent 收集追踪数据。运行两个示例场景,跟随智能体的调用与重试,并在 Arize Phoenix 中查看完整追踪。 博客还探讨了 Nous 如何利用追踪和任务结果,在重复运行中评估修复效果。 TechBlog: https://nvda.ws/47tKxjQ 📽️ 来自我们自家的 @Picomoorhead:

9月30日周三
  1. xAI:News(网页)62

    xAI 发布编码模型 grok-build-0.1,API 公测上线

    xAI 将编码模型 grok-build-0.1 以公开测试形式上线 xAI API,该模型专为智能体编码任务训练,支持 Web 开发、调试和 MCP,也是驱动 Grok Build 的同一模型。

    推荐理由:xAI 官方公告给出了 grok-build-0.1 的定位、速度、定价和适配工具,读者可据此评估是否接入自己的编码工作流。

  2. Cloudflare Developers54

    Cloudflare Developers 转发官方公告,宣布 Cloudflare Containers 面向 Agent 沙箱的重大升级。容器启动速度提升 6 倍,支持 Agent 在运行时为每个沙箱选择镜像和实例类型,文件系统快照进入公测,全部通过 Durable Object 控制。

    引用Cloudflare@Cloudflare

    Cloudflare Containers now start 6x faster, let your agent choose each sandbox's image and instance type at runtime, and support filesystem snapshots in public beta, all controlled from a Durable Object. https://cfl.re/4hVasac #BirthdayWeek

  3. TensorZero:实验与工程博客47

    TensorZero:把 LLM 应用看作 POMDP,而不是 Agent

    TensorZero 提出把 LLM 应用建模为部分可观测马尔可夫决策过程(POMDP),而非 Agent,认为应用与 LLM 的接口应是变量间的函数 f:X→Y,而不是提示词与生成结果。该框架由此推导出推理、可观测性、优化、评估与实验的闭环方法,并已开源其生产级子集,还在一项 AI 电话智能体试点中取得显著提升。

  4. TensorZero:实验与工程博客32

    某大型银行如何用 LLM 与 TensorZero 自动化代码变更日志

    欧洲一家大型银行的 DevOps 工程师 Mark 借助开源平台 TensorZero 构建变更日志自动化系统,接入 GitLab merge request 与 CI/CD 流程,并用 Ollama 实现全自托管部署,数据不出内网。系统利用内置的动态上下文学习(DICL),将工程师对 AI 生成日志的修改自动用于优化后续推理,无需微调或标注数据集。

  5. Prime Intellect(网页)65

    Prime Intellect 发布 INTELLECT-1:首次全球分布式训练 10B 参数模型

    Prime Intellect 启动 INTELLECT-1,称其为首个全球分布式训练的 10B 参数模型,基于 Llama-3 架构,使用超过 6 万亿 token 的数据混合(55% Fineweb-Edu、20% DLCM、20% Stack v2、5% OpenWebMath),并邀请任何人贡献算力。

    推荐理由:原文给出INTELLECT-1的训练规模、数据配比和通信优化细节,读者可据此了解全球分布式训练10B模型的可行路径。