Cloudflare 用 AI 工具 CryptoLabe 推进 2029 年后量子迁移
Cloudflare 介绍内部 AI 工具 CryptoLabe,用于发现代码库中的密码学使用并规划后量子(PQ)迁移,目标 2029 年实现全面 PQ 就绪。
Cloudflare 介绍内部 AI 工具 CryptoLabe,用于发现代码库中的密码学使用并规划后量子(PQ)迁移,目标 2029 年实现全面 PQ 就绪。
xAI 发布设计复盘文章,讲解 Grok Bot 如何围绕持久智能体而非单次会话来设计界面。文章将产品概念收敛为 Bots、Chats、Prompts、Tools。
SpaceXAI(正文写法,来源为 xAI News)在 Cursor 并入后用 Grok Bot 承接客户支持,合并团队工单增长 175% 但未新增人手,估算相当于少招 200 人。
TensorZero 团队发布开源方法,在每次 Git commit 时自动为 Cursor 的 LLM 推理计算反馈奖励。
TensorZero 研究发现,用 GPT-4.1 生成的高质量对话数据微调小模型,可在多种任务上实现相对 GPT-4.1 最高 30 倍的成本下降,同时性能持平或更优,响应速度最高提升 4 倍。
Suno 发布创作者指南,建议完善个人资料以提升音乐被发现和推荐的机会。资料需包含名称、头像、简介和至少一首已发布歌曲,才可被搜索并获得 Suno 推荐;还可添加最多 5 个曲风标签及 Spotify、TikTok、Instagram、SoundCloud 等外部链接。完整资料有助于将一次性听众转化为长期粉丝。
Suno 发布科普文章,解释压缩器如何通过降低音频最响部分并配合补偿增益提升整体电平,从而压缩动态范围。Suno Studio 的压缩器插件提供阈值、压缩比、启动与释放等参数,并配有实时动态曲线表。Studio 是浏览器端 DAW,已内置包括压缩在内的一整套音频效果,随 Suno Premier 订阅免费提供。
Suno Studio 发布 EQ 使用指南,给出三条入门技巧:混音以耳朵为准而非只看曲线;先衰减再提升,例如人声可在 400Hz 处先减 6dB 并用约 80Hz 高通滤除低频;EQ 尽量放在效果链首位。Suno Studio 自 2025 年上线起即支持每轨 EQ,最新版本中 EQ 已作为音频效果与压缩、混响、延迟并列,可手动添加、自制预设并跨轨道和项目复制分享。
RadixArk SGLang 团队与 Ant Ling Infra 团队在 4 张 NVIDIA Blackwell GPU 上为混合线性注意力 MoE 模型 Ling-3.0-flash 优化 batch-1 解码,NEXTN/MTP 路径将单请求吞吐从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。
LMSYS 的 SGLang 团队发布 SSD Expert Pack 路径,把装不进 VRAM 和内存的 MoE 路由专家放在 NVMe SSD 上,只加载 router 选中的专家,用 Expert Pack 布局、direct I/O、pinned 缓冲和 GPU 缓存把 SSD 容量变成可用的存储层。
推荐理由:原文给出在单张消费级 GPU 上运行超大 MoE 模型的完整方案和实测数据,读者可以评估这条 SSD 专家卸载路径是否适合自己的本地部署。
Meta 介绍其开源模型 Segment Anything Model 3(SAM 3)和 DINOv3 成为由能源部 Genesis Mission 旗下 SYNAPS-I 项目分割管线的核心。
SGLang、Qwen 和 NVIDIA 团队在 SGLang 中实现了 NVFP4 KV cache,将 K/V 以 4 位 NVFP4 格式存储并在 decode 阶段于注意力 kernel 内即时反量化到 FP8。
SGLang 团队介绍用 /v1/score 接口为 JEV 类决策模型做标签打分,调用方通过 label_token_ids 显式指定标签,无需依赖生成结果的 top-k logprobs。
Baseten 的部署(deployment)是模型在平台上运行的一个版本,拥有独立 API endpoint,每次 baseten model push 都会创建一个部署,同一模型可同时运行多个部署以便在不影响生产流量的情况下测试新版本。
NVIDIA 为 ROS 2 Lyrical 贡献了 CUDA buffer backend,配合 rosidl::Buffer 抽象,让 ROS 2 节点在满足同主机、同 CUDA 设备、同 Linux 用户及受支持 RMW 实现等条件时以零拷贝方式交换 GPU 常驻数据,否则自动回退 CPU 路径。
NVIDIA 用机密计算(CC)在 Blackwell GPU 上跑生产级 LLM 推理,TensorRT LLM 通过 CC 感知优化把吞吐保留在基线的 96.1%–98.2%,平均 TPOT 开销仅 1.2%–4.3%。测试基于单台 DGX B200(8 张 B200)、DeepSeek-R1-0528-NVFP4、32K 输入/1K 输出、TP=8,并发 1–16。
Cursor 工程师 Vicent Martí 撰文介绍其 Git 存储系统 Continuity:以 S3 中兼容对象存储的预写日志(WAL)作为唯一事实来源,本地副本为 NVMe 上的普通 Git 仓库,通过 S3 CAS 与 UDP gossip 实现乐观复制,无需路由表和共识选举,所有 push 线性化且完全持久化前不确认。
Cursor 团队发布文章,介绍过去几个月为提升长时间智能体运行的 token 效率所做的 harness 改动,整体将用户 token 成本降低 7% 且智能体质量未下降。
推荐理由:Cursor 团队逐项拆解了降低智能体 token 成本的 harness 改动,给出系统提示精简、动态工具加载与缓存断点等可借鉴的做法。
Augment Code 解决方案架构负责人用其智能体编排平台 Cosmos 生成企业试点健康视图,无需新建数据管道或仪表盘项目。Cosmos 会查询产品使用数据、校正 session lineage、拉取 Salesforce 交易状态,并对照客户通话记录核验结论,输出每个试点的采用度、技术进展、风险与整体健康评估,每个数字都可追溯到实时数据源。
Augment Code 今年早些时候从零重构了 Auggie CLI 的 harness,在 SWE-bench Pro(731 实例,opus4.7)上 Auggie v2 通过率与 Claude Code 相当的情况下,单任务成本 $1.27 对 $2.70,便宜 53%,平均耗时 330s 对 409s。
Augment Code 的两人 Cosmos Advisor 团队用 Cosmos 构建了 Feedback Triager 智能体,把每周产品反馈从约 5 条增至 30+ 条的压力接了过来。
Google 发布 autofinetune 项目,将 autoresearch 的自主研究循环应用到 LLM 后训练(SFT 和基于 GRPO 的强化学习),使用 Tunix、Gemma 和 Cloud TPU,并由 Antigravity CLI 与 Gemini Flash 3.7 编排。
Google Developers Blog 发布零信任 Agent 系列第二篇,讲解如何将 Customer Support & Returns Agent 的安全检查从构建时移到 Gemini Enterprise Agent Platform 的运行时治理层。
Google 团队在 MaxText(JAX/XLA)中从零复现 Ai2 的 Olmo 3 7B,在 Google Cloud TPU 上完成 stage-1 预训练(约5.93T token。
针对 RAG 在跨数百份合同的聚合问题上失效,该方案改用结构化抽取:AI 抽取智能体(Claude Sonnet 系列)从每份合同 PDF 提取 8 个关键字段并附置信度,验证智能体(Claude Haiku)独立复核,签名检测分歧由 Amazon Textract 用计算机视觉裁定,结果存入 Amazon Aurora PostgreSQL。
AWS 发文拆解 Amazon Quick 各组件的提示词写法:Quick Research 需明确目标、受众与关注范围,并自行拆解子问题、限定数据源(Quick Index。
Amazon Quick 的提示词工程基础指南指出,提示词结构直接决定其 AI 功能输出的准确性与可靠性。文章给出清晰具体、提供业务上下文、用示例代替描述等核心原则,并介绍 CRISPE 框架,用于跨 Quick 各组件构建复杂提示词。这是两部分系列的第一篇,第二篇将覆盖 Research、Flows、Sight、Chat Agents 和 Action Integrations 的组件专属技巧。
NVIDIA 开源了基于 TensorRT 的 C++ AI 模型参考实现集合 TensorRT Model Connect,目标是让 NVIDIA 推理栈的性能更易获取。项目围绕编码智能体设计,采用并行工作、模型族隔离、可逆变更与 GPU 验证等实践。
vLLM 官方博客发布分离式推理(disaggregated serving)实战指南,讲解如何将 prefill 与 decode 拆分为独立实例、把 tokenization 和解析移到无 GPU 的 /render 与 /derender 前端。
Databricks 介绍其内部新模型发布流程:通过 Unity Gateway 让全体员工首日获得 Opus 5.5、GPT-6 Sol 和 GPT-Luna 的实验性访问,并用四类按用户预算控制成本。
推荐理由:Databricks 以自身一万多名员工的实际 rollout 数据为例,给出一套可复用的新模型评估与推广方法,含具体成本对比。
Databricks 发布 Genie One 企业推广 playbook,主张从单一团队、单一问题集起步,先建语义层再逐步扩面。落地分四部分:Genie One 面向业务用户提供带引用来源的问答,Genie Agents 处理合同分析等特定领域任务,Genie Ontology 映射业务术语与指标,Unity Catalog 负责权限、脱敏与审计。
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并用 Gradio 应用验证。
AWS 发布 vLLM-Omni 图像视频生成示例,在同一 vLLM-Omni DLC 上部署两个 SageMaker AI 端点:实时端点跑 FLUX.2-klein-4B 文生图,异步端点跑 Wan2.1-VACE-1.3B 图生视频。
Google 介绍 Gemini 3.8 Flash 相比 3.7 Flash 在软件工程、Agent 任务和专业领域多步推理上有显著提升,性能常接近更高成本的 frontier 模型。
推荐理由:文章展示了四个社区用 Gemini 3.8 Flash 做出的具体项目,读者可以借此了解模型在多步推理和多模态任务上的实际用法。
AWS 博客介绍用 Amazon Nova Act 配合 Amazon Bedrock AgentCore 构建智能体驱动的合成监控方案,以自然语言动作替代 Selenium、Playwright 的 DOM 选择器脚本。
AWS 发布跨账户自动化管理 Amazon Textract 适配器生命周期的方案,提供 CloudFormation 和 Terraform 模板、跨账户适配器提升流程、生产安全配置及文档预分类路由模式。
布鲁克林 Edy's Grocer 店主 Edy Massih 用 Gemini 将家族黎巴嫩菜谱直接换算成大型宴会批量配方,避免手工计算香料与酥皮比例出错。Gemini 还能把活动菜单转成分区陈列的采购清单、汇总共用食材并提前排好备餐日程,并针对无麸质、无坚果等饮食限制给出保留风味的替换方案。Edy 表示 Gemini 释放了他的时间,让他少做行政事务、多推广黎巴嫩饮食文化。
Databricks 博客梳理了营销与数据工程团队最常理解不一致的 24 个营销数据术语,围绕活动数据来源、客户记录代表谁、受众何时可激活等五个执行问题展开。每个术语都给出营销侧与数据工程侧的两套定义,例如“实时”在营销眼中是每 15 分钟刷新,在数据团队眼中则是秒级更新,涉及新基础设施与持续成本。文章建议在开工前先对齐“客户”“受众就绪”“信号新鲜度”等含义,避免误解变成活动返工。
GitHub Copilot 应用中的 canvas(画布扩展)是一种可自定义界面,用户只需在 agent 会话中输入 /create-canvas 技能并用自然语言描述需求,即可生成看板、发布清单或仪表盘等界面,无需编写代码或手动设计。
AWS 提出在 Amazon EKS 上结合 EFA 与 DeepEP 扩展 MoE 模型强化学习训练的架构,吞吐量提升 40%。该方案针对 rollout 生成与策略训练并行的异步 RL 负载,用 DeepEP 优化专家并行(EP)在 EFA 上的 all-to-all 通信,缓解跨节点带宽瓶颈。适用于 RLHF、PPO 和 GRPO 等大规模 RL 训练流程。