GitHub 如何用 Copilot 把营销活动运营变成代码
GitHub 日本和韩国营销负责人把活动运营流程交给 GitHub Copilot,从单个 GitHub Issue 出发自动完成落地页复制、UTM 链接生成、报名名单清洗和会后报告。
GitHub 日本和韩国营销负责人把活动运营流程交给 GitHub Copilot,从单个 GitHub Issue 出发自动完成落地页复制、UTM 链接生成、报名名单清洗和会后报告。
掌握 AI 工程技能,你就能主动塑造构建过程:影响要构建什么,并驱动构建循环。以下是实现这一点的关键技能。https://x.com/i/article/2098450134883594240
GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让开发者无需在编辑器、终端和浏览器之间切换即可完成 AI 编码闭环。diff 面板以绿色标注新增、红色标注删除,支持接受改动、留言或让 Copilot 继续修改;终端面板可直接运行项目命令并支持多窗口;浏览器面板可用 Pick & Polish 工具选中元素并让智能体调整。
NVIDIA 通过全栈 NIM 优化,在 Nemotron 3 Ultra 上实现 2.5 倍并发用户量。该优化针对生产环境部署大语言模型时,在现有 GPU 基础设施上提升并发服务能力并保持交互响应速度的需求,对提示词长、上下文跨步骤复用的智能体 AI 工作负载尤为关键。
Hugging Face 发布 Workflow1111,用 gr.Workflow 在单个画布上以 73 个节点重建了 AUTOMATIC1111 的 11 条媒体管线,涵盖文生图、hi-resolution fix、图生图、VLM 反推提示词、检测生成 inpaint 蒙版、ControlNet 风格 annotator、背景去除、PNG Info 和图生视频。
推荐理由:官方用 Gradio Workflow 在单个画布上复刻了 AUTOMATIC1111 的主要功能,读者可以对照它了解节点式工作流与 ComfyUI 的差异。
Together AI 的 kernels 团队为 NVIDIA Vera Rubin NVL72 平台在 ThunderKittens 中新增了 NVFP4 与 FP8 GEMM 支持。
Hugging Face 博客介绍 TRL v1.14 的 AsyncGRPOTrainer 新支持:只训练 LoRA 适配器并仅同步适配器(rank-1 仅几 MB)到 vLLM,训练器与 vLLM 副本作为独立 HF Jobs 运行在分开的机器上,通过挂载 Storage Bucket 共享适配器路径,无需 NCCL 或共享本地盘。
MiniMax M3 在 AMD Instinct MI355X 上的 vLLM 服务性能大幅提升:SemiAnalysis InferenceX 基准显示,并发 32 时 MXFP8 标准服务从 109.1 升至 342.4 output tokens/s/GPU(3.14×),中位 TTFT 从 1.46 秒降至 0.67 秒。
NVIDIA 技术博客解析了 Encode-Prefill-Decode(EPD)分离架构这一多模态模型推理优化技术,它将视觉编码器阶段与 prefill、decode 阶段分离。该方案对图像密集提示词、中短输出和量化 MoE 模型最有效,配合 NVIDIA Dynamo 可实现最高 5 倍加速。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值对齐校验框架,用自定义解析器生成调用树并借助 Vibe CLI 启动上百个智能体补文档,最终采用人工把关的 coder、tester、reviewer 智能体工作流逐模块迁移。
Together AI 发布长文,解析开发者从闭源模型转向开源模型所需的 AI 编码栈,提出由模型、推理、网关与路由、Harness、工具(Skills 与 MCP)组成的 MIGHT 五层框架。
推荐理由:Together AI 把开源编码栈拆为 MIGHT 五层,给出大小模型分工和分层组合的具体实践方法。
vLLM 团队发布针对智能体负载的全栈优化方案,覆盖 KV 缓存管理、并行策略与 P/D 分离配比,并在 SemiAnalysis AgentX 公开基准上验证。
推荐理由:原文给出 vLLM 针对 AgentX 基准的全栈优化路径与可复现结果,读者可以借此理解智能体负载的服务优化思路。
vLLM 为 GLM 5.3 引入 Hybrid HiSparse 卸载机制,在单台 8× H200 节点上首次实现 100 万上下文长度运行,并在各上下文长度下大幅提升并发量。该机制基于稀疏 MLA 的 top-K 选择,将未被选中的 KV cache 卸载至 CPU,仅在 KV cache 承压时才付出 CPU-GPU 传输代价,热缓冲页与常驻页共用同一 HMA 块池。
Sierra 发布呼叫中心 AI 运营与推广指南,主张把 AI 部署当作运营模式变革而非单点演示,需在迁移流量前设定基线与扩展标准。指南覆盖语音、消息、邮件等渠道,Sierra 支持单一智能体跨渠道部署,Voice 支持呼入呼出、语音模拟、多语言与带上下文升级。落地需围绕路由与队列行为、人力排班、人机质量校准等环节设计运营模型。
NVIDIA 团队用 NemoClaw 构建了一个记忆驱动的"幕僚长"智能体,通过名为 self model 的人类可读知识层保存智能体记忆。该智能体面向企业工作中随时间变化的邮件、决策、项目和待办事项,避免每次启动都需重建上下文。
NVIDIA 发布技术指南,介绍如何在 Jetson 边缘设备上部署和优化具备多步推理能力的模型。此前这类模型体积过大,无法在边缘硬件本地运行,开发者只能将推理请求路由至数据中心,带来网络依赖、成本上升与数据外泄风险。该指南称这一限制正在被打破。
高效使用 AI 编程智能体最重要的技能。呈现用于使用编程智能体的 AI 工程技能图谱。https://x.com/i/article/2095882148670832640
NVIDIA 技术博客介绍如何在联邦 Kubernetes 与 AI 平台间传递用户身份。现代 AI 平台中用户从中央门户进入、打开受治理数据集、启动 notebook 并调用另一集群中的助手,身份在每一步都跨越控制面与数据面边界,传统单点登录在此失效。
Meta 推出 ZGateway,作为统一 ZippyDB 客户端流量的无状态代理层,承载约 40% 的 ZippyDB 流量,可处理超过 10 亿次/秒的操作,平均用例仅增加约 6% 计算开销。
GitHub Blog 发布 GitHub Copilot app 入门教程,讲解如何同时运行多个 agent 会话。每个会话可运行在独立的 Git worktree 上,彼此隔离、并行执行且各自保留上下文,用户可在 sessions 视图跟踪进度,把时间花在审查和决策上。
Hugging Face 发布教程,用 TRL 库对 LiquidAI/LFM2.5-350M 做 GRPO 微调,仅用约 500 个样本和 100 步训练,将其在 IFStruct benchmark 上的通过率从 22.6% 提升到 29.7%。
推荐理由:教程给出完整可复现的低成本 GRPO 微调流程和逐项评测数字,读者可以照着在免费 GPU 上复刻这一结构化输出改进方法。
Hugging Face 博客发布复现实践:作者用 TRL 和 OpenEnv 开源复现 Surya Narreddi 用 RL 让 Qwen/Qwen3.5-35B-A3B 写 p5.brush JavaScript 画水彩的方法,参考池、RL 环境、训练脚本和模型全部公开。
NVIDIA 技术博客发布 CUDA 优化实战教程,以一个 RGB 转灰度并计算分块的图像处理管线为例,通过六个增量步骤演示如何用 Compute Sanitizer 和 CCCL 新索引 API 排查越界错误。
NVIDIA 技术博客发布 AI 模型协同设计系列第三篇,探讨如何用投机解码在保持精度的同时加速 LLM 推理。文章给出五条指南,用于在帕累托前沿上选择草稿长度与草稿机制。
Meta 工程团队构建了一个面向合规领域的 AI 智能体,作为组织级“第二大脑”,通过结构化知识文件与可组合 recipes 分离知识与推理,并以自动化自我改进闭环将专家反馈编译为经回归测试的更新,无需模型重训。
Sierra 发布面向企业的 AI 语音 Agent 指南,说明 Voice AI 与 AI 语音 Agent 的区别,以及语音 Agent 从听、理解、推理、执行到控制的完整工作流程。
NVIDIA 发布技术博客,介绍如何用 NVIDIA Nemotron 构建自适应智能体网络安全系统。文章指出,当前多数安全智能体实现仍依赖既有告警、预定义工作流和已知攻击行为,更难的问题在于识别防御盲区并将其转化为改进。
NVIDIA 技术博客探讨企业如何为 AI 推理负载合理配置 GPU 并优化总体拥有成本(TCO)。文章指出,延迟目标、模型选择、流量模式和预算约束的复杂组合让 GPU 资源规划变得困难。
安全研究者 Johann Rehberger 发布针对 Claude Code Opus 5 Auto Mode 的提示词注入攻击链实测,在小样本下实现代码执行,攻击成功率达 60-80%,而 Anthropic 委托 Trajectory Labs 的 72 场景评测显示 Auto Mode 攻击成功率为 0.00%。
推荐理由:作者以第一手实测展示 Claude Code Opus 5 Auto Mode 的提示词注入攻击链,可与官方 0.00% 评测结果对照阅读。
NVIDIA 技术博客介绍用 AI 智能体训练跨形态机器人导航策略的方法。导航要求机器人持续定位、理解变化的环境、选择路线并避障,而迁移到新机器人或新场景往往需要新的数据、仿真资产和机器人接口。
Sentence Transformers v6.0 引入 MultiVectorEncoder 模型类型,这篇教程完整演示如何训练和微调 ColBERT 式多向量模型,涵盖模型、数据集、损失函数、训练参数和评估器。
推荐理由:原文给出完整可复现的多向量模型微调配方和实测对比,读者可以按组件迁移到自己的领域数据上。
NVIDIA 发布 DSX MaxLPS,用于提升 AI 工厂的每瓦性能。AI 工厂是受功耗约束的工业系统,对 AI 推理负载而言,应用层每瓦性能已成为衡量 AI 工厂效率的关键指标,因为配电、冷却等环节会消耗部分兆瓦电力,并非每兆瓦都能转化为产生收入的算力。
vLLM 官方博客解析投机解码的 draft-and-verify 机制,对比 native MTP、Gemma 4 MTP、EAGLE-3、DFlash、DSpark 五种起草方法的差异。
Sebastian Raschka 发布 48 分钟视频讲稿,解释 Anthropic 为 Claude 输出文本添加水印的机制。
vLLM 推出基于 Ray Direct Transport(RDT)的原生分片权重传输引擎,在 48 个 8xH100 节点(32 训练、16 推理)上以 BF16 完成 Kimi K2 的权重传输仅需 7.53 秒。
NVIDIA 提出 GPU 加速的矩阵分解算法 AdaptGrow,可将滚动相关性与尾部依赖矩阵转化为硬聚类、软因子载荷和结构突变信号,支持单 GPU 与多节点规模。该算法面向量化策略中的投资组合构建、风险聚合、统计套利与交易监控等场景,错误的工具分组会带来问题。
NVIDIA 的 AI 安全团队结合与 NVIDIA OpenShell、智能体开发者、开源项目及生态伙伴的合作,阐述了对新兴 AI 智能体栈的看法,包括各层所扮演的角色。随着 AI 智能体能力增强、运行周期变长,在其驱动的应用中内建安全与信任变得愈发重要。
Hugging Face 详解 Papers with Code 论文搜索引擎的架构:用 PostgreSQL 全文检索加 pgvector 语义召回,经加权 RRF 融合为混合搜索,已为超过 11 万篇 arXiv 论文维护嵌入向量。
推荐理由:作者亲述 Papers with Code 混合搜索的架构与生产经验,读者可以借鉴其离线批量与在线查询分离的设计方法。
生成式推荐系统正把 RecSys 从传统嵌入向量相似度目标转向生成式目标,即根据用户历史序列预测大目录中的下一个动作或物品。NVIDIA 技术博客指出,RecSys 是消费互联网中最普遍却极难大规模训练与服务的机器学习问题之一,LLM 的出现推动了这一范式转变。