Hugging Face 作者用 ML Intern 两天造出 7 个小模型,总成本约 103 美元
The model that didn't exist, so you made it yourself
作者在 HuggingChat 中用 ML Intern 模式,几天内做出 7 个模型并发布到 Hub,总计算成本约 USD 103。首个项目是 Qwen-Image 2.1 自带 9B 提示词改写器的 0.8B 蒸馏版,可在 CPU 运行,输出有效率 99.7%,token 用量约教师的四分之一。
作者用七个真实项目拆解了向 ML Intern 下提示词的关键写法,包括基线、冒烟测试和预算上限,方法可直接迁移。
上周,我想要一个 Qwen-Image 2.1 自带的提示词重写器的小版本。官方版本是一个 9B 模型,需要约 20 GB 内存,并且在写出一个段落之前要思考数千个 token。在 Hub 上,我只找到了同一个 9B 模型的压缩副本。于是我把想要的东西描述给 ML Intern,第二天我就得到了一个能在 CPU 上运行的 0.8B 版本。它有 99.7% 的时间返回有效输出,并且使用的 token 约为教师模型的四分之一。整个项目的计算成本,包括让 9B 模型标注 8,797 条示例请求,总共为 16 美元。
在接下来的几天里,我用同样的方式又做了五个模型。每一个都始于开启 ML-intern 后在 HuggingChat 中的一条消息,每一个都最终成为 Hub 上的公开模型,并在模型卡片中附有评估结果。ML-intern 负责规划工作,在花费任何费用之前先向我询问预算,在正式任务之前先运行一个小测试,然后在 Hugging Face 硬件上进行训练、评估和发布。
我如何提示 ML Intern
第一条消息是我花精力的地方。我为下面分享的 citrus 模型写的第一个提示词大约 450 词。到我的第 6 个项目时,它已接近 2,000 词,因为每个项目都教会了我一些希望在下一次中用到的东西。全部七个提示词都放在 GitHub 上的 yvrjsharma/ml-intern-prompts,与我所写的完全一致。
提示词以一行表达想法以及我为什么想要它开始。然后它列出确切的组成部分:数据集、基础模型、训练脚本。任何我已经核实过的内容都放在一个标题下,这个标题字面上写着“已验证的事实,不要重新推导”,这样智能体会把预算花在工作上,而不是重新发现我已经知道的东西。对于摄像机角度 LoRA,那一节列出了哪个训练器刚刚添加了透明图像支持,以及哪些开放的 GitHub issue 使得后备训练器有风险。
提示词中有两行至关重要。第一行要求在任何训练之前先有一个基线。例如,citrus 提示词说:“在训练前也报告基础模型在同一指标上的零样本得分,这样我们可以看出增益。”没有它,你会得到一个训练好的模型,却不知道它是否比一开始的更好。第二行是一个附带检查的冒烟测试。对于图像 LoRA,我要求先进行 50 个训练步骤,然后检查保存的权重确实发生了变化,之后才为完整运行付费。
在提示词的最后,我列出预期的交付物并限制成本。我定义模型卡片中应包含什么,并包含这样的指令:“总花费上限为 12 美元,超出前先问我。”因为 ML-intern 每个任务都从零美元预算开始,并且在执行付费任务前需要许可,所以这个支出限制会被严格执行。当你省略预算时,智能体会根据项目规模建议几种路径,并询问你更偏好哪一种。
你第一次尝试时不一定需要所有这些。例如,我的 citrus 简报中没有已验证事实部分,ML Intern 仍然产出了一个模型,其准确率是 Qwen3.5-2B 模型的三倍多。让我带你看看我在短短几天内用 ML-Intern 构建的 6 样东西。
1. 一个了解你所在领域的模型
通用视觉模型可以描述一片发黄的柑橘叶子。然而,要告诉你这是螨虫问题还是缺镁,以及治疗该植物的生物和非生物方法,是非常困难的。使用 Claude,我整理了一个训练数据集,该数据集合并自 Hub 上由 Project-AgML 组织托管的三个来源。由此产生的 citrus-disease-vlm-instruct 是一个包含 3,017 张标注图像的数据集,涵盖 21 种不同的害虫、疾病、营养缺乏和治疗方法。ML-intern 使用这些示例完成了 Qwen3.5-2B 的微调,并确保事先对基础模型进行了基准测试。
在 335 张测试照片上,基础模型正确判断问题的比例为 14.9%。在一台 A10G 上训练两个 epoch 后,微调模型达到了 52.8%。计算成本约为 1.90 美元。
查看:模型 · 数据集 · Citrus Doctor 应用
2. 一个能画出你角色的模型
图像模型认识很多角色。以 Hugging Face 品牌资产的扁平风格绘制的 Huggy,并不在其中。我请 ML-Intern 为 FLUX.2 klein base 4B 训练一个 LoRA,使用的是来自 Chunte/huggy_for_training 数据集的 84 张带说明的绘图。
该 agent 每 100 步保存一个检查点,并用每个检查点绘制同一组提示词,这使得选择变得容易。第 200 步是 Huggy 首次完全 符合设定。从第 500 步开始,Huggy 的风格开始渗入与 Huggy 无关的提示词中!训练好的 LoRA 在 4 步的蒸馏 klein 模型上也有效。计算成本约为 7.60 美元。
查看:模型 · 数据集 · Huggy 生成器应用
3. 一个能做新把戏的模型
- 相机角度 LoRA 是早期 Qwen-Image 模型最受欢迎的社区附加组件之一。你可以给模型一张物体的图片,并要求从左侧 45 度查看它。在 Qwen-Image 2.1 模型发布几天后我查看时,还没有人制作,所以我让 ML-intern 来构建它。
ML-intern 以每个物体 24 个角度渲染了来自 Google Scanned Objects 的 1,030 个扫描家居物体,共 24,722 张透明图像,在一个花费几美分的 CPU 任务上完成。它后来确定了 461 个物体用于训练,40 个留出用于测试,以及 1,844 个训练前后配对,均匀分布在 23 个相机指令上。
训练在一台 A100 上运行了 2,000 步,约 90 分钟(约 3.75 美元)。整个项目耗时约半天和 48 个任务,其中包括因缺少软件包或路径错误而失败、必须由 ML-Intern 重新提交的任务。总计算成本约为 16 美元。
查看:模型 · 数据集 · Viewpoint Orbit 应用
- Doodle-in LoRA 是另一个很酷的想法。上传一张带有品红色涂鸦的照片,并添加一个命名物体的简短提示词。该 LoRA 会用该物体替换涂鸦,同时保持原始光照和构图一致。
此前不存在这样的数据集,所以我的提示词描述了如何制作一个。从 Open Images 中的一张真实照片开始,用 LaMa 修复模型移除一个物体,并在物体原先所在的位置画一个涂鸦。未修改的照片作为目标。ML-intern 在 CPU 沙箱中编写并测试了配对构建脚本,然后将其作为 GPU 任务运行,同时记录了每张源照片的作者和许可证。它构建了 6,042 个训练对和一个 160 对的测试集,其中 40 个测试对来自 23 个完全排除在训练之外的物体类别。
在训练之前,它单独测量了基础模型,以及使用 Viggle turbo LoRA 的情况,并检查了批量运行编辑是否产生完全相同的图像,这使得评估成本更低。训练在一台 A100 上运行了 2,000 步,耗时 1 小时 38 分钟(约 4 美元),并在 48 个测试对上比较保存的检查点后选择了第 500 步。
与 Viggle turbo LoRA 搭配,在 6 步下,该 LoRA 表现得非常好。67.5% 的物体在绘制位置被检测到,每次编辑耗时 4.7 秒。来自 23 个未见类别的物体落地可靠性与其余部分相当(65.0% 对 64.2%)。该项目耗时略超过一天,共 59 个任务。总计算成本约 24 美元。
查看:模型 · 数据集 · Doodle-in 应用
4. 适合你设备的模型
- 本文开头的 Pocket Rewriter 是第一个。ML-intern 首先通过 Inference Providers 使用一个小型指令模型生成了 8,797 个简短的图像请求,遵循我提示词中设定的混合类型:照片、海报、标志、信息图等,其中约三分之一要求引号内的精确文本,许多使用英语以外的语言。随后,9B 教师模型在一台 A100 上用了 2 小时 37 分钟重写了所有这些内容(约 6.50 美元)。经过质量筛选后,选择了 1,840 个样本用于训练数据集。

训练 0.8B 和 2B 学生模型分别用了 12 分钟和 18 分钟,在一台 A10G 上(两者共 0.75 美元)。0.8B 还以 812 MB 的 GGUF 文件形式发布,可在 CPU 上运行。该项目耗时约 11 小时,共 24 个任务。总计算成本约 16 美元。
查看:Pocket rewriter 0.8B 学生模型 · 2B 学生模型 · 数据集 · Pocket Studio 应用 · 在 Rewriter Arena 中比较教师与学生模型
- Agate-Preview-002-4step 是第二个。Logolabs 的 Agate Preview 002 是一个 260M 参数的文生图模型,小到可以在浏览器中运行,但它在有引导的情况下需要 50 步,即每张图像 100 次网络前向。我让 ML-intern 将其蒸馏到仅 4 次前向!
这用了两次运行。第一次将 155,000 张训练图像缓存为潜变量,将引导烘焙进模型,然后将步数分阶段从 16 降到 8 再降到 4,全部在 A100 上完成。4 步学生模型在 GenEval 和 FID 上以相同的 4 步击败了教师模型,之后 ML-intern 将其导出为 ONNX 以供浏览器使用。这次运行耗时约 13 小时,花费 22 美元。
我进行了第二次训练运行,要求 ML-Intern 进一步改进 4 步学生模型。它随后用教师模型在 16 步下生成了另外 24,000 个图像对,并针对这些图像对微调 4 步学生模型约一小时。GenEval 从 0.509 提升到 0.536,而教师模型在 50 步下为 0.563,仅用 4 步(计算量的四分之一)。ML-intern 重新导出了浏览器版本。第二次运行耗时约 8 小时。两次运行的总计算成本约 37 美元。
查看:Agate 4-step model · Dataset · Run Agate in your browser · Agate 4-step LIVE
花费
| 模型 | 基础模型 | 计算 |
|---|---|---|
| Citrus Doctor | Qwen3.5-2B | 1.90 美元 |
| Huggy LoRA | FLUX.2 klein base 4B | 7.60 美元 |
| Pocket rewriter(0.8B 和 2B) | Qwen3.5-0.8B 和 2B | 16.05 美元 |
| Viewpoint Orbit LoRA | Qwen-Image 2.1 | 16 美元 |
| Doodle-in LoRA | Qwen-Image 2.1 | 24.30 美元 |
| Agate 4-step(两次运行) | Agate Preview 002 | 37 美元 |
| 总计 | 约 103 美元 |
这些是每个会话所报告的 GPU 和 CPU 作业费用。
自己动手做
ML-intern 已在 HuggingChat 中。开启 ML-intern 模式并粘贴提示词。如果你想找个起点,我的示例提示词可以随意复制。从一个你希望存在的模型和一份你已有的数据集开始,或者一份你能描述出来的数据集。给它一个小预算,要求先做一个基线和一个冒烟测试,在提高上限之前先看看返回的结果。
如果你用它做出了什么东西,请在 X 上分享并标记 @Gradio 和 @HuggingFace。我们很想看到你做出的那些别人想不到为你构建的模型。
来源:Hugging Face:Blog · huggingface.co