跳到正文
原文
Tomer Tunguz 博客(VC 分析)·· 2 小时前精选AI 评分64

Qwen3.5-9B 开源模型可在 12GB 内存笔记本本地运行,性能对标 Claude Opus 4.1

Data Center Intelligence at the Price of a Laptop

AI 导读

阿里巴巴本周发布开源模型 Qwen3.5-9B,可在 12GB 内存设备本地运行,作者称其推理、编码、智能体工作流等能力与 2025 年 12 月的 Claude Opus 4.1 相当。

推荐理由

作者用自己日均千万级 token 的用量算出本地运行 Qwen3.5-9B 的回本周期,并指出并行能力是本地推理的主要取舍。

正文 · AI 翻译

2月28日,我消耗了8400万个token。研究公司、起草备忘录、运行智能体。

Token usage dashboard showing 84.42M tokens consumed on Feb 28 2026

这用的是Kimi K2.5,一个通过API提供的无服务器模型。按Claude1或OpenAI2的价格,混合计费大约每百万token 9美元,同等用量一天的工作就要花756美元。我用量最高的日子达到8000万token。平均每天2000万。按前沿模型定价的云端推理,费用累积得很快。

本周,阿里巴巴发布了Qwen3.5-9B3,一个开源模型,性能媲美2025年12月的Claude Opus 4.1。它能在12GB内存的机器上本地运行。三个月前,这种能力还需要一座数据中心。现在,只需要一个电源插座。

GPQA Diamond high water mark chart showing frontier models vs Qwen3.5-9B

一台5000美元的笔记本电脑,一台内存足以本地运行Qwen的MacBook Pro,在消耗5.56亿token后就能回本。按我的使用率,大约一个月。按每天2000万token算,就是四周。

回本之后,边际成本降到只剩电费。

这不是在智能上妥协。推理、编程、智能体工作流、文档处理、指令遵循:这个9B模型在各方面都媲美12月的前沿水平。

Aggregate benchmark comparison showing Qwen3.5-9B vs GPT-5 and Claude Opus 4.1 across enterprise benchmarks

当前沿智能在本地运行时,会发生什么变化?我今天发送给云端API的一切——起草邮件、研究公司、写代码、分析文档——都留在我的机器上。没有API日志。没有第三方留存。没有服务中断。没有速率限制。

代价是并行化。云端API能处理数千个并发请求。一台笔记本电脑一次只能运行一个推理。对于简单任务——摘要、起草、问答——这没问题。

把它们排进队列。让它们整夜运行。对于会生成数十个并行线程的复杂智能体工作流,本地推理可能不值得等待。经济账倾向于深度而非广度:任务更少、运行更久、成本更低。

从数据中心到笔记本电脑,只用了三个月。买还是租的账,刚刚变了。


  1. https://claude.com/pricing ↩︎

  2. https://openai.com/api/pricing/ ↩︎

  3. https://qwen.ai/blog?id=qwen3.5 ↩︎

来源:Tomer Tunguz 博客(VC 分析) · tomtunguz.com