SGLang 与 Miles 为 Qwen3.8-2.4T-A95B 提供 Day-0 支持
SGLang 团队宣布与 Qwen、阿里百炼、NVIDIA 和 AMD 合作,在 SGLang 和 Miles 中于发布当日支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B。
推荐理由:原文给出 Qwen3.8 混合注意力架构的推理支撑细节和实测性能数字,读者可据此评估新模型在自建推理栈上的部署可行性。
阿里千问 Qwen 系列的开源发布与迭代:从旗舰模型到端侧小模型的全谱系动态。
SGLang 团队宣布与 Qwen、阿里百炼、NVIDIA 和 AMD 合作,在 SGLang 和 Miles 中于发布当日支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B。
推荐理由:原文给出 Qwen3.8 混合注意力架构的推理支撑细节和实测性能数字,读者可据此评估新模型在自建推理栈上的部署可行性。
一位 VC 博主归纳一个 500+ 评论的 HN 讨论指出,本地编码栈正快速成熟:Qwen 3.6 35B-A3B 以 33% 的提及率主导模型选择,Pi 以 49% 领先 Agent 提名。
推荐理由:作者基于 HN 讨论归纳本地编码模型与 Agent 的当前格局,并给出与云端模型的对比视角。
Tom Tunguz 用 25 个 VC 任务对比 DeepSeek V4 云端模型与两个本地模型,judge 模型盲评显示三者质量接近(8.0 左右),但路径不同。
推荐理由:作者以 25 个真实 VC 任务实测云端与本地模型,用质量、token 用量和延迟数据解释小模型靠更多推理弥补知识差距。
千问(Qwen)团队开源 Qwen3.8-Flash-Next,一个多模态 MoE 模型,被视为 Qwen4 架构的早期预览。模型总参数 125B 加 51B N-gram Embedding,每 token 激活 6B,48 层中含 36 层 GDN 线性注意力和 12 层 QSA 稀疏注意力,MoE 使用 512 专家 top-10 路由。
推荐理由:原文给出该模型混合架构细节和 SGLang 的 day-0 推理支持数据,读者可以据此评估长上下文部署的实际收益。
Qwen Image 2.1 is here! 🖼️ A 7B params native image generation and editing model, with up to 10 image references The model comes with it's own prompt enhancement LLMs, integrated with diffusers 🧨 and ComfyUI ▶️ on Spaces https://huggingface.co/spaces/hugging-apps/qwen-image-2-1
推荐理由:原文给出了模型的参数量、参考图能力与免配置体验入口,读者可以直接在浏览器试用判断适用性。
Qwen-Image-2.1 is now supported in ComfyUI! Open weights. One 7B checkpoint that generates and edits. → Image generation at native 2K → Instruction editing from up to 10 reference images in a single pass → RGBA output, alpha included
推荐理由:正文点出该模型已在 ComfyUI 支持,读者可以据此更新本地图像生成与编辑工作流。
vLLM 宣布 Day-0 支持 Qwen3.8-2.4T-A95B,这是 Qwen 家族首个以开放权重发布的 Qwen-Max 级模型,基于 Qwen 3.5 架构开箱即用。
推荐理由:原文给出 Qwen3.8-2.4T-A95B 的架构细节、多精度权重和部署要求,读者可据此评估自建推理的成本与硬件门槛。
Nathan Lambert 与 Florian Brand 在季度开源模型总结播客中讨论 Kimi K3 发布后的开源模型格局,称 Kimi K3 在研究类任务上超出预期,但 API 拥堵导致响应明显慢于 GPT。
推荐理由:Lambert 结合上手实测与行业一手观察,拆解开源模型与闭源前沿的差距、蒸馏争议和安全依赖问题,判断较有信息量。
QwenLM 发布 open-computer-use,一个基于 MCP 的 Computer Use 服务,供 Qwen Code 及任何 AI Agent 使用。它通过辅助功能 API 控制 macOS、Linux 和 Windows 系统。
推荐理由:原文点明该服务基于 MCP、可跨三大操作系统控制电脑,读者可以据此评估它与 Qwen Code 等 Agent 的结合方式。
Sebastian Raschka 按时间顺序梳理 2026 年 1-2 月的十个主要开源权重模型发布,包括 Arcee Trinity Large 400B。
推荐理由:作者以架构对比视角梳理近两个月主要开源权重模型发布,读者可以借此看清各家的注意力机制和效率设计选择。
阿里云 Qwen 团队发布端到端全模态大语言模型 Qwen3-Omni,可理解文本、音频、图像和视频,并能实时生成语音。项目链接:https://github.com/QwenLM/Qwen3-Omni
推荐理由:作者以官方身份说明 Qwen3-Omni 的模态覆盖和实时语音生成能力,可帮助读者判断其适用场景。
QwenLM 发布 Qwen-Image,一个图像生成基础模型,主打复杂文字渲染和精确图像编辑能力,代码发布在 GitHub(https://github.com/QwenLM/Qwen-Image)。