Qwen3 8B Embedding 文本嵌入模型
Qwen3 8B Embedding 是一个文本嵌入模型,输入文本后输出一维嵌入向量,常用于聚类等下游任务并配合向量数据库使用。该模型部署时量化为 FP8,需 Nvidia 较新 GPU 支持,如 H100、H100_40GB、B200 或 L4,量化可选但能提升效率。客户端代码可通过 pip 安装,也可使用 OpenAI embeddings 客户端。
Qwen3 8B Embedding 是一个文本嵌入模型,输入文本后输出一维嵌入向量,常用于聚类等下游任务并配合向量数据库使用。该模型部署时量化为 FP8,需 Nvidia 较新 GPU 支持,如 H100、H100_40GB、B200 或 L4,量化可选但能提升效率。客户端代码可通过 pip 安装,也可使用 OpenAI embeddings 客户端。
在复合工程流程中,打磨(Polish)是最后一步:亲自使用应用,把感觉不对的地方告诉 AI 智能体,直到满意为止。作者用 /ce-polish 命令检出分支、后台启动开发服务器并在编辑器中打开应用,通过 Monologue 语音反馈让智能体调整 Cora 邮件卡片的动画与布局密度。这一环节之所以重要,是因为智能体无法判断什么才算“好”,最终的人类判断仍不可替代。
Baseten Base Labs 发布 Qwen3 8B Reranker,用于对查询与文档做相关性判定,输出只能是 "yes" 或 "no"。示例通过 baseten_performance_client 的 PerformanceClient 调用 classify 接口,支持 truncate、batch_size 与 max_concurrent_requests 参数配置。
Every 作者复盘自己弃用的多个 AI 工作流,包括仿照 Tend 搭建的 Attention Desk 和 AI 助手 Margot,认为弃用不等于个人失败,关键在工作流是否匹配真实问题和习惯。文中指出失败的四种类型,并给出规则:新自动化先手动跑三次、产出需在五分钟内可用、四次未用即触发调整或退役决定,留存的工作流如 compound writing 插件则因即时回报而持续使用。
微软 Copilot Studio 被认为是构建 AI 智能体的最佳工具之一,但用户需经历购买、配置、多重账号跳转等繁琐流程才能使用,且其技能功能未对部分许可证开放。该平台与 GitHub Copilot、消费版 Copilot 应用完全独立,微软旗下以 Copilot 命名的产品超过 80 个。
SDXL Lightning 是 Stable Diffusion XL 的变体,仅需 4 个 UNet 步骤即可生成 1024x1024 像素图像,实现接近实时的图像生成。模型接收单个 prompt 输入,返回图像的 base64 字符串,该实现采用 4 步 UNet checkpoint 以平衡速度与质量。用户可自行部署 2 步版本以获得更快速度,或 8 步版本以获得更高质量。
Eugene Yan 撰文梳理机器学习代码与系统中常见的设计模式,主要参考 Gang of Four 设计模式一书。
作者用 Claude 搭建写作风格工具 Tastemaker,并加了连接 Claude Code、Codex 等 Agent 的 MCP 连接器,自认功能可用便上线。
Qwen Image 2512 已在 Baseten 平台上线,可通过 OpenAI 兼容 API 调用,模型名为 qwen-image-2512。该模型支持 1024x1024 尺寸图像生成,可配置 num_inference_steps 与 guidance_scale 参数,并返回 b64_json 格式结果。
Every 评测负责人介绍如何为自己的工作搭建个人 AI 基准测试,指出 MMLU-Pro 等常用基准衡量不了模型能否帮到你自己的工作。作者以写文案、建仪表盘和做幻灯片为例,说明个人基准分三个层次,可帮助判断何时在 Astra 与 Fable 之间切换,以及能否用 Luna 或 Haiku 等更便宜的模型省钱。
Baseten 提供 Wan 2.2 T2V 文生视频 API,通过 POST 请求传入提示词即可生成视频,返回 base64 编码结果。支持 720x1280、1280x720、480x832、832x480、704x1280、1280x704、1024x704、704x1024 八种分辨率,可设置 sampling_steps、guide_scale 与 seed 参数。
Every 发布一篇 Codex 知识工作进阶指南,讲解如何把 Codex 用于邮件、写作、研究、规划和报告。文章面向非工程师,涵盖设置、工作流和使用原则。
NVIDIA Cosmos 3 Nano (8B) 世界基础模型现可通过 Baseten 在单张 H100 上部署,提供六种 omni 模式:text2image、text2video(默认模式)、image2video、forward/inverse dynamics 和 policy。
Eugene Yan 通过阅读 requests、scikit-learn、pytorch、fastai 等广泛使用的 Python 库,总结了一些不常见的 Python 用法。
Every 发布对 GPT-6 Astra 的 Vibe Check 评测,认为它是大幅升级,写作、软件操作和视觉设计表现令人印象深刻,但也存在一些坏习惯。
Eugene Yan 撰文分析复杂度偏见为何存在,指出复杂方案通过信号化努力、掌控力、创新和功能多样性而更受论文评审和晋升机制青睐,而简单方案更易采用、构建、扩展和运维。文章举例说明简单机器学习方法常不逊于复杂方法,如点积在推荐检索上优于神经协同过滤、树模型在 45 个中型表格数据集上超过深度神经网络,并建议聚焦问题复杂度而非方案复杂度,善用奥卡姆剃刀。
Baseten Base Labs 上线图像生成模型 Flux.2 [dev],模型名为 flux2-dev,可通过 OpenAI 兼容 API 调用。示例代码以 1024x1024 尺寸、50 步推理、guidance_scale 1.0 生成图像,并以 b64_json 格式返回结果。
Eugene Yan 发文探讨数据与机器学习管道的测试为何频繁失效,并以行为日志到批量推理的示例管道演示单元、schema 和集成测试。
Baseten Base Labs 发布 Qwen Image 的 Python 调用示例,通过 httpx 向 Baseten 部署端点发送 prompt、width、height、num_inference_steps 和 seed 等参数生成图像。
TypeSafe 发布新模型 Jev,可将自然语言问题直接输出为 0 到 1 的概率或自定义类别,供代码直接调用。它原生支持结构化输出,无需像 DSPy 那样额外引导 LLM,因此速度极快、成本极低,适合在后台为 AI 智能体做实时判定。其实际效果目前仍待验证。
RecSys 2022 于 9 月 18-23 日在西雅图举办,行业投稿较 2021 年增长 50%、较 2020 年增长 260%,15 篇行业论文和 15 场行业演讲进入主会程。作者重点推荐三篇论文:用 recency sampling 提升序列推荐训练效率、将 Open Bandit Pipeline 扩展到模拟行业挑战、以及 Google 广告 CTR 模型的工业级 ML 工程实践。
Eugene Yan 系统梳理文生图的四个核心概念:扩散、文本条件、分类器引导与潜空间。作者亲手复现 DDPM 发现去噪权重低至 0.01-0.02、加噪权重最高 0.14。
Baseten 提供 NVIDIA Nemotron 3 Diarization 的三种预设方案,该模型支持最多 8 个说话人、可按请求配置延迟档位(0.32 秒到 30 秒 buffer),是 Streaming Sortformer v2.1 的后继,采用 OpenMDW 1.1 许可证允许商用。
创意工作室 Afterimage 用真实拍摄素材测试了 GPT-6 Astra 的视觉特效能力,包括替换移动镜头中的餐盘、在布鲁克林街景中添加建筑、让巨型游行花车出现在手持 iPhone 素材的窗外。部分镜头成功,部分失败,但团队最终开始构思此前不敢尝试的特效。此前 Opus 4.6 只能写确定性 Python 脚本做基础瑕疵与物体移除,Gemini Omni 虽能生成改动但缺乏精细控制。
自编码器与扩散模型在学习范式上相似:都以数据为输入并重建输出,都在过程中学习数据的低维流形,架构上都使用瓶颈层,U-Net 可视为带残差连接的自编码器。关键区别在于扩散模型以时间步 t 为条件输入,使单一模型和单组参数即可处理不同噪声水平,从而先由高 t 的噪声生成模糊图像、再在低 t 时逐步锐化;当前扩散模型还以图像描述等文本为条件,支持按文本提示词生成图像。
Baseten 推出基于 Whisper Large V3 的优化实时转录管线,支持可配置的部分转录更新频率、高并发音频流下稳定的实时延迟,以及多语言转录的自动语言检测。
OpenAI 的 GPT-6 Sol 与 Anthropic 的 Claude Opus 5.5 同日发布,Every 基于日常工作的实测与评测对两者做了对比,结论是存在一个明确的取舍。该对比旨在回答该用 Sol 6 还是 Opus 5.5 的问题,完整内容需订阅阅读。
Eugene Yan 回顾 2022 年:完成 18/26 篇博客写作,学习并应用 bandits、反事实评估、text-to-image 等技术,2/3 位导师晋升到下一级别,并在 RecSys 线上推荐系统 workshop 发表 keynote,主张多数场景下批量推荐已足够。
Whisper Large V3 Turbo 已在 Baseten 上线,面向实时笔记、内容字幕和客服等实时语音场景,支持部分转录更新频率可配置、高并发音频流下延迟稳定,以及多语言转录的自动语言检测。
当依赖团队不愿或无法帮忙时,Eugene Yan 建议先理解对方的约束与优先级,而非直接升级或写长篇 JIRA 工单。若对方接受代码贡献成本更高,可推动其建立 away team work 机制,如 office hours、自助文档和代码评审流程。也可将当前协作框定为投资:对方指导你这次改动,你未来可指导自己团队,减少后续支持成本。
MOSS-Transcribe-Diarize 0.9B 是一个端到端音频模型,可在单次推理中完成语音转写、说话人标注和时间戳,把多人长录音整理成结构化的"谁说了什么"。
Every 发布 Compound Engineering 技能包(当前版本 v3.30.1),通过 brainstorm、plan、work、simplify、review、compound 六步循环让编码智能体把学到的经验写入 docs/solutions/,供后续任务复用。
Baseten 上部署的 NVIDIA Nemotron 3 ASR(英文)通过 WebSocket 直连 NIM 原生 Riva Realtime API,无需自定义 schema,直接使用 Riva 的 OpenAI-Realtime 风格 JSON 事件协议。
Every 推出语音效率应用 Monologue,将任意应用内的语音听写、语音笔记和无机器人会议转录整合为一。支持 Mac、iPhone、iPad 和 Apple Watch,提供 100+ 语言、Mac 离线本地转录、自定义词典,并可通过 MCP、API 和 CLI 让 AI 智能体访问已保存的笔记。Monologue Pro 定价 $15/月或 $144/年,亦包含在 Every 订阅中。
Eugene Yan 总结了提升机器学习项目成功率的四种机制:为每个项目设置 pilot 和 copilot 以发现关键缺陷,copilot 约投入 pilot 10% 的时间。
NVIDIA Nemotron 3.5 ASR 是一款面向低延迟流式与批量场景的多语言流式语音识别模型,已在 Baseten 上以 docker_server 形式部署,通过 WebSocket 直连 NIM 原生 Riva Realtime API。
Eugene Yan 总结了技术团队及跨团队协作的四类机制:每周结束简报(EOWD)让 4-6 人团队各用约 10 分钟分享进展并收集反馈,月度学习会以 30-45 分钟分享加 Q&A 把个人专长扩展到团队,季度回顾对齐中长期优先级并明确停止事项,每周业务回顾(WBR)则通过输入指标与输出指标梳理业务全貌。
Every 成立 Product Studio,通过内部写作、播客、产品与咨询项目的正向反馈循环孵化新想法,并与驻场创业者(EIR)合作打造 AI 产品。用户可注册获取产品早期访问权限。
Eugene Yan 基于多篇行业论文和技术博客,总结出构建内容审核与欺诈检测系统的五个模式:通过 human-in-the-loop 收集 ground truth、数据增强、级联模式拆分问题、结合监督与无监督学习、以及可解释性。
Baseten 发布 Qwen3-TTS-12Hz 流式文本转语音模型,支持十种主要语言、3 秒参考音频快速克隆音色,并可依据文本内容调整语气、节奏和情感表达。模型支持流式与非流式生成,收到单个字符即可输出首个音频包,提供 0.6B 和 1.7B 两个 Base 版本模型卡,页面附有基于 WebSocket 的完整调用脚本,可进行语音管理和 PCM 流式合成。