Every 撰文解读如何用好 Jev 分类模型
Every 发布文章解读 TypeSafe 于 9 月 15 日推出的 Jev,一个对文本和结构化数据做分类而非生成的模型。文章说明 Jev 快速、低成本、可大规模处理日常判断类任务(如邮件是否紧急、段落是否像 AI 写的),并给出上手方法;编辑的演示展示其从语音和手势推断用户意图,已超 100 万次观看。
Every 发布文章解读 TypeSafe 于 9 月 15 日推出的 Jev,一个对文本和结构化数据做分类而非生成的模型。文章说明 Jev 快速、低成本、可大规模处理日常判断类任务(如邮件是否紧急、段落是否像 AI 写的),并给出上手方法;编辑的演示展示其从语音和手势推断用户意图,已超 100 万次观看。
Eugene Yan 总结撰写数据标注指南的方法,提出好指南应回答 Why、What、How 三层问题:任务为何重要、任务是什么、术语如何定义、标注员如何决策、任务如何执行。文章引用 Google 和 Bing Search 的指南实例,包括查询意图分类、页面质量评估因素、匹配质量决策树和标注示例讲解,并建议用 Cohen's kappa 衡量标注员之间的一致性来迭代改进指南。
CAMB.AI 推出前沿文本转语音模型 MARS6,支持 10 种语言的音色与韵律克隆,需商业授权方可使用。模型至少需要文本、参考音频、参考文本和目标语言四项输入,输出默认采用 ADTS AAC 流式响应,也可配置为 flac 流式或返回 base64 编码的 flac 文件。
这是 Every 员工作者 Laura Entis 的文章列表页,收录其多篇 AI 主题文章,涵盖 token 消耗策略、Opus 4.7 与 4.8、GPT-5.5、Fable 5、Claude Managed Agents、Codex 等模型与工具,以及个人评测基准、AI 写作和智能体工作流等话题。
Eugene Yan 让 gpt-4、gpt-3.5-turbo-0301、claude-v1.2、cohere-xlarge 等 LLM 根据训练数据为他写传记,以观察各模型学到了什么。gpt3.5/4 整体表现最好,主旨正确但细节多有事实错误,且部分模型比其他模型更多地背诵和复述训练数据。这些模型无法联网,输出完全基于训练数据。
Baseten Base Labs 推出 MARS8-Flash 语音生成模型,支持流式输出音频,默认输出格式为 flac,也可选 wav、adts 或无头 PCM。
Every 的 Context Window 栏目解释了 evals 为何突然无处不在,并评测了 Grok 4.7,称其表现"参差不齐"、可能是"一次退步"。Grok 4.7 已于周一公开发布。
Eugene Yan 用 LangChain 结合 gpt-3.5-turbo、gpt-4、text-embedding-ada-002、Pinecone 和 Google 搜索 API,在 Discord 上搭出 /summarize、/sql、/search、/board 等助手。
Baseten Base Labs 发布 VoxCPM2 语音缓存演示客户端,通过 /v1/audio/speech 接口验证参考音频复用。首次请求发送 voice 名称加 ref_audio,服务端将其存为已上传语音并预热 ref_audio_feat 缓存;后续请求仅传同一 voice 名称即可命中缓存。客户端支持 wav、pcm、flac、mp3、aac、opus 格式及流式输出。
数据科学家 Ryan Sloan 在 Every 发表文章,讨论微软能否让职场 AI 智能体在规模化场景下真正有用,文章标题为「Copilot Gets a Seat in the Org Chart」。Ryan Sloan 常驻西雅图,在 Full Rank 撰写 AI 测量与评估相关内容。
Eugene Yan 用 Raspberry Pico 加电子墨水屏做了个 Raspberry-LLM,调用 WSJ 和 HackerNews 的 RSS 源与第三方 LLM API 生成内容,能押韵报时、用 Dr. Seuss 风格解读新闻标题、编造名人假引语,还能模仿 HackerNews 喷子留言。
Canopy Labs 推出 Orpheus TTS(Orpheus v1),为其 Orpheus TTS 的继任模型,需以约 83 tokens/秒生成才能实现实时流式输出。该实现支持流式生成,在 H100 MIG GPU 上可支持 16 路并发实时流(可变流量)、24 路并发实时流(稳定流量),以及 128 路并发非实时生成以进行低成本批处理。
Microsoft 在西雅图和 Redmond 的发布活动上宣布新 Copilot,将聊天、代码、Office 和名为 Autopilot 的常驻智能体合并到一个界面,取代此前分开的消费者与工作聊天应用。
Eugene Yan 总结九个机器学习系统设计模式,包括原始数据只处理一次、Human-In-The-Loop 标注、数据增强、难负例挖掘、问题重构、级联、数据飞轮、业务规则层和上线前评估。每条模式给出优缺点并结合 Meta、DoorDash、Twitter、Stack Exchange、ChatGPT 等案例,并探讨这些模式在 LLM 系统中的适用性。
Baseten 发布 Orpheus 3B 的 WebSocket 接入示例:客户端先发送含 voice、max_tokens、buffer_size 的 JSON 元数据,再通过同一连接逐词流式发送文本,服务端返回原始音频字节。示例用 `__END__` 哨兵标记文本结束,音频以 24000 采样率、paInt16、单声道播放,代码基于 aiohttp 与 pyaudio。
Every 网站文章列表页汇总了多篇 AI 主题文章,涵盖 Claude 的 Agent 能力、Claude Skills 入门、GPT-5 发布后的走向、OpenAI Codex 成为 Claude Code 竞品、Super Sonnet 4、Claude Code 占据领先位置,以及 OpenAI Atlas、MCP 等话题。
Eugene Yan 提出以点击为主、对话为辅的 LLM 交互方式,并搭建了一个图书推荐原型:先点击感兴趣的书、按“氛围”关键词筛选,再向 LLM 图书管理员提问。系统用近似最近邻在物品嵌入向量上召回相似书,经 LTR 模型或启发式排序,氛围关键词为预缓存而非 LLM 动态抽取;后端用 FastAPI、Jinja 与流式 API 降低等待。
Baseten 模型库现已提供 DeepSeek V4.1 Flash、GLM-5.3 Fast、GLM-5.3、GLM-5.3-Flash 和 Kimi K3 等热门模型,可部署在 API 端点后直接调用。
Every 团队对本周发布的三款模型做了 Vibe Check。Opus 5.5 在产品和设计工作上持平或超过 Fable 5.1,每 token 成本低 60%,但会把要点埋进长文且不限时运行;GPT-6 Sol 成为 Dan Shipper 的日常主力,更快更便宜;Grok 4.7 只赢回一位用户,Katie 认为其写作缺乏节奏感。
Eugene Yan 整理了一份可商用许可的开源 LLM 清单,起因是他想微调一个带商用许可的 LLM 以规避使用第三方 LLM 的法律与隐私问题。清单涵盖面向代码微调的模型,发布两天内社区提交了八个 PR,新增了上下文长度列并纠正了一个实际不具备商用许可的模型。
文章用图书馆检索的类比解释 Attention 中的 query、key、value 向量:query 与各 key 做点积衡量相关性,经 softmax 归一化后对 value 加权求和。相比把整句压进固定向量的 encoder-decoder 循环模型,Attention 让解码器每步都能看到整个输入句,缓解信息瓶颈与长距离依赖,并支持并行计算。多头机制则让模型同时关注多个词。
Eugene Yan 发布 Obsidian-Copilot 原型,给定章节标题时通过 RAG 起草段落,并能对每日日记做一周复盘与下周规划,代码开源于 GitHub。
Eugene Yan 总结了将大语言模型集成到系统与产品中的七大实用模式:Evals、RAG、微调、缓存、Guardrails、防御性 UX 和收集用户反馈,按提升性能与降低成本/风险、靠近数据与靠近用户两个维度组织。
Eugene Yan 撰文讲解如何把 LLM 应用中的常见问题匹配到对应的解决模式。文章先区分外部与内部 LLM 的差异,再按问题逐一给出建议:用 evals 和用户反馈衡量性能,用 RAG 减少幻觉,用微调提升内部模型在特定任务的表现,用缓存应对延迟要求,用 guardrails 处理语法与语义错误,用防御式 UX 降低错误影响,并用监控追踪用户影响。
Eugene Yan 撰文梳理抽象式摘要评估的四个维度(流畅、连贯、相关、一致),并分四类讲解指标:基于参考的 ROUGE、METEOR、BERTScore、MoverScore。
首届 AI Engineer Summit 上,Amplify Partners 对 AI Engineering 的调研显示,在 800 多份回复中,评测(evals)和推理服务成本被列为 LLM 部署的最大痛点。目前评测手段仍缺乏好方案,介于确定但脆弱的 assert 断言与昂贵随机的 3P LLM 打分之间,代码生成因可验证输出成为相对易评测的例外。RAG 短期不会消失,缓存降本则讨论寥寥。
在 Factual Inconsistency Benchmark(FIB)上,先用 Wikipedia 摘要微调 3 个 epoch 再在 FIB 上微调 10 个 epoch,PR AUC 达 0.85,比仅在 FIB 上微调提升 23%。
推送通知可视为一种推荐系统,但与搜索和站内推荐不同,推送场景下用户意图并不明确,只能依据事件、促销或位置等触发条件猜测。Alibaba 发现,推荐互补商品(而非替代品)并说明推荐理由的个性化推送能提升打开率;DPG Media 则建议向用户解释收到通知的原因。推送还受时效性、单条只能突出一个商品、每日或每周推送上限等约束,过度优化即时反馈会损害用户长期满意度,甚至导致用户关闭通知或卸载应用。
Eugene Yan 发布 2023 年度回顾,全年写下 20 篇文章、做了 5 个原型和 2 场演讲,其中 LLM 实验与 LLM patterns 两篇获得超 2 万阅读。他借助 GPT-4 辅助职业反思,并因内部原型 Dewey 表现良好而将工作重心转向 GenAI 计划,同时与朋友创办了 LM 论文俱乐部。
Eugene Yan 与朋友组建了每周一次的语言建模论文俱乐部,并整理出约一年阅读量的论文清单,每篇附一句话总结,涵盖 Transformer、GPT 系列、BERT、T5、Scaling Laws、Chinchilla、LoRA、RAG、RLHF/DPO 等主题。清单支持通过 PR 或 issue 提交补充建议,作者还附上了论文阅读方法的指引。
Eugene Yan 发表长文,系统讲解如何生成和使用合成数据进行预训练、指令微调与偏好微调。文章将方法分为从更强模型蒸馏(如 Unnatural Instructions。
机器学习代码与普通软件不同:软件是输入数据加人工逻辑得到输出,ML 则是用输入数据和期望输出学出逻辑,因此测试时往往需要加载真实模型做推理,而非 mock。作者建议用小型内联样本数据、在可行时用随机或空权重测试输出形状与设备迁移,并把损失下降、过拟合、模型服务启动等关键测试标记为 slow 按需运行,同时不必测试数据加载器、tokenizer、优化器等外部库。
Eugene Yan 撰文总结任务特定的 LLM 评测方法,指出通用评测常与实际应用表现相关性弱。文章给出分类用 recall、precision、ROC-AUC。
Eugene Yan 用 Vapi 语音 API 搭配 claude-3-sonnet 搭建了一个可通话的 AI 教练 Tara,用于散步时倾诉焦虑、梳理情绪和演练困难对话。
Eugene Yan 发布提示词工程基础教程,核心观点是把提示词视为对概率模型的条件化,并给出评估先行的工作流。文章用 Claude Messages API 演示角色设定、XML 结构化输入输出、Prefill、n-shot 提示、改进 CoT、拆分多步提示、stop sequence 和 temperature 选择等技巧,并指出礼貌用语和小费威胁等做法对近期模型效果影响不大。
Eugene Yan 与 Jason 分享招聘 ML/AI 工程师的方法,把面试当作评估系统,主张可靠、有效、低噪声。
Eugene Yan 发布长文,基于约二十篇论文系统讲解如何应用和评估 LLM-as-Judge(LLM 评估器)。
作者用 FastAPI、FastHTML、Next.js 和 SvelteKit 分别构建了同一个名为 "Look at Your Data" 的 CSV 增删改查应用,以比较各框架的开发体验。
Eugene Yan 发布 AlignEval(aligneval.com),把构建 LLM 评测器简化为四步:上传含 input、output 列的 CSV,标注样本为 pass 或 fail,定义评测标准并运行 LLM 评测器,再用 dev-test 划分半自动优化。
Eugene Yan 整理 2024 年参加多个 ML 会议后的 39 条经验,涵盖机器学习系统构建、生产与规模化、执行协作、面向用户和参会演讲五方面。要点包括尽早投入奖励函数工程、扎实 evals 是差异化和护城河、从 demo 到产品 effort 巨大、每次 10 倍规模增长都会暴露新问题,并引用 Karpathy、Will Larson 等人的观点。