跳到正文

全部动态

今日 46 条
9月30日周三
  1. Baseten Base Labs:模型研究35

    Baseten 上线 Wan 2.2 T2V 文生视频 API

    Baseten 提供 Wan 2.2 T2V 文生视频 API,通过 POST 请求传入提示词即可生成视频,返回 base64 编码结果。支持 720x1280、1280x720、480x832、832x480、704x1280、1280x704、1024x704、704x1024 八种分辨率,可设置 sampling_steps、guide_scale 与 seed 参数。

  2. Eugene Yan:Writing45

    自编码器与扩散模型:简要对比

    自编码器与扩散模型在学习范式上相似:都以数据为输入并重建输出,都在过程中学习数据的低维流形,架构上都使用瓶颈层,U-Net 可视为带残差连接的自编码器。关键区别在于扩散模型以时间步 t 为条件输入,使单一模型和单组参数即可处理不同噪声水平,从而先由高 t 的噪声生成模糊图像、再在低 t 时逐步锐化;当前扩散模型还以图像描述等文本为条件,支持按文本提示词生成图像。

  3. Eugene Yan:Writing41

    依赖团队无法帮忙时该怎么办:Eugene Yan 的协作经验

    当依赖团队不愿或无法帮忙时,Eugene Yan 建议先理解对方的约束与优先级,而非直接升级或写长篇 JIRA 工单。若对方接受代码贡献成本更高,可推动其建立 away team work 机制,如 office hours、自助文档和代码评审流程。也可将当前协作框定为投资:对方指导你这次改动,你未来可指导自己团队,减少后续支持成本。

  4. Eugene Yan:Writing40

    高效技术团队的运作机制:EOWD、月度学习会、季度回顾与 WBR

    Eugene Yan 总结了技术团队及跨团队协作的四类机制:每周结束简报(EOWD)让 4-6 人团队各用约 10 分钟分享进展并收集反馈,月度学习会以 30-45 分钟分享加 Q&A 把个人专长扩展到团队,季度回顾对齐中长期优先级并明确停止事项,每周业务回顾(WBR)则通过输入指标与输出指标梳理业务全貌。

  5. Every:最新文章(网页)55

    Every 撰文解读如何用好 Jev 分类模型

    Every 发布文章解读 TypeSafe 于 9 月 15 日推出的 Jev,一个对文本和结构化数据做分类而非生成的模型。文章说明 Jev 快速、低成本、可大规模处理日常判断类任务(如邮件是否紧急、段落是否像 AI 写的),并给出上手方法;编辑的演示展示其从语音和手势推断用户意图,已超 100 万次观看。

  6. Eugene Yan:Writing55

    Eugene Yan:如何撰写数据标注指南

    Eugene Yan 总结撰写数据标注指南的方法,提出好指南应回答 Why、What、How 三层问题:任务为何重要、任务是什么、术语如何定义、标注员如何决策、任务如何执行。文章引用 Google 和 Bing Search 的指南实例,包括查询意图分类、页面质量评估因素、匹配质量决策树和标注示例讲解,并建议用 Cohen's kappa 衡量标注员之间的一致性来迭代改进指南。

  7. Baseten Base Labs:模型研究23

    VoxCPM2 语音缓存演示:/v1/audio/speech 接口复用参考音频

    Baseten Base Labs 发布 VoxCPM2 语音缓存演示客户端,通过 /v1/audio/speech 接口验证参考音频复用。首次请求发送 voice 名称加 ref_audio,服务端将其存为已上传语音并预热 ref_audio_feat 缓存;后续请求仅传同一 voice 名称即可命中缓存。客户端支持 wav、pcm、flac、mp3、aac、opus 格式及流式输出。

  8. Eugene Yan:Writing58

    Eugene Yan 详解九个机器学习系统设计模式

    Eugene Yan 总结九个机器学习系统设计模式,包括原始数据只处理一次、Human-In-The-Loop 标注、数据增强、难负例挖掘、问题重构、级联、数据飞轮、业务规则层和上线前评估。每条模式给出优缺点并结合 Meta、DoorDash、Twitter、Stack Exchange、ChatGPT 等案例,并探讨这些模式在 LLM 系统中的适用性。

  9. Baseten Base Labs:模型研究27

    Baseten Orpheus 3B 的 WebSocket 流式 TTS 接入示例

    Baseten 发布 Orpheus 3B 的 WebSocket 接入示例:客户端先发送含 voice、max_tokens、buffer_size 的 JSON 元数据,再通过同一连接逐词流式发送文本,服务端返回原始音频字节。示例用 `__END__` 哨兵标记文本结束,音频以 24000 采样率、paInt16、单声道播放,代码基于 aiohttp 与 pyaudio。

  10. Eugene Yan:Writing43

    Open-LLMs:可商用开源大语言模型清单

    Eugene Yan 整理了一份可商用许可的开源 LLM 清单,起因是他想微调一个带商用许可的 LLM 以规避使用第三方 LLM 的法律与隐私问题。清单涵盖面向代码微调的模型,发布两天内社区提交了八个 PR,新增了上下文长度列并纠正了一个实际不具备商用许可的模型。

  11. Eugene Yan:Writing37

    关于 Attention 与 Transformer 的一些直觉理解

    文章用图书馆检索的类比解释 Attention 中的 query、key、value 向量:query 与各 key 做点积衡量相关性,经 softmax 归一化后对 value 加权求和。相比把整句压进固定向量的 encoder-decoder 循环模型,Attention 让解码器每步都能看到整个输入句,缓解信息瓶颈与长距离依赖,并支持并行计算。多头机制则让模型同时关注多个词。

  12. Eugene Yan:Writing60

    Eugene Yan:如何将 LLM 模式匹配到具体问题

    Eugene Yan 撰文讲解如何把 LLM 应用中的常见问题匹配到对应的解决模式。文章先区分外部与内部 LLM 的差异,再按问题逐一给出建议:用 evals 和用户反馈衡量性能,用 RAG 减少幻觉,用微调提升内部模型在特定任务的表现,用缓存应对延迟要求,用 guardrails 处理语法与语义错误,用防御式 UX 降低错误影响,并用监控追踪用户影响。

  13. Eugene Yan:Writing45

    推送通知该推什么、不该推什么、频率多高:一份推荐系统视角的实践分析

    推送通知可视为一种推荐系统,但与搜索和站内推荐不同,推送场景下用户意图并不明确,只能依据事件、促销或位置等触发条件猜测。Alibaba 发现,推荐互补商品(而非替代品)并说明推荐理由的个性化推送能提升打开率;DPG Media 则建议向用户解释收到通知的原因。推送还受时效性、单条只能突出一个商品、每日或每周推送上限等约束,过度优化即时反馈会损害用户长期满意度,甚至导致用户关闭通知或卸载应用。

  14. Eugene Yan:Writing53

    Eugene Yan 整理语言建模论文阅读清单,助力组建论文俱乐部

    Eugene Yan 与朋友组建了每周一次的语言建模论文俱乐部,并整理出约一年阅读量的论文清单,每篇附一句话总结,涵盖 Transformer、GPT 系列、BERT、T5、Scaling Laws、Chinchilla、LoRA、RAG、RLHF/DPO 等主题。清单支持通过 PR 或 issue 提交补充建议,作者还附上了论文阅读方法的指引。

  15. Eugene Yan:Writing49

    为什么不应在单元测试中 Mock 机器学习模型

    机器学习代码与普通软件不同:软件是输入数据加人工逻辑得到输出,ML 则是用输入数据和期望输出学出逻辑,因此测试时往往需要加载真实模型做推理,而非 mock。作者建议用小型内联样本数据、在可行时用随机或空权重测试输出形状与设备迁移,并把损失下降、过拟合、模型服务启动等关键测试标记为 slow 按需运行,同时不必测试数据加载器、tokenizer、优化器等外部库。

  16. Eugene Yan:Writing65

    Eugene Yan 详解提示词工程基础与有效应用方法

    Eugene Yan 发布提示词工程基础教程,核心观点是把提示词视为对概率模型的条件化,并给出评估先行的工作流。文章用 Claude Messages API 演示角色设定、XML 结构化输入输出、Prefill、n-shot 提示、改进 CoT、拆分多步提示、stop sequence 和 temperature 选择等技巧,并指出礼貌用语和小费威胁等做法对近期模型效果影响不大。

  17. Eugene Yan:Writing52

    Eugene Yan 总结 39 条 ML 系统构建、规模化与执行经验

    Eugene Yan 整理 2024 年参加多个 ML 会议后的 39 条经验,涵盖机器学习系统构建、生产与规模化、执行协作、面向用户和参会演讲五方面。要点包括尽早投入奖励函数工程、扎实 evals 是差异化和护城河、从 demo 到产品 effort 巨大、每次 10 倍规模增长都会暴露新问题,并引用 Karpathy、Will Larson 等人的观点。