跳到正文

#部署/工程

今日 41 条
9月30日周三
  1. Preferred Networks:AI 研究与产品19

    Preferred Networks 的 AI 计算基础设施:MN-Core 系列处理器与 PFCP 云平台

    Preferred Networks(PFN)自研 MN-Core 系列 AI 处理器,并整合先进网络与存储技术,为内外部研究者与开发者提供 AI 计算基础设施。除通用 GPU 外,PFN 将自研处理器纳入整体方案;自 2024 年起还推出 Preferred Computing Platform(PFCP),这是唯一运行于 MN-Core 系列的 AI 工作负载云服务。

  2. World Labs:官网65

    World Labs 发布实时生成世界模型 RTFM 并开放研究预览

    World Labs 发布实时生成世界模型 RTFM(Real-Time Frame Model),可在用户交互时实时生成视频,现已以研究预览形式开放浏览器演示。RTFM 在单张 H100 GPU 上以交互帧率运行推理,不依赖显式 3D 表示,作为端到端训练的学习式渲染器工作;它将带位姿的帧作为空间记忆并通过 context juggling 检索邻近帧,使世界在长时间交互中持续存在而不丢失。

  3. Baseten Base Labs:模型研究16

    GLM-5.3-Flash

    GLM-5.3-Flash 出现在 Baseten Base Labs 的模型研究内容中,原始标题仅给出该模型名称,正文为一段 chat.completion 格式的 API 返回示例,其中 model 字段为空,completion_tokens 为 145、prompt_tokens 为 38、total_tokens 为 183。

  4. Baseten Base Labs:模型研究11

    Qwen3.6 27B

    Qwen3.6 27B 出现在 Baseten Base Labs 的模型研究内容中,原始标题仅给出该模型名称。正文为一段 chat.completion 格式的 API 返回示例,包含 38 个 prompt_tokens、145 个 completion_tokens,合计 183 个 tokens,模型字段为空,未披露更多参数或评测信息。

  5. Every:最新文章(网页)55

    Every 复盘全员 AI 智能体实验:Plus One 将从个人助手转向共享团队资源

    Every 复盘内部部署 Plus One(OpenClaw 托管版)的经验:每位员工一个 AI 智能体的初始设想被证明是错误起点,智能体常拒绝执行任务、需持续维护,仅部分场景如加速写作、管理 Proof 的 bug 报告有用。下一篇 Plus One 将改为类似共享团队资源的形态,有明确分工而非反映主人个性的个人宠物,详细方案将随付费订阅内容发布。

  6. Baseten Base Labs:模型研究30

    Qwen3 8B Embedding 文本嵌入模型

    Qwen3 8B Embedding 是一个文本嵌入模型,输入文本后输出一维嵌入向量,常用于聚类等下游任务并配合向量数据库使用。该模型部署时量化为 FP8,需 Nvidia 较新 GPU 支持,如 H100、H100_40GB、B200 或 L4,量化可选但能提升效率。客户端代码可通过 pip 安装,也可使用 OpenAI embeddings 客户端。

  7. Baseten Base Labs:模型研究35

    Baseten 上线 Wan 2.2 T2V 文生视频 API

    Baseten 提供 Wan 2.2 T2V 文生视频 API,通过 POST 请求传入提示词即可生成视频,返回 base64 编码结果。支持 720x1280、1280x720、480x832、832x480、704x1280、1280x704、1024x704、704x1024 八种分辨率,可设置 sampling_steps、guide_scale 与 seed 参数。

  8. Eugene Yan:Writing41

    依赖团队无法帮忙时该怎么办:Eugene Yan 的协作经验

    当依赖团队不愿或无法帮忙时,Eugene Yan 建议先理解对方的约束与优先级,而非直接升级或写长篇 JIRA 工单。若对方接受代码贡献成本更高,可推动其建立 away team work 机制,如 office hours、自助文档和代码评审流程。也可将当前协作框定为投资:对方指导你这次改动,你未来可指导自己团队,减少后续支持成本。

  9. Baseten Base Labs:模型研究49

    Orpheus TTS:Canopy Labs 的实时流式语音模型

    Canopy Labs 推出 Orpheus TTS(Orpheus v1),为其 Orpheus TTS 的继任模型,需以约 83 tokens/秒生成才能实现实时流式输出。该实现支持流式生成,在 H100 MIG GPU 上可支持 16 路并发实时流(可变流量)、24 路并发实时流(稳定流量),以及 128 路并发非实时生成以进行低成本批处理。

  10. Baseten Base Labs:模型研究27

    Baseten Orpheus 3B 的 WebSocket 流式 TTS 接入示例

    Baseten 发布 Orpheus 3B 的 WebSocket 接入示例:客户端先发送含 voice、max_tokens、buffer_size 的 JSON 元数据,再通过同一连接逐词流式发送文本,服务端返回原始音频字节。示例用 `__END__` 哨兵标记文本结束,音频以 24000 采样率、paInt16、单声道播放,代码基于 aiohttp 与 pyaudio。

  11. Eugene Yan:Writing60

    Eugene Yan:如何将 LLM 模式匹配到具体问题

    Eugene Yan 撰文讲解如何把 LLM 应用中的常见问题匹配到对应的解决模式。文章先区分外部与内部 LLM 的差异,再按问题逐一给出建议:用 evals 和用户反馈衡量性能,用 RAG 减少幻觉,用微调提升内部模型在特定任务的表现,用缓存应对延迟要求,用 guardrails 处理语法与语义错误,用防御式 UX 降低错误影响,并用监控追踪用户影响。

  12. Eugene Yan:Writing40

    AI Engineer Summit 2023 参会反思:LLM 系统落地的评测与成本难题

    首届 AI Engineer Summit 上,Amplify Partners 对 AI Engineering 的调研显示,在 800 多份回复中,评测(evals)和推理服务成本被列为 LLM 部署的最大痛点。目前评测手段仍缺乏好方案,介于确定但脆弱的 assert 断言与昂贵随机的 3P LLM 打分之间,代码生成因可验证输出成为相对易评测的例外。RAG 短期不会消失,缓存降本则讨论寥寥。

  13. Eugene Yan:Writing49

    为什么不应在单元测试中 Mock 机器学习模型

    机器学习代码与普通软件不同:软件是输入数据加人工逻辑得到输出,ML 则是用输入数据和期望输出学出逻辑,因此测试时往往需要加载真实模型做推理,而非 mock。作者建议用小型内联样本数据、在可行时用随机或空权重测试输出形状与设备迁移,并把损失下降、过拟合、模型服务启动等关键测试标记为 slow 按需运行,同时不必测试数据加载器、tokenizer、优化器等外部库。

  14. Eugene Yan:Writing52

    Eugene Yan 总结 39 条 ML 系统构建、规模化与执行经验

    Eugene Yan 整理 2024 年参加多个 ML 会议后的 39 条经验,涵盖机器学习系统构建、生产与规模化、执行协作、面向用户和参会演讲五方面。要点包括尽早投入奖励函数工程、扎实 evals 是差异化和护城河、从 demo 到产品 effort 巨大、每次 10 倍规模增长都会暴露新问题,并引用 Karpathy、Will Larson 等人的观点。

  15. Andrej Karpathy:Blog(网页)65

    Karpathy 用 JavaScript 从零实现 t-SNE,可视化 Twitter 头部账号

    Karpathy 从零用 JavaScript 实现 t-SNE 并以 tsnejs 发布在 GitHub,构建了按推文内容对 Twitter 前 500 大账号做二维聚类的 demo。流程包括用 Kimono 抓取账号列表、Tweepy 采集每人 200 条推文、TfidfVectorizer 生成 500 x 87,342 维语言指纹,再用 d3js 渲染结果,并另附词向量可视化 demo。