实测:421M 参数决策模型 Laya 能否在浏览器中运行
作者在 Mac 上的 Chromium 浏览器中实测了开源 421M 参数决策模型 Laya(Apache 2.0)经社区 ONNX Runtime Web 移植版 layaForWeb 的运行表现。
推荐理由:作者实测给出了 Laya 在浏览器运行的下载量、延迟、量化精度损失和后台标签页限制,方法可复用。
作者在 Mac 上的 Chromium 浏览器中实测了开源 421M 参数决策模型 Laya(Apache 2.0)经社区 ONNX Runtime Web 移植版 layaForWeb 的运行表现。
推荐理由:作者实测给出了 Laya 在浏览器运行的下载量、延迟、量化精度损失和后台标签页限制,方法可复用。
AWS 机器学习博客发布教程,用三个智能体(作曲、交付、合规)在 Amazon Bedrock AgentCore Runtime Instances 上构建音乐制作流水线。
Zyphra 推出 Zyphra Cloud,提供面向长周期智能体系统的推理服务,包含 Serverless Inference 与 Dedicated Inference Capacity 两种模式。
Zyphra 推出面向持续增长训练语料的增量模糊去重系统 PUFFER,在十小时吞吐测试中处理最多 10 亿文档,较现有 CPU 去重方法提速 11x-35x,单进程 1.75 小时可摄入 10 亿文档,已在超 300 亿文档的生产环境部署,并以 Apache 2.0 开源。
Preferred Networks 发布基于 Rust 的 Optuna 实现 Rustuna,并同步推出 Optuna v5.0。内部基准显示 Rustuna 速度最高可达 Optuna 的 1,000 倍,Matlantis CSP 的替换测试中 10 万次 trial 的内存消耗降低约 50%。
Preferred Networks(PFN)与 PFCI 计划在 2026 年内,通过 PFCI 的 AI 云服务 PFCP 向材料模拟器 Matlantis 提供自研 AI 芯片 MN-Core 2 的算力,用于晶体结构等特定计算任务。
Preferred Networks 自 2016 年起与神户大学共同开发 MN-Core 系列 AI 专用芯片,覆盖训练、推理与高性能计算。面向生成式 AI 推理的 MN-Core L1000 采用 3D 堆叠架构与 DRAM,每秒可处理更多 token,性能最高达现有 GPU 及其他处理器的 10 倍。
Preferred Networks(PFN)自研 MN-Core 系列 AI 处理器,并整合先进网络与存储技术,为内外部研究者与开发者提供 AI 计算基础设施。除通用 GPU 外,PFN 将自研处理器纳入整体方案;自 2024 年起还推出 Preferred Computing Platform(PFCP),这是唯一运行于 MN-Core 系列的 AI 工作负载云服务。
World Labs 发布实时生成世界模型 RTFM(Real-Time Frame Model),可在用户交互时实时生成视频,现已以研究预览形式开放浏览器演示。RTFM 在单张 H100 GPU 上以交互帧率运行推理,不依赖显式 3D 表示,作为端到端训练的学习式渲染器工作;它将带位姿的帧作为空间记忆并通过 context juggling 检索邻近帧,使世界在长时间交互中持续存在而不丢失。
GLM-5.3-Flash 出现在 Baseten Base Labs 的模型研究内容中,原始标题仅给出该模型名称,正文为一段 chat.completion 格式的 API 返回示例,其中 model 字段为空,completion_tokens 为 145、prompt_tokens 为 38、total_tokens 为 183。
Qwen3.6 27B 出现在 Baseten Base Labs 的模型研究内容中,原始标题仅给出该模型名称。正文为一段 chat.completion 格式的 API 返回示例,包含 38 个 prompt_tokens、145 个 completion_tokens,合计 183 个 tokens,模型字段为空,未披露更多参数或评测信息。
Baseten 模型库新增阿里云 Qwen 系列模型,涵盖 Qwen3.5 35B-A3B、Qwen3.5 122B-A10B、Qwen3.6 27B、Qwen3 Coder 480B、Qwen3 VL 235B 等 LLM,以及 Qwen Image、Qwen3 TTS 12Hz、Qwen 3 ASR 1.7B 和 Qwen3 系列嵌入与重排序模型。
DeepSeek V3.2 是 DeepSeek 推出的混合推理模型,主打高效长上下文扩展,已可通过 Baseten Inference Stack 的 OpenAI 兼容 API 端点调用。
BAAI/bge-en-icl 是一个文本嵌入模型,输入文本后输出一维嵌入向量,常用于聚类等下游任务并配合向量数据库使用。该模型量化至 FP8 部署,由 Nvidia 最新 GPU(如 H100、H100_40GB 或 L4)支持,量化可选但能带来更高效率。
Every 复盘内部部署 Plus One(OpenClaw 托管版)的经验:每位员工一个 AI 智能体的初始设想被证明是错误起点,智能体常拒绝执行任务、需持续维护,仅部分场景如加速写作、管理 Proof 的 bug 报告有用。下一篇 Plus One 将改为类似共享团队资源的形态,有明确分工而非反映主人个性的个人宠物,详细方案将随付费订阅内容发布。
Qwen3 8B Embedding 是一个文本嵌入模型,输入文本后输出一维嵌入向量,常用于聚类等下游任务并配合向量数据库使用。该模型部署时量化为 FP8,需 Nvidia 较新 GPU 支持,如 H100、H100_40GB、B200 或 L4,量化可选但能提升效率。客户端代码可通过 pip 安装,也可使用 OpenAI embeddings 客户端。
Eugene Yan 撰文梳理机器学习代码与系统中常见的设计模式,主要参考 Gang of Four 设计模式一书。
Baseten 提供 Wan 2.2 T2V 文生视频 API,通过 POST 请求传入提示词即可生成视频,返回 base64 编码结果。支持 720x1280、1280x720、480x832、832x480、704x1280、1280x704、1024x704、704x1024 八种分辨率,可设置 sampling_steps、guide_scale 与 seed 参数。
NVIDIA Cosmos 3 Nano (8B) 世界基础模型现可通过 Baseten 在单张 H100 上部署,提供六种 omni 模式:text2image、text2video(默认模式)、image2video、forward/inverse dynamics 和 policy。
Eugene Yan 发文探讨数据与机器学习管道的测试为何频繁失效,并以行为日志到批量推理的示例管道演示单元、schema 和集成测试。
TypeSafe 发布新模型 Jev,可将自然语言问题直接输出为 0 到 1 的概率或自定义类别,供代码直接调用。它原生支持结构化输出,无需像 DSPy 那样额外引导 LLM,因此速度极快、成本极低,适合在后台为 AI 智能体做实时判定。其实际效果目前仍待验证。
Baseten 提供 NVIDIA Nemotron 3 Diarization 的三种预设方案,该模型支持最多 8 个说话人、可按请求配置延迟档位(0.32 秒到 30 秒 buffer),是 Streaming Sortformer v2.1 的后继,采用 OpenMDW 1.1 许可证允许商用。
Baseten 推出基于 Whisper Large V3 的优化实时转录管线,支持可配置的部分转录更新频率、高并发音频流下稳定的实时延迟,以及多语言转录的自动语言检测。
Whisper Large V3 Turbo 已在 Baseten 上线,面向实时笔记、内容字幕和客服等实时语音场景,支持部分转录更新频率可配置、高并发音频流下延迟稳定,以及多语言转录的自动语言检测。
当依赖团队不愿或无法帮忙时,Eugene Yan 建议先理解对方的约束与优先级,而非直接升级或写长篇 JIRA 工单。若对方接受代码贡献成本更高,可推动其建立 away team work 机制,如 office hours、自助文档和代码评审流程。也可将当前协作框定为投资:对方指导你这次改动,你未来可指导自己团队,减少后续支持成本。
Eugene Yan 基于多篇行业论文和技术博客,总结出构建内容审核与欺诈检测系统的五个模式:通过 human-in-the-loop 收集 ground truth、数据增强、级联模式拆分问题、结合监督与无监督学习、以及可解释性。
Canopy Labs 推出 Orpheus TTS(Orpheus v1),为其 Orpheus TTS 的继任模型,需以约 83 tokens/秒生成才能实现实时流式输出。该实现支持流式生成,在 H100 MIG GPU 上可支持 16 路并发实时流(可变流量)、24 路并发实时流(稳定流量),以及 128 路并发非实时生成以进行低成本批处理。
Baseten 发布 Orpheus 3B 的 WebSocket 接入示例:客户端先发送含 voice、max_tokens、buffer_size 的 JSON 元数据,再通过同一连接逐词流式发送文本,服务端返回原始音频字节。示例用 `__END__` 哨兵标记文本结束,音频以 24000 采样率、paInt16、单声道播放,代码基于 aiohttp 与 pyaudio。
Baseten 模型库现已提供 DeepSeek V4.1 Flash、GLM-5.3 Fast、GLM-5.3、GLM-5.3-Flash 和 Kimi K3 等热门模型,可部署在 API 端点后直接调用。
Eugene Yan 总结了将大语言模型集成到系统与产品中的七大实用模式:Evals、RAG、微调、缓存、Guardrails、防御性 UX 和收集用户反馈,按提升性能与降低成本/风险、靠近数据与靠近用户两个维度组织。
Eugene Yan 撰文讲解如何把 LLM 应用中的常见问题匹配到对应的解决模式。文章先区分外部与内部 LLM 的差异,再按问题逐一给出建议:用 evals 和用户反馈衡量性能,用 RAG 减少幻觉,用微调提升内部模型在特定任务的表现,用缓存应对延迟要求,用 guardrails 处理语法与语义错误,用防御式 UX 降低错误影响,并用监控追踪用户影响。
首届 AI Engineer Summit 上,Amplify Partners 对 AI Engineering 的调研显示,在 800 多份回复中,评测(evals)和推理服务成本被列为 LLM 部署的最大痛点。目前评测手段仍缺乏好方案,介于确定但脆弱的 assert 断言与昂贵随机的 3P LLM 打分之间,代码生成因可验证输出成为相对易评测的例外。RAG 短期不会消失,缓存降本则讨论寥寥。
机器学习代码与普通软件不同:软件是输入数据加人工逻辑得到输出,ML 则是用输入数据和期望输出学出逻辑,因此测试时往往需要加载真实模型做推理,而非 mock。作者建议用小型内联样本数据、在可行时用随机或空权重测试输出形状与设备迁移,并把损失下降、过拟合、模型服务启动等关键测试标记为 slow 按需运行,同时不必测试数据加载器、tokenizer、优化器等外部库。
Eugene Yan 整理 2024 年参加多个 ML 会议后的 39 条经验,涵盖机器学习系统构建、生产与规模化、执行协作、面向用户和参会演讲五方面。要点包括尽早投入奖励函数工程、扎实 evals 是差异化和护城河、从 demo 到产品 effort 巨大、每次 10 倍规模增长都会暴露新问题,并引用 Karpathy、Will Larson 等人的观点。
Eugene Yan 从 2019 Intel MacBook Pro 换到 M4 MacBook Pro,不恢复备份而是从头搭建环境,并发布了自己的极简 Mac 配置指南。
Eugene Yan 回顾 2024 年,将 2023 年的原型规模化落地为服务客户的 ML/LLM 生产系统,并发布 6 篇长文,其中与友人合写的《What We've Learned From a Year of Building with LLMs》还由 O'Reilly 出版成书。
Karpathy 从零用 JavaScript 实现 t-SNE 并以 tsnejs 发布在 GitHub,构建了按推文内容对 Twitter 前 500 大账号做二维聚类的 demo。流程包括用 Kimono 抓取账号列表、Tweepy 采集每人 200 条推文、TfidfVectorizer 生成 500 x 87,342 维语言指纹,再用 d3js 渲染结果,并另附词向量可视化 demo。
Cloudflare 发布全新 CLI 工具 cf(开放 beta,npm i -g cf),将命令覆盖从 Wrangler 的约 280 个操作扩展到超过 3000 个 API 操作,基于 Forge 从 OpenAPI schema 生成。
Cloudflare 用前沿 LLM 构建自适应 WAF 测试系统,在授权的客户预发环境针对 XSS、SQLi、CMDi、SSRF、LFI、Log4j 六类攻击运行 45 个场景,记录 1,107 次尝试,经人工分流确认 49 项相关发现,其中 48 项属于 CMDi 和 SSRF。
Cloudflare 介绍内部 AI 工具 CryptoLabe,用于发现代码库中的密码学使用并规划后量子(PQ)迁移,目标 2029 年实现全面 PQ 就绪。