Sebastian Raschka 从零构建 AI 文本检测器教程
Sebastian Raschka 撰写教程,从零构建一个类似 Substack 内置 AI 检测功能的 AI 文本检测器,方法参考 Pangram 模型,通过微调 DistilBERT 分类器输出 0-100 的 AI 生成概率分。
Sebastian Raschka 撰写教程,从零构建一个类似 Substack 内置 AI 检测功能的 AI 文本检测器,方法参考 Pangram 模型,通过微调 DistilBERT 分类器输出 0-100 的 AI 生成概率分。
Hugging Face 博客与 AWS Strands Robots 团队演示了在单个 Agent 中跑通机器人数据闭环:录制演示同步到 Storage Bucket,通过 Xet 内容定义分块实现字节级去重上传,再用 stream_dataset() 直接从 Hub 流式读取训练,无需先下载整个数据集。
Sierra 提出在基于目标与护栏构建的智能体上沿用纵深防御原则,让每条客户消息在回复前经过内容、规则与政策、Supervisor 模型、确定性护栏等多层检查,单条消息可触发多达六项校验。Sierra 还通过第三方对抗评估与红队测试、平台级 Threat Detection 与单智能体 Agent Monitors 持续监控,并用 Simulations 在上线前压测护栏回归。
蚂蚁 inclusionAI 在 GitHub 上线 ling-cookbook 仓库,为 Ling 模型系列提供指南、文档与实用技巧。该仓库定位是帮助用户充分发挥 Ling 模型系列的能力,目前仅公布了仓库用途,未披露具体模型版本或功能细节。
Nathan Lambert 宣布其 post-training 教材《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》由 Manning 出版,Manning 和 Amazon US 已开售,Amazon UK 十月发售。
vLLM 详解 Decode Context Parallelism(DCP):将 KV cache 沿序列维度切分到各 GPU,而非像 TP 那样按注意力头切分,从而突破 GQA 和 MLA 模型下 KV cache 复制导致的内存瓶颈。
安全研究者 Johann Rehberger 发布 LLM Heist 攻击链研究,演示仅用 LiteLLM 的 /model/update 等合法管理功能,将 api_base 指向攻击者网关并开启 use_litellm_proxy,即可重路由全部 LLM 流量、捕获后端 provider 密钥、监控对话并注入伪造响应与工具调用。
Together AI 发布 Kimi K3 开发者指南。Kimi K3 是 Moonshot AI 的 2.8 万亿参数开源权重模型,支持 1M 上下文、KDA 与 AttnRes 架构,API 兼容 OpenAI,定价为缓存命中输入每 1M token $0.30、未命中 $3.00、输出 $15.00。
推荐理由:Together AI 官方上手指南,覆盖 Kimi K3 的架构要点、推理与缓存等 API 细节和定价,便于开发者直接接入生产。
安全研究员披露 PipeWire 的 PulseAudio 兼容层漏洞 CVE-2026-5674(CVSS 8.8),仅拥有音频权限的 Flatpak 应用即可逃逸沙箱并以用户身份执行任意代码。
vLLM 联合 PyTorch、oneDNN 和 KleidiAI 社区完成 Arm CPU 服务栈的上游优化,新增预构建 wheel 与 Docker 镜像、chunked prefill、前缀缓存、INT8 W8A8/W4A8 推理,并支持 GPT-OSS、Whisper 和 Qwen 3.5/3.6。
Ethan Mollick 在其定期更新的 AI 使用指南中提出,用 AI 做事已从聊天转向 agent 系统,做正经工作首选 ChatGPT 或 Claude,每月 $20 起。
推荐理由:作者基于自己的实际使用给出选型建议和权限管理提醒,读者可据此判断当前 agent 工具的分工与取舍。
DaoCloud 团队在 3 台 8 卡 B300 服务器(共 24 GPU)上以 4 Prefill + 1 Decode 分离拓扑部署 GLM-5.2-NVFP4,在 mean TTFT ≤ 2.5s、mean TPOT ≤ 20ms 的 SLA 下,将 16K 输入的 mean TPOT 从约 40ms 优化到约 17ms。
Sierra 工程师 Mihai Parparita 发布长文,复盘公司内部 MCP Gateway 的构建过程,该网关基于 Model Context Protocol 将 AI 智能体安全接入内部工具。
推荐理由:作者以第一手复盘提炼七条工程经验,覆盖权限设计、Agent 校验与身份管理,方法对自建 Agent 基础设施可直接借鉴。
Hugging Face 发布 AIFS-single-2.0 的补丁与教程,支持通过 Hugging Face jobs 或本地环境在各类 GPU 上运行该模型。仓库名为 huggingface/AIFS-single-2.0-on-all-GPUs,内容为运行补丁与操作教程。
Modem 发布《Writing Code for Agents》系列第一篇,解释 Claude Code、Codex 等编码智能体主要靠 ripgrep 文本搜索导航代码库,并给出命名、类型、注释位置等可发现的写码建议。
Sebastian Raschka 撰文讲解推理模型如何支持多档推理力度(reasoning effort)设置。
vLLM 团队介绍其如何在高合并节奏下保持发布稳定:2026 年 6 月共合并 1,918 个 commit(日均 64 个),CI 包含 37 个测试组、266 个任务,使用共享容器镜像和 pip-compile 锁定依赖,并依赖 58 个 runner 队列的异构硬件。
IBM Research 分享在智能体系统中构建模型路由的经验,认为路由不应被当作分类问题而是系统优化问题。在 AppWorld Test Challenge 上用 CodeAct 智能体实测 417 个任务,Claude Sonnet 4.6 总成本 $79($0.19/任务),反而低于单价更低的 GPT-4.1 的 $155($0.37/任务),差异源于缓存命中。
推荐理由:作者基于 AppWorld 实测给出路由成本、难度与延迟被低估的三点原因,并分享了可迁移的优化思路。
vLLM 与 AMD Quark 团队展示了在 AMD Instinct MI355X GPU 上训练和部署 EAGLE3 投机解码的完整流程,覆盖 Kimi-K2.5 与 MiniMax-M2.5,并用 InferenceX 做基准测试。
Hugging Face 发布 Profiling in PyTorch 系列第三篇,用 profiler trace 对比手写注意力、in-place 掩码、SDPA math/efficient/flash/cuDNN 各后端的 kernel 表现。
推荐理由:原文用 profiler trace 逐一对比 PyTorch 各注意力实现的 kernel 差异,读者可以学到一套先猜测再看 trace 的可迁移分析方法。
PRX 系列第 4 篇披露其数据策略:预训练数据由公开与内部数据集混合而成,用 VLM 重新生成图像长描述,再转为可流式读取的语料。团队改用 Qwen3-VL 在训练中实时计算文本 latent,实测吞吐仅损失约 3–4%(30 天训练多约 1 天),并采用 Lance 构建、MDS 流式的双格式流程,图像统一以 JPEG quality 92 编码。
vLLM-Omni 将 Qwen3-Omni 拆成 Thinker、Talker、Code2Wav 三阶段流水线,并通过 OpenAI 兼容的 /v1/chat/completions 提供文本与语音生成。
Sebastian Raschka 发布长篇教程,讲解如何用 Ollama 服务 Qwen3.6 35B-A3B 等开源权重模型,并接入 Qwen Code、Codex、Claude Code 三种编码 agent harness,评测代码在 https://github.com/rasbt/local-coding-agent-evals。
Lilian Weng 撰文梳理 Scaling Laws 的经验基础,指出训练损失 L 随模型规模 N、数据量 D 和算力 C 按幂律下降,在对数坐标上呈直线,核心是在 N 与 D 之间最优分配算力,常用近似为 C ≈ 6ND。
vLLM-Omni 已支持 Qwen3-TTS、VoxCPM2、Fish Speech S2 Pro 和 Higgs Audio V3 等 TTS 系统,并针对各模型瓶颈采用不同优化策略。
vLLM 联合 Red Hat 和 Andrew Ng 的 DeepLearning.AI 推出课程《Fast & Efficient LLM Inference with vLLM》,现已免费上线,时长约 1.5 小时,含 9 节视频和 3 个 JupyterLab 动手实验。
Intel 的 AutoRound 训练后量化算法已完整集成进 vLLM-Omni,支持 W4A16 量化并实现"一次量化、直接部署"流程。Qwen3-Omni-30B-A3B 的 checkpoint 从 66 GB 降至 25 GB,体积减少最多 62%,其 W4A16 版本在 OmniBench 上得分略优于 BF16 参考,文生图质量漂移仅约 1.3%。
Together AI 详细解析其为 MiniMax M3 做的生产级推理优化,M3 支持 1M token 上下文窗口、原生多模态和 MiniMax Sparse Attention(MSA)架构,MSA 使 prefill 提速超过 9x、decode 提速超过 15x。
小米 MiMo-V2.5 与 MiMo-V2.5-Pro 基于 Hybrid SWA 架构,将 KVCache 存储压缩至 Full Attention 的约 1/7。
Together AI 通过 TensorRT 多 profile 编译、GPU 端条件分支和减少 CPU 拷贝,打造出全球最快的语音转文字技术栈。
Sierra 工程师 Stephen Burgess 复盘用 AI 编码智能体在不到四个月内基本独自完成 Agent Studio 本地化,而他在 Slack 参与的同类项目曾需 10 人团队耗时 9 到 12 个月支持 4 个语言。
推荐理由:作者亲历两轮本地化项目,复盘单人用 AI 完成团队级工作的流程设计与坑,包含可直接迁移的工作流经验。
Dwarkesh Patel 发布与 MatX CEO Reiner Pope 的黑板讲座,从逻辑门出发逐层讲解 AI 芯片如何工作,直至解释 GPU、TPU、FPGA 和人脑各自的设计形态。
Sierra 构建了一套动态路由多家供应商的转录平台,通过并行查询多个转录模型并融合输出,内部基准显示可将话语错误率平均降低约 25%,在转录提升空间更大的语言中最高降低 37%。该平台还支持 70 多种语言,并将对话上下文注入转录过程,使金融服务智能体的输入验证率提升超 25%,整体解决率最高提升 1%、重大转录错误最多减少 15%。
Sebastian Raschka 梳理 2026 年 4 至 5 月主要开源权重 LLM 的架构变化,核心主题是长上下文效率。
Together AI 发文解析 DeepSeek-V4 的服务化挑战,认为其核心变化是在 token 轴压缩 KV cache 的混合注意力设计(CSA、HCA、SWA),使模型支持 1M token 上下文窗口。
推荐理由:原文基于 Together 在 HGX B200 上的实际 bring-up,给出 KV cache 布局和缓存策略如何决定 DeepSeek-V4 长上下文吞吐的具体经验。
开发者用 CLI 智能体 Goose 配合 Together 的 dedicated containers 技能,仅凭一句提示词就为 Netflix 新发布的 void-model 生成了可在 Together Dedicated Container Inference(DCI)上运行的完整容器配置,把从模型发布到实际部署的滞后压缩到近乎为零。
Sierra 提出"上下文工程"是构建复杂 AI 智能体的核心,通过渐进式披露只向模型提供当下最相关的信息,避免上下文窗口内无关 token 稀释注意力。