Eugene Yan 的极简 MacBook Pro 配置指南:从 M4 新机设置到开发与效率工具
Eugene Yan 从 2019 Intel MacBook Pro 换到 M4 MacBook Pro,不恢复备份而是从头搭建环境,并发布了自己的极简 Mac 配置指南。
Eugene Yan 从 2019 Intel MacBook Pro 换到 M4 MacBook Pro,不恢复备份而是从头搭建环境,并发布了自己的极简 Mac 配置指南。
Eugene Yan 总结 Latent Space Paper Club 连续 18 个月、至少 80 篇论文的每周读书会经验,内容覆盖 Attention、LoRA/QLoRA、Transformer 系列、RLHF、推理加速与 RAG 等主题。
Eugene Yan 发布 AI Reading Club(AiReadingClub.com)的构建复盘,核心是 AI 阅读伴侣 Dewey,支持理解所选上下文、答疑、生成测验、回顾全书进度、书内查找和回看历史讨论。
工业搜索与推荐系统正引入 LLM 与多模态架构来缓解冷启动和长尾问题。YouTube 用 RQ-VAE 将 VideoBERT 内容嵌入压缩为 Semantic IDs。
Eugene Yan 发布 FAQ 汇总其写作流程的常见问题,包括如何起步、为何写作、为谁写作、如何选题、选平台、写作流水线、更新频率与克服完美主义。他因多位资深数据科学家指出沟通能力才是高效数据科学家的关键差异,而开始坚持写作,并称写作帮助自己强化学习、理清思路、结识同行并加速职业成长。
Eugene Yan 指出,指望再加一个工具、指标或 LLM-as-Judge 来解决产品问题,只会绕开核心难题、回避真正的工作。产品评估不是静态产物或速效药,而是把科学方法、评估驱动开发(EDD)和 AI 输出监控落到实处的实践:从观察数据、标注成败样本(理想为 50:50 的通过/失败分布)开始,再提出假设、设计实验、量化结果并迭代。
Eugene Yan 发布 news-agents 项目,基于 Amazon Q CLI 和 MCP 生成每日新闻摘要。主智能体将 Hacker News、WSJ、TechCrunch、AI News、Wired 六个 RSS 源分成三组,在独立 tmux 窗格中生成三个子智能体并行处理并分类汇总,最终合并为 main-summary.md。
Karpathy 从零用 JavaScript 实现 t-SNE 并以 tsnejs 发布在 GitHub,构建了按推文内容对 Twitter 前 500 大账号做二维聚类的 demo。流程包括用 Kimono 抓取账号列表、Tweepy 采集每人 200 条推文、TfidfVectorizer 生成 500 x 87,342 维语言指纹,再用 d3js 渲染结果,并另附词向量可视化 demo。
Karpathy 通过实验说明,用不可察觉的扰动即可让模型把图像分类为任意类别,这一缺陷并非深度学习独有,而是源于线性函数。
Andrej Karpathy 发文讲解 RNN/LSTM 的原理与应用,并同步在 Github 发布基于多层 LSTM 的字符级语言模型代码 char-rnn(MIT 协议)。
Andrej Karpathy 抓取约 500 万张带 #selfie 标签的图片并筛选出 200 万张含人脸的自拍,按点赞数与粉丝数归一化后标注好坏,用 Caffe 微调 ImageNet 预训练的 VGGNet,模型达 60% 验证准确率。
Andrej Karpathy 发布长文讲解强化学习,用 130 行 Python 仅依赖 numpy 的脚本,以 Policy Gradients 从原始像素训练出能在 ATARI Pong 中略胜内置 AI 的 2 层策略网络,约 8000 个 episode、20 万局游戏、800 次参数更新。
Anthropic 提出 Contextual Retrieval 方法,在嵌入前为每个文本块前置上下文说明,结合 Contextual Embeddings 与 Contextual BM25 将 top-20 检索失败率降低 49%(5.7%→2.9%),叠加 reranking 后降低 67%(5.7%→1.9%)。
Anthropic 基于与数十个团队合作的经验发布构建高效 Agent 的工程指南,主张用简单、可组合的模式而非复杂框架,并区分了工作流与 Agent 两类系统。文章给出增强 LLM 这一基础构件,以及提示链、路由、并行化、编排者-工作者、评估者-优化者五种工作流模式,并建议仅在简单方案失效时增加复杂度;附录还讲解了工具提示词工程与 Agent-计算机接口(ACI)设计实践。
推荐理由:Anthropic 基于大量客户实践总结了构建智能体的可组合模式与工具设计方法,开发者可直接对照自己的场景选用。
Anthropic 的升级版 Claude 3.5 Sonnet 在 SWE-bench Verified 上取得 49%,超过此前 SOTA 的 45%,模型本身未变而成绩来自围绕模型的 agent 脚手架。
Anthropic 发布工程指南,介绍给 Claude 增加 "think" 工具的方法,让模型在长链工具调用和策略密集场景中停下来做结构化思考。在 τ-bench 航空域,think 工具加优化提示词的 pass^1 达 0.570,比基线 0.370 相对提升 54%;零售域仅加工具即达 0.812(基线 0.783)。
Anthropic 发布 Claude Code 智能体编码最佳实践指南,指出上下文窗口是最需要管理的资源,性能会随上下文填满而下降。指南覆盖给 Claude 提供可运行的验证标准、先探索再规划再编码、编写精简 CLAUDE.md、配置权限与 hooks、用子代理隔离调查、用 /clear 和 /rewind 管理会话,以及并行会话、非交互模式和对抗式审查等规模化用法。
推荐理由:Anthropic 官方系统梳理 Claude Code 使用模式,围绕上下文管理与验证闭环给出可直接套用的实践方法。
Anthropic 工程团队发布长文,复盘 Claude Research 多智能体研究系统从原型到生产的构建过程。系统采用 orchestrator-worker 架构,内部评估中 Claude Opus 4 主导加 Claude Sonnet 4 子代理的组合比单代理 Claude Opus 4 高出 90.2%,但多智能体消耗约 15 倍于普通对话的 token。
Anthropic 发布工程文章,讲解如何为 MCP 和 LLM 智能体编写高效工具,包括构建原型、运行评测、用 Claude Code 自动分析转录并改进工具的流程。
Anthropic 应用 AI 团队发文阐述上下文工程,定义为在 LLM 推理过程中筛选和维护最优 token 集合的策略,将其视为提示工程的自然演进。文章指出所有模型都存在 context rot 现象,上下文应被当作边际收益递减的有限资源。
推荐理由:Anthropic 提出上下文工程是提示工程的演进,并给出压缩、结构化笔记、子智能体三种应对长任务的具体方法,可直接迁移到智能体开发。
Anthropic 发布 Agent Skills 工程解析,说明 Skills 是包含 SKILL.md 的目录,通过渐进式披露分三级加载指令、脚本和资源,可附 Python 脚本作为可执行工具。Skills 已支持 Claude.ai、Claude Code、Claude Agent SDK 和开发者平台,文末给出编写、评估与安全审计建议,并提示恶意 Skills 可能引入漏洞或数据外泄风险。
Anthropic 发布工程文章,提出让 Agent 通过代码执行方式与 MCP 服务器交互,以解决工具定义和中间结果占用过多上下文的问题。示例场景中 token 消耗从 150,000 降至 2,000,节省 98.7%。文章还介绍了渐进式工具发现、在执行环境中过滤数据、PII 令牌化保护隐私、状态持久化与可复用 Skills 等收益,并提示需要沙箱、资源限制等安全基础设施作为权衡。
Anthropic 工程博客介绍如何让 Claude Agent SDK 上的 Agent 在多个上下文窗口间持续取得进展。
Anthropic 工程博客发布长文,系统讲解如何为 AI Agent 构建可靠的自动化评测。文章定义了任务、试验、grader、transcript、评测框架等核心概念,对比代码型、模型型和人工三类评测器的优劣,分别给出编码、对话、研究和计算机使用四类 Agent 的评测方法,并解释 pass@k 与 pass^k 两种指标在非确定性下的差异。
Anthropic 性能优化团队负责人 Tristan Hume 复盘其招聘用 take-home 测试被 Claude 模型逐步击穿的过程:超 1000 名候选人完成过该模拟加速器优化测试,Claude Opus 4 在相同时间内超过多数人类申请者,Claude Opus 4.5 在 2 小时内追平最佳人类成绩。
推荐理由:作者以一手迭代经验说明模型如何逐步击穿技术面试题,并给出设计抗 AI 评测的具体做法与开源挑战。
TensorZero 团队发布开源方法,在每次 Git commit 时自动为 Cursor 的 LLM 推理计算反馈奖励。
TensorZero 研究发现,用 GPT-4.1 生成的高质量对话数据微调小模型,可在多种任务上实现相对 GPT-4.1 最高 30 倍的成本下降,同时性能持平或更优,响应速度最高提升 4 倍。
TensorZero 用三个真实任务(CoNLL++ 命名实体识别、terminal-bench 智能体编码、τ-bench retail 客服工具调用)对比 o4-mini 上的 RFT 与 GPT-4.1 mini 的 SFT。
TensorZero 推出基于 Track-and-Stop 最佳臂识别的多臂老虎机算法,在 LLM 网关中实现自适应 A/B 实验,动态调整采样比例并用 anytime-valid 的 GLRT 停止规则避免 p-hacking。
推荐理由:文章用仿真和真实 NER 实验数据说明自适应实验相比均匀采样能减少约 37% 的判定时间,并给出可直接复用的配置方法。
TensorZero 指出每百万 token 单价($/MTok)不能反映 LLM API 真实成本,因为各家 tokenizer 对相同输入产生不同 token 数。
推荐理由:原文用实测数据说明 token 计数差异会让实际成本偏离标价,读者可据此修正自己比较模型价格的方法。
TensorZero 发文指出,输出级相关性低的噪声 LLM 评估器在离线 Agent 选型中仍然可靠,因为单输出噪声会随样本量平均消去。
Suno 发布创作者指南,建议完善个人资料以提升音乐被发现和推荐的机会。资料需包含名称、头像、简介和至少一首已发布歌曲,才可被搜索并获得 Suno 推荐;还可添加最多 5 个曲风标签及 Spotify、TikTok、Instagram、SoundCloud 等外部链接。完整资料有助于将一次性听众转化为长期粉丝。
Suno 发布科普文章,解释压缩器如何通过降低音频最响部分并配合补偿增益提升整体电平,从而压缩动态范围。Suno Studio 的压缩器插件提供阈值、压缩比、启动与释放等参数,并配有实时动态曲线表。Studio 是浏览器端 DAW,已内置包括压缩在内的一整套音频效果,随 Suno Premier 订阅免费提供。
Suno Studio 发布 EQ 使用指南,给出三条入门技巧:混音以耳朵为准而非只看曲线;先衰减再提升,例如人声可在 400Hz 处先减 6dB 并用约 80Hz 高通滤除低频;EQ 尽量放在效果链首位。Suno Studio 自 2025 年上线起即支持每轨 EQ,最新版本中 EQ 已作为音频效果与压缩、混响、延迟并列,可手动添加、自制预设并跨轨道和项目复制分享。
Sarvam AI 发布印度语言 ASR 评估实践指南,指出 WER/CER 等为英语设计的指标在口语变体、code-mixing、数字多写法等六类场景下会把正确转写误判为错误。
Mixedbread 基于 Prime Intellect 的 prime-rl 训练出深度搜索智能体 Toast 1,搭配 GPT-5.6 Sol 在 OfficeQA Pro V2 上比 Claude Fable 5 高出近 10 个百分点,成本仅为其 27%。
Prime Intellect 推出 Prime Flash MoE,一组为 Blackwell 优化的 CUDA 内核,最高比 PyTorch grouped GEMM 快 2.4×,在 4k-128k token 区间约 2.3× 加速。
Prime Intellect 基于 NIXL 和 ModelExpress 重建了 prime-rl 的权重传输流程,把 GLM-5.2 的 RL 权重同步从 60-90 秒降至个位数秒,实测约 4 秒。
RadixArk SGLang 团队与 Ant Ling Infra 团队在 4 张 NVIDIA Blackwell GPU 上为混合线性注意力 MoE 模型 Ling-3.0-flash 优化 batch-1 解码,NEXTN/MTP 路径将单请求吞吐从 288 tok/s 提升至 606 tok/s,平均 TPOT 从 3.33 ms 降至 1.53 ms。
SGLang Diffusion 团队发布 MiniMax-H3 视频生成基准,在 8× NVIDIA H200(141 GB)、SGLang v0.5.18。