PatchHolmes:通过列表式选择实现智能体补丁检索
PatchHolmes 用列表式选择让智能体一次性读取前 100 个候选 commit,再通过四个带预算的工具打开单个 commit,最终提交唯一答案,Recall@1 达 59.95%,高于逐点系统的 34.61% 和通用检索推理基线的 28.55%。
PatchHolmes 用列表式选择让智能体一次性读取前 100 个候选 commit,再通过四个带预算的工具打开单个 commit,最终提交唯一答案,Recall@1 达 59.95%,高于逐点系统的 34.61% 和通用检索推理基线的 28.55%。
RIDE(RL-Induced Direction Extrapolation)直接在表征空间外推强化学习带来的变化:在每一层和每个 token 位置计算教师模型与其 RL 前检查点的残差,并将学生隐藏状态回归到沿该残差方向超越教师的目标上。
作者 Sunny JayaRaju 发布开源命令行工具 ocprobe(v3.1.3,MIT 协议,可通过 Homebrew 安装),用于管理 OpenCode 模型目录:对比上游目录与白名单、探测变更模型、确认后才应用修改。
开发者发布 VS Code 扩展 Ghost Regex,用 Ctrl+Alt+R 打开面板,可将正则表达式渲染为带语义配色的 Railroad 图,并检测嵌套量词等 ReDoS 风险并给出修复建议。
作者为开源 LLM API 漂移预警项目 SEISMOGRAPH 发布第二份天气报告,并公布 2026-09-30 更新:mistral 腿停写的原因已查明为 API key 过期,换新 key 后恢复 STABLE。
微软在 GitHub 上线 amplifier-smart-tool-creator,一个帮助用户创建、验证和评估智能工具的 smart tool。该仓库目前仅给出这一句功能描述,未披露模型、参数或可用方式等细节。
我们正在开源我们最先进的上下文嵌入模型,它在 turbopuffer 的 context-bench 中表现最佳。
We built a new way to train contextual embedding models, which encode each chunk of a document with the whole document in view. pplx-embed-v2-context-9b-preview sets a new state of the art on ConTEB and @turbopuffer's new, privately held context-bench. https://www.perplexity.ai/hub/blog/contextual-embedding-beyond-the-gold-passage
xAI 宣布开源 Grok Build 的编码 Agent 与 TUI,源码已发布在 GitHub。
推荐理由:源码公开了 agent loop、工具、TUI 和扩展系统的实现细节,还支持本地编译和接自有推理服务。
Sarvam AI 与 AI4Bharat 合作发布开源权重模型 Sarvam-Translate,基于 Gemma3-4B-IT 微调,支持 22 种印度语言,其中 15 种支持结构化长文本翻译。
UC Berkeley 团队构建了一个全自动 AI 智能体,审计 FrontierCS、Terminal-Bench、WebArena 等 13 个常用 AI 基准,确认了 45 个无需真正解题即可刷高或拿满分的作弊方案,全部附可运行的 PoC,覆盖 16 种攻击类型。
推荐理由:作者用自动化智能体实测了 13 个常用 AI 基准,找到 45 个可验证的作弊方案,并给出可落地的防作弊设计建议。
USC、Prime Intellect 与 Nucleic Acid Observatory 联合发布 METAGENE-1,一个 7B 参数自回归 Transformer 宏基因组基础模型,在超过 1.5T 碱基对的废水 DNA/RNA 序列上预训练。该模型采用 512-token 上下文窗口,在病原体检测与宏基因组嵌入基准上达到 SOTA,并开源模型权重与论文。
Prime Intellect 推出 SYNTHETIC-1,基于 DeepSeek-R1 生成 140 万条覆盖数学、编程、软件工程、STEM 和合成代码理解的任务与验证器,目标是构建最大的开源验证推理数据集。
Prime Intellect 发布 SYNTHETIC-1,一个由全球算力贡献者协作生成、基于 DeepSeek-R1 的 200 万条推理轨迹开放数据集,覆盖数学、编码和科学任务,并用任务专属验证器确认正确性。
Prime Intellect 发布 PCCL(Prime Collective Communications Library),一个为跨全球分布式训练构建的容错集合通信库。
Prime Intellect 发布 SYNTHETIC-2,一个基于 DeepSeek-R1-0528 的开源推理数据集,配合全球分布的流水线并行推理运行,支持从消费级 GPU 到 NVIDIA 和 AMD 集群的异构算力贡献。
Prime Intellect 发布开源数据集 SYNTHETIC-2,包含 400 万条经过验证的推理轨迹,覆盖迄今最全面的复杂强化学习任务与验证器。数据由全球算力贡献者通过流水线并行分布式推理生成,3 天内共有 1,253 块 GPU 参与,涵盖 4090 到 H200。
Prime Intellect 开源了 renderers,一个让开发者完全控制 RL 与多轮推理对话格式的独立 Python 库。它把聊天模板变成可编程对象,支持消息渲染为 token id、解析补全结果、按来源消息归属 token 以做 loss masking,并可在不重新渲染模型采样历史的情况下扩展多轮 rollout,带来打包训练序列 3x 冗余节省。
Prime Intellect 发布系统化 reward hacking 研究,提出其本质是梯度动力学问题而非单纯的规格问题:在 Llama 3.2-1B-Instruct 上用 backdoor-ifeval 环境植入隐藏关键词奖励。
Prime Intellect 发布 prime-rl 0.6.0,可在 28 个 H200 节点上以最高 131k 序列长度、sub-5 分钟 step 时间和 256 rollouts 批大小训练 GLM-5 等万亿参数 MoE 模型执行 SWE 任务。
Prime Intellect 发布 verifiers 0.2.0 预览版,以 verifiers.v1 命名空间预览重写后的核心,将环境拆解为 taskset、harness 和 runtime 三部分,支持任意 taskset 搭配兼容 harness 运行。
Prime Intellect 发布 research-environments,为 23 个开源智能体任务集提供统一 taskset API,涵盖约 198,000 个软件工程任务、约 28,600 个终端任务和约 137,600 个搜索任务,总计约 365,000 个环境,配套约 135,000 个预构建任务镜像。
Prime Intellect 发布开源编码智能体 Prime Agent,围绕 Recursive Language Model(RLM)和 Continual Harness 两个抽象设计,通过持久 IPython 内核以程序化方式调用工具和子智能体,并支持对提示词、技能、记忆和子智能体进行 CRUD 式自改进。
推荐理由:官方介绍了 RLM 与 Continual Harness 两个抽象和公开的评测数据,读者可以据此评估这个开源智能体运行时的适用场景。
METR 公开 Example Task Suite,包含 31 个示例任务、覆盖 10 个任务族,另有 186 个任务的摘要信息,用于评测 AI 智能体的危险自主能力。
SGLang 团队推出 Mini-SGLang,一个仅 5k 行 Python 代码的轻量级 LLM 推理框架,源自 SGLang 项目,旨在降低现代推理系统的学习门槛并支持快速研究原型。
LMSYS SpecForge 团队与 Ant、Meituan、Nex-AGI、EigenAI 合作发布 SpecBundle Phase 1,为 Llama。
SGLang 宣布正式支持 DSpark 投机解码算法(PR sgl-project/sglang#30261),覆盖 Qwen3 等稠密模型和 DeepSeek-V4 等稀疏模型。
LMSYS SpecForge 团队发布 SpecForge v0.3.0,将目标模型推理与草稿模型训练解耦,统一支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并用 YAML 单一入口配置拓扑。
腾讯混元 AI Infra 与 SGLang 团队宣布,HPC-Ops 的 Attention、Router GEMM 和 MoE 算子已合入 SGLang 主分支。
LlamaIndex 发布 LiteParse 更新,通过对自维护 PDFium fork 做内存分配等优化,文本提取提速 20-25%,OCR 关闭下平均 2.8ms/page 提取文本、3.9ms/page 渲染 markdown。
Liquid AI 在 GitHub 上公开了基于 LFM 基础模型和 LEAP SDK 的示例、端到端教程与应用仓库,获 2.5k star。同批仓库还包括语音到语音模型 Liquid Audio、用于减少模型重复循环的偏好数据生成训练工具 Antidoom,以及 LFM 全流程定制仓库和 LeapSDK 的 Kotlin 示例应用。
Fireworks AI 用 CyberGym 测评 DeepSeek V4 Pro 0813、Kimi K3、GPT-5.5 和 Claude Opus 4.8,V4 Pro 在 840 个对抗性安全任务中零拒绝、全部产生原生工具调用,进入验证率 97.3%。
Trail of Bits 发布 gosentry,一个面向 fuzzing 的 Go 工具链 fork,让 go test -fuzz 默认使用 LibAFL,同时保留 testing.F 工作流和现有 harness API。
Google 发布开源 C++ 库 Credentio,用于本地验证 C2PA Content Credentials,起步支持规范版本 2.2 和 2.4。
作者发布开源 Rust 工具库 TeaQL Tool,将 52 个常用工具封装在统一的 T::xxx() 门面之后,覆盖 ID、时间、JSON、哈希、HTTP 等操作,底层复用 uuid、chrono、serde_、reqwest 等成熟 crate。
Preferred Networks 发布基于 Rust 的 Optuna 实现 Rustuna,并同步推出 Optuna v5.0。内部基准显示 Rustuna 速度最高可达 Optuna 的 1,000 倍,Matlantis CSP 的替换测试中 10 万次 trial 的内存消耗降低约 50%。
Preferred Networks(PFN)从零自研的日本大语言模型 PLaMo,主打日语理解与生成能力,旗舰版 PLaMo Prime 以紧凑模型规模提供世界级日语性能,可通过云端 PLaMo API(付费)和 PLaMo Chat 使用,并借 Amazon Bedrock Marketplace 支持本地部署。
Sarvam AI 发布印度语言 ASR 评估实践指南,指出 WER/CER 等为英语设计的指标在口语变体、code-mixing、数字多写法等六类场景下会把正确转写误判为错误。
Berkeley RDI 于 2026 年 9 月推出 CUA-Lite,一个开发 computer-use agent 的开源平台,围绕 Lite.Gym 统一环境接口、Lite.Sample 统一监督数据格式和每模型一个、跨 eval/SFT/RL 共用的 harness 三大抽象构建。
推荐理由:平台由 Berkeley RDI 官方发布,给出三大抽象和已接入的基准、数据规模,读者可据此评估是否用于 CUA 开发。
Microsoft AI 发布 run-assert-eval,这是一个开源技能,用于发现给定 Agent 的关键风险、测量其失败频率。它会根据评估结果直接生成运行时策略,并复跑 eval 以验证修复是否生效。