跳到正文

#开源/仓库

今日 8 条
今天10月1日周四
  1. Aravind Srinivas48

    我们正在开源我们最先进的上下文嵌入模型,它在 turbopuffer 的 context-bench 中表现最佳。

    引用Perplexity@perplexity_ai

    We built a new way to train contextual embedding models, which encode each chunk of a document with the whole document in view. pplx-embed-v2-context-9b-preview sets a new state of the art on ConTEB and @turbopuffer's new, privately held context-bench. https://www.perplexity.ai/hub/blog/contextual-embedding-beyond-the-gold-passage

9月30日周三
  1. Berkeley RDI:Blog(AI 安全与评测)76

    UC Berkeley 用 AI 智能体审计 13 个 AI 基准,发现 45 个满分作弊方案

    UC Berkeley 团队构建了一个全自动 AI 智能体,审计 FrontierCS、Terminal-Bench、WebArena 等 13 个常用 AI 基准,确认了 45 个无需真正解题即可刷高或拿满分的作弊方案,全部附可运行的 PoC,覆盖 16 种攻击类型。

    推荐理由:作者用自动化智能体实测了 13 个常用 AI 基准,找到 45 个可验证的作弊方案,并给出可落地的防作弊设计建议。

  2. Prime Intellect(网页)46

    Prime Intellect 开源 renderers:面向智能体 RL 的 Token 级模板库

    Prime Intellect 开源了 renderers,一个让开发者完全控制 RL 与多轮推理对话格式的独立 Python 库。它把聊天模板变成可编程对象,支持消息渲染为 token id、解析补全结果、按来源消息归属 token 以做 loss masking,并可在不重新渲染模型采样历史的情况下扩展多轮 rollout,带来打包训练序列 3x 冗余节省。

  3. Prime Intellect(网页)76

    Prime Intellect 发布开源自改进编码智能体 Prime Agent

    Prime Intellect 发布开源编码智能体 Prime Agent,围绕 Recursive Language Model(RLM)和 Continual Harness 两个抽象设计,通过持久 IPython 内核以程序化方式调用工具和子智能体,并支持对提示词、技能、记忆和子智能体进行 CRUD 式自改进。

    推荐理由:官方介绍了 RLM 与 Continual Harness 两个抽象和公开的评测数据,读者可以据此评估这个开源智能体运行时的适用场景。

  4. Liquid AI 模型与工程博客(网页)36

    Liquid AI 开源 LFM 与 LEAP SDK 示例、教程及配套工具仓库

    Liquid AI 在 GitHub 上公开了基于 LFM 基础模型和 LEAP SDK 的示例、端到端教程与应用仓库,获 2.5k star。同批仓库还包括语音到语音模型 Liquid Audio、用于减少模型重复循环的偏好数据生成训练工具 Antidoom,以及 LFM 全流程定制仓库和 LeapSDK 的 Kotlin 示例应用。

  5. Berkeley RDI:Blog(AI 安全与评测)66

    Berkeley RDI 发布 CUA-Lite:面向 computer-use agent 的开源平台

    Berkeley RDI 于 2026 年 9 月推出 CUA-Lite,一个开发 computer-use agent 的开源平台,围绕 Lite.Gym 统一环境接口、Lite.Sample 统一监督数据格式和每模型一个、跨 eval/SFT/RL 共用的 harness 三大抽象构建。

    推荐理由:平台由 Berkeley RDI 官方发布,给出三大抽象和已接入的基准、数据规模,读者可据此评估是否用于 CUA 开发。