xAI 开源 Grok Build 编码 Agent 与 TUI
xAI 宣布开源 Grok Build 的编码 Agent 与 TUI,源码已发布在 GitHub。
推荐理由:源码公开了 agent loop、工具、TUI 和扩展系统的实现细节,还支持本地编译和接自有推理服务。
xAI 宣布开源 Grok Build 的编码 Agent 与 TUI,源码已发布在 GitHub。
推荐理由:源码公开了 agent loop、工具、TUI 和扩展系统的实现细节,还支持本地编译和接自有推理服务。
UC Berkeley 团队构建了一个全自动 AI 智能体,审计 FrontierCS、Terminal-Bench、WebArena 等 13 个常用 AI 基准,确认了 45 个无需真正解题即可刷高或拿满分的作弊方案,全部附可运行的 PoC,覆盖 16 种攻击类型。
推荐理由:作者用自动化智能体实测了 13 个常用 AI 基准,找到 45 个可验证的作弊方案,并给出可落地的防作弊设计建议。
METR 公开 Example Task Suite,包含 31 个示例任务、覆盖 10 个任务族,另有 186 个任务的摘要信息,用于评测 AI 智能体的危险自主能力。
SGLang 团队推出 Mini-SGLang,一个仅 5k 行 Python 代码的轻量级 LLM 推理框架,源自 SGLang 项目,旨在降低现代推理系统的学习门槛并支持快速研究原型。
LMSYS SpecForge 团队与 Ant、Meituan、Nex-AGI、EigenAI 合作发布 SpecBundle Phase 1,为 Llama。
SGLang 宣布正式支持 DSpark 投机解码算法(PR sgl-project/sglang#30261),覆盖 Qwen3 等稠密模型和 DeepSeek-V4 等稀疏模型。
LMSYS SpecForge 团队发布 SpecForge v0.3.0,将目标模型推理与草稿模型训练解耦,统一支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并用 YAML 单一入口配置拓扑。
腾讯混元 AI Infra 与 SGLang 团队宣布,HPC-Ops 的 Attention、Router GEMM 和 MoE 算子已合入 SGLang 主分支。
Liquid AI 在 GitHub 上公开了基于 LFM 基础模型和 LEAP SDK 的示例、端到端教程与应用仓库,获 2.5k star。同批仓库还包括语音到语音模型 Liquid Audio、用于减少模型重复循环的偏好数据生成训练工具 Antidoom,以及 LFM 全流程定制仓库和 LeapSDK 的 Kotlin 示例应用。
Fireworks AI 用 CyberGym 测评 DeepSeek V4 Pro 0813、Kimi K3、GPT-5.5 和 Claude Opus 4.8,V4 Pro 在 840 个对抗性安全任务中零拒绝、全部产生原生工具调用,进入验证率 97.3%。
Google 发布开源 C++ 库 Credentio,用于本地验证 C2PA Content Credentials,起步支持规范版本 2.2 和 2.4。
Preferred Networks 发布基于 Rust 的 Optuna 实现 Rustuna,并同步推出 Optuna v5.0。内部基准显示 Rustuna 速度最高可达 Optuna 的 1,000 倍,Matlantis CSP 的替换测试中 10 万次 trial 的内存消耗降低约 50%。
Preferred Networks(PFN)从零自研的日本大语言模型 PLaMo,主打日语理解与生成能力,旗舰版 PLaMo Prime 以紧凑模型规模提供世界级日语性能,可通过云端 PLaMo API(付费)和 PLaMo Chat 使用,并借 Amazon Bedrock Marketplace 支持本地部署。
Berkeley RDI 于 2026 年 9 月推出 CUA-Lite,一个开发 computer-use agent 的开源平台,围绕 Lite.Gym 统一环境接口、Lite.Sample 统一监督数据格式和每模型一个、跨 eval/SFT/RL 共用的 harness 三大抽象构建。
推荐理由:平台由 Berkeley RDI 官方发布,给出三大抽象和已接入的基准、数据规模,读者可据此评估是否用于 CUA 开发。
Microsoft AI 发布 run-assert-eval,这是一个开源技能,用于发现给定 Agent 的关键风险、测量其失败频率。它会根据评估结果直接生成运行时策略,并复跑 eval 以验证修复是否生效。
Today we’re announcing OpenClaw Enterprise In collaboration with @RedHat , @nvidia and @OpenAI the OpenClaw Foundation is open sourcing a powerful enterprise control plane for persistent agents OpenClaw Enterprise is built to run on your own infrastructure and will always be free for an organization to use https://openclaw.ai/blog/openclaw-enterprise
H 公司发布 Holo4 系列智能体模型,包含 27B 稠密版和 35B-A3B MoE 版,两者均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 格式开源在 Hugging Face。
推荐理由:Holo4 同时给出两种尺寸、跨 GUI 与 MCP 的统一接口和公开轨迹,读者可据此比较开源智能体与闭源前沿的成本差距。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并分诊崩溃。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可了解其分层设计与安全边界。
Hugging Face 为 transformers 加入 GGUF 模型支持,用户可从 Hub 选取 GGUF 检查点,通过 from_pretrained 传入 gguf_file 在本地生成。
推荐理由:Hugging Face 把 GGUF 量化模型接入 transformers,读者可据此判断本地推理工作流会如何变化。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型用学习式集成策略融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 的排序预测。
小米 MiMo 在 GitHub 新建仓库 verl,其 HybridFlow 是一个灵活高效的强化学习后训练框架。该仓库定位为 RL post-training 框架,强调灵活性与效率,目前原文未披露参数规模、benchmark 分数或开源许可等细节。
Hugging Face 发布 tokenizers v1,输出与 v0.23 完全一致的 token ID,但速度常达 v0.23 的数十倍。v1 将单个 crate 拆为 workspace,引入无分配合并、bitcannon SIMD 分片、侵入式双向链表合并循环、线程本地词缓存和原生多线程并行。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流(middle-mile)配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 开放。
Nous Research 在 GitHub 发布独立 Hermes 记忆提供方插件 hermes-plugin-holographic,采用全息记忆方案,基于本地 SQLite 事实存储,支持 FTS5 搜索、信任评分与 HRR 组合式检索。
Nous Research 在 GitHub 上线独立 Hermes 记忆提供方插件 hermes-plugin-hindsight,为 Hermes 提供长期记忆能力。该插件支持知识图谱、实体消解与多策略检索。
商汤介绍开源智能体办公技能套件 SenseNova Skills,将 Deep Research、数据分析、PPT 生成与信息图生成整合为一体化流程,可把原始数据处理成可编辑的 .pptx 文件。
Hugging Face 发布 Workflow1111,用 gr.Workflow 在单个画布上以 73 个节点重建了 AUTOMATIC1111 的 11 条媒体管线,涵盖文生图、hi-resolution fix、图生图、VLM 反推提示词、检测生成 inpaint 蒙版、ControlNet 风格 annotator、背景去除、PNG Info 和图生视频。
推荐理由:官方用 Gradio Workflow 在单个画布上复刻了 AUTOMATIC1111 的主要功能,读者可以对照它了解节点式工作流与 ComfyUI 的差异。
微软研究院联合华盛顿大学和 Providence 发布 GigaPath-Flash 与 GigaTIME-Flash,两者均以 Apache 2.0 许可在 Hugging Face 开放权重。
更多好消息:GLM-5.3 的权重将于明天发布。 https://huggingface.co/zai-org/GLM-5.3
Meta 发布 MetaRoCE,一个为 AI 工作负载在商品化以太网上从零设计的 RDMA 传输协议,将通过 OCP 开放规范、参考软件实现和合规测试套件。
蚂蚁 inclusionAI 在 GitHub 上线 ConceptEdit 项目,包含 ConceptEdit-12M 数据集与 ConceptEdit-Bench 基准。目前公开信息仅给出这两个名称,尚未披露模型规模、评测分数或使用方式等细节。
蚂蚁 inclusionAI 在 GitHub 上线 SingProbe 官方训练代码仓库。正文仅说明这是 SingProbe 的官方训练代码,未披露模型规模、训练数据或评测结果等细节。
Google DeepMind 在 Nature 发表 WeatherNext AI 模型研究,对气旋路径、强度和风结构的预报平均多出超过 24 小时提前量,相当于约十年的气象学进步。
推荐理由:官方介绍论文与开源模型的关键结果,读者可以据此评估其对气象预报和研究的可用性。
Together AI 发布 Kimi K3 开发者指南。Kimi K3 是 Moonshot AI 的 2.8 万亿参数开源权重模型,支持 1M 上下文、KDA 与 AttnRes 架构,API 兼容 OpenAI,定价为缓存命中输入每 1M token $0.30、未命中 $3.00、输出 $15.00。
推荐理由:Together AI 官方上手指南,覆盖 Kimi K3 的架构要点、推理与缓存等 API 细节和定价,便于开发者直接接入生产。
蚂蚁 inclusionAI 在 GitHub 发布 PanelWise,一个自托管的多模型深度研究系统,可将多个独立研究智能体的结果融合为有证据支撑的报告。
蚂蚁 inclusionAI 在 GitHub 新建仓库 buildkit-service,提供面向智能体基础设施的分布式镜像构建与包镜像服务。该仓库定位为 agentic infrastructure 的构建与镜像分发支撑组件,目前公开信息仅包含这一句功能描述。
Nous Research 在 GitHub 新建 hermes-e2e-evidence 仓库,用于存放 hermes-agent CI 发布的临时视觉证据。仓库说明称这些证据为 ephemeral(临时性)内容,由 hermes-agent 的 CI 流程自动发布。
上海人工智能实验室 InternLM 开源 archspace 项目,目标是把 LLM 架构探索转化为社区可复用的知识。该项目以“让架构探索成为可复用知识”为定位,面向 LLM 架构研究场景。
蚂蚁 inclusionAI 在 GitHub 发布新仓库 distill-fs,这是一个只读 FUSE 文件系统,可直接挂载原始磁盘镜像和 Nydus RAFS 镜像。该工具面向镜像内容的只读访问场景,目前仓库信息仅说明其支持的两类镜像格式。