蚂蚁 inclusionAI 的 vLLM:面向 LLM 的高吞吐、低内存推理与服务引擎
蚂蚁 inclusionAI 在 GitHub 新建仓库 inclusionAI/vllm,定位为面向 LLM 的高吞吐、内存高效推理与服务引擎。该仓库目前仅给出这一句项目描述,未披露具体模型支持、性能数据或版本信息。
蚂蚁 inclusionAI 在 GitHub 新建仓库 inclusionAI/vllm,定位为面向 LLM 的高吞吐、内存高效推理与服务引擎。该仓库目前仅给出这一句项目描述,未披露具体模型支持、性能数据或版本信息。
蚂蚁 inclusionAI 在 GitHub 新建 sglang 仓库,定位为面向大语言模型和多模态模型的高性能服务框架。该仓库目前仅给出这一定位描述,未披露具体版本号、性能数据或开源许可等细节。
Hugging Face 发布 LeRobot v0.6.0,引入 VLA-JEPA、FastWAM、LingBot-VA 等世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等 VLA,以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:发布方系统列出世界模型策略、奖励模型 API、新基准与部署 CLI 等更新,读者可以据此评估机器人学习工作流的变化。
蚂蚁 inclusionAI 在 GitHub 上线新仓库 Avernet,定位为分布式智能体协调平台,让智能体在其中共同生存、连接、协调、执行与演化。该平台目前以开源仓库形式发布,具体功能细节与可用性尚未在仓库描述中展开。
Nous Research 在 GitHub 新建仓库 harbor-fork,定位为评估和改进 AI 智能体的框架。该仓库目前仅给出这一句功能描述,未披露具体模型、参数规模或评测基准信息。
蚂蚁 inclusionAI 在 GitHub 开源 Universal-Manipulation-Exoskeleton 项目,通过实时力矩反馈学习柔顺的全身操作策略。该仓库聚焦全身策略学习与力反馈控制,具体模型规模、benchmark 与可用性细节尚未在标题与摘要信息中披露。
Nous Research 在 GitHub 开源 speculators,一个用于构建、评估和存储 LLM 推理投机解码算法的统一库,面向 vLLM。该库将投机解码算法的开发、评测与存储整合到同一套工具中。
小米 MiMo 在 GitHub 上线新仓库 MiMo-Code,定位为模型与智能体协同进化。仓库标题为“MiMo Code: Where Models and Agents Co-Evolve”,目前公开信息仅包含仓库名称与这一主题表述。
蚂蚁 inclusionAI 在 GitHub 开源 AReno,一个易用且快速的工具包,用于在单节点上扩展强化学习后训练。该工具定位为轻量级 RL post-training 方案,具体性能数据与支持模型尚未在仓库说明中披露。
vLLM 社区发布开源 RL 后训练框架 vime(Apache 2.0),基于 slime 的训练栈和数据生成设计,将 Megatron 训练与 vLLM 推理接入同一条解耦管线。
Google Research 将驱动 Flood Hub 的水文模型框架在 GitHub 以 Apache 2.0 许可证开源,供各国气象水文部门训练 AI 洪水预报模型。
Nous Research 在 GitHub 上线 Automodel,这是一个基于 PyTorch 原生分布式、面向 LLM 与 VLM 的训练库,开箱即支持 Hugging Face。
Nous Research 在 GitHub 新建 Megatron-LM 仓库,用于持续开展大规模 Transformer 模型训练研究。该仓库定位为规模化训练 Transformer 的持续性研究项目,目前公开信息仅包含这一句描述,未披露模型规模、参数或具体训练细节。
Nous Research 推出 Megatron-Bridge,一个面向 Megatron 系列模型的训练库,支持与 Hugging Face 的双向转换。该库同时提供模型训练能力与 Hugging Face 格式互转功能。
Nous Research 在 GitHub 上线 hermes-compression-eval,一个面向 hermes-agent 的 ContextCompressor 的离线探针式评测工具。其方法论改编自 Factory 于 2025 年 12 月发布的《Evaluating Compression》。
Together AI 发布完全开源的视频翻译工具 Violin,基于 Together API 提供 Web 应用、CLI 和 Agent Skill 三种形态,代码以 MIT 协议开源。
NousResearch 在 GitHub 发布 agent-governance-toolkit 开源仓库,面向自主 AI 智能体提供策略执行、零信任身份、执行沙箱和可靠性工程能力。仓库说明覆盖 10/10 OWASP Agentic Top 10。
Sierra 开源 μ-Bench,包含五种语言 locale、五家 provider、来自 250 段真实 8 kHz 电话录音的 4,270 条人工标注语料。
蚂蚁 inclusionAI 在 GitHub 开源 cuLA,提供多种线性注意力变体的 CUDA 内核,使用 CuTe DSL 与 CUTLASS C++ 编写。该仓库目前仅披露技术栈,未公布支持的模型、性能数据或开源许可等细节。
Together AI 开源 Aurora,一个基于 RL 的推测解码框架,可从实时推理轨迹中持续学习并异步更新 draft 模型,在 Qwen3 和 Llama3 等模型上比静态 speculator 额外提速 1.25 倍。
Together AI 在首届 AI Native Conf 上发布七项研究与产品成果,覆盖 Kernels、强化学习与算法推理优化三个方向。
OpenAI 开源 ChatKit advanced samples 仓库,收集多个场景驱动的 ChatKit 示例,每个示例由 FastAPI 后端与 Vite + React 前端组成,用 ChatKit Python SDK 实现自定义后端并接入 ChatKit.js。
OpenAI 在 GitHub 发布 openai-apps-sdk-examples 仓库,展示可与 Apps SDK 配合使用的示例 UI 组件,以及把组件作为工具暴露的多个 MCP 服务器,包括 Pizzaz、3D 太阳系、购物车和带 OAuth 认证的示例。
Answer.AI 开源 cachy 包,通过修改 httpx 的 send 方法把 LLM 响应缓存到本地文件,无需手写 mock。测试运行从 2 分钟缩短到约 2 秒,并让 CI/CD 测试和 notebook diff 更干净。
推荐理由:开源工具 cachy 通过拦截 httpx 缓存 LLM 响应,测试从 2 分钟降到约 2 秒,方法可直接迁移到自己的项目。
上海人工智能实验室 InternLM 项目发布 AdaptiveGEMM,一种可适配不同 Group M 长度的 FP8 GEMM 实现。该工作针对分组矩阵乘法中 Group M 长度多变的情况做自适应处理,属于底层算子层面的优化。
上海人工智能实验室 InternLM 项目发布 GroupedGEMM,为 CUTLASS 和 CUBLAS 的分组 GEMM、Permute 与 Unpermute 提供 PyTorch 绑定。该库面向 MoE 等场景中的分组矩阵计算,可直接在 PyTorch 中调用上述算子。
OpenAI 发布 openai-testing-agent-demo 仓库,演示如何用 CUA 模型和 computer use 工具自动化前端测试。项目包含 frontend、cua-server、sample-test-app 三个应用,通过 Playwright 启动浏览器执行测试用例,MIT 协议开源,官方提醒 computer use 仍处预览阶段,不建议在认证环境或高风险任务中信任。
上海人工智能实验室 InternLM 项目发布 POLAR,一种通过策略判别学习(Policy Discriminative Learning)训练的奖励模型,具备预训练、可扩展、高性能特性。该方法将奖励建模转化为区分不同策略的判别任务,以支撑大规模强化学习训练。