Today, we are introducing Inkling. Inkling reasons efficiently across text, image, and audio modalities. We are making the full weights available. https://thinkingmachines.ai/news/introducing-inkling/ Available today for fine-tuning on Tinker. Play with it in the Inkling Playground. 🧵
全部AI 动态
全部动态
今日 46 条
Lilian Weng@lilianwengAI 评分7171引用Thinking Machines@thinkymachines
Mira Murati@miramurati精选AI 评分7272引用Thinking Machines@thinkymachinesToday, we are introducing Inkling. Inkling reasons efficiently across text, image, and audio modalities. We are making the full weights available. https://thinkingmachines.ai/news/introducing-inkling/ Available today for fine-tuning on Tinker. Play with it in the Inkling Playground. 🧵
推荐理由:Thinking Machines 发布首个模型 Inkling,开放全部权重并支持 Tinker 微调,可关注其跨模态推理的落地方式。
Thinking Machines@thinkymachines精选AI 评分6767推荐理由:原文给出多模态能力、开放权重和两个可用入口,读者可以据此了解获取和试用方式。
Together AI 研究与产品博客(RSS)精选AI 评分7777 Together AI 首日上线 Thinking Machines Lab 新模型 Inkling
Thinking Machines Lab 发布多模态 MoE 模型 Inkling,Together AI 在发布当天通过 Serverless 提供托管推理,支持 1M 上下文窗口和 OpenAI 兼容 API。
推荐理由:原文给出 Inkling 的架构细节、参数规模和初步评测数据,读者可以据此判断其推理与多模态能力是否适合接入。
Hugging Face:Blog(RSS)精选AI 评分8181 Thinking Machines 发布 1T 参数多模态开源模型 Inkling 及 Inkling-Small
Thinking Machines 在 Hugging Face 上发布开源多模态模型 Inkling,共 975B 总参数、41B 激活参数,支持 1M 上下文,原生接收图像、文本和音频输入,训练数据为 45 万亿 token,并同时发布 276B 总参数、12B 激活参数的 Inkling-Small。
推荐理由:文章给出了 Inkling 的架构细节、各档位 VRAM 需求和多条部署路径,便于读者评估在自己的硬件上运行哪种变体。
Mistral AI:News(网页)AI 评分4848 Mistral 推出 Robostral Navigate:8B 具身导航模型,单 RGB 摄像头达 76.6%
Mistral 发布首个具身导航模型 Robostral Navigate,8B 参数,仅靠单个普通 RGB 摄像头、无需 LiDAR 或深度传感器,在 R2R-CE validation unseen 上达到 76.6% 成功率,比最佳单摄像头方案高 9.7 分、比最佳多传感器方案高 4.5 分。
美团 LongCat:HuggingFace 新模型AI 评分7171 美团发布 LongCat-2.0:1.6T 总参数 MoE 模型,MIT 协议开源权重
美团发布 LongCat-2.0,总参数 1.6 万亿的 MoE 大语言模型,每 token 激活约 48B,权重以 MIT 协议开源。预训练覆盖超过 35 万亿 token,训练与部署全程基于 AI ASIC 超算集群;模型引入 LongCat Sparse Attention,并在 1M 上下文数据上训练,支持 GPU 与 NPU 部署。
美团 LongCat:HuggingFace 新模型AI 评分6767 美团发布 LongCat-2.0:1.6T 总参数 MoE 模型,权重采用 MIT License 开源
美团发布 LongCat-2.0,一个总参数 1.6 万亿、每 token 激活约 480 亿的 MoE 大语言模型,训练与部署完全基于 AI ASIC 超节点,预训练消耗超过 35 万亿 token。
美团 LongCat:HuggingFace 新模型AI 评分7070 美团发布 LongCat-2.0:1.6T 参数 MoE 模型,MIT 协议开源
美团 LongCat 团队发布 LongCat-2.0,总参数 1.6 万亿、每 token 激活约 480 亿的 MoE 大语言模型,权重以 MIT 协议开源。
Mistral AI:News(网页)AI 评分5959 Mistral AI 发布 Leanstral 1.5:6B 激活参数的形式化证明模型
Mistral AI 发布 Apache-2.0 协议的 Leanstral 1.5,总参数 119B、激活 6B,专注 Lean 4 形式化证明工程。
蚂蚁 inclusionAI:GitHub 新仓库AI 评分3939 蚂蚁 inclusionAI 发布 Universal-Manipulation-Exoskeleton:用实时力矩反馈学习柔顺全身策略
蚂蚁 inclusionAI 在 GitHub 开源 Universal-Manipulation-Exoskeleton 项目,通过实时力矩反馈学习柔顺的全身操作策略。该仓库聚焦全身策略学习与力反馈控制,具体模型规模、benchmark 与可用性细节尚未在标题与摘要信息中披露。
Google ResearchAI 评分5959 Google Research 发布表格数据零样本基础模型 TabFM
Google Research 发布面向表格数据分类与回归的零样本基础模型 TabFM,将表格预测框定为 ICL 问题,一次前向传播即可生成预测,无需手动训练、调参或特征工程。
通义 QwenAudio:原创语音项目AI 评分2020 QwenLM 发布 Qwen-RobotNav 官方仓库
QwenLM 上线 Qwen-RobotNav 官方仓库,定位为该项目官方 Repo。目前公开信息仅显示仓库归属 QwenLM 组织,具体模型能力、参数规模与可用形式尚未披露。
通义 QwenAudio:原创语音项目AI 评分2121 QwenLM 发布 Qwen-RobotManip 官方仓库
QwenLM 上线了 Qwen-RobotManip 的官方仓库,定位为机器人操作方向的官方代码库。目前公开信息仅显示该仓库为官方 Repo,未披露模型规模、benchmark 分数或开放形式等细节。
DeepSeek:GitHub 新仓库AI 评分3939 DeepSeek 开源 DeepSpec:投机解码训练与评测全栈代码库
DeepSeek 在 GitHub 发布 DeepSpec,一个用于训练和评测投机解码(speculative decoding)算法的全栈代码库。该仓库同时覆盖算法训练与效果评测两个环节,面向投机解码这一推理加速方向提供完整实现。
Midjourney:Updates(RSS)AI 评分5858 Midjourney 将默认模型从 V7 切换为 V8.1
Midjourney 宣布经过测试和反馈后,默认模型已从 V7 更新为 V8.1。V8.1 更聪明、更连贯,更好地遵循详细提示词并渲染文字;开启 HD 模式后图像尺寸为 V7 的两倍、分辨率 4 倍,SD 模式 4 秒、HD 模式 12 秒出图。风格参考、个性化与美学在 V7 与 V8.1 间保持一致;V7 的 omni-reference 仍可使用,V8.0 alpha 将在两周后弃用。
Google DeepMind:Blog(RSS)精选AI 评分7676 Google DeepMind 发布开源实验模型 DiffusionGemma,GPU 文本生成最高提速 4 倍
Google DeepMind 发布实验性开源模型 DiffusionGemma,基于文本扩散方法,在专用 GPU 上实现最高 4 倍的文本生成提速。该模型为 26B 总参数的 MoE,推理时仅激活 3.8B 参数,量化后可装入 18GB 显存,单张 NVIDIA H100 上超过 1000 tokens 每秒,RTX 5090 上超过 700 tokens 每秒。
推荐理由:官方给出具体吞吐数字、显存占用和质量取舍,读者可据此判断它适不适合本地交互式工作流。
小米 MiMo:GitHub 新仓库(模型发布)AI 评分3030 小米 MiMo 发布 MiMo-Code:模型与智能体协同进化
小米 MiMo 在 GitHub 上线新仓库 MiMo-Code,定位为模型与智能体协同进化。仓库标题为“MiMo Code: Where Models and Agents Co-Evolve”,目前公开信息仅包含仓库名称与这一主题表述。
Google DeepMind:Blog(RSS)精选AI 评分7777 Google DeepMind 发布 Gemma 4 12B:无编码器统一多模态模型,可在 16GB 内存笔记本本地运行
Google DeepMind 发布 Gemma 4 12B,定位于在笔记本上本地运行的智能体多模态模型,性能接近其 26B MoE 模型而内存占用不到一半。
推荐理由:官方介绍了无编码器统一架构和 16GB 内存本机运行等细节,适合关注端侧多模态部署的开发者参考。
蚂蚁 inclusionAI:GitHub 新仓库AI 评分3535 蚂蚁 inclusionAI 开源 AReno:单节点扩展 RL 后训练工具包
蚂蚁 inclusionAI 在 GitHub 开源 AReno,一个易用且快速的工具包,用于在单节点上扩展强化学习后训练。该工具定位为轻量级 RL post-training 方案,具体性能数据与支持模型尚未在仓库说明中披露。
vLLM 官方博客(RSS)精选AI 评分6767 NVIDIA Nemotron 3 Ultra 在 vLLM 获 Day-0 支持
NVIDIA 宣布 Nemotron 3 Ultra 在 vLLM 上获得 Day-0 支持。该开源模型采用混合 Transformer-Mamba 潜在 MoE 架构,总参数 550B、激活 55B,上下文最长 1M tokens,支持 NVFP4 与 BF16 精度,面向长时程自主智能体工作流。
推荐理由:官方给出架构细节、显存配置和 vLLM 部署命令,读者可以直接照此在自有环境里跑通该模型。
Google ResearchAI 评分5353 Google Research 在 GitHub 开源水文模型框架,供各国气象水文部门构建 AI 洪水预报
Google Research 将驱动 Flood Hub 的水文模型框架在 GitHub 以 Apache 2.0 许可证开源,供各国气象水文部门训练 AI 洪水预报模型。
通义 QwenAudio:原创语音项目AI 评分4040 Qwen-VLA 官方仓库发布
通义 QwenAudio 原创语音项目下出现 Qwen-VLA 官方仓库。目前仅有仓库地址信息,尚未披露模型参数规模、功能细节或可用方式。
Nous Research:GitHub 新仓库AI 评分1818 Nous Research 发布 Megatron-LM 仓库,用于大规模 Transformer 模型训练研究
Nous Research 在 GitHub 新建 Megatron-LM 仓库,用于持续开展大规模 Transformer 模型训练研究。该仓库定位为规模化训练 Transformer 的持续性研究项目,目前公开信息仅包含这一句描述,未披露模型规模、参数或具体训练细节。
Nous Research:GitHub 新仓库AI 评分3939 Nous Research 发布 Megatron-Bridge 训练库
Nous Research 推出 Megatron-Bridge,一个面向 Megatron 系列模型的训练库,支持与 Hugging Face 的双向转换。该库同时提供模型训练能力与 Hugging Face 格式互转功能。
DeepSeek@deepseek_aiAI 评分4545我们将把折扣永久化!🎉 尽情用 DeepSeek-V4-Pro 构建,让你的创新想法成为现实!🚀
引用DeepSeek@deepseek_aiThe DeepSeek-V4-Pro discount has been extended until May 31, 2026, 15:59 UTC!
Saining Xie@sainingxieAI 评分4545引用Jaskirat Singh@1jaskiratsinghIn Oct last year, Representation Autoencoders provided an elegant solution to unified tokenization for understanding and generation. Today we make them a bit more simple. a bit more general. Result: >10x faster convergence, better reconstruction, better generation. And yes we test them on T2I and world models :) Introducing RAEv2
美团 LongCat:HuggingFace 新模型AI 评分5353 美团 LongCat 发布开源模型 LongCat-Video-Avatar 1.5
美团 LongCat 团队发布开源音频驱动数字人视频生成框架 LongCat-Video-Avatar 1.5,基于 LongCat-Video 基础模型,支持 AT2V、ATI2V 和视频续写,兼容单路与多路音频输入。
Google DeepMind:Blog(RSS)精选AI 评分8585 Google DeepMind 发布 Gemini 3.5,率先推出 3.5 Flash
Google DeepMind 发布 Gemini 3.5 模型系列,首发的 3.5 Flash 已在 Gemini 应用、Search AI Mode、Google Antigravity、Gemini API 和 Gemini Enterprise 上线。
推荐理由:官方发布稿给出了具体基准成绩、速度倍数和开放渠道,读者可以据此评估 3.5 Flash 在智能体和编码场景的可用性。
Lilian Weng@lilianwengAI 评分3939过去几个月,我们经历了许多乐趣(和压力😅),在训练运行日志中产出了 12 个版本(以及许多子版本)和 137 页内容。 事实证明,人与人之间的协作对于改善人机协作很重要。😊
引用Thinking Machines@thinkymachinesPeople talk, listen, watch, think, and collaborate at the same time, in real time. We've designed an AI that works with people the same way. We share our approach, early results, and a quick look at our model in action. https://thinkingmachines.ai/blog/interaction-models
Thinking Machines Lab:官方博客(RSS)精选AI 评分7070 Thinking Machines Lab 发布 TML-Interaction-Small 交互模型研究预览
Thinking Machines Lab 宣布 interaction models 研究预览,让模型原生处理实时音频、视频和文本交互,而非依赖外部 harness。
推荐理由:原文由当事团队给出架构设计、能力演示和基准数字,读者可以据此了解交互能力如何内置于模型本身。
上海人工智能实验室 InternLM:原创项目AI 评分3939 上海人工智能实验室 InternLM 推出 ETCHR:面向 MLLM 的推理感知图像编辑器
上海人工智能实验室 InternLM 项目发布 ETCHR,一个以问题为条件、具备推理感知能力的图像编辑器,定位为多模态大语言模型(MLLM)的解耦式视觉推理助手。该工具通过解耦设计为 MLLM 提供独立的视觉推理支持。
Fuli Luo@_LuoFuliAI 评分6565引用Xiaomi MiMo@XiaomiMiMoXiaomi MiMo-V2.5 is now officially open-sourced! MIT License, supporting commercial deployment, continued training, and fine-tuning - no additional authorization required. Two models, both supporting a 1M-token context window : • MiMo-V2.5-Pro: built for complex agent and coding tasks, ranking No.1 among open-source models on GDPVal-AA and ClawEval • MiMo-V2.5: a native omni-modal model with strong agent capabilities A model's value isn't measured by rankings alone — it's measured by the problems it solves. Let's build with MiMo now! 🤗 Weights: https://huggingface.co/collections/XiaomiMiMo/mimo-v25 📄 Blog: https://mimo.xiaomi.com/index#blog
通义 QwenAudio:原创语音项目AI 评分3535 QwenLM 推出 FlashQLA:基于 TileLang 的高性能线性注意力内核库
QwenLM 发布 FlashQLA,一个基于 TileLang 构建的高性能线性注意力内核库。该库面向线性注意力算子提供内核实现,具体性能数据与可用性信息原文未披露。
小米 MiMo:GitHub 新仓库(模型发布)AI 评分3939 小米 MiMo-V2.5-ASR 发布:跨语言、方言与复杂声学场景的鲁棒语音识别
小米发布 MiMo-V2.5-ASR,一款面向多语言、方言及复杂声学场景的鲁棒语音识别模型。该模型主打在跨语言、方言和嘈杂环境下的稳定识别表现,具体参数与评测数据尚未在仓库说明中披露。
小米 MiMo:GitHub 新仓库(模型发布)AI 评分2424 小米 MiMo 发布 MiMo-Skills 智能体技能仓库
小米为 MiMo 系列模型推出 MiMo-Skills,一个面向该系列的智能体技能(Agent skills)仓库。目前公开信息仅说明其用途是服务 Xiaomi MiMo 系列,未披露技能数量、支持版本或调用方式等细节。
OpenAI:GitHub 新仓库AI 评分3636 OpenAI 开源 monitorability-evals 评估套件
OpenAI 开源了 monitorability-evals 评估套件,该套件来自 Monitoring Monitorability 论文。
DeepSeek:GitHub 新仓库AI 评分3535 DeepSeek 开源 TileKernels:用 TileLang 编写的内核库
DeepSeek 在 GitHub 新建仓库 TileKernels,这是一个用 TileLang 编写的内核(kernel)库。仓库目前仅给出这一句说明,未披露支持的算子范围、性能数据或开源许可等细节。
蚂蚁 inclusionAI:GitHub 新仓库AI 评分2626 蚂蚁 inclusionAI 发布 LLaDA2.0-Uni:理解与生成世界
蚂蚁 inclusionAI 在 GitHub 新建仓库 LLaDA2.0-Uni,定位为"理解与生成世界"。该仓库目前仅公布名称与这一句定位描述,未披露参数规模、上下文长度、benchmark 分数或开源许可等具体信息。
Alibaba:GitHub 新仓库AI 评分4141 阿里巴巴开源 slime:面向 RL Scaling 的 LLM 后训练框架
阿里巴巴在 GitHub 发布 slime,一个面向 RL Scaling 的 LLM 后训练框架。该仓库为 fork 版本,用于贡献代码,所有改动均计划以 PR 形式提交上游。