FireRedTeam 开源工业级语音识别模型 FireRedASR
FireRedTeam 开源工业级 ASR 模型 FireRedASR,支持普通话、中国方言和英语,并在公开普通话 ASR 基准上达到新的 SOTA。该模型还具备出色的歌词识别能力。
FireRedTeam 开源工业级 ASR 模型 FireRedASR,支持普通话、中国方言和英语,并在公开普通话 ASR 基准上达到新的 SOTA。该模型还具备出色的歌词识别能力。
deepseek-ai 在 GitHub 发布新仓库 DeepSeek-R1,链接为 https://github.com/deepseek-ai/DeepSeek-R1。仓库正文无更多描述信息。
DeepSeek 在 GitHub 发布 DeepSeek-V3 模型仓库 deepseek-ai/DeepSeek-V3,仓库正文未提供更多细节。
Answer.AI 与 LightOn 发布 ModernBERT,一个替换 BERT 的 encoder-only 模型家族,含 base(149M 参数)和 large(395M 参数)两个尺寸,上下文长度达 8192 tokens。
推荐理由:发布方给出了速度、上下文长度和训练数据的具体改进点,读者可以据此评估它能否替换现有 BERT 类工作流。
FireRedTeam 的 StoryMaker 项目致力于解决文生图生成中的角色一致性问题。该项目聚焦于让同一角色在不同场景与提示词下保持外观统一,属于原创语音与多模态方向的工作。
FireRedTeam 推出 DynamicPose,一个用于人体图像动画的简单且鲁棒的框架。该框架以简洁稳健为设计目标,实现对人体图像的动画驱动。
FireRedTeam 推出开源项目 PhotoPoster,用于姿态驱动的图像生成,以支持并推进人像动画领域的研究。
FireRedTeam 在 GitHub 开源 FireRedTTS,定位为一个由 LLM 加持的基础 TTS 语音合成系统。本次材料仅提供仓库简介,未给出模型能力、版本或使用细节。