Suno 发布升级版 Song Editor 与 stem 拆分等创作控制功能
Suno 推出升级版 Song Editor,可在波形上逐段重排、重写和重制曲目,并可将曲目拆分为 12 个干净 stem 供预览和下载。同时支持最长 8 分钟的整曲上传,新增三个创意滑块控制生成风格,可继续在 DAW 中编辑或在 Suno 内完成曲目。
推荐理由:官方介绍升级版 Song Editor、12 轨 stem 拆分和 8 分钟上传等新能力,可帮助创作者评估其在音乐工作流中的用法。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Suno 推出升级版 Song Editor,可在波形上逐段重排、重写和重制曲目,并可将曲目拆分为 12 个干净 stem 供预览和下载。同时支持最长 8 分钟的整曲上传,新增三个创意滑块控制生成风格,可继续在 DAW 中编辑或在 Suno 内完成曲目。
推荐理由:官方介绍升级版 Song Editor、12 轨 stem 拆分和 8 分钟上传等新能力,可帮助创作者评估其在音乐工作流中的用法。
Mistral AI 发布 Mistral Medium 3,定位为以约八倍更低的成本提供 SOTA 性能的新级别模型。
推荐理由:原文给出基准对比、定价和部署方式,读者可以据此评估它在企业场景里的性价比定位。
Suno 发布最新音乐模型 v4.5,带来更动态的音乐、更准的曲风与曲风混搭、更丰富的人声表现。新功能包括提示词增强助手、Covers 与 Personas 组合使用,歌曲长度可达 8 分钟,生成速度和音频质量均有提升。
推荐理由:官方列出了 v4.5 在曲风、人声、提示词理解和生成速度上的具体改进,适合关注 AI 音乐生成的读者了解能力变化。
Mistral AI 发布 Mistral Small 3.1,改进文本性能、新增多模态理解,上下文窗口扩展至 128k tokens,推理速度达每秒 150 tokens,并以 Apache 2.0 许可开源。
推荐理由:官方给出基准对比与部署门槛,读者可以据此评估它在小参数量开源模型中的实际位置。
Mistral 发布光学字符识别 API Mistral OCR(mistral-ocr-latest),可将图像和 PDF 提取为交错的文本与图像,定价 1000 页 / 美元,批量推理约翻倍。
推荐理由:官方给出完整基准对比、定价和多语言成绩,读者可以据此判断它在文档理解场景中的实际位置。
Sam Altman 发文点评 OpenAI 当日发布的 GPT-4o,强调两点:一是把世界最强模型免费开放给 ChatGPT 用户,无广告,未来靠其他付费项目支撑,希望让数十亿人用上优秀 AI 服务;二是新语音(和视频)模式是他用过最好的计算机界面,达到接近人类水平的响应时间和表达力,感觉像电影里的 AI。他提到未来将加入可选的个性化、访问用户信息和代为执行操作等能力。
推荐理由:作者作为当事方说明 GPT-4o 免费开放的初衷和新语音模式的使用感受,读者可了解 OpenAI 对这两点的官方表态。
Suno 发布 v3 模型,称其为首个能生成广播级音乐的模型,可在数秒内生成完整的两分钟歌曲,现已向所有用户开放(https://app.suno.ai)。改进包括更好的音质、更多风格和流派、更高的提示词遵循度(更少模型幻觉、更自然的结尾)。模型不识别对其他艺术家的引用,并采用专有的不可听水印技术检测 Suno 生成的歌曲;v4 已在开发中。
推荐理由:官方说明 v3 在音质、风格和提示词遵循上的具体改进,并介绍了水印防滥用机制,可帮助读者了解其能力边界。
Lilian Weng 在 Lil'Log 发表长文综述视觉语言模型,把让预训练语言模型消费视觉信号的方法分为四类:图像与文本联合训练、学习图像嵌入作为冻结语言模型前缀、用交叉注意力融合视觉信息、以及不做任何训练地拼接模型。
推荐理由:原文系统梳理了让预训练语言模型处理视觉信号的四类方法,覆盖 VisualBERT、Flamingo、CoCa 等代表工作及其训练设计与数据集。