推荐理由:第三方评测给出 GPT-6.1 Sol 与多款前代模型的具体成本对比数字,读者可据此评估 OpenAI 模型的性价比变化。
#多模态
#多模态
今日 5 条
Artificial Analysis@ArtificialAnlys精选AI 评分6767TechCrunch:AI(RSS)AI 评分5858 Google 发布 Gemini 4 Argon,称其为迄今最强模型
Google 发布 Gemini 4 Argon,面向编码、研究和写作等任务,主打网络安全能力。该模型专为防御性网络工作训练,可在 Fairwind Program 内自主发现、验证并修补关键软件漏洞。
ginobefun@hongming731AI 评分5555BestBlogs 10 月 1 日早报精讲三条内容:Google DeepMind 发布 Gemini 4 Argon,输出 token 上限从 64K 提升至 1M。
IT之家(RSS)AI 评分6868 谷歌发布 Gemini 4 Argon,DeepSWE 测试 77.9% 超 Claude Opus 5.5
谷歌于 9 月 30 日发布 Gemini 4 Argon,称其为迄今最先进的 AI 模型,重点面向长流程软件工程、企业知识工作和网络安全防御,单次输出上限约 100 万 tokens。
Google DeepMind:Blog(RSS)精选AI 评分7777 Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google DeepMind 宣布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,再逐步扩展至开发者、企业和消费者。
推荐理由:原文给出定价、1M 输出上限和多项基准成绩,读者可据此评估该模型在编码与防御性网络安全上的实际表现。
xAI:News(网页)精选AI 评分6464 xAI 将 Grok 4.5 推向 iOS、Android、网页和 X 平台
xAI 宣布其最强模型 Grok 4.5 当日起在 grok.com、X 以及 iOS 和 Android 应用上可用。官方称该模型更准确理解提问、能跟踪更长对话并更快给出答案,可完成制作电子表格、把大纲转为幻灯片和图表、撰写文稿、提炼长 PDF 要点等任务,并通过 Microsoft 365 插件在 Word、Excel、PowerPoint 和 Outlook 中直接使用。
推荐理由:xAI 官方说明 Grok 4.5 的能力改进和全平台可用范围,读者可据此评估在日常问答和知识工作中的使用方式。
Sarvam AI(网页)AI 评分4444 Sarvam AI 开源 Sarvam-Translate:支持 22 种印度语言翻译
Sarvam AI 与 AI4Bharat 合作发布开源权重模型 Sarvam-Translate,基于 Gemma3-4B-IT 微调,支持 22 种印度语言,其中 15 种支持结构化长文本翻译。
Sarvam AI(网页)AI 评分5050 Sarvam AI 发布 3B 状态空间视觉语言模型 Sarvam Vision
Sarvam AI 于 2026 年 2 月 5 日发布 Sarvam Vision,一个面向文档智能的 3B 参数状态空间视觉语言模型,支持图像描述、场景文字识别、图表解读和复杂表格解析,覆盖英语和全部 22 种官方印度语言。
Sarvam AI(网页)AI 评分5050 Sarvam AI 发布 Saaras V3 语音识别模型,支持 23 种语言流式转写
Sarvam AI 发布 Saaras V3 语音识别模型,原生支持流式低延迟解码,覆盖 22 种官方印度语言和英语。在 IndicVoices 基准上 WER 约 19%,优于 Saaras V2.5(约 22%),并在低资源语言上保持一致精度;训练使用超 100 万小时多语言音频。
Liquid AI 模型与工程博客(网页)AI 评分3636 Liquid AI 在 Hugging Face 上线 LFM2.5 系列 WebGPU 与 CPU 演示 Space
Liquid AI 在 Hugging Face Spaces 上线一批 LFM2.5 演示,包括可在浏览器用 WebGPU 本地运行的 LFM2.5-VL-3B 和端侧 LFM2.5 研究智能体。另有英语拼写检查、多语言 PII 检测、掩码扩散与策略检查等 Space,基于 LFM2.5 或 LFM2.5 Encoder 在 CPU 上运行。
Liquid AI 模型与工程博客(网页)AI 评分6060 Liquid AI 发布 LFM2.5 端侧模型家族
Liquid AI 发布 LFM2.5 模型家族,主打端侧 AI 部署与设备上 Agentic AI,预训练从 10T 扩展到 28T tokens,并通过强化学习扩展后训练流程。
Liquid AI 模型与工程博客(网页)AI 评分5555 Liquid AI 发布 LFM-7B:非 Transformer 架构的高效语言模型
Liquid AI 发布 LFM-7B,一款基于 Liquid Foundation Model 非 Transformer 架构的语言模型,面向聊天场景。官方称其在 7B-8B 级别英文、阿拉伯语和日语对话评测中领先,上下文窗口为 32k(RULER 有效长度 32k),内存占用低于同类 Transformer 模型,适合本地、低延迟和成本受限部署。
Liquid AI 模型与工程博客(网页)AI 评分6363 Liquid AI 发布 LFM2-VL 系列视觉语言模型
Liquid AI 发布首批视觉语言基础模型 LFM2-VL,包含 LFM2-VL-450M 和 LFM2-VL-1.6B 两个开源变体,面向手机、笔记本、可穿戴等资源受限设备的低延迟部署。
Liquid AI 模型与工程博客(网页)AI 评分6060 Liquid AI 发布端到端音频基础模型 LFM2-Audio-1.5B
Liquid AI 发布 LFM2-Audio-1.5B,一个支持音频与文本输入输出的端到端基础模型,将 LFM2 家族扩展到音频领域。
Liquid AI 模型与工程博客(网页)AI 评分5555 Liquid AI 发布 3B 端侧视觉语言模型 LFM2-VL-3B
Liquid AI 发布 30 亿参数视觉语言模型 LFM2-VL-3B,基于 LFM2-2.6B 主干并集成 SigLIP2 400M NaFlex 编码器,现已在 Hugging Face 和 LEAP 平台上线。
Liquid AI 模型与工程博客(网页)AI 评分6464 Liquid AI 发布 LFM2.5 端侧模型家族
Liquid AI 发布 LFM2.5-1.2B 模型家族,称其为迄今最强的边缘 AI 版本,预训练从 10T 扩展到 28T tokens,并大规模引入强化学习后训练。
Liquid AI 模型与工程博客(网页)AI 评分5656 Liquid AI 发布 LFM2.5-VL-450M,新增目标定位与函数调用,面向边缘部署
Liquid AI 发布 LFM2.5-VL-450M,是 LFM2-VL-450M 的升级版,新增边界框定位和文本函数调用支持,预训练从 10T 扩展到 28T tokens。
Liquid AI 模型与工程博客(网页)AI 评分5353 Liquid AI 发布 LFM2.5-ColBERT-350M 与 LFM2.5-Embedding-350M 双向检索模型
Liquid AI 发布两款 350M 参数多语言检索模型 LFM2.5-ColBERT-350M 和 LFM2.5-Embedding-350M,是 LFM 家族首批双向模型,支持 11 种语言的跨语言搜索。
Cursor Blog精选AI 评分6969 Cursor 与 SpaceXAI 联合发布 Grok 4.6,聚焦长时程智能体任务
Cursor 团队与 SpaceXAI 今日联合发布 Grok 4.6,基于 Grok 4.5 打造,专注于长时间运行的智能体、更复杂的交互与视觉工作。在 Artificial Analysis Intelligence Index 上它与 GPT-5.6 Sol 持平(61 分),训练上进行了更长时间的补充训练、重新生成的 SFT 轨迹和广泛的智能体 RL。
推荐理由:原文给出训练方法、基准分数和定价细节,读者可以据此评估它在智能体编程场景中的定位。
Cohere Labs:官方研究博客AI 评分6262 Cohere Labs 发布 Embed 5 系列嵌入模型,含 Pro 与 Fast 两档
Cohere 发布 Embed 5 系列嵌入模型,含 Embed 5 Pro 和 Embed 5 Fast 两档,均支持 128K token 上下文、100+ 语言、文本与图像输入和共享嵌入空间,定价分别为每百万 token $0.12 和 $0.08。
Anthropic:The Institute(旗舰研究长文 · 网页)精选AI 评分8181 Anthropic 发布 Claude Fable 5.1:面向编码与长时间智能体任务的新旗舰模型
Anthropic 发布 Claude Fable 5.1,定位为其最强编码与知识工作模型,面向 Pro、Max、Team、Enterprise 用户及 Claude Platform、AWS、Google Cloud、Microsoft Foundry。
推荐理由:官方页面给出定价、缓存降价、回退机制和客户实测引用,读者可以据此评估长时智能体与编码工作流的成本收益。
World Labs:官网AI 评分6565 World Labs 发布实时生成世界模型 RTFM 并开放研究预览
World Labs 发布实时生成世界模型 RTFM(Real-Time Frame Model),可在用户交互时实时生成视频,现已以研究预览形式开放浏览器演示。RTFM 在单张 H100 GPU 上以交互帧率运行推理,不依赖显式 3D 表示,作为端到端训练的学习式渲染器工作;它将带位姿的帧作为空间记忆并通过 context juggling 检索邻近帧,使世界在长时间交互中持续存在而不丢失。
Baseten Base Labs:模型研究AI 评分2929 Kimi K3
月之暗面(Moonshot AI)的 Kimi K3 模型以 moonshotai/Kimi-K3 标识出现在一份 API 响应示例中,该响应返回了 chat.completion 对象。示例显示其 usage 包含 189 个 prompt_tokens、82 个 completion_tokens,其中多模态图像 token 为 96。
Baseten Base Labs:模型研究AI 评分6161 DeepSeek 发布 V4 家族首个实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4 家族首个实验性多模态模型,在 DeepSeek-V4-Flash 架构上加入视觉模块并继续训练以获得视觉理解能力。
IT之家(RSS)AI 评分5858 B站开源 Index-Translate 多语言翻译模型家族,文本模型支持 150 种语言
哔哩哔哩 Index LLM 团队发布基于 Qwen3.5 的 Index-Translate 多语言翻译模型家族,2B / 9B / 35B-A3B(preview)权重已在 Hugging Face 与 ModelScope 开放。
World Labs:官网AI 评分6969 World Labs 发布下一代世界模型 Atlas
World Labs 发布下一代世界模型 Atlas,一个从零预训练的全能模型,可原生处理文本、图像、视频和 3D。
Sarvam AI(网页)AI 评分5454 Sarvam AI 发布语音识别模型 Saaras V4
Sarvam AI 发布语音识别模型 Saaras V4,采用音频编码器加 3B 混合状态空间 LLM 解码器的架构,解码器完全从零自研训练。
Sarvam AI(网页)AI 评分5252 Sarvam AI 发布 Sarvam Vision 2.1,文档智能基准达到 SOTA
Sarvam AI 发布 Sarvam Vision 2.1,在 olmOCR-Bench(87.3)与自研 Indic OCR Bench(总体准确率 87.39)上取得领先成绩。
MiniMax:Blog(网页)精选AI 评分7171 MiniMax 开源 H3 通用视频生成模型,支持 2K 分辨率与原生立体声音频
MiniMax 正式开源下一代通用视频模型 MiniMax H3,支持文本、图像、视频、音频的多模态统一理解,可生成最长 15 秒、768p(经 H3-Regenerate-2K 可达 2K)、24 FPS 并带 32 kHz 立体声音频的视频。
推荐理由:官方开源公告给出了完整的三模块系统结构、模型规格和本地部署方式,读者可以据此评估在自己的视频生成流程中如何接入。
Meta AI:Blog(网页)精选AI 评分8080 Meta Superintelligence Labs 发布 Muse Spark 多模态推理模型
Meta Superintelligence Labs 发布 Muse 系列首个模型 Muse Spark,为原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排,已在 meta.ai 和 Meta AI 应用上线,并向部分用户开放私有 API 预览。
推荐理由:官方披露了预训练效率、RL 与测试时推理三条扩展路径的具体结果,以及 Apollo Research 关于评估意识的独立发现,可据此了解其技术栈现状。
Meta AI:Blog(网页)AI 评分7171 Meta Superintelligence Labs 发布 Muse Spark 1.1 多模态推理模型并开放 Meta Model API 公测
Meta Superintelligence Labs 发布 Muse Spark 1.1,一个面向智能体任务的多模态推理模型,在工具与计算机使用、编码和多模态理解上较 Muse Spark 有明显提升,支持 100 万 token 上下文管理和多智能体编排。
Liquid AI 模型与工程博客(网页)AI 评分6363 Liquid AI 发布 LFM2.5-VL-3B 视觉语言模型
Liquid AI 发布 LFM2.5-VL-3B 视觉语言模型,已上架 Hugging Face。相比 LFM2-VL-3B,屏幕理解、函数调用、grounding 和多图输入显著提升,ScreenSpot-v2 达 80.7,ToolSandbox 从 26.4 升至 59.5,RefCOCO 从 57.1 升至 87.9。
Liquid AI 模型与工程博客(网页)AI 评分5858 Liquid AI 发布 LFM2.5-VL-3B 的 DSpark 视觉草稿模型,解码吞吐最高提升 3.13 倍
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,以约 280M 参数(增加 8.9% 内存占用)换取更快解码,GPU 解码吞吐最高提升 2.66 倍、边缘设备最高 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍。
Baseten Base Labs:模型研究AI 评分7474 DeepSeek-V4.1-Flash 发布:552B 多模态 MoE 模型,支持 1M token 上下文
DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,prefill 激活 8B、解码激活 16B,支持 1M token 上下文,采用 Causal Encoder-Decoder 架构与 Compressed Sparse Attention 2。
Black Forest Labs:Blog(网页)精选AI 评分6363 Black Forest Labs 发布 FLUX 3 多模态基础模型,并与 mimic 合作推出机器人视频动作模型 FLUX-mimic
Black Forest Labs 发布早期版本 FLUX 3 多模态基础模型,联合训练图像、视频与音频,视频预测占训练算力超 95%。FLUX 3 骨干可解码动作预测,加入动作模态后视频质量先降最多 10%,3500 步后恢复原有水平。
推荐理由:官方给出训练细节与工厂实测数据,说明同一多模态骨干如何同时支持内容生成与机器人动作控制。
Black Forest Labs:Blog(网页)精选AI 评分7171 Black Forest Labs 发布多模态基础模型 FLUX 3 并开放 Early Access
Black Forest Labs 发布多模态基础模型 FLUX 3,基于 Self-Flow 方法在统一架构内联合学习图像、视频和音频,现已开放 Early Access。
推荐理由:原文给出 FLUX 3 的多模态架构、早期对比评测数字和分阶段开放计划,读者可据此评估其对创作与具身场景的适用性。
Black Forest Labs:Blog(网页)精选AI 评分6666 Black Forest Labs 发布 FLUX 3 Video,文生视频与图生视频正式开放
Black Forest Labs 宣布 FLUX 3 Video 初版正式开放,可通过 BFL API 和部分合作伙伴使用。模型支持最长 20 秒、HD(720p)与 Full HD(1080p,经上采样)的视频生成,并伴随生成原生音频;能力包括文生视频、图生视频与关键帧、视频续接(最多 4 秒)、单次生成多镜头、多语言对白与唇形同步、Draft Mode 低成本预览等。
推荐理由:原文给出具体生成时长、分辨率、多语言与评测结果,读者可据此判断 FLUX 3 Video 在视频生成工作流中的可用性。
Rohan Paul@rohanpaul_aiAI 评分6060引用StepFun@StepFun_aiStepFun and ACE Studio present StepAudio 3 Music, StepFun’s first music generation foundation model — built to turn a prompt and lyrics into a complete song. Describe the sound you want: • Genre, mood and vocal character • Instruments, key and BPM • Song structure and arrangement Four workflows in one model: 🎤 Song generation 🎹 Instrumental generation 🔁 Music cover 🎙️ Vocal-to-song arrangement Powered by ABC-COT, it plans musical structure and arrangement before synthesis. Generate a version, rewrite the prompt, edit the ABC notation, and iterate toward the sound in your head. (ABC-COT API coming soon) Try the interactive demo: › https://static.stepfun.com/blog/stepaudio3/music/
Microsoft Research@MSFTResearchAI 评分2929
Microsoft Research 博客(RSS)精选AI 评分6666 微软研究院推出面向生物学复杂性的 AI 研究系统 Quine
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并排序数千种化合物以推动肿瘤细胞状态转变,最高排名化合物在湿实验中产生了最大的预期转变,从缩小化合物搜索空间到选出候选验证仅用一个周末。
推荐理由:微软研究院公开 Quine 的多模态世界模型与实验闭环设计,读者可了解 AI 参与生物实验设计与验证的具体路径。