Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google DeepMind 宣布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,再逐步扩展至开发者、企业和消费者。
推荐理由:原文给出定价、1M 输出上限和多项基准成绩,读者可据此评估该模型在编码与防御性网络安全上的实际表现。
Google DeepMind 宣布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,再逐步扩展至开发者、企业和消费者。
推荐理由:原文给出定价、1M 输出上限和多项基准成绩,读者可据此评估该模型在编码与防御性网络安全上的实际表现。
Google Translate 将最新 Gemini 模型与语言专家的人类视角结合,把字面翻译转为自然对话。软件工程师 Isaac Caswell 已帮助平台新增 146 种语言,目前 Translate 支持近 250 种语言。团队还通过向用户询问上下文、微调大语言模型来判断语义细微差别。
xAI 发布 Grok Imagine API,一套覆盖视频生成与视频编辑的统一 API 套件,称其为迄今最强的音视频生成模型。
推荐理由:官方宣布 Grok Imagine API 上线,附 Artificial Analysis 文生视频排名第一及延迟对比,可据此评估其在视频生成工作流中的位置。
xAI 发布 Grok Imagine Video 1.5,已在 Imagine API 正式可用(模型名 grok-imagine-video-1.5),并在 grok.com/imagine 和 iOS、Android 应用推出 Video 1.5 Fast。
推荐理由:xAI 官方说明升级点和速度数据,还给出 API 模型名与并发代理等入口,适合评估图生视频工作流。
xAI 宣布其最强模型 Grok 4.5 当日起在 grok.com、X 以及 iOS 和 Android 应用上可用。官方称该模型更准确理解提问、能跟踪更长对话并更快给出答案,可完成制作电子表格、把大纲转为幻灯片和图表、撰写文稿、提炼长 PDF 要点等任务,并通过 Microsoft 365 插件在 Word、Excel、PowerPoint 和 Outlook 中直接使用。
推荐理由:xAI 官方说明 Grok 4.5 的能力改进和全平台可用范围,读者可据此评估在日常问答和知识工作中的使用方式。
Suno 发布 v3 模型,称其为首个能生成广播级音乐的模型,可在数秒内生成完整的两分钟歌曲,现已向所有用户开放(https://app.suno.ai)。改进包括更好的音质、更多风格和流派、更高的提示词遵循度(更少模型幻觉、更自然的结尾)。模型不识别对其他艺术家的引用,并采用专有的不可听水印技术检测 Suno 生成的歌曲;v4 已在开发中。
推荐理由:官方说明 v3 在音质、风格和提示词遵循上的具体改进,并介绍了水印防滥用机制,可帮助读者了解其能力边界。
Suno 发布新功能 Suno Scenes,从相机拍摄的照片或视频生成独特歌曲,官方称其为视觉叙事的创作模式。该功能首先面向 iOS 移动端用户开放,在歌曲创作体验的 Camera 模式下使用。
Suno 发布最新音乐模型 v4.5,带来更动态的音乐、更准的曲风与曲风混搭、更丰富的人声表现。新功能包括提示词增强助手、Covers 与 Personas 组合使用,歌曲长度可达 8 分钟,生成速度和音频质量均有提升。
推荐理由:官方列出了 v4.5 在曲风、人声、提示词理解和生成速度上的具体改进,适合关注 AI 音乐生成的读者了解能力变化。
Suno 推出升级版 Song Editor,可在波形上逐段重排、重写和重制曲目,并可将曲目拆分为 12 个干净 stem 供预览和下载。同时支持最长 8 分钟的整曲上传,新增三个创意滑块控制生成风格,可继续在 DAW 中编辑或在 Suno 内完成曲目。
推荐理由:官方介绍升级版 Song Editor、12 轨 stem 拆分和 8 分钟上传等新能力,可帮助创作者评估其在音乐工作流中的用法。
Microsoft 生成式 AI 通过深度学习按自然语言提示词生成文本、图像、音乐和代码,区别于仅做分析预测的传统 AI、预测式 AI 和对话式 AI。
MiniMax 在 NVIDIA GTC 期间举办 AI Founder Day,并推出首个自进化模型 M2.7。现场演示显示 M2.7 可处理复杂任务、迭代编辑与工具调用,接近“精英级工程师”表现。联合创始人云叶一在主题演讲中提出智能体时代,强调模型正成为可规划、执行与迭代的系统核心组件。
SGLang 推出 Encoder-Prefill-Decode(EPD)分离架构,将视觉语言模型(VLM)的视觉编码与语言处理拆分为三层,使编码器服务器可独立横向扩展。
Intel 与 SGLang 团队通过 Dynamo 和 SGLang 为视觉语言模型(VLM)实现异构 Encode-Prefill-Decode(EPD)分离,将视觉编码任务卸载到 CPU。在 Qwen3-VL-8B-Instruct 上,该方案在 QPS 1-2 负载下带来约 1.2x-1.3x 的 P99 TTFT 和请求吞吐提升,P99 TPOT 降低约 1.3x-30x。
Liquid AI 推出面向国防战术边缘的端侧 AI 方案,其多模态模型完全在设备本地运行,支持威胁检测、自主导航和实时 ISR,推理留在本地以保持速度和断网可用性。该方案针对国防场景的 SWaP 约束调优,适配手持设备、头显、地面车辆和小型 UAS 的 NPU 与 CPU,避免将敏感数据发送至云端带来的安全风险与 ITAR 违规。
Liquid AI 推出面向医疗健康与生命科学的 SLM 方案,可在医院内网或 VPC 私有部署,让敏感数据留在本地。该系列模型针对临床与制药场景定制,支持文本、音频和图像的多模态处理,并采用支持 HIPAA、SaMD 变更控制模式与可审计性的架构。
Liquid AI 推出面向电商行业的定制多模态 AI 模型,以毫秒级响应支撑语义搜索、站内智能体和商家 Copilot。其意图原生搜索可理解自然语言、图像查询与结构化筛选,并实时调用商家 API 返回商品;站内智能体接入购物车、结账、订阅、订单状态等 API,可引导客户并完成购买流程。商家侧 SLM 基于分析数据、营销活动和商品目录训练,用于总结表现、建议行动并生成商品调整。
Liquid AI 面向消费电子厂商推出端侧 AI 方案,其高效 SLM 可为 PC、智能手机、智能扫地机器人等设备定制适配 NPU、CPU、RAM 和功耗的模型,无需新芯片即可实现智能通知、离线助手和功耗摘要等功能。该方案支持调用厂商自有 API 以打开应用、修改设置并编排设备功能,仅在复杂推理时交由云端 LLM 处理,同时以单一多模态模型覆盖文本、音频和视觉。
Liquid AI 推出面向汽车行业的车载 AI 助手方案,其多模态模型完全运行在量产车已有的 CPU 和 NPU 上,无需云端依赖或新增硬件。方案采用边缘优先的 SLM 与混合智能体架构,单个模型支持 20+ 种语言,速度达现有方案的 5 倍,可实现亚秒级响应与自然语音、座舱视觉交互。
Liquid AI 在 Hugging Face Spaces 上线一批 LFM2.5 演示,包括可在浏览器用 WebGPU 本地运行的 LFM2.5-VL-3B 和端侧 LFM2.5 研究智能体。另有英语拼写检查、多语言 PII 检测、掩码扩散与策略检查等 Space,基于 LFM2.5 或 LFM2.5 Encoder 在 CPU 上运行。
Liquid AI 发布 LFM2.5 模型家族,主打端侧 AI 部署与设备上 Agentic AI,预训练从 10T 扩展到 28T tokens,并通过强化学习扩展后训练流程。
Liquid AI 发布 LFM-7B,一款基于 Liquid Foundation Model 非 Transformer 架构的语言模型,面向聊天场景。官方称其在 7B-8B 级别英文、阿拉伯语和日语对话评测中领先,上下文窗口为 32k(RULER 有效长度 32k),内存占用低于同类 Transformer 模型,适合本地、低延迟和成本受限部署。
Liquid AI 发布首批视觉语言基础模型 LFM2-VL,包含 LFM2-VL-450M 和 LFM2-VL-1.6B 两个开源变体,面向手机、笔记本、可穿戴等资源受限设备的低延迟部署。
Liquid AI 发布 LFM2-Audio-1.5B,一个支持音频与文本输入输出的端到端基础模型,将 LFM2 家族扩展到音频领域。
Liquid AI 发布 30 亿参数视觉语言模型 LFM2-VL-3B,基于 LFM2-2.6B 主干并集成 SigLIP2 400M NaFlex 编码器,现已在 Hugging Face 和 LEAP 平台上线。
Liquid AI 发布 LFM2.5-1.2B 模型家族,称其为迄今最强的边缘 AI 版本,预训练从 10T 扩展到 28T tokens,并大规模引入强化学习后训练。
Liquid AI 发布 LFM2.5-VL-450M,是 LFM2-VL-450M 的升级版,新增边界框定位和文本函数调用支持,预训练从 10T 扩展到 28T tokens。
Liquid AI 发布两款 350M 参数多语言检索模型 LFM2.5-ColBERT-350M 和 LFM2.5-Embedding-350M,是 LFM 家族首批双向模型,支持 11 种语言的跨语言搜索。
Cursor 团队与 SpaceXAI 今日联合发布 Grok 4.6,基于 Grok 4.5 打造,专注于长时间运行的智能体、更复杂的交互与视觉工作。在 Artificial Analysis Intelligence Index 上它与 GPT-5.6 Sol 持平(61 分),训练上进行了更长时间的补充训练、重新生成的 SFT 轨迹和广泛的智能体 RL。
推荐理由:原文给出训练方法、基准分数和定价细节,读者可以据此评估它在智能体编程场景中的定位。
Claude 介绍 Artifacts 功能,可在对话旁生成设计、演示文稿、文档、仪表盘或小型交互工具,支持画布编辑、链接分享(默认私有)和导出为 PowerPoint、PDF、HTML 等格式。
推荐理由:官方页面对 Artifacts 及 Claude Design、Claude Slides、Claude Docs 的功能、协作与导出方式做了较完整说明,便于了解可用范围。
卡内基梅隆大学(CMU)研究者在 12 月 2 日至 7 日于圣迭戈举行的第 39 届 NeurIPS 2025 上展示 156 篇论文。口头报告包括提出 Encoder–Attender–Decoder 框架研究触觉处理的 ConvRNN、缓解标签平滑表征坍缩的 MaxSup,以及单步生成模型 MeanFlow(ImageNet 256×256 单次函数评估 FID 3.43)。
Cohere 发布 Embed 5 系列嵌入模型,含 Embed 5 Pro 和 Embed 5 Fast 两档,均支持 128K token 上下文、100+ 语言、文本与图像输入和共享嵌入空间,定价分别为每百万 token $0.12 和 $0.08。
Anthropic 发布 Claude Fable 5.1,定位为其最强编码与知识工作模型,面向 Pro、Max、Team、Enterprise 用户及 Claude Platform、AWS、Google Cloud、Microsoft Foundry。
推荐理由:官方页面给出定价、缓存降价、回退机制和客户实测引用,读者可以据此评估长时智能体与编码工作流的成本收益。
Anthropic 发布 Claude Science,一款面向科学家的 AI 工作台应用,目前为 macOS、Windows 和 Linux 上的公开 beta,面向 Pro、Max、Team 和 Enterprise 计划。
推荐理由:官方产品页列出可复现分析、60+ 科学数据库连接和 HPC 计算管理等具体能力,读者可据此判断它对科研工作流的影响。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源 TTS 模型的可懂度、速度和说话人相似度,将评估周期从数周缩到数小时。
Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 为目标模型完成多项优化,支持 4K+ token 文本与 15K+ token 多模态输入的嵌入推理。
Preferred Networks(PFN)宣布投资 Noetra 并参与其日本国产 Physical AI 多模态基础模型项目,该项目由 METI 与 NEDO 资助,Noetra 与 AIST 共同入选。
World Labs 发布 Christoph Lassner 的分享,探讨生成式 AI 如何催生一种角色与世界可动态演化的新媒介,以及这对叙事和数字内容未来的意义。
World Labs 发布空间智能模型更新,并推出有限访问的 Marble 测试预览,用户可在 marble.worldlabs.ai 用图像或文本提示生成可自由导航的 3D 世界。
World Labs 发布实时生成世界模型 RTFM(Real-Time Frame Model),可在用户交互时实时生成视频,现已以研究预览形式开放浏览器演示。RTFM 在单张 H100 GPU 上以交互帧率运行推理,不依赖显式 3D 表示,作为端到端训练的学习式渲染器工作;它将带位姿的帧作为空间记忆并通过 context juggling 检索邻近帧,使世界在长时间交互中持续存在而不丢失。
李飞飞发表长文,提出空间智能是 AI 的下一个前沿,认为 LLM 擅长语言但在距离估计、物体旋转、物理预测等空间能力上远低于人类。她将世界模型概括为生成一致世界、接受多模态输入、根据动作预测下一状态三项核心能力,并介绍 World Labs 已向部分用户开放可通过多模态输入生成可探索 3D 环境的 Marble,应用将依次覆盖创作工具、机器人和科学研究。