三星 Galaxy Tab S12 Plus 与 Tab S12 Ultra 发布,Plus 迎来大改款
三星发布 Galaxy Tab S12 系列,其中 Tab S12 Plus 是对两年前 Tab S10 Plus 的大幅更新:屏幕升级为 12.6 英寸、机身更薄更轻,搭载 MediaTek Dimensity 9500 芯片和 10,600mAh 电池,起售价上涨 200 美元至 1,199 美元。
三星发布 Galaxy Tab S12 系列,其中 Tab S12 Plus 是对两年前 Tab S10 Plus 的大幅更新:屏幕升级为 12.6 英寸、机身更薄更轻,搭载 MediaTek Dimensity 9500 芯片和 10,600mAh 电池,起售价上涨 200 美元至 1,199 美元。
StepFun and ACE Studio present StepAudio 3 Music, StepFun’s first music generation foundation model — built to turn a prompt and lyrics into a complete song. Describe the sound you want: • Genre, mood and vocal character • Instruments, key and BPM • Song structure and arrangement Four workflows in one model: 🎤 Song generation 🎹 Instrumental generation 🔁 Music cover 🎙️ Vocal-to-song arrangement Powered by ABC-COT, it plans musical structure and arrangement before synthesis. Generate a version, rewrite the prompt, edit the ABC notation, and iterate toward the sound in your head. (ABC-COT API coming soon) Try the interactive demo: › https://static.stepfun.com/blog/stepaudio3/music/
HeadGuard 是一种可组合的注意力头保护方法,通过离线选取约 1/8 的图像敏感与输出敏感 KV 头并保持其图像 key(可选 value)为 BF16 精度,来缓解低比特 KV-Cache 量化对 VLM 精度的损害。
研究者提出 CALIBRA,一个校准优先的多模态时序框架,用独立循环编码器处理环境、肺功能、症状、用药、可穿戴与情境数据流,并通过可靠性门控与梯度反转抑制队列特征。
NVIDIA 发布 Metropolis Blueprint for Video Search and Summarization(VSS)3.3,用于降低视觉 AI 智能体的构建与运行成本。该蓝图及其智能体技能将视频接入、流处理、事件检测、检索、摘要与报告整合为可维护的系统,让视觉语言模型在生产规模下理解视频。
Apple Creator Studio 将推出全新模板、端到端电影级视频功能及多项提效特性。Freeform 新增自动适配深色模式、文件夹分组协作,Writing Tools 借助 Apple Intelligence 可改写、校对和摘要手写笔记,并支持通过 Shortcuts 自动添加内容。
Xin Liu 与 Eunjo Lee 在 LAS Art Foundation 与 Google Arts & Culture Lab 合作的线上艺术家驻地项目中,用 Google AI 工具创作了《nom nom》和《In Your Eyes, Before My Own》两件作品,探索哲学、心理学与 AI。
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并排序数千种化合物以推动肿瘤细胞状态转变,最高排名化合物在湿实验中产生了最大的预期转变,从缩小化合物搜索空间到选出候选验证仅用一个周末。
推荐理由:微软研究院公开 Quine 的多模态世界模型与实验闭环设计,读者可了解 AI 参与生物实验设计与验证的具体路径。
MiniCPM-o 4.5 现已进入 SGLang Omni v0.1.7。 为开发者提供更多运行和构建该模型的灵活性。
Hi everyone, today we released SGLang Omni v0.1.7. This release includes 75 merged PRs and welcomes 8 new contributors, with 8 first-time contributions. We added MiniCPM-o 4.5, NVIDIA PersonaPlex-7B, and OmniTyper powered by MLX streaming ASR, while further improving realtime and stateful Omni serving. 1.Performance: continued optimizations for Qwen3-TTS, Qwen3-Omni, CosyVoice3, MOSS-TTS, and AuK, covering Prefill CUDA Graph, speaker/reference encoding, kernel fusion, batching, and vocoder hot paths. 2.Serving: added Omni session lifecycle, the SGLang streaming session bridge, and a shared /v1/realtime WebSocket runtime, while further improving realtime ASR and streaming serving. 3.Models & hardware: added MiniCPM-o 4.5 multimodal input and speech output, plus PersonaPlex-7B offline speech-to-speech. MiniCPM-o and MiniMax-Music3 now support Intel XPU, with further MUSA support for Qwen3-TTS. 4.Runtime: improved breakable Prefill CUDA Graph, Talker / Code2Wav colocation, priority CUDA streams, scheduler admission, and profiling infrastructure to reduce host overhead and improve high-concurrency stability. https://github.com/sgl-project/sglang-omni/releases/tag/v0.1.7 https://github.com/sgl-project/sglang-omni
Latent Space 的 AINews 汇总 9/24-9/25 动态,指出本周发布的 Claude Opus 5.5 在讲解视频生成上表现突出,并以 88.4% 领跑 SimpleBench,在 Terminal-Bench-Science 上从低推理强度的 24% 升至 xhigh 的 62%。
AMD 宣布以约 82 亿美元全股票交易收购由李飞飞联合创立的 AI 研究实验室 World Labs,交易预计今年年底完成。World Labs 于 2024 年成立,数月内估值达 10 亿美元,2025 年推出首个商业产品世界生成模型 Marble,可根据提示词生成可交互 3D 世界。
推荐理由:AMD 以约 82 亿美元全股票收购 World Labs,读者可了解交易结构、团队去向及其对 AI 硬件与模型协同的影响。
World Labs 官宣加入 AMD。团队称自 2024 年成立以来在空间与物理世界的 AI 研究上取得突破,加入 AMD 是为了扩大投入与覆盖,并更贴近硬件以推进空间和物理智能。
Google 与 XPRIZE 合作的 Future Vision XPRIZE 公布大奖得主,独立电影人 Jeff Synthesized 的作品《The Gifted》从全球 2500 多份投稿中胜出,获得 10 万美元奖金及 250 万美元长片制作资金。
Google Arts & Culture 移动 App 迎来 15 周年改版,新增视觉优先的对话式搜索,用户可用自然语言提问并获得配图与合作伙伴档案中的精选故事。
Google 介绍 Gemini 3.8 Flash 相比 3.7 Flash 在软件工程、Agent 任务和专业领域多步推理上有显著提升,性能常接近更高成本的 frontier 模型。
推荐理由:文章展示了四个社区用 Gemini 3.8 Flash 做出的具体项目,读者可以借此了解模型在多步推理和多模态任务上的实际用法。
404 Media 报道,微软为改进 Copilot 雇佣的人工承包商持续收到大量淫秽或性露骨的图片编辑请求和用户上传的图像,包括走光照或将女性置于性姿势的图片。承包商还需审核生成的图像是否满足提示词要求,例如 AI 放大的女性胸部是否足够大。
群核科技联合博主「特能斯」4 人 4 天在甘肃永泰龟城采集 6 万多张照片,通过 3D 高斯重建平台 Aholo Reality 生成 24 亿高斯点、60 万平方米的数字古城,刷新全球公开可查的 3D 高斯重建纪录。
工程师之间的合作最棒了 🙌 恭喜 @AIatMeta 推出 Muse Realtime Avatar!我们与他们的团队合作,让模型更高效,这样虚拟形象在你与它对话时就能跟上节奏。
@finkd just unveiled Muse Realtime Avatar, our real-time embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars. Muse Realtime Avatar enables an entirely new range of interactions in @Muse, starting with real-time conversations. 🧵👇 #MetaConnect
Parse 5 为常见格式的企业文档提供最优价格。它消化并返回: ✅ 表格 ✅ 图像 ✅ 边界框 ✅ 流程图 ✅ 以及更多 看看它的表现 👇
LongCat-2.5-Preview is now free on OpenCode for two weeks - 1M Context - Multi-modal - Zero Data Retention
Qwen 团队发布报告,介绍原生多模态模型 Qwen3.8-Omni-Flash,面向文本、音频和视频的长时程智能体任务,如视频编辑和长音频视频翻译。
在 Amazon SageMaker HyperPod 上使用开源 RL 框架 SkyRL,通过 GRPO 对 Qwen3-VL-8B 视觉语言模型进行多轮强化学习后训练,在固定 64 个迷宫评测集上把解迷宫成功率从 43.75% 提升到 95% 以上。
LongCat-2.5-Preview is now live. 1.6T parameters. ~48B active. A 1M-token context window. Natively multimodal. Built to take on long-horizon tasks. From terminals and browsers to GUIs, spreadsheets, and design tools. Try it now: 🚀 API: https://longcat.ai/platform/ 💬 Chat: https://longcat.ai/chat/
Runway 本月早些时候发布 GWM Worlds 2 研究预览,把高保真视频与音频生成变成实时交互式模拟,并提出新的输入格式 WorldPrompt,可固定环境部分要素(包括首帧)后生成带时间戳的事件序列,事件还能实时提示。
上海人工智能实验室推出 InternLM/Intern-Decision,一个快速多模态决策模型。该模型以多模态决策为核心定位,强调快速响应能力,具体参数规模、benchmark 分数与开放方式尚未在现有信息中披露。
Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成连贯的多镜头长视频,并原生继承 SynthID 水印等安全机制。
推荐理由:Google 把长视频生成拆成四个可组合的智能体框架,并给出三套自建基准与量化结果,便于对照现有方案。
Chrome 将 Gemini 的媒体理解能力在桌面端扩展到播客及 YouTube 以外的视频,播放后即可提取要点、定位信息或解释难点。Gemini 还能基于标签页内容生成互动测验,已在美印桌面端以英文推出,未来数月扩展至更多地区和移动端。此外 Chrome 新增跨设备发送标签页时保留滚动位置和未填完表单,并支持分屏视图、标签组、沉浸式阅读模式和朗读功能。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话模型结合,让对话 AI 具备动态视觉形象,支持精准唇形同步、自然表情和流畅轮次切换。
推荐理由:官方披露了实时视频与语音耦合的对话能力、异步工具调用和 97 种语言支持,可据此判断企业级数字人交互的落地边界。
推出 Agora-2,我们的下一代多智能体世界模型。 Agora-2 支持最多 20 个人类和智能体在同一共享环境中互动,全部实时模拟。 我们的多人研究预览版现已开放体验!
Google 推出 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力原生结合,让企业智能体在对话中"能听、能看、能说",并具备精准唇形同步与自然表情。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,设备端解码最高提速 3.13x、H100 上 2.66x,端到端最高提升 2.62x 和 2.27x。