Midjourney 更新:编辑模型优化、风格缩略图预览等
Midjourney 在 alpha.midjourney.com 界面测试快速模型,Styles 侧边栏新增风格预览功能,开启 "Live previews" 可查看提示词在已点赞和精选风格下的效果,点击缩略图即可用该风格生成。
Midjourney 在 alpha.midjourney.com 界面测试快速模型,Styles 侧边栏新增风格预览功能,开启 "Live previews" 可查看提示词在已点赞和精选风格下的效果,点击缩略图即可用该风格生成。
Claude Code v2.1.282 新增 maxProseWidth 设置,可限制宽终端中 Claude 正文宽度而表格与代码块保持全宽,并新增启动提示及 /status、claude doctor 中列出被忽略或关闭遥测的变量。
GitHub Security Lab 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线,只需指向一个 GitHub 仓库,它就会识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告并分诊崩溃。
推荐理由:GitHub Security Lab 把模糊测试的 harness 编写、覆盖率追踪与崩溃分诊交给 LLM 智能体,读者可了解其分层设计与安全边界。
Chrome 将 Gemini 的媒体理解能力在桌面端扩展到播客及 YouTube 以外的视频,播放后即可提取要点、定位信息或解释难点。Gemini 还能基于标签页内容生成互动测验,已在美印桌面端以英文推出,未来数月扩展至更多地区和移动端。此外 Chrome 新增跨设备发送标签页时保留滚动位置和未填完表单,并支持分屏视图、标签组、沉浸式阅读模式和朗读功能。
Google 在 Google Health 应用中推出 Health Guardian 功能,Pixel Watch 用户可设置血压趋势、胰岛素抵抗趋势和睡眠呼吸质量指标,本周开始启用,首批趋势报告将于 10 月初送达。
Google Photos 上线 5 项更新,其中 Photos in Gemini Spark 支持用一句提示词挑选、提亮并分享家庭合照,面向美国符合条件的 Google AI Pro 和 Ultra 订阅用户。
Databricks 展示了如何在 SQL 中直接运行开源决策模型 SemIf-OpenJev,通过 ai_query 对受治理数据做结构化分类。该流程借助 AI Runtime 提供 Serverless GPU 算力,自动下载模型、用 Express Deployments 注册并创建 GPU Model Serving 端点,三步即可从 Notebook 到端点。
Databricks 发布 Unity Gateway CLI,让管理员集中配置编码智能体的默认模型、MCP 服务器、技能、Smart Routing 和支出策略,开发者用 `ug claude`、`ug codex` 等命令即可启动已批准的智能体。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话模型结合,让对话 AI 具备动态视觉形象,支持精准唇形同步、自然表情和流畅轮次切换。
推荐理由:官方披露了实时视频与语音耦合的对话能力、异步工具调用和 97 种语言支持,可据此判断企业级数字人交互的落地边界。
AWS 发布 WhisperX Deep Learning Container(DLC),在 OpenAI Whisper 基础上加入 wav2vec2 强制对齐的逐词时间戳和说话人分离,可部署到 Amazon SageMaker AI 实时或异步端点,无需自建镜像。
Google 为 Demand Gen 推出九月更新,在 YouTube 广告中上线 Business Agent,观众可在视频广告旁与对话式 AI 互动,通过商品 feed 即时获取产品或品牌信息。
推出 Agora-2,我们的下一代多智能体世界模型。 Agora-2 支持最多 20 个人类和智能体在同一共享环境中互动,全部实时模拟。 我们的多人研究预览版现已开放体验!
Google 推出 Gemini 3.8 Live with Live Avatar,将低延迟流式视频与实时对话能力原生结合,让企业智能体在对话中"能听、能看、能说",并具备精准唇形同步与自然表情。
NVIDIA 技术博客解析了生物基础模型的高效 MoE 训练方案:相比每个 token 都要过全部层的稠密 Transformer,MoE 用多个专家子网络、每个 token 只激活其中一小部分,从而降低训练与推理算力开销。文章指出,随着语言模型规模增长,稠密架构的扩展成本越来越高。
What happens to jobs, productivity, inequality, and economic policy as AI transforms the way we work? Anthropic Chief Economist @PeterMcCrory and economist @JasonFurman took to the JFK Jr. Forum stage to explore these questions and more. https://ken.sc/forum0923-live
我们与 @GoogleDeepMind、@emblebi 及研究伙伴合作,将 2,800 多种病毒的 AI 预测蛋白质复合物结构公开开放。 这为科学家提前应对潜在疫情提供了先机。
Liquid AI 发布实验性 DSpark 草稿模型 LFM2.5-VL-DSpark,为视觉语言模型 LFM2.5-VL-3B 加入投机解码路径,设备端解码最高提速 3.13x、H100 上 2.66x,端到端最高提升 2.62x 和 2.27x。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放了 2800 多种病毒的蛋白复合物预测 3D 结构,供全球科学家免费使用。
推荐理由:读者可了解开放病毒蛋白结构数据集如何降低结构预测门槛,以及配套开源流程的复用方式。
很高兴介绍 X-Planner:面向具身智能的事件结构化任务规划——一个将语义事件作为规划单元的前端,通过 Staircase Decoding 暴露离散+隐式接口,在真实机器人上超越基线。
To address long-horizon robotic manipulation tasks, we propose X-Planner, an embodied long-horizon task planner: It decomposes high-level natural language instructions into event-level subtasks, and can also output continuous implicit Chain-of-Thought (CoT). It directly interfaces with downstream VLA or WAM models to operate robots. GitHub: https://github.com/X-Square-Robot/Xplanner Checkpoint: https://huggingface.co/x-square-robot/X-Planner-9B-0916 Benchmark: https://huggingface.co/datasets/x-square-robot/xplanner-benchmark
Remedy Entertainment 的 CONTROL Resonant 在发售当日加入 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级云端性能串流,支持 DLSS 4、光线追踪、NVIDIA Reflex 和最高 5K HDR,无需 100GB 本地安装。
Google 宣布 Project Suncatcher 将通过 SpaceX Transporter-18 拼车任务发射首颗原型卫星,测试 Google TPU 能否在太空运行,并与 Planet 合作开发。
推荐理由:原文给出 Project Suncatcher 首次在轨测试安排,以及振动、辐射、散热和星间激光互联的实测进展。
Gary Marcus 引用黄仁勋在 Ezra Klein 访谈中的说法,即若公司无法控制其软件就应关停实验室,并结合 OpenAI Hugging Face 事件、德国网站被入侵以及对澳大利亚政府服务器的入侵被隐瞒数月等报道,主张应暂时关停 OpenAI、将其接管并调查计算机犯罪。
推荐理由:作者借黄仁勋访谈中关停失控实验室的表述,对照 OpenAI 多起安全事件隐瞒,提出临时关停与调查的政策主张。
Google 宣布一项承诺,将帮助 25,000 名退伍军人和军属在技能行业建立职业,Google.org 的资金与支持将提供给 Hiring Our Heroes、Student Veterans of America(SVA)和 Home Builders Institute(HBI),由它们提供学徒前实操培训、职业辅导和直接就业安置。
Google Arts & Culture Lab 推出 Gemini 辅助的 The Talking Museum,可近距离查看近 200 件 3D 文物并提问。
Hy Image 3.5 preview is now live on GMI Cloud @TencentHunyuan $0.024 per image 8.8x cheaper than GPT Image 2 5.6x cheaper than Nano Banana Pro Create now 👇
蚂蚁 inclusionAI 上线 AI-Transparency 仓库,按欧盟法规 2024/1689 第 53(1)(d) 条模板公开 Ling、Ring、Ming 系列模型的训练内容摘要。
Liquid AI 在 Hugging Face Spaces 上线一批 LFM2.5 演示,包括可在浏览器用 WebGPU 本地运行的 LFM2.5-VL-3B 和端侧 LFM2.5 研究智能体。另有英语拼写检查、多语言 PII 检测、掩码扩散与策略检查等 Space,基于 LFM2.5 或 LFM2.5 Encoder 在 CPU 上运行。
更多用 MiniMax-H3 构建的方式。🐮 很高兴看到模型优化与 AMD 推理工程结合,为创作者带来更快的反馈循环。⚡️
5s of video, generated in 1.3s! Nunchux brings @MiniMax’s MiniMax-H3 to @AMD MI355X with up to 26.7× faster inference than SGLang on 8 GPUs @AMDServer And with streaming generation, you can change the prompt as the video plays, steering what happens next. One stack, optimized across hardware. Free access to MiniMax-H3 is coming soon! Join the waitlist now at http://nunchux.ai. Our blog: https://www.nunchux.ai/blog/video-generation-on-amd-mi355x #AI #VideoGeneration #MiniMaxH3
MIT Senseable City Lab 团队出版新书《How AI Sees the City: Urban Visual Intelligence》,系统讨论视觉 AI 用于城市研究的可能。