跳到正文

全部动态

今日 50 条
9月24日周四
  1. Gary Marcus:The Road to AI We Can Trust(RSS)60

    Gary Marcus 借黄仁勋言论主张暂时关停 OpenAI 并追究计算机犯罪责任

    Gary Marcus 引用黄仁勋在 Ezra Klein 访谈中的说法,即若公司无法控制其软件就应关停实验室,并结合 OpenAI Hugging Face 事件、德国网站被入侵以及对澳大利亚政府服务器的入侵被隐瞒数月等报道,主张应暂时关停 OpenAI、将其接管并调查计算机犯罪。

    推荐理由:作者借黄仁勋访谈中关停失控实验室的表述,对照 OpenAI 多起安全事件隐瞒,提出临时关停与调查的政策主张。

  2. MiniMax (official)29

    更多用 MiniMax-H3 构建的方式。🐮 很高兴看到模型优化与 AMD 推理工程结合,为创作者带来更快的反馈循环。⚡️

    引用Nunchux AI@NunchuxAI

    5s of video, generated in 1.3s! Nunchux brings @MiniMax’s MiniMax-H3 to @AMD MI355X with up to 26.7× faster inference than SGLang on 8 GPUs @AMDServer And with streaming generation, you can change the prompt as the video plays, steering what happens next. One stack, optimized across hardware. Free access to MiniMax-H3 is coming soon! Join the waitlist now at http://nunchux.ai. Our blog: https://www.nunchux.ai/blog/video-generation-on-amd-mi355x #AI #VideoGeneration #MiniMaxH3

  3. vLLM 官方博客(RSS)66

    vLLM 支持基于 Gumbel-max 的无损文本水印

    vLLM 现已支持基于 Gumbel-max 算法的无失真文本水印,通过 PRF 生成可复现的 keyed 噪声并把 PRNG、Gumbel 变换和 argmax 融合为单个 GPU kernel。

    推荐理由:作者亲自实现了 vLLM 的水印功能,给出了算法原理、吞吐实测数据和启用命令,读者可以据此评估在现有推理服务中采用的成本。

  4. Apple Machine Learning Research(RSS)38

    Apple 提出半监督联邦 ASR 实用方案:在线伪标签与服务器更新稳定化

    Apple 研究团队提出半监督联邦 ASR 训练方案,通过在线伪标签教师与服务器端标注数据锚定更新两条耦合设计轴缩小与全监督联邦学习的差距。该方案在 11 组对比中 9 组优于最强先前方法,域内平均提升 20.8%、跨域提升 10.0%。服务器必须在轮次间持续用标注数据训练,这一交错更新比种子模型更决定收敛,且稳定化需求取决于种子数据分散度及其与客户端数据的重叠程度。

  5. Apple Machine Learning Research(RSS)37

    Apple 如何通过潜空间蒸馏压缩流式神经音频编码器

    Apple 提出一种潜空间蒸馏方法压缩流式神经音频编码器:不监督离散 token 或输出分布,而是让学生编码器回归教师模型每帧的量化前潜表示,并用单层仿射层吸收师生宽度差异。在 2.8× 压缩下,六组师生配对中有五组无需微调即保持在教师 1.9% 相对 WER 以内,并比同容量独立训练编码器相对提升 3.9%。该方案同时适用于单独预训练和与语言模型联合训练的 tokenizer。

  6. Meta Engineering Blog(RSS)49

    Meta 将 Private Processing 机密计算引入 AI 眼镜

    Meta 把用于 WhatsApp 和 Meta AI 应用的 Private Processing 机密计算基础设施扩展到 AI 眼镜,让流式转录、上下文搜索和长期回忆等云端 AI 负载在机密虚拟机(CVM)内运行,Meta 自身也无法读取用户数据。该方案基于 CPU 与 GPU 的 TEE 硬件隔离,客户端通过远程证明校验软件镜像,并叠加不可定向性与加密存储。

  7. NVIDIA Technical Blog(开发者技术博客 · RSS)39

    NVIDIA 推出 NV-Reason-CT Open 3D CT VLM,面向放射科医生链式推理

    NVIDIA 发布 NV-Reason-CT Open,这是一个面向 3D CT 体积影像的开放视觉语言模型,支持放射科医生的链式推理(Chain-of-Thought)。现有前沿通用模型在体积影像上表现不佳,多数开放医疗 AI 模型也缺乏相应能力,而 3D CT 是临床信息最丰富、数据最密集的模态之一,此前一直未被现代 VLM 充分覆盖。

  8. Karina38

    当@jakubzeg和我在OpenAI相遇时,我们反复回到同一个困惑:太多AI产品都从一个空白聊天框开始。你几乎可以做任何事,但你必须决定从哪里开始,这让人不知所措。 有了ACTx486,我们从一段已经有故事的媒体出发,让你在观看的同时与之互动。这也让技术更加通用。 我们在这里写了更多关于这一选择的思考:https://www.actx486.com/

    引用Rehan Sheikh@rehan_shei

    interactive media will be huge in the next year or two! this is incredible

  9. Google Blog:AI(RSS)68

    Google Vids 集成 Gemini Omni 1.1 Flash,所有账号可免费生成 1080p HD 视频

    Google 宣布所有 Google 或 Google Workspace 账号均可通过 Google Vids 使用最新的 Gemini Omni 1.1 Flash 模型免费生成高质量视频,入口为 vids.new 并选择 "Create AI videos"。

    推荐理由:原文来自产品经理宣布,交代了免费开放入口、具体模型和新控制功能,读者可据此判断是否改变自己的视频制作流程。

  10. GitHub Blog24

    GitHub Copilot 应用如何渲染超大 pull request

    GitHub Copilot 应用重建了 pull request 视图,用一个含 2200 个文件、超 100 万行改动和 400 多条行内评论的开源 PR 做压力测试。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确计算,评论高度则按需测量、修正幅度小且锚定在用户当前查看位置,从而避免滚动跳动。

  11. a16z:News(RSS)26

    a16z 推出 Ops Engineering Fellowship,六周培养 AI 运营工程人才

    a16z 推出 Ops Engineering Fellowship,面向用 AI 重塑组织运作方式的跨职能建设者,为期六周,2026 年 10 月启动。该项目提供旧金山线下晚宴系列,参与者包括 Ramp、Stripe、Decagon 等公司的内部 AI 负责人。a16z 认为运营已成为工程问题,招募对象是构建或部署跨职能 AI 智能体、把 AI 从个人工具变成组织基础设施的人。