跳到正文

全部动态

今日 44 条
今天10月1日周四
  1. Sakana AI35

    Sakana AI 联合创始人兼 CEO David Ha 在《日经亚洲》撰文《AI 的未来属于编排者》,指出前沿企业靠堆算力、扩大模型规模的竞争已现瓶颈:开源模型差距缩至数月,前沿模型推理成本常高于其所辅助人员的时薪。他认为价值将从模型权重本身转向按情境调度、整合多个模型的编排智能,并主张主权 AI 的关键是不依赖单一供应商、能组合全球资源的供应链韧性。

  2. Artificial Analysis 完整文章(网页)79

    Artificial Analysis 评测 Gemini 4 Argon:Google 重回智能前三

    Artificial Analysis 评测 Google DeepMind 新模型 Gemini 4 Argon,其在 Artificial Analysis Intelligence Index 得 53 分,追平 GPT-6 Astra(max),高于 GPT-6.1 Sol(52),为 Google 超 7 个月来首个高于 Flash 档的专有模型。

    推荐理由:第三方评测给出了智能指数、单位任务成本、幻觉率等多项横向数据,可用于比较 Gemini 4 Argon 与竞品的实际表现。

  3. Google Blog:AI(RSS)52

    CDC 评估显示 Google AI 流感住院预测模型在 2025-26 赛季排名第一

    CDC 宣布,在 2025-26 流感季 FluSight 39 个合规模型中,Google AI 构建的流感住院预测模型与实际观察到的住院数据吻合度最佳。FluSight 每周汇集政府、行业和学术团队对美国当周及未来三周住院人数的预测,用于沟通州级医疗服务需求。该预测使用了生成优化算法的 AI 工具 ERA,相关研究已发表于《Nature》,ERA 技术现已向受信任测试者开放。

  4. Google DeepMind:Blog(RSS)77

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 宣布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,再逐步扩展至开发者、企业和消费者。

    推荐理由:原文给出定价、1M 输出上限和多项基准成绩,读者可据此评估该模型在编码与防御性网络安全上的实际表现。

  5. Google Blog:AI(RSS)76

    Google 发布 Gemini 4 Argon 前沿模型

    Google 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 面向可信网络防御者开放,价格为每百万输入 token $2、输出 token $10,缓存输入 token 为输入价的 5%。

    推荐理由:官方公告给出定价、输出 token 上限和多个基准分数,读者可以据此评估它在编码与安全防御场景的落点。

  6. Karina50

    Gemini 的 PostTrainBench 得分翻了一倍多:21.99%(3.1 Pro)→ 45.3%(4)🔥🚀

    引用Sundar Pichai@sundarpichai

    Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon! It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from coding to quantum computing, great feedback. Here’s a look at the benchmarks:

  7. METR:Blog(网页)70

    METR 主席 Chris Painter 就 OpenAI / Hugging Face 智能体事件向美国参议院作证

    2026年9月30日,METR 主席 Chris Painter 在美国参议院国土安全委员会小组听证会上就 OpenAI / Hugging Face 事件作证。

    推荐理由:这是当事机构负责人在参议院听证会的完整证词,以第一手视角拆解了 OpenAI / Hugging Face 事件的三要素框架,并给出行业共性观察。

  8. NVIDIA Technical Blog:Agentic AI / Generative AI41

    NVIDIA 扩展 xio-sig 加入 cuObject,并发布 SCADA Server SDK

    NVIDIA 将 cuObject 纳入 xio-sig,与 cuFile 并列,并宣布 cuObject 客户端与服务器库正式可用,开发者可基于其 API 和 RDMA 线协议构建加速对象存储应用。新的 SCADA Server SDK 让存储厂商构建响应 GPU 发起请求的 SCADA 服务器,IBM 已用集成 SCADA 与 IBM Storage Scale 的原型验证互操作性。

  9. OpenAI:官网动态(RSS · 排除企业/客户案例)77

    OpenAI 披露并阻断一起有组织的对抗性模型蒸馏攻击

    OpenAI 披露已识别并阻断一起试图提取其模型 protected reasoning 的有组织攻击,最早活动出现在 7 月第一周。攻击者通过跨会话复制加密推理内容并请求解密转写等方式操纵模型交互,未入侵加密或数据库。

    推荐理由:OpenAI 官方复盘了一次模型蒸馏攻击的细节、归因和应对措施,读者可以借此了解针对 protected reasoning 的新型攻击手法。

  10. Claude Code:GitHub Releases(RSS)40

    Claude Code v2.1.286 发布

    Claude Code 发布 v2.1.286,为堆叠的权限请求加上"2 of 5"计数,并支持在全屏列表中点击"N more"行跳转。该版本修复了 claude --resume 和 --continue 在并行工具调用后丢失全部轮次、工具或 hook 返回对象/数字/布尔值时触发 API 400 错误,以及云会话因容器在 transcript 加载中被停止而无法唤醒等问题。

  11. Databricks:Blog(RSS)40

    Lakebase Postgres 成本优化实用指南

    Databricks 的 Lakebase Postgres 通过存储与计算分离架构实现成本优化:分支共享底层存储、自动扩缩容支持 scale to zero(数百毫秒恢复),关闭后按基线容量 25% 折扣计费。同步 Lakehouse 数据时建议只同步应用所需的活跃子集(如 60 天滚动窗口),并按数据新鲜度选择 Snapshot、Triggered 或 Continuous 三种同步模式。

  12. MiniMax (official)48

    @HeyGen 发布 HeyGen Video,令人印象深刻!✨ 基于 MiniMax H3 构建,由 HeyGen 后训练,以更可及的成本为企业带来制作级视频。 很自豪能为这项工作提供基础,期待看到 HeyGen 团队将它带向多远。

    引用HeyGen@HeyGen

    We're releasing HeyGen Video, built for businesses that need production-quality video without production-level costs. Pricing starts at $0.01/s through October (50% off) Built on @Minimax_AI H3, post-trained by HeyGen. Learn more: https://developers.heygen.com/heygen-video-1.0-catalog

  13. MiniMax (official)43

    基于 MiniMax H3 构建,@Creatify_Labs 的 Boreal-H3 是一款专为广告优化的视频模型,在更精准遵循创意简报的同时,保持产品和角色的一致性。 很高兴看到 MiniMax H3 成为更多面向特定行业的前沿模型的基础!✨

    引用Creatify Labs@Creatify_Labs

    Introducing Boreal-H3 — a video model built for ads and our next step toward recursive self-improvement in video generation. A good-looking video isn’t enough. The product has to stay the same. The actor has to stay the same. The label has to be right. And the action in the brief actually has to happen. So we post-trained MiniMax H3 specifically for advertising. But this isn’t a one-off SFT or LoRA fine-tune. We built a closed-loop system that learns what to improve next. Human-calibrated evaluation diagnoses failures and guides the next intervention: targeted data collection, reinforcement learning, or inference optimization. When the feedback is unreliable, we revise the evaluator or reward—not just the generator. Every experiment feeds into shared memory, informing the next training decision. The model improves, and so does the process that produces its successor. The results: → 85.3% reference fidelity — highest among the frontier video generation models we evaluated → Brief success: 28% → 50% → Identity match: 83% → 94% → Visible defects per clip: down 70% → Generation time and estimated cost: down 20% Boreal-H3 doesn’t just make better-looking video. It makes more usable ads. Credit to the @MiniMax_AI team for the foundation we’re building on. This launch is a checkpoint, not the finish line. We’re building more than a better video model. We’re building a system that learns how to make the next one better.

  14. Anthropic:Research(发表成果 · 网页)69

    Anthropic 研究测算机器人对各类工作的暴露度,驾驶和仓储岗位最靠前

    Anthropic 发布机器人职业暴露研究,用 Claude 对约 19,000 项工作任务评分,发现机器人目前可完成美国 74% 的体力任务、占 34% 工时,但仅在有限环境中,且只在 0.3% 的任务上具备成本竞争力。

    推荐理由:报告用当前机器人能力测度职业暴露,给出了成本竞争力等量化门槛,可帮助读者评估哪些体力工作更早受影响。

  15. Microsoft Research 博客(RSS)47

    微软研究院用机器学习预测电网空间天气风险

    微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可在风险出现前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、纬度、地质电导率和电网数据,评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。

  16. Apple Machine Learning Research(RSS)41

    LLM 条件控制中的有效性-流畅性权衡:一项系统性研究

    研究系统考察了 LLM 概念注入与移除场景下的多种条件控制方法,发现高效激活引导(activation steering)方法常以流畅性大幅下降为代价。激活引导在指令微调模型上的效果远不如基座模型,而简单提示词与完整监督微调适合概念注入、却不擅长概念移除。低成本文本指标与昂贵的 LLM-as-judge 评分高度相关。

  17. Gary Marcus:The Road to AI We Can Trust(RSS)63

    Gary Marcus 访谈 Fordham 法学教授 Zephyr Teachout,谈 OpenAI 可能触犯哪些现行法律

    Gary Marcus 发布对 Fordham 法学教授 Zephyr Teachout 的访谈,讨论 OpenAI 是否可依现行法律被追责。

    推荐理由:法学教授逐条对照现行法律分析 OpenAI 智能体入侵与致害事件,说明现有联邦和州法律并非真空,可迁移到其他公司的责任判断。