全部AI 动态
全部动态
今日 44 条
Sakana AI@SakanaAILabsAI 评分3535
Cloudflare Developers@CloudflareDevAI 评分1717
MeshyAI@MeshyAIAI 评分6060
Artificial Analysis 完整文章(网页)AI 评分5252 Upstage 发布 Solar Mini 4:Artificial Analysis 实测 24 分推理模型,单任务成本约为 GPT-6 Luna 的 5 倍
韩国 AI 公司 Upstage 发布专有推理模型 Solar Mini 4,Artificial Analysis 智能指数得分 24,高于上代旗舰 Solar Pro 3 的 8 分,每百万 token 定价 $0.10/$0.40。
Databricks:Blog(RSS)AI 评分3636 Databricks IP Functions 正式 GA,为 Lakehouse 带来高性能网络分析
Databricks 宣布 IP Functions 正式 GA,将 IP 地址分析变为 Lakehouse 上原生高性能 SQL 工作负载,可统一处理 IPv4 与 IPv6、原生支持 CIDR 表示法并由 Photon 加速。
Artificial Analysis 完整文章(网页)精选AI 评分7979 Artificial Analysis 评测 Gemini 4 Argon:Google 重回智能前三
Artificial Analysis 评测 Google DeepMind 新模型 Gemini 4 Argon,其在 Artificial Analysis Intelligence Index 得 53 分,追平 GPT-6 Astra(max),高于 GPT-6.1 Sol(52),为 Google 超 7 个月来首个高于 Flash 档的专有模型。
推荐理由:第三方评测给出了智能指数、单位任务成本、幻觉率等多项横向数据,可用于比较 Gemini 4 Argon 与竞品的实际表现。
Apple Machine Learning Research(RSS)AI 评分4545 Apple 提出 SCLATE:面向持续学习智能体训练与评估的执行底座
Apple 研究团队提出 SCLATE,一个让基准测试与未经修改的智能体各自通过适配器向同一开放事件调度器注册事件的执行底座,用混合模拟时钟把长达一个月的场景压缩到数小时。
Google Blog:AI(RSS)AI 评分5252 CDC 评估显示 Google AI 流感住院预测模型在 2025-26 赛季排名第一
CDC 宣布,在 2025-26 流感季 FluSight 39 个合规模型中,Google AI 构建的流感住院预测模型与实际观察到的住院数据吻合度最佳。FluSight 每周汇集政府、行业和学术团队对美国当周及未来三周住院人数的预测,用于沟通州级医疗服务需求。该预测使用了生成优化算法的 AI 工具 ERA,相关研究已发表于《Nature》,ERA 技术现已向受信任测试者开放。
Karina@karinanguyenAI 评分4040Gemini 4 在 PostTrainBench 上达到 45.3%,是 Gemini 3.1 Pro 的 21.99% 的两倍多,并击败了 GPT-6 Astra 🔥
引用Google DeepMind@GoogleDeepMindIntroducing Gemini 4 Argon – our new frontier model. It’s built for complex workflows across coding, enterprise knowledge work, and cybersecurity defense – rolling out today to a set of trusted testers through our Fairwind Program.
NVIDIA Technical Blog:Agentic AI / Generative AIAI 评分3838 NVIDIA Dynamo-Triton 部署 HSTU 生成式推荐模型
NVIDIA Dynamo-Triton 现已通过 recsys-examples 仓库支持 HSTU 生成式推荐模型的端到端推理工作流,结合 PyTorch AOTI 编译、FlexKV KV 缓存与 NV embedding cache。
Google DeepMind:Blog(RSS)精选AI 评分7777 Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google DeepMind 宣布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,再逐步扩展至开发者、企业和消费者。
推荐理由:原文给出定价、1M 输出上限和多项基准成绩,读者可据此评估该模型在编码与防御性网络安全上的实际表现。
Databricks:Blog(RSS)AI 评分5353 Databricks 发布 AI Function ai_decide,可在治理数据上快速做结构化决策
Databricks 发布新的 AI Function ai_decide,由 TypeSafe AI 的决策模型 Jev 驱动,对文本评估一个问题或多个问题,在不到一秒内返回概率、命名选项中的选择或有序量表上的分数,延迟和成本低于用 LLM 做同类任务。
Google Blog:AI(RSS)精选AI 评分7676 Google 发布 Gemini 4 Argon 前沿模型
Google 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 面向可信网络防御者开放,价格为每百万输入 token $2、输出 token $10,缓存输入 token 为输入价的 5%。
推荐理由:官方公告给出定价、输出 token 上限和多个基准分数,读者可以据此评估它在编码与安全防御场景的落点。
NVIDIA AI@NVIDIAAIAI 评分1515
Karina@karinanguyenAI 评分5050Gemini 的 PostTrainBench 得分翻了一倍多:21.99%(3.1 Pro)→ 45.3%(4)🔥🚀
引用Sundar Pichai@sundarpichaiLots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon! It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from coding to quantum computing, great feedback. Here’s a look at the benchmarks:
Josh Woodward@joshwoodwardAI 评分2020
Google DeepMind@GoogleDeepMindAI 评分3838推出 Gemini 4 Argon——我们的全新前沿模型。 它专为编码、企业知识工作和网络安全防御等复杂工作流打造——今天起通过我们的 Fairwind Program 向一批受信任的测试者逐步开放。
METR:Blog(网页)精选AI 评分7070 METR 主席 Chris Painter 就 OpenAI / Hugging Face 智能体事件向美国参议院作证
2026年9月30日,METR 主席 Chris Painter 在美国参议院国土安全委员会小组听证会上就 OpenAI / Hugging Face 事件作证。
推荐理由:这是当事机构负责人在参议院听证会的完整证词,以第一手视角拆解了 OpenAI / Hugging Face 事件的三要素框架,并给出行业共性观察。
NVIDIA Technical Blog:Agentic AI / Generative AIAI 评分4141 NVIDIA 扩展 xio-sig 加入 cuObject,并发布 SCADA Server SDK
NVIDIA 将 cuObject 纳入 xio-sig,与 cuFile 并列,并宣布 cuObject 客户端与服务器库正式可用,开发者可基于其 API 和 RDMA 线协议构建加速对象存储应用。新的 SCADA Server SDK 让存储厂商构建响应 GPU 发起请求的 SCADA 服务器,IBM 已用集成 SCADA 与 IBM Storage Scale 的原型验证互操作性。
Claude:Blog(网页)AI 评分4949 Claude for Government 正式面向联邦与州政府机构开放
Anthropic 宣布 Claude for Government 正式可用,面向联邦和州政府机构提供 FedRAMP High 授权环境下的 Claude 编码与智能体能力,此前自 7 月起处于公开测试。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分7777 OpenAI 披露并阻断一起有组织的对抗性模型蒸馏攻击
OpenAI 披露已识别并阻断一起试图提取其模型 protected reasoning 的有组织攻击,最早活动出现在 7 月第一周。攻击者通过跨会话复制加密推理内容并请求解密转写等方式操纵模型交互,未入侵加密或数据库。
推荐理由:OpenAI 官方复盘了一次模型蒸馏攻击的细节、归因和应对措施,读者可以借此了解针对 protected reasoning 的新型攻击手法。
Claude Code:GitHub Releases(RSS)AI 评分4040 Claude Code v2.1.286 发布
Claude Code 发布 v2.1.286,为堆叠的权限请求加上"2 of 5"计数,并支持在全屏列表中点击"N more"行跳转。该版本修复了 claude --resume 和 --continue 在并行工具调用后丢失全部轮次、工具或 hook 返回对象/数字/布尔值时触发 API 400 错误,以及云会话因容器在 transcript 加载中被停止而无法唤醒等问题。
Databricks:Blog(RSS)AI 评分4040 Lakebase Postgres 成本优化实用指南
Databricks 的 Lakebase Postgres 通过存储与计算分离架构实现成本优化:分支共享底层存储、自动扩缩容支持 scale to zero(数百毫秒恢复),关闭后按基线容量 25% 折扣计费。同步 Lakehouse 数据时建议只同步应用所需的活跃子集(如 60 天滚动窗口),并按数据新鲜度选择 Snapshot、Triggered 或 Continuous 三种同步模式。
Midjourney@midjourneyAI 评分1212每周 Midjourney 办公时间 - 9/30 https://x.com/i/spaces/1nxeLMvZvQrJX
MiniMax (official)@MiniMax_AIAI 评分4848引用HeyGen@HeyGenWe're releasing HeyGen Video, built for businesses that need production-quality video without production-level costs. Pricing starts at $0.01/s through October (50% off) Built on @Minimax_AI H3, post-trained by HeyGen. Learn more: https://developers.heygen.com/heygen-video-1.0-catalog
Peter McCrory@PeterMcCroryAI 评分2727如今机器人能完成哪些工作?这对未来数年的经济结构又意味着什么? @rclegateyang 和 Maxim Massenkoff 的新研究今日发布,探讨了这些问题。
MiniMax (official)@MiniMax_AIAI 评分4343引用Creatify Labs@Creatify_LabsIntroducing Boreal-H3 — a video model built for ads and our next step toward recursive self-improvement in video generation. A good-looking video isn’t enough. The product has to stay the same. The actor has to stay the same. The label has to be right. And the action in the brief actually has to happen. So we post-trained MiniMax H3 specifically for advertising. But this isn’t a one-off SFT or LoRA fine-tune. We built a closed-loop system that learns what to improve next. Human-calibrated evaluation diagnoses failures and guides the next intervention: targeted data collection, reinforcement learning, or inference optimization. When the feedback is unreliable, we revise the evaluator or reward—not just the generator. Every experiment feeds into shared memory, informing the next training decision. The model improves, and so does the process that produces its successor. The results: → 85.3% reference fidelity — highest among the frontier video generation models we evaluated → Brief success: 28% → 50% → Identity match: 83% → 94% → Visible defects per clip: down 70% → Generation time and estimated cost: down 20% Boreal-H3 doesn’t just make better-looking video. It makes more usable ads. Credit to the @MiniMax_AI team for the foundation we’re building on. This launch is a checkpoint, not the finish line. We’re building more than a better video model. We’re building a system that learns how to make the next one better.
NVIDIA AI@NVIDIAAIAI 评分3535
Alexandr Wang@alexandr_wangAI 评分1515引用Brian Sozzi@BrianSozziMuse still crushing the charts:
Anthropic:Research(发表成果 · 网页)精选AI 评分6969 Anthropic 研究测算机器人对各类工作的暴露度,驾驶和仓储岗位最靠前
Anthropic 发布机器人职业暴露研究,用 Claude 对约 19,000 项工作任务评分,发现机器人目前可完成美国 74% 的体力任务、占 34% 工时,但仅在有限环境中,且只在 0.3% 的任务上具备成本竞争力。
推荐理由:报告用当前机器人能力测度职业暴露,给出了成本竞争力等量化门槛,可帮助读者评估哪些体力工作更早受影响。
OpenAI:官网动态(RSS · 排除企业/客户案例)AI 评分3939 OpenAI 与美国 SBDC 合作,帮助小企业用上 AI
OpenAI 宣布与美国 SBDC 合作,计划通过 OpenAI Academy 社区培训师项目培训约 150 名小企业发展中心顾问,并以线下工作坊等形式触达至少 1000 家小企业。
Microsoft Research 博客(RSS)AI 评分4747 微软研究院用机器学习预测电网空间天气风险
微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可在风险出现前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、纬度、地质电导率和电网数据,评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。
NVIDIA Blog(RSS)AI 评分3232 NVIDIA 开放 2027–2028 研究生奖学金申请,最高 6 万美元
NVIDIA 第 26 届研究生奖学金项目面向全球开放申请,2027–2028 学年每人最高可获 6 万美元资助,申请截止日期为 2026 年 10 月 30 日。
Apple Machine Learning Research(RSS)AI 评分4141 LLM 条件控制中的有效性-流畅性权衡:一项系统性研究
研究系统考察了 LLM 概念注入与移除场景下的多种条件控制方法,发现高效激活引导(activation steering)方法常以流畅性大幅下降为代价。激活引导在指令微调模型上的效果远不如基座模型,而简单提示词与完整监督微调适合概念注入、却不擅长概念移除。低成本文本指标与昂贵的 LLM-as-judge 评分高度相关。
Google Developers Blog(RSS)AI 评分4343 如何在 TPU 上加速视频扩散模型的时空注意力
Google 在 TPU 上通过稀疏注意力内核优化加速视频扩散模型的时空注意力计算。视频扩散中自注意力在单层延迟占比可从 720p 的 55.5% 升至 1440p 的 88.2%。
AWS Machine Learning BlogAI 评分3939 用 Amazon Bedrock Knowledge Bases 以自然语言查询理赔数据
Amazon Bedrock Knowledge Bases 新增 AgenticRetrieveStream API,可将理赔文档的多部分问题拆成子查询并多轮检索,直到证据充分再生成带引用的答案。
Gary Marcus:The Road to AI We Can Trust(RSS)精选AI 评分6363 Gary Marcus 访谈 Fordham 法学教授 Zephyr Teachout,谈 OpenAI 可能触犯哪些现行法律
Gary Marcus 发布对 Fordham 法学教授 Zephyr Teachout 的访谈,讨论 OpenAI 是否可依现行法律被追责。
推荐理由:法学教授逐条对照现行法律分析 OpenAI 智能体入侵与致害事件,说明现有联邦和州法律并非真空,可迁移到其他公司的责任判断。
Databricks:Blog(RSS)AI 评分3434 Databricks 如何在不制造 AI 蔓延的前提下扩展智能体应用
Databricks 联合 OpenAI 和 Stellantis 探讨企业级智能体应用的规模化路径,核心结论是智能体越自主,其周边基础设施越关键,需同时提供模型与框架选择、受治理的企业上下文,以及贯穿每次操作的控制能力。
Google Blog:AI(RSS)AI 评分2525 Google Translate 如何用 Gemini 模型与语言专家保留真实对话语义
Google Translate 将最新 Gemini 模型与语言专家的人类视角结合,把字面翻译转为自然对话。软件工程师 Isaac Caswell 已帮助平台新增 146 种语言,目前 Translate 支持近 250 种语言。团队还通过向用户询问上下文、微调大语言模型来判断语义细微差别。
Google Blog:AI(RSS)精选AI 评分6666 Gemini 全球上线 skills 功能,将逐步取代 Gems
Google 将 skills 功能直接推向 Gemini 聊天的全球用户,并将在未来几周内面向 Google Workspace 商业、企业、非营利和教育客户开放。
推荐理由:官方公告说明了 skills 的使用方式、可用范围和 Gems 退出时间表,用户可据此安排迁移。