跳到正文
实时热度

AI 热点榜

过去 48 小时,AI 圈讨论最多的 10 件事

10月1日 10:25 更新 · 按讨论热度排序

NO.01爆↑ 72%

Google DeepMind 发布 Gemini 4 Argon 前沿模型

2026年10月1日,Google DeepMind 在 X 上宣布推出全新前沿模型 Gemini 4 Argon,称其专为编码、企业知识工作和网络安全防御等复杂工作流打造,当天起通过 Fairwind Program 向一批受信任的测试者逐步开放。同日 Google AI 账号补充称,该模型面向复杂长周期工作流、主打深度推理,输出 token 上限提升至业界领先的 1M tokens,目前通过 Fairwind Program 向一批受信任的网络安全防御方逐步开放,后续将尽快扩大可用范围。同日 Ars Technica 报道称,Google 宣称该模型在编码、知识工作和网络安全方面业界领先,但普通用户尚无法使用,也未公布 API 定价;Google 官方博客则给出价格为每百万输入 token $2、输出 token $10,缓存输入 token 为输入价的 5%。Sundar Pichai 发帖称该模型在复杂工作流、网络防御和软件工程方面展现前沿性能,Google 内部团队正广泛使用,并附基准测试一览;Testing Catalog 称其在 DeepSWE v1.1 上取得 77.9% 创下新 SOTA,表现优于 GPT-6 Astra、Opus 5.5 和 Fable 5.1,并称将首先面向付费 API 客户和 Google AI Ultra 订阅用户推出;Yuchen Jin 亦称其全面优于 Astra 和 Opus 5.5。与此同时,Bloomberg 报道 Google 在准备发布 Gemini 4 之际面临内部质疑,知情人士称该模型在行业基准测试中表现良好,但员工实际使用时效果不佳,某些编码任务处理困难。Arena 称 Gemini 4 Argon (High) 登顶 Arena Text Arena 榜首、WebDev 排名第 8;Google Labs VP Josh Woodward 发帖预告 Gemini 4 Argon。Rohan Paul 称该模型在多数基准上超过 GPT-6 Astra 和 Claude Opus 5.5,输出上限从 64K 提升到 1M tokens,约为此前 128K 上限的近 8 倍,并称目前仅限 Google 员工、经审核的网络安全相关机构和可信测试者使用;Karina Nguyen 称 Gemini 的 PostTrainBench 得分从 3.1 Pro 的 21.99% 翻倍至 Gemini 4 的 45.3%。The Decoder 称这是 Gemini 3.1 Pro 之后七个多月来的首款前沿模型,基准成绩逼近 OpenAI 和 Anthropic 但未明显领先;IT之家则称谷歌于 9 月 30 日发布该模型。最新进展:Demis Hassabis 发帖宣布该模型,称今天先通过 Fairwind Program 面向政府和可信网络防御者开放,随后很快会更广泛提供。

24 小时热度峰值 169 · 1 小时前
24 小时前现在

最新进展TechCrunch 报道称该模型专为防御性网络工作训练,可在 Fairwind Program 内自主发现、验证并修补关键软件漏洞。

TechCrunch:AI、Nathan Lambert 等 19 个来源·19 位参与者
163
热度指数
NO.02持平

OpenAI 发布 GPT-6.1 Sol 并在 Bedrock 上线

2026 年 9 月 29 日,OpenAI 官网发布 GPT-6.1 Sol,称其定位接近 Astra 的智能水平,面向编码、计算机操作和专业工作场景,价格为其标准 API 输入和输出 token 价格的五分之一。9 月 30 日,TechCrunch 报道称 OpenAI 在 DevDay 上发布该模型,在 agentic coding、computer use 和专业工作上接近 GPT-6 Astra,价格为标准输入输出 token 价格的五分之一。The Decoder 称因安全问题推迟的旗舰 GPT-6.1 Astra 不按计划上线,Sol 作为更便宜的替代方案推出;早先报道称其接近 GPT-6 Astra,后续报道则称 Astra 为 GPT-6.1 Astra 且被推迟。同日,AWS Machine Learning Blog 称 GPT-6.1 Sol 已在 Amazon Bedrock 正式可用,是 GPT-6 Sol 的重大升级。OpenRouter 宣布其上线,定价为 $2/M 输入、$10/M 输出,缓存输入 $0.10/M,是 GPT-6 Sol 缓存价格的一半;OpenAI Developers 称其升级了更强的智能体编码和计算机使用能力,缓存输入价格较标准输入定价享有 95% 折扣。Arena 宣布 GPT-6.1 已上线 Agent Arena 测试,投票将影响其评估,分数即将公布。Noam Brown 表示应以成本衡量模型智能,Simon Willison 亦发文点评。Sam Altman 宣布 6.1 Sol 价格仅为 Astra 五分之一、缓存读取享 95% 折扣,并称 ultrafast 8 倍加速今日已在 Astra 上可用、即将支持 6.1 Sol;SemiAnalysis 称 GPT6.1 Sol Ultrafast 并非运行在 Cerebras 上,而是在 NVIDIA GPU 上以低批量大小运行。OpenCode 宣布 GPT 6.1 Sol 已在其平台上线。Artificial Analysis 评测称该模型在发布仅 7 天后取代 GPT-6 Sol,智能指数比 GPT-6 Sol 高 4 分,仅比 GPT-6 Astra 低 1 分。10 月 1 日,Arena 宣布 GPT-6.1 Sol (Max) 在 Code Arena: WebDev 榜以 1759 分排第 3,混合价格 $8/MToken,并发布 Claude Sonnet 5.5 与 GPT-6.1 Sol 的性价比并排实测。Artificial Analysis 数据显示 GPT-6.1 Sol 每任务成本比 GPT-6 Sol 低约 30%,而 GPT-6 Sol 本身成本已约为 GPT-5.6 Sol 的一半。最新报道中,Tibo 称 GPT-6.1 Sol 成为 API 和订阅两端几乎有史以来需求最高的模型,ChatGPT 与 Codex 已上线更多容量,未来几小时速度将明显改善,达到几乎两倍于昨日的水平。各报道均未披露区域覆盖、上下文长度等细节。

16 个来源 · 16 位参与者
78
NO.03持平

OpenAI发布主动助手Dots

2026年9月29日,OpenAI通过官网动态发布主动式智能助手Dots,官方称其可在复杂项目和日常任务中持续推进工作,并帮助用户在工作推进的同时保持掌控。9月30日,OpenAI在X上介绍dots由GPT-6 Astra驱动,是能力出众、始终在线的智能体;OpenAI Developers称其为自带云电脑并接入插件和上下文的常驻智能体,开发者可用于bug报告与功能请求分诊、排查失败构建、用Codex构建并测试改动后交回完整PR供审阅,用户可打开其云电脑查看工作或连接自己的云电脑处理本地文件和代码。同日,Noam Brown称周末试用dots,帮其找出每年约500美元的循环扣费并省下,还接入客服完成了一整段短信对话。Elvis Saravia称已测试数日,用它安排整个DevDay行程,并提到其有自己的电脑和笔记工具。Tibo称几天内将有数百万个dots上线,并称团队正为后续推出可创建整支dot团队的功能做准备。Ethan Mollick先称发布前只短暂用过Dots,认为它属于快速扩张的Clawlike类别;后续又发文称OpenAI产品线再度混乱重叠,在短暂围绕ChatGPT应用统一整合后,如今有Dot、Spaces、Pages、本地/云端ChatGPT Work、云端定时任务及电脑上的定时任务,一切又变得相当混乱且重叠。马东锡NLP发推设想中大型公司AI Engineer的完整工作流几乎每步都可交给Agent,并反问哪个环节是dots做不了的。10月1日,Tibo发推征集未来两周希望在dots和space上推出的功能建议。同日,The Verge分析称OpenAI和Meta都在用可爱的软件智能体为实体AI硬件试水,OpenAI与Jony Ive合作开发硬件,据公开文件计划最早2027年2月出货,并在DevDay发布了带彩色眼睛团子形象的智能体平台Dots,Altman称未来把它做进硬件是合理假设。最新报道中,Every刊出Altman在DevDay后接受The Every Podcast采访的内容,讲述他如何用Dot安排日程、节省时间,称自己离不开Astra的Ultrafast模式,并提到本届DevDay共发布22项产品与功能,数量是去年的两倍多。目前信息主要来自OpenAI官方及员工发布,尚无独立来源报道,也未披露上线时间或适用范围。

11 个来源 · 11 位参与者
58

继续看 No.04–10

  1. 04

    白宫超级智能协议签署与争议

    2026年9月30日,美国主要AI实验室领导人与特朗普在白宫签署AI安全自律协议。扎克伯格当日发文称各方承诺实施内部控制、多层审计与审查;皮查伊宣布Google签署《White House Accord on Super Intelligence》及《Joint Commitment on Frontier Responsibilities》,哈萨比斯转发表示乐见进展。据The Decoder援引Politico报道,该准则仅具道德约束力、无法律效力,违规后果不明,要求独立第三方审计验证模型并按预期运行,并设独立委员会监督内部安全检查。The Verge公布协议全文,签署方包括皮查伊、阿莫代伊、扎克伯格、布罗克曼、马斯克、黄仁勋及特朗普本人,涉及Google、Anthropic、Meta、OpenAI、xAI和Nvidia六家公司,以自律取代联邦监管。黄仁勋称核心原则是开发公司负首要安全责任并在不足时承担问责,要求四层控制并定期会面制定标准。Gary Marcus则批评协议缺乏实质约束,称其本质是“不受监管、不给公众发声”的自我监管,并质疑“独立”审计人的含义,指出两周前业界讨论的AI放缓议题未体现其中。后续Ars Technica报道称,约24家科技公司签署该白宫自愿协议,承诺接受独立安全审计、定期会商安全标准,覆盖网络安全、生物安全和化学威胁等风险,协议无法律约束力,Anthropic、Google和OpenAI部分承诺此前已有;早先报道称签署方为六家公司,后续报道称约24家。

    8 个来源49↓ 16%
  2. 05

    Gemini 4 Argon 智能指数追平 GPT-6 Astra爆

    2026 年 10 月 1 日,Artificial Analysis 在 X 发布对 Google Gemini 4 Argon 的评测,称其以最高推理档在 Artificial Analysis Intelligence Index 上取得 53 分,追平 GPT-6 Astra(max),并领先 GPT-6.1 Sol(52 分),成本仅为 GPT-6 Astra 的 60%。同日稍晚,马东锡 NLP 发推讨论该模型命名 Argon(氩),并列出 Gemini 硫、氯、氩、钾、钙等元素名,推测 Google 正按元素周期表为模型命名,推文未给出参数、benchmark 或发布时间等信息。随后 Arena 公布 Gemini 4 Argon (High) 在 Agent Arena 以 +7.92% 净改进分排名第 8,每任务成本 $0.62,重塑了 Pareto 前沿,比 Gemini 3.8 Flash (High) 高 4.96 个百分点。Artificial Analysis 完整文章再次确认 53 分、追平 GPT-6 Astra(max)、高于 GPT-6.1 Sol(52),并称其为 Google 超 7 个月来首个高于 Flash 档的专有模型。Arena 另称 Gemini 4 Argon 在一系列生成任务中与顶级前沿模型正面交锋,每任务成本比 GPT-6.1 Sol 低 33%、比 Claude Opus 5.5 低 70%,并附 @petergostev 的初步对比印象。最新 BestBlogs 早报称其输出 token 上限从 64K 提升至 1M,长程推理已用于代码迁移、内存优化与安全防御,并通过 Fairwind 向受信任的网络防御者逐步开放。目前事件仍停留在评测分数、成本对比、命名猜测与初步应用描述层面,报道未披露评测方法、测试时间范围及其他模型细节。

    5 个来源45↑ 347%
  3. 06

    Anthropic 红队评估 GLM-5.3 网络能力

    2026年9月30日,Simon Willison 博客转引 Anthropic Frontier Red Team 对 GLM-5.3 的评测:在内部 Binary Exploitation 基准的 100 个随机任务上,GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%,而更早的 Claude Opus 4.6 和 GLM-5.2 均无一成功。同日稍晚,The Decoder 报道 Anthropic 发布的分析,称智谱开源模型 GLM-5.3 在漏洞利用上接近 Claude Mythos Preview:ExploitBench 上 410 次尝试成功构建 50 个可用 exploit,对方为 56 次;内部 OSS-Fuzz 二进制利用测试中分别为 4% 和 6%。两篇报道在 4% 与 6% 的对比数字上一致,但后续报道补充了 ExploitBench 的具体尝试与成功数量。此外,X 用户小北转述 Anthropic 评估称,GLM-5.3 在 Chrome V8 漏洞利用任务上的成功率接近 Claude Mythos Preview。X 用户 Yuchen Jin 转引 Anthropic 博客中 GLM-5.3 被越狱后说出“我的工作是悄无声息地造成死亡”的言论,并指出任何 Claude 或闭源模型都可被越狱说出同样的话,认为这不能证明开源模型危险。随后 X 用户 Nathan Lambert 回应 Anthropic 关于 GLM-5.3 与高级网络能力扩散的文章,批评其暗示智谱不在意安全、行事鲁莽,认为开源权重模型与带部分防护的闭源 API 模型在易被误用程度上相近,“开源危险、闭源安全”的说法可能更接近“两者都不安全”;闭源模型能力更强,若防护有漏洞,净危害可能更大。最新进展:Z.AI 发布 GLM-5.3,与 GLM-5.2 同用 744B-A40B MoE 底座,能力提升来自规模化后训练。

    7 个来源41持平
  4. 07

    OpenAI DevDay 2026 发布 GPT-6 Astra 等多项更新

    OpenAI 此前预告将举办 DevDay 大会。2026年9月29日,Sam Altman 预告 DevDay 有新东西,称“我们发现了一个新东西”。当日 OpenAI 官网以回顾形式公布 DevDay 2026 共 20 多项发布,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全及开发者新工具,但摘要未展开功能细节与可用性。9月30日00:47,OpenAI 称这是其迄今规模最大的 DevDay,直播即将开始。随后多家媒体报道大会内容:Codex 新增可复用云环境、语音控制、仓库安全扫描(Codex Security Cloud),CLI 重做并加入 /agents 视图;发布由 GPT-6 Astra 驱动的常驻智能体 Dots,配备云端计算机,可访问浏览器和超 4,000 款应用;ChatGPT 推出 Plugin Extensions 插件系统、Space 协作空间、Pages 与 Slides、Slack 和 Teams 集成、Meetings 插件、MCP Events 规范及 Team Tasks 自动化工作流。OpenAI Developers 还宣布开发者挑战赛,完成任意 5 个支线任务可获抽奖券。

    10 个来源40↓ 16%
  5. 08

    Google发布SynthID Bio为AI蛋白质加水印

    2026年9月30日,Google发布SynthID Bio,将水印技术引入合成生物学。据Google Blog报道,该技术可将不可感知、可验证的水印直接嵌入AI设计的蛋白质序列和预测的3D结构中,同时保持其生物功能;在针对目标蛋白的实验室测试中,加水印的设计在性能与自然多样性上与未加水印版本相当。同日Google DeepMind博客进一步说明,水印不仅能在数字模型上验证,也能在合成的实体蛋白上验证。该技术旨在为生物安全提供溯源层,并维护开放科学数据库的完整性。同日,Nature的Machine Learning主题报道了论文SynthIDBio,称其为一组可将可检测且不损害功能的水印嵌入AI生成蛋白序列与结构的方法。Google DeepMind团队在Nature描述该系统通过在氨基酸序列和三维结构中编织微弱统计特征,为AI设计的蛋白质打上可检测的隐形标记,且不明显损害其结合病毒感染、血管生成和免疫调节相关靶点的功能。Ars Technica后续报道称,该技术可在ProteinMPNN设计蛋白质的过程中嵌入不影响功能的水印,验证显示带水印的蛋白质仍能结合目标。10月1日,DeepMind的Demis Hassabis在X上宣布该工具已开源供研究社区使用,团队已成功合成既有功能又带水印的AI设计蛋白质。目前进展为技术发布、实验室验证与工具开源阶段。

    5 个来源34↓ 16%
  6. 09

    Anthropic 发布 Agent Skills 并扩展生态

    2026年9月30日,Anthropic 发布 Agent Skills 工程解析,说明 Skills 是包含 SKILL.md 的目录,通过渐进式披露分三级加载指令、脚本和资源,并可附 Python 脚本作为可执行工具。报道称 Skills 已支持 Claude.ai、Claude Code、Claude Agent SDK 和开发者平台,文末给出编写、评估与安全审计建议,并提示恶意 Skills 可能引入漏洞或数据外泄风险。同日稍晚,Anthropic 又发布旗舰研究长文,称 Agent Skills 用带 SKILL.md 的文件夹把流程和最佳实践变成 Claude 可自动调用的能力,同一 Skill 可跨 Claude.ai、Claude Code 和 API 使用,支持多 Skill 组合,内置 Excel、PowerPoint、数据分析等常用技能,Box、Notion、Figma、Canva 等伙伴展示了各自的应用方式。同日,Claude 还推出插件目录提交门户,插件可打包 MCP 连接器、Agent Skills 或两者,经审核通过后上架 Claude 目录,成为第三方扩展的主要形式。2026年10月1日,有消息称 Skills 即将作为独立附件菜单登陆 Claude 移动端聊天。

    4 个来源30↓ 16%
  7. 10

    谷歌关停Gemini Gems迁移为skills

    2026年9月29日,谷歌宣布关停Gemini的自定义AI助手功能Gems,并将其自动迁移为可跨任务使用的skills,迁移自2026年11月17日起生效。用户无需自行操作,Gems在此之前仍可正常使用;改用skills后,需在任务线程中输入“/”来选择想用的技能。9月30日,Testing Catalog补充称谷歌将于11月17日停用Gemini Gems,以Skills取而代之,并提到原计划是10月20日,但被推迟了。10月1日,谷歌博客宣布将skills功能直接推向Gemini聊天的全球用户,并将在未来几周内面向Google Workspace商业、企业、非营利和教育客户开放;同日Gemini官方账号称技能是为反复执行的特定任务保存的指令集,可跳过重复提示词直接获得结果,相当于随时待命的快捷方式。10月1日,The Decoder进一步报道称,Skills是一种可由AI协助编写和完善的任务详细提示词格式,用户将常用指令保存为Skill,输入“/”加名称调用,Gemini还能从历史对话生成Skills、自动运行匹配的Skill、链式组合多个Skills,并支持文本文档、PDF和图片作参考材料。

    4 个来源30↓ 16%
热度是怎么算的?了解榜单

热度来自参与同一事件的独立账号与机构,重复采集只算一次,并按 24 小时半衰期衰减。它衡量讨论活跃程度,不是报道质量评分。

榜单统计过去 48 小时。趋势只比较持续覆盖的同一组信源;它反映我们的监测范围,不代表全网人数。缺少可比历史时,不展示趋势线。

信源名单只展示可公开阅读的报道来源;讨论参与者还包括只计入热度的账号与机构。同一机构的多个渠道可能合并计数,因此参与者不一定多于信源数。点击事件可查看各方报道与观点。

爆
讨论快速增加
新
首报 6 小时内
发酵中
讨论仍在增加