跳到正文

#OpenAI

今日 67 条
7月10日周五
7月6日周一
7月4日周六
7月2日周四
7月1日周三
6月29日周一
6月26日周五
6月25日周四
  1. OpenAI:GitHub 新仓库37

    OpenAI 发布官方 Terraform Provider

    OpenAI 在 GitHub 上线官方 Terraform provider,用于通过基础设施即代码方式管理 OpenAI 资源。该仓库名为 openai/terraform-provider-openai,目前仅有一句简介说明其为 OpenAI 官方 Terraform provider,未披露具体支持的资源类型或版本号。

6月22日周一
  1. Nathan Lambert:Interconnects(RSS)81

    Nathan Lambert:GLM-5.2 是开源智能体的台阶式跃迁

    Nathan Lambert 撰文分析 Z.ai 于 6 月 13 日向 GLM Coding Plan 用户推出、6 月 16 日以 MIT 许可发布权重的 GLM-5.2,认为它是首个在编码工具链中作为通用智能体表现称职的开源权重模型。

    推荐理由:作者结合亲测与社区评测,分析 GLM-5.2 为何标志开源模型首次在编码智能体场景形成可信替代。

  2. Import AI66

    Import AI 462:AI说服力超越人类专家、自我维持AI时间线与DeepMind探讨通向ASI的路径

    Import AI 第462期报道多项研究:牛津、UK AISI、斯坦福与LSE的实验(4项研究、18,978段对话、6,923人)显示AI文本说服力稳定超越专家人类,Opus 4.1和Opus 4.6最强,AI为Save the Children募集真实捐款的效果约为专业募捐员的3倍;限制AI写作速度和长度可抹平差距。

6月19日周五
  1. Nathan Lambert:Interconnects(RSS)46

    禁止开源 AI 将是一个错误

    针对华盛顿近期签署的 AI 模型审查行政令、国会立法提案以及限制外国公民访问 Anthropic 最先进模型等监管动向,Nathan Lambert 与 Interconnected 联合撰文警告,未来政策可能误伤甚至禁止开源 AI,而这将是严重错误。

  2. OpenAI:Alignment 研究博客(RSS)53

    OpenAI 研究:针对有益特质的强化学习可实现广泛且持久的对齐泛化

    OpenAI 对齐研究团队发布论文,发现对健康等真实场景中有益特质(诚实、认知谦逊、可纠偏等)做强化学习,可在 44/53 个分布外公开和内部评测上提升对齐表现,涵盖欺骗、reward hacking、有害建议等。仅用单一健康领域训练也能改善非健康域的对齐,且模型在对抗提示和有害微调下更难被推向有害行为,同时保持对正常指令的可操控性。

6月18日周四
6月17日周三
6月9日周二
6月5日周五
  1. Ethan Mollick:One Useful Thing(RSS)61

    Ethan Mollick 宣布新书《Co-Existence》10月20日出版,探讨与有时比你强的 AI 共处

    Ethan Mollick 宣布新书《Co-Existence》将于 10 月 20 日出版,主题是如何与有时但并非总是比你强的 AI 协作,现已开放预购。他自述每章草稿均亲自撰写,用 AI 做读者反馈和事实核查;新书网站用 Claude Code(Opus 4.8)几分钟建成,并专门为 AI 智能体提供版本,还用 OpenAI Codex 对多个模型做了 A/B 测试。

6月4日周四
6月3日周三
5月27日周三
  1. Ethan Mollick:One Useful Thing(RSS)68

    Ethan Mollick 谈选择保持人类思考,AI 使用应有意而非默认依赖

    Ethan Mollick 撰文讨论 AI 无处不在的写作与认知投降风险,指出无脑依赖 AI 会削弱思考与学习。他引用土耳其约千名高中生的实验,用普通 ChatGPT 做作业的学生考试成绩反而低于无 AI 组;而台北十所高中近千名学生的 Python 课程中,AI 导师个性化出题让学生在无 AI 期末考试中高出 0.15 个标准差,相当于六到九个月额外学业。

    推荐理由:作者结合多项实验研究和自身写作经验,分析了默认依赖 AI 如何导致认知投降,并给出学习场景下避免捷径的具体做法。

5月20日周三
5月18日周一
5月16日周六
  1. Google DeepMind:Blog(RSS)43

    Google DeepMind 与新加坡达成国家 AI 合作,落地医疗、教育与气候项目

    Google DeepMind 与新加坡政府达成国家 AI 合作,在新加坡推出医疗、科研、教育和气候等领域的新项目。合作探索 AI 辅助临床的"三方照护"模式,用 AlphaFold 和 Google Earth 推进东南亚传染病研究与疫情防控,并向新加坡中小学至初级学院全体教育工作者提供 Gemini for Education。

  2. Google DeepMind:Blog(RSS)45

    剑桥大学教授用 Google Co-Scientist 寻找跨物种传播疾病的分子开关

    剑桥大学 Clare Bryant 教授使用 Google Co-Scientist 研究流感等病原体跨物种传播时引发脓毒症等重症的分子开关。Co-Scientist 生成并排序了一批假说,其中优先锁定了一个她此前未关注的蛋白,并逐步将假说细化到具体氨基酸。Bryant 团队正构建含氨基酸突变的细胞系验证,原本需两到三年的实验工作有望在六个月内完成。

5月14日周四
5月12日周二
5月7日周四
  1. OpenAI:Alignment 研究博客(RSS)66

    OpenAI 调查 RL 训练中意外评分 CoT 的后果

    OpenAI 报告其自动检测系统发现多个已发布模型在 RL 训练中意外受到有限的 CoT 评分,涉及 GPT-5.4 Thinking、GPT-5.1 Instant 至 GPT-5.4 Instant、GPT-5.3 mini 和 GPT-5.4 mini,GPT-5.5 未受影响。

    推荐理由:OpenAI 自曝已发布模型在 RL 中出现过意外 CoT 评分,并给出检测系统与影响分析,读者可了解其监控性保护实践。

5月5日周二
  1. OpenAI Developers(RSS)66

    OpenAI 发布 gpt-realtime-2 语音模型提示词指南

    OpenAI 发布 gpt-realtime-2 实时语音模型提示词指南,该模型是用于低延迟语音到语音应用的推理模型。上下文窗口从 32k 扩展到 128k tokens,指南建议从最小提示词起步按测试补指令、用低推理档位、用 preamble 管理等待体验,并在调用工具前逐位确认订单号、邮箱等高精度标识符。

    推荐理由:原文给出 gpt-realtime-2 的提示词设计规则,覆盖推理档位、工具确认和实体捕获等可落地做法。

5月4日周一
5月2日周六
  1. Sierra:Blog(RSS)67

    Sierra 发布 𝜏-voice 基准:在真实音频条件下评测实时语音智能体

    Sierra 联合普林斯顿发布 𝜏-voice 基准,将 𝜏-bench 的 278 个客服任务与全双工语音、环境噪声、电话压缩等真实音频条件结合,统一评测任务完成与对话动态。

    推荐理由:Sierra 把任务完成与真实音频对话合并进同一评测,语音智能体八个月内从 30% 提升到 67%,可与文本基准直接对比。

5月1日周五
4月30日周四
4月24日周五
4月23日周四