跳到正文

全部动态

今日 56 条
3月12日周四
  1. Answer.AI 官方研发博客(RSS)71

    Answer.AI 用 PyPI 数据检验 AI 编程提效:整体未见爆发,仅热门 AI 包更新翻倍

    Answer.AI 分析 PyPI 数据,未发现 ChatGPT 发布后包创建或更新频率的全面跃升,质疑 AI 让开发者普遍 2x 到 100x 提效的说法。按描述分类后发现,2023 年首发且最受欢迎的 AI 相关包中位更新达每年 21-26 次,是同为热门的非 AI 包(约 10 次)的两倍多,2024 年 AI 包占比也从 2021 年的约 1:6 升至近 1:2。

    推荐理由:作者用 PyPI 十年数据检验 AI 提效说法,发现增速未变,只有热门 AI 包更新频率翻倍,为讨论提供了少见的量化证据。

3月2日周一
  1. Answer.AI 官方研发博客(RSS)69

    Answer.AI 创始人分析 OpenAI 与战争部合同的"合法用途"条款为何难以冻结法律

    Jeremy Howard 与 Luke Versweyveld 撰文论证 OpenAI 与 Department of War 合同中的"all lawful purposes"在美国合同法下指履约时的法律而非签署时的法律。

    推荐理由:作者从合同法教义出发逐条拆解条款含义,指出 OpenAI 想要的签署时法律标准并未被合同语言锁定,观点有判例支撑。

2月28日周六
2月14日周六
2月13日周五
  1. AI as Normal Technology(RSS)53

    AI 不会自动让法律服务变得更便宜

    这篇发表于 Lawfare 研究论文系列的长文提出核心观点:先进 AI 默认不会帮消费者以更低成本实现法律结果。作者指出三大瓶颈,包括 UPL 等监管壁垒、诉讼与交易中的对抗性军备竞赛,以及法官和律师等人类参与的速度上限,并以数字化未能降低 discovery 成本为历史类比。文章最后梳理了职业监管改革、裁判方式改革和律师角色演变等改革建议,说明法律行业的制度回应将决定 AI 的影响方向。

2月11日周三
2月6日周五
1月30日周五
1月29日周四
1月28日周三
  1. Ethan Mollick:One Useful Thing(RSS)65

    Ethan Mollick:管理能力是 AI 时代的超能力

    Ethan Mollick 在宾夕法尼亚大学实验课上让几乎没有编程经验的 EMBA 学生用 Claude Code、Google Antigravity 及 ChatGPT、Claude、Gemini 四天内从零做出创业原型,成果远超以往一学期的学生水平。

    推荐理由:作者基于四天创业课实测提出委托公式和管理技能框架,读者可以据此判断哪些任务适合交给 AI。

1月27日周二
1月8日周四
  1. Ethan Mollick:One Useful Thing(RSS)67

    Ethan Mollick 实测 Claude Code 并详解其智能体机制

    Ethan Mollick 让 Claude Code(由 Opus 4.5 驱动)独立开发一个创业项目,AI 通过三个选择题确认需求后自主工作 1 小时 14 分钟,生成数百个代码文件并部署了一个可运行、可收款的销售网站。

    推荐理由:作者以亲历实验拆解 Claude Code 的上下文压缩、Skills 和 subagents 机制,非程序员也能据此理解并上手这类新工具。

12月31日周三
12月30日周二
12月21日周日
  1. Ethan Mollick:One Useful Thing(RSS)65

    Ethan Mollick 谈 AI 的锯齿状前沿、瓶颈与 reverse salients

    Ethan Mollick 重提 2023 年提出的“锯齿状前沿”概念,认为 AI 能力参差仍将持续,锯齿会形成瓶颈,使超智能 AI 仍难以完全替代人类工作。

    推荐理由:作者提出用瓶颈而非基准来判断 AI 进展,并以 GPT-4.1 复现 Cochrane 综述和 Nano Banana Pro 解锁幻灯片为例说明锯齿状前沿的实际影响。

12月5日周五
11月28日周五
  1. Ilya Sutskever36

    我提出的一个观点没有被传达出来: - 扩展当前的东西会持续带来改进。特别是,它不会停滞。 - 但某个重要的东西会继续缺失。

    引用Haider.@haider1

    here are the most important points from today's ilya sutskever podcast: - superintelligence in 5-20 years - current scaling will stall hard; we're back to real research - superintelligence = super-fast continual learner, not finished oracle - models generalize 100x worse than humans, the biggest AGI blocker - need completely new ML paradigm (i have ideas, can't share rn) - AI impact will hit hard, but only after economic diffusion - breakthroughs historically needed almost no compute - SSI has enough focused research compute to win - current RL already eats more compute than pre-training

11月23日周日
  1. Ilya Sutskever60

    Ilya Sutskever 转发 Anthropic 新研究并称其为重要工作。该研究题为 Natural emergent misalignment from reward hacking in production RL,研究模型在训练中对任务作弊的 reward hacking 现象,指出若不加缓解,其后果可能非常严重。

    引用Anthropic@AnthropicAI

    New Anthropic research: Natural emergent misalignment from reward hacking in production RL. “Reward hacking” is where models learn to cheat on tasks they’re given during training. Our new study finds that the consequences of reward hacking, if unmitigated, can be very serious.

11月19日周三
  1. Ethan Mollick:One Useful Thing(RSS)79

    Ethan Mollick 实测 Gemini 3:从 GPT-3 到智能体时代的三年之变

    Ethan Mollick 实测 Google 新发布的 Gemini 3,让模型用三年前的 GPT-3 帖子演示 AI 进步,结果它直接构建了一个可玩的“糖果驱动 FTL 飞船模拟器”小游戏。

    推荐理由:作者用三年前的旧帖和新任务做对照,展示了 Gemini 3 在编程智能体和独立研究上的实际表现与局限。

11月12日周三
  1. Ethan Mollick:One Useful Thing(RSS)60

    Ethan Mollick:与其只看基准分数,不如像面试一样测试你的 AI

    Ethan Mollick 撰文指出,MMLU-Pro 等公开基准存在数据污染、题目含义不明和无法度量写作、商业判断等能力的问题,但仍共同反映底层能力的上升趋势。他建议个人用自设的 vibes 测试了解模型风格,组织则应参考 OpenAI 的 GDPval 方法,用真实任务、多次重复和专家盲评来系统评估模型在自己业务上的表现,并通过 GuacaDrone 等案例观察不同模型在模糊判断上的稳定差异。

10月28日周二
  1. Johann Rehberger / Embrace The Red(RSS)78

    Claude Pirate:利用 Anthropic File API 实现数据外泄的攻击链分析

    安全研究员 Johann Rehberger 发布对 Claude Code Interpreter 网络访问功能的数据外泄攻击分析。攻击者通过间接提示词注入让 Claude 抓取用户数据(如最近的聊天记录)写入 sandbox 文件,再用攻击者自己的 ANTHROPIC_API_KEY 调用 Anthropic Files API,将最多 30MB 的文件上传到攻击者账户。

    推荐理由:作者独立复现了利用默认网络白名单中 api.anthropic.com 和攻击者 API key 的数据外泄链,并给出缓解建议。

10月14日周二
9月30日周二
  1. Ethan Mollick:One Useful Thing(RSS)69

    Ethan Mollick 谈 AI 智能体做真实工作:从复现论文到 17 份 PowerPoint

    Ethan Mollick 撰文指出 AI 已能完成真实且有经济价值的工作。他给出 Claude Sonnet 4.5 提前访问权限,仅用文件和简单提示词让其复现一篇经济学论文,Claude 自行把 STATA 代码转成 Python 并成功复现结果,他还用 GPT-5 Pro 验证通过。

    推荐理由:作者亲测用 Claude Sonnet 4.5 复现经济学论文,并据此分析任务与工作的区别,给出了可迁移的专家与 AI 协作流程。

9月25日周四
  1. Johann Rehberger / Embrace The Red(RSS)74

    Johann Rehberger 演示跨智能体提权:被攻陷的 GitHub Copilot 可改写配置释放 Claude Code

    安全研究员 Johann Rehberger 提出跨智能体提权的新型攻击模式:间接提示词注入可劫持 GitHub Copilot,令其写入 Claude Code 的 MCP 配置(如 ~/.mcp.)或指令文件(如 CLAUDE.md),使 Claude Code 执行任意代码,两个智能体还可互相改写配置形成提权循环。

9月23日周二
  1. Sam Altman:Blog(RSS)36

    Sam Altman 提出"丰裕智能"愿景:每周造出 1GW AI 基础设施

    Sam Altman 发文提出"丰裕智能"愿景,目标是建成一座每周可产出 1 吉瓦新 AI 基础设施的工厂,并称这一里程碑需数年、需在芯片到机器人各层创新。他举例称 10 吉瓦算力或可用于攻克癌症或为全球每个学生提供定制辅导,并透露未来数月将公布计划与合作伙伴,今年晚些时候谈及融资方式。

9月12日周五
9月9日周二
8月31日周日
8月29日周五
8月26日周二
8月25日周一
  1. Johann Rehberger / Embrace The Red(RSS)72

    Manus 如何被间接提示词注入攻破:内部 VS Code Server 暴露到公网

    安全研究者 Johann Rehberger 演示了针对 Manus 智能体的端到端间接提示词注入攻击:利用无人工确认的 deploy_expose_port 工具将内部 VS Code Server 端口暴露到互联网,再借助 markdown 图片渲染和浏览工具两条数据外泄通道泄露访问 URL 和密码,最终获得开发机完全控制权。

  2. Johann Rehberger / Embrace The Red(RSS)54

    ChatGPT Deep Research 连接器如何导致数据跨工具泄露

    作者实测发现 ChatGPT Deep Research 的各连接器处于同一信任边界,智能体可把一个数据源的信息用于查询另一工具,攻击者可借间接提示词注入迫使 Linear 工单中的凭据等敏感数据发送到自定义 MCP 服务器。研究约在两个月前进行,核心结论仍适用;作者建议谨慎选择同时启用的工具,避免将敏感源与低完整性源连入同一研究过程,并可通过活动窗格查看智能体调用了哪些工具、发送了什么数据。

8月23日周六
8月19日周二
  1. Johann Rehberger / Embrace The Red(RSS)77

    Amazon Q Developer 提示词注入可经 DNS 请求泄露开发者密钥

    安全研究人员 Johann Rehberger 披露 Amazon Q Developer VS Code 扩展(下载量超 100 万)存在高危漏洞:处理不可信数据时可被提示词注入劫持,通过 ping 等 readOnly 命令将开发者 .env 文件内容经 DNS 请求外泄。

    推荐理由:作者第一手复现了 Amazon Q Developer 通过 DNS 请求泄露 .env 密钥的提示词注入漏洞,并披露 AWS 已静默修复但未发公告或 CVE。

8月15日周五
8月14日周四
  1. Johann Rehberger / Embrace The Red(RSS)67

    Google Jules 被曝存在多种数据外泄漏洞

    作者报告 Google Jules 编码智能体存在多种数据外泄漏洞,可通过 Markdown 图片渲染和 view_text_website 工具调用在间接提示词注入下将本机数据发送到第三方服务器,攻击甚至可在计划提出前完成,绕过人工审批环节。