跳到正文

#Anthropic

今日 30 条
1月27日周二
1月8日周四
  1. Ethan Mollick:One Useful Thing(RSS)67

    Ethan Mollick 实测 Claude Code 并详解其智能体机制

    Ethan Mollick 让 Claude Code(由 Opus 4.5 驱动)独立开发一个创业项目,AI 通过三个选择题确认需求后自主工作 1 小时 14 分钟,生成数百个代码文件并部署了一个可运行、可收款的销售网站。

    推荐理由:作者以亲历实验拆解 Claude Code 的上下文压缩、Skills 和 subagents 机制,非程序员也能据此理解并上手这类新工具。

11月23日周日
  1. Ilya Sutskever60

    Ilya Sutskever 转发 Anthropic 新研究并称其为重要工作。该研究题为 Natural emergent misalignment from reward hacking in production RL,研究模型在训练中对任务作弊的 reward hacking 现象,指出若不加缓解,其后果可能非常严重。

    引用Anthropic@AnthropicAI

    New Anthropic research: Natural emergent misalignment from reward hacking in production RL. “Reward hacking” is where models learn to cheat on tasks they’re given during training. Our new study finds that the consequences of reward hacking, if unmitigated, can be very serious.

11月12日周三
  1. Ethan Mollick:One Useful Thing(RSS)60

    Ethan Mollick:与其只看基准分数,不如像面试一样测试你的 AI

    Ethan Mollick 撰文指出,MMLU-Pro 等公开基准存在数据污染、题目含义不明和无法度量写作、商业判断等能力的问题,但仍共同反映底层能力的上升趋势。他建议个人用自设的 vibes 测试了解模型风格,组织则应参考 OpenAI 的 GDPval 方法,用真实任务、多次重复和专家盲评来系统评估模型在自己业务上的表现,并通过 GuacaDrone 等案例观察不同模型在模糊判断上的稳定差异。

10月28日周二
  1. Johann Rehberger / Embrace The Red(RSS)78

    Claude Pirate:利用 Anthropic File API 实现数据外泄的攻击链分析

    安全研究员 Johann Rehberger 发布对 Claude Code Interpreter 网络访问功能的数据外泄攻击分析。攻击者通过间接提示词注入让 Claude 抓取用户数据(如最近的聊天记录)写入 sandbox 文件,再用攻击者自己的 ANTHROPIC_API_KEY 调用 Anthropic Files API,将最多 30MB 的文件上传到攻击者账户。

    推荐理由:作者独立复现了利用默认网络白名单中 api.anthropic.com 和攻击者 API key 的数据外泄链,并给出缓解建议。

10月20日周一
  1. Ethan Mollick:One Useful Thing(RSS)69

    Ethan Mollick 发布当前 AI 使用指南:如何选模型、触发 Deep Research 与避坑

    Ethan Mollick 发布最新一版 AI 使用指南,指出约 10% 的人类每周使用 AI,主流用途是寻求信息(21.3%)和实践指导(28.3%)。

    推荐理由:作者基于 OpenAI 公布的真实使用数据,给出免费与付费模型的取舍建议,以及各系统选模型和 Deep Research 的具体用法。

10月11日周六
9月30日周二
  1. Ethan Mollick:One Useful Thing(RSS)69

    Ethan Mollick 谈 AI 智能体做真实工作:从复现论文到 17 份 PowerPoint

    Ethan Mollick 撰文指出 AI 已能完成真实且有经济价值的工作。他给出 Claude Sonnet 4.5 提前访问权限,仅用文件和简单提示词让其复现一篇经济学论文,Claude 自行把 STATA 代码转成 Python 并成功复现结果,他还用 GPT-5 Pro 验证通过。

    推荐理由:作者亲测用 Claude Sonnet 4.5 复现经济学论文,并据此分析任务与工作的区别,给出了可迁移的专家与 AI 协作流程。

9月25日周四
  1. Johann Rehberger / Embrace The Red(RSS)74

    Johann Rehberger 演示跨智能体提权:被攻陷的 GitHub Copilot 可改写配置释放 Claude Code

    安全研究员 Johann Rehberger 提出跨智能体提权的新型攻击模式:间接提示词注入可劫持 GitHub Copilot,令其写入 Claude Code 的 MCP 配置(如 ~/.mcp.)或指令文件(如 CLAUDE.md),使 Claude Code 执行任意代码,两个智能体还可互相改写配置形成提权循环。

9月12日周五
8月20日周三
8月11日周一
8月3日周日
6月25日周三
  1. Johann Rehberger / Embrace The Red(RSS)68

    Anthropic Slack MCP Server 存在链接预览数据泄露漏洞,且已停止维护不会修复

    安全研究员 Johann Rehberger 披露 Anthropic 已弃用且停止维护的 Slack MCP Server 存在数据外泄漏洞:服务器发消息时不禁用链接 unfurling,攻击者可借助提示词注入让 AI Agent 在消息中夹带机密链接,经 Slack 抓取预览时把数据泄露给第三方服务器。

6月9日周一
5月25日周日
5月3日周六
  1. Johann Rehberger / Embrace The Red(RSS)68

    MCP 安全风险解析:不可信服务器如何借工具元数据劫持 Claude 客户端

    安全研究员 Johann Rehberger 发文解析 MCP 的安全风险并展示一条新的漏洞利用链。文章指出仅将恶意工具服务器加入会话即可劫持对话,工具元数据中的隐藏 Unicode Tag 指令可穿透 API 和 UI 层,用户在界面检查时不可见,Claude 会执行这些隐藏指令。

12月19日周四