最新精选 第 261–280 条 · 共 280 条 08:00 OpenAI Developers(RSS) 精选AI 评分 65 65 OpenAI 发布 Codex app,定位为基于智能体构建软件的指挥中心。它支持并行运行多个智能体并用 worktrees 隔离各自改动,可将工具和约定打包成可复用的 skills,还支持通过后台定时工作流把重复性工作交给 Codex。目前提供 macOS 下载(https://openai.com/codex),Windows 支持即将推出。
推荐理由:视频给出了 Codex app 的并行多任务、skills 打包和后台自动化等能力与 macOS 下载入口,读者可据此评估其对现有开发流程的影响。
00:55 Ethan Mollick:One Useful Thing(RSS) 精选AI 评分 65 65 Ethan Mollick 在宾夕法尼亚大学实验课上让几乎没有编程经验的 EMBA 学生用 Claude Code、Google Antigravity 及 ChatGPT、Claude、Gemini 四天内从零做出创业原型,成果远超以往一学期的学生水平。
推荐理由:作者基于四天创业课实测提出委托公式和管理技能框架,读者可以据此判断哪些任务适合交给 AI。
00:00 Mistral AI:News(网页) 精选AI 评分 62 62 Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的重大升级,由 Devstral 2 模型系列驱动。新增自定义 subagents、多选项澄清、slash 命令技能、统一 agent 模式和自动更新;产品现已在 Le Chat Pro 和 Team 套餐开放,支持按量付费或自带 API key。
推荐理由:官方宣布 Mistral Vibe 2.0 上线,列出 subagents、slash 命令技能等新能力和 Le Chat Pro/Team 套餐与 Devstral 2 定价,读者可据此评估工作流适配。
07:00 Ethan Mollick:One Useful Thing(RSS) 精选AI 评分 67 67 Ethan Mollick 让 Claude Code(由 Opus 4.5 驱动)独立开发一个创业项目,AI 通过三个选择题确认需求后自主工作 1 小时 14 分钟,生成数百个代码文件并部署了一个可运行、可收款的销售网站。
推荐理由:作者以亲历实验拆解 Claude Code 的上下文压缩、Skills 和 subagents 机制,非程序员也能据此理解并上手这类新工具。
08:00 OpenAI Developers(RSS) 精选AI 评分 79 79 OpenAI 发布 GPT-5.2 提示词指南,称其在企业级和智能体工作负载中提升了准确性、指令遵循、token 效率和多模态理解,但默认 reasoning_effort 为 none 且仍对提示词敏感。
推荐理由:OpenAI 官方给出 GPT-5.2 的提示词模式与迁移步骤,开发者可以直接套用其中模板和 evals 流程。
20:00 Mistral AI:News(网页) 精选AI 评分 72 72 Mistral AI 发布开源编码模型 Devstral 2(123B,修改版 MIT 许可)和 Devstral Small 2(24B,Apache 2.0),并推出开源命令行编码助手 Mistral Vibe CLI。
推荐理由:官方公布了两档开源编码模型的参数规模、SWE-bench Verified 成绩和定价,并说明各自部署门槛,可据此评估实际选用成本。
00:55 Ethan Mollick:One Useful Thing(RSS) 精选AI 评分 79 79 Ethan Mollick 实测 Google 新发布的 Gemini 3,让模型用三年前的 GPT-3 帖子演示 AI 进步,结果它直接构建了一个可玩的“糖果驱动 FTL 飞船模拟器”小游戏。
推荐理由:作者用三年前的旧帖和新任务做对照,展示了 Gemini 3 在编程智能体和独立研究上的实际表现与局限。
23:36 Johann Rehberger / Embrace The Red(RSS) 精选AI 评分 78 78 安全研究员 Johann Rehberger 发布对 Claude Code Interpreter 网络访问功能的数据外泄攻击分析。攻击者通过间接提示词注入让 Claude 抓取用户数据(如最近的聊天记录)写入 sandbox 文件,再用攻击者自己的 ANTHROPIC_API_KEY 调用 Anthropic Files API,将最多 30MB 的文件上传到攻击者账户。
推荐理由:作者独立复现了利用默认网络白名单中 api.anthropic.com 和攻击者 API key 的数据外泄链,并给出缓解建议。
02:52 Ethan Mollick:One Useful Thing(RSS) 精选AI 评分 69 69 Ethan Mollick 撰文指出 AI 已能完成真实且有经济价值的工作。他给出 Claude Sonnet 4.5 提前访问权限,仅用文件和简单提示词让其复现一篇经济学论文,Claude 自行把 STATA 代码转成 Python 并成功复现结果,他还用 GPT-5 Pro 验证通过。
推荐理由:作者亲测用 Claude Sonnet 4.5 复现经济学论文,并据此分析任务与工作的区别,给出了可迁移的专家与 AI 协作流程。
04:37 Ethan Mollick:One Useful Thing(RSS) 精选AI 评分 65 65 Ethan Mollick 在 One Useful Thing 发文,认为 AI 使用正从共同协作转向「召唤巫师」式的被动接收。
推荐理由:作者以论文重审、表格改造等一手实测为基础,提出从协作到巫师式 AI 使用的关系转变与验证难题。
05:20 Johann Rehberger / Embrace The Red(RSS) 精选AI 评分 79 79 安全研究者 Johann Rehberger 披露 Amazon Q Developer VS Code 扩展(下载量超 100 万)存在间接提示词注入漏洞:executeBash 将 find 归类为 readonly 并跳过人工确认。
推荐理由:作者亲测复现了 Amazon Q Developer 的间接提示词注入到任意命令执行路径,读者可借此理解 Agent 权限模型的风险。
03:20 Johann Rehberger / Embrace The Red(RSS) 精选AI 评分 77 77 安全研究人员 Johann Rehberger 披露 Amazon Q Developer VS Code 扩展(下载量超 100 万)存在高危漏洞:处理不可信数据时可被提示词注入劫持,通过 ping 等 readOnly 命令将开发者 .env 文件内容经 DNS 请求外泄。
推荐理由:作者第一手复现了 Amazon Q Developer 通过 DNS 请求泄露 .env 密钥的提示词注入漏洞,并披露 AWS 已静默修复但未发公告或 CVE。
05:20 Johann Rehberger / Embrace The Red(RSS) 精选AI 评分 84 84 Johann Rehberger 披露 GitHub Copilot 的提示词注入漏洞 CVE-2025-53773:注入内容可让 Copilot 写入 .vscode/settings. 并添加 "chat.tools.autoApprove"。
推荐理由:作者亲测复现了从提示词注入到本机代码执行的完整链条,并给出缓解建议,适合评估 Agent 自改配置的安全风险。
08:00 OpenAI Developers(RSS) 精选AI 评分 70 70 OpenAI 发布 Computer Use API 的示例应用 openai-cua-sample-app,包含两个计算机操作智能体:一个用 JavaScript 和 Playwright 控制浏览器,另一个用 Python 和 PyAutoGUI 通过截图、鼠标和键盘控制桌面。
推荐理由:OpenAI 官方开源了计算机操作智能体的示例应用,读者可以据此了解用代码驱动浏览器和桌面的模式。
00:00 Mistral AI:News(网页) 精选AI 评分 70 70 Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:原文给出两个模型的 SWE-Bench Verified 成绩、许可证和 API 定价,读者可据此评估在编码智能体工作流中的成本与部署选择。
20:00 Mistral AI:News(网页) 精选AI 评分 67 67 Mistral AI 发布新的 Agents API,将语言模型与代码执行、网页搜索、图像生成、文档库和 MCP 工具等内置连接器结合,并支持跨对话的持久记忆与多智能体编排。
推荐理由:官方原文给出内置连接器、有状态对话和智能体编排的具体能力,还附 SimpleQA 对比数字,便于评估它在实际工作流中的用法。
20:00 Mistral AI:News(网页) 精选AI 评分 69 69 Mistral AI 与 All Hands AI 合作发布软件工程智能体模型 Devstral,以 Apache 2.0 许可开源。
推荐理由:Mistral 自家发布,给出 SWE-Bench Verified 具体分数、开源许可和部署门槛,读者可据此评估其在本地或企业编码场景的可用性。
08:00 Answer.AI 官方研发博客(RSS) 精选AI 评分 79 79 Answer.AI 团队对 Devin 进行一个月真实任务实测,20 个任务中 14 个失败、3 个无结论、仅 3 个成功,且无法预测哪些任务会成功。Devin 在处理现有代码库、研究类任务中常陷入技术死胡同或幻觉出不存在的功能,团队结论是其自主性反而成为负担,更倾向使用 Cursor 等由开发者主导的 AI 辅助工作流。
推荐理由:作者团队用一个月、20 个真实任务实测 Devin,给出了成败分布和与 Cursor 类工作流的对比,可作为评估自主编码智能体的参照。
08:00 Lilian Weng:Lil'Log(RSS) 精选AI 评分 80 80 Lilian Weng 在博客发布长文,系统阐述以 LLM 为核心控制器的自主智能体架构,将其拆解为规划、记忆、工具使用三大组件。
推荐理由:文章把 LLM 智能体系统拆解为规划、记忆、工具使用三大组件,梳理了 ReAct、Reflexion 等代表方法与共同局限,便于建立整体认知框架。
08:00 Lilian Weng:Lil'Log(RSS) 精选AI 评分 72 72 Lilian Weng 在 Lil'Log 发表 Prompt Engineering 长文,系统介绍不更新模型权重、靠提示引导大语言模型行为的方法。
推荐理由:Lilian Weng 系统梳理了从 few-shot 到 CoT、自洽采样和 Toolformer 的提示词方法,附带示例选择与偏差校准的可迁移经验。
上一页 1 … 12 13 14