Together AI 首日上线 NVIDIA Nemotron 3 Super,开发者可专用推理部署
NVIDIA Nemotron 3 Super 登陆 Together AI,模型为 120B 参数(12B 激活)、Transformer 与 Mamba 混合 MoE 架构,支持 1M-token 上下文窗口,生成速度较当前领先开源模型高 50% 以上。
NVIDIA Nemotron 3 Super 登陆 Together AI,模型为 120B 参数(12B 激活)、Transformer 与 Mamba 混合 MoE 架构,支持 1M-token 上下文窗口,生成速度较当前领先开源模型高 50% 以上。
browser-use 在 GitHub 上线 chat-ui-example 仓库,这是一个使用 Browser Use v3 SDK 构建的 AI 聊天应用示例。该仓库为开发者提供了将 Browser Use v3 SDK 集成到聊天界面的参考实现。
Together AI 在首届 AI Native Conf 上发布七项研究与产品成果,覆盖 Kernels、强化学习与算法推理优化三个方向。
Steve Yegge 宣布推出 Wasteland,一个把数千个 Gas Town 通过信任网络连接起来的联邦化协作系统,核心是共享的 wanted board 和基于 Git fork/merge 模型的 stamp 认证协议。
OpenAI 发布 Codex 模型(API 中为 gpt-5.3-codex)的提示词指南,推荐 medium 推理力度作为交互编码的平衡选择,高难度任务可用 high 或 xhigh。
推荐理由:官方给出从 GPT-5 系列迁移到 gpt-5.3-codex 的提示词、工具和 phase 参数细节,可直接照做。
Sayash Kapoor 等人发布论文《Towards a Science of AI Agent Reliability》,借鉴航空、核安全等领域将可靠性分解为12个维度,在 GAIA 和 TauBench 两个基准上评测 OpenAI、Google、Anthropic 的14个模型,共执行500次运行。
Ethan Mollick 发布第八版 AI 使用指南,指出 AI 使用方式已从聊天机器人转向智能体,提出按模型、应用和 harness 三层来选择工具。
推荐理由:作者亲历多个 AI 工具的使用,提出模型、应用与 harness 三层框架,可帮助读者按实际任务选择合适工具。
Answer.AI 的 Piotr Czapla 报告,Claude Opus 4.6、Sonnet 4.5、Haiku 4.5 会幻觉调用未被授予的工具(如 read_secret、GitHub MCP 的 get_me),且 API 不拦截;在 Gemini、Grok 上也能复现类似行为。
推荐理由:作者实测多家模型会调用未授权工具且 API 不拦截,指出这会瓦解能力分离防御,并给出客户端校验的简单修复。
Sierra 构建了 Multi-Model Router(MMR)与拥塞感知的 provider 选择器两层基础设施,在 provider 出现限流或故障时保持智能体行为一致。
QwenLM 在 GitHub 开源 WebWorld,一个大规模网页世界模型,用于在模拟浏览器环境中训练 web agent。该方式可避开真实网页带来的延迟和安全问题。原文仅提供简要介绍,更多细节见 https://github.com/QwenLM/WebWorld。
OpenBMB 推出 EdgeClaw,一个基于 OpenClaw 的边缘-云协同个人 AI 助手。该仓库由清华 NLP 团队开源,定位为端云协同架构的个人助理项目。
browser-use 在 GitHub 上线 mix-eval-go,一个用 Go 编写的评测编排器,用于通过浏览器自动化智能体运行 Mix Eval 任务。该仓库目前仅给出这一句功能定位,未披露支持的模型、任务规模或性能数据。
browser-use 推出 Cloud SDK,用于接入其云端浏览器智能体能力。该 SDK 以 browser-use/sdk 仓库形式发布,具体功能与接口细节尚未在现有信息中披露。
browser-use 推出 webagents.md,让网站直接在浏览器中向 AI 智能体暴露可调用的工具。该仓库目前仅给出这一句说明,未披露具体实现方式、支持的模型或可用范围。
安全研究员 Johann Rehberger 演示了如何用不可见的 Unicode Tag 码点在 Agent Skill 的 SKILL.md 中植入人类审查看不见的提示词注入后门,并在 OpenAI 官方安全最佳实践 Skill 中加入隐藏指令,Claude Code 执行后打印了 Trust No AI 并运行了 curl 管道 bash 命令。
Modem 完成 440 万美元融资,由 Accel 领投、Inovia Capital 参投,用于打造面向智能体编程时代的自动分诊产品经理。Modem 可连接 Slack、Discord、GitHub、Linear、email 等渠道,从产品讨论中构建上下文图谱,自动将杂乱对话归类为结构化主题并排定优先级,无需手动打标签或分诊。
FireRedTeam 推出 AI 视频剪辑智能体 FireRed-OpenStoryline,通过自然语言交互、LLM 驱动的规划与精准工具编排,将手动剪辑转变为意图驱动的导演式创作。该智能体支持人在回路中的透明创作流程,并提供可复用的 Style Skills,以保持叙事风格的一致与专业。
Sierra 在进入第三年之际宣布 ARR 超过 1.5 亿美元,此前用七个季度达到 1 亿美元 ARR,并迎来首个 5000 万美元季度。
美团发布 LongCat-Flash-Lite,非思考型 68.5B 参数 MoE 模型,激活参数约 3B,支持 256k 上下文,权重以 MIT 协议开源在 HuggingFace。模型集成 N-gram 嵌入表提升性能与推理速度,官方评测显示其 SWE-Bench 达 54.40,agentic 与编码能力在同规模模型中具竞争力,并给出 transformers 与 SGLang 部署方案。
OpenAI 发布论文《Preventing URL-Based Data Exfiltration in Language-Model Agents》,详解其针对语言模型智能体 URL 数据外泄的缓解措施。
OpenAI 发布 Codex app,定位为基于智能体构建软件的指挥中心。它支持并行运行多个智能体并用 worktrees 隔离各自改动,可将工具和约定打包成可复用的 skills,还支持通过后台定时工作流把重复性工作交给 Codex。目前提供 macOS 下载(https://openai.com/codex),Windows 支持即将推出。
推荐理由:视频给出了 Codex app 的并行多任务、skills 打包和后台自动化等能力与 macOS 下载入口,读者可据此评估其对现有开发流程的影响。
Steve Yegge 依据对 AI 指数级进步的判断,提出软件生存的“选择压力”模型,核心论点是节省 token 即节省认知的软件更可能在 Karpathy 所说的 Software 3.0 时代存活。
Ethan Mollick 在宾夕法尼亚大学实验课上让几乎没有编程经验的 EMBA 学生用 Claude Code、Google Antigravity 及 ChatGPT、Claude、Gemini 四天内从零做出创业原型,成果远超以往一学期的学生水平。
推荐理由:作者基于四天创业课实测提出委托公式和管理技能框架,读者可以据此判断哪些任务适合交给 AI。
Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的重大升级,由 Devstral 2 模型系列驱动。新增自定义 subagents、多选项澄清、slash 命令技能、统一 agent 模式和自动更新;产品现已在 Le Chat Pro 和 Team 套餐开放,支持按量付费或自带 API key。
推荐理由:官方宣布 Mistral Vibe 2.0 上线,列出 subagents、slash 命令技能等新能力和 Le Chat Pro/Team 套餐与 Devstral 2 定价,读者可据此评估工作流适配。
美团 LongCat 发布 LongCat-Flash-Lite,一个非思考型 68.5B 参数 MoE 模型,激活参数约 3B,通过 YaRN 支持 256k 上下文,MIT 许可开源。
上海人工智能实验室 InternLM 推出 EMemBench,一个面向 VLM 智能体的情景记忆交互式基准,论文已被 EMNLP 2026 Findings 收录。该基准以交互方式评测智能体的情景记忆能力,官方仓库已同步开放。
Sierra 发布 Expert Answers,可在 AI 智能体遇到知识缺口、转交人工客服解决后,自动从该次解决过程生成可审核的知识草稿并回灌给智能体。一家数字健康公司用其基于真实客服对话生成的文章做小流量测试,解决率提升 4% 且未增加客服工作量,随后全面铺开。该功能还可配合 Live Assist 将知识同步给整个客服团队。
美团 LongCat 团队发布更新版 LongCat-Flash-Thinking-2601,总参数 560B(激活 27B)的 MoE 大推理模型,FP8 权重以 MIT 许可开源在 HuggingFace。
美团发布 LongCat-Flash-Thinking-2601,总参数 560B、激活 27B 的 MoE 大推理模型,权重以 MIT License 开源。更新通过环境扩展与多环境强化学习、噪声课程训练强化智能体能力,并新增 Heavy Thinking Mode,在智能体搜索、工具调用等基准上取得有竞争力的成绩,已在 SGLang、vLLM 支持部署并上线 longcat.ai。
Sierra 与 Stellarus 达成合作,帮助健康计划大规模部署 AI 智能体,双方与 Blue Shield of California 合作推出的 AI 语音智能体已运行六个月,在数千次会员互动中取得 4.4/5 的客户满意度评分。该智能体基于 Sierra 平台构建,可 24/7 解答福利与承保范围等问题,无需等待接通。双方下一步将从被动支持转向更主动的 AI 驱动互动。
OpenBMB 发布 AgentCPM,一个用于训练和评测各类 LLM 智能体的端到端基础设施。该仓库同时覆盖智能体的训练与评测环节,具体功能、支持模型及可用方式尚未在现有信息中披露。
Ethan Mollick 让 Claude Code(由 Opus 4.5 驱动)独立开发一个创业项目,AI 通过三个选择题确认需求后自主工作 1 小时 14 分钟,生成数百个代码文件并部署了一个可运行、可收款的销售网站。
推荐理由:作者以亲历实验拆解 Claude Code 的上下文压缩、Skills 和 subagents 机制,非程序员也能据此理解并上手这类新工具。
Johann Rehberger 在 39C3 发布演讲“Agentic ProbLLMs: Exploiting AI Computer-Use and Coding Agents”,内容为其针对智能体系统漏洞的安全研究及 Month of AI Bugs 项目,并包含大量演示。
Sierra 发布 Workspaces,把 GitHub、Figma 式的协作模式引入 AI 智能体开发,让团队成员在各自 Workspace 中并行构建、测试,再通过合并生成 snapshot 并发布到 QA、staging 或生产环境。
小米发布 MiMo-V2-Flash 基础模型,主打高效推理、编码与智能体能力。该模型以 MiMo-V2-Flash 为名在 GitHub 新仓库开源,具体参数规模、benchmark 分数与上下文长度尚未在现有信息中披露。
OpenAI 发布 GPT-5.2 提示词指南,称其在企业级和智能体工作负载中提升了准确性、指令遵循、token 效率和多模态理解,但默认 reasoning_effort 为 none 且仍对提示词敏感。
推荐理由:OpenAI 官方给出 GPT-5.2 的提示词模式与迁移步骤,开发者可以直接套用其中模板和 evals 流程。
Sierra 发布 Visual Attachments,让聊天智能体在对话中直接嵌入进度条、安全输入框、快捷按钮等可视化 UI 组件,无需替换对话即可缩短完成路径。这些组件用 React 构建、可在 Agent Studio 中零代码部署,并支持无障碍、响应式与可测量。Rocket Mortgage 的预资格智能体采用后,客户转接银行专员时的转化率在再融资和购房流程中均提升 4 倍。
Mistral AI 发布开源编码模型 Devstral 2(123B,修改版 MIT 许可)和 Devstral Small 2(24B,Apache 2.0),并推出开源命令行编码助手 Mistral Vibe CLI。
推荐理由:官方公布了两档开源编码模型的参数规模、SWE-bench Verified 成绩和定价,并说明各自部署门槛,可据此评估实际选用成本。
安全研究员 Johann Rehberger 提出偏差正常化概念,指行业正逐渐把过度依赖 LLM 输出的不安全做法变成常态,视不可靠模型输出为可信。
browser-use 上线 gemini-demo 仓库,用于演示 Gemini 3 填写一份模拟申请表。该 demo 展示了 Gemini 3 在浏览器中自动完成表单填写的能力,仓库已在 GitHub 公开。