Prime Intellect 在 PRIME-RL 中引入多智能体系统训练
Prime Intellect 的 PRIME-RL 强化学习栈从训练单个智能体扩展到多智能体系统,可编程任意智能体交互、选择哪些角色参与学习,并在完整交互中分配信用。
Prime Intellect 的 PRIME-RL 强化学习栈从训练单个智能体扩展到多智能体系统,可编程任意智能体交互、选择哪些角色参与学习,并在完整交互中分配信用。
Prime Intellect 宣布 Prime Sandboxes 正式全面开放,这是一种为智能体 RL 训练设计的 MicroVM 沙盒,此前已创建约 30M 个沙盒。
微软推出 MAI-Code-1.1-Flash 模型,已用于 GitHub Copilot,在命令行编码和 .NET 开发任务上表现提升,用更少 token 完成任务且成本低于 6 月版本。微软还发布开源智能体框架 Orchard,为训练和评估能写代码、浏览网页的 AI 智能体提供可复用环境。此外,微软研究模型 CARE-X 可将多项放射学任务整合,在胸部 X 光任务和真实患者数据上表现良好。
MiniMax 发布语音模型 Speech 2.8,新增原生音效标签支持,可模拟 "um"、"uh" 等口语填充词及呼吸、停顿,并实现 10 秒样本的高保真声音克隆。该版本还重构处理引擎以消除背景噪声与合成失真,并率先修复普通话-日语跨语言场景中的口音串扰问题。Speech 2.8 现已上线。
AI 时尚应用 Alta Daily 基于 Meta 的 Segment Anything Model(SAM)完成服装分割与数字化,已处理超 2000 万张图片。
Meta 的 DINOv3 与 SAM 正被匹兹堡大学 RAMMP 项目用于辅助机器人,在电池供电的边缘设备上实现实时环境感知。RAMMP 的感知系统基于 RF-DETR,并用 DINOv2 嵌入微调、由 SAM 自动标注训练数据,实现 360 度环境感知与自适应物体检测。团队已把基于 DINO 的图像传感器查询功能集成进首个原型,可检测自动门按钮、杯子和路缘,目前正转向语音与触控输入。
LlamaIndex 推出面向行政运营的文档智能与智能体工作流方案,宣称可消除手动流程、为更高阶任务释放 80% 时间。方案包含发票评估器、合同数据智能体、表单处理器、政策文档智能体、员工入职助手和合规报告器六类组件,基于 LlamaParse 解析含图表和表格的复杂文档,并提供引用溯源与置信度分数。
LlamaIndex 面向研发场景推出文档智能与智能体工作流方案,宣称可将产品研发周期加速 80%。方案包含 R&D assistant、System design navigator、Technical spec comparator 等 6 类智能体,基于 LlamaParse 解析图表与表格等复杂文档,并提供引用溯源与置信度分数。
LlamaParse 团队推出开源文档解析工具 LiteParse,支持 PDF、DOCX、PPTX、XLSX 和图片,全程本地运行,无云端调用、无 LLM token 消耗。
推荐理由:原文来自产品官方,清晰给出了 LiteParse 的本地解析方式、支持格式与坐标输出等能力边界,便于与 LlamaParse 作取舍。
LlamaIndex 的 Index 产品提供智能分块与嵌入能力,让数据为检索做好准备,支持连接器增量同步、自定义嵌入模型、多模态索引以及 OTEL 等测试评估集成。官方数据显示其已处理超 1B 份文档,LlamaParse 用户超 300k,包月下载量超 25M。KPMG 等团队用其标准化企业知识助手开发,工程师得以从数据管线维护转向 LLM 应用开发。
LlamaIndex 发布 LlamaExtract,可从复杂文档中提取字段级数据,并给出逐列置信度分数与可追溯引用。该工具支持多字段提取、布局与上下文感知推理、自定义或自动检测 schema,以及多种解析模式以平衡成本与精度。LlamaParse 已累计处理超 10 亿份文档,月下载量超 2500 万次,用户超 30 万。
LlamaIndex 推出 LlamaParse,可将复杂版式、表格、图表、手写内容、复选框和图片解析为干净的 markdown。该工具支持版式感知、多模态解析和多种解析模式,可处理数百万页文档,开箱支持 100+ 种语言,并支持本地云部署。官方称已处理超 10 亿份文档,LlamaParse 用户超 30 万,包月下载量超 2500 万次。
LlamaIndex 的 LlamaParse 提供端到端文档理解,覆盖解析、提取与索引三个环节,可处理复杂版式、表格、图表、手写和图像。其 Extract 支持带置信度分数和引用的上下文感知数据提取,Index 通过智能分块与嵌入让数据可直接用于检索。
来源显示 Qwen3.5 35B-A3B 这一模型标识,正文仅包含一段 API 返回的 JSON 示例,其中 model 字段为空,usage 记录 completion_tokens 145、prompt_tokens 38、total_tokens 183。原文未提供该模型的参数、benchmark 或可用性等更多信息。
智谱 GLM 5 出现在 Baseten Base Labs 的模型研究页面中,原始标题仅给出模型名,正文为一段 chat.completion 格式的 API 返回示例,包含 38 个 prompt_tokens、145 个 completion_tokens、共 183 个 total_tokens,模型字段为空。
Baseten Base Labs 模型研究页面列出 Llama 3.3 70B Instruct,正文仅给出一段 chat.completion 格式的 API 返回示例,其中 model 字段为空,completion_tokens 为 145、prompt_tokens 为 38、total_tokens 为 183。
Goodfire 面向学术与安全实验室开放 Silico 研究访问,价格为每月 1000 美元,企业访问需另行申请演示。团队正分批邀请研究人员,并将通过邮件跟进;研究人员可在其页面查看已有研究案例。
Goodfire Research 为 Silico 推出企业版定价,面向规模化部署 AI 研究的团队。企业版在 Academic & Safety 版基础上增加专属研究员支持、组织级计费与席位管理,并提供 Zero Data Retention 选项。
Goodfire Research 发布 Silico,一款用于机器人与视觉基础模型的物理 AI 研究工具,可在生成任何一帧前直接从潜空间验证模型是否学到真实物理结构。
Goodfire 发布 Silico for Life Sciences,可追踪模型内部可解释特征,验证预测依赖真实生物结构还是数据集伪相关,并从模型内部直接挖掘生物标志物与机制假设。该工具已用于 Mayo Clinic 合作项目,对 ClinVar 全部 420 万个变异给出可解释预测,其中 83.9 万个变异实现 SOTA 致病性预测,并开源可解释预测数据库。
Goodfire 发布面向 LLM 的可解释性工具 Silico,用模型内部表征的轻量探针作为奖励信号训练 Google Gemma 3 12B,幻觉降低 58% 且性能基准无退化,成本比 LLM-as-a-judge 低约 90 倍。该工具还支持基于探针定位有害行为对应的训练数据点,过滤后重训可使相关行为减少 63%,识别并剔除问题数据源后减少 84%。Silico 已提供 macOS 版下载。
Goodfire Research 发布可解释性智能体 Silico,可围绕研究目标自主制定实验计划、并行运行并监控进度,支持任意规模模型。它集成 auto-interp、探针与 SAE 训练、模型对比、因果分析、数据归因、神经几何和激活 verbalizer 等可解释性方法与库,用于解释模型行为、调试回归问题、构建多阶段护栏以及复现对齐研究。Silico 已提供 macOS 版本下载。
Fireworks AI 发布 Specialized Intelligence Index(SII),汇集开放、闭源和专用模型在医疗、法律、网络安全、金融、客服、生产力、软件七个领域的从业者设计基准上的表现。
Fireworks 发布 ARCv3 权重更新压缩器,在 1000 个生产 RL 权重更新 delta 上,BF16 权重载荷比 ARCv2 缩小近 50%,平均 delta 约为原始 BF16 权重的 0.19%,低于 ARCv2 的 0.36%,且可无损还原训练器的精确 BF16 权重。
Fireworks 推出 GLOBAL 多区域部署选项,让单一部署身份和端点跨区域调度 GPU 容量,避免将工作负载钉在单一区域造成容量上限。其调度不进入请求路径,由 DNS 就近选择健康网关并按预生成路由记录转发,支持 GLOBAL、US、EUROPE、APAC、CANADA 范围。七天生产观测显示,可全球部署客户部署的请求成功率从单区域的 99.269% 升至多区域的 99.992%。
Fireworks AI 推出 FireRouter with Opus,在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间按每轮任务做缓存感知路由,首次可作为独立 serverless 端点供任意 Fireworks 账号调用。
推荐理由:厂商给出内部 A/B 测试的成本与准确率数据,读者可以据此评估缓存感知路由在编码工作流中的省费空间。
Cursor 发布云端智能体自托管机器功能,工具执行可迁移到团队自管的基础设施,智能体循环、推理和规划仍留在 Cursor 云端。
推荐理由:原文给出了自托管机器的适用场景、worker 机制和沙箱合作生态,读者可以据此判断是否把智能体执行迁回自有环境。
Cursor 推出 Projects,让开发者以项目为单位承接功能开发、迁移和长期维护等工作,可维持数月上下文、向数千个子智能体委派任务并自动处理周期性工作。每个 Project 默认在云端运行并同步共享上下文,协调智能体只负责委派而不写代码,还可订阅 Slack 频道、按计划运行或跟踪 PR。
推荐理由:官方介绍了 Projects 的协调智能体机制和内部使用数据,读者可以对照自己的多 PR 工作流评估是否适用。
Cursor 推出两款软件开发 Bots,Rollouts 全程监控变更从 PR 到生产环境、自动标记回归并支持回滚,Security Reviewer 在每个 PR 上像安全工程师一样审查代码并支持一键修复。
推荐理由:原文来自官方,详细说明了两个 bot 的工作机制和适用场景,读者可对照自身部署与安全审查流程评估可用性。
Cohere 推出 Embed 5 系列前沿嵌入模型,定位为当前最优的检索(state-of-the-art retrieval),已在 Pro 和 Fast 两个档位上线。该系列属于 Cohere 的语义表示模型产品线,官方称其为新一代前沿嵌入模型家族。
Cognition 在 Devin Desktop 和 CLI 中开放 Fusion,一个由前沿模型主导规划审查、高性价比模型执行编码的双智能体 harness,官方称在主要编码基准上最高节省 39% 成本。
推荐理由:原文给出双智能体架构、实测成本数据与模型配对调优经验,读者可据此理解按任务定价与多智能体分工的设计取舍。
Anthropic 宣布 Claude Cowork 与聊天合并为一个 Claude,任务不再需要用户选择入口,可在合上电脑后继续完成。同时发布 Claude Docs 和 Claude Slides,Claude Design 也可在对话中直接使用,三者均在付费计划上处于 beta。
推荐理由:官方说明了 Cowork 与聊天合并的原因和落地方式,读者可以据此判断现有工作流会受哪些影响。
Anthropic 为企业版提供三种购买路径:可直接用信用卡在几分钟内自助结账升级 Enterprise;也可通过购买智能体咨询问题、获取个性化报价并当天结账,必要时可升级至销售团队;销售团队仅支持 500+ 席位部署和 BAA 等复杂交易。
Anthropic 上线 Claude 平台 Console,提供两种开发方式:Messages 为直连模型,需自行构建每轮对话、管理会话状态并编写工具循环;Managed Agents 提供全托管智能体基础设施,支持有状态会话与持久事件历史。平台同时提供 Claude 模型家族选型指引,涵盖研究、编码、写作等场景,Haiku 4.5 主打最快速度与最低成本。
Anthropic 发布 Claude Code 入门文档,该智能体编程工具可读取代码库、编辑文件、运行命令,支持终端、IDE、桌面应用和浏览器四种使用界面。终端 CLI、VS Code 和 JetBrains 插件还支持第三方模型提供商,多数界面需 Claude 订阅或 Anthropic Console 账户。
Claude 提供桌面与移动端应用下载,覆盖 macOS、Windows(含 arm64)、Linux(beta,支持 Ubuntu 和 Debian)以及 iOS 和 Android,所有套餐(Free、Pro、Max、Team、Enterprise)均可使用,部分功能仅限付费计划。
推荐理由:原文汇总了 Claude 桌面与移动端应用的下载入口、各平台支持范围和付费限制,读者可据此判断是否迁移工作流。
NVIDIA 在 IFA 2026 宣布与 Microsoft 及伙伴合作加速本地 AI,包括 Hermes Agent、OpenClaw 和 Perplexity Portable Computer 的简化本地模型配置,llama.cpp 与 vLLM 带来最高 1.9x 推理提升,并推出开源工具 NVIDIA PAIR 在局域网内分发推理请求。
NVIDIA 在 IBC 2026 宣布大幅扩展 NVIDIA AI for Media,为广播、体育与流媒体工作流新增 GPU 加速 SDK、NIM 微服务与蓝图。
Perplexity 在 Windows 版应用中推出 Portable Computer,可在兼容的 NVIDIA GeForce RTX PC 和 RTX PRO Workstation 上本地运行,此前已支持 DGX Spark 和 Linux RTX PC。
Cloudflare 为 AI Gateway 的 User Insights 新增模型过度使用(Overkill)视图,可识别所选模型能力超出任务需求的情况,并展示关联用户、智能体与应用。