LlamaIndex 推出 LlamaExtract:从复杂文档中提取带引用与置信度分数的结构化数据
LlamaIndex 发布 LlamaExtract,可从复杂文档中提取字段级数据,并给出逐列置信度分数与可追溯引用。该工具支持多字段提取、布局与上下文感知推理、自定义或自动检测 schema,以及多种解析模式以平衡成本与精度。LlamaParse 已累计处理超 10 亿份文档,月下载量超 2500 万次,用户超 30 万。
LlamaIndex 发布 LlamaExtract,可从复杂文档中提取字段级数据,并给出逐列置信度分数与可追溯引用。该工具支持多字段提取、布局与上下文感知推理、自定义或自动检测 schema,以及多种解析模式以平衡成本与精度。LlamaParse 已累计处理超 10 亿份文档,月下载量超 2500 万次,用户超 30 万。
LlamaIndex 推出 LlamaParse,可将复杂版式、表格、图表、手写内容、复选框和图片解析为干净的 markdown。该工具支持版式感知、多模态解析和多种解析模式,可处理数百万页文档,开箱支持 100+ 种语言,并支持本地云部署。官方称已处理超 10 亿份文档,LlamaParse 用户超 30 万,包月下载量超 2500 万次。
LlamaIndex 的 LlamaParse 提供端到端文档理解,覆盖解析、提取与索引三个环节,可处理复杂版式、表格、图表、手写和图像。其 Extract 支持带置信度分数和引用的上下文感知数据提取,Index 通过智能分块与嵌入让数据可直接用于检索。
来源显示 Qwen3.5 35B-A3B 这一模型标识,正文仅包含一段 API 返回的 JSON 示例,其中 model 字段为空,usage 记录 completion_tokens 145、prompt_tokens 38、total_tokens 183。原文未提供该模型的参数、benchmark 或可用性等更多信息。
智谱 GLM 5 出现在 Baseten Base Labs 的模型研究页面中,原始标题仅给出模型名,正文为一段 chat.completion 格式的 API 返回示例,包含 38 个 prompt_tokens、145 个 completion_tokens、共 183 个 total_tokens,模型字段为空。
Baseten Base Labs 模型研究页面列出 Llama 3.3 70B Instruct,正文仅给出一段 chat.completion 格式的 API 返回示例,其中 model 字段为空,completion_tokens 为 145、prompt_tokens 为 38、total_tokens 为 183。
Goodfire 面向学术与安全实验室开放 Silico 研究访问,价格为每月 1000 美元,企业访问需另行申请演示。团队正分批邀请研究人员,并将通过邮件跟进;研究人员可在其页面查看已有研究案例。
Goodfire Research 为 Silico 推出企业版定价,面向规模化部署 AI 研究的团队。企业版在 Academic & Safety 版基础上增加专属研究员支持、组织级计费与席位管理,并提供 Zero Data Retention 选项。
Goodfire Research 发布 Silico,一款用于机器人与视觉基础模型的物理 AI 研究工具,可在生成任何一帧前直接从潜空间验证模型是否学到真实物理结构。
Goodfire 发布 Silico for Life Sciences,可追踪模型内部可解释特征,验证预测依赖真实生物结构还是数据集伪相关,并从模型内部直接挖掘生物标志物与机制假设。该工具已用于 Mayo Clinic 合作项目,对 ClinVar 全部 420 万个变异给出可解释预测,其中 83.9 万个变异实现 SOTA 致病性预测,并开源可解释预测数据库。
Goodfire 发布面向 LLM 的可解释性工具 Silico,用模型内部表征的轻量探针作为奖励信号训练 Google Gemma 3 12B,幻觉降低 58% 且性能基准无退化,成本比 LLM-as-a-judge 低约 90 倍。该工具还支持基于探针定位有害行为对应的训练数据点,过滤后重训可使相关行为减少 63%,识别并剔除问题数据源后减少 84%。Silico 已提供 macOS 版下载。
Goodfire Research 发布可解释性智能体 Silico,可围绕研究目标自主制定实验计划、并行运行并监控进度,支持任意规模模型。它集成 auto-interp、探针与 SAE 训练、模型对比、因果分析、数据归因、神经几何和激活 verbalizer 等可解释性方法与库,用于解释模型行为、调试回归问题、构建多阶段护栏以及复现对齐研究。Silico 已提供 macOS 版本下载。
OpenAI DevDay 2026 发布20多项产品和功能,包括 ChatGPT 内常驻智能体 Dots、类 Google Drive 的 Space 与原生文档套件。
推荐理由:作者基于亲手测试梳理 DevDay 二十多项发布,给出 Dots、Decisions API 等功能的实际体验细节和与竞品的初步对比。
Every 的 Dan Shipper 发表对 OpenAI 今日发布的主动式常驻智能体 Dot 的使用评测。他用 Dot 改签旧金山航班时,Dot 从他未读的 Slack 讨论中察觉拟定的周三上午录像安排并主动提醒冲突。文章目前仅对付费订阅者开放。
Fireworks 发布 ARCv3 权重更新压缩器,在 1000 个生产 RL 权重更新 delta 上,BF16 权重载荷比 ARCv2 缩小近 50%,平均 delta 约为原始 BF16 权重的 0.19%,低于 ARCv2 的 0.36%,且可无损还原训练器的精确 BF16 权重。
Fireworks 推出 GLOBAL 多区域部署选项,让单一部署身份和端点跨区域调度 GPU 容量,避免将工作负载钉在单一区域造成容量上限。其调度不进入请求路径,由 DNS 就近选择健康网关并按预生成路由记录转发,支持 GLOBAL、US、EUROPE、APAC、CANADA 范围。七天生产观测显示,可全球部署客户部署的请求成功率从单区域的 99.269% 升至多区域的 99.992%。
Fireworks AI 推出 FireRouter with Opus,在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间按每轮任务做缓存感知路由,首次可作为独立 serverless 端点供任意 Fireworks 账号调用。
推荐理由:厂商给出内部 A/B 测试的成本与准确率数据,读者可以据此评估缓存感知路由在编码工作流中的省费空间。
Cursor 发布云端智能体自托管机器功能,工具执行可迁移到团队自管的基础设施,智能体循环、推理和规划仍留在 Cursor 云端。
推荐理由:原文给出了自托管机器的适用场景、worker 机制和沙箱合作生态,读者可以据此判断是否把智能体执行迁回自有环境。
Cursor 推出 Projects,让开发者以项目为单位承接功能开发、迁移和长期维护等工作,可维持数月上下文、向数千个子智能体委派任务并自动处理周期性工作。每个 Project 默认在云端运行并同步共享上下文,协调智能体只负责委派而不写代码,还可订阅 Slack 频道、按计划运行或跟踪 PR。
推荐理由:官方介绍了 Projects 的协调智能体机制和内部使用数据,读者可以对照自己的多 PR 工作流评估是否适用。
Cursor 推出两款软件开发 Bots,Rollouts 全程监控变更从 PR 到生产环境、自动标记回归并支持回滚,Security Reviewer 在每个 PR 上像安全工程师一样审查代码并支持一键修复。
推荐理由:原文来自官方,详细说明了两个 bot 的工作机制和适用场景,读者可对照自身部署与安全审查流程评估可用性。
Cohere 推出 Embed 5 系列前沿嵌入模型,定位为当前最优的检索(state-of-the-art retrieval),已在 Pro 和 Fast 两个档位上线。该系列属于 Cohere 的语义表示模型产品线,官方称其为新一代前沿嵌入模型家族。
Cognition 研究员 Eric Lu 带领多个 Devin 会话构建了目前性能最高的 GPU lattice siever,用修改版 CADO-NFS 在约 4,900 GPU 天、约 $400k 的成本上完成 RSA-260 分解,创下公开解决的 RSA Factoring Challenge 最大规模纪录,超过 2020 年 2 月的 RSA-250。
推荐理由:原文详细披露 GPU 格子筛实现、成本估算和人机分工,读者可以了解 Agent 驱动大型科研工程的实际工作流。
Cognition 在 Devin Desktop 和 CLI 中开放 Fusion,一个由前沿模型主导规划审查、高性价比模型执行编码的双智能体 harness,官方称在主要编码基准上最高节省 39% 成本。
推荐理由:原文给出双智能体架构、实测成本数据与模型配对调优经验,读者可据此理解按任务定价与多智能体分工的设计取舍。
Anthropic 宣布 Claude Cowork 与聊天合并为一个 Claude,任务不再需要用户选择入口,可在合上电脑后继续完成。同时发布 Claude Docs 和 Claude Slides,Claude Design 也可在对话中直接使用,三者均在付费计划上处于 beta。
推荐理由:官方说明了 Cowork 与聊天合并的原因和落地方式,读者可以据此判断现有工作流会受哪些影响。
Anthropic 为企业版提供三种购买路径:可直接用信用卡在几分钟内自助结账升级 Enterprise;也可通过购买智能体咨询问题、获取个性化报价并当天结账,必要时可升级至销售团队;销售团队仅支持 500+ 席位部署和 BAA 等复杂交易。
Anthropic 上线 Claude 平台 Console,提供两种开发方式:Messages 为直连模型,需自行构建每轮对话、管理会话状态并编写工具循环;Managed Agents 提供全托管智能体基础设施,支持有状态会话与持久事件历史。平台同时提供 Claude 模型家族选型指引,涵盖研究、编码、写作等场景,Haiku 4.5 主打最快速度与最低成本。
Anthropic 发布 Claude Code 入门文档,该智能体编程工具可读取代码库、编辑文件、运行命令,支持终端、IDE、桌面应用和浏览器四种使用界面。终端 CLI、VS Code 和 JetBrains 插件还支持第三方模型提供商,多数界面需 Claude 订阅或 Anthropic Console 账户。
Claude 提供桌面与移动端应用下载,覆盖 macOS、Windows(含 arm64)、Linux(beta,支持 Ubuntu 和 Debian)以及 iOS 和 Android,所有套餐(Free、Pro、Max、Team、Enterprise)均可使用,部分功能仅限付费计划。
推荐理由:原文汇总了 Claude 桌面与移动端应用的下载入口、各平台支持范围和付费限制,读者可据此判断是否迁移工作流。
NVIDIA 在 IFA 2026 宣布与 Microsoft 及伙伴合作加速本地 AI,包括 Hermes Agent、OpenClaw 和 Perplexity Portable Computer 的简化本地模型配置,llama.cpp 与 vLLM 带来最高 1.9x 推理提升,并推出开源工具 NVIDIA PAIR 在局域网内分发推理请求。
NVIDIA 在 IBC 2026 宣布大幅扩展 NVIDIA AI for Media,为广播、体育与流媒体工作流新增 GPU 加速 SDK、NIM 微服务与蓝图。
Perplexity 在 Windows 版应用中推出 Portable Computer,可在兼容的 NVIDIA GeForce RTX PC 和 RTX PRO Workstation 上本地运行,此前已支持 DGX Spark 和 Linux RTX PC。
Cloudflare 为 AI Gateway 的 User Insights 新增模型过度使用(Overkill)视图,可识别所选模型能力超出任务需求的情况,并展示关联用户、智能体与应用。
Cloudflare 发布 Pay Per Use beta,AI 公司为内容的具体使用出价,出版方在 dashboard 中决定是否接受,Cloudflare 负责记录使用、向买方计费并按月付款给出版方。
Cloudflare 推出 Monetization Gateway 封闭测试版,让域名拥有者通过 HTTP 402 状态码对访问网站、API、MCP 工具或数据集的智能体按请求收费,支付经 Coinbase x402 Facilitator 在 Base 区块链上以 USDC 结算。
Cloudflare Registrar 推出全新域名搜索,支持全部 420+ 扩展、即时响应、排序过滤和透明定价,并在 Birthday Week 对 .io、.dev、.app、.tech 等提供首年注册折扣。
Cloudflare 为 Workers 推出内置错误监控功能 Issues,现处开放测试阶段。无需额外 SDK,一行配置即可自动归组重复异常、5xx 响应和错误日志。
Cloudflare 发布 Auto Router 公测,通过 AI Gateway 使用,将模型设为 cloudflare/auto 即可自动把每个请求路由到能力足够的最便宜模型。
Baseten 发布训练 SDK Loops(早期访问),支持 256K+ 序列长度、2T+ 参数模型训练与异步 RL,训练完成后一条命令即可部署到 Baseten 推理栈。
Baseten 发布 Model APIs,在 Baseten Inference Stack 上按需运行 DeepSeek V4.1 Flash、DeepSeek V4 Pro 0813、Kimi K3、GLM-5.3 系列及 NVIDIA Nemotron 3 Ultra 等前沿开源模型。
Baseten 推出 Dedicated Inference 专用推理部署,基于 Baseten Inference Stack 支持跨云自动扩缩容,官方称可实现 6 倍 GPU 利用率提升和 5-10 倍成本降低。