Mooncake 如何为 Miles 加速 RL rollout 数据批量传输
Mooncake 社区发布博客,介绍 Mooncake 如何为大规模强化学习框架 Miles 解决 rollout 数据传输瓶颈。
Mooncake 社区发布博客,介绍 Mooncake 如何为大规模强化学习框架 Miles 解决 rollout 数据传输瓶颈。
LlamaIndex 发文分析 LLM OCR(用大语言模型或视觉语言模型把文档图像转成文本和结构化数据)虽然降低了难文档的错误率,却把错误形态从可见的乱码变成流畅但静默的替换、遗漏和重复循环,传统按字符置信度和正则校验构建的 OCR 工具难以捕获。
智能 OCR 将传统字符识别与机器学习、版面感知、语义抽取和校验逻辑结合,把文档转成结构化数据而非原始文本,并支持字段级置信度评分与规则校验。相比传统 OCR 输出扁平文本、遇到未见版式即失效,它可跨版面泛化、支持手写内容,并逐步演进到能自我验证、处理歧义的智能体文档工作流。
LlamaIndex 发文讲解 OCR 自动化与单纯文本提取的区别,指出生产准确性主要取决于解析前后的输入质量、置信度阈值校准和直通处理率,并给出 85-92% 到 90-95% 的直通率基准。
LlamaIndex 用 Temporal 替换 RabbitMQ,支撑起每天数千万页文档的处理,并驱动其最新的 Batch API 发布。Temporal 作为持久化函数执行运行时,将业务逻辑组织为确定性的 Workflow 与 Activity,由 Worker 执行、服务端持久保存执行状态,失败可从断点重试。
LlamaIndex 尝试让静态嵌入模型实现 ColBERT 式 late-interaction 检索,发现直接用 MaxSim 打分在公开基准上反而输给池化(mean NDCG 0.418 vs 0.504)。
LlamaParse 面向 PDF 表格提取,解决 PDF 只存字符坐标、不存行列结构的问题,需从空间布局推断行列关系。文章指出扁平文本提取、模板规则系统和单纯 OCR 都会在生产文档上失效,因为无边框表格、跨页表头、合并单元格、嵌套表格和扫描件会破坏简单假设。
LlamaIndex 提出面向 10-100 份文档的临时数据室场景,采用两遍式处理,先用免费工具(如 LiteParse)快速提取文本并检索,再对相关页面用 VLM 做 just-in-time OCR。
LlamaIndex 发文讲解如何为文档抽取结果选择置信度阈值,实现自动接受与人工复核的划分,目标是在给定精度(如 97%)下最大化自动化比例。
LlamaIndex 撰文指出,OCR 文档处理中每字段准确率与每文档自动化率存在单位错配,20 个字段的发票在 97% 字段准确率下整单全对的概率约 54%,而路由门控读的是置信信号而非准确率。
LlamaIndex 发文指出,AI 文档抽取的阅读环节已很成熟,生产管线丢失精度的主因是 schema 设计而非模型。文章以 180 页信贷协议中一个利率字段对应三个真实数值为例,区分了解析失败与规格失败两类表现相同的错误,列举 required 字段被编造、同名字段多义、重复结构被压成标量等常见缺陷,并给出 nullable、语义消歧、数组化等修正示例。
LlamaIndex 解析了 VLM 处理表单的失败模式:VLM 面向通用推理优化,推理能力提升并不能改善解析结果,且成本高、可靠性差。LlamaParse 专为文档与表单理解构建,将表单表示为含 id、label、field、value 的字段与 section 嵌套树,输出 JSON,以更低成本超越通用 VLM。表单的复选框勾选状态等细微错误会完全改变下游智能体的动作。
LlamaIndex 介绍用 LlamaParse 与 LlamaExtract 实现发票 OCR 数据提取:LlamaParse 将发票作为结构化文档处理,结合 OCR、版面解析、表格提取与语义建模,输出干净可校验的结构化数据。LlamaExtract 支持 GUI 单次测试最多 20 个文件,生产环境可通过 Python SDK 或 API 并行处理 PDF、JPG、PNG 及多页文件。
LlamaIndex 发文盘点图像 OCR 的四类主流方案:开源引擎(Tesseract、PaddleOCR、EasyOCR、docTR)、云 API(Google Cloud Vision/Document AI。
LlamaCloud 推出 VLM 驱动的 agentic OCR 引擎,将视觉识别、版面理解、结构推理与校验整合进单一系统,直接输出结构化 JSON、Markdown 或 HTML,而非扁平文本。
表格 OCR 通过版面感知处理、结构解析和 schema 对齐提取,把 PDF、扫描件中的表格转为 JSON、CSV 或 Excel 等机器可读格式。其流程分为表格检测、结构识别和数据提取三阶段,需处理合并单元格、多行记录和无边框表格等难点。
LlamaIndex 提出智能体文档处理(ADP),用具备目标、工具调用和决策能力的 AI Agent 自主完成文档工作流,仅在低置信度决策点才引入人工。其 LlamaParse 采用多个专用文档理解 Agent 协同解析,用语言模型处理文本、视觉模型解读图表图像、布局感知计算机视觉识别结构,无需因版式变化重新训练。相比基于模板的传统 IDP,ADP 能自主处理异常并触发下游动作。
企业约 90% 的数据是非结构化的,非结构化数据抽取通过 NLP、NER 和 LLM 把文档转为可查询的结构化信息。现代方案不再依赖易碎的规则解析器,而是用 LLM 的零样本能力按 JSON schema 抽取字段,省去为每种文档训练专用模型。生产级流水线还需覆盖摄取、OCR 与分块预处理、校验以及输出集成等环节。
OCR 准确率需分层衡量:字符错误率(CER)在印刷体上应低于 1%、手写体为 3–5%,词错误率(WER)低于 2%,金融等关键字段的字段级准确率需达 99.9% 才能实现直通处理。图像分辨率低于 300 DPI、多栏表格等复杂版式、手写变体、硬件显存不足及文档折痕污损都会显著拉低精度,其中 5 度倾斜可使 WER 上升 15% 以上。
AI 文档分类通过训练模型读取文档内容与结构,自动完成分类和打标,替代关键词检索和规则路由。流程分五个阶段:解析预处理、特征提取、模型分类、打标与置信度评分、路由到下游工作流。大语言模型可零样本分类,无需标注训练数据;LlamaParse 等工具用布局感知视觉解析提升预处理质量,置信度评分则让低置信结果转人工复核。
单次提取缺乏问责闭环,模型只提取一次就输出结果,不校验、不与文档总额对账,也无法标记遗漏内容,在长文档和复杂版式中会静默丢行、合并条目。Deep Extraction 采用智能体驱动的迭代流程,提取后对照源文档验证、识别缺口并重新提取,直至达到既定质量阈值,可将前沿模型的字段准确率从 10-20% 提升至 99-100%。
LlamaIndex 解析抵押贷款文档自动化流程:通过智能文档处理将贷款文件转为结构化数据,涵盖文档摄取与分类、数据抽取与结构化解析、验证与跨文档匹配等环节。系统结合机器学习、计算机视觉与结构化解析,保留表格、键值对等布局关系,并引入置信度评分与人工复核处理边缘案例。
LlamaIndex 发文指出,标准 OCR 为白纸上的清晰印刷体设计,无法可靠处理真实身份证件,导致 KYC 字段错误并向下游 AML 系统传播。合规要求字段级准确率达 99.9%,而人工录入错误率平均 1–4%,按每月 5 万份文档计算意味着 500 条记录字段出错。人工复核每份文档成本约 $1.50–$8,在高增长金融科技与加密交易所中已成为规模化约束。
LlamaIndex 发布 LlamaCloud 文档处理 API 文档,支持用 Python、TypeScript 和 curl 调用解析、抽取、分类与拆分四类能力。
Liquid AI 在开发 LFM2 系列开放权重模型时选用 PyTorch ExecuTorch 作为推理引擎,看中其混合缓存支持与单条命令打包权重、元数据和执行图的自动化部署流程。
斯坦福 HAI 隐私与数据政策研究员 Jennifer King 建议 AI 聊天机器人用户谨慎分享信息,具体做法包括:上传医疗等敏感文件前先隐去全部个人信息、使用临时对话、在可选情况下关闭数据用于训练、定期查看政策更新以调整设置。
Trilogy AI Center of Excellence 围绕 Fireworks 上的 Kimi K3 发布公开 AI 网络安全手册与练习包,包含交互式手册、仓库和十个针对本地训练应用的练习。
Fireworks AI 发布低成本嵌入模型微调方法,用 InfoNCE 对比学习在平台上微调 Qwen3-Embedding-8B,成本不到 $10、约 150 步。
推荐理由:原文给出用 Qwen3-Embedding-8B 做对比微调的完整配方和三个真实检索任务的实测数据,还总结了哪些场景不会有效。
Fireworks AI 在 Qwen3.5-9B 上用 Placement、寄存器分配和 Nexa VM 三个可自动验证任务做对照实验,提出在把 LoRA 换成 FullFT 前先依次测试数据覆盖、学习率等训练配方和 adapter rank。实验显示单任务场景下调数据或配方基本消除 FullFT 优势,固定预算混合任务中 FullFT 仍领先 4.29 个百分点,并将进一步发布后续实验。
Cursor 团队分享为云端智能体搭建开发环境的经验,核心思路是把开发环境当作用户是智能体的产品来做。他们让云端 VM 与本地开发环境对齐,构建 anydev CLI 简化智能体运行服务的流程,并通过 Cursor Cloud MCP 和 Cloud Doctor 自动化功能实现环境的自愈与持续改善。
推荐理由:Cursor 团队分享了自家云端智能体环境的搭建经验,包含 anydev CLI、Cursor Cloud MCP 等做法和可迁移的判断标准。
Anthropic 发布 AI-native SDLC playbook,主张在代码不再瓶颈后重构传统软件开发生命周期,将流程改为以提交工件驱动的闭环。
推荐理由:Anthropic 把内部 agentic 编码实践整理成六阶段方法论,覆盖从需求捕获到自动回环的每一步落地与治理细节。
Anthropic 发布《构建 AI 原生营收组织》指南,介绍在销售组织中推广 Claude 的配置决策、三阶段落地计划和 ROI 衡量框架。指南包含成熟度模型、试点前的负责人/连接器/IT 安全/成功指标/支出可见性等决策,以及按角色映射的高频用例。
Anthropic 前线部署工程师分享大型代码现代化项目的准备方法:过去需多年的项目如今可在数月或数周完成,但组织流程不变,瓶颈从产出变更转向动员组织。
推荐理由:Anthropic 前线工程师基于真实客户部署,给出智能体驱动代码现代化的六步准备方法,可直接迁移到企业大型改造项目。
Cognition 官方博客介绍其团队如何用 Devin 构建 Devin 本身:上周合并了 659 个 Devin 提交的 PR,高于 2025 年最佳单周的 154 个。
Cognition 发布长文复盘,认为多智能体系统目前只在写入保持单线程、其他智能体贡献智能的模式下有效。
推荐理由:Cognition 一线团队复盘了真正跑通的多智能体模式,给出干净的审查上下文和单线程写入等可迁移经验。
Cognition 基于两年多构建 Devin 的经验,指出容器化方案存在共享内核安全风险,也无法跨异步间隙保存状态,他们用 microVM 隔离和 hypervisor 级全机状态快照解决。
Cognition 发布博客,总结过去一年在多家车企(包括 RV Tech 和 Mercedes)部署 Devin 处理 HIL/SIL 工作流的经验。
Trail of Bits 在 Testing Handbook 中新增 C/C++ 安全审查清单章节,覆盖通用 bug 类别、Linux 用户态与内核、Windows 用户态与内核、seccomp/BPF 沙箱五部分,包括 libc 陷阱、DLL planting、WorstFit Unicode 问题、io_uring 沙箱绕过等。
Trail of Bits 为纯 Ruby 代码与 Ruby C 扩展的覆盖率引导模糊测试器 Ruzzy 增加了 LibAFL 支持,让 Ruby 开发者无需改动 harness 写法即可换用更活跃的模糊测试引擎。
Trail of Bits 公布 Windows 驱动注册表处理程序挑战的完整分析,指出缺失 RTL_QUERY_REGISTRY_TYPECHECK 标志导致的注册表类型混淆可从本地拒绝服务升级为内核写原语。