跳到正文

全部动态

今日 46 条
9月30日周三
  1. LlamaIndex:产品、工程与评测58

    LlamaIndex 解析 LLM OCR 为何错误更隐蔽而非更少

    LlamaIndex 发文分析 LLM OCR(用大语言模型或视觉语言模型把文档图像转成文本和结构化数据)虽然降低了难文档的错误率,却把错误形态从可见的乱码变成流畅但静默的替换、遗漏和重复循环,传统按字符置信度和正则校验构建的 OCR 工具难以捕获。

  2. LlamaIndex:产品、工程与评测32

    智能 OCR:构建生产级文档理解系统

    智能 OCR 将传统字符识别与机器学习、版面感知、语义抽取和校验逻辑结合,把文档转成结构化数据而非原始文本,并支持字段级置信度评分与规则校验。相比传统 OCR 输出扁平文本、遇到未见版式即失效,它可跨版面泛化、支持手写内容,并逐步演进到能自我验证、处理歧义的智能体文档工作流。

  3. LlamaIndex:产品、工程与评测36

    如何从 PDF 中提取表格:用 LlamaParse 大规模构建结构化、可验证的数据

    LlamaParse 面向 PDF 表格提取,解决 PDF 只存字符坐标、不存行列结构的问题,需从空间布局推断行列关系。文章指出扁平文本提取、模板规则系统和单纯 OCR 都会在生产文档上失效,因为无边框表格、跨页表头、合并单元格、嵌套表格和扫描件会破坏简单假设。

  4. LlamaIndex:产品、工程与评测60

    LlamaIndex 谈 AI 文档抽取:真正容易出错的是 Schema 设计

    LlamaIndex 发文指出,AI 文档抽取的阅读环节已很成熟,生产管线丢失精度的主因是 schema 设计而非模型。文章以 180 页信贷协议中一个利率字段对应三个真实数值为例,区分了解析失败与规格失败两类表现相同的错误,列举 required 字段被编造、同名字段多义、重复结构被压成标量等常见缺陷,并给出 nullable、语义消歧、数组化等修正示例。

  5. LlamaIndex:产品、工程与评测42

    为什么 VLM 读不懂表单?LlamaParse 用 JSON 结构化解析表单

    LlamaIndex 解析了 VLM 处理表单的失败模式:VLM 面向通用推理优化,推理能力提升并不能改善解析结果,且成本高、可靠性差。LlamaParse 专为文档与表单理解构建,将表单表示为含 id、label、field、value 的字段与 section 嵌套树,输出 JSON,以更低成本超越通用 VLM。表单的复选框勾选状态等细微错误会完全改变下游智能体的动作。

  6. LlamaIndex:产品、工程与评测35

    如何用 OCR 从发票中准确快速提取数据

    LlamaIndex 介绍用 LlamaParse 与 LlamaExtract 实现发票 OCR 数据提取:LlamaParse 将发票作为结构化文档处理,结合 OCR、版面解析、表格提取与语义建模,输出干净可校验的结构化数据。LlamaExtract 支持 GUI 单次测试最多 20 个文件,生产环境可通过 Python SDK 或 API 并行处理 PDF、JPG、PNG 及多页文件。

  7. LlamaIndex:产品、工程与评测32

    智能体文档处理:AI Agent 如何自动化复杂工作流

    LlamaIndex 提出智能体文档处理(ADP),用具备目标、工具调用和决策能力的 AI Agent 自主完成文档工作流,仅在低置信度决策点才引入人工。其 LlamaParse 采用多个专用文档理解 Agent 协同解析,用语言模型处理文本、视觉模型解读图表图像、布局感知计算机视觉识别结构,无需因版式变化重新训练。相比基于模板的传统 IDP,ADP 能自主处理异常并触发下游动作。

  8. LlamaIndex:产品、工程与评测36

    非结构化数据抽取:如何把文档转化为结构化洞察

    企业约 90% 的数据是非结构化的,非结构化数据抽取通过 NLP、NER 和 LLM 把文档转为可查询的结构化信息。现代方案不再依赖易碎的规则解析器,而是用 LLM 的零样本能力按 JSON schema 抽取字段,省去为每种文档训练专用模型。生产级流水线还需覆盖摄取、OCR 与分块预处理、校验以及输出集成等环节。

  9. LlamaIndex:产品、工程与评测39

    OCR 准确率解析:影响因素与提升方法

    OCR 准确率需分层衡量:字符错误率(CER)在印刷体上应低于 1%、手写体为 3–5%,词错误率(WER)低于 2%,金融等关键字段的字段级准确率需达 99.9% 才能实现直通处理。图像分辨率低于 300 DPI、多栏表格等复杂版式、手写变体、硬件显存不足及文档折痕污损都会显著拉低精度,其中 5 度倾斜可使 WER 上升 15% 以上。

  10. LlamaIndex:产品、工程与评测41

    AI 文档分类:自动分拣与打标的实用指南

    AI 文档分类通过训练模型读取文档内容与结构,自动完成分类和打标,替代关键词检索和规则路由。流程分五个阶段:解析预处理、特征提取、模型分类、打标与置信度评分、路由到下游工作流。大语言模型可零样本分类,无需标注训练数据;LlamaParse 等工具用布局感知视觉解析提升预处理质量,置信度评分则让低置信结果转人工复核。

  11. LlamaIndex:产品、工程与评测41

    为什么单次提取会失败,以及 Deep Extraction 真正解决了什么

    单次提取缺乏问责闭环,模型只提取一次就输出结果,不校验、不与文档总额对账,也无法标记遗漏内容,在长文档和复杂版式中会静默丢行、合并条目。Deep Extraction 采用智能体驱动的迭代流程,提取后对照源文档验证、识别缺口并重新提取,直至达到既定质量阈值,可将前沿模型的字段准确率从 10-20% 提升至 99-100%。

  12. LlamaIndex:产品、工程与评测21

    LlamaIndex 如何实现抵押贷款文档自动化

    LlamaIndex 解析抵押贷款文档自动化流程:通过智能文档处理将贷款文件转为结构化数据,涵盖文档摄取与分类、数据抽取与结构化解析、验证与跨文档匹配等环节。系统结合机器学习、计算机视觉与结构化解析,保留表格、键值对等布局关系,并引入置信度评分与人工复核处理边缘案例。

  13. LlamaIndex:产品、工程与评测30

    OCR 为何难以满足 KYC 合规要求:LlamaIndex 解析标准文本提取的短板

    LlamaIndex 发文指出,标准 OCR 为白纸上的清晰印刷体设计,无法可靠处理真实身份证件,导致 KYC 字段错误并向下游 AML 系统传播。合规要求字段级准确率达 99.9%,而人工录入错误率平均 1–4%,按每月 5 万份文档计算意味着 500 条记录字段出错。人工复核每份文档成本约 $1.50–$8,在高增长金融科技与加密交易所中已成为规模化约束。

  14. Fireworks AI(网页)55

    Fireworks AI 通过三组受控实验给出从 LoRA 切换到 FullFT 前的测试方法

    Fireworks AI 在 Qwen3.5-9B 上用 Placement、寄存器分配和 Nexa VM 三个可自动验证任务做对照实验,提出在把 LoRA 换成 FullFT 前先依次测试数据覆盖、学习率等训练配方和 adapter rank。实验显示单任务场景下调数据或配方基本消除 FullFT 优势,固定预算混合任务中 FullFT 仍领先 4.29 个百分点,并将进一步发布后续实验。

  15. Cursor Blog70

    Cursor 团队分享如何搭建云端智能体开发环境

    Cursor 团队分享为云端智能体搭建开发环境的经验,核心思路是把开发环境当作用户是智能体的产品来做。他们让云端 VM 与本地开发环境对齐,构建 anydev CLI 简化智能体运行服务的流程,并通过 Cursor Cloud MCP 和 Cloud Doctor 自动化功能实现环境的自愈与持续改善。

    推荐理由:Cursor 团队分享了自家云端智能体环境的搭建经验,包含 anydev CLI、Cursor Cloud MCP 等做法和可迁移的判断标准。

  16. Claude:Blog(网页)69

    Anthropic 前线工程师详解如何准备 AI 驱动的代码现代化项目

    Anthropic 前线部署工程师分享大型代码现代化项目的准备方法:过去需多年的项目如今可在数月或数周完成,但组织流程不变,瓶颈从产出变更转向动员组织。

    推荐理由:Anthropic 前线工程师基于真实客户部署,给出智能体驱动代码现代化的六步准备方法,可直接迁移到企业大型改造项目。