跳到正文

#教程/实践

今日 38 条
9月30日周三
  1. LlamaIndex:产品、工程与评测60

    LlamaIndex 谈 AI 文档抽取:真正容易出错的是 Schema 设计

    LlamaIndex 发文指出,AI 文档抽取的阅读环节已很成熟,生产管线丢失精度的主因是 schema 设计而非模型。文章以 180 页信贷协议中一个利率字段对应三个真实数值为例,区分了解析失败与规格失败两类表现相同的错误,列举 required 字段被编造、同名字段多义、重复结构被压成标量等常见缺陷,并给出 nullable、语义消歧、数组化等修正示例。

  2. LlamaIndex:产品、工程与评测42

    为什么 VLM 读不懂表单?LlamaParse 用 JSON 结构化解析表单

    LlamaIndex 解析了 VLM 处理表单的失败模式:VLM 面向通用推理优化,推理能力提升并不能改善解析结果,且成本高、可靠性差。LlamaParse 专为文档与表单理解构建,将表单表示为含 id、label、field、value 的字段与 section 嵌套树,输出 JSON,以更低成本超越通用 VLM。表单的复选框勾选状态等细微错误会完全改变下游智能体的动作。

  3. LlamaIndex:产品、工程与评测35

    如何用 OCR 从发票中准确快速提取数据

    LlamaIndex 介绍用 LlamaParse 与 LlamaExtract 实现发票 OCR 数据提取:LlamaParse 将发票作为结构化文档处理,结合 OCR、版面解析、表格提取与语义建模,输出干净可校验的结构化数据。LlamaExtract 支持 GUI 单次测试最多 20 个文件,生产环境可通过 Python SDK 或 API 并行处理 PDF、JPG、PNG 及多页文件。

  4. LlamaIndex:产品、工程与评测32

    智能体文档处理:AI Agent 如何自动化复杂工作流

    LlamaIndex 提出智能体文档处理(ADP),用具备目标、工具调用和决策能力的 AI Agent 自主完成文档工作流,仅在低置信度决策点才引入人工。其 LlamaParse 采用多个专用文档理解 Agent 协同解析,用语言模型处理文本、视觉模型解读图表图像、布局感知计算机视觉识别结构,无需因版式变化重新训练。相比基于模板的传统 IDP,ADP 能自主处理异常并触发下游动作。

  5. LlamaIndex:产品、工程与评测36

    非结构化数据抽取:如何把文档转化为结构化洞察

    企业约 90% 的数据是非结构化的,非结构化数据抽取通过 NLP、NER 和 LLM 把文档转为可查询的结构化信息。现代方案不再依赖易碎的规则解析器,而是用 LLM 的零样本能力按 JSON schema 抽取字段,省去为每种文档训练专用模型。生产级流水线还需覆盖摄取、OCR 与分块预处理、校验以及输出集成等环节。

  6. LlamaIndex:产品、工程与评测39

    OCR 准确率解析:影响因素与提升方法

    OCR 准确率需分层衡量:字符错误率(CER)在印刷体上应低于 1%、手写体为 3–5%,词错误率(WER)低于 2%,金融等关键字段的字段级准确率需达 99.9% 才能实现直通处理。图像分辨率低于 300 DPI、多栏表格等复杂版式、手写变体、硬件显存不足及文档折痕污损都会显著拉低精度,其中 5 度倾斜可使 WER 上升 15% 以上。

  7. LlamaIndex:产品、工程与评测41

    AI 文档分类:自动分拣与打标的实用指南

    AI 文档分类通过训练模型读取文档内容与结构,自动完成分类和打标,替代关键词检索和规则路由。流程分五个阶段:解析预处理、特征提取、模型分类、打标与置信度评分、路由到下游工作流。大语言模型可零样本分类,无需标注训练数据;LlamaParse 等工具用布局感知视觉解析提升预处理质量,置信度评分则让低置信结果转人工复核。

  8. LlamaIndex:产品、工程与评测41

    为什么单次提取会失败,以及 Deep Extraction 真正解决了什么

    单次提取缺乏问责闭环,模型只提取一次就输出结果,不校验、不与文档总额对账,也无法标记遗漏内容,在长文档和复杂版式中会静默丢行、合并条目。Deep Extraction 采用智能体驱动的迭代流程,提取后对照源文档验证、识别缺口并重新提取,直至达到既定质量阈值,可将前沿模型的字段准确率从 10-20% 提升至 99-100%。

  9. LlamaIndex:产品、工程与评测21

    LlamaIndex 如何实现抵押贷款文档自动化

    LlamaIndex 解析抵押贷款文档自动化流程:通过智能文档处理将贷款文件转为结构化数据,涵盖文档摄取与分类、数据抽取与结构化解析、验证与跨文档匹配等环节。系统结合机器学习、计算机视觉与结构化解析,保留表格、键值对等布局关系,并引入置信度评分与人工复核处理边缘案例。

  10. LlamaIndex:产品、工程与评测30

    OCR 为何难以满足 KYC 合规要求:LlamaIndex 解析标准文本提取的短板

    LlamaIndex 发文指出,标准 OCR 为白纸上的清晰印刷体设计,无法可靠处理真实身份证件,导致 KYC 字段错误并向下游 AML 系统传播。合规要求字段级准确率达 99.9%,而人工录入错误率平均 1–4%,按每月 5 万份文档计算意味着 500 条记录字段出错。人工复核每份文档成本约 $1.50–$8,在高增长金融科技与加密交易所中已成为规模化约束。

  11. Fireworks AI(网页)55

    Fireworks AI 通过三组受控实验给出从 LoRA 切换到 FullFT 前的测试方法

    Fireworks AI 在 Qwen3.5-9B 上用 Placement、寄存器分配和 Nexa VM 三个可自动验证任务做对照实验,提出在把 LoRA 换成 FullFT 前先依次测试数据覆盖、学习率等训练配方和 adapter rank。实验显示单任务场景下调数据或配方基本消除 FullFT 优势,固定预算混合任务中 FullFT 仍领先 4.29 个百分点,并将进一步发布后续实验。

  12. Claude:Blog(网页)69

    Anthropic 前线工程师详解如何准备 AI 驱动的代码现代化项目

    Anthropic 前线部署工程师分享大型代码现代化项目的准备方法:过去需多年的项目如今可在数月或数周完成,但组织流程不变,瓶颈从产出变更转向动员组织。

    推荐理由:Anthropic 前线工程师基于真实客户部署,给出智能体驱动代码现代化的六步准备方法,可直接迁移到企业大型改造项目。

  13. Cognition 模型 / Devin 博客(网页)58

    Cognition 拆解 Devin 如何在财富 500 强企业实现 COBOL 现代化

    Cognition 发文说明 Devin 在多家财富 500 强企业承担 COBOL 项目的做法与成效。文章指出 COBOL 对智能体的三大难点:业务数据靠内存位置而非命名关联、LLM 几乎没有 COBOL 训练语料、COBOL 依赖大型机导致反馈循环失效;应对方式是先用 DeepWiki 建立系统级代码地图,再用 playbook 编码领域约束。

  14. Baseten 工程博客(网页)13

    Baseten 解读 Compound AI:用多模型组合替代单体大模型

    Baseten 工程博客提出 Compound AI 系统,主张用多个专用模型组合替代庞大的全能单体模型,以获得更快、更便宜的推理。该系统让模型之间直接互相调用,减少网络开销、额外延迟和出网成本,并让每个步骤独立使用自动扩缩容的 GPU。文中列举的典型场景包括 AI 电话呼叫、AI 智能体和 RAG 流水线。

  15. Trail of Bits:AI安全研究48

    Trail of Bits 的 Mewt 变异测试引擎新增 DAML 支持

    Trail of Bits 为其开源变异测试引擎 Mewt 新增 DAML 语言支持,可解析 DAML 代码、生成多类变异体并跑现有测试套件统计存活数量。Mewt 还加入两个针对 DAML 授权原语的变异:controller 参与方替换(CPS)与移除(CPR),瞄准 controller 子句拼写错误、参与方缺失等授权类 bug。

  16. Trail of Bits:AI安全研究72

    Trail of Bits 分享用 Codex 的 /goal 挖掘开源漏洞的三个技巧

    Trail of Bits 在与 OpenAI 合作的 Patch the Planet 项目中,用 Codex 的 /goal 对 Rust、curl、zlib 等代码库挖洞,找到了 Rust 1.98 已修复的 soundness 漏洞和误编译、11 处变体命中,以及 Keycloak SAML 的两个潜在高危提权漏洞。

    推荐理由:原文来自亲历团队,给出了 /goal 挖漏洞的三条可迁移技巧和 Rust 变体分析流水线,读者可以照此改进自己的 Agent 审计流程。