跳到正文

#RAG

今日 7 条
今天10月1日周四
  1. Aravind Srinivas48

    我们正在开源我们最先进的上下文嵌入模型,它在 turbopuffer 的 context-bench 中表现最佳。

    引用Perplexity@perplexity_ai

    We built a new way to train contextual embedding models, which encode each chunk of a document with the whole document in view. pplx-embed-v2-context-9b-preview sets a new state of the art on ConTEB and @turbopuffer's new, privately held context-bench. https://www.perplexity.ai/hub/blog/contextual-embedding-beyond-the-gold-passage

  2. Google AI:DEV 作者专属(RSS)40

    我无法为代码辩护:i.c.stars 第四周的四份文档与产品规则设计

    i.c.stars 第四周产出四份非代码文档:缺陷日志、同行评审、三份 runbook 和一份 run of show,核心都是让工作能经受交接。作者在同行评审中复现对方八项发现中的六项,指出"擅长找 bug、弱于记录 bug"是常态。其产品贡献是主张检索系统只允许两种行为:附文档、章节和生效日期作答,或停止并转交人工,拒绝不是兜底而是同等功能。

  3. TypeSafe AI28

    给后排的人: • 用 Jev 对销售数据做生产级重排序 • 快 20 倍 • 便宜 10 倍 • 准确率高 12% 你们懂了吗?

    引用Rox@rox_ai

    We used Jev to retrieve sales data 20x faster, 10x cheaper, and 12% more accurate than GPT-5 Mini. Every time a Rox agent answers a query, it pulls from relevant transcripts, emails, CRM notes, news, and documents. We benchmarked two ways of retrieving them: LLM-based reranking Jev classification The results speak for themselves. Jev was faster, cheaper, and more accurate. Revenue agents require thousands of points of context to understand accounts, chart relationships, and execute on sales. This research will help us serve that context with frontier-level performance for our customers.

9月30日周三
  1. LlamaIndex:产品、工程与评测58

    LlamaIndex 解析 LLM OCR 为何错误更隐蔽而非更少

    LlamaIndex 发文分析 LLM OCR(用大语言模型或视觉语言模型把文档图像转成文本和结构化数据)虽然降低了难文档的错误率,却把错误形态从可见的乱码变成流畅但静默的替换、遗漏和重复循环,传统按字符置信度和正则校验构建的 OCR 工具难以捕获。

  2. LlamaIndex:产品、工程与评测32

    智能 OCR:构建生产级文档理解系统

    智能 OCR 将传统字符识别与机器学习、版面感知、语义抽取和校验逻辑结合,把文档转成结构化数据而非原始文本,并支持字段级置信度评分与规则校验。相比传统 OCR 输出扁平文本、遇到未见版式即失效,它可跨版面泛化、支持手写内容,并逐步演进到能自我验证、处理歧义的智能体文档工作流。

  3. LlamaIndex:产品、工程与评测36

    如何从 PDF 中提取表格:用 LlamaParse 大规模构建结构化、可验证的数据

    LlamaParse 面向 PDF 表格提取,解决 PDF 只存字符坐标、不存行列结构的问题,需从空间布局推断行列关系。文章指出扁平文本提取、模板规则系统和单纯 OCR 都会在生产文档上失效,因为无边框表格、跨页表头、合并单元格、嵌套表格和扫描件会破坏简单假设。

  4. LlamaIndex:产品、工程与评测35

    智能文档处理平台:多数厂商做错了什么

    多数智能文档处理(IDP)平台在演示中表现良好,但在生产环境中因文档多样性而失效,演示与生产的准确率差距常达 10 到 20 个百分点,98% 的干净 PDF 提取准确率在实际收件中可能降至 82%。传统平台依赖模板,模板数量会随文档种类增长而不断累积,且普遍忽略图表、示意图、图像等非文本内容。新一代方案采用 LLM 编排层,将文本、表格、图表分别路由给 OCR、版面感知提取和视觉语言模型处理。

  5. LlamaIndex:产品、工程与评测60

    LlamaIndex 谈 AI 文档抽取:真正容易出错的是 Schema 设计

    LlamaIndex 发文指出,AI 文档抽取的阅读环节已很成熟,生产管线丢失精度的主因是 schema 设计而非模型。文章以 180 页信贷协议中一个利率字段对应三个真实数值为例,区分了解析失败与规格失败两类表现相同的错误,列举 required 字段被编造、同名字段多义、重复结构被压成标量等常见缺陷,并给出 nullable、语义消歧、数组化等修正示例。

  6. LlamaIndex:产品、工程与评测42

    为什么 VLM 读不懂表单?LlamaParse 用 JSON 结构化解析表单

    LlamaIndex 解析了 VLM 处理表单的失败模式:VLM 面向通用推理优化,推理能力提升并不能改善解析结果,且成本高、可靠性差。LlamaParse 专为文档与表单理解构建,将表单表示为含 id、label、field、value 的字段与 section 嵌套树,输出 JSON,以更低成本超越通用 VLM。表单的复选框勾选状态等细微错误会完全改变下游智能体的动作。

  7. LlamaIndex:产品、工程与评测22

    应付账款 OCR 指南:优势、挑战与最佳实践

    LlamaIndex 提出将 OCR 融入更广泛的解析与索引框架,用 VLM 文档解析、机器学习和结构化解析把发票转为可校验的结构化财务数据,而非只做字符识别。该方案称可提升准确率、降低成本、把处理周期从数天缩短到数分钟,并支持行项目级提取与审计追溯。

  8. LlamaIndex:产品、工程与评测35

    如何用 OCR 从发票中准确快速提取数据

    LlamaIndex 介绍用 LlamaParse 与 LlamaExtract 实现发票 OCR 数据提取:LlamaParse 将发票作为结构化文档处理,结合 OCR、版面解析、表格提取与语义建模,输出干净可校验的结构化数据。LlamaExtract 支持 GUI 单次测试最多 20 个文件,生产环境可通过 Python SDK 或 API 并行处理 PDF、JPG、PNG 及多页文件。

  9. LlamaIndex:产品、工程与评测32

    智能体文档处理:AI Agent 如何自动化复杂工作流

    LlamaIndex 提出智能体文档处理(ADP),用具备目标、工具调用和决策能力的 AI Agent 自主完成文档工作流,仅在低置信度决策点才引入人工。其 LlamaParse 采用多个专用文档理解 Agent 协同解析,用语言模型处理文本、视觉模型解读图表图像、布局感知计算机视觉识别结构,无需因版式变化重新训练。相比基于模板的传统 IDP,ADP 能自主处理异常并触发下游动作。

  10. LlamaIndex:产品、工程与评测36

    非结构化数据抽取:如何把文档转化为结构化洞察

    企业约 90% 的数据是非结构化的,非结构化数据抽取通过 NLP、NER 和 LLM 把文档转为可查询的结构化信息。现代方案不再依赖易碎的规则解析器,而是用 LLM 的零样本能力按 JSON schema 抽取字段,省去为每种文档训练专用模型。生产级流水线还需覆盖摄取、OCR 与分块预处理、校验以及输出集成等环节。

  11. LlamaIndex:产品、工程与评测39

    OCR 准确率解析:影响因素与提升方法

    OCR 准确率需分层衡量:字符错误率(CER)在印刷体上应低于 1%、手写体为 3–5%,词错误率(WER)低于 2%,金融等关键字段的字段级准确率需达 99.9% 才能实现直通处理。图像分辨率低于 300 DPI、多栏表格等复杂版式、手写变体、硬件显存不足及文档折痕污损都会显著拉低精度,其中 5 度倾斜可使 WER 上升 15% 以上。

  12. LlamaIndex:产品、工程与评测41

    AI 文档分类:自动分拣与打标的实用指南

    AI 文档分类通过训练模型读取文档内容与结构,自动完成分类和打标,替代关键词检索和规则路由。流程分五个阶段:解析预处理、特征提取、模型分类、打标与置信度评分、路由到下游工作流。大语言模型可零样本分类,无需标注训练数据;LlamaParse 等工具用布局感知视觉解析提升预处理质量,置信度评分则让低置信结果转人工复核。

  13. LlamaIndex:产品、工程与评测41

    为什么单次提取会失败,以及 Deep Extraction 真正解决了什么

    单次提取缺乏问责闭环,模型只提取一次就输出结果,不校验、不与文档总额对账,也无法标记遗漏内容,在长文档和复杂版式中会静默丢行、合并条目。Deep Extraction 采用智能体驱动的迭代流程,提取后对照源文档验证、识别缺口并重新提取,直至达到既定质量阈值,可将前沿模型的字段准确率从 10-20% 提升至 99-100%。

  14. LlamaIndex:产品、工程与评测35

    KYC 自动化:如何用可扩展的合规工作流取代人工核验

    LlamaIndex 发文介绍 KYC 自动化如何以软件完成身份核验、制裁筛查与风险评分,标准案例处理时间从数天至数周缩短到数分钟至数小时,且成本不随客户量线性增长。文中将流程拆为文档收集、身份核验与数据提取等五个阶段,并指出文档处理层是多数实现低估的成败关键,LlamaParse 以 agentic 文档解析将任意格式文档转为结构化内容。

  15. LlamaIndex:产品、工程与评测34

    收入验证 API 如何自动化大规模文档收入核查

    收入验证 API 通过数据采集、验证与决策支持三步流程,将工资单、税表、银行流水等文档转为结构化收入记录。文章对比了 payroll API(Argyle、Pinwheel)、开放银行数据、人工审核与文档提取 API(LlamaParse)四类方案,指出 payroll API 对自雇、零工及小雇主覆盖不足,文档提取可覆盖任意收入类型但需下游结构化逻辑,混合方案覆盖更广但集成更复杂。

  16. LlamaIndex:产品、工程与评测21

    LlamaIndex 如何实现抵押贷款文档自动化

    LlamaIndex 解析抵押贷款文档自动化流程:通过智能文档处理将贷款文件转为结构化数据,涵盖文档摄取与分类、数据抽取与结构化解析、验证与跨文档匹配等环节。系统结合机器学习、计算机视觉与结构化解析,保留表格、键值对等布局关系,并引入置信度评分与人工复核处理边缘案例。

  17. LlamaIndex:产品、工程与评测30

    OCR 为何难以满足 KYC 合规要求:LlamaIndex 解析标准文本提取的短板

    LlamaIndex 发文指出,标准 OCR 为白纸上的清晰印刷体设计,无法可靠处理真实身份证件,导致 KYC 字段错误并向下游 AML 系统传播。合规要求字段级准确率达 99.9%,而人工录入错误率平均 1–4%,按每月 5 万份文档计算意味着 500 条记录字段出错。人工复核每份文档成本约 $1.50–$8,在高增长金融科技与加密交易所中已成为规模化约束。

  18. LlamaIndex:产品、工程与评测12

    LlamaParse 预约演示:智能体文档处理平台

    LlamaIndex 为旗下智能体文档处理平台 LlamaParse 开放定制演示预约,主打文档 OCR、信息抽取与索引的行业领先准确率。该平台提供页面级引用、置信度分数和边界框以支持人工复核,并可通过成本优化模式自动选择解析设置来平衡成本与准确率。用户还能借助低代码构建器 LlamaAgents,用自然语言开发和部署文档智能体,实现端到端自动化。

  19. LlamaIndex:产品、工程与评测19

    LlamaIndex 如何为客服团队构建即时准确的问答智能体

    LlamaIndex 面向客服场景提供基于 FAQ、知识库、政策、工单和产品手册的智能体方案,可即时回答重复问题、生成分步排障指引并支持多轮上下文对话。其 LlamaParse 专为含图表和表格的复杂文档设计,提供引用溯源与置信度评分,并配套 Python、TypeScript SDK 和 API。

  20. LlamaIndex:产品、工程与评测24

    LlamaIndex 技术文档搜索:在复杂文档中快速找到答案

    LlamaIndex 推出技术文档搜索方案,帮助工程与研发团队在规格书、SOP 和手册上构建智能体,实现即时准确的答案检索。方案包含规格搜索、版本对比、QA 文档阅读器和研发助手四项能力,底层由专为图表和表格等复杂文档打造的 LlamaParse 提供解析支持,并提供 Python 与 TypeScript SDK、API 及并行流水线以支撑企业级规模。

  21. LlamaIndex:产品、工程与评测23

    LlamaIndex 如何自动化发票处理、减少人工审核

    LlamaIndex 面向财务与运营团队推出发票处理方案,用 LlamaParse 解析发票中的行项目、税额与总额,并通过 Validation Agent 对照采购订单核验、Approval Assistant 路由审批、Audit Tracker 生成合规记录。方案提供 Python 和 TypeScript SDK、API 及并行流水线,支持在仪表盘、API 或集成中复核监控。

  22. LlamaIndex:产品、工程与评测18

    LlamaIndex 如何加速财务尽职调查与合规审查

    LlamaIndex 面向投资与审计团队,用 LlamaParse 解析合同、财务报表和合规文档中的表格与图表,并提取关键条款、汇总风险义务、比对不同实体的文件差异。其方案结合文档智能与智能体工作流,可上传文档、解析提取信息,再由智能体路由、校验、记录和通知,支持 Python 和 TypeScript SDK 及 API。