VEKTOR v1.9.8 发布:新增 Library 阅读器、80 多种格式转换和 Faraday 安全层
VEKTOR Memory 发布 v1.9.8,将本地优先的 AI 智能体记忆系统整合进单一 SDK,新增 Library 阅读模式、支持 80 多种格式转换的 Convert 标签页,以及会先请求用户批准的 Faraday 安全层。
VEKTOR Memory 发布 v1.9.8,将本地优先的 AI 智能体记忆系统整合进单一 SDK,新增 Library 阅读模式、支持 80 多种格式转换的 Convert 标签页,以及会先请求用户批准的 Faraday 安全层。
我们正在开源我们最先进的上下文嵌入模型,它在 turbopuffer 的 context-bench 中表现最佳。
We built a new way to train contextual embedding models, which encode each chunk of a document with the whole document in view. pplx-embed-v2-context-9b-preview sets a new state of the art on ConTEB and @turbopuffer's new, privately held context-bench. https://www.perplexity.ai/hub/blog/contextual-embedding-beyond-the-gold-passage
i.c.stars 第四周产出四份非代码文档:缺陷日志、同行评审、三份 runbook 和一份 run of show,核心都是让工作能经受交接。作者在同行评审中复现对方八项发现中的六项,指出"擅长找 bug、弱于记录 bug"是常态。其产品贡献是主张检索系统只允许两种行为:附文档、章节和生效日期作答,或停止并转交人工,拒绝不是兜底而是同等功能。
给后排的人: • 用 Jev 对销售数据做生产级重排序 • 快 20 倍 • 便宜 10 倍 • 准确率高 12% 你们懂了吗?
We used Jev to retrieve sales data 20x faster, 10x cheaper, and 12% more accurate than GPT-5 Mini. Every time a Rox agent answers a query, it pulls from relevant transcripts, emails, CRM notes, news, and documents. We benchmarked two ways of retrieving them: LLM-based reranking Jev classification The results speak for themselves. Jev was faster, cheaper, and more accurate. Revenue agents require thousands of points of context to understand accounts, chart relationships, and execute on sales. This research will help us serve that context with frontier-level performance for our customers.
Google 的 Spanner Omni 正式 GA,这是 Spanner 的可部署于任何环境的版本,支持本地数据中心和其他云上的生产负载。它提供与全托管 Spanner 相同的核心能力,涵盖 SQL、图、键值、全文搜索、向量搜索和列式分析引擎,并支持 MCP Toolbox 接入智能体系统。
Amazon Bedrock Knowledge Bases 新增 AgenticRetrieveStream API,可将理赔文档的多部分问题拆成子查询并多轮检索,直到证据充分再生成带引用的答案。
LlamaIndex 发布 Parse Gateway,基于 LiteParse v2.2.0 的 is_complex 功能在页面级别估计文档复杂度,并将各页路由到不同的 LlamaParse 层级。
LlamaIndex 发文分析 LLM OCR(用大语言模型或视觉语言模型把文档图像转成文本和结构化数据)虽然降低了难文档的错误率,却把错误形态从可见的乱码变成流畅但静默的替换、遗漏和重复循环,传统按字符置信度和正则校验构建的 OCR 工具难以捕获。
智能 OCR 将传统字符识别与机器学习、版面感知、语义抽取和校验逻辑结合,把文档转成结构化数据而非原始文本,并支持字段级置信度评分与规则校验。相比传统 OCR 输出扁平文本、遇到未见版式即失效,它可跨版面泛化、支持手写内容,并逐步演进到能自我验证、处理歧义的智能体文档工作流。
LlamaIndex 发文讲解 OCR 自动化与单纯文本提取的区别,指出生产准确性主要取决于解析前后的输入质量、置信度阈值校准和直通处理率,并给出 85-92% 到 90-95% 的直通率基准。
LlamaIndex 用 Temporal 替换 RabbitMQ,支撑起每天数千万页文档的处理,并驱动其最新的 Batch API 发布。Temporal 作为持久化函数执行运行时,将业务逻辑组织为确定性的 Workflow 与 Activity,由 Worker 执行、服务端持久保存执行状态,失败可从断点重试。
LlamaIndex 尝试让静态嵌入模型实现 ColBERT 式 late-interaction 检索,发现直接用 MaxSim 打分在公开基准上反而输给池化(mean NDCG 0.418 vs 0.504)。
LlamaParse 面向 PDF 表格提取,解决 PDF 只存字符坐标、不存行列结构的问题,需从空间布局推断行列关系。文章指出扁平文本提取、模板规则系统和单纯 OCR 都会在生产文档上失效,因为无边框表格、跨页表头、合并单元格、嵌套表格和扫描件会破坏简单假设。
LlamaIndex 提出面向 10-100 份文档的临时数据室场景,采用两遍式处理,先用免费工具(如 LiteParse)快速提取文本并检索,再对相关页面用 VLM 做 just-in-time OCR。
多数智能文档处理(IDP)平台在演示中表现良好,但在生产环境中因文档多样性而失效,演示与生产的准确率差距常达 10 到 20 个百分点,98% 的干净 PDF 提取准确率在实际收件中可能降至 82%。传统平台依赖模板,模板数量会随文档种类增长而不断累积,且普遍忽略图表、示意图、图像等非文本内容。新一代方案采用 LLM 编排层,将文本、表格、图表分别路由给 OCR、版面感知提取和视觉语言模型处理。
LlamaIndex 撰文指出,OCR 文档处理中每字段准确率与每文档自动化率存在单位错配,20 个字段的发票在 97% 字段准确率下整单全对的概率约 54%,而路由门控读的是置信信号而非准确率。
LlamaIndex 发文指出,AI 文档抽取的阅读环节已很成熟,生产管线丢失精度的主因是 schema 设计而非模型。文章以 180 页信贷协议中一个利率字段对应三个真实数值为例,区分了解析失败与规格失败两类表现相同的错误,列举 required 字段被编造、同名字段多义、重复结构被压成标量等常见缺陷,并给出 nullable、语义消歧、数组化等修正示例。
LlamaIndex 解析了 VLM 处理表单的失败模式:VLM 面向通用推理优化,推理能力提升并不能改善解析结果,且成本高、可靠性差。LlamaParse 专为文档与表单理解构建,将表单表示为含 id、label、field、value 的字段与 section 嵌套树,输出 JSON,以更低成本超越通用 VLM。表单的复选框勾选状态等细微错误会完全改变下游智能体的动作。
LlamaIndex 提出将 OCR 融入更广泛的解析与索引框架,用 VLM 文档解析、机器学习和结构化解析把发票转为可校验的结构化财务数据,而非只做字符识别。该方案称可提升准确率、降低成本、把处理周期从数天缩短到数分钟,并支持行项目级提取与审计追溯。
LlamaIndex 介绍用 LlamaParse 与 LlamaExtract 实现发票 OCR 数据提取:LlamaParse 将发票作为结构化文档处理,结合 OCR、版面解析、表格提取与语义建模,输出干净可校验的结构化数据。LlamaExtract 支持 GUI 单次测试最多 20 个文件,生产环境可通过 Python SDK 或 API 并行处理 PDF、JPG、PNG 及多页文件。
LlamaIndex 发文盘点图像 OCR 的四类主流方案:开源引擎(Tesseract、PaddleOCR、EasyOCR、docTR)、云 API(Google Cloud Vision/Document AI。
表格 OCR 通过版面感知处理、结构解析和 schema 对齐提取,把 PDF、扫描件中的表格转为 JSON、CSV 或 Excel 等机器可读格式。其流程分为表格检测、结构识别和数据提取三阶段,需处理合并单元格、多行记录和无边框表格等难点。
LlamaIndex 提出智能体文档处理(ADP),用具备目标、工具调用和决策能力的 AI Agent 自主完成文档工作流,仅在低置信度决策点才引入人工。其 LlamaParse 采用多个专用文档理解 Agent 协同解析,用语言模型处理文本、视觉模型解读图表图像、布局感知计算机视觉识别结构,无需因版式变化重新训练。相比基于模板的传统 IDP,ADP 能自主处理异常并触发下游动作。
企业约 90% 的数据是非结构化的,非结构化数据抽取通过 NLP、NER 和 LLM 把文档转为可查询的结构化信息。现代方案不再依赖易碎的规则解析器,而是用 LLM 的零样本能力按 JSON schema 抽取字段,省去为每种文档训练专用模型。生产级流水线还需覆盖摄取、OCR 与分块预处理、校验以及输出集成等环节。
OCR 准确率需分层衡量:字符错误率(CER)在印刷体上应低于 1%、手写体为 3–5%,词错误率(WER)低于 2%,金融等关键字段的字段级准确率需达 99.9% 才能实现直通处理。图像分辨率低于 300 DPI、多栏表格等复杂版式、手写变体、硬件显存不足及文档折痕污损都会显著拉低精度,其中 5 度倾斜可使 WER 上升 15% 以上。
AI 文档分类通过训练模型读取文档内容与结构,自动完成分类和打标,替代关键词检索和规则路由。流程分五个阶段:解析预处理、特征提取、模型分类、打标与置信度评分、路由到下游工作流。大语言模型可零样本分类,无需标注训练数据;LlamaParse 等工具用布局感知视觉解析提升预处理质量,置信度评分则让低置信结果转人工复核。
单次提取缺乏问责闭环,模型只提取一次就输出结果,不校验、不与文档总额对账,也无法标记遗漏内容,在长文档和复杂版式中会静默丢行、合并条目。Deep Extraction 采用智能体驱动的迭代流程,提取后对照源文档验证、识别缺口并重新提取,直至达到既定质量阈值,可将前沿模型的字段准确率从 10-20% 提升至 99-100%。
LlamaIndex 发文介绍 KYC 自动化如何以软件完成身份核验、制裁筛查与风险评分,标准案例处理时间从数天至数周缩短到数分钟至数小时,且成本不随客户量线性增长。文中将流程拆为文档收集、身份核验与数据提取等五个阶段,并指出文档处理层是多数实现低估的成败关键,LlamaParse 以 agentic 文档解析将任意格式文档转为结构化内容。
收入验证 API 通过数据采集、验证与决策支持三步流程,将工资单、税表、银行流水等文档转为结构化收入记录。文章对比了 payroll API(Argyle、Pinwheel)、开放银行数据、人工审核与文档提取 API(LlamaParse)四类方案,指出 payroll API 对自雇、零工及小雇主覆盖不足,文档提取可覆盖任意收入类型但需下游结构化逻辑,混合方案覆盖更广但集成更复杂。
LlamaIndex 解析抵押贷款文档自动化流程:通过智能文档处理将贷款文件转为结构化数据,涵盖文档摄取与分类、数据抽取与结构化解析、验证与跨文档匹配等环节。系统结合机器学习、计算机视觉与结构化解析,保留表格、键值对等布局关系,并引入置信度评分与人工复核处理边缘案例。
LlamaIndex 发文指出,标准 OCR 为白纸上的清晰印刷体设计,无法可靠处理真实身份证件,导致 KYC 字段错误并向下游 AML 系统传播。合规要求字段级准确率达 99.9%,而人工录入错误率平均 1–4%,按每月 5 万份文档计算意味着 500 条记录字段出错。人工复核每份文档成本约 $1.50–$8,在高增长金融科技与加密交易所中已成为规模化约束。
LlamaIndex 为旗下智能体文档处理平台 LlamaParse 开放定制演示预约,主打文档 OCR、信息抽取与索引的行业领先准确率。该平台提供页面级引用、置信度分数和边界框以支持人工复核,并可通过成本优化模式自动选择解析设置来平衡成本与准确率。用户还能借助低代码构建器 LlamaAgents,用自然语言开发和部署文档智能体,实现端到端自动化。
LlamaIndex 公布 LlamaParse 文档解析平台的定价方案,采用 credit 计费,1,000 credits = $1.25,免费版每月含 10K credits,Starter 含 40K、Pro 含 400K。
LlamaIndex 公布了一批客户案例,展示 NTT DATA、Experian、KPMG、Carlyle、SkySQL、11x.ai、Arcee AI、Pursuit、Lyzr 等团队如何用其构建文档解析、RAG 与 AI 智能体应用。
LlamaIndex 发布 LlamaCloud 文档处理 API 文档,支持用 Python、TypeScript 和 curl 调用解析、抽取、分类与拆分四类能力。
LlamaIndex 面向客服场景提供基于 FAQ、知识库、政策、工单和产品手册的智能体方案,可即时回答重复问题、生成分步排障指引并支持多轮上下文对话。其 LlamaParse 专为含图表和表格的复杂文档设计,提供引用溯源与置信度评分,并配套 Python、TypeScript SDK 和 API。
LlamaIndex 推出技术文档搜索方案,帮助工程与研发团队在规格书、SOP 和手册上构建智能体,实现即时准确的答案检索。方案包含规格搜索、版本对比、QA 文档阅读器和研发助手四项能力,底层由专为图表和表格等复杂文档打造的 LlamaParse 提供解析支持,并提供 Python 与 TypeScript SDK、API 及并行流水线以支撑企业级规模。
LlamaIndex 面向财务与运营团队推出发票处理方案,用 LlamaParse 解析发票中的行项目、税额与总额,并通过 Validation Agent 对照采购订单核验、Approval Assistant 路由审批、Audit Tracker 生成合规记录。方案提供 Python 和 TypeScript SDK、API 及并行流水线,支持在仪表盘、API 或集成中复核监控。
LlamaIndex 面向投资与审计团队,用 LlamaParse 解析合同、财务报表和合规文档中的表格与图表,并提取关键条款、汇总风险义务、比对不同实体的文件差异。其方案结合文档智能与智能体工作流,可上传文档、解析提取信息,再由智能体路由、校验、记录和通知,支持 Python 和 TypeScript SDK 及 API。