跳到正文

#RAG

今日 11 条
9月30日周三
  1. TensorZero:实验与工程博客66

    TensorZero 在 LLM 网关中引入多臂老虎机自适应 A/B 实验

    TensorZero 推出基于 Track-and-Stop 最佳臂识别的多臂老虎机算法,在 LLM 网关中实现自适应 A/B 实验,动态调整采样比例并用 anytime-valid 的 GLRT 停止规则避免 p-hacking。

    推荐理由:文章用仿真和真实 NER 实验数据说明自适应实验相比均匀采样能减少约 37% 的判定时间,并给出可直接复用的配置方法。

  2. LlamaIndex:产品、工程与评测19

    LlamaIndex 行政运营方案:用 LlamaParse 与智能体自动化发票、合同和表单流程

    LlamaIndex 推出面向行政运营的文档智能与智能体工作流方案,宣称可消除手动流程、为更高阶任务释放 80% 时间。方案包含发票评估器、合同数据智能体、表单处理器、政策文档智能体、员工入职助手和合规报告器六类组件,基于 LlamaParse 解析含图表和表格的复杂文档,并提供引用溯源与置信度分数。

  3. LlamaIndex:产品、工程与评测16

    LlamaIndex 如何将产品研发周期加速 80%

    LlamaIndex 面向研发场景推出文档智能与智能体工作流方案,宣称可将产品研发周期加速 80%。方案包含 R&D assistant、System design navigator、Technical spec comparator 等 6 类智能体,基于 LlamaParse 解析图表与表格等复杂文档,并提供引用溯源与置信度分数。

  4. LlamaIndex:产品、工程与评测38

    LlamaIndex Index:面向 RAG 的智能分块与嵌入数据管线

    LlamaIndex 的 Index 产品提供智能分块与嵌入能力,让数据为检索做好准备,支持连接器增量同步、自定义嵌入模型、多模态索引以及 OTEL 等测试评估集成。官方数据显示其已处理超 1B 份文档,LlamaParse 用户超 300k,包月下载量超 25M。KPMG 等团队用其标准化企业知识助手开发,工程师得以从数据管线维护转向 LLM 应用开发。

  5. LlamaIndex:产品、工程与评测44

    LlamaIndex 推出 LlamaExtract:从复杂文档中提取带引用与置信度分数的结构化数据

    LlamaIndex 发布 LlamaExtract,可从复杂文档中提取字段级数据,并给出逐列置信度分数与可追溯引用。该工具支持多字段提取、布局与上下文感知推理、自定义或自动检测 schema,以及多种解析模式以平衡成本与精度。LlamaParse 已累计处理超 10 亿份文档,月下载量超 2500 万次,用户超 30 万。

  6. LlamaIndex:产品、工程与评测30

    LlamaParse:面向复杂文档的多模态解析工具

    LlamaIndex 推出 LlamaParse,可将复杂版式、表格、图表、手写内容、复选框和图片解析为干净的 markdown。该工具支持版式感知、多模态解析和多种解析模式,可处理数百万页文档,开箱支持 100+ 种语言,并支持本地云部署。官方称已处理超 10 亿份文档,LlamaParse 用户超 30 万,包月下载量超 2500 万次。

  7. LlamaIndex:产品、工程与评测26

    LlamaParse:兼顾成本与精度的前沿智能体文档处理

    LlamaIndex 的 LlamaParse 提供端到端文档理解,覆盖解析、提取与索引三个环节,可处理复杂版式、表格、图表、手写和图像。其 Extract 支持带置信度分数和引用的上下文感知数据提取,Index 通过智能分块与嵌入让数据可直接用于检索。

  8. Eugene Yan:Writing68

    Eugene Yan 详解长上下文问答系统评测:指标、数据集与六个基准

    Eugene Yan 发布长文讲解如何评测长上下文问答系统,提出忠实性与有用性两个正交维度,并介绍证据位置、多跳推理、幻觉等长文本特有挑战。文章覆盖 NarrativeQA、NovelQA、QASPER、L-Eval、HELMET、Loong 六个基准,指出传统 n-gram 指标与人工判断相关性差、应改用 LLM 评估者,且 RAG 在证据分散于多文档的 Loong 任务上反而降低表现。

  9. CMU:Machine Learning Blog46

    LumberChunker:面向长篇叙事文档的分段方法

    CMU 提出 LumberChunker,让 LLM 在连续段落中判断叙事最早发生语义转折的位置,从而切分出更自然的文本块。在 100 本公版书、3000 道大海捞针式问题的 GutenQA 基准上,其 DCG@20 达 62.1%、Recall@20 达 77.9%,优于语义分段、段落级、递归分段和命题级方法。token 预算 θ≈550 时检索质量最佳,平均块长约 334 tokens。

  10. arXiv:cs.CL(计算语言学,全量分类)35

    从词汇基线到智能体检索增强生成:基于 SFIA 框架的结构化技能与责任级别抽取

    研究首次为 SFIA 框架建立可复现的结构化技能抽取基线,将自由文本映射为(技能,级别)对,覆盖 147 项专业技能与七个责任级别。在五种策略对比中,检索式匹配识别技能最多,生成式策略精度更高;只有把级别作为显式决策的策略才能可靠预测级别,基于相似度的选择错误率高出两倍以上。

9月29日周二
9月28日周一
9月26日周六
  1. AWS Machine Learning Blog46

    NarrateAI 如何在 Amazon Bedrock 上实现生产级 LLM 质量保障

    NarrateAI 在 Amazon Bedrock 上通过五项技术实现约 99% 的数值准确率并实时流式返回结果,服务超过 4000 名 AWS 高管。这五项技术分别是自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,其中约 90% 的查询走单次快速路径,仅约 10% 的复杂查询进入并行批处理路径。

9月25日周五
9月19日周六
9月18日周五
  1. GitHub Blog22

    GitHub Podcast 拆解 AI 热门观点:该不该读代码、RAG 是否已死、Skills 是否杀死了 MCP

    GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,MCP 提供工具与数据的标准接入,Skills 封装团队流程与最佳实践,二者可组合使用;RAG 并未消亡,检索能为模型提供训练数据之外的信息,减少 token 消耗并让回答更有依据。

9月16日周三
  1. Apple Machine Learning Research(RSS)38

    Glyph:面向企业数据目录列描述与敏感本体标注的多策略智能体系统

    Apple 研究团队提出 Glyph,一个将列描述生成与列类型标注建模为有状态图编排的多智能体 LLM 生产系统。其 Descriptor 通过推理-行动工具循环从企业 GitHub 按需检索管道源码来支撑生成,Tagger 并行运行描述、业务线正则与元数据三种策略,并用 RRF 融合排序结果,从 275 叶节点的数据分类本体中打标。

9月11日周五
9月3日周四
9月2日周三
8月26日周三
  1. Hugging Face:Blog(RSS)76

    Sentence Transformers v6.0 教程:用 MultiVectorEncoder 训练和微调多向量嵌入模型

    Sentence Transformers v6.0 引入 MultiVectorEncoder 模型类型,这篇教程完整演示如何训练和微调 ColBERT 式多向量模型,涵盖模型、数据集、损失函数、训练参数和评估器。

    推荐理由:原文给出完整可复现的多向量模型微调配方和实测对比,读者可以按组件迁移到自己的领域数据上。

8月21日周五
  1. Hugging Face:Blog(RSS)62

    Hugging Face 解析 Papers with Code 混合搜索背后的架构实践

    Hugging Face 详解 Papers with Code 论文搜索引擎的架构:用 PostgreSQL 全文检索加 pgvector 语义召回,经加权 RRF 融合为混合搜索,已为超过 11 万篇 arXiv 论文维护嵌入向量。

    推荐理由:作者亲述 Papers with Code 混合搜索的架构与生产经验,读者可以借鉴其离线批量与在线查询分离的设计方法。

  2. Google Cloud:Databases(RSS)37

    AlloyDB ScaNN 如何将向量搜索扩展至 100 亿向量

    AlloyDB 的 ScaNN 索引通过新增四级树(preview)架构与内存优化,将向量搜索规模扩展至 100 亿向量。内部测试中,该索引在 100 亿向量下实现 ≤51 ms p95 延迟与 95% 召回率,搜索复杂度由三级树的 O(N^1/3) 降至 O(N^1/4)。四级树已开放 preview,可按快速入门指南部署。

8月20日周四