跳到正文
原文
CMU:Machine Learning Blog·· 15 小时前AI 评分46

LumberChunker:面向长篇叙事文档的分段方法

LumberChunker: Long-Form Narrative Document Segmentation

AI 导读

CMU 提出 LumberChunker,让 LLM 在连续段落中判断叙事最早发生语义转折的位置,从而切分出更自然的文本块。在 100 本公版书、3000 道大海捞针式问题的 GutenQA 基准上,其 DCG@20 达 62.1%、Recall@20 达 77.9%,优于语义分段、段落级、递归分段和命题级方法。token 预算 θ≈550 时检索质量最佳,平均块长约 334 tokens。

来源:CMU:Machine Learning Blog · blog.ml.cmu.edu