CMU:Machine Learning Blog·· 15 小时前AI 评分46
LumberChunker:面向长篇叙事文档的分段方法
LumberChunker: Long-Form Narrative Document Segmentation
AI 导读
CMU 提出 LumberChunker,让 LLM 在连续段落中判断叙事最早发生语义转折的位置,从而切分出更自然的文本块。在 100 本公版书、3000 道大海捞针式问题的 GutenQA 基准上,其 DCG@20 达 62.1%、Recall@20 达 77.9%,优于语义分段、段落级、递归分段和命题级方法。token 预算 θ≈550 时检索质量最佳,平均块长约 334 tokens。
来源:CMU:Machine Learning Blog · blog.ml.cmu.edu