PathAnchor:面向科学智能体的路径结构化证据系统
PathAnchor 是一个基于路径结构化证据工作区的科学推理系统,在 120 道单篇与跨论文柔性传感器问题上得分 82.6%,领先六个参评系统。在控制器、语料与六次调用预算一致的条件下,用路径结构化记录替代无序概念图,将来源召回率从 61.3% 提升至 82.9%,全部论断均引用已打开证据的回答占比从 69.2% 升至 90.0%,并减少工具调用次数。
PathAnchor 是一个基于路径结构化证据工作区的科学推理系统,在 120 道单篇与跨论文柔性传感器问题上得分 82.6%,领先六个参评系统。在控制器、语料与六次调用预算一致的条件下,用路径结构化记录替代无序概念图,将来源召回率从 61.3% 提升至 82.9%,全部论断均引用已打开证据的回答占比从 69.2% 升至 90.0%,并减少工具调用次数。
研究者提出 VHOP-Router,一种结合监督微调、在线模仿学习与强化学习的端到端训练流程,将标准嵌入模型转变为自回归多步检索器,可直接在视觉潜在空间中单次工具调用检索关联图像链。
研究提出概念生命周期模型(CLM)与概念锚定注意力(CGA),将概念表示为带来源与时序版本的图实体,并通过图偏置自注意力(Form A)和门控交叉注意力(Form B)注入 Transformer。
研究者发布 ViLegalExpert,一个基于真实公民—律师咨询构建的大规模越南法律基准,包含超 172K 个问题、覆盖 34 个法律领域,并配有专业答案与专家核验的法律证据。该基准支持法律信息检索、抽取式问答和生成式问答三类任务。实验显示,预训练模型在问答上表现较强,混合检索取得最佳检索效果,但证据检索与有依据的答案生成仍面临显著挑战。
TRACE 通过目标分组检索、独立类型化证据定位、多模态表格抽取、schema 驱动表格构建与 fail-closed 校验,弥合 LitTraceQA 中源访问与评分可见正确性之间的“grounding contract gap”。
研究将此前用于 RAG 的 claim 级保形事实性控制迁移到多跳 RAG,在 HotpotQA、Natural Questions 和 TriviaQA 上用 Llama 3.1 8B 与 GPT-4o-mini 测试。
针对 LLM 智能体在扁平语料中反复重新发现文档关系、遗漏互补证据且消耗大量 token 的问题,研究者提出 CorpusMap——围绕文档中反复出现的实体构建导航层,将每个实体表示为 Entity Page 并链接所有提及它的文档,形成可遍历的实体-文档图。
BRIDGE 是一种内存高效的一阶双层优化方法,将检索器与 LLM 策略的联合训练建模为双层优化问题,以解决检索证据错误被错误归咎于 LLM 策略的"信息信用鸿沟"。在七个开放域 QA 基准上,BRIDGE 在 3B 和 7B 骨干下均取得最高平均准确率,多跳平均较最强基线分别提升 9.6 和 3.4 EM 点,并在医疗 QA 基准上取得最佳平均答案准确率与推理质量。
ARCagent 是面向 ME/CFS 临床问答的自适应检索校准智能体,在 LLM-as-Judge 评测中达到 95.3%,超过所有基线 LLM。它构建了 1,706 个文本块、10 个来源的知识库,并配有覆盖现有 ME/CFS 诊断框架的指南间冲突登记表,以及按查询焦点与冲突信号重排证据的校准流程。该评测避免了关键词匹配平均 10.1 个百分点的系统性低估,代码已开源。
研究者提出 LLM-Guided Graph Pruning(LGP)框架,用 LLM 推理直接优化已有 ANN 图索引,把结构上"低价值"的邻居替换为 LLM 选出的语义替代项,同时保留原图的稀疏性与可导航性。在 DiskANN 和 HNSW 等图索引上,LGP 在语义检索基准中端到端表现稳定优于贪心图搜索和 LLM 重排序。
PILLAR 是一种基于私有信息检索(PIR)的隐私保护 RAG 系统,客户端可从服务器公开语料中取回与查询最相似的 k 篇文档,而服务器无法获知查询词项及其访问模式。
研究者推出 GeoOutageBench,一个评估 LLM 地理时空 KGQA 的基准,其时空知识图谱融合停电记录、遥感、气象观测、风暴与电力事件、地理实体及领域本体等多模态数据。
Mara Chain 提出一种精炼流程,不再丢弃被拒绝的候选配置,而是保留并借助前序尝试积累的证据迭代精炼,每条精炼链限定固定深度,并用 Pareto 过滤的 Top-N 选择约束候选池。
MemFold 将查询条件下的文本记忆压缩为 K 个连续向量作为读者记忆接口,并用任务结果的组相对奖励与置信门控的 on-policy 蒸馏训练读者自身 rollout,教师模型在推理时完全移除。
Mnemon 是一种将记忆工作分为快慢两套系统的 LLM 记忆智能体:对话以带日期的原始记录保存,LLM(System 2)规划搜索,决策模型 Jev(System 1)以每秒数十次的 yes/no 判断筛选结果,再由显式预算规则生成小型 View 供回答模型使用。
研究者提出 Entropy-Driven Adaptive Router(EDAR),在推理时依据 RAG 响应前几个生成 token 的预测熵,决定用检索片段作答还是升级到完整长上下文处理。
TRACE 是一个面向肿瘤学 LLM 的可部署树关系结构增强框架,将昂贵的离线结构学习与轻量在线推理分离,把肿瘤学概念与关系组织为可更新的树关系结构,并在推理时检索为紧凑的提示词证据。
CMU 提出 LumberChunker,让 LLM 在连续段落中判断叙事最早发生语义转折的位置,从而切分出更自然的文本块。在 100 本公版书、3000 道大海捞针式问题的 GutenQA 基准上,其 DCG@20 达 62.1%、Recall@20 达 77.9%,优于语义分段、段落级、递归分段和命题级方法。token 预算 θ≈550 时检索质量最佳,平均块长约 334 tokens。
研究者提出 Sieve and Sage 框架,将检索失败拆分为"无法回答"与"受干扰"两种状态,先用轻量模块 Sieve 过滤检索文档中的干扰证据,再调用高成本 LLM(Sage)进行有据生成与拒答。
研究首次为 SFIA 框架建立可复现的结构化技能抽取基线,将自由文本映射为(技能,级别)对,覆盖 147 项专业技能与七个责任级别。在五种策略对比中,检索式匹配识别技能最多,生成式策略精度更高;只有把级别作为显式决策的策略才能可靠预测级别,基于相似度的选择错误率高出两倍以上。
Apple 研究团队提出 Glyph,一个将列描述生成与列类型标注建模为有状态图编排的多智能体 LLM 生产系统。其 Descriptor 通过推理-行动工具循环从企业 GitHub 按需检索管道源码来支撑生成,Tagger 并行运行描述、业务线正则与元数据三种策略,并用 RRF 融合排序结果,从 275 叶节点的数据分类本体中打标。
OpenBMB(清华 NLP)在 GitHub 发布 SHIFT 源码,对应论文《SHIFT: Gate-Modulated Activation Steering for Knowledge Conflict Mitigation in Retrieval-Augmented Generation》。该方法通过门控调制的激活引导,缓解检索增强生成中的知识冲突问题。
Sierra 推出 𝜏-knowledge 基准,扩展自 𝜏-bench,新增 𝜏-Banking 金融客服场景,包含 21 个产品类别的 698 份文档(约 195K tokens)。
Sierra 为每个客户从昨日对话中采样数千条匿名搜索样本,用前沿 LLM 多阶段流水线筛选出理想文章构成 golden 数据集,并以 recall、precision、nDCG 等指标每日衡量检索质量。发布检索与重排序模型 Linnaeus 和 Darwin 后,客户 recall 逐日提升,相关解决率最高提升 16 个百分点。
Together AI 在 ICLR 2026 论文《When Does Divide and Conquer Work for Long Context LLM?
Google 联合康奈尔大学在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位专家按 6 项指标盲评打分。
Answer.AI 推出 ReadBench 基准,将 MMLU-Redux、MMLU-Pro、GPQA-Diamond、BABILong 和 LongBench 等文本基准的上下文转为图像、问题保留为文本,评测 VLM 从图像中读取和推理文本的能力。