MemFold:通过 On-Policy 优化为长上下文个性化学习紧凑软记忆
MemFold 将查询条件下的文本记忆压缩为 K 个连续向量作为读者记忆接口,并用任务结果的组相对奖励与置信门控的 on-policy 蒸馏训练读者自身 rollout,教师模型在推理时完全移除。
MemFold 将查询条件下的文本记忆压缩为 K 个连续向量作为读者记忆接口,并用任务结果的组相对奖励与置信门控的 on-policy 蒸馏训练读者自身 rollout,教师模型在推理时完全移除。
Mnemon 是一种将记忆工作分为快慢两套系统的 LLM 记忆智能体:对话以带日期的原始记录保存,LLM(System 2)规划搜索,决策模型 Jev(System 1)以每秒数十次的 yes/no 判断筛选结果,再由显式预算规则生成小型 View 供回答模型使用。
研究者提出 Entropy-Driven Adaptive Router(EDAR),在推理时依据 RAG 响应前几个生成 token 的预测熵,决定用检索片段作答还是升级到完整长上下文处理。
TRACE 是一个面向肿瘤学 LLM 的可部署树关系结构增强框架,将昂贵的离线结构学习与轻量在线推理分离,把肿瘤学概念与关系组织为可更新的树关系结构,并在推理时检索为紧凑的提示词证据。
TensorZero 研究发现,用 GPT-4.1 生成的高质量对话数据微调小模型,可在多种任务上实现相对 GPT-4.1 最高 30 倍的成本下降,同时性能持平或更优,响应速度最高提升 4 倍。
TensorZero 推出基于 Track-and-Stop 最佳臂识别的多臂老虎机算法,在 LLM 网关中实现自适应 A/B 实验,动态调整采样比例并用 anytime-valid 的 GLRT 停止规则避免 p-hacking。
推荐理由:文章用仿真和真实 NER 实验数据说明自适应实验相比均匀采样能减少约 37% 的判定时间,并给出可直接复用的配置方法。
Mixedbread 基于 Prime Intellect 的 prime-rl 训练出深度搜索智能体 Toast 1,搭配 GPT-5.6 Sol 在 OfficeQA Pro V2 上比 Claude Fable 5 高出近 10 个百分点,成本仅为其 27%。
LlamaIndex 推出面向行政运营的文档智能与智能体工作流方案,宣称可消除手动流程、为更高阶任务释放 80% 时间。方案包含发票评估器、合同数据智能体、表单处理器、政策文档智能体、员工入职助手和合规报告器六类组件,基于 LlamaParse 解析含图表和表格的复杂文档,并提供引用溯源与置信度分数。
LlamaIndex 面向研发场景推出文档智能与智能体工作流方案,宣称可将产品研发周期加速 80%。方案包含 R&D assistant、System design navigator、Technical spec comparator 等 6 类智能体,基于 LlamaParse 解析图表与表格等复杂文档,并提供引用溯源与置信度分数。
LlamaIndex 的 Index 产品提供智能分块与嵌入能力,让数据为检索做好准备,支持连接器增量同步、自定义嵌入模型、多模态索引以及 OTEL 等测试评估集成。官方数据显示其已处理超 1B 份文档,LlamaParse 用户超 300k,包月下载量超 25M。KPMG 等团队用其标准化企业知识助手开发,工程师得以从数据管线维护转向 LLM 应用开发。
LlamaIndex 发布 LlamaExtract,可从复杂文档中提取字段级数据,并给出逐列置信度分数与可追溯引用。该工具支持多字段提取、布局与上下文感知推理、自定义或自动检测 schema,以及多种解析模式以平衡成本与精度。LlamaParse 已累计处理超 10 亿份文档,月下载量超 2500 万次,用户超 30 万。
LlamaIndex 推出 LlamaParse,可将复杂版式、表格、图表、手写内容、复选框和图片解析为干净的 markdown。该工具支持版式感知、多模态解析和多种解析模式,可处理数百万页文档,开箱支持 100+ 种语言,并支持本地云部署。官方称已处理超 10 亿份文档,LlamaParse 用户超 30 万,包月下载量超 2500 万次。
LlamaIndex 的 LlamaParse 提供端到端文档理解,覆盖解析、提取与索引三个环节,可处理复杂版式、表格、图表、手写和图像。其 Extract 支持带置信度分数和引用的上下文感知数据提取,Index 通过智能分块与嵌入让数据可直接用于检索。
Eugene Yan 发布长文讲解如何评测长上下文问答系统,提出忠实性与有用性两个正交维度,并介绍证据位置、多跳推理、幻觉等长文本特有挑战。文章覆盖 NarrativeQA、NovelQA、QASPER、L-Eval、HELMET、Loong 六个基准,指出传统 n-gram 指标与人工判断相关性差、应改用 LLM 评估者,且 RAG 在证据分散于多文档的 Loong 任务上反而降低表现。
Eugene Yan 用 RQ-VAE 把 Amazon Reviews 2023 游戏品类的 66k 商品编码为语义 ID,再微调 Qwen3-8B,构建一个无需检索、单一模型即可同时理解自然语言和商品 ID 的推荐混合模型。
Eugene Yan 撰文总结构建产品 evals 的三个步骤:标注小数据集、对齐 LLM 评估器、运行评估 harness。
CMU 提出 LumberChunker,让 LLM 在连续段落中判断叙事最早发生语义转折的位置,从而切分出更自然的文本块。在 100 本公版书、3000 道大海捞针式问题的 GutenQA 基准上,其 DCG@20 达 62.1%、Recall@20 达 77.9%,优于语义分段、段落级、递归分段和命题级方法。token 预算 θ≈550 时检索质量最佳,平均块长约 334 tokens。
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,将单次内容检索耗时从 250 分钟降至 2 分钟以内。
针对 RAG 在跨数百份合同的聚合问题上失效,该方案改用结构化抽取:AI 抽取智能体(Claude Sonnet 系列)从每份合同 PDF 提取 8 个关键字段并附置信度,验证智能体(Claude Haiku)独立复核,签名检测分歧由 Amazon Textract 用计算机视觉裁定,结果存入 Amazon Aurora PostgreSQL。
研究者提出 Sieve and Sage 框架,将检索失败拆分为"无法回答"与"受干扰"两种状态,先用轻量模块 Sieve 过滤检索文档中的干扰证据,再调用高成本 LLM(Sage)进行有据生成与拒答。
研究首次为 SFIA 框架建立可复现的结构化技能抽取基线,将自由文本映射为(技能,级别)对,覆盖 147 项专业技能与七个责任级别。在五种策略对比中,检索式匹配识别技能最多,生成式策略精度更高;只有把级别作为显式决策的策略才能可靠预测级别,基于相似度的选择错误率高出两倍以上。
Databricks 发布 Lakebase Search,通过 lakebase_vector 和 lakebase_text 两个扩展为 Lakebase Postgres 带来可扩展向量搜索与 BM25 全文检索,已在 AWS 和 Azure 正式可用。
把 jev 评分用作 RAG 重排序器非常合理。Rippling 内部 GTM 团队的应用做得很不错
https://x.com/i/article/2104262240535023616
NarrateAI 在 Amazon Bedrock 上通过五项技术实现约 99% 的数值准确率并实时流式返回结果,服务超过 4000 名 AWS 高管。这五项技术分别是自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,其中约 90% 的查询走单次快速路径,仅约 10% 的复杂查询进入并行批处理路径。
Datacor 将 Amazon Quick Sight 嵌入其 TrackAbout 解决方案,为工业气体与焊接分销商提供交互式仪表盘和自然语言查询的自助式租赁分析。
Google Cloud 宣布 AlloyDB 和 Cloud SQL for PostgreSQL 17+ 预览原生 BM25 索引,基于 Tiger Data 的开源 pg_textsearch 扩展,无需再维护独立的全文搜索后端。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,MCP 提供工具与数据的标准接入,Skills 封装团队流程与最佳实践,二者可组合使用;RAG 并未消亡,检索能为模型提供训练数据之外的信息,减少 token 消耗并让回答更有依据。
Nous Research 在 GitHub 发布独立 Hermes 记忆提供方插件 hermes-plugin-openviking,对接 OpenViking 上下文数据库。该插件提供会话管理的记忆能力,支持自动提取、分层检索与文件系统存储。
Nous Research 在 GitHub 发布独立 Hermes 记忆提供方插件 hermes-plugin-mem0,基于 mem0 实现服务端 LLM 事实抽取、语义搜索与自动去重,并提供可选的重排序功能。
Nous Research 在 GitHub 发布独立 Hermes 记忆提供方插件 hermes-plugin-honcho,接入 Honcho 的 AI 原生记忆能力。该插件支持跨会话用户建模、辩证式问答、语义搜索与持久化上下文。
Nous Research 在 GitHub 发布独立 Hermes 记忆提供方插件 hermes-plugin-byterover,接入 ByteRover 持久化知识树。该插件通过 brv CLI 实现分层检索,为 Hermes 提供外部记忆能力。
Lucius AI 用 AlloyDB for PostgreSQL 承载覆盖五大洲的招标平台,将语义搜索迁移到 ScaNN 索引后,代表性生产查询延迟从 1.14 秒降至 24 毫秒,提速 47 倍。
Apple 研究团队提出 Glyph,一个将列描述生成与列类型标注建模为有状态图编排的多智能体 LLM 生产系统。其 Descriptor 通过推理-行动工具循环从企业 GitHub 按需检索管道源码来支撑生成,Tagger 并行运行描述、业务线正则与元数据三种策略,并用 RRF 融合排序结果,从 275 叶节点的数据分类本体中打标。
Microsoft 在 GitHub 新建仓库 microsoft/TRPL,对应西奥多·罗斯福总统图书馆(TRPL)的 Living Library 项目。该体验由 AI 驱动,让访客通过自然语言对话与可信的历史知识互动。
H Company 发布 NeoMME 系列多语言多模态编码器,提供 260M 和 800M 两种规格,用单个双向 Transformer 处理文本和 32×32 图像 patch,以 masked discrete-diffusion 目标从零预训练,不依赖预训练视觉塔或因果语言模型。
Meta 工程团队构建了一个面向合规领域的 AI 智能体,作为组织级“第二大脑”,通过结构化知识文件与可组合 recipes 分离知识与推理,并以自动化自我改进闭环将专家反馈编译为经回归测试的更新,无需模型重训。
Sentence Transformers v6.0 引入 MultiVectorEncoder 模型类型,这篇教程完整演示如何训练和微调 ColBERT 式多向量模型,涵盖模型、数据集、损失函数、训练参数和评估器。
推荐理由:原文给出完整可复现的多向量模型微调配方和实测对比,读者可以按组件迁移到自己的领域数据上。
Hugging Face 详解 Papers with Code 论文搜索引擎的架构:用 PostgreSQL 全文检索加 pgvector 语义召回,经加权 RRF 融合为混合搜索,已为超过 11 万篇 arXiv 论文维护嵌入向量。
推荐理由:作者亲述 Papers with Code 混合搜索的架构与生产经验,读者可以借鉴其离线批量与在线查询分离的设计方法。
AlloyDB 的 ScaNN 索引通过新增四级树(preview)架构与内存优化,将向量搜索规模扩展至 100 亿向量。内部测试中,该索引在 100 亿向量下实现 ≤51 ms p95 延迟与 95% 召回率,搜索复杂度由三级树的 O(N^1/3) 降至 O(N^1/4)。四级树已开放 preview,可按快速入门指南部署。
Mistral 发布 Agentic Search,一种多步检索层,让模型在复杂文档中查找、翻阅并核实信息,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环的工具设计与两组基准数据,可对照一次性 RAG 判断适用边界。