Sentence Transformers v6.0 新增 MultiVectorEncoder:用同一 API 使用 ColBERT 式晚交互嵌入模型
Hugging Face 发布教程,介绍 Sentence Transformers v6.0 新增的第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索。
推荐理由:官方教程系统讲解多向量晚交互模型的使用、检索质量与索引体积权衡,并给出可直接运行的检索和重排方案。
Hugging Face 发布教程,介绍 Sentence Transformers v6.0 新增的第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索。
推荐理由:官方教程系统讲解多向量晚交互模型的使用、检索质量与索引体积权衡,并给出可直接运行的检索和重排方案。
Target 基于 Spanner Graph 构建企业本体,将图关系、向量嵌入、全文检索与事务数据统一到同一数据库引擎,替代原有 Elasticsearch 加 NoSQL 的碎片化架构。迁移采用零停机四阶段方案,完成后下线旧 Elasticsearch 集群,数据库维护成本降低 50%。该平台为 Gift Finder 等对话式购物助手提供结构化上下文,支撑 GraphRAG 式商品发现。
Google 宣布 Data Commons on Spanner Graph 正式可用,并预览新的 Data Commons Platform,用于把企业私有知识与公共数据集知识图谱打通。
vLLM Semantic Router 提出 Mixture-of-Models(MoM)架构,目标是在同一版本化契约下把独立模型、策略、偏好与执行路径组合成可训练、评估、导出、部署和调用的模型系统。
Mistral 发布 OCR 4 文档解析模型,除提取文本外返回边界框、块类型分类和逐词置信度分数,支持 170 种语言,可单容器自托管部署。
推荐理由:官方说明新模型的结构化输出能力、定价和基准局限,读者可据此判断它在文档解析流程中的适配场景。
OpenBMB(清华 NLP)在 GitHub 发布 SHIFT 源码,对应论文《SHIFT: Gate-Modulated Activation Steering for Knowledge Conflict Mitigation in Retrieval-Augmented Generation》。该方法通过门控调制的激活引导,缓解检索增强生成中的知识冲突问题。
Google 在 Gemini Enterprise Agent Platform 上推出基于 Agentic RAG 的 Cross-Corpus Retrieval,通过多智能体协作处理多源、多跳查询,相比标准 RAG 在事实性数据集上准确率最高提升 34%。
Mistral AI 发布开源 Search Toolkit 公开预览版,这是一个用于构建 AI 应用生产级搜索管线的可组合框架。
推荐理由:原文给出框架的具体模块构成、内置检索与评测指标,以及可复用的 starter 模板命令,读者可据此评估是否替代自建检索管线。
Sierra 推出 𝜏-knowledge 基准,扩展自 𝜏-bench,新增 𝜏-Banking 金融客服场景,包含 21 个产品类别的 698 份文档(约 195K tokens)。
Sierra 为每个客户从昨日对话中采样数千条匿名搜索样本,用前沿 LLM 多阶段流水线筛选出理想文章构成 golden 数据集,并以 recall、precision、nDCG 等指标每日衡量检索质量。发布检索与重排序模型 Linnaeus 和 Darwin 后,客户 recall 逐日提升,相关解决率最高提升 16 个百分点。
Sierra 发布两款自研搜索模型 Linnaeus(检索)与 Darwin(重排序),称其解决率最高提升 16 个百分点。Linnaeus 直接基于完整对话检索,recall@5 提升 20%、recall@30 约 95%,每次搜索延迟最多降低约 800ms;Darwin 负责重排序,兼顾精度与成本。Sierra 智能体每天执行超 200 万次搜索,P90 延迟与搜索成本均下降超 75%。
OpenBMB 推出 ClawXMemory,一个为 OpenClaw 设计的多层级记忆插件,主打长期上下文能力。该插件通过多层级记忆结构管理长期上下文,具体参数与可用方式尚未在现有信息中披露。
Together AI 在 ICLR 2026 论文《When Does Divide and Conquer Work for Long Context LLM?
Google 联合康奈尔大学在 PNAS 发表研究,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位专家按 6 项指标盲评打分。
OpenAI 在 Responses API 中提供托管式 file search 工具,模型可通过语义与关键词检索,从预先上传到 vector store 的文件知识库中取回信息并自动调用。
Answer.AI 推出 ReadBench 基准,将 MMLU-Redux、MMLU-Pro、GPQA-Diamond、BABILong 和 LongBench 等文本基准的上下文转为图像、问题保留为文本,评测 VLM 从图像中读取和推理文本的能力。
Mistral AI 发布首个代码专用嵌入模型 Codestral Embed,在真实代码检索任务上显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。
Mistral 提出用 LLM as a Judge 结合 RAG Triad 框架评估 RAG 系统,从上下文相关性、有据性和答案相关性三个维度打分。其 API 新增的结构化输出功能可定义评分 schema,让评判 LLM 输出机器可读的分数,从而构建更可靠的自动化评估流程。
Mistral 发布光学字符识别 API Mistral OCR(mistral-ocr-latest),可将图像和 PDF 提取为交错的文本与图像,定价 1000 页 / 美元,批量推理约翻倍。
推荐理由:官方给出完整基准对比、定价和多语言成绩,读者可以据此判断它在文档理解场景中的实际位置。
Lilian Weng 在 Lil'Log 发表长文,将幻觉聚焦于外在幻觉,即模型输出未被提供的上下文或世界知识支持、编造且不可验证的内容。文章梳理幻觉成因,包括预训练数据中的过时或错误信息,以及微调引入新知识会加剧幻觉(Gekhman et al. 2024 发现模型学会 Unknown 样本后更易幻觉)。
推荐理由:Lilian Weng 系统梳理大语言模型外在幻觉的成因、检测基准与缓解方法,覆盖 RAG、采样、微调等技术路线。
Lilian Weng 在博客发布长文,系统阐述以 LLM 为核心控制器的自主智能体架构,将其拆解为规划、记忆、工具使用三大组件。
推荐理由:文章把 LLM 智能体系统拆解为规划、记忆、工具使用三大组件,梳理了 ReAct、Reflexion 等代表方法与共同局限,便于建立整体认知框架。
Lilian Weng 在 Lil'Log 发布长文,综述构建开放域问答(ODQA)系统的常见方法。
推荐理由:作者系统梳理了开放域问答的检索器阅读器、检索器生成器和闭卷三类框架,并给出各模型的预训练与联合训练对比。