用 Amazon Bedrock Knowledge Bases 以自然语言查询理赔数据
Amazon Bedrock Knowledge Bases 新增 AgenticRetrieveStream API,可将理赔文档的多部分问题拆成子查询并多轮检索,直到证据充分再生成带引用的答案。
Amazon Bedrock Knowledge Bases 新增 AgenticRetrieveStream API,可将理赔文档的多部分问题拆成子查询并多轮检索,直到证据充分再生成带引用的答案。
Liquid AI 发布 LFM2-ColBERT-350M,一个基于 LFM2 骨干的晚交互检索模型,支持用一种语言存储文档、用其他语言查询检索。在扩展的 NanoBEIR 多语言基准上,其跨语言检索能力显著优于 150M 参数的 GTE-ModernColBERT-v1,尤其在德语、阿拉伯语、韩语和日语上;尽管模型体积更大,查询和文档编码吞吐与对方相当。
Liquid AI 发布两款 350M 参数多语言检索模型 LFM2.5-ColBERT-350M 和 LFM2.5-Embedding-350M,是 LFM 家族首批双向模型,支持 11 种语言的跨语言搜索。
Fireworks AI 发布低成本嵌入模型微调方法,用 InfoNCE 对比学习在平台上微调 Qwen3-Embedding-8B,成本不到 $10、约 150 步。
推荐理由:原文给出用 Qwen3-Embedding-8B 做对比微调的完整配方和三个真实检索任务的实测数据,还总结了哪些场景不会有效。
Fireworks 成为 Voyage AI by MongoDB 首个且唯一合作的专用推理平台,Voyage 4 系列、voyage-multimodal-3.5 与 rerank-2.5 现已原生运行于 Fireworks,检索到生成全流程可在同一 API 上完成。
Fireworks AI 发文梳理企业迈向专业化智能的三阶段路径:先租用闭源前沿模型并围绕其搭建提示词、上下文与 harness 工程,再引入更便宜的开源模型优化成本与延迟,最终为真正属于自己的问题训练定制模型。文中以 Kimi K3 与 GPT 5.6 Sol 在 OSWorld 2.0、UIPad 上的对比为例,说明基准只能用于初筛,自建评测才是性能的最佳指标。
Cohere 发布 Embed 5 系列嵌入模型,含 Embed 5 Pro 和 Embed 5 Fast 两档,均支持 128K token 上下文、100+ 语言、文本与图像输入和共享嵌入空间,定价分别为每百万 token $0.12 和 $0.08。
Cohere 推出 Embed 5 系列前沿嵌入模型,是其迄今最强的嵌入模型,现已提供 Pro 和 Fast 两个档位。同期 Cohere 还发布 North Small Translate 开源权重机器翻译模型,并提出衡量企业检索质量的 RCP-nDCG@10 新指标。
Baseten 上线 Embeddings 服务,可用任意嵌入模型快速处理数百万数据点,支持自定义 Docker 镜像、Truss 库和 Baseten Chains。该服务覆盖 BGE、Stella、SFR-Embedding、Nomic、NV-Embed、Voyage 等模型系列,面向语义搜索与推荐系统,提供五个 9 可用性、优化冷启动和弹性自动扩缩容,可缩容至零以节省成本。
Baseten 工程博客提出 Compound AI 系统,主张用多个专用模型组合替代庞大的全能单体模型,以获得更快、更便宜的推理。该系统让模型之间直接互相调用,减少网络开销、额外延迟和出网成本,并让每个步骤独立使用自动扩缩容的 GPU。文中列举的典型场景包括 AI 电话呼叫、AI 智能体和 RAG 流水线。
Baseten 提供面向大语言模型的推理基础设施,支持部署 DeepSeek V3 0324、DeepSeek R1 0528(均为 671B 参数 MoE 模型)、Llama 4 Scout(109B 总参数)和 Llama 4 Maverick(400B 总参数)等模型。
Augment Code 构建了名为 Mimi 的 AI 数据分析师,接入 Linear、Slack 和 GitHub,并从 Hex 认证报告与 dbt 模型(Mimir 仓库)取数回答团队提问。
EmbeddingGemma 是 Google 基于 Gemma3 架构的 3 亿参数文本嵌入模型,在 MTEB 基准上为不到 5 亿参数的嵌入模型中质量最高,支持 100 多种语言、输入最长 2k token。页面给出使用 baseten_performance_client 的完整代码示例,包括各任务的 prompt 前缀和通过 PerformanceClient 调用生成嵌入的方法。
Baseten Base Labs 发布 Qwen3 8B Reranker,用于对查询与文档做相关性判定,输出只能是 "yes" 或 "no"。示例通过 baseten_performance_client 的 PerformanceClient 调用 classify 接口,支持 truncate、batch_size 与 max_concurrent_requests 参数配置。
TensorZero 研究发现,用 GPT-4.1 生成的高质量对话数据微调小模型,可在多种任务上实现相对 GPT-4.1 最高 30 倍的成本下降,同时性能持平或更优,响应速度最高提升 4 倍。
TensorZero 推出基于 Track-and-Stop 最佳臂识别的多臂老虎机算法,在 LLM 网关中实现自适应 A/B 实验,动态调整采样比例并用 anytime-valid 的 GLRT 停止规则避免 p-hacking。
推荐理由:文章用仿真和真实 NER 实验数据说明自适应实验相比均匀采样能减少约 37% 的判定时间,并给出可直接复用的配置方法。
CMU 提出 LumberChunker,让 LLM 在连续段落中判断叙事最早发生语义转折的位置,从而切分出更自然的文本块。在 100 本公版书、3000 道大海捞针式问题的 GutenQA 基准上,其 DCG@20 达 62.1%、Recall@20 达 77.9%,优于语义分段、段落级、递归分段和命题级方法。token 预算 θ≈550 时检索质量最佳,平均块长约 334 tokens。
Condé Nast 与 AWS 生成式 AI 创新中心合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,将单次内容检索耗时从 250 分钟降至 2 分钟以内。
针对 RAG 在跨数百份合同的聚合问题上失效,该方案改用结构化抽取:AI 抽取智能体(Claude Sonnet 系列)从每份合同 PDF 提取 8 个关键字段并附置信度,验证智能体(Claude Haiku)独立复核,签名检测分歧由 Amazon Textract 用计算机视觉裁定,结果存入 Amazon Aurora PostgreSQL。
Databricks 发布 Lakebase Search,通过 lakebase_vector 和 lakebase_text 两个扩展为 Lakebase Postgres 带来可扩展向量搜索与 BM25 全文检索,已在 AWS 和 Azure 正式可用。
NarrateAI 在 Amazon Bedrock 上通过五项技术实现约 99% 的数值准确率并实时流式返回结果,服务超过 4000 名 AWS 高管。这五项技术分别是自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证,其中约 90% 的查询走单次快速路径,仅约 10% 的复杂查询进入并行批处理路径。
Datacor 将 Amazon Quick Sight 嵌入其 TrackAbout 解决方案,为工业气体与焊接分销商提供交互式仪表盘和自然语言查询的自助式租赁分析。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,MCP 提供工具与数据的标准接入,Skills 封装团队流程与最佳实践,二者可组合使用;RAG 并未消亡,检索能为模型提供训练数据之外的信息,减少 token 消耗并让回答更有依据。
Nous Research 在 GitHub 发布独立 Hermes 记忆提供方插件 hermes-plugin-openviking,对接 OpenViking 上下文数据库。该插件提供会话管理的记忆能力,支持自动提取、分层检索与文件系统存储。
Nous Research 在 GitHub 发布独立 Hermes 记忆提供方插件 hermes-plugin-mem0,基于 mem0 实现服务端 LLM 事实抽取、语义搜索与自动去重,并提供可选的重排序功能。
Nous Research 在 GitHub 发布独立 Hermes 记忆提供方插件 hermes-plugin-honcho,接入 Honcho 的 AI 原生记忆能力。该插件支持跨会话用户建模、辩证式问答、语义搜索与持久化上下文。
Nous Research 在 GitHub 发布独立 Hermes 记忆提供方插件 hermes-plugin-byterover,接入 ByteRover 持久化知识树。该插件通过 brv CLI 实现分层检索,为 Hermes 提供外部记忆能力。
Apple 研究团队提出 Glyph,一个将列描述生成与列类型标注建模为有状态图编排的多智能体 LLM 生产系统。其 Descriptor 通过推理-行动工具循环从企业 GitHub 按需检索管道源码来支撑生成,Tagger 并行运行描述、业务线正则与元数据三种策略,并用 RRF 融合排序结果,从 275 叶节点的数据分类本体中打标。
H Company 发布 NeoMME 系列多语言多模态编码器,提供 260M 和 800M 两种规格,用单个双向 Transformer 处理文本和 32×32 图像 patch,以 masked discrete-diffusion 目标从零预训练,不依赖预训练视觉塔或因果语言模型。
Meta 工程团队构建了一个面向合规领域的 AI 智能体,作为组织级“第二大脑”,通过结构化知识文件与可组合 recipes 分离知识与推理,并以自动化自我改进闭环将专家反馈编译为经回归测试的更新,无需模型重训。
Sentence Transformers v6.0 引入 MultiVectorEncoder 模型类型,这篇教程完整演示如何训练和微调 ColBERT 式多向量模型,涵盖模型、数据集、损失函数、训练参数和评估器。
推荐理由:原文给出完整可复现的多向量模型微调配方和实测对比,读者可以按组件迁移到自己的领域数据上。
Hugging Face 详解 Papers with Code 论文搜索引擎的架构:用 PostgreSQL 全文检索加 pgvector 语义召回,经加权 RRF 融合为混合搜索,已为超过 11 万篇 arXiv 论文维护嵌入向量。
推荐理由:作者亲述 Papers with Code 混合搜索的架构与生产经验,读者可以借鉴其离线批量与在线查询分离的设计方法。
Mistral 发布 Agentic Search,一种多步检索层,让模型在复杂文档中查找、翻阅并核实信息,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环的工具设计与两组基准数据,可对照一次性 RAG 判断适用边界。
Hugging Face 发布教程,介绍 Sentence Transformers v6.0 新增的第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索。
推荐理由:官方教程系统讲解多向量晚交互模型的使用、检索质量与索引体积权衡,并给出可直接运行的检索和重排方案。
vLLM Semantic Router 提出 Mixture-of-Models(MoM)架构,目标是在同一版本化契约下把独立模型、策略、偏好与执行路径组合成可训练、评估、导出、部署和调用的模型系统。
Mistral 发布 OCR 4 文档解析模型,除提取文本外返回边界框、块类型分类和逐词置信度分数,支持 170 种语言,可单容器自托管部署。
推荐理由:官方说明新模型的结构化输出能力、定价和基准局限,读者可据此判断它在文档解析流程中的适配场景。
Google 在 Gemini Enterprise Agent Platform 上推出基于 Agentic RAG 的 Cross-Corpus Retrieval,通过多智能体协作处理多源、多跳查询,相比标准 RAG 在事实性数据集上准确率最高提升 34%。
Mistral AI 发布开源 Search Toolkit 公开预览版,这是一个用于构建 AI 应用生产级搜索管线的可组合框架。
推荐理由:原文给出框架的具体模块构成、内置检索与评测指标,以及可复用的 starter 模板命令,读者可据此评估是否替代自建检索管线。
Sierra 推出 𝜏-knowledge 基准,扩展自 𝜏-bench,新增 𝜏-Banking 金融客服场景,包含 21 个产品类别的 698 份文档(约 195K tokens)。
Sierra 为每个客户从昨日对话中采样数千条匿名搜索样本,用前沿 LLM 多阶段流水线筛选出理想文章构成 golden 数据集,并以 recall、precision、nDCG 等指标每日衡量检索质量。发布检索与重排序模型 Linnaeus 和 Darwin 后,客户 recall 逐日提升,相关解决率最高提升 16 个百分点。