生成式推荐系统如何重新定义大规模 RecSys
生成式推荐系统正把 RecSys 从传统嵌入向量相似度目标转向生成式目标,即根据用户历史序列预测大目录中的下一个动作或物品。NVIDIA 技术博客指出,RecSys 是消费互联网中最普遍却极难大规模训练与服务的机器学习问题之一,LLM 的出现推动了这一范式转变。
生成式推荐系统正把 RecSys 从传统嵌入向量相似度目标转向生成式目标,即根据用户历史序列预测大目录中的下一个动作或物品。NVIDIA 技术博客指出,RecSys 是消费互联网中最普遍却极难大规模训练与服务的机器学习问题之一,LLM 的出现推动了这一范式转变。
Mistral 发布 Agentic Search,一种多步检索层,让模型在复杂文档中查找、翻阅并核实信息,通过 Mistral Search Toolkit 提供,并内置于 Studio 和 Vibe 的 Libraries。
推荐理由:原文给出多步检索循环的工具设计与两组基准数据,可对照一次性 RAG 判断适用边界。
VeRL-Omni v0.2.0 发布,通过 vLLM-Omni 的请求级批处理让 Qwen-Image FlowGRPO rollout 的 GPU 利用率从约 80% 升至约 100%,单次生成时间从 226s 降至 108s,减少 52%。
NVIDIA 探索通用编程智能体能否借助 HoloHub 中的示例、文档和开发工具来开发 Holoscan 边缘实时 AI 应用。Holoscan 是面向医疗影像、机器人等边缘实时 AI 应用的平台,HoloHub 是其配套仓库,汇集了不断增长的参考应用与组件。
NVIDIA 发布技术博客,介绍如何用 NVIDIA FLARE 构建联邦多模态 AI 工作流,在数据无法集中到一处的情况下跨数据本地站点协调视觉语言模型(VLM)训练。VLM 可支持视觉问答、图像描述和图文推理等任务,而联邦学习为这类分布式数据场景提供了训练协调方案。
Pol Alvarez Vecino 借 Peter Naur 的《Programming as Theory building》指出,真正要降低的复杂度是存在于工程师头脑中的程序 Theory,而非代码本身,因此 LoC、圈复杂度等指标无法约束 LLM 的复杂度膨胀。
Grok 4.6 在 DiligenceBench 金融测试中以约 52–53% 位列第 2,与 Claude Opus 5 基本持平,Sonnet 5 以 46.2% 落后。
ALTK-Evolve 让智能体从自身历史轨迹中蒸馏可复用准则并在推理时注入,无需更新权重或人工标注,在 AppWorld 的 585 个多步任务上测试了 8 个模型。
Jakub Pachocki 表示 OpenAI 暂时放缓了部分前沿训练以加强安全与监控,其最大规模的前沿 RL run 仍暂停,继续用较小规模训练和评估测试防护措施并收集更多对齐证据。
MIT CSAIL 团队在 Nature Communications 发表论文,提出“归因衰减”现象:训练数据越大,单个样本对生成结果的影响越小,删除任一图像甚至某艺术家的全部图像后输出不变。
我们许多最强的研究员都选择专注于对齐,但我们也在招聘! 如果你想在一个认真对待对齐、不假装它已解决的前沿实验室工作,请申请。
These are incredibly misleading headlines – @OpenAI Preparedness is very much alive and well by any meaningful definition Our subteam – RSI/misalignment Preparedness – is doing more urgent work than ever, and has never been more empowered to do so!
Hugging Face 发布教程,介绍 Sentence Transformers v6.0 新增的第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索。
推荐理由:官方教程系统讲解多向量晚交互模型的使用、检索质量与索引体积权衡,并给出可直接运行的检索和重排方案。
一个约束感知 GPU 分配器在相同硬件与负载下,相比 FIFO 调度器将 GPU 利用率最多提升 33 个百分点,优先级加权产出在全部场景中上升,最高增幅 105%。在五个真实争用场景中,利用率从 52–85% 提升至 72–88%,优先级加权价值平均增长 52%。该分配器把实时推理需求当作随时步变化的曲线而非全天峰值预留,并按优先级在整个调度周期内放置批式任务。
OpenAI 首席研究官 Mark Chen 宣布与 NVIDIA 达成大规模合作,签约 4+ GW 的算力容量。他表示这是前沿模型训练所需的规模。
https://x.com/i/article/2089330332369588224
Google Research 推出研究性深度学习框架 PhotoScan,从标准 2D 手机照片估算体脂率(BF%)、A/G 比和 V/S 比三项三维体成分指标。
蚂蚁 inclusionAI 在 GitHub 上线 ConceptEdit 项目,包含 ConceptEdit-12M 数据集与 ConceptEdit-Bench 基准。目前公开信息仅给出这两个名称,尚未披露模型规模、评测分数或使用方式等细节。
蚂蚁 inclusionAI 在 GitHub 上线 SingProbe 官方训练代码仓库。正文仅说明这是 SingProbe 的官方训练代码,未披露模型规模、训练数据或评测结果等细节。
vLLM-Omni 团队发布 Distributed Layerwise Offload,让超过单卡 HBM 的视频生成模型(如 Cosmos3-Super 64B / 124 GB)可在多块 NPU 或 GPU 上运行。
Together AI 在平台上推出端点级 LLM A/B 测试功能,让团队用真实用户流量比较候选模型与现网模型,而非只看 benchmark 或影子流量。实验挂在端点上,须有一个 control 和一至多个 variant,variant 部署权重须为 0,百分比为固定流量份额且与副本数无关。
Together AI 在 DeepSWE 全部 113 个任务上各跑 4 次试验,对比 DeepSeek V4 Pro 0813 与 Claude Fable 5。
推荐理由:原文基于 904 次 rollout 的实测数据,给出两模型在成本、失败模式和级联路由上的可迁移用法。
Sierra 宣布在慕尼黑开设办公室,服务德国、奥地利和瑞士的企业客户。Sierra 帮助大型企业构建服务与营收 AI 智能体,客户包括全球三分之一领先银行、40% 的 Fortune 50 企业及十大医疗组织中的五家。其客户 BBVA 30 天上线智能体,英国零售商 Next 用时 42 天,Singtel 用时 56 天。
vLLM 在 PR #47808 中引入 DSpark 置信度调度验证(enable_adaptive_verification),让引擎逐步决定验证多少 draft token,而非按部署固定 num_speculative_tokens。
Hugging Face 发布 2026 年 1 至 8 月开源模型生态观察报告,指出 Hub 公开模型仓库从 243 万增至 296 万、数据集突破 100 万,但 85.6% 的模型终身下载不足 200 次。
推荐理由:报告用 Hub 下载、许可证与衍生模型数据区分关注度与真实采用,读者可据此校准自己对开源模型生态的判断。
Hugging Face 博客与 AWS Strands Robots 团队演示了在单个 Agent 中跑通机器人数据闭环:录制演示同步到 Storage Bucket,通过 Xet 内容定义分块实现字节级去重上传,再用 stream_dataset() 直接从 Hub 流式读取训练,无需先下载整个数据集。
Google DeepMind 发布 Gemini 3.7 Flash,称其为迄今最智能的主力模型,面向编码与 Agent 场景,距 Gemini 3.6 Flash 发布仅三周。
推荐理由:官方博客给出具体评测分数与限时定价,读者可以据此评估 Flash 系列在编码、Web 开发和知识工作上的实际提升。
Sierra 提出在基于目标与护栏构建的智能体上沿用纵深防御原则,让每条客户消息在回复前经过内容、规则与政策、Supervisor 模型、确定性护栏等多层检查,单条消息可触发多达六项校验。Sierra 还通过第三方对抗评估与红队测试、平台级 Threat Detection 与单智能体 Agent Monitors 持续监控,并用 Simulations 在上线前压测护栏回归。
Nous Research 在 GitHub 发布 Hermes-Bot-Mode,为 Hermes 桌面端带来 Bot Mode,提供一组具名智能体,各自拥有独立聊天、头像、例程,并支持智能体间互发消息。该功能以桌面插件形式实现,无需修改核心代码。
推荐理由:原文给出 Harness 的插件化架构设计和 MIT 开源仓库入口,开发者可据此评估是否接入自己的 Agent 开发流程。
蚂蚁 inclusionAI 在 GitHub 上线 ling-cookbook 仓库,为 Ling 模型系列提供指南、文档与实用技巧。该仓库定位是帮助用户充分发挥 Ling 模型系列的能力,目前仅公布了仓库用途,未披露具体模型版本或功能细节。
Hugging Face 组织的 ICML 2026 Open Reproductions 挑战赛(7 月 15 日至 8 月 2 日)中,1,221 名社区成员用 Claude Code。
推荐理由:原文复现了 ICML 2026 约三分之一的论文并给出具体的证伪案例,读者可以借此了解智能体驱动大规模同行审查的可能与局限。
AllenAI 的 OlmoEarth Studio 现已支持计算并导出 OlmoEarth 开源基础模型的 embedding 向量,源代码、模型权重和研究论文公开可查。
微软研究院推出 MindTopo 基准,从连续性、分离、顺序、包围、绳结五类拓扑关系评估多模态大模型的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧关系可见时偶有帮助,跨多步动作时难以维持拓扑约束。