Mistral 如何用 AI 智能体迁移 4 万行 Fortran 77 遗留代码
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值对齐校验框架,用自定义解析器生成调用树并借助 Vibe CLI 启动上百个智能体补文档,最终采用人工把关的 coder、tester、reviewer 智能体工作流逐模块迁移。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 的油藏模拟器迁移到 C++,该代码库没有测试套件和集中文档。团队先搭建数值对齐校验框架,用自定义解析器生成调用树并借助 Vibe CLI 启动上百个智能体补文档,最终采用人工把关的 coder、tester、reviewer 智能体工作流逐模块迁移。
vLLM 为 GLM 5.3 引入 Hybrid HiSparse 卸载机制,在单台 8× H200 节点上首次实现 100 万上下文长度运行,并在各上下文长度下大幅提升并发量。该机制基于稀疏 MLA 的 top-K 选择,将未被选中的 KV cache 卸载至 CPU,仅在 KV cache 承压时才付出 CPU-GPU 传输代价,热缓冲页与常驻页共用同一 HMA 块池。
Sierra 发布呼叫中心 AI 运营与推广指南,主张把 AI 部署当作运营模式变革而非单点演示,需在迁移流量前设定基线与扩展标准。指南覆盖语音、消息、邮件等渠道,Sierra 支持单一智能体跨渠道部署,Voice 支持呼入呼出、语音模拟、多语言与带上下文升级。落地需围绕路由与队列行为、人力排班、人机质量校准等环节设计运营模型。
NVIDIA 团队用 NemoClaw 构建了一个记忆驱动的"幕僚长"智能体,通过名为 self model 的人类可读知识层保存智能体记忆。该智能体面向企业工作中随时间变化的邮件、决策、项目和待办事项,避免每次启动都需重建上下文。
NVIDIA 发布技术指南,介绍如何在 Jetson 边缘设备上部署和优化具备多步推理能力的模型。此前这类模型体积过大,无法在边缘硬件本地运行,开发者只能将推理请求路由至数据中心,带来网络依赖、成本上升与数据外泄风险。该指南称这一限制正在被打破。
NVIDIA 技术博客介绍如何在联邦 Kubernetes 与 AI 平台间传递用户身份。现代 AI 平台中用户从中央门户进入、打开受治理数据集、启动 notebook 并调用另一集群中的助手,身份在每一步都跨越控制面与数据面边界,传统单点登录在此失效。
Meta 推出 ZGateway,作为统一 ZippyDB 客户端流量的无状态代理层,承载约 40% 的 ZippyDB 流量,可处理超过 10 亿次/秒的操作,平均用例仅增加约 6% 计算开销。
GitHub Blog 发布 GitHub Copilot app 入门教程,讲解如何同时运行多个 agent 会话。每个会话可运行在独立的 Git worktree 上,彼此隔离、并行执行且各自保留上下文,用户可在 sessions 视图跟踪进度,把时间花在审查和决策上。
Hugging Face 发布教程,用 TRL 库对 LiquidAI/LFM2.5-350M 做 GRPO 微调,仅用约 500 个样本和 100 步训练,将其在 IFStruct benchmark 上的通过率从 22.6% 提升到 29.7%。
推荐理由:教程给出完整可复现的低成本 GRPO 微调流程和逐项评测数字,读者可以照着在免费 GPU 上复刻这一结构化输出改进方法。
Hugging Face 博客发布复现实践:作者用 TRL 和 OpenEnv 开源复现 Surya Narreddi 用 RL 让 Qwen/Qwen3.5-35B-A3B 写 p5.brush JavaScript 画水彩的方法,参考池、RL 环境、训练脚本和模型全部公开。
NVIDIA 技术博客发布 CUDA 优化实战教程,以一个 RGB 转灰度并计算分块的图像处理管线为例,通过六个增量步骤演示如何用 Compute Sanitizer 和 CCCL 新索引 API 排查越界错误。
NVIDIA 技术博客发布 AI 模型协同设计系列第三篇,探讨如何用投机解码在保持精度的同时加速 LLM 推理。文章给出五条指南,用于在帕累托前沿上选择草稿长度与草稿机制。
Meta 工程团队构建了一个面向合规领域的 AI 智能体,作为组织级“第二大脑”,通过结构化知识文件与可组合 recipes 分离知识与推理,并以自动化自我改进闭环将专家反馈编译为经回归测试的更新,无需模型重训。
Sierra 发布面向企业的 AI 语音 Agent 指南,说明 Voice AI 与 AI 语音 Agent 的区别,以及语音 Agent 从听、理解、推理、执行到控制的完整工作流程。
NVIDIA 发布技术博客,介绍如何用 NVIDIA Nemotron 构建自适应智能体网络安全系统。文章指出,当前多数安全智能体实现仍依赖既有告警、预定义工作流和已知攻击行为,更难的问题在于识别防御盲区并将其转化为改进。
NVIDIA 技术博客探讨企业如何为 AI 推理负载合理配置 GPU 并优化总体拥有成本(TCO)。文章指出,延迟目标、模型选择、流量模式和预算约束的复杂组合让 GPU 资源规划变得困难。
vLLM-Omni 团队发布 MiniMax H3 服务优化详解,先对完整管线做无损系统级优化,相比 Diffusers 将完整响应延迟降低 30.8%(1.445x)。
NVIDIA 技术博客介绍用 AI 智能体训练跨形态机器人导航策略的方法。导航要求机器人持续定位、理解变化的环境、选择路线并避障,而迁移到新机器人或新场景往往需要新的数据、仿真资产和机器人接口。
Sentence Transformers v6.0 引入 MultiVectorEncoder 模型类型,这篇教程完整演示如何训练和微调 ColBERT 式多向量模型,涵盖模型、数据集、损失函数、训练参数和评估器。
推荐理由:原文给出完整可复现的多向量模型微调配方和实测对比,读者可以按组件迁移到自己的领域数据上。
Hugging Face 发布 gr.Workflow 实用指南,介绍 Gradio 内置的工作流功能:用户把步骤描述为带类型的节点图,Gradio 提供可拖拽画布,每个节点可单独运行、中间结果可见,同一张图自动成为 REST API 并可一键部署到 Hugging Face Spaces。
推荐理由:原文给出 gr.Workflow 的节点图构建、REST API 调用和 Spaces 部署的完整示例,读者可直接 Duplicate 改造成自己的流程。
NVIDIA 发布 DSX MaxLPS,用于提升 AI 工厂的每瓦性能。AI 工厂是受功耗约束的工业系统,对 AI 推理负载而言,应用层每瓦性能已成为衡量 AI 工厂效率的关键指标,因为配电、冷却等环节会消耗部分兆瓦电力,并非每兆瓦都能转化为产生收入的算力。
vLLM 官方博客解析投机解码的 draft-and-verify 机制,对比 native MTP、Gemma 4 MTP、EAGLE-3、DFlash、DSpark 五种起草方法的差异。
vLLM 推出基于 Ray Direct Transport(RDT)的原生分片权重传输引擎,在 48 个 8xH100 节点(32 训练、16 推理)上以 BF16 完成 Kimi K2 的权重传输仅需 7.53 秒。
NVIDIA 提出 GPU 加速的矩阵分解算法 AdaptGrow,可将滚动相关性与尾部依赖矩阵转化为硬聚类、软因子载荷和结构突变信号,支持单 GPU 与多节点规模。该算法面向量化策略中的投资组合构建、风险聚合、统计套利与交易监控等场景,错误的工具分组会带来问题。
NVIDIA 的 AI 安全团队结合与 NVIDIA OpenShell、智能体开发者、开源项目及生态伙伴的合作,阐述了对新兴 AI 智能体栈的看法,包括各层所扮演的角色。随着 AI 智能体能力增强、运行周期变长,在其驱动的应用中内建安全与信任变得愈发重要。
Hugging Face 详解 Papers with Code 论文搜索引擎的架构:用 PostgreSQL 全文检索加 pgvector 语义召回,经加权 RRF 融合为混合搜索,已为超过 11 万篇 arXiv 论文维护嵌入向量。
推荐理由:作者亲述 Papers with Code 混合搜索的架构与生产经验,读者可以借鉴其离线批量与在线查询分离的设计方法。
生成式推荐系统正把 RecSys 从传统嵌入向量相似度目标转向生成式目标,即根据用户历史序列预测大目录中的下一个动作或物品。NVIDIA 技术博客指出,RecSys 是消费互联网中最普遍却极难大规模训练与服务的机器学习问题之一,LLM 的出现推动了这一范式转变。
NVIDIA 探索通用编程智能体能否借助 HoloHub 中的示例、文档和开发工具来开发 Holoscan 边缘实时 AI 应用。Holoscan 是面向医疗影像、机器人等边缘实时 AI 应用的平台,HoloHub 是其配套仓库,汇集了不断增长的参考应用与组件。
NVIDIA 发布技术博客,介绍如何用 NVIDIA FLARE 构建联邦多模态 AI 工作流,在数据无法集中到一处的情况下跨数据本地站点协调视觉语言模型(VLM)训练。VLM 可支持视觉问答、图像描述和图文推理等任务,而联邦学习为这类分布式数据场景提供了训练协调方案。
Hugging Face 发布教程,介绍 Sentence Transformers v6.0 新增的第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索。
推荐理由:官方教程系统讲解多向量晚交互模型的使用、检索质量与索引体积权衡,并给出可直接运行的检索和重排方案。
一个约束感知 GPU 分配器在相同硬件与负载下,相比 FIFO 调度器将 GPU 利用率最多提升 33 个百分点,优先级加权产出在全部场景中上升,最高增幅 105%。在五个真实争用场景中,利用率从 52–85% 提升至 72–88%,优先级加权价值平均增长 52%。该分配器把实时推理需求当作随时步变化的曲线而非全天峰值预留,并按优先级在整个调度周期内放置批式任务。
Hugging Face 博客与 AWS Strands Robots 团队演示了在单个 Agent 中跑通机器人数据闭环:录制演示同步到 Storage Bucket,通过 Xet 内容定义分块实现字节级去重上传,再用 stream_dataset() 直接从 Hub 流式读取训练,无需先下载整个数据集。
Sierra 提出在基于目标与护栏构建的智能体上沿用纵深防御原则,让每条客户消息在回复前经过内容、规则与政策、Supervisor 模型、确定性护栏等多层检查,单条消息可触发多达六项校验。Sierra 还通过第三方对抗评估与红队测试、平台级 Threat Detection 与单智能体 Agent Monitors 持续监控,并用 Simulations 在上线前压测护栏回归。
蚂蚁 inclusionAI 在 GitHub 上线 ling-cookbook 仓库,为 Ling 模型系列提供指南、文档与实用技巧。该仓库定位是帮助用户充分发挥 Ling 模型系列的能力,目前仅公布了仓库用途,未披露具体模型版本或功能细节。
vLLM 详解 Decode Context Parallelism(DCP):将 KV cache 沿序列维度切分到各 GPU,而非像 TP 那样按注意力头切分,从而突破 GQA 和 MLA 模型下 KV cache 复制导致的内存瓶颈。
Together AI 发布 Kimi K3 开发者指南。Kimi K3 是 Moonshot AI 的 2.8 万亿参数开源权重模型,支持 1M 上下文、KDA 与 AttnRes 架构,API 兼容 OpenAI,定价为缓存命中输入每 1M token $0.30、未命中 $3.00、输出 $15.00。
推荐理由:Together AI 官方上手指南,覆盖 Kimi K3 的架构要点、推理与缓存等 API 细节和定价,便于开发者直接接入生产。
vLLM 联合 PyTorch、oneDNN 和 KleidiAI 社区完成 Arm CPU 服务栈的上游优化,新增预构建 wheel 与 Docker 镜像、chunked prefill、前缀缓存、INT8 W8A8/W4A8 推理,并支持 GPT-OSS、Whisper 和 Qwen 3.5/3.6。
DaoCloud 团队在 3 台 8 卡 B300 服务器(共 24 GPU)上以 4 Prefill + 1 Decode 分离拓扑部署 GLM-5.2-NVFP4,在 mean TTFT ≤ 2.5s、mean TPOT ≤ 20ms 的 SLA 下,将 16K 输入的 mean TPOT 从约 40ms 优化到约 17ms。