Microsoft Learn 推出基于 Learn MCP 服务器的自定义智能体
Microsoft Learn 支持创建自定义智能体,该智能体通过 Learn MCP 服务器,依据受信任的 Microsoft 官方文档回答用户问题。平台同时提供 AI、Azure 和 Copilot 基础知识的热门技术资源与培训,以及开发人员社区问答和技能认证。
Microsoft Learn 支持创建自定义智能体,该智能体通过 Learn MCP 服务器,依据受信任的 Microsoft 官方文档回答用户问题。平台同时提供 AI、Azure 和 Copilot 基础知识的热门技术资源与培训,以及开发人员社区问答和技能认证。
GitHub 正在优化 VS Code 中 GitHub Copilot 的 token 效率,以应对其转向按用量计费后每个 token 都变得关键的变化。官方称让智能体框架更省 token 是持续进行的工作,将逐个小的改进持续投入。
Azure Container Apps Sandboxes 已正式可用,为 AI 智能体提供快速、隔离的沙箱基础设施。Azure 同时提供 Microsoft Foundry、Microsoft Fabric、Microsoft IQ 等产品,用于构建、评估和部署生成式 AI 方案与自定义智能体。Azure HorizonDB 处于预览阶段,是基于 PostgreSQL 的云数据库服务。
Microsoft Power Platform 支持专业开发者、IT 人员与业务用户从低代码工具起步,构建应用、自动化工作流并部署 AI 智能体,IT 可集中管理环境、数据访问、DLP 策略与审计。
Microsoft Dynamics 365 推出面向前沿的智能体业务应用,将智能体 CRM、CCaaS 与 ERP 结合,帮助团队更智能地销售、更快服务客户并提升运营利润。该产品被 Forbes Advisor 评为 2025 年最佳云 ERP 软件之一。
Microsoft 生成式 AI 通过深度学习按自然语言提示词生成文本、图像、音乐和代码,区别于仅做分析预测的传统 AI、预测式 AI 和对话式 AI。
Microsoft Edge 将 Copilot 集成进各标签页,可协助比较选项、解释重点,并结合浏览历史提供更个性化的帮助。新增的 Copilot Vision 能查看用户屏幕,即时扫描、分析并给出建议。Edge 还提供节能模式,平均延长 25 分钟电池续航,并内置面向 PC 游戏的 Edge for Game Bar。
Microsoft 发布 Surface 系列新品,包括面向创作者的性能笔记本 Surface Laptop Ultra,该产品目前为预发布状态,功能可能变动。Surface Laptop 13 英寸本地视频播放续航最高 22.5 小时,Surface Pro 12/13 英寸均为 15.5 小时。Copilot+ PC 功能仅在 16GB 及以上内存的部分配置上提供。
微软在 Windows 宣传页中主推 Windows Hello,用户可用人脸、指纹或 PIN 免密登录,无需记忆或输入密码。页面以灵活性、兼容性、本地 AI、游戏生态和内置 Microsoft 安全防护五个维度对比 Windows 与其他主流操作系统,并称 Windows 拥有最大的 PC 游戏生态。本地 AI 功能依赖硬件,且随设备而异。
Microsoft Copilot 现可在 Web、桌面和移动端使用,将工作与生活场景整合到同一体验中,并支持 Windows、Mac、Microsoft Edge 及移动设备间保持连接。Copilot 功能需符合条件的 Microsoft 365 订阅,可用性因地区而异。
Azure Container Apps Sandboxes 已正式可用,为 AI 智能体提供快速、隔离的沙箱基础设施。Azure 同时提供 Microsoft Foundry、Microsoft Fabric、Microsoft IQ 等产品,用于构建、评估和部署生成式 AI 方案与自定义智能体。Azure HorizonDB 处于预览阶段,是基于 PostgreSQL 的云数据库服务。
METR 正将内部评估与智能体启发研究工具从 Vivaria 迁移到 Inspect,并建议新项目优先使用 Inspect。Vivaria 仍以开源形式可用,但新功能开发已逐步停止,现有用户可继续使用。
SGLang 团队推出 Mini-SGLang,一个仅 5k 行 Python 代码的轻量级 LLM 推理框架,源自 SGLang 项目,旨在降低现代推理系统的学习门槛并支持快速研究原型。
SGLang 团队与蚂蚁集团 DeepXPU 团队宣布在 SGLang 内实现 Diffusion LLM(dLLM)框架,并 Day-0 支持 LLaDA 2.0。
推荐理由:原文给出 SGLang 支持 Block Diffusion LLM 的实现思路和实测吞吐数据,读者可据此评估 dLLM 推理方案的可用性。
LMSYS Chatbot Arena 团队复盘 SGLang-Diffusion 自 2025 年 11 月初发布两个月来的进展,当前版本(docker tag: lmsysorg/sglang:dev-pr-17247)比初版快最多 2.5 倍,在 NVIDIA GPU 上较其他方案最高快 5x。
推荐理由:官方复盘发布两个月来的优化成果,速度较初版提升至 2.5 倍,并新增 ComfyUI 集成和 LoRA 支持,读者可评估是否迁移现有图像视频生成工作流。
NVIDIA 宣布 Nemotron 3 Super 发布,SGLang 于 Day-0 提供支持。
Miles 强化学习框架现已支持 AMD Instinct GPU(含 MI300/350 系列),可在 ROCm 上原生运行大规模 RL 后训练。Miles 基于 SGLang 与 Slime 生态,支持 GRPO/PPO、Ray 编排及 Megatron-LM 集成,并提供预构建容器。在单节点 8 卡 MI300X 上,团队用 GRPO 训练了 Qwen3-30B-A3B。
LMSYS 的 SGLang 与 Miles 团队宣布对 DeepSeek-V4(1.6T Pro、284B Flash)提供 Day-0 推理和 RL 训练支持,是首个在发布日同时服务与训练该模型的开源栈。
推荐理由:LMSYS 团队详述了为 DeepSeek-V4 混合稀疏注意力等新架构所做的推理与 RL 训练优化,附基准数据。
SGLang-Omni 团队宣布为 Boson AI 的 Higgs Audio v3 TTS 提供端到端推理服务。该模型约 4B 参数,基于 Qwen3-4B 骨干,支持流式合成和 100 种语言的个位数 WER/CER,开发者可通过文本流内嵌控制标签调节情绪、风格、韵律和音效。
MOSS-TTS-Local-Transformer-v1.5 已在 SGLang-Omni 上实现端到端服务,与 MOSI 和 OpenMOSS 团队合作完成。
SGLang 宣布正式支持 DSpark 投机解码算法(PR sgl-project/sglang#30261),覆盖 Qwen3 等稠密模型和 DeepSeek-V4 等稀疏模型。
DeepSeek-V4 Flash 的 RL 训练现已在 AMD Instinct MI355X GPU 上通过 Miles 与 ROCm 支持,完成四节点端到端验证。
SGLang 团队与 Thinking Machines Lab 合作,为 975B 参数、1M 上下文的多模态模型 Inkling 提供Day-0推理与 RL 支持,并为 Modal 训练的 DFlash 草稿模型提供投机解码。
推荐理由:原文出自 SGLang 团队,给出针对 Inkling 新架构的具体优化手段和实测吞吐数字,读者可评估其对自建推理或 RL 流程的参考价值。
SGLang 团队与 Miles 宣布在发布当天支持 Moonshot AI 的 Kimi K3,覆盖 SGLang 推理和 Miles RL 训练。K3 是首个 3 万亿参数级的开源模型,2.8T 参数、1M token 上下文,采用 69 层 KDA 线性注意力加 24 层 MLA 的混合架构及 LatentMoE 和 Attention Residuals。
推荐理由:K3 的混合架构打破了多数推理框架的既有假设,文中给出的内存管理、投机解码与并行方案对同类服务栈有直接参考价值。
LMSYS SpecForge 团队发布 SpecForge v0.3.0,将目标模型推理与草稿模型训练解耦,统一支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并用 YAML 单一入口配置拓扑。
SGLang 团队与 Meta Superintelligence Labs 合作,为 30B 参数多模态稠密模型 Muse Glimmer 提供 Day-0 支持,面向本地硬件上的智能体工作流推理。
推荐理由:原文给出 Muse Glimmer 在 SGLang 上的多硬件部署方案和分平台实测数据,读者可据此评估本地智能体推理的可行配置。
SGLang 团队宣布与 Qwen、阿里百炼、NVIDIA 和 AMD 合作,在 SGLang 和 Miles 中于发布当日支持 Qwen3.8-2.4T-A95B,这是千问最大的开源模型,总参数 2.4T、每 token 激活 95B。
推荐理由:原文给出 Qwen3.8 混合注意力架构的推理支撑细节和实测性能数字,读者可据此评估新模型在自建推理栈上的部署可行性。
RadixArk 发布 Miles v0.1,一个面向前沿后训练的全栈生产级系统,是首个 Miles 版本的继任者。它基于 slime 设计,用 SGLang 做 rollout、NVIDIA Megatron-LM 或 FSDP 做训练,支持全异步 RL、三种评估模式和可插拔智能体环境,并附带智能体编码与终端任务的端到端配方。
蚂蚁集团基础设施团队联合阿里巴巴与 SGLang 团队推出 Weight Cache Daemon,通过 CUDA IPC 零拷贝映射将常驻 GPU 的量化后权重直接提供给新的 SGLang 引擎实例。
LlamaIndex 发布 Parse Gateway,基于 LiteParse v2.2.0 的 is_complex 功能在页面级别估计文档复杂度,并将各页路由到不同的 LlamaParse 层级。
LlamaIndex 在 LlamaParse 平台发布 beta 版 Turbo 抽取档位,主打低延迟实时工作流。
多数智能文档处理(IDP)平台在演示中表现良好,但在生产环境中因文档多样性而失效,演示与生产的准确率差距常达 10 到 20 个百分点,98% 的干净 PDF 提取准确率在实际收件中可能降至 82%。传统平台依赖模板,模板数量会随文档种类增长而不断累积,且普遍忽略图表、示意图、图像等非文本内容。新一代方案采用 LLM 编排层,将文本、表格、图表分别路由给 OCR、版面感知提取和视觉语言模型处理。
LlamaIndex 发布 LiteParse 更新,通过对自维护 PDFium fork 做内存分配等优化,文本提取提速 20-25%,OCR 关闭下平均 2.8ms/page 提取文本、3.9ms/page 渲染 markdown。
LlamaIndex 提出将 OCR 融入更广泛的解析与索引框架,用 VLM 文档解析、机器学习和结构化解析把发票转为可校验的结构化财务数据,而非只做字符识别。该方案称可提升准确率、降低成本、把处理周期从数天缩短到数分钟,并支持行项目级提取与审计追溯。
Agentic OCR 将推理、验证与自适应模型选择引入文档处理流程,以目标导向的智能体循环取代传统 OCR 的一次性提取。它用多模态语言模型作为推理层,通过视觉定位(bounding box)让每个抽取字段可回溯到原文位置,并自动识别文档类型、无需模板即可适配新格式。相比传统 OCR 与 IDP,它在版面变化时自动适应、能自我纠错并输出带引用的校验结果,新文档类型的接入从数周配置缩短到数分钟。
Agentic 文档抽取把文档处理当作推理任务,通过"规划-执行-验证"循环先识别文档类型与逻辑结构,再抽取数据并自查结果,可捕获 OCR 高置信度但语义不合理的错误。LlamaParse 对每份文档同时校验视觉布局与语义内容,并用视觉定位将文本绑定到页面坐标,从而区分格式相同的金额或日期字段。该方式无需为 500 种发票格式分别维护模板,可动态推断表头与单元格关系。
LlamaIndex 发文介绍 KYC 自动化如何以软件完成身份核验、制裁筛查与风险评分,标准案例处理时间从数天至数周缩短到数分钟至数小时,且成本不随客户量线性增长。文中将流程拆为文档收集、身份核验与数据提取等五个阶段,并指出文档处理层是多数实现低估的成败关键,LlamaParse 以 agentic 文档解析将任意格式文档转为结构化内容。
收入验证 API 通过数据采集、验证与决策支持三步流程,将工资单、税表、银行流水等文档转为结构化收入记录。文章对比了 payroll API(Argyle、Pinwheel)、开放银行数据、人工审核与文档提取 API(LlamaParse)四类方案,指出 payroll API 对自雇、零工及小雇主覆盖不足,文档提取可覆盖任意收入类型但需下游结构化逻辑,混合方案覆盖更广但集成更复杂。
LlamaIndex 为旗下智能体文档处理平台 LlamaParse 开放定制演示预约,主打文档 OCR、信息抽取与索引的行业领先准确率。该平台提供页面级引用、置信度分数和边界框以支持人工复核,并可通过成本优化模式自动选择解析设置来平衡成本与准确率。用户还能借助低代码构建器 LlamaAgents,用自然语言开发和部署文档智能体,实现端到端自动化。
LlamaIndex 公布 LlamaParse 文档解析平台的定价方案,采用 credit 计费,1,000 credits = $1.25,免费版每月含 10K credits,Starter 含 40K、Pro 含 400K。