Together AI 发布 Dedicated Container Inference,自定义模型推理提速最高 2.6x
Together AI 推出 Dedicated Container Inference,团队自带 Docker 容器部署视频生成、虚拟人合成、图像处理等自定义生成媒体模型,平台负责自动扩缩、队列、流量隔离和监控。
Together AI 推出 Dedicated Container Inference,团队自带 Docker 容器部署视频生成、虚拟人合成、图像处理等自定义生成媒体模型,平台负责自动扩缩、队列、流量隔离和监控。
Mistral AI 发布 Mistral Vibe 2.0,这是其终端原生编码智能体的重大升级,由 Devstral 2 模型系列驱动。新增自定义 subagents、多选项澄清、slash 命令技能、统一 agent 模式和自动更新;产品现已在 Le Chat Pro 和 Team 套餐开放,支持按量付费或自带 API key。
推荐理由:官方宣布 Mistral Vibe 2.0 上线,列出 subagents、slash 命令技能等新能力和 Le Chat Pro/Team 套餐与 Devstral 2 定价,读者可据此评估工作流适配。
Mistral AI 团队排查 vLLM 在 P/D 分离部署(NIXL/UCX、Mistral Medium 3.1、开启图编译)下每分钟约 400 MB 的内存泄漏。
推荐理由:原文完整复盘从 Heaptrack、pmap、BPFtrace 到 GDB 的内存泄漏排查路径,方法可迁移到类似的深层依赖问题。
OpenAI 上线面向开发者文档的公共 MCP 服务器,地址为 https://developers.openai.com/mcp,提供对 developers.openai.com、platform.openai.com 和 learn.chatgpt.com 文档的只读搜索与页面内容访问,可把文档拉入 agent 上下文,不会代用户调用 OpenAI API。
Sierra 发布 Workspaces,把 GitHub、Figma 式的协作模式引入 AI 智能体开发,让团队成员在各自 Workspace 中并行构建、测试,再通过合并生成 snapshot 并发布到 QA、staging 或生产环境。
Mistral AI 宣布与德国企业和机构的多项长期战略承诺。与 SAP 建立多年期合作,将 Mistral 模型集成进 SAP AI Foundation,为德国和欧洲提供全主权 AI 技术栈,并共同开发面向复杂行业和行政机构的行业方案;同时与 Helsing 加速开发面向国防和安全应用的视觉-语言-动作模型。Mistral 还将大幅扩充德国本地团队,并在未来数月开设德国办公室。
Mistral AI 推出 Mistral AI Studio,一个面向企业团队的生产级 AI 平台,由 Observability、Agent Runtime 和 AI Registry 三大支柱组成。
OpenAI 开源 ChatKit advanced samples 仓库,收集多个场景驱动的 ChatKit 示例,每个示例由 FastAPI 后端与 Vite + React 前端组成,用 ChatKit Python SDK 实现自定义后端并接入 ChatKit.js。
OpenAI 在 GitHub 发布 openai-apps-sdk-examples 仓库,展示可与 Apps SDK 配合使用的示例 UI 组件,以及把组件作为工具暴露的多个 MCP 服务器,包括 Pizzaz、3D 太阳系、购物车和带 OAuth 认证的示例。
Answer.AI 开源 cachy 包,通过修改 httpx 的 send 方法把 LLM 响应缓存到本地文件,无需手写 mock。测试运行从 2 分钟缩短到约 2 秒,并让 CI/CD 测试和 notebook diff 更干净。
推荐理由:开源工具 cachy 通过拦截 httpx 缓存 LLM 响应,测试从 2 分钟降到约 2 秒,方法可直接迁移到自己的项目。
Thinking Machines Lab 发布研究,系统实验表明在满足两个条件时 LoRA 与全量微调(FullFT)样本效率相同、最终性能相当:将 LoRA 应用于所有层尤其是 MLP/MoE 层,且可训练参数量超过数据集信息量。
Thinking Machines Lab 的 Horace He 发文指出,LLM 推理非确定性的主因不是并发加浮点误差,而是服务器负载变化导致 batch size 变化,使非批不变的 kernel 输出随批次改变。
推荐理由:原文指出 LLM 推理不确定性的真正根源是批大小变化而非并发原子加,并给出可复现的批不变 kernel 方案。
上海人工智能实验室 InternLM 项目发布 AdaptiveGEMM,一种可适配不同 Group M 长度的 FP8 GEMM 实现。该工作针对分组矩阵乘法中 Group M 长度多变的情况做自适应处理,属于底层算子层面的优化。
上海人工智能实验室 InternLM 项目发布 GroupedGEMM,为 CUTLASS 和 CUBLAS 的分组 GEMM、Permute 与 Unpermute 提供 PyTorch 绑定。该库面向 MoE 等场景中的分组矩阵计算,可直接在 PyTorch 中调用上述算子。
OpenAI 发布 API 速率限制指南,说明速率限制按组织级和项目级而非用户级设定,并随所用模型不同而变化。限制指标包括 RPM、RPD、TPM、TPD、IPM 及部分流式音频模型的每分钟音频分钟数,任一指标先触顶即受限。付费用量层级分为 Build、Launch、Grow,随累计充值额自动升级,层级越高速率限制越高。
Mistral AI 发布 Codestral 25.08,并推出覆盖补全、语义检索与智能体工作流的企业编码栈,包含 Codestral Embed、Devstral 和 Mistral Code IDE 插件。
Mistral AI 联合 Carbone 4 和 ADEME 完成 AI 模型首个综合生命周期分析(LCA),并经 Resilio 和 Hubblo 同行评审。
推荐理由:原文给出了 Mistral Large 2 全生命周期的具体碳、水和资源消耗数字,并说明其对选型与采购的意义。
OpenAI 发布 Background mode 指南,开发者可在 GPT-5.2 和 GPT-5.2 Pro 上异步执行长任务,通过将 API 请求的 background 设为 true 并以 GET 端点轮询状态,避免超时和连接问题。ZDR 项目需配合 store=false,响应数据临时落盘约 10 分钟;仅显式设置 store=true 时响应才会在轮询期后保留。
OpenAI 推出 Flex processing(beta),以更慢的响应速度和偶发的资源不可用换取更低成本,适合模型评估、数据增强和异步等非生产任务。token 按 Batch API 费率计价,叠加 prompt caching 折扣,通过在 API 请求中设置 service_tier 为 flex 使用;资源不足时返回 429 且不计费,官方建议用指数退避重试或改回标准处理。
OpenAI Developers 分享在质量、性能与开销之间取得平衡的策略,围绕准确率、延迟和成本三个维度做取舍。内容聚焦如何为具体场景选择合适的权衡方案。
OpenAI 发布 Evals 最佳实践指南,讲解如何为 LLM 应用设计评估,并宣布 Evals 平台将于 2026 年 10 月 31 日对现有用户转为只读、11 月 30 日关停。指南覆盖从单轮交互到多智能体四种架构中非确定性出现的环节,给出指标型评估、人工评估和 LLM-as-a-judge 的取舍建议,并提醒用 gpt-6-astra 构建 LLM 评审时需先与人工标注校验一致性。
OpenAI 发布 openai-testing-agent-demo 仓库,演示如何用 CUA 模型和 computer use 工具自动化前端测试。项目包含 frontend、cua-server、sample-test-app 三个应用,通过 Playwright 启动浏览器执行测试用例,MIT 协议开源,官方提醒 computer use 仍处预览阶段,不建议在认证环境或高风险任务中信任。
Mistral AI 发布 Mistral Compute,提供从裸金属服务器到全托管 PaaS 的私有集成 AI 基础设施,涵盖 GPU、编排、API、产品和服务。该服务与 NVIDIA 合作提供最新参考架构,首批可用数万块 GPU 并计划快速扩张,主打欧洲及美中以外地区的数据主权需求,启动合作伙伴包括 BNP Paribas、Orange、Thales、SNCF 等。
Mistral AI 发布 Mistral Medium 3,定位为以约八倍更低的成本提供 SOTA 性能的新级别模型。
推荐理由:原文给出基准对比、定价和部署方式,读者可以据此评估它在企业场景里的性价比定位。
Answer.AI 研究员 Sarah Pan 发布 WebGPU Puzzles,基于 Answer.AI 的 gpu.cpp,参考 Sasha Rush 的 CUDA Puzzles,让初学者可直接在浏览器中学习 GPU 编程基础。项目附带详细解答以降低入门门槛;作者同期分享了从 fast.ai 课程、MIT Primes 研究到一作论文入选 NeurIPS 的经历。
Mistral 发布光学字符识别 API Mistral OCR(mistral-ocr-latest),可将图像和 PDF 提取为交错的文本与图像,定价 1000 页 / 美元,批量推理约翻倍。
推荐理由:官方给出完整基准对比、定价和多语言成绩,读者可以据此判断它在文档理解场景中的实际位置。
Answer.AI 发布开源库 MonsterUI,在 FastHTML 之上提供预样式组件和智能默认值,让开发者用纯 Python 构建现代网页 UI,无需手写 CSS 或维护类名字符串。