OpenAI 发布 ChatKit advanced samples 场景化示例仓库
OpenAI 开源 ChatKit advanced samples 仓库,收集多个场景驱动的 ChatKit 示例,每个示例由 FastAPI 后端与 Vite + React 前端组成,用 ChatKit Python SDK 实现自定义后端并接入 ChatKit.js。
OpenAI 开源 ChatKit advanced samples 仓库,收集多个场景驱动的 ChatKit 示例,每个示例由 FastAPI 后端与 Vite + React 前端组成,用 ChatKit Python SDK 实现自定义后端并接入 ChatKit.js。
OpenAI 在 GitHub 发布 openai-apps-sdk-examples 仓库,展示可与 Apps SDK 配合使用的示例 UI 组件,以及把组件作为工具暴露的多个 MCP 服务器,包括 Pizzaz、3D 太阳系、购物车和带 OAuth 认证的示例。
Answer.AI 开源 cachy 包,通过修改 httpx 的 send 方法把 LLM 响应缓存到本地文件,无需手写 mock。测试运行从 2 分钟缩短到约 2 秒,并让 CI/CD 测试和 notebook diff 更干净。
推荐理由:开源工具 cachy 通过拦截 httpx 缓存 LLM 响应,测试从 2 分钟降到约 2 秒,方法可直接迁移到自己的项目。
Thinking Machines Lab 发布研究,系统实验表明在满足两个条件时 LoRA 与全量微调(FullFT)样本效率相同、最终性能相当:将 LoRA 应用于所有层尤其是 MLP/MoE 层,且可训练参数量超过数据集信息量。
Sam Altman 发文提出"丰裕智能"愿景,目标是建成一座每周可产出 1 吉瓦新 AI 基础设施的工厂,并称这一里程碑需数年、需在芯片到机器人各层创新。他举例称 10 吉瓦算力或可用于攻克癌症或为全球每个学生提供定制辅导,并透露未来数月将公布计划与合作伙伴,今年晚些时候谈及融资方式。
QwenLM 发布 Qwen3-ASR-Toolkit,这是 Qwen3-ASR API 的官方 Python 工具包,支持并行高吞吐调用、稳健的长音频转写和多采样率。该工具包面向需要批量调用 Qwen3-ASR 语音识别能力的开发者。
Thinking Machines Lab 的 Horace He 发文指出,LLM 推理非确定性的主因不是并发加浮点误差,而是服务器负载变化导致 batch size 变化,使非批不变的 kernel 输出随批次改变。
推荐理由:原文指出 LLM 推理不确定性的真正根源是批大小变化而非并发原子加,并给出可复现的批不变 kernel 方案。
上海人工智能实验室 InternLM 项目发布 AdaptiveGEMM,一种可适配不同 Group M 长度的 FP8 GEMM 实现。该工作针对分组矩阵乘法中 Group M 长度多变的情况做自适应处理,属于底层算子层面的优化。
上海人工智能实验室 InternLM 项目发布 GroupedGEMM,为 CUTLASS 和 CUBLAS 的分组 GEMM、Permute 与 Unpermute 提供 PyTorch 绑定。该库面向 MoE 等场景中的分组矩阵计算,可直接在 PyTorch 中调用上述算子。
安全研究员 Johann Rehberger 在 Month of AI Bugs 期间发布 AgentHopper,一个利用 GitHub Copilot、Amp Code、Amazon Q Developer 和 AWS Kiro 间接提示词注入远程代码执行漏洞实现跨智能体传播的 AI 病毒概念验证。
OpenAI 发布 API 速率限制指南,说明速率限制按组织级和项目级而非用户级设定,并随所用模型不同而变化。限制指标包括 RPM、RPD、TPM、TPD、IPM 及部分流式音频模型的每分钟音频分钟数,任一指标先触顶即受限。付费用量层级分为 Build、Launch、Grow,随累计充值额自动升级,层级越高速率限制越高。
Mistral AI 发布 Codestral 25.08,并推出覆盖补全、语义检索与智能体工作流的企业编码栈,包含 Codestral Embed、Devstral 和 Mistral Code IDE 插件。
Mistral AI 联合 Carbone 4 和 ADEME 完成 AI 模型首个综合生命周期分析(LCA),并经 Resilio 和 Hubblo 同行评审。
推荐理由:原文给出了 Mistral Large 2 全生命周期的具体碳、水和资源消耗数字,并说明其对选型与采购的意义。
OpenAI 发布 Background mode 指南,开发者可在 GPT-5.2 和 GPT-5.2 Pro 上异步执行长任务,通过将 API 请求的 background 设为 true 并以 GET 端点轮询状态,避免超时和连接问题。ZDR 项目需配合 store=false,响应数据临时落盘约 10 分钟;仅显式设置 store=true 时响应才会在轮询期后保留。
OpenAI 推出 Flex processing(beta),以更慢的响应速度和偶发的资源不可用换取更低成本,适合模型评估、数据增强和异步等非生产任务。token 按 Batch API 费率计价,叠加 prompt caching 折扣,通过在 API 请求中设置 service_tier 为 flex 使用;资源不足时返回 429 且不计费,官方建议用指数退避重试或改回标准处理。
OpenAI Developers 分享在质量、性能与开销之间取得平衡的策略,围绕准确率、延迟和成本三个维度做取舍。内容聚焦如何为具体场景选择合适的权衡方案。
OpenAI 发布 Evals 最佳实践指南,讲解如何为 LLM 应用设计评估,并宣布 Evals 平台将于 2026 年 10 月 31 日对现有用户转为只读、11 月 30 日关停。指南覆盖从单轮交互到多智能体四种架构中非确定性出现的环节,给出指标型评估、人工评估和 LLM-as-a-judge 的取舍建议,并提醒用 gpt-6-astra 构建 LLM 评审时需先与人工标注校验一致性。
OpenAI 发布 openai-testing-agent-demo 仓库,演示如何用 CUA 模型和 computer use 工具自动化前端测试。项目包含 frontend、cua-server、sample-test-app 三个应用,通过 Playwright 启动浏览器执行测试用例,MIT 协议开源,官方提醒 computer use 仍处预览阶段,不建议在认证环境或高风险任务中信任。
Mistral AI 发布 Mistral Compute,提供从裸金属服务器到全托管 PaaS 的私有集成 AI 基础设施,涵盖 GPU、编排、API、产品和服务。该服务与 NVIDIA 合作提供最新参考架构,首批可用数万块 GPU 并计划快速扩张,主打欧洲及美中以外地区的数据主权需求,启动合作伙伴包括 BNP Paribas、Orange、Thales、SNCF 等。
Mistral AI 发布 Mistral Medium 3,定位为以约八倍更低的成本提供 SOTA 性能的新级别模型。
推荐理由:原文给出基准对比、定价和部署方式,读者可以据此评估它在企业场景里的性价比定位。
Answer.AI 研究员 Sarah Pan 发布 WebGPU Puzzles,基于 Answer.AI 的 gpu.cpp,参考 Sasha Rush 的 CUDA Puzzles,让初学者可直接在浏览器中学习 GPU 编程基础。项目附带详细解答以降低入门门槛;作者同期分享了从 fast.ai 课程、MIT Primes 研究到一作论文入选 NeurIPS 的经历。
安全研究者 Johann Rehberger 在 ASCII Smuggler 中新增 Sneaky Bits 编码,用两个隐形 Unicode 字符(U+2062 表示 0、U+2064 表示 1)按位编码任意 Unicode 字符或字节序列。
Mistral 发布光学字符识别 API Mistral OCR(mistral-ocr-latest),可将图像和 PDF 提取为交错的文本与图像,定价 1000 页 / 美元,批量推理约翻倍。
推荐理由:官方给出完整基准对比、定价和多语言成绩,读者可以据此判断它在文档理解场景中的实际位置。
DeepSeek 在 GitHub 开源 3FS,一个高性能分布式文件系统,专为应对 AI 训练和推理工作负载的挑战而设计。
DeepSeek 在 GitHub 发布新仓库 EPLB(Expert Parallelism Load Balancer),用于专家并行场景下的负载均衡。该工具面向 MoE 架构中专家并行带来的负载不均问题,目前仓库仅提供项目名称与简介,具体功能与用法尚未披露。
DeepSeek 在 GitHub 发布 FlashMLA 仓库,提供高效的 Multi-head Latent Attention(MLA)内核,地址为 https://github.com/deepseek-ai/FlashMLA。本次材料仅含仓库简介,未提供更多性能或使用细节。
DeepSeek 在 GitHub 发布新仓库 deepseek-ai/open-infra-index,定位为经过生产验证的 AI 基础设施工具集合,用于高效 AGI 开发和社区驱动的创新。
DeepSeek 在 GitHub 开源 DeepEP,一个高效的 expert-parallel(专家并行)通信库,仓库地址为 https://github.com/deepseek-ai/DeepEP。
DeepSeek 在 GitHub 开源了 GPU BLAS 内核库 DeepGEMM,主打简洁与高效。该库以 clean and efficient 为设计目标,面向 GPU 上的 BLAS 运算场景。
安全研究人员 Johann Rehberger 演示,通过在文档中嵌入提示注入并配合延迟工具调用,可诱导 Gemini Advanced 把虚假信息写入用户长期记忆。
Answer.AI 发布开源库 MonsterUI,在 FastHTML 之上提供预样式组件和智能默认值,让开发者用纯 Python 构建现代网页 UI,无需手写 CSS 或维护类名字符串。
Lilian Weng 发布长文综述大型 Transformer 模型推理优化的主要方法,指出 KV cache 内存占用和注意力随序列长度二次增长的推理瓶颈。文章覆盖知识蒸馏、量化(PTQ/QAT、LLM.int8()、GPTQ、SmoothQuant)、结构化剪枝与 N:M 稀疏、MoE 路由改进以及高效注意力架构等方向,并给出 DistilBERT 等具体效果数据。
Lilian Weng 在博客中系统讲解在多 GPU 上训练超大模型的方法,覆盖数据并行、模型并行、流水线并行、张量并行和 MoE 等并行范式。文章结合 GPipe、PipeDream、Megatron-LM、GShard、Switch Transformer 等工作分析流水线气泡、门控路由设计,并介绍激活重计算、混合精度训练和 ZeRO 等节省显存的方法。