DeepSeek 开源双向流水线并行算法 DualPipe,用于 V3/R1 训练
DeepSeek 在 GitHub 开源双向流水线并行算法 DualPipe,用于 DeepSeek V3/R1 训练中的计算与通信重叠。该算法通过双向流水线调度实现计算与通信的 overlap,仓库路径为 deepseek-ai/DualPipe。
DeepSeek 在 GitHub 开源双向流水线并行算法 DualPipe,用于 DeepSeek V3/R1 训练中的计算与通信重叠。该算法通过双向流水线调度实现计算与通信的 overlap,仓库路径为 deepseek-ai/DualPipe。
Answer.AI 发布 ModernBERT-Large-Instruct,一个在 ModernBERT-Large(395M 参数)上用 FLAN 指令微调的编码器模型,直接用 MLM 头做分类和选择题,无需架构改动。
Johann Rehberger 发布研究证明可通过 prompt injection 劫持 ChatGPT 实例并将其接入命令控制(C2)系统,实现长期远程控制,类似一种新型僵尸网络。
Lilian Weng 发表长文《Reward Hacking in Reinforcement Learning》,系统讲解 RL 智能体利用奖励函数缺陷获取高奖励却不完成预期任务的现象。
FireRedTeam 开源 Target-Driven-Distillation 项目,用目标时间步选择与解耦引导改进一致性蒸馏。该方法面向扩散模型蒸馏场景,通过挑选目标时间步并解耦引导信号来提升生成一致性。项目已公开,具体效果与评测数据未在原文中给出。
OpenAI 发布新成果,用自研的通用强化学习算法 PPO 训练 5 个 Dota 智能体击败半职业选手,且对战两周前的旧智能体胜率达 90-95%。训练未使用人类对局数据,算法通过自我对弈学会玩法;Sam Altman 认为这表明深度强化学习在算力充足且模拟环境足够好时可解决极难问题,未来可迁移到更接近真实环境的问题。