热点事件持续更新
NinaXander:跨架构冻结语言模型组合研究
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月1日,arXiv cs.CL 分类发布 NinaXander 研究,探讨通过共享潜在空间跨架构家族组合冻结语言模型的可行性与局限。该研究用单个训练好的共享潜在适配器连接不同架构家族的冻结语言模型层,组合模型无需重训即可在不同层连接。实验采用 RWKV-4-Raven-7B 与 Tulu-Pythia-6.9b,其中 Pythia 前 5 层加 RWKV 后 27 层的配置将 Transformer KV cache 减少 84.4%,准确率与单独 RWKV 无显著差异。
AI 根据报道生成 · 2 小时前更新
最新进展10月1日 12:00
NinaXander 研究发布,跨架构组合冻结模型可减少 KV cache 84.4%。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- arXiv:cs.CL(计算语言学,全量分类)NinaXander:通过共享潜在空间跨架构家族组合冻结语言模型的可行性与局限
NinaXander 用单个训练好的共享潜在适配器连接不同架构家族的冻结语言模型层,组合模型无需重训即可在不同层连接。用 RWKV-4-Raven-7B 与 Tulu-Pythia-6.9b 实验,Pythia 前 5 层加 RWKV 后 27 层的配置将 Transformer KV cache 减少 84.4%,准确率与单独 RWKV 无显著差异。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。