雷峰网·· 12 小时前AI 评分22
Kimi 和 DeepSeek 为什么出现在同一张模型架构图里?GLM-5.3-Flash 的 Linear 与 Sparse 组合解析
Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?
AI 导读
GLM-5.3-Flash 的 45 层架构中,34 层采用 Kimi 路线的 KDA 线性注意力,11 层采用 DeepSeek 路线的 KPool-DSA 稀疏注意力,Linear 与 Sparse 首次被放进同一套模型。
来源:雷峰网 · leiphone.com