跳到正文
原文
雷峰网·· 12 小时前AI 评分22

Kimi 和 DeepSeek 为什么出现在同一张模型架构图里?GLM-5.3-Flash 的 Linear 与 Sparse 组合解析

Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?

AI 导读

GLM-5.3-Flash 的 45 层架构中,34 层采用 Kimi 路线的 KDA 线性注意力,11 层采用 DeepSeek 路线的 KPool-DSA 稀疏注意力,Linear 与 Sparse 首次被放进同一套模型。

来源:雷峰网 · leiphone.com