跳到正文
原文
Sebastian Raschka· Sebastian Raschka, PhD·· 2026-05-16AI 评分74

近期LLM架构发展:KV共享、mHC与压缩注意力

Recent Developments in LLM Architectures: KV Sharing, mHC, and Compressed Attention

AI 导读

近期开源权重LLM架构普遍通过KV共享、逐层注意力预算、压缩注意力和残差流优化来降低长上下文成本。文章分析Gemma 4的跨层KV共享与逐层嵌入、Laguna XS.2的逐层注意力头预算、ZAYA1-8B的压缩卷积注意力,以及DeepSeek V4的mHC与CSA/HCA,并指出这些设计会增加实现复杂度。

来源:Sebastian Raschka · magazine.sebastianraschka.com