跳到正文
原文
Sebastian Raschka· Sebastian Raschka, PhD·· 2025-12-03AI 评分65

DeepSeek V3.2:架构、稀疏注意力与强化学习更新解析

From DeepSeek V3 to V3.2: Architecture, Sparse Attention, and RL Updates

AI 导读

DeepSeek V3.2 延续 V3.2-Exp 的架构,通过 DeepSeek Sparse Attention 引入非标准稀疏注意力,以降低长上下文场景中的训练与推理开销。模型还引入 DeepSeekMath V2 的自验证与自我改进机制,并更新 GRPO 及奖励设计,在可验证任务中采用 RLVR,在通用任务中使用生成式奖励模型。

来源:Sebastian Raschka · magazine.sebastianraschka.com