技术文章
深度内容 · 共 3 篇
三条内容线:原创解读(本站编辑撰稿)、行业精选(合规引用策展)、站长专栏(站长亲笔)。 深度是这里的事——快而准是新闻的事。
MoE 的稀疏艺术:1.6 万亿参数的模型,为什么每个 token 只唤醒 49B
混合专家(MoE)让模型总参数量和推理计算量脱钩。本文从路由公式出发,拆解 Top-K 门控、负载均衡的辅助损失与 DeepSeek-V3 的无辅助损失方案,以及细粒度专家、共享专家、节点受限路由这些工程取舍各自的含义。
大模型推理部署解剖:PD 分离、AF 分离,和 micro-batch 流水线到底在优化什么
为什么同一个模型,自部署的吞吐和商业 API 差一个数量级?答案在部署架构。本文拆解推理两阶段的资源特征、Prefill-Decode 分离与 KV 传输、更进一步的 Attention-FFN 分离,以及 DualPipe 双向流水线如何用 micro-batch 把通信藏进计算里。
注意力的显存战争:从 MHA 到 MLA,KV Cache 是怎么被一步步压缩的
长上下文时代,推理显存的大头不是权重而是 KV Cache。本文从公式和维度出发,拆解 MHA、MQA、GQA、MLA 四种注意力变体各自的缓存账,以及 DeepSeek MLA 低秩压缩为什么能把每 token 缓存压到 1/57。