登记表格式,记录常用模型的权重规模、架构与官方权重大小;新模型直接按行追加两张表 + 备注。显存怎么算、为什么这么算见 llm-vram-usage-calculation。
主表
| 模型 | 厂商 | 开源时间 | 架构 | 总参数 | 激活参数 | 上下文 | BF16 理论权重 | 官方权重精度 | 官方权重大小 |
|---|---|---|---|---|---|---|---|---|---|
| DeepSeek-V4-Pro | DeepSeek | 2026-04 | MoE | 1.6T | 49B | 1M | 3.2 TB | FP4 专家 + FP8 非专家(QAT) | ≈850 GB |
| DeepSeek-V4-Flash | DeepSeek | 2026-04(0731 正式版) | MoE | 284B | 13B | 1M | 568 GB | FP4 专家 + FP8 非专家(QAT) | ≈150-162 GB |
| Kimi K3 | 月之暗面 | 2026-07-27 | MoE + 原生视觉 | 2.8T | 104B | 1M | 5.6 TB | MXFP4 权重 / MXFP8 激活(QAT) | ≈1.5 TB |
BF16 理论权重 = 总参数 × 2B,仅作”如果全精度要多大”的参照;三家旗舰官方发布即低比特 QAT 权重,实际下载大小看最后一列。
架构细表
| 模型 | 层数 | hidden | 注意力 | 专家 routed/topk/shared | expert 中间维度 | 词表 | 其他 |
|---|---|---|---|---|---|---|---|
| V4-Pro | 61 | 7168 | MLA + CSA(4x)/HCA(128x),index topk 1024 | 384 / 6 / 1 | 3072 | 129,280 | q_lora 1536,o_groups 16 |
| V4-Flash | 43 | 4096 | MLA + CSA(4x)/HCA(128x),index topk 512 | 256 / 6 / 1 | 2048 | 129,280 | q_lora 1024,o_groups 8 |
| Kimi K3 | 93 + 1 dense | 7168 | 69×KDA 线性注意力 + 24×Gated MLA | 896 / 16 / 2 | 3072 | 160K | 视觉 MoonViT-V2 401M;SiTU-GLU;Attention Residuals |
备注
DeepSeek-V4-Pro
- 专家参数 ≈1.55T(3×7168×3072×384×61),占总量 ~97%;非专家 ≈24B(FP8)
- 官方权重建算:1.55T×0.53B(MXFP4 含 scale)+ 24B×1B ≈ 850 GB
- KV cache:层配比 1 全量 + 29 CSA + 31 HCA,1M 上下文 BF16 ≈10 GB,与 Flash 同量级
DeepSeek-V4-Flash
- 完整显存推导见 llm-vram-usage-calculation
- GGUF 实测:AD-BF16 原样重打包 162.1 GB、AD-MXFP4 154.5 GB;专家已 4bit QAT,再往下压(<3bit)质量陡降
Kimi K3
- 全球首个开源 3T 级模型;Stable LatentMoE:896 专家激活 16 + 2 shared
- KDA 混合线性注意力:1M 上下文 KV cache 压缩 75%、解码速度最高 6.3x;KDA Prefix-Cache 编程场景缓存命中率 >90%
- 视觉编码器 MoonViT-V2 401M 参数,原生图文视频理解
- 社区量化:Unsloth GGUF(UD-Q8_K_XL / UD-Q4_K_XL 等),昇腾 950 / SGLang / vLLM Day-0 适配
登记约定(后续追加模型时)
- 主表必填:总参数 / 激活参数(MoE)/ 上下文 / 官方权重精度与大小;BF16 理论值按
总参数×2B速算 - 架构细表尽量从官方 config.json / 模型卡取数,注明注意力类型与专家配置
- 权重大小优先实测(GGUF/safetensors 目录大小),无实测给公式估算并标注 ≈
关联
- llm-vram-usage-calculation — 显存三段式计算逻辑(权重/KV/开销),本页数字的推导方法
- deepseek-reasonix — DeepSeek 原生 terminal coding agent
资源
- DeepSeek-V4-Pro config:https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/config.json
- DeepSeek-V4-Flash config:https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash/blob/main/config.json
- Kimi K3 模型卡与技术报告:https://modelscope.cn/models/unsloth/Kimi-K3-GGUF