2026/8/17 16:00:01

Kimi-K2.5-Eagle3-FP8模型文件解剖:5.68GB权重结构、safetensors分片与vLLM加载注意点

Kimi-K2.5-Eagle3-FP8模型文件解剖:5.68GB权重结构、safetensors分片与vLLM加载注意点 Kimi-K2.5-Eagle3-FP8模型文件解剖5.68GB权重结构、safetensors分片与vLLM加载注意点【免费下载链接】Kimi-K2.5-Eagle3-FP8项目地址: https://ai.gitcode.com/hf_mirrors/amd/Kimi-K2.5-Eagle3-FP8如果你正在折腾Kimi K2.5 的投机解码speculative decoding加速那么这个 5.68GB 的 FP8 量化草稿模型Kimi-K2.5-Eagle3-FP8值得仔细研究。它由 AMD 基于 Eagle3 MTP 草稿模型量化而来配合 vLLM 可将推理吞吐最高提升 2.0 倍。本文带你逐层解剖它的权重结构、safetensors 分片规则并梳理vLLM 加载 FP8 草稿模型时的关键注意点让新手也能一次跑通。一句话看懂这个模型是干什么的Kimi-K2.5-Eagle3-FP8 是一个Eagle3 草稿模型draft model本身不直接输出答案而是给 Kimi-K2.5 主模型打前站用轻量草稿快速预测多个 token再由主模型一次性验证从而大幅提升解码速度。它最大的特点有两个FP8 量化用 AMD Quark 工具将权重压到 FP8 E4M3体积更小、推理更快单层结构整个模型只有 1 层midlayer隐藏层 7168 维、64 注意力头所以权重总量仅 5.68GB。属性数值架构LlamaForCausalLMEagle3总权重大小5.68GB5,681,498,256 字节分片数量2 个 safetensors隐藏层7168注意力头64GQAKV 头 64词汇表163,840draft_vocab_size量化格式FP8 E4M3权重静态 激活动态5.68GB 权重结构解剖两个分片分别装了什么打开索引文件model.safetensors.index.json可以看到所有张量被精确划分到两个分片。这是理解safetensors 分片规则的第一步。分片一model-00001-of-00002.safetensors约 3.33GB第一个分片承载了模型 99% 的网络主体共 21 个张量嵌入层embed_tokens.weight16 万词表最大的单块权重midlayer 注意力self_attn.{q,k,v,o}_proj.weight及其weight_scale缩放因子——FP8 量化的标志性产物midlayer MLPmlp.{gate,up,down}_proj.weight 各自的weight_scale归一化层input_layernorm、post_attention_layernorm、hidden_norm、顶层normfc 投影fc.weight未被量化的漏网之鱼。分片二model-00002-of-00002.safetensors约 2.35GB第二个分片极其专一只装一个张量lm_head.weight输出头负责把隐藏状态映射回 16 万词表是单块最大的权重之一。为什么lm_head单独放一个分片因为这正是项目的设计巧思LM head 刻意不做量化与目标模型共享 BF16 输出头保证投机解码的采样质量同时利用 safetensors 分片机制把大张量独立归档方便按需加载。FP8 量化细节哪些层被量化哪些被排除从config.json的quantization_config中可以读出 AMD Quark 的完整量化方案量化对象方案权重FP8 E4M3、静态、per-channel、对称ch_axis0激活FP8 E4M3、动态、per-channel、对称ch_axis1量化层midlayer.self_attn.{q,k,v,o}_proj与midlayer.mlp.{gate,up,down}_proj排除层fc与lm_head保持 BF16✅ 好消息是这是免校准file-to-file量化不需要准备任何校准数据集拿到模型即可直接部署。vLLM 加载注意点三个最容易踩的坑把 FP8 草稿模型塞进 vLLM 时新手最容易在下面三处翻车。坑 1exclude 必须是正则表达式Quark 导出时config.json里的排除层可能写成普通字符串exclude: [fc, lm_head]但vLLM 只认正则格式必须手动改成exclude: [re:.*fc.*, re:.*lm_head.*]否则 vLLM 会把fc/lm_head误当成已量化的 FP8 层去加载直接报格式错误。坑 2draft 模型路径和参数要写对启动 vLLM 服务时用--speculative-config指定草稿模型推荐参数如下vllm serve amd/Kimi-K2.5-MXFP4 \ --port 8888 \ --tensor-parallel-size 4 \ --speculative-config {model:amd/Kimi-K2.5-Eagle3-FP8,method:eagle3,num_speculative_tokens:6,draft_tensor_parallel_size:1}官方推荐的运行环境是AMD Instinct MI355X ROCm 7.0 vLLM ROCm nightly 镜像配合VLLM_ROCM_USE_AITER1等环境变量使用。坑 3TP 与显存规划草稿模型虽小但目标模型才是显存大头。实测基准使用 TP4、--gpu-memory-utilization 0.90草稿路径走的是 hipBLASLt 行式缩放 FP8 GEMM。建议先跑通小并发再逐步加压。实测性能最高 2.0 倍加速官方在单机 4×MI355X 上、ISL/OSL1K/1K 场景测得的吞吐如下tok/s/GPU并发无草稿BF16 Eagle3FP8 Eagle3482.7157.01.90x165.22.00x8142.2269.11.89x270.11.90x16220.5399.61.81x412.71.87x64533.3901.61.69x936.61.76x可以看到FP8 草稿在所有并发下都追平甚至超过 BF16 版本高并发场景尤其划算。相关文件速查想深入源码可以按下面路径继续探索量化配置与模型参数config.json权重分片索引model.safetensors.index.json推理代码modeling_kimi_k25.pyEagle3 架构实现分词器tokenization_kimi.pytokenizer_config.json官方说明与复现命令README.md小结Kimi-K2.5-Eagle3-FP8 用5.68GB、两个 safetensors 分片装下了一个完整的 Eagle3 草稿模型FP8 量化让它在保持精度的同时跑出最高 2.0 倍的投机解码加速。上手时只需记住三个要点exclude 改成正则、draft 参数写对、先小并发验证就能在 AMD 平台上丝滑起飞 。【免费下载链接】Kimi-K2.5-Eagle3-FP8项目地址: https://ai.gitcode.com/hf_mirrors/amd/Kimi-K2.5-Eagle3-FP8创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考