
四款国产旗舰大模型横评能力只差 4.7 分价格差 11 倍——MiMo-V2.6-Pro、Qwen3.8 Max、GLM-5.3、Kimi K3 怎么选数据截至 2026 年 10 月 8 日。能力分、输出速度、话多倍数取自 Artificial Analysis 独立评测价格取自各厂商官网小米取自 OpenRouter 上的小米官方端点调用量取自 OpenRouter 公开周榜Source: OpenRouter, openrouter.ai/rankings美元按 1 USD 6.7046 CNY2026-10-07欧洲央行折算。过去两个月国内四家厂商先后发布了新一代旗舰月之暗面 Kimi K37 月 16 日、智谱 GLM-5.38 月 18 日、阿里 Qwen3.8 Max 09029 月 2 日、小米 MiMo-V2.6-Pro9 月 21 日。把它们放到同一套独立评测里结果很有意思四款模型的综合能力分最高 80.4、最低 75.7相差只有 4.7 分但按混合价计算最便宜的每百万 token 3.65 元最贵的 40.00 元相差 11 倍。能力接近、价格悬殊意味着「选哪个」不能只看综合分。本文从能力结构、真实成本、开发者实际用量、分发渠道四个角度把这四款模型拆开来看最后给出按场景的选型建议。一、先看位置国产旗舰处在什么梯队Artificial Analysis 目前收录 384 个模型条目同一模型的不同推理档位分别计为一条。四款国产旗舰的综合能力分排名分别是第 30、32、34、39 位。如果把同一模型的不同推理档位合并只保留最高档排在它们前面的是 11 个海外模型Claude Opus 5.5、Claude Sonnet 5.5、Claude Fable 5.1、GPT-6 Astra、Gemini 4 Argon、GPT-6.1 Sol、Claude Opus 5、Claude Fable 5、GPT-6 Sol、GPT-5.6 Sol、Grok 4.7。注能力分为 Artificial Analysis Intelligence Index 按榜首 100 归一化均取各模型最高推理档。开放权重依据 OpenRouter 模型目录标注的 Hugging Face 仓库判定。四款模型的上下文窗口都在 100 万 token 左右本文不再单独比较。两个基本判断国产旗舰之间的差距很小。4.7 分的跨度比同一个模型开高、低两档推理的差距还小。和海外第一梯队仍有明显差距。榜首 Claude Opus 5.5 为 100 分国产最高的 MiMo-V2.6-Pro 为 80.4 分相差约 20 分。二、能力结构四款模型各有一项明显长板综合分接近不代表能力结构一样。把 Artificial Analysis 的几个分项指数拆开注各分项均按该项榜首 100 归一化「—」为 Artificial Analysis 暂无该项数据。长文推理为 Artificial Analysis 的 LCRLong Context Reasoning指标衡量长上下文中能否答对而不是能塞多长。逐项看Agent三款国产旗舰排在 Gemini 和 GPT 之前。在 206 个有 Agent 分的模型条目中MiMo-V2.6-Pro、Qwen3.8 Max、GLM-5.3 分列第 12、13、14 位排在它们前面的只有 Claude 和 Grok 系列Gemini 4 Argon81.8和 GPT-6.1 Sol77.9都排在它们后面。Kimi K3 的 Agent 分为 75.0在四款中明显偏弱。代码三款几乎打平。Qwen3.8 Max 93.5、Kimi K3 93.4、GLM-5.3 92.2在 308 个条目中排第 20、22、26 位差距在 1.3 分以内。MiMo-V2.6-Pro 暂无代码指数。长文推理Kimi K3 全场第一。在 356 个有该项数据的条目中Kimi K3 排第 1MiMo-V2.6-Pro 排第 2都超过了 Claude Opus 5.595.5。这是 Kimi 系列一贯的方向也是 Kimi K3 在综合分垫底的情况下仍值得考虑的主要理由。速度GLM-5.3 是其他三款的两倍。GLM-5.3 每秒输出 79.3 token其余三款都在 38~42 之间。按这个速度换算同样输出 10 万 tokenGLM-5.3 的纯生成时间约 21 分钟其他三款约 40~44 分钟。三、真实成本标价差 11 倍但标价不是全部注混合价 输入 × 0.75 输出 × 0.25。话多倍数所有模型跑同一套评测题实际消耗的 token 量是全体中位数的几倍越高说明完成同样的题目输出越多。有效成本 混合价 × 话多倍数。每元能力分 综合能力分 ÷ 混合价。MiMo-V2.6-Pro 价格为小米官方端点 0.435 / 0.87 美元折算暂无话多倍数不能按 1.0 估算。Qwen3.8 Max 为输入 100 万 token 以内的阶梯价。这张表说明三件事。第一MiMo-V2.6-Pro 的定价明显偏离同档。综合分最高混合价却只有 GLM-5.3 的 28%、Kimi K3 的 9%。每元能力分 22.05是第二名 GLM-5.3 的 3.7 倍。第二话多倍数会大幅缩小价格差距。Kimi K3 标价是 Qwen3.8 Max 的 2.2 倍但它的话多倍数只有 1.35是三款有数据模型中最低的Qwen3.8 Max 和 GLM-5.3 都在 2.3 以上。乘上话多倍数之后Kimi K3 和 Qwen3.8 Max 的有效成本差距缩小到 1.29 倍。只看标价会高估 Kimi K3 的实际成本。第三缓存价格差异很大。对 Agent 这类反复携带长上下文的工作负载缓存命中价比标价更关键。四家的缓存命中价与未命中价之比差别很大GLM-5.3 官网为 2 元 / 8 元1/4Kimi K3 官网为 2 元 / 20 元1/10Qwen3.8 Max 在 OpenRouter 阿里端点为 0.25 / 2 美元1/8MiMo-V2.6-Pro 在 OpenRouter 小米端点为 0.0036 / 0.435 美元约 1/120。缓存命中率高的场景MiMo-V2.6-Pro 的价格优势会进一步扩大。再把海外旗舰放进来做个参照注海外模型价格为 Artificial Analysis 美元价按当日汇率折算「—」为暂无实测速度。Claude Haiku 5.5 于 10 月 7 日发布。两个值得注意的对照Kimi K3 的混合价高于 Claude Sonnet 5.5而后者综合分高 21.5 分刚发布的 Claude Haiku 5.5 综合分与 Kimi K3 只差 0.4 分混合价却只有后者的 1/30。国产旗舰的价格优势并不是普遍成立的要逐个模型看。四、开发者实际在用哪个OpenRouter 四周用量OpenRouter 是一个模型聚合网关公开每周各模型的 token 用量。需要先说明边界它只是一个网关的数据各厂商官方 API、国内云平台百炼、火山方舟、千帆等的调用都不在其中尤其会低估主要通过国内渠道销售的模型。注括号内为当周全平台排名。OpenRouter 周榜只公开前 48 名左右Qwen3.8 Max 一列为周榜中的 qwen/qwen3.8-max 条目0902 版未进入过周榜。从这张表可以读出GLM-5.3 是四款中网关用量最大、最稳定的四周都在 2.5 万亿以上、排名第 9~11。09-28 这一周它的用量超过了 Claude Opus 5.52.46 万亿第 12和 GPT-6 Astra1.41 万亿第 18。MiMo-V2.6-Pro 上线两周用量还在爬坡。第二周比第一周增长 12.8%但和它在评测和价格上的优势相比用量明显滞后。Qwen3.8 Max 在网关上存在感很弱。这与它是闭源模型、只有阿里一家提供服务有关它的主要销售渠道是阿里云百炼OpenRouter 数据不能反映它的真实使用情况。还有一个更大的背景旗舰的用量远低于同厂商的轻量档。09-28 这一周GLM-5.3-Flash 用量 9.73 万亿是 GLM-5.3 的 3.3 倍MiMo-V2.6-Flash 用量 9.63 万亿是 MiMo-V2.6-Pro 的 8.0 倍。开发者的大部分调用量流向了「够用且便宜」的轻量模型旗舰只承担其中最难的那部分任务。五、分发渠道开放权重决定了「在哪能用到」开放权重模型可以被任何云厂商自行部署。10 月 8 日查询 OpenRouter 模型目录服务商多带来的是更低的价格和更高的可用性。GLM-5.3 在 OpenRouter 上输出价最低的一家服务商为 2.20 美元只有官方端点的一半。但第三方服务商有一个容易被忽略的差异量化精度不同。同样是 GLM-5.3目录里标注的精度有 fp8、fp4、nvfp4 等多种Kimi K3 的 20 家服务商中也混有 fp8、fp4、mxfp4。低精度部署通常更便宜但在长推理、长上下文任务上可能有效果损失。第三方价格低不等于拿到的是同一个模型效果。六、四款模型的画像MiMo-V2.6-Pro综合分最高、价格最低速度是短板。综合、Agent 两项都是四款第一长文推理全场第二混合价不到 4 元OpenRouter 目录显示它支持文本、图像、视频、音频输入。不足是输出速度 37.6 token/s四款中最慢只有 4 家服务商发布才两周多话多倍数等数据尚不完整生产使用前需要更多实测。Qwen3.8 Max 0902代码和 Agent 均衡适合国内云合规场景。代码 93.5 为四款最高Agent 85.2 仅次于 MiMo。闭源、只能通过阿里云使用对已经在阿里云体系内、有数据合规要求的企业接入成本最低。话多倍数 2.33 偏高按有效成本算并不便宜。GLM-5.3最快生态最广。79.3 token/s 的输出速度是另外三款的两倍左右对需要人在旁边等待的交互式场景编程助手、客服最友好33 家服务商、四周稳定的网关用量说明它在海外开发者中的接受度最高。代价是话多倍数 2.57四款中最高有效成本比标价高出一倍多。Kimi K3长文推理第一Agent 偏弱价格最高。长文推理在 356 个条目中排第 1话多倍数 1.35 也最节省。但 Agent 分 75.0 明显落后另外三款混合价 40 元是四款最高、甚至高于 Claude Sonnet 5.5。适合长文档分析、大代码库阅读这类以「读懂」为主的任务不建议作为通用 Agent 的主力模型。七、这组数据说明了什么以下是基于数据的分析判断读者可以在后续数据中验证。1. 国产旗舰已经形成一个紧密的第二梯队。四款模型综合分相差 4.7 分在 Agent 指标上整体超过 Gemini 和 GPT 当前主力型号但距离 Claude 和 GPT 的顶级型号仍有约 20 分的综合分差距。2. 竞争的焦点从「能力」转向「定价与结构」。能力差 4.7 分、价格差 11 倍说明各家在定价策略上的分歧远大于技术差距。MiMo-V2.6-Pro 以接近轻量档的价格推出旗舰是一个明显的信号。3. 旗舰模型的价格面临来自两端的压力。一端是同厂商的轻量档GLM-5.3-Flash 综合分 72.6只比 GLM-5.3 低 5.1 分混合价只有后者的 1/10。另一端是海外的新轻量模型Claude Haiku 5.5 综合分已接近 Kimi K3。如果旗舰不能在难任务上拉开足够差距用户会继续向轻量档迁移。4. 用量会更多地由「速度 生态」决定而不只是评测分。GLM-5.3 综合分在四款中排第三网关用量却是第一速度和服务商数量都是它的优势。这和上一篇分析的 DeepSeek V4.1 Flash 现象一致。八、选型建议通用 Agent、追求能力和成本的平衡先试 MiMo-V2.6-Pro。综合分和 Agent 分最高、价格最低但上线前务必实测速度是否满足你的延迟要求。交互式场景、对等待时间敏感优先 GLM-5.3。速度优势明显第三方服务商多可以按价格和稳定性挑选注意核对量化精度。代码任务、阿里云体系内的企业Qwen3.8 Max。代码分最高合规和接入路径清晰。长文档、大代码库分析Kimi K3 或 MiMo-V2.6-Pro。两者长文推理排全场前二如果预算敏感MiMo-V2.6-Pro 的价格只有 Kimi K3 的 1/11。大部分常规任务先考虑轻量档。GLM-5.3-Flash、MiMo-V2.6-Flash 的综合分都在 65 分以上混合价在 1.3 元左右。把旗舰留给轻量模型确实做不好的那部分任务总成本会低得多。最终以自己的业务数据为准。公开评测只能缩小范围。抽取几十条真实请求在两三个候选模型上各跑一遍对比结果质量、输出 token 数和耗时再做决定。各模型的能力分、价格、话多倍数、输出速度以及 OpenRouter 用量趋势可在大模型选型平台 ModelSagemodelsage.cn的排行榜、模型对比页和趋势页中查看数据每日自动更新。数据来源Artificial Analysis综合、Agent、代码、长文推理指数输出速度评测成本各厂商官网价格页智谱、阿里云百炼、月之暗面OpenRouter 公开周榜Source: OpenRouter, openrouter.ai/rankingsCC BY 4.0与模型目录欧洲央行汇率。整理于 2026 年 10 月 8 日。