2026/8/28 18:14:41

国产“Flash”级模型密集发布,市场迎来更多选择

国产“Flash”级模型密集发布,市场迎来更多选择 8月26日晚Hacker News首页同时出现了两款来自中国的轻量级大模型——智谱的GLM-5.3-Flash和阿里千问的Qwen3.8-Flash-Next引发海外开发者社区的广泛讨论。两款模型均定位为“Flash”级强调低成本和高效能但各自的架构和侧重点有所不同。与此同时该赛道原有的代表性产品DeepSeek V4 Flash于8月17日调整了定价策略引入峰谷计价模式。三款模型在同一个月内先后释放新信息让开发者和企业用户在选型时有了更多维度的考量。以下基于公开资料和第三方评测数据分别介绍这三款模型的现状。一、DeepSeek V4 Flash定价策略调整峰谷计价上线DeepSeek V4 Flash自发布以来以较低的API价格获得了不少中小团队和内容创作者的青睐。自2026年8月17日起其定价模式调整为高峰/空闲时段差异化收费高峰时段工作日 9:00-12:00, 14:00-18:00输入缓存未命中3元/百万tokens输出9元/百万tokens。空闲时段输入1.5元/百万tokens输出4.5元/百万tokens。调整后若在空闲时段调用价格仍处于可接受范围但在高峰时段调用成本较此前有明显上升。这一变化可能促使部分用户重新评估调用时机或考虑其他选项。性能方面根据独立评测机构Artificial Analysis的智能指数DeepSeek V4 Flash得分为53分在同级模型中仍具竞争力但其输出速度较快约120 token/秒适合对响应时间敏感的任务。二、GLM-5.3-Flash开源且高智商长上下文是亮点GLM-5.3-Flash是智谱推出的轻量级MoE模型总参数量320B激活参数仅18B上下文窗口达到1M tokens约可处理1500页文本。该模型于8月26日正式开源采用MIT协议允许商业使用。定价在官方ZAI平台上输入价格为0.15美元/百万tokens输出为0.50美元/百万tokens。部分第三方平台在促销期提供更低折扣。性能在Artificial Analysis智能指数中GLM-5.3-Flash获得57分与一些顶级闭源模型的得分持平。评测中该模型生成了约1.5亿个token输出速度约为49 token/秒相对偏慢但官方表示其编程和Agent能力接近某些高价位旗舰模型。部署特色该模型的推理服务运行在国产芯片集群上智谱自研的推理引擎实现了较高效率这也在一定程度上证明了国产算力在大规模商业化场景下的可行性。三、Qwen3.8-Flash-Next架构前瞻本地部署友好Qwen3.8-Flash-Next是阿里千问基于下一代Qwen4架构打造的预览版模型总参数为176B含51B的N-gram嵌入模块每token仅激活6B参数支持高达1M的上下文窗口并具备多模态输入能力。定价在千问AI官方平台输入价格为1元/百万tokens输出为3元/百万tokens国际版QwenCloud定价为输入0.16美元、输出0.47美元。性能Artificial Analysis智能指数评分为56-58分区间与GLM-5.3-Flash处于同一梯队。官方称其训练成本仅为Qwen3.7-Plus的九分之一但性能反超。部署优势模型权重已上线Hugging Face和ModelScope体积约73GB有开发者反馈在128GB内存的Mac设备上可本地运行这对于希望私有化部署或避免API调用的用户是一个值得关注的特性。如何看待这三款模型从当前公开信息看三款模型各有侧重DeepSeek V4 Flash在调整定价后性价比更多取决于调用时段。若团队可以灵活安排非高峰时段调用其成本仍可接受且响应速度较快。GLM-5.3-Flash的优势在于高智能得分、超长上下文以及开源商用授权适合对模型能力要求较高、需要处理长文档或有私有化部署需求的场景。Qwen3.8-Flash-Next则在极致定价和本地运行门槛上做出了平衡尤其对个人开发者或小团队而言较低的总拥有成本可能更具吸引力。在实际使用中不同模型对同一任务的表现可能存在差异——有的更简洁有的更详尽有的速度快有的思考深。建议开发者根据自己的具体任务如文案生成、摘要、编程辅助等进行小规模实测再决定长期选型。三款模型基本情况对比各模型简要说明DeepSeek V4 Flash于2026年4月发布自8月17日起调整为峰谷定价模式高峰时段为工作日9:00-12:00和14:00-18:00空闲时段价格为高峰时段的一半。GLM-5.3-Flash于8月26日正式上线并开源在Artificial Analysis智能指数中获得57分。模型采用MIT协议允许商业使用。官方ZAI平台定价为输入$0.15/百万tokens、输出$0.50/百万tokens上线前两周提供五折优惠。Qwen3.8-Flash-Next同样于8月26日发布是阿里基于Qwen4架构推出的预览版模型。模型权重已上线Hugging Face与ModelScope平台生产版本Qwen3.8-Flash将通过QwenCloud提供API服务。选型参考不同模型在架构设计、定价策略和开源授权上各有侧重用户可根据自身任务需求、调用频率、部署方式等因素综合评估若对响应速度和调用时段的灵活性有要求可关注DeepSeek V4 Flash的峰谷定价机制错峰调用成本相对更低。若需要处理超长文档、追求较高智能水平或希望获得开源商用授权GLM-5.3-Flash的1M上下文窗口和MIT协议是值得关注的特性。若希望本地部署或对成本较为敏感Qwen3.8-Flash-Next的较低激活参数和开源权重为自托管提供了可能。建议在实际选型前用自身业务场景中的典型任务进行小规模测试以获取更直接的体验对比。未来关注点随着GLM-5.3-Flash权重的开放和Qwen3.8-Flash-Next API的即将上线市场上将有更多可直接对比的实测数据。届时各模型在不同任务下的真实表现会更为清晰。对于从业者而言保持关注、定期测试或许是应对快速变化的大模型生态的务实方式。模型本身只是工具如何用好它们依旧取决于使用者的业务理解和创造力。