
干电商的朋友应该都遇到过这种场面新品要上架运营、设计、文案各交一摊东西——标题在A同事手里五点卖点在B同事手里详情页是外包做的A页面又是另一个人写的主图改了三版。最后所有资料堆到一个文件夹里看似齐了实际谁也没通读过一遍。我这次要做的就是用 Qwen3.8-Max 搭一个电商商品资料包体检助手把标题、五点、详情文案、A页面、搜索词、FAQ 六份文字资料加一张商品主图一次性全喂进去让模型按一套规则逐项检查最后输出一份带位置、带问题描述、带修改建议的体检报告。实测下来6 份资料加 1 张图75 秒出结果一次查出 27 个问题里面有合规风险、文案硬伤、前后矛盾还有搜索权重浪费。这篇文章就把整个搭建思路、规则设计、实操步骤和踩过的坑完整拆给你。这套东西适合谁如果你是电商运营、商品详情页文案、独立站卖家或者自己做品牌想在亚马逊、Shopify、淘宝上规范商品资料那这套流程可以直接照搬。我用的核心是 Qwen3.8-Max 的文本理解能力和多模态图片识别能力不需要微调模型也不需要写一堆复杂的规则代码只要把“检查规则”和“输出格式”想清楚模型就能当好这个质检员。下面我从为什么选它讲起再到规则怎么拆、流程怎么搭、问题怎么排一步步说清楚。1. 为什么选 Qwen3.8-Max 来当这个“体检医生”1.1 商品资料审核为什么这么麻烦先说说背景。大部分电商团队对商品资料的检查还停留在“人工通读”的阶段运营打开文档从上往下看一遍凭经验找问题。这种方式有几个要命的地方。第一人眼扫读会漏。十几页的详情文案再加上五点、A你让一个人从头读到尾他大概率只能抓住最明显的错别字和格式问题那些藏在第 3 个卖点里的“主演尺寸”和详情页参数表里对不上的数据根本不会注意到。第二不同人对规则的理解不一样。哪怕你给运营一份 30 条的检查清单他看完标题觉得“这个极限词应该没问题吧”另一个审核的人可能就觉得“这是违规风险”。标准不统一结果就随缘。第三跨文档核对非常费精力。标题里的核心关键词有没有在五点里展开FAQ 里的回答和详情页参数是不是一致A 页面有没有把价格信息写进去这种“文档与文档之间”的一致性检查靠人工做本质上是在做一场高强度的信息比对人脑做这个事的可靠性和速度都堪忧。所以问题的本质是商品资料包不是“写出来”就完了而是要“验过”才能上线。这个“验”如果有一台机器能帮你把 61 份材料全部读一遍并且按照固定的尺子去量每一处细节效率和稳定性都会好很多。1.2 为什么是大模型而不是规则脚本可能有人会说这东西用 Python 写个正则匹配不就行了吗关键词违规用词表图片分辨率用 Pillow 读一下字数用 len() 数一下。确实一部分检查可以做。但涉及到下面这几类问题传统规则脚本几乎无能为力语义一致性比如标题写“无线蓝牙耳机”五点里说“支持蓝牙 5.3”FAQ 里回答“本产品为有线连接”这种前后矛盾靠关键词匹配是发现不了的必须理解上下文语义。合规风险判断像“100% 纯棉”“全网最低价”“根治脱发”这类表述需要模型根据平台规则常识来判断而且有些表述是隐性违规比如“绝对不会起球”这种近似绝对化的承诺规则词表中很难穷举。图像信息审查主图上有没有水印、文字内容是否和标题海报宣传口径一致、分辨率够不够清晰这些需要视觉理解能力。建议生成查出问题不算完还要能给出“改成什么”的具体方案这本质上是一个文本生成任务。所以这里选 Qwen3.8-Max 不是盲目追新而是它的定位比较合适上下文窗口够大能一次吃进多份文档指令跟随能力强能按 JSON 结构输出多模态能力支持图片识别国产模型在中文电商文案的理解上比纯英文模型要准。而且通过 API 调用不用自己部署算力成本和门槛都很低。1.3 整体方案架构我要做的不是一个复杂系统而是一个“输入-检查-输出”的单向流程架构非常简单商品资料包6份文本 1张主图 ↓ 资料标准化整理统一为纯文本/标准图片格式 ↓ 规则引擎提示词内置27项检查规则 输出模板 ↓ Qwen3.8-Max 调用文本分析 图像分析 ↓ 结构化体检报告JSON / Markdown 表格整个链路里最核心的不是模型调用代码而是规则引擎提示词。模型本身知道你喂进去的是什么材料但你得告诉它“按什么标准查、查到问题怎么描述、输出格式长什么样”它才能稳定地产出高质量结果。这个后面细讲。2. 体检规则设计27 个问题是如何拆解出来的2.1 规则体系的四个维度一套体检程序首先要定义“什么是健康”。“体检项”不能拍脑袋想我参考了主流电商平台亚马逊、淘宝、京东、Shopify 系的商品发布规范再结合日常运营中的常见翻车案例把检查内容拆成四个维度维度核心目的典型问题数量合规性避免违规下架、封号风险8 个一致性跨文档信息对齐避免误导用户7 个内容质量文案可读性、信息密度6 个搜索优化关键词覆盖、结构合理性6 个这四个维度加起来正好 27 项也就是实测时一次查出 27 个问题的规则来源。每个维度背后都有明确的“为什么”合规性解决的是生存问题一致性解决的是信任问题内容质量解决的是转化问题搜索优化解决的是流量问题。一个商品资料包这四个维度都过关了才算得上“健康”。2.2 六份资料与一张图的检查分工不同资料承载的信息角色不同所以检查项也要区分主次。我的设计是这样标题重点查长度、关键词堆砌、违禁词、核心卖点是否前置。五点描述重点查首句信息量、参数一致性、是否出现绝对化用语、每点是否过于冗长。详情页长描述重点查合规风险、文案与参数表是否冲突、是否出现第三方品牌名、是否包含促销信息。A 页面文本重点查与五点描述的重合度、是否含价格信息、场景描述是否有实质内容。搜索词ST重点查与标题关键词重合度、是否包含无关流量词、是否有重复浪费词位。FAQ重点查回答是否与详情参数矛盾、是否涉及医疗/功效类违规、是否覆盖核心客诉点。商品主图重点查分辨率、水印、背景色、图中文字与标题口径是否一致、是否有边框或促销标签。这里有一个很关键的设计思路一份资料里查出的问题往往要结合另一份资料才能判断。比如 FAQ 里写“这款咖啡机支持 20bar 萃取压力”但详情页参数表只写了“15bar”单看 FAQ 是看不出问题的必须让模型同时读两份文档做交叉比对。所以提示词里必须明确要求“跨文档对比”而不是逐份孤立检查。2.3 提示词设计的三个要点提示词是这套体检助手的灵魂。我试过几种写法最后沉淀下来三个关键要点。第一必须给模型“角色 任务 边界”。开篇就要说清楚你是一名资深的电商合规审核员负责对商品资料包进行体检重点关注合规风险、信息一致性、内容质量和搜索优化。但“边界”同样重要我会明确告诉模型不要修改原文不要输出赞美性评价只输出发现的问题没有问题的检查项不用列出来。第二必须把 27 项规则逐条枚举清楚。不要只写“检查违规词”而是要把常见违规类型、疑似极限词示例、第三方品牌名示例、促销信息示例都写进去。模型对规则越清楚误报率越低。第三必须规定输出格式。我采用的是“问题列表”格式每个问题包含item问题来源标题/五点/详情页/A/ST/FAQ/主图check_type所属维度合规/一致/质量/搜索issue具体问题描述evidence原文摘录证明模型不是瞎说suggestion修改建议把输出格式定义清楚后续不管是人力复核还是自动处理都非常方便。提示提示词里可以加一两个 few-shot 示例但不要让示例过度引导模型只关注某类问题否则会漏检其他类型。我一般每个维度加一个示例就够。3. 实操流程从资料整理到体检报告3.1 环境准备与资料标准化先说 API 调用方式。Qwen3.8-Max 走的是 OpenAI 兼容的接口格式Python 里用openai库就能直接调不需要额外引入特殊 SDK。我用的环境是 Python 3.10 openai 库系统 Windows/Mac 都行。代码层面第一步是把散落的资料读进来。我的习惯是把六份文本分别保存在单独的.txt文件里文件名按商品-标题.txt、商品-五点.txt这样的规则命名。读取代码很简单import os file_map { 标题: data/商品-标题.txt, 五点: data/商品-五点.txt, 详情页: data/商品-详情页.txt, A: data/商品-A.txt, 搜索词: data/商品-ST.txt, FAQ: data/商品-FAQ.txt, } documents {} for name, path in file_map.items(): with open(path, r, encodingutf-8) as f: documents[name] f.read().strip()这一步有个小坑要注意很多运营给的文案是 Word 或 PDF 格式直接复制到 txt 里会带上乱七八糟的格式符号。我建议在读取之前先做一次清洗把多余空行、特殊字符、自动编号去掉。否则模型会把格式混乱也当成质量问题产生一批伪问题。我在实测第一轮就遇到这种情况详情页里有一堆\u3000全角空格和换行符模型报告了 4 个“格式不整洁”的问题实际内容本身没问题。图片部分我用的是 Pillow 先做一次基础信息提取尺寸、格式再把图片以 base64 方式传给多模态接口。如果你用的是纯文本接口可以先把图片交给 Qwen3.8-Max 的多模态能力做一次“看图说话”把关测信息转成文字再合并进文本分析。我的做法是直接在一次请求里同时传入图片与文本。3.2 构建检查提示词把材料读进来之后核心就是组装提示词。我把它拆成四段system_prompt 你是一名资深的电商商品合规审核员熟悉亚马逊、淘宝、京东、Shopify等平台的商品发布规则。 你的任务是对给定商品资料包进行体检发现其中可能存在的问题。 检查覆盖四个维度 1. 合规性违禁词、极限词、医疗功效宣称、第三方品牌提及、价格促销信息等。 2. 一致性标题、五点、详情、A、FAQ、搜索词、主图之间的信息是否一致包括参数、规格、型号、颜色、材质等。 3. 内容质量文案可读性、篇幅控制、信息重复、堆砌、语义不清、缺乏实质性内容等。 4. 搜索优化关键词重复浪费、核心关键词缺失、ST词与标题重合度过高、关键词无关等。 请逐项检查对每个问题输出如下JSON格式 {issues: [{item: 标题, check_type: 合规性, issue: 具体问题, evidence: 原文摘录, suggestion: 修改建议}]} 注意只输出发现的问题没有问题的检查项不要输出不要修改原文不要输出与问题无关的内容。 然后是把资料拼进去user_prompt 以下是商品资料包请开始体检\n\n for name, content in documents.items(): user_prompt f【{name}】\n{content}\n\n user_prompt 【主图】\n见附带的图片这里我要强调一个细节不同资料之间用清晰的分隔符隔开并标注名称。模型对“哪个部分是哪个文档”理解得越清楚跨文档比对就越准确。我第一次做的时候把所有文字堆在一起结果模型把标题里的某句话当成详情页内容来判断跨文档对比完全乱套。后来加上【】标签后准确率提升非常明显。你的项目标题里提到“6 份资料 1 张商品图”这一点一定要处理干净。3.3 调用模型与解析结果调用部分用的是chat.completions接口from openai import OpenAI import base64 import json client OpenAI( api_key你的API密钥, base_urlhttps://dashscope.aliyuncs.com/compatible-mode/v1 ) with open(data/商品主图.jpg, rb) as f: image_base64 base64.b64encode(f.read()).decode() response client.chat.completions.create( modelqwen3.8-max, response_format{type: json_object}, messages[ {role: system, content: system_prompt}, {role: user, content: [ {type: text, text: user_prompt}, {type: image_url, image_url: {url: fdata:image/jpeg;base64,{image_base64}}} ]} ], temperature0.2 ) result json.loads(response.choices[0].message.content) print(f共发现 {len(result[issues])} 个问题)这里有两个容易踩的坑。第一个是temperature一定不要用默认值 1.0建议设置在 0.2 以下。体检是判断任务不是创意任务温度越高模型越容易“发挥”把没问题的东西说成有问题。我刚开始用 0.7 测试模型居然报了一个“标题中缺少‘2026 新款’字样建议补充”的建议类问题这就是温度过高导致模型过度发挥。第二个是response_format建议直接指定为json_object省得解析文本时被前后缀干扰。我最早做的时候没设置这个参数模型偶尔会在 JSON 外面加一段“我已检查完成结果如下”虽然也能清洗但纯 JSON 输出明显更省事。3.4 实测效果27 个问题长什么样这次实战的商品是一个“便携榨汁杯”测试资料包里有标题、五点、详情页、A、ST、FAQ 六份文本和一张主图。Qwen3.8-Max 跑完一遍后输出 27 个问题我按维度统计如下维度问题数典型例子合规性8标题含“最低价”极限词五点描述出现“医用级”涉嫌功效夸饰详情页出现“与某知名品牌对比”的第三方品牌名FAQ 回答涉及“辅助减肥”功效一致性7标题标注容量 500ml详情页参数写 450ml五点首句写“无线充电”A 页面描述为“Type-C 充电”主图显示粉色款文案却主打蓝色款内容质量6五点第 2 点与第 4 点都写“便携轻巧”详情页出现大量空行与全角空格A 页面全是场景口号没有参数信息搜索优化6ST 关键词与标题重复词超过 60%ST 中有“生日礼物”等泛流量词标题核心词“榨汁杯”没有在五点首句中出现这里面最典型的一个跨文档矛盾是标题写“500ml 大容量”五点里也写“500ml”但详情页参数表写的是“450ml”。模型能同时摘录三处原文作为证据直接定位到冲突位置。这个场景放在人工审核里至少得来回翻三个文档才能发现。另一个让我意外的是图片检查——主图上有“限时特价”的角标但商品发布规范里通常不允许在主图放促销信息模型从纯视觉信息里识别出来了。整体走完一遍从读取文件到拿到 JSON 报告耗时 75 秒左右。如果按 27 个问题算下来每个问题平均不到 3 秒这个效率比人工至少快一个数量级而且不累、不困、不漏。我建议拿到 JSON 报告后再做一步后处理把问题按资料类型分组转成可读性更强的 Markdown 表格方便发给运营或设计同事直接对照修改from collections import defaultdict grouped defaultdict(list) for issue in result[issues]: grouped[issue[item]].append(issue) for item, issues in grouped.items(): print(f## {item}) for i in issues: print(f- [{i[check_type]}] {i[issue]}) print(f 原文{i[evidence]}) print(f 建议{i[suggestion]})4. 常见问题与排错技巧实录4.1 漏检与误检怎么平衡实测过程中最需要调的就是“漏检”和“误检”这对矛盾。模型太宽松问题就漏报模型太严格就会把正常的描述也当成问题。我调了三轮最后得出两个有效策略。第一个策略是在提示词里加“高风险”和“低风险”的区分。比如明确告诉模型合规性问题属于高风险宁可多报不要漏报格式、标点这类属于低风险仅作为提示不要过分纠结。这样模型在判断时会自动分级输出结果的价值密度高很多。第二个策略是给每个维度列出最大的三个检查重点。比如合规性维度我重点提示“极限词、医疗功效、第三方品牌”一致性维度重点提示“容量/尺寸/材质/颜色/型号”。模型注意力会被引导到真正容易出问题的点上而不是平均用力。我测出来一个现象Qwen3.8-Max 对数字的敏感性比对人名/品牌名更高。很多数据矛盾它能一眼抓出来但第三方品牌名偶尔会漏。所以我后来会额外在提示词里补一句“注意用户原文中出现的所有大写英文单词、品牌名、知名平台名”。这句话一加上去第三方品牌类问题基本就不会漏了。4.2 图片信息识别不准怎么办多模态接口虽然能读图但不是所有图都能读准尤其是主图上文字小、水印半透明、背景复杂的情况。我遇到过一次主图上有“30 天无理由退换”的金色小字模型第一次没识别出来因为图片压缩后小字已经糊了。这个问题的解决方法不在提示词而在图片预处理。我会在上传前先用 Pillow 把图片做一次放大和对比度增强from PIL import Image, ImageEnhance img Image.open(data/商品主图.jpg) img img.resize((img.width * 2, img.height * 2), Image.LANCZOS) enhancer ImageEnhance.Contrast(img) img enhancer.enhance(1.5) img img.convert(RGB) img.save(data/商品主图_enhanced.jpg, quality95)另外如果图片信息对最终结果影响很大我会额外在 prompt 里让模型“先描述图片中的文字内容再结合文字内容做检查”。这一步相当于把“看图”和“审核”拆成两个动作识别准确率明显提升。提示不要把高清原图压缩后再传。API 对图片大小有上限但优先保证清晰度。如果图片太大先按比例缩到 1500px 以内但不要用低质量 JPEG 压缩。4.3 输出格式不稳定怎么兜底大多数时候 Qwen3.8-Max 能严格按 JSON 输出但偶尔会遇到 JSON 里混进多余逗号、引号没闭合的情况直接json.loads会报错。我的做法是写一个简单的容错解析import re def parse_json_response(text): try: return json.loads(text) except: match re.search(r\{.*\}, text, re.S) if match: return json.loads(match.group()) raise ValueError(无法解析模型输出)这算是一个工程兜底不是为了掩盖模型的问题而是为了保证整个流程在批量跑的时候不会因为一次解析失败就中断。真正要根治格式问题还是在系统提示词里反复强调“必须输出合法 JSON不要输出任何其他文字”。4.4 成本与速度调优最后聊聊钱和时间。Qwen3.8-Max 按 token 计费一次体检大概消耗 4000~6000 token视资料长度而定图片另计。我实测下来一次完整体检的成本非常可控基本就是几厘钱的量级比我预期的低得多。如果你每天只需要测几十个品成本几乎可以忽略。速度方面75 秒左右一次。如果你想更快有两个思路一个是对长文档做截断只保留每个文档的前 1500 字因为核心问题通常出现在前部的卖点和首句另一个是把合规性检查和一致性检查拆成两次并行调用各查各的维度再合并结果。并行能让单次耗时压到 40 秒左右但代码复杂度会上升我目前用的还是单次调用稳定性优先。这套流程还能怎么扩展搭完这套体检助手之后我最大的感受是它不只是省人工而是强制建立了一条资料质量流水线。以前大家都是写完就上现在是先体检再上等于在发布前多了一道自动化安检。目前这套流程我主要跑商品资料包的“上线前体检”。后续我还在考虑两个扩展方向一个是把每次体检结果沉淀成数据库按月统计哪类问题出现最多反向指导文案团队优化写作规范另一个是把“修改建议”直接接到生成流程里做成“查完即改”的半自动闭环让模型基于建议生成修改版文案人工再确认一遍。这两个方向目前都还在测试中等跑出稳定的效果再写一篇展开。如果你手上也有一堆商品资料经常因为细节问题被平台警告、被用户差评建议试一下这个思路不要把它当成一个多复杂的项目。核心就三件事把资料标准化、把规则写清楚、让模型按固定格式输出。做完这三步你也能搭出自己的体检助手。