
dingo 数据质量评估实战指南从规则引擎到大模型深挖【免费下载链接】dingoDingo: A Comprehensive AI Data, Model and Application Quality Evaluation Tool项目地址: https://gitcode.com/gh_mirrors/dingo5/dingo模型卡在 85% 两周没动你的第一反应多半是调参。那次排查到最后才发现训练集里混进一批重复样本和乱码字段清掉之后指标才爬起来。这类脏数据靠肉眼翻不出来得靠系统的数据质量评估——dingo 就是干这个的。30 秒认识 dingo开源数据质检工具CLI 和 SDK 双入口说白了dingo 是个开源的数据质量评估工具专门自动揪出数据集里的毛病。文本、多媒体都兼容预训练、微调、评估数据集都在覆盖范围内。入口留了两个CLI 适合临时质检一批文件SDK 适合嵌进你自己的评估平台。七个维度一次扫完dingo 能揪出哪些数据毛病维度说明内置规则完整性空字段、缺失值、内容截断RuleContentNull有效性乱码、异常字符、HTML 残留RuleAbnormalChar流畅性缺标点、数字错位、词语粘连RuleNoPunc相关性开头跑题、混入无关内容RuleHeadWord安全性身份证号、敏感词暴露RuleIDCard相似性重复样本、高度雷同的文本RuleDocRepeat可理解性大小写混乱、阅读体验差RuleCapitalWords规则层负责兜底大模型负责深挖这是 dingo 的双层思路。它内置了TEXT_QUALITY_V2这类 prompt接上 GPT 等模型就能做 LLM 数据质检把语义层面的毛病也一起捞出来。底层怎么跑起来输入参数、执行器与插件化规则架构是模块化的输入参数先声明要评估哪个数据集Executor 执行器把任务真正跑完规则和模型以插件形式挂载想加一个质检维度写个插件就行。本地文件、Hugging Face、S3、SQL 这些数据源都能接远程数据不用先搬到本地。想自己扩展规则的话dingo 规则源码 里有一堆现成范式可以直接抄。四个高频用法从本地文件到语义级深度评估本地文本文件质检把一批文件指给 dingo跑完规则集脏数据出在哪直接标出来。Hugging Face 数据集不用下载到本地远程数据集直接评估省掉搬运这一步。JSON / JSONL 结构化数据按字段级别逐条检查适合微调入库前最后一道质检。接 GPT 等大模型做语义级深度评估规则覆盖不到的表达问题、逻辑问题让 LLM 来判。更多组合玩法可以看 官方文档。为什么值得把 dingo 放进数据流水线七维全覆盖完整性到可理解性一次跑完不用自己拼指标。规则 LLM 双引擎确定性规则兜底大模型深挖语义两层互补不内耗。CLI / SDK 双入口临时质检、平台化集成都能满足。流水线友好输出结构化结果直接接进 CI 或数据清洗环节。⚡下次怀疑数据有问题先跑一轮 dingo回到开头那个卡在 85% 的模型要是当时先跑一轮 dingo重复样本和乱码字段半天就能定位。数据集质量检查这事先让机器翻一遍再回去调参数不迟。【免费下载链接】dingoDingo: A Comprehensive AI Data, Model and Application Quality Evaluation Tool项目地址: https://gitcode.com/gh_mirrors/dingo5/dingo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考