2026/9/12 5:01:25

3步把LLM评估结果拖进Zeno,错误样本一目了然

3步把LLM评估结果拖进Zeno,错误样本一目了然 3步把LLM评估结果拖进Zeno错误样本一目了然【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness评估跑完你在目录里得到一堆JSON文件和终端日志每个任务的总分都在但模型错在哪道题、当时写了什么肉眼根本看不出来。这里用lm-evaluation-harness演示LLM评估可视化的完整流程把本地跑出来的评估结果变成Zeno交互式看板Zeno是一个AI评估可视化平台看板由它返回的项目链接打开。它到底在干嘛lm-evaluation-harness像个自动化的监考老师。每个任务里它把题目包成标准的少样本提示——任务描述、几条示例、最后一道待完成的题——喂给模型收回回答后逐题算出指标这样无论测哪个模型题目格式都一样分数可以横向比。左边这张少样本提示示意图就是模型实际看到的内容提前给几条例子正是衡量模型少样本能力的标准做法。Zeno则是一本带分析功能的成绩册它不跑评估只消费监考老师留下的文件。一个管把试考完一个管让你看明白考得怎么样。监考老师留下两类文件一类是汇总结果各任务的分数和配置一类是逐样本记录每题的完整提示、参考答案、模型输出。这两类文件就是评估可视化的全部数据源。从零到看到第一张图 拿到看板一共敲3条命令安装、跑评估、上传三步都能在几分钟内完成。卡壳的地方可以直接跳到文末。下表是你敲什么、屏幕上出现什么。你敲什么屏幕上出现什么克隆仓库并安装终端滚动依赖安装进度最后提示安装成功lm_eval跑一个任务进度条跑完结果目录里出现结果文件和逐样本文件带API Key跑可视化脚本打印模型名和项目链接浏览器打开链接就是看板git clone https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness cd lm-evaluation-harness pip install -e . zeno-client这两行把项目拉到本地顺手装好评估框架和zeno-client上传工具。lm_eval --model hf --model_args pretrainedEleutherAI/pythia-14m \ --tasks lambada_openai --log_samples --output_path ./results这条命令用pythia-14m小模型跑lambada任务指定模型和任务名即可换别的模型、任务同理。--log_samples和--output_path是看板的前提前者保存逐样本记录后者指定保存位置。export ZENO_API_KEYyour_api_key python scripts/zeno_visualize.py --data_path ./results --project_name MyFirstRunAPI Key在Zeno官网注册后从项目设置里复制。--data_path指向结果目录即可脚本会自动把一级子文件夹当作一个模型开始上传。看板里能挖出什么 任务总分一眼看完脚本会自动从结果文件读取任务的指标列表在Zeno上生成对应的均值指标不用手动配置。一次跑多个任务时项目名会自动带上任务名。看板顶部就是总分比如lambada和arc一起跑两个总分并排挂在同一页哪个任务偏弱这个问题它直接回答。逐样本定位错误、翻回原文样本明细页每一行就是一道题完整提示、参考答案、模型输出都在。多选题会记下模型选了哪个选项生成任务能看到模型的完整输出文本。按对错过滤后逐条翻原文能分清模型真不会还是格式没对上。两个模型并排对比脚本把data_path下每个一级子文件夹当作一个模型同名任务跑多次、结果放进同一目录看板里就能对同一任务做系统间对比。两次跑的任务集不一致时只保留交集并打印一条警告。新手最容易卡住的3个点脚本启动就报Key相关的错——API Key没设先去Zeno官网拿Key再用export写进环境变量然后重跑。结果目录一个文件都没有或脚本提示找不到模型目录——跑评估时忘了指定--output_path结果只打在终端里没落盘。结果文件在、样本却传不上去——没开--log_samples只存了汇总结果没有逐样本数据Zeno画不出样本明细。评估跑完别只盯一个总分这条评估可视化流程走完哪个任务弱、哪道题错都在看板上一目了然链接还能留着下次继续翻细节。更多参数细节可看官方文档。【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考