十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

手把手装好 lm-evaluation-harness:语言模型评测与安装配置速通

手把手装好 lm-evaluation-harness:语言模型评测与安装配置速通 手把手装好 lm-evaluation-harness语言模型评测与安装配置速通【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness你刚训练完一个模型接下来怎么判断它到底靠不靠谱光看 loss 曲线可不够得拿真实任务考它一把。lm-evaluation-harness 就是干这个的语言模型评测框架一条命令把模型扔进 HellaSwag、ARC 这类标准任务里出分。这篇模型评测安装教程带你把它跑起来。评测框架能干啥lm-evaluation-harness 是 EleutherAI 开发、以 Python 编写的开源评测框架核心价值是统一接口同一套评测流水线换模型、换任务就能横向对比不同模型在同一批任务上的表现不用为每个数据集各写一套脚本。它支持多种模型来源总有一种接得上你手里的模型Hugging Face Transformers 加载的本地权重模型vLLM 推理引擎主打快和省显存OpenAI API 等云端接口--model apiTextSynth 托管模型PEFT 适配器LoRA 等微调产物直接挂到基座上评环境自检清单开工前花一分钟确认三件事Python 3.7 或更高版本python --version看一眼Git 已安装用于拉取仓库用 GPU 的话CUDA 驱动正常nvidia-smi能正常输出CPU 也能跑只是速度感人。三分钟装好 lm-evaluation-harness先 clone 仓库到本地git clone https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness然后进入目录安装cd lm-evaluation-harness pip install -e .-e是可编辑安装改源码能立即生效方便后续自己加任务。装完立刻验证lm_eval --help看到lm-evaluation-harness 安装帮助信息说明一切就绪。如果要用 Hugging Face 后端的模型再补一句pip install lm_eval[hf]装对应依赖。跑通第一个评测来一条可直接复制的命令对 GPT-J-6B 跑 HellaSwaglm_eval --model hf \ --model_args pretrainedEleutherAI/gpt-j-6B \ --tasks hellaswag \ --device cuda:0 \ --batch_size 8参数不用逐个背记住两个最关键的--tasks指定跑哪些任务多个用逗号分隔--batch_size控制每批样本数显存吃紧就调小。--device指定用哪块卡--model_args里填模型名或本地路径即可。多 GPU 评测命令怎么写模型能塞进单卡、但想跑快一点时用 Hugging Face 的accelerate启动器做多卡数据并行accelerate launch -m lm_eval --model hf \ --tasks lambada_openai,arc_easy \ --batch_size 16每张卡装一份完整模型副本K 块 GPU 大致就是 K 倍速度模型大到单卡装不下时改走parallelizeTrue切分权重细节见 README。下一步可以试试翻一翻 lm_eval/tasks/ 内置任务目录从 hellaswag 换到你关心的领域任务查 docs/task_guide.md 了解任务配置规则或照着 docs/new_task_guide.md 给自己的数据集加个自定义任务需要接 API 模型或 vLLM 后端时看 docs/model_guide.md【免费下载链接】lm-evaluation-harnessA framework for few-shot evaluation of language models.项目地址: https://gitcode.com/GitHub_Trending/lm/lm-evaluation-harness创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表