十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

GPT2-Chinese 快速指南:让 GPT-2 写诗、写小说的中文文本生成工具

GPT2-Chinese 快速指南:让 GPT-2 写诗、写小说的中文文本生成工具 GPT2-Chinese 快速指南让 GPT-2 写诗、写小说的中文文本生成工具【免费下载链接】GPT2-ChineseChinese version of GPT2 training code, using BERT tokenizer.项目地址: https://gitcode.com/gh_mirrors/gpt/GPT2-ChineseGPT-2 写英文是一把好手可一写中文就露怯了。GPT2-Chinese 是一套开源的中文 GPT-2 训练代码用它配合自己的语料就能练出会写诗、写小说、写新闻的中文文本生成模型。新手照着几步也能跑起来。GPT2-Chinese 到底是什么一句话定位它是架在 HuggingFace Transformers 库上的一座中文桥把 GPT-2 和中文训练、中文生成连了起来。你喂给它中文文章它帮你把模型练出来练完就能续写新文本。它是如何运作的先教模型认字再教它接话可以把它的工作拆成两步都和吃饭一样朴素。第一步是认字分词。中文不像英文有天然的空格机器要理解一句话得先决定切成多大的块。项目里备了三种切法按字切、按词切、按 BPE 切。BPE 有点像一本高频词打包手册——经常一起出现的字会被捆成一个整体模型读起来更省劲儿也更能抓住词的意思。第二步是接话生成。GPT-2 本质上是一台猜下一个字的机器。训练时它海量地读文本像学生靠反复朗读把语感背出来生成时你给它一句开头它就一个字符一个字符地往下猜猜出来的串起来就是一段新文章。项目还支持 FP16 和梯度累积两种加速手段语料上到 GB 级也不在话下。谁会用得上它爱写诗、爱填词的人。社区已经用这套代码练好了古诗词、对联、歌词等现成模型。给它一句上句它能顺着往下续还可以指定体裁律诗、绝句、词牌都能接。写小说、找灵感的人。拿一整本书的文本当语料就能模仿那种文风。仓库里的 单文件训练脚本 就是为训练一整本书这种场景准备的README 里还收录了模仿金庸武侠文风的生成样例读起来有模有样。学生和研究者。代码路径清晰训练看 train.py生成看 generate.py分词逻辑在 tokenizations/评估用 eval.py。想搞清楚一个 Transformer 语言模型到底是怎么从零训起来的它是个不错的练手项目。如何快速上手从克隆到生成只需五步拿到代码git clone https://gitcode.com/gh_mirrors/gpt/GPT2-Chinese安装依赖pip install -r requirements.txt准备语料在项目根目录建data文件夹把train.json放进去——它就是一篇篇文章组成的列表格式可参考仓库里现成的 train.json开始训练运行train.py并勾选--raw数据预处理和训练会自动接着跑尝鲜生成跑generate.py指定开头的 prefix 和生成长度新文本就出来了想要存盘就加上--save_samples 不想自己训社区分享的散文、诗词、对联、歌词、文言文、通用模型都可以直接拿来生成。唯一要记住的小窍门输入文本前面要加一个起始符[CLS]否则模型不知道从哪儿开始接话。它的优势与适用边界优点很实在字级、词级、BPE 级三种粒度任选大语料训练稳得住还有一批开箱即用的预训练模型。但边界也得说清楚项目已暂停更新作者自己说明初衷是练习 PyTorch难免有不成熟之处依赖锁在较老的transformers 2.1.1在新环境里跑可能要自己处理版本冲突。FP16 训练作者备注可能不收敛原因至今不明图快之前先了解这个坑。生成质量很吃语料。从 样例展示 里就能看到模型偶尔会跑偏说些驴唇不对马嘴的话想要稳定输出语料清洗比调参数更关键。定位上它更适合风格模仿、创意启发和入门学习而不是严肃写作或高精度任务。延伸资源与下一步代码获取git clone https://gitcode.com/gh_mirrors/gpt/GPT2-Chinese训练脚本、生成脚本、样例输出、词表与分词器 都在仓库里按 README 的目录说明翻一遍就能摸清结构scripts/ 下有现成的训练与生成示例命令可直接照着改参数如果你用它写出了满意的句子或者自己训出了一个不错的中文模型欢迎回来交流分享——这套代码的很多亮点正是一个个社区贡献者添上去的。【免费下载链接】GPT2-ChineseChinese version of GPT2 training code, using BERT tokenizer.项目地址: https://gitcode.com/gh_mirrors/gpt/GPT2-Chinese创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表