十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

RD-Agent Finetune 场景 BioProBench 数据集详解:四类生物协议任务的字段定义、数据准备与微调输出格式关键点

RD-Agent Finetune 场景 BioProBench 数据集详解:四类生物协议任务的字段定义、数据准备与微调输出格式关键点 RD-Agent Finetune 场景 BioProBench 数据集详解四类生物协议任务的字段定义、数据准备与微调输出格式关键点【免费下载链接】RD-AgentResearch and development (RD) is crucial for the enhancement of industrial productivity, especially in the AI era, where the core aspects of RD are mainly focused on data and models. We are committed to automating these high-value generic RD processes through RD-Agent, which lets AI drive>项目地址: https://gitcode.com/GitHub_Trending/rd/RD-Agent本文以 RD-Agent 微调Finetune场景下的 BioProBench 数据集说明文档为主体完整讲解该数据集的四个任务PQA/ORD/ERR/GEN的字段结构、train/test 划分规则以及微调训练数据生成时最易出错的“答案语义”与“输出格式”规范并结合仓库源码说明该数据集如何通过prepare()注册机制从 HuggingFace 下载、如何在 OpenCompass 评测链中被消费帮助读者完整掌握“数据准备 → 训练数据构造 → 基准评测”这一闭环。一、数据集定位与规模BioProBench 是一个面向大语言模型LLM的生物实验协议理解与推理多任务基准其数据集说明文档位于 bioprobench/README.md是 RD-Agent finetune 场景中 Biology 领域的核心训练/评测数据源。根据文档描述其关键规模为原始语料约27K 条生物实验协议结构化实例跨任务合计550K 条测试集每个任务保留1,000 条held-out 样本许可证CC BY 4.0。文档中声明了四个用于微调的任务任务缩写任务名称能力定位PQAProtocol Question Answering协议内容多选问答ORDStep Ordering协议步骤排序顶层或子步骤序列ERRError Correction协议文本错误检测与纠正GENProtocol Generation从提示生成简洁、单级、带编号的协议步骤需要注意文档 Notes 部分明确说明REAReasoning over Experimental protocols属于更广泛的基准范畴但不在本仓库提供的数据文件中因此基于该数据集构建微调任务时只能覆盖上述四类。二、数据文件组织与 HuggingFace 配置数据集在 HuggingFace 上以四个 config 组织每个 config 都定义了train/test两个 split对应 README frontmatter 中的配置块config_nametrain split 文件test split 文件PQAPQA.jsonPQA_test.jsonERRERR.jsonERR_test.jsonORDORD.jsonORD_test.jsonGENGEN.jsonGEN_test.json文档给出的 split 使用规则非常直接Train每个任务使用非_test.json后缀的文件Test每个任务提供 1,000 条 held-out 样本*_test.json。文档同时提示如果你的微调管线期望本地文件需要把这些 JSON 文件放在数据准备目录中或相应地更新路径配置。这一要求与 RD-Agent 的下载机制下一节正好对应。三、四个任务的字段定义微调时必须逐字段核对以下是文档“Task Definitions and Fields”一节的完整字段说明构建训练数据模板时每一列都不能省略PQA — 协议问答多选问答Multiple-choice QA over protocol content。字段字段说明question问题字符串choices候选答案列表answer正确答案type问题类别如 parameter、reagent、operationid唯一标识符ORD — 步骤排序将打乱顺序的步骤还原为正确时序支持top顶层与child子步骤两种粒度。字段字段说明question描述步骤列表与上下文/标题的提示wrong_steps被打乱或顺序错误的步骤列表correct_steps正确时间顺序的步骤type序列粒度如top、childid唯一标识符ERR — 错误纠正在局部上下文local context中检测并纠正协议文本错误。字段字段说明context对象含purpose、prior_step、next_stepcorrupted_text错误文本对“原本正确”的样本可能为nullcorrected_text纠正后的文本is_correct布尔值标识给定文本是否已经正确type类别parameter、reagent、operation 或correcterror_description纠正原因的简要说明id唯一标识符GEN — 协议生成从提示生成简洁、单级、带编号flat1., 2., 3. ...的协议步骤。字段字段说明system_prompt角色/系统指令instruction格式与风格约束input任务描述或查询output编号步骤列表id唯一标识符type难度标签如easy四、训练数据指南CRITICAL答案语义与输出格式这是原文档的核心实战部分文档将其标注为 “CRITICAL for Fine-tuning”。微调 BIO 类任务时评测器会把模型输出与标准答案直接比对任何格式或语义偏差都会导致分数异常必须严格遵循以下规范。ERR答案语义不可反转基准提示语是 “If you find anything wrong, answer False.”即is_correct字段与训练输出的对应关系为条件is_correct字段正确的训练输出协议步骤正确True[ANSWER_START]True[ANSWER_END]协议步骤有错误False[ANSWER_START]False[ANSWER_END]文档明确要求训练数据生成脚本采用如下逻辑def gold_answer_from_is_correct(is_correct: bool) - str: # True step is correct, False step has errors return ANSWER_TRUE if is_correct else ANSWER_FALSE并强调不要反转该逻辑——评测器会将模型输出直接与is_correct字段比对。这是 ERR 任务最容易踩的坑直觉上“有错误才回答 True”很自然但基准语义恰好相反。ORD输出必须是合法 Python 列表答案必须是合法 Python 列表[0, 2, 1, 3]不是空格分隔0 2 1 3错误不是无括号的逗号分隔0, 2, 1, 3错误。训练数据格式上允许包含简短推理1–2 句最终答案必须包裹为[ANSWER_START][list][ANSWER_END]示例[ANSWER_START][2, 0, 1, 3][ANSWER_END]。GEN输出格式步骤化协议包裹在[ANSWER_START]...[ANSWER_END]中该任务允许 CoTChain-of-Thought格式。通用规则所有任务都支持think...标签承载 CoT 推理评测器会将其剥离答案必须包裹在[ANSWER_START]与[ANSWER_END]标签中。上述格式约束在仓库的评测侧描述中得到了交叉印证。scenarios.json 为四个 bioprobench 基准各自维护了scenario与benchmark_description其中对bioprobench_ord与bioprobench_err的说明逐字重申了“必须是带括号的 Python 列表”“True 表示步骤正确”这两条 CRITICAL 规则FT-Agent 使用文档 也把 Biology 领域列入了支持基准表bioprobench_gen、bioprobench_ord、bioprobench_err、bioprobench_pqa主数据集为bioprobench。五、在 RD-Agent 中下载与准备数据集源码级流程BioProBench 在 RD-Agent 中的接入点集中在 finetune 场景的数据集准备模块下面按调用链梳理以 datasets/init.py 为主。1. 数据集注册在 DATASETS 注册表 中BioProBench 以如下配置注册bioprobench: DatasetConfig( repo_idbowenxian/BioProBench, ),DatasetConfig只有两个属性repo_idHuggingFace 数据集仓库 ID和可选的post_download_fn下载后处理函数。BioProBench 未配置后处理函数下载后不做额外清理——这与 financeiq 的 split 处理、panorama 的评测集删除形成对比同文件 L46-L68。2. prepare() 下载流程prepare(name, forceFalse) 的行为校验name必须在DATASETS注册表中否则抛出ValueError目标目录固定为Path(FT_RD_SETTING.file_path) / datasets / name即由FT_FILE_PATH环境变量决定根目录例如FT_FILE_PATH/datasets/bioprobench/若目录已存在且未加forceTrue直接返回已有路径可复用已下载资产首次运行可能较慢通过 download_dataset() 下载底层使用huggingface_hub.snapshot_download参数为repo_typedataset、local_dir_use_symlinksFalse保留 HF 仓库原始文件结构hf.py L55-L62若存在post_download_fn则执行BioProBench 没有README 替换机制若源码中存在datasets/bioprobench/README.md即本文所讲的这份文档则复制覆盖到下载目录L105-L108。这意味着运行后在数据目录中看到的正是本仓库这份定制版说明文档而非 HF 原始 README。该机制的完整说明见 数据集模块文档。使用方式与 datasets/README.md 一致from rdagent.scenarios.finetune.datasets import prepare, prepare_all path prepare(bioprobench) # 下载至 FT_FILE_PATH/datasets/bioprobench/ prepare_all() # 准备全部已注册数据集也可直接以模块入口运行main块 L125-L133传入数据集名执行prepare不传参数则打印可用数据集列表。相关注意事项来自模块文档与源码私有数据集需设置HF_TOKEN环境变量hf.py 的 _get_hf_token 支持 HF_TOKEN / HUGGINGFACE_TOKEN / HUGGING_FACE_HUB_TOKEN强制刷新使用prepare(name, forceTrue)会先删除已存在目录再重新下载运行 finetune 场景需要 Linux、当前用户可用的 Docker免 sudo或兼容 conda 环境、NVIDIA GPU 与 LLM API 访问FT-Agent 文档 Prerequisites.env中需配置FT_FILE_PATH、FT_TARGET_BENCHMARK等参数。六、评测链路OpenCompass 适配器与核心指标数据集下载后的另一条主线是评测。benchmark 数据适配器 为四个任务分别注册了 OpenCompass 数据集配置映射# BioProBench bioprobench_gen: BenchmarkConfig(datasetopencompass.configs.datasets.bioprobench.bioprobench_gen), bioprobench_ord: BenchmarkConfig(datasetopencompass.configs.datasets.bioprobench.bioprobench_ord), bioprobench_err: BenchmarkConfig(datasetopencompass.configs.datasets.bioprobench.bioprobench_err), bioprobench_pqa: BenchmarkConfig(datasetopencompass.configs.datasets.bioprobench.bioprobench_pqa),各任务的核心指标由 BioProBenchProcessor 定义任务核心指标PQAaccuracyORDkendall_tauKendalls TauERRf1GENROUGE-L从源码结构看get_core_metric()会遍历评测汇总中各子集的指标按数据子集名匹配任务前缀选取核心指标并对ROUGE-L这类大小写不一致的键名做了大小写不敏感兜底多子集时取平均并返回 “mixed (average)” 之类的指标名。在 FT-Agent 的评测流程中训练完成后会分别在 validation 与 test 区间各跑一次run_benchmarkvalidation 结果供 agent 做 SOTA 判断test 结果仅用于前端展示FTRunnerEvaluator.evaluate 的 Stage 2 之后的双区间评测。这也解释了为什么数据集要固定 1,000 条/任务的 held-out 测试集——它服务于不向 agent 暴露的最终展示分。七、实践要点小结字段核对构造训练样本模板前对照第三节的字段表逐一映射ERR 的context是嵌套对象purpose/prior_step/next_step不要压平。语义方向ERR 任务的is_correctTrue对应输出True步骤正确反转逻辑会系统性拉低 F1。格式刚性ORD 答案必须是[0, 2, 1, 3]风格的合法 Python 列表所有任务答案都必须包裹[ANSWER_START]...[ANSWER_END]。CoT 可用think...标签推理会被评测器剥离GEN 任务允许 CoT 格式输出。复用下载固定FT_FILE_PATH首次prepare(bioprobench)后再次运行可直接复用需要更新时用forceTrue。范围边界本数据集文件不包含 REA 任务四个基准bioprobench_pqa/ord/err/gen分别对应 accuracy / kendall_tau / f1 / ROUGE-L 核心指标。数据来源与许可数据集遵循 CC BY 4.0 许可原始基准的详细构成协议来源的领域与仓库分布请参考上游 BioProBench 基准项目。【免费下载链接】RD-AgentResearch and development (RD) is crucial for the enhancement of industrial productivity, especially in the AI era, where the core aspects of RD are mainly focused on data and models. We are committed to automating these high-value generic RD processes through RD-Agent, which lets AI drive>项目地址: https://gitcode.com/GitHub_Trending/rd/RD-Agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表