十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

DB-GPT 如何用 Falcon 基准数据集对多个大模型跑 Text2SQL 评测并导出 Excel 报告

DB-GPT 如何用 Falcon 基准数据集对多个大模型跑 Text2SQL 评测并导出 Excel 报告 DB-GPT 如何用 Falcon 基准数据集对多个大模型跑 Text2SQL 评测并导出 Excel 报告【免费下载链接】DB-GPTopen-source agentic AI data assistant for the next generation of AI Data products.项目地址: https://gitcode.com/GitHub_Trending/db/DB-GPT如果你的目标是横向比较多个大模型在 Text2SQL 任务上的表现DB-GPT 内置的 benchmark 模块可以完成这件事它基于蚂蚁集团开源的 Falcon 基准数据集28 个数据集、90 张表已正式发布 500 道中文题目其中 easy 151、medium 130、hard 219对模型生成的 SQL 做语法正确性、语义准确性和执行有效性的三层检查输出执行率Executability Rate与准确率Accuracy Rate两项指标并把每道题的执行细节和比对结果导出为 Excel 报告。整个过程在 DB-GPT 平台页面内完成无需自己搭评测脚本。适用前提DB-GPT 需要升级到 V0.7.4或更高版本且评测数据集当前只支持 SQLite 作为底层数据库类型MySQL、ODPS 均不支持。准备环境升级到 V0.7.4 并升级元数据库升级版本与元数据库 schema第一步是把 DB-GPT 升级到 V0.7.4并升级元数据库如果元数据库使用 SQLite表结构默认自动升级无需手动操作如果使用 MySQL需要手动执行 DDL。完整 DDL 在assets/schema/dbgpt.sql分版本的增量 DDL 在assets/schema/upgrade/目录下。例如从 v0.7.1 升到 v0.7.4执行mysql -h127.0.0.1 -uroot -p{your_password} assets/schema/upgrade/v0_7_4/upgrade_to_v0.7.4.sql命令中的{your_password}需要替换为你本机 MySQL 的 root 密码。该文件upgrade_to_v0.7.4.sql会创建evaluate_managebenchmark 任务记录和benchmark_summary汇总指标结果两张表。启动服务并等待评测数据集加载启动 DB-GPT 服务后Falcon 评测集会自动加载耗时约 1~5 分钟。看到类似下面的日志行即代表数据集加载完成在平台注册要参评的 LLMbenchmark 只能评测已在 DB-GPT 平台注册的模型文档给出两种注册方式方式一通过配置文件配置 ProxyModel参考 Proxy LLMs 配置文档。以 OpenAI 为例编辑configs/dbgpt-proxy-openai.toml中的模型配置[models] [[models.llms]] name gpt-3.5-turbo provider proxy/openai api_key your-openai-api-key然后以该配置启动服务uv run dbgpt start webserver --config configs/dbgpt-proxy-openai.toml方式二通过产品页面注册模型参考 Models 文档新版本中模型管理位于 Application Management 面板下。要评测多个模型就把每个模型都注册进来。后续创建评测任务时填写的是这里配置的模型名称。创建多模型评测任务Step1在平台页面点击 Create Benchmark 创建评测任务。Step2填写任务名称并选择要参评的模型列表。Step3提交任务。Step4等待任务执行完成。500 道题逐一调用 LLM 生成 SQL 并执行比对文档明确提示评测可能需要较长时间属于正常现象。任务创建也可以在页面之外通过 API 完成作为可选路径。向POST /api/v2/serve/evaluate/execute_benchmark_task发送请求完整参数说明见 Benchmark API 文档DBGPT_API_KEYdbgpt SPACE_ID{YOUR_SPACE_ID} curl -X POST http://localhost:5670/api/v2/serve/evaluate/execute_benchmark_task \ -H Authorization: Bearer $DBGPT_API_KEY \ -H accept: application/json \ -H Content-Type: application/json \ -d { scene_value: Falcon_benchmark_01, model_list: [DeepSeek-V3.1, Qwen3-235B-A22B] }文档中标注scene_key场景类型与scene_value任务名称为必填字段model_list中必须填写在 DB-GPT 平台上配置过的模型名另有可选的temperature默认 0.7和max_tokens。DBGPT_API_KEY与SPACE_ID按你的实际环境替换。返回体中的status字段表示任务状态如 success、failed、running。查看评测报告任务状态变为 Completed 后点击 View Details 查看评测报告。报告会展示参评模型总数、题目总数以及正确Correct、错误Incorrect、失败Failed的题目数每个轮次和每个模型执行数、正确数、错误数、失败数以及执行率和准确率执行率与准确率的柱状图可直接对比多个模型。三个状态的判定含义文档原文Correct模型答对了该题Incorrect模型生成的 SQL 语法正确但语义错误Failed通常表示 SQL 存在语法或语义错误。两项核心指标的计算口径指标公式含义Executability Rate语法正确样本数 / 总样本数模型生成的 SQL 中能通过数据库执行的比例Accuracy Rate语义正确样本数 / 总样本数生成的 SQL 语法正确、可执行且语义正确的比例导出 Excel 报告在任务详情页点击 Download Evaluation Results即可下载明细 Excel 报告。报告包含 LLM 执行明细和比对结果分别放在不同的 sheet 中。两个 sheet 的结构dataset_evaluation_result执行明细每题的编号、大模型名称、轮次、数据集ID、用户问题、自定义标签题目来源、SQL 类型、prompt、CoT 长度CoT tokens、LLM 生成的 SQLLLM输出结果、该 SQL 的执行结果结果执行、执行报错信息、traceId、耗时秒。benchmark_compare_result比对结果question评测问题、standardAnswerSql标准答案 SQL基于阿里云 MaxCompute 语法、standardAnswer标准答案在 MaxCompute 引擎上的执行结果部分题目有多个答案、llmCode参评模型名、llmOutput模型生成的 SQL、executeResult模型 SQL 的执行结果、errorMsg比对错误信息以及关键的compareResult字段RIGHT表示正确WRONG表示错误FAILED表示失败通常是 SQL 本身有问题。拿到 Excel 后用benchmark_compare_resultsheet 按llmCode分组就能得到每个模型的对错分布配合dataset_evaluation_resultsheet 里的报错信息可以定位具体哪道题、什么 SQL 出的问题。另外页面还提供 View Dataset Details可查看 Falcon 数据集的表、字段与样例数据方便理解题目对应的数据库结构。当前能力边界按 benchmark 模块文档的支持矩阵做评测规划时需要注意这些限制维度支持情况指标Executability Rate、Accuracy Rate数据集仅 Falcon输出格式仅 ExcelCSV、JSON、Yuque 均不支持数据库类型仅 SQLiteMySQL、ODPS 不支持功能清单中还标注了尚未完成的能力多轮评测、agent 评测、接入其他数据源。也就是说目前 benchmark 是单轮多模型评测一次任务对model_list中的每个模型各跑一轮文档示例中的parallel_num为 1。标题里说的多个大模型体现在单轮任务内同时评测多个模型而不是多轮。相关文档Benchmark 模块说明评测流程、指标口径与 Excel 结构的完整说明。Benchmark API创建任务、查询任务列表GET /api/v2/serve/evaluate/benchmark_task_list、查询比对结果GET /api/v2/serve/evaluate/benchmark/result/{evaluate_code}的接口与返回字段其中结果接口的summaries会给出每个模型的right/wrong/failed/accuracy/execRate及结果文件路径outputPath。Proxy LLMs 配置各 provider 的模型注册配置示例。【免费下载链接】DB-GPTopen-source agentic AI data assistant for the next generation of AI Data products.项目地址: https://gitcode.com/GitHub_Trending/db/DB-GPT创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表