十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

CMPhysBench: A Benchmark for Evaluating Large Language Models in Condensed Matter Physics

CMPhysBench: A Benchmark for Evaluating Large Language Models in Condensed Matter Physics CMPhysBench相关总结与翻译一、文章主要内容(一)研究背景随着大型语言模型(LLMs)在自然语言处理、数学推理等领域的快速发展,其在科学研究(如分子生成、优化)中的应用潜力受到关注。然而,物理学对LLMs要求极高,不仅需高级推理和数学精度,还需对物理原理有深刻概念理解,而现有物理相关基准存在不足——要么聚焦高中知识(如SciQ、ScienceQA),要么虽涉及本科内容(如PHYBench、UGPhysics),但在当代物理学关键前沿领域覆盖不足,难以评估LLMs在实际科学任务中的能力。(二)CMPhysBench基准构建基准规模与覆盖范围:包含520道精心设计的题目,由博士生和博士后基于凝聚态物理标准研究生教材编写,难度涵盖本科到高级研究生水平。覆盖凝聚态物理6个代表性主题,包括4个核心主题(磁学、超导、强关联系统、半导体)以及2个扩展维度(理论基础、其他领域,后者包含量子力学、统计物理等)。题目类型与数据构建:题目均为开放式计算题,要求模型生成完整解题步骤,避免选择题无法考察中间推理过程的缺陷。数据构建历经收集(从17本经典教材收集材料并转换格式)、结构化(调整题目为标准化计算格式)、质量控制与标注(专家审核、分类答案类型)三个阶段,确保数据质量。答案类型分为元组、方程、数值、表达式、区间五类,由专家分类以保证准确性。(
返回列表