拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding

MAC: A Live Benchmark for Multimodal Large Language Models in Scientific Understanding

MAC相关研究总结与核心部分翻译

一、文章主要内容

本文聚焦多模态大型语言模型(MLLMs)在科学理解能力评估方面的挑战,提出了一个动态演进的基准测试集MAC(Multimodal Academic Cover benchmark),并针对MLLMs跨模态科学推理能力不足的问题,设计了轻量级推理方法DAD(Description and Deduction)。

1. 现有基准测试集的局限性

  • 静态基准测试集(如MMMU)随着MLLMs能力提升逐渐饱和,例如Gemini-2.5-pro在MMMU的pass@1设置下准确率已达81.7%,失去对模型发展的指导意义。
  • 现有动态基准测试集(如LiveBench)仅关注单一语言模态,且依赖互联网快速变化的内容,在科学理解评估的数据质量上存在隐患。

2. MAC基准测试集的构建与特点

  • 数据来源:从Nature、Science、Cell、美国化学学会(ACS)等顶级科学期刊中收集超过25,000个图文对,涵盖分子细胞生物学、材料科学、医学、化学等多个学科领域。
  • 核心快照:2025年快照MAC-2025包含2024年1月至2025年2月期间的2287个期刊封面-封面故事对,用于当前MLLMs的评估。
  • 任务设计:包含Image2Text(给定封面图选对应封面故事)和Text2Image(给定
返回列表