基准
MATH
MATH是一个用于评估机器学习模型数学推理能力的基准数据集,由Hendrycks等人构建,包含来自高中数学竞赛的数千道题目,涵盖代数、几何、数论、概率等多个数学领域,并按难度分级。每道题目要求模型给出完整的解题过程与最终答案,是衡量大语言模型在复杂数学推理与问题求解能力方面的重要评测标准。
时间轴 (近 90 天)
8月27日
MATH数据集由Hendrycks等人于2021年发布,包含12500道竞赛数学题目并按难度分为5级
待验证50%
8月4日
The industry has begun shifting toward more challenging benchmarks like GPQA and MATH as older benchmarks lose discriminative power
待验证80%