[控场AI]
基准ARC-AGI-2

ARC-AGI

ARC-AGI(Abstraction and Reasoning Corpus for Artificial General Intelligence)是由François Chollet提出的人工智能推理能力基准测试,旨在评估AI系统的抽象推理与泛化能力。该基准通过一组视觉图形变换任务,要求模型从少量示例中归纳规律并推断答案,强调考察类人的核心知识推理,而非依赖大规模记忆或统计学习,是衡量通用人工智能进展的重要参考标准之一。

核心事实

时间轴 (近 90 天)

8月26日

ARC-AGI基准由François Chollet于2019年提出,用于评估AI在面对全新问题时的抽象推理和泛化能力

待验证50%
8月25日

ARC-AGI基准由Keras创始人François Chollet于2019年提出,每道题都是独一无二的视觉图案变换任务,用于衡量抽象推理能力而非模式匹配

待验证50%
8月22日

Pathway模型论文称在ARC-AGI等基准上达到29.5%成绩,单题计算成本仅为0.0007美元

待验证50%
7月20日

ARC-AGI由AI研究者François Chollet设计,用于创造对人类直觉简单但对依赖数据记忆的语言模型极为困难的测试集

已验证65%
5月31日

ARC-AGI是由AI安全研究员François Chollet设计的专门测量流体智能的基准测试

已验证70%
5月31日

人类在ARC-AGI测试上的平均得分约为85%,而顶尖AI模型长期徘徊在30%-60%区间

待验证60%

全部知识事实 (6)

来源文章