ARC-AGI-3, 7.8%에서 30.2%로
2026-07ARC Prize가 Claude Opus 5를 직접 측정해 ARC-AGI-3에서 30.2%를 기록했다 — 종전 최고 7.8%(GPT-5.6 Sol Max)의 약 4배다. 3월 출시 당시 모든 프런티어 모델이 1% 미만이었고 인간은 전 과제를 푸는 벤치마크다. Opus 5는 어떤 모델도 넘지 못했던 환경 여러 개를 통과했다. 더 널리 퍼진 숫자에 주의할 것: 96.2%는 한 외부 개발자가 공개 25개 레벨을 자체 하네스로 돌린 결과이며 ARC Prize의 공식 측정치가 아니다.