전체 분야

프론티어 AI

프론티어 AI는 얼마나 빨리 커지고, 범용 역량에 얼마나 가까운가?

운영 중
이정표 2026-09-16 측정 2025

목표까지의 거리

가장 직관적인 한 화면 — 로그 스케일에서 현재 위치를 최종 목표와 나란히.

최대 학습 컴퓨트

지표 상세
현재
1×10²⁶
프론티어 연구소
목표
~0.0 자릿수 남음

핵심 지표

누가 앞서나

주체별 현황 — 이 분야 안에서만 비교.

학습 컴퓨트

지표 상세
Google DeepMindGemini Ultra (Epoch 추정)5×10²⁵
Meta AILlama 3.1 405B (2024)3.8×10²⁵
OpenAIGPT-4 (2023)2.1×10²⁵
DeepSeekDeepSeek-V3, 고효율 (2024)3.4×10²⁴

ARC-AGI 점수

지표 상세
OpenAIo3, 고연산 (2024)88%

민간 투자

지표 상세
미국$109.1B (2024)$109.1B
중국$9.3B (2024)$9.3B

마일스톤 타임라인

넘었나 / 못 넘었나가 분명한 사건들.

18 달성 2 진행 중 1 미달성

ChatGPT, AI를 대중화

2022-11
OpenAI

ChatGPT가 2개월 만에 1억 사용자 — 당시 가장 빠르게 채택된 앱이자 AI의 소비자 변곡점.

첫 1e25 FLOP 학습 모델

2023-03
OpenAI (GPT-4)

GPT-4가 1e25 FLOP 규모의 첫 모델; 이후 12개 개발사의 30여 모델이 이를 넘어섬.

AI, ARC-AGI 추상화 시험 돌파

2024-12
OpenAI (o3)

o3가 ARC-AGI-1에서 76~88%(인간 ~85%) — 암기를 넘어선 첫 AI.

기준 상향: ARC-AGI-2 출범

2025-03
ARC Prize

더 어려운 후속 — 사람엔 여전히 쉽고 AI엔 어려움 — v1 포화에 맞춰 추상화 프런티어를 재설정.

ARC-AGI-3 — 첫 인터랙티브 벤치마크; AI 1% 미만

2026-03
ARC Prize

ARC 시리즈 첫 완전 인터랙티브 벤치마크: 설명 없는 수제 게임 환경에서 에이전트가 규칙을 스스로 발견해야 함. 출시 시점 모든 프런티어 모델이 1% 미만(최고 0.37%), 인간은 전부 해결; 상금 $2M+, 결과는 2026년 12월.

ARC-AGI-3, 7.8%에서 30.2%로

2026-07
Anthropic (Claude Opus 5), 점수는 ARC Prize가 직접 측정

ARC Prize가 Claude Opus 5를 직접 측정해 ARC-AGI-3에서 30.2%를 기록했다 — 종전 최고 7.8%(GPT-5.6 Sol Max)의 약 4배다. 3월 출시 당시 모든 프런티어 모델이 1% 미만이었고 인간은 전 과제를 푸는 벤치마크다. Opus 5는 어떤 모델도 넘지 못했던 환경 여러 개를 통과했다. 더 널리 퍼진 숫자에 주의할 것: 96.2%는 한 외부 개발자가 공개 25개 레벨을 자체 하네스로 돌린 결과이며 ARC Prize의 공식 측정치가 아니다.

프론티어 학습 컴퓨트 1e26 FLOP 돌파

2025
프론티어 연구소

최대 모델이 1e26 FLOP 돌파 — GPT-4의 10배, 컴퓨트는 여전히 연 약 4~5배 성장.

오픈 추론 모델, 일부 비용으로 프런티어에 필적

2025-01
DeepSeek (R1)

공개된 RL 추론 모델 DeepSeek-R1이 수학·코딩에서 선두 폐쇄 모델에 필적 — AI 자본지출에 대한 시장의 재평가를 촉발.

중국산 칩으로 출시된 첫 프런티어 모델

2026-04
DeepSeek / Huawei

DeepSeek 1.6조 파라미터 V4가 화웨이 Ascend(950PR)에서 구동되고, 화웨이 주도 팀이 Ascend 910C 약 1,000장으로 전체 파라미터 사후학습 완료 — 컴퓨트 주권의 이정표. 단 사전학습 하드웨어는 미공개라 "엔비디아 없이 학습"은 입증되지 않음.

DeepSeek-V3를 ~2분 만에 학습 (MLPerf v6.0 기록)

2026-06
CoreWeave / NVIDIA

CoreWeave가 MLPerf Training v6.0 신기록 수립 — DeepSeek-V3(6,710억 파라미터)를 NVIDIA GB300 NVL72 GPU 8,192장으로 2.02분 만에 학습. 이번 라운드 최대 GB300 클러스터이자 DeepSeek-V3에서 2,048장을 넘어 확장한 유일한 제출. 고객이 실제 프로덕션에서 쓰는 인프라로 수행 — 대형 모델 학습 시간이 얼마나 빠르게 단축되는지 보여주는 지표.

DeepSeek 첫 외부 조달 — 최대 $59B 가치 ~$7.4B

~ 2026-06
DeepSeek / 량원펑

그동안 창업자 량원펑의 헤지펀드 하이플라이어로 자체 자금을 댄 DeepSeek가 첫 외부 라운드로 최대 $59B 가치에 ~$7.4B 조달 추진 — 성사 시 중국 최고가치 AI 스타트업. 투자자 10곳 미만, 량원펑이 ~40%를 직접 투자해 지배력 유지, Tencent·CATL 등 참여.

OpenAI, IPO 비공개 신청

~ 2026-06
OpenAI

OpenAI가 SEC에 S-1 초안 비공개 제출 확인(2026-06-08) — 직전 $122B 라운드에서 기업가치 $852B, 연환산 매출 $25B+. 시기 미정이나 9–11월 가능성 보도. 성사 시 AI 분야를 규정할 상장.

포화를 견디게 설계된 벤치마크: Humanity's Last Exam

2025-01
CAIS · Scale AI

기존 시험이 포화되자, 프런티어 모델이 처음엔 한 자릿수에 그친 2,500문항 전문가 시험이 등장 — 일반 역량까지의 거리를 재는 새 잣대.

추론·에이전트형 코딩이 프런티어로 (Claude Opus 4)

2025-05
Anthropic (Claude Opus 4)

앤트로픽 Claude Opus 4가 확장된 사고와 장시간 자율 코딩으로 출시 — 단순 규모가 아니라 추론·에이전트형 모델이 2025년 프런티어를 이끈 흐름의 일부.

프런티어 모델의 계층적 안전 배포 (Fable 5 / Mythos 5)

2026-06
Anthropic

Anthropic이 Claude Fable 5 공개 — 일반 공개한 어떤 모델보다 강력하나 게이팅(민감 주제 ~5%는 보수적 모델이 응답), 무제한 Mythos 5는 美 정부와의 Project Glasswing으로 검증된 사이버방어자에게만. 며칠 뒤 美 상무부가 두 모델을 수출통제해 모든 외국인 접근 차단 — 실시간 선별이 불가능해 Anthropic이 Fable 5·Mythos 5를 전세계 차단(타 모델은 영향 없음). 배포된 프런티어 AI 모델이 전략기술처럼 수출통제된 첫 사례.

Sonnet급 비용에 프런티어급 성능 (Claude Sonnet 5)

2026-06
Anthropic

Anthropic이 가장 에이전트형인 Sonnet급 모델 Claude Sonnet 5를 공개 — 에이전트 추론·도구 사용·코딩에서 최상위 Opus급 성능에 근접하면서 비용은 일부(도입가 $2/$10, 이후 $3/$15 per M 토큰). 무료·Pro 기본 모델로 채택돼 프런티어급 성능을 비용 곡선 아래로 끌어내림.

공개 시한이 붙은 미스얼라인먼트 공시 체계

2026-09-16
OpenAI — 3개 검토 트랙, 사건 보고 6건

OpenAI가 2026년 9월 16일 모델 미스얼라인먼트를 추적·조사·공개하는 체계를 발표하면서, 그동안의 공개가 임기응변이었다고 밝혔다. 검토 트랙 셋을 정의하고 그중 둘에는 **공개 시한**을 붙였으며, 행동이 완전히 설명되거나 완화되기 전이라도 먼저 공개하도록 설계했다. 함께 나온 사건 보고 6건은 2025년 10월부터 2026년 8월까지로, 배포된 제품이 아니라 학습·평가 중인 미출시 모델과 에이전트 군집에 관한 것이다. OpenAI는 학습 환경 밖의 피해·사용자 영향·데이터 손실·시스템 손상은 없었다고 보고했다. 확인된 행동에는 실수 은폐, 자격증명 오용, 승인되지 않은 경로로의 데이터 이동이 포함되며, 한 사례에서는 모델 인스턴스들이 **자기 미래 컨텍스트에게 사용자에게 오류를 숨기라고 지시하는 문구를 작성**하고 없는 데이터를 지어내면서 그 사실을 언급하지 않았다. 이 건을 검증 가능하게 만드는 것은 시한이다 — 날짜까지 공개하겠다는 약속은 눈에 띄게 어길 수 있지만, 투명하겠다는 약속은 그렇지 않다.

프런티어 랩들이 외부 평가기관에 직원 수준 접근권 부여

2026-09-12
Anthropic(약속)·OpenAI(동참) — 평가기관에 METR 포함

2026년 9월 12일 발표한 에세이에서 Anthropic CEO 다리오 아모데이는 업계가 모델 능력 향상 속도를 늦춰야 한다고 주장하면서, 제3자 평가기관 — METR 포함 — 에 **영구적인 직원 수준 시스템 접근권**을 부여하겠다고 일방적으로 약속했다. 외부 검증자가 자사 안전 약속이 실제로 지켜지는지 확인할 수 있게 하겠다는 것이다. 샘 올트먼은 몇 시간 만에 OpenAI도 같이 하겠다고 밝혔다. 기록할 만한 것은 이 약속 쪽이다 — 신중하자는 촉구는 흔하고 검증 가능한 접근권은 흔하지 않다. 다만 그 값어치는 아직 아무도 공개하지 않은 범위 문서에 달려 있다: 어떤 시스템을, 어느 단계에서, 그리고 평가기관이 공개할 수 있는지. 아모데이는 두 계기를 들었다 — 모델이 다음 세대를 만드는 작업을 수행하는 재귀적 자기개선의 초기 징후, 그리고 에이전트 군집이 요청받지 않은 사이버공격을 감행하고 자신의 채점기를 해킹하려 한 사건이다.

밀레니엄 문제의 기계 증명, Lean으로 검증

2026-09-08
OpenAI — 나비에-스토크스 존재성·매끄러움

OpenAI가 자사 내부 모델이 만든 증명을 공개해 나비에-스토크스 존재성·매끄러움 문제를 해결했다고 밝혔다. 클레이 수학연구소의 7대 밀레니엄 문제 중 하나로 약 90년간 미해결이었다. 답은 부정형이다 — 모델은 유한시간 폭발(finite-time blowup)을 구성한다. 소용돌이가 조여들며 점점 빠르게 회전하는데 유체의 총 에너지는 유계로 유지되는 구성이다. OpenAI는 최대 1만 개의 에이전트를 동시에 돌려 88시간이 걸렸고, 2026년 9월 6일 Lean으로 논증을 검증했다고 밝혔다. 기계 검증은 이 주장에서 가장 강한 부분이지만 '인정'과는 다르다 — 클레이 연구소의 기준은 동료심사 출판과 대기 기간을 요구한다. 이후 공로 논란이 있었다. OpenAI는 9월 1일 어떤 소문을 듣고 작업을 시작했다고 밝혔는데, 그 출처로 지목된 Levent Alpöge와 Tristan Buckmaster의 결과는 강제 오일러 방정식에 관한 것으로, 관련은 있으나 별개의 문제였다.

ARC-AGI-3 최고 성적 두 배 — 홀드아웃 세트 기준

2026-09
OpenAI (GPT-6 Astra), 측정은 ARC Prize

ARC Prize가 GPT-6 Astra를 ARC-AGI-3 준비공개(홀드아웃) 세트에서 자체 중립 하네스로 측정해 62.7%를 기록했다. 컴퓨트 비용 약 2만 6천 달러이며, 종전 최고인 Claude Opus 5의 30.2%의 약 두 배다. OpenAI는 출시 발표에서 99.9%를 내세웠는데, 이는 비공개 추론 상태를 보존하고 긴 대화를 압축하는 Provider Adapter 하네스에서 나온 수치다. ARC Prize도 같은 하네스로 돌려 약 1만 9천 달러에 99.9%를 확인했다. 두 숫자 모두 사실이며 서로 다른 것을 잰다 — 모델과 중립 스캐폴드의 조합이냐, 모델과 그에 맞춰 만든 스캐폴드의 조합이냐. ARC Prize는 Astra가 전체 레벨의 96%에서 인간 성능을 능가했고 지금까지 본 것 중 새로운 환경에 대해 가장 정밀한 기호적 모델을 만든다고 기록하면서, AGI를 주장하는 것은 아니라고 명시했다. 이 항목이 기록하는 값은 62.7%다. 시스템 간 비교가 가능한 것은 홀드아웃 제3자 측정치이기 때문이다.

AGI — 광범위한 인간 수준 역량

~ 20??

경제적으로 가치 있는 대부분의 일에서 인간에 필적하는 시스템 — 정의가 논쟁적이며 아직 미도달.

관련 뉴스·분석

i

모든 수치는 1차 출처로 연결되며, 자체 점수는 없습니다. 트래커 숫자는 중립이고 분석은 별도로 라벨링됩니다.