AI 모델 순위
독립 벤치마크의 공개 결과를 그대로 기록하고, 실제 기업 도입 시 함께 살펴야 할 해석 기준을 덧붙입니다.
2026.08.25 · 13:26 KST SNAPSHOT
Intelligence Index 상위 10개 모델
Artificial Analysis 리더보드의 기본 정렬 순서를 기준으로 기록했습니다.
다음 정기 확인
| 순위 | 모델·평가 설정 | 개발사 | 지수 |
|---|---|---|---|
| 1 | Claude Opus 5 (max) | Anthropic | 63 |
| 2 | Claude Opus 5 (xhigh) | Anthropic | 63 |
| 3 | Claude Fable 5 (with fallback) | Anthropic | 62 |
| 4 | Claude Opus 5 (high) | Anthropic | 61 |
| 5 | GPT-5.6 Sol (max) | OpenAI | 61 |
| 6 | Grok 4.6 (high) | SpaceXAI | 61 |
| 7 | Grok 4.6 (xhigh) | SpaceXAI | 60 |
| 8 | Kimi K3 (max) | Kimi | 60 |
| 9 | GLM-5.3 (max) | Z AI | 60 |
| 10 | GPT-5.6 Sol (xhigh) | OpenAI | 59 |
동점은 원문 리더보드의 표시 순서를 따릅니다. 같은 모델도 추론 강도와 실행 설정이 다르면 별도 항목으로 집계되므로, 숫자만으로 제품 우열을 단정할 수 없습니다.
HOW TO READ
순위를 읽는 기준
현재 Artificial Analysis Intelligence Index v4.1.1은 텍스트 중심의 영어 평가입니다. 에이전트·코딩·과학적 추론·일반 역량을 가중 합산하므로 한국어 업무나 특정 산업의 성능을 그대로 보장하지 않습니다.
종합 지능 지수
에이전트 34%, 코딩 24%, 과학적 추론 24%, 일반 역량 18%를 반영한 종합 지표입니다.
비용·속도 별도 검토
실제 운영 모델은 종합 점수와 함께 업무당 비용, 출력 속도, 첫 응답 지연을 따로 비교해야 합니다.
현업 검증 필수
한국어 정확성, 보안, 데이터 위치, 도구 연동, 실패 복구를 조직의 실제 데이터로 재검증해야 합니다.
SOURCE & UPDATE POLICY
출처와 업데이트 원칙
이 페이지는 실시간 순위가 아니라 조회 시점의 공개 스냅샷입니다. 10일마다 원문 순위, 평가 버전, 전체 평가 수를 다시 확인하며 변경이 있을 때 갱신합니다.
벤치마크는 모델 선택을 돕는 참고 자료이며 특정 모델의 구매·도입을 권유하지 않습니다. 실제 도입 전에는 조직의 사용 사례와 위험 기준으로 별도 평가해 주세요.