그록 4.6 성능 비교, GPT-5.6·클로드 페이블 5와 벤치마크 10종 뜯어보니
종합 점수는 동률, 가격은 최대 5분의 1
일론 머스크가 이끄는 xAI가 8월 12일(현지시각) 새 플래그십 모델 그록 4.6(Grok 4.6)을 공개했습니다. 여러 매체가 “GPT급 성능에 반값”이라는 헤드라인을 달았지만, 실제 벤치마크 10종을 뜯어보면 이야기가 그렇게 단순하지 않습니다.
결론부터 말하면 그록 4.6은 종합 지능 지표에서 GPT-5.6 솔 맥스와 정확히 동점을 받았고, 클로드 페이블 5 맥스에는 1점 뒤졌습니다. 다만 가격은 입력 토큰 기준 GPT-5.6 솔 맥스의 5분의 2, 출력 토큰 기준으로는 5분의 1 수준입니다. 반값이 아니라 그 이상으로 저렴한 셈입니다.
이 글에서는 Artificial Analysis가 집계한 벤치마크 원본 데이터를 기준으로 그록 4.6이 실제로 어디서 앞서고 어디서 밀리는지, 그리고 전작 그록 4.5 대비 무엇이 얼마나 좋아졌는지를 숫자로 정리했습니다.
1. 벤치마크 10종으로 보는 그록 4.6 vs GPT-5.6 vs 클로드 페이블 5
Artificial Analysis가 공개한 원본 수치를 기준으로 정리하면 아래와 같습니다. 굵게 표시한 값이 세 모델 중 1위입니다.
| 벤치마크 | 그록 4.6 | GPT-5.6 솔 맥스 | 클로드 페이블 5 맥스 |
|---|---|---|---|
| AA 인텔리전스 인덱스 (종합) | 61 | 61 | 62 |
| GDPVal-AA v2 (실무 능력) | 1753 | 1728 | 1741 |
| AA-브리프케이스 (지식노동) | 1577 | 1502 | 1574 |
| Harvey LAB (법률) | 15.8% | 2.5% | 11.3% |
| CursorBench v3.2 (코딩) | 69.9% | 67.2% | 70.5% |
| FrontierCode v1.1 (코딩) | 61.3% | 60.6% | 64.9% |
| APEX-Agents (에이전트) | 57.5% | 56.7% | 59.2% |
| APEX-SWE (소프트웨어 엔지니어링) | 56.4% | 미공개 | 58.8% |
| DeepSWE v1.1 (코딩) | 65.9% | 73% | 70% |
| Terminal-Bench v3.0 (터미널 조작) | 26% | 34.6% | 34.1% |
표를 보면 패턴이 뚜렷합니다. 그록 4.6은 실무 처리, 지식노동, 법률 분야에서 1위를 싹쓸이했지만, 정작 개발자들이 가장 민감하게 보는 코딩·터미널 계열 지표에서는 세 모델 중 꼴찌인 경우가 많습니다. 특히 Terminal-Bench는 GPT-5.6 솔 맥스보다 8.6%p나 낮습니다.
출처: officechai(Artificial Analysis 데이터 기반)
2. 가격 비교, “반값”이 아니라 최대 5분의 1
가격 구조부터 정리하면 아래와 같습니다.
| 구분 | 입력(100만 토큰) | 출력(100만 토큰) | 캐시 입력(100만 토큰) |
|---|---|---|---|
| 그록 4.6 | $2.00 | $6.00 | $0.50 |
| GPT-5.6 솔 맥스 | $5.00 | $30.00 | 미공개 |
| 클로드 페이블 5 맥스 | $10.00 | $50.00 | 미공개 |
이 표를 비율로 바꿔보면 체감이 더 명확해집니다.
- 입력 토큰: 그록 4.6은 GPT-5.6 솔 맥스의 40%(5분의 2), 클로드 페이블 5 맥스의 20%(5분의 1) 가격입니다.
- 출력 토큰: 그록 4.6은 GPT-5.6 솔 맥스의 20%(5분의 1), 클로드 페이블 5 맥스의 12%(약 8분의 1) 가격입니다.
다만 프롬프트가 20만 토큰을 넘어가면 그록 4.6의 요금도 그대로 2배로 뛴다는 점은 유의할 필요가 있습니다. 20만 토큰 초과 구간에서는 입력 $4.00, 캐시 입력 $1.00, 출력 $12.00이 적용됩니다.
Artificial Analysis가 실제 작업 단위로 환산한 수치도 참고할 만합니다. 그록 4.6(High)은 표준 작업 하나를 처리하는 데 평균 22,000토큰을 쓰고, 이를 비용으로 환산하면 작업당 $0.84, 처리 속도는 초당 65.6토큰입니다.
3. 그록 4.6이 가장 잘하는 영역, 실무·법률
그록 4.6이 세 모델 중 확실히 1위를 차지한 지표는 세 개입니다.
- GDPVal-AA v2(실무 업무 처리) 1753점: 2위 클로드 페이블 5 맥스(1741점)와도 격차가 있고, 전작 그록 4.5(1526점) 대비로는 227점, 약 14.9% 올랐습니다.
- AA-브리프케이스(지식노동) 1577점: 클로드 페이블 5 맥스(1574점)를 근소하게 앞섰습니다.
- Harvey LAB(법률 분야) 15.8%: GPT-5.6 솔 맥스(2.5%)의 6배가 넘는 점수로, 세 모델 중 격차가 가장 큰 지표입니다.
세 지표 모두 코딩보다는 문서 작성, 자료 조사, 법률·비즈니스 자문 성격의 업무에 가깝습니다. xAI가 이번 그록 4.6을 “장시간 이어지는 에이전트 작업과 지식노동에 초점을 맞췄다”고 설명한 것과 실제 벤치마크 결과가 맞아떨어지는 대목입니다.
4. 그록 4.6이 아직 밀리는 영역, 코딩·터미널
반대로 개발 관련 지표에서는 세 모델 중 가장 낮은 점수를 받은 경우가 많습니다.
- Terminal-Bench v3.0 26%: GPT-5.6 솔 맥스(34.6%), 클로드 페이블 5 맥스(34.1%)와 8%p 이상 차이가 납니다. 셸 명령어를 직접 실행하며 문제를 해결하는 유형의 작업에서는 아직 약점이 뚜렷합니다.
- DeepSWE v1.1 65.9%: GPT-5.6 솔 맥스(73%)보다 7.1%p 낮습니다. 전작 그록 4.5(54%) 대비로는 11.9%p 올랐지만, 경쟁 모델과의 격차를 완전히 좁히지는 못했습니다.
- FrontierCode v1.1 61.3%, APEX-SWE 56.4%: 두 지표 모두 클로드 페이블 5 맥스가 가장 높았고, 그록 4.6은 GPT-5.6 솔 맥스와 비슷하거나 조금 낮은 수준입니다.
정리하면 자율적으로 터미널을 조작하며 긴 코딩 세션을 이어가는 용도라면 아직 GPT-5.6 솔 맥스나 클로드 페이블 5 맥스가 더 안정적인 선택지입니다.
5. 그록 4.5 대비 얼마나 좋아졌나
이번 업데이트는 완전히 새로 학습한 모델이 아니라, 그록 4.5와 같은 기반 위에서 추가 학습을 거친 버전입니다. 정확한 파라미터 수는 xAI가 공식 공개하지 않았지만, 업계에서는 그록 4.5와 동일한 약 1.5조 규모 기반으로 추정하고 있습니다.
| 벤치마크 | 그록 4.5 | 그록 4.6 | 변화 |
|---|---|---|---|
| AA 인텔리전스 인덱스 | 56 | 61 | +5점 |
| GDPVal-AA v2 | 1526 | 1753 | +227 |
| AA-브리프케이스 | 1313 | 1577 | +264 |
| Terminal-Bench v3.0 | 15.7% | 26% | +10.3%p |
| DeepSWE v1.1 | 54% | 65.9% | +11.9%p |
| APEX-Agents | 47.1% | 57.5% | +10.4%p |
| CursorBench v3.2 | 66.7% | 69.9% | +3.2%p |
| Harvey LAB | 12.9% | 15.8% | +2.9%p |
전 지표에서 예외 없이 상승했고, 특히 에이전트 관련 지표(APEX-Agents, Terminal-Bench)의 상승폭이 큽니다. xAI는 그록 4.5로 SFT(지도 미세조정) 학습 데이터를 직접 재생성하고, 모델 기반 검증으로 품질이 낮은 데이터를 걸러낸 뒤 추가 학습했다고 밝혔습니다.
6. 컨텍스트 윈도우와 실제 사용 경로
| 항목 | 그록 4.6 | GPT-5.6 솔 맥스 | 클로드 페이블 5 맥스 |
|---|---|---|---|
| 컨텍스트 윈도우 | 500,000토큰 | 1,050,000토큰 | 1,000,000토큰 |
| 입력 형태 | 텍스트, 이미지 | 텍스트, 이미지 | 텍스트, 이미지 |
| 출력 형태 | 텍스트 전용 | 텍스트 전용 | 텍스트 전용 |
| 지식 컷오프 | 2026년 2월 1일 | 비교 자료 기준 미확인 | 비교 자료 기준 미확인 |
컨텍스트 윈도우만 놓고 보면 그록 4.6이 세 모델 중 가장 좁습니다. 긴 문서나 대규모 코드베이스 전체를 한 번에 넣어야 하는 작업이라면 이 부분을 감안해야 합니다.
접근 경로는 발표 당일부터 xAI API(모델 ID grok-4.6), 커서(Cursor), xAI 자체 코딩 도구인 그록 빌드(Grok Build), X의 그록 봇에서 이용 가능하며, 오픈라우터(OpenRouter)·버셀(Vercel)·클라우드플레어(Cloudflare) 등 서드파티 플랫폼에도 함께 풀렸습니다. 오픈 웨이트는 공개되지 않아 자체 서버에 직접 올려 구동하는 방식은 지원하지 않습니다.
7. 그래서 언제 그록 4.6을 골라야 할까
벤치마크를 종합하면 용도에 따라 답이 갈립니다.
- 에이전트 기반 리서치, 문서 작업, 법률·비즈니스 자문 챗봇: 그록 4.6이 실무 지표(GDPVal-AA v2, AA-브리프케이스, Harvey LAB)에서 세 모델 중 가장 높은 점수를 받았고, 가격도 가장 저렴해 비용 대비 효율이 좋습니다.
- 터미널을 직접 조작하는 자율 코딩 에이전트, 대규모 리팩터링: Terminal-Bench와 DeepSWE 점수가 낮은 만큼, 아직은 GPT-5.6 솔 맥스나 클로드 페이블 5 맥스가 더 안정적입니다.
- 가격보다 원시 지능 점수 자체가 우선: AA 인텔리전스 인덱스 62점으로 세 모델 중 가장 높은 클로드 페이블 5 맥스가 앞섭니다. 다만 입력 기준 그록 4.6 대비 5배, 출력 기준 약 8배 비쌉니다.
FAQ
Q. 그록 4.6은 무료로 쓸 수 있나요? X 앱 안의 그록 봇으로는 요금제에 따라 일부 무료 사용이 가능하지만, API·커서·그록 빌드에서 본격적으로 쓰려면 앞서 정리한 토큰당 요금이 그대로 청구됩니다. 그록 빌드는 출시 첫 주 한정으로 2배 사용량을 제공하는 프로모션을 진행했습니다.
Q. 그록 4.6과 그록 4.5의 가장 큰 차이는 무엇인가요? 완전히 새로운 아키텍처가 아니라 같은 기반 모델 위에 추가 학습을 거친 버전입니다. 다만 전 벤치마크에서 예외 없이 점수가 올랐고, 특히 에이전트 작업과 실무 처리 관련 지표의 상승폭이 큽니다.
Q. 그록 4.6이 코딩에 약하다는데 실제로 못 쓸 정도인가요? 못 쓸 정도는 아닙니다. CursorBench에서는 69.9%로 GPT-5.6 솔 맥스(67.2%)보다 오히려 높습니다. 다만 셸 명령어를 자율적으로 실행하는 Terminal-Bench나 대규모 소프트웨어 엔지니어링 작업(DeepSWE)에서는 상대적으로 약한 편이라는 뜻입니다.
Q. 한국에서 그록 4.6 API를 바로 쓸 수 있나요? 네. 별도의 지역 제한 발표는 없었고, xAI API 콘솔과 오픈라우터 등 서드파티 플랫폼을 통해 접근할 수 있습니다. 다만 정확한 이용 약관과 결제 방식은 가입 시점에 xAI 공식 페이지에서 다시 확인하는 것이 안전합니다.
마무리
숫자로만 보면 그록 4.6은 “만능 1위”가 아니라 “가격 대비 실무형” 모델에 가깝습니다. 코딩 자동화 비중이 높은 팀이라면 여전히 GPT-5.6 솔 맥스나 클로드 페이블 5 맥스 쪽 벤치마크를 함께 참고하는 편을 권합니다.
이 글은 정보 제공 목적으로 작성했으며, xAI·OpenAI·Anthropic 등 언급된 기업과 무관한 devlogbase의 자체 비교 분석 글입니다. 벤치마크 점수와 가격 정보는 Artificial Analysis 및 xAI 공식 발표, 관련 매체 보도를 근거로 2026년 8월 21일 기준으로 작성했습니다. 벤치마크 점수는 측정 방식과 시점에 따라 달라질 수 있고 실제 사용 경험과 차이가 있을 수 있으니, 모델 도입 전에는 각 서비스의 공식 문서에서 최신 가격과 성능 지표를 다시 확인하시기 바랍니다.


Leave a comment