그록 4.7 출시, 오퍼스 5 코딩 점수 따라잡고 가격은 절반
일론 머스크가 2026년 9월 22일(한국 시간) 자신의 X 계정에 “Grok 4.7”이라는 짧은 글과 함께 커서벤치(CursorBench) 4.0 점수-비용 그래프를 올렸습니다. 그래프에서 그록 4.7은 앤트로픽 오퍼스 5와 거의 같은 점수를 받으면서도 작업당 비용은 절반 수준으로 표시됩니다. 그록 4.7이 어떤 모델이고 실제 벤치마크 수치와 사용자 반응은 어땠는지 정리했습니다.
일론 머스크가 X에 게시한 커서벤치 4.0 점수 대비 작업당 평균 비용 그래프. 자료 제공 : 일론 머스크 X 게시물
그록 4.7이란 무엇인가
그록 4.7은 일론 머스크의 AI 기업 스페이스XAI(SpaceXAI, 옛 xAI)가 2026년 9월 21일(미국 시간) 공개한 코딩 에이전트 중심 언어모델입니다. 공식 모델 카드에 따르면 그록 4.7은 코딩, 엔지니어링, 사무·지식 작업처럼 길고 어려운 에이전트형 작업에 강점을 두고 학습됐고 커서(Cursor)의 익명화된 워크플로 데이터를 추가로 학습해 코딩 에이전트 성능을 끌어올렸습니다.
지식 컷오프는 2026년 6월이며 일부 보충 데이터는 8월까지 반영됐습니다. 텍스트 입출력에 이미지 입력을 지원하고, 스페이스XAI API와 자체 터미널 코딩 에이전트인 그록 빌드(Grok Build), 커서 전 플랜, 워드·파워포인트·엑셀용 오피스 애드인, OpenRouter·Vercel·Cloudflare·스노우플레이크·데이터브릭스 등 모델 게이트웨이에서 바로 사용할 수 있습니다. X 앱 안에서 쓰는 그록 봇 연동은 추후 예정이라고 안내합니다.
일론 머스크는 같은 날 올린 다른 글에서 “그록 4.7이 에이전트 코딩 부문에서 스페이스XAI를 앤트로픽과 오픈AI에 이어 3위에 올려놨다”라며 “속도가 훨씬 빠르고 비용이 낮다는 점을 감안하면 일상적으로 쓰기 좋은 선택”이라고 적었습니다.
커서벤치 4.0 점수, 오퍼스 5 절반 가격으로 근접
머스크가 공개한 그래프의 기준인 커서벤치 4.0은 커서 개발사가 2026년 9월 10일 새로 내놓은 벤치마크입니다. 커서의 리드 개발자 리롭(leerob)은 당시 X에서 “지시 사항을 얼마나 잘 따르는지, 어려운 프로젝트를 시간이 지나도 잘 처리하는지를 보는 과제를 새로 넣었고 난이도도 올려서 모든 모델의 점수가 이전보다 낮게 나온다”라고 설명했습니다.
X 사용자들이 공유한 세부 수치를 보면 이 그래프의 격차가 더 뚜렷합니다. xhigh(최고 추론 강도) 설정 기준으로 그록 4.7은 46.3퍼센트, 작업당 6.01달러, 출력 토큰 약 7만 개, 88단계를 기록했습니다. 반면 오퍼스 5 맥스는 46.6퍼센트로 근소하게 앞섰지만 작업당 11.95달러, 토큰 약 8만 5천 개, 106단계가 들었습니다. GPT-5.6 솔 맥스는 41.7퍼센트, 8.23달러로 두 모델보다 점수와 비용 모두 낮은 자리에 있었습니다.
그록 4.7의 가격 자체는 이전 버전인 4.6과 동일하게 유지됐습니다. 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러이고 캐시가 걸린 입력은 100만 토큰당 0.5달러로 더 싸집니다. 커서 안에서 쓸 수 있는 컨텍스트 창도 그록 4.6 때는 25만 6천 토큰으로 제한됐지만 그록 4.7부터는 원래 모델이 가진 50만 토큰을 커서에서도 그대로 쓸 수 있게 됐습니다.
아티피셜 애널리시스 지능 지수에서는 아직 격차가 있다
머스크의 그래프가 코딩 한 영역만 보여준다면, 독립 평가 기관 아티피셜 애널리시스(Artificial Analysis)는 더 넓은 범위의 지표를 공개했습니다. 이 기관은 그록 4.7이 자체 지능 지수(Intelligence Index)에서 46점을 받아 그록 4.6보다 2점 올랐고 스페이스XAI를 상위 4대 AI 랩 반열에 올려놨다고 평가했습니다.
아티피셜 애널리시스가 발표한 지능 지수(위)와 코딩 에이전트 지수(아래) 순위. 자료 제공 : Artificial Analysis X 게시물
세부적으로는 장기 에이전트형 지식 작업을 재는 자체 비공개 벤치마크 AA-브리프케이스(AA-Briefcase)에서 그록 4.6(high) 대비 111 엘로가 오른 1657 엘로를 받아 클로드 오퍼스 5, 클로드 페이블 5.1과 같은 최상위권에 들었다고 평가했습니다. 업무 대행 성능을 보는 GDPval-AA에서도 1695 엘로로 그록 4.6보다 90점 높았습니다.
각 모델이 자기 개발사의 전용 도구로 코딩하는 상황을 재는 코딩 에이전트 지수(Coding Agent Index)에서는 그록 4.7과 그록 빌드 조합이 56점으로 그록 4.6보다 9점 올라 4위에 올랐습니다. 다만 순위표 자체는 여전히 클로드 페이블 5.1, GPT-6 아스트라, 클로드 오퍼스 5가 위에 있어 코딩 에이전트 부문에서도 최상위권과는 차이가 남아 있습니다.
다른 항목에서는 개선과 후퇴가 함께 나타났습니다. 터미널벤치(Terminal-Bench) 4.0은 4.5퍼센트포인트, GDP.pdf는 3.0퍼센트포인트 올랐지만 장문 맥락을 다루는 AA-LCR은 3.7퍼센트포인트, 자동화 작업을 보는 AutomationBench-AA는 1.1퍼센트포인트 내려갔습니다. 아티피셜 애널리시스는 그록 4.7이 지능 지수 과제 하나당 평균 약 8만 1천 개의 출력 토큰을 쓴다고도 밝혔는데 이는 그록 4.6(high)의 3만 6천 개보다 125퍼센트, GPT-6 아스트라(max)의 2만 7천 개보다 196퍼센트 많은 수치입니다. 점수가 오른 대신 답을 내는 데 쓰는 토큰 양도 함께 늘어난 셈입니다.
스페이스XAI가 공개한 자체 모델 카드에서는 다른 코딩 벤치마크 수치도 확인할 수 있습니다. 딥스웨(DeepSWE) v1.1은 71.0퍼센트(high)로 GPT-5.6 솔의 72.7퍼센트에 근접했고 터미널벤치 4.0은 xhigh 기준 38.0퍼센트로 그록 4.6의 20.3퍼센트보다 크게 올랐습니다. 프런티어SWE V2는 29.0퍼센트(4.6은 25.3퍼센트), SWE-마라톤 v1.1은 46.0퍼센트(4.6은 31.9퍼센트)로 나타났습니다.
실제 사용 후기는 엇갈렸다
발표 직후 X에서는 실제 사용 경험을 두고 반응이 갈렸습니다. 한 사용자는 그록 빌드와 커서에서 그록 4.7 xHigh를 직접 돌려본 뒤 “확실히 더 빠르고 효율적으로 느껴진다”라며 커서의 컨텍스트 창 확장(25만 6천 토큰에서 50만 토큰으로)을 긍정적으로 평가했습니다. 커서벤치 세부 수치를 정리해 공유한 다른 사용자는 “오퍼스 5 맥스와 거의 같은 점수를 절반 비용으로 받았다”라며 가격 대비 성능을 강점으로 꼽았습니다.
반면 비판적인 반응도 있었습니다. 한 개발자는 “그록 4.7의 터미널벤치 4.0 점수가 형편없다”라며 “오픈AI와 앤트로픽이 코딩 모델에서 얼마나 앞서 있는지 보여준다”라고 적었습니다(다만 그록 빌드로 쓰는 것 자체는 계속 좋아한다고 덧붙였습니다). 중국어권 사용자 사이에서는 동일한 쓰리제이에스(Three.js) 로켓 발사 애니메이션 프롬프트로 그록 4.7과 문샷 AI의 키미(Kimi) K3를 비교한 영상이 화제가 됐는데 그록 4.7은 가격이 4분의 1 수준(1.59달러 대 약 6달러)이었지만 로켓 형태가 뒤틀리는 등 완성도에서 키미 K3에 밀린다는 평가를 받았습니다.
그록 4.8과 4.9는 어떻게 다를까
그록 4.7 출시 전인 9월 14일, 머스크는 한 사용자의 질문에 답하며 향후 로드맵을 짧게 언급했습니다. “그록 4.7은 오퍼스 5.0과 대략 비슷한 수준일 것이고, 5.1은 아니다. 어떤 면에서는 더 낫고 어떤 면에서는 더 못할 것이다. 멀티모달 성능을 고쳐야 한다”라고 적었고, 이어 “그록 4.8은 눈에 띄는 개선이 있을 것이고, 그록 4.9는 아스트라나 페이블 급일 가능성이 크다. 그록 5는 어떤 모델보다 나을 수도 있다. 지켜봐야 한다”라고 덧붙였습니다. 같은 날 다른 글에서는 2.5조 파라미터 규모인 그록 4.8이 새 C++ 소프트웨어 스택으로 학습을 마치고 강화학습 단계에 들어간다고도 밝혔습니다.
그록 4.7 관련 자주 묻는 질문
그록 4.7은 어디서 쓸 수 있나요?
스페이스XAI API, 자체 터미널 코딩 에이전트인 그록 빌드, 커서의 모든 플랜, 워드·파워포인트·엑셀용 오피스 애드인, OpenRouter와 Vercel, Cloudflare, 스노우플레이크, 데이터브릭스 같은 모델 게이트웨이에서 이용할 수 있습니다. X 앱 안 그록 봇 연동은 추후 제공될 예정입니다.
그록 4.7 가격은 얼마인가요?
입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러로 이전 버전인 4.6과 동일합니다. 캐시가 걸린 입력 토큰은 100만 토큰당 0.5달러로 더 저렴합니다.
그록 4.7이 클로드 오퍼스 5보다 나은가요?
코딩 작업만 보는 커서벤치 4.0에서는 오퍼스 5 맥스(46.6퍼센트)와 그록 4.7 xHigh(46.3퍼센트)의 점수 차이가 크지 않고, 비용은 그록 4.7 쪽이 절반 정도입니다. 다만 더 넓은 범위를 보는 아티피셜 애널리시스 지능 지수와 코딩 에이전트 지수에서는 오퍼스 5가 그록 4.7보다 여전히 높은 순위에 있어 항목에 따라 결과가 달라집니다.
그록 4.8과 4.9는 언제 나오나요?
정식 출시일은 공개되지 않았습니다. 일론 머스크는 그록 4.8이 눈에 띄는 성능 개선을 보일 것이고 그록 4.9는 GPT-6 아스트라나 클로드 페이블 5.1 수준에 이를 수 있다고 예고했습니다.
이 글은 2026년 9월 22일 기준 일론 머스크와 스페이스XAI, 아티피셜 애널리시스가 X에 공개한 게시물과 그록 4.7 모델 카드를 바탕으로 작성했습니다. 벤치마크 점수와 가격, 제공 범위는 이후 바뀔 수 있으므로 실제 도입 전에는 공식 발표를 다시 확인해야 합니다.
Leave a comment