통찰력 있는 사람들이 함께하는 젊고 열정적인 IT 기업, 비젠메디컬.
그록 4.7 출시, 단가는 그대로인데 작업당 비용은 왜 늘까 - 개발팀에서 AI 코딩 도구 도입을 검토하던 한 개발자가 최근 이상한 경험을 했다는 이야기를 전한 적이 있다. 새 모
---
개발팀에서 AI 코딩 도구 도입을 검토하던 한 개발자가 최근 이상한 경험을 했다는 이야기를 전한 적이 있다. 새 모델로 바꿨는데 토큰 단가표를 봐도 이전과 똑같았고, 그래서 이번 달 청구서도 비슷할 거라 예상했지만 실제로는 한 달 사용 금액이 눈에 띄게 늘어 있었다는 것이다. 원인을 찾다 보니 단가가 오른 게 아니라 모델이 한 번 답을 낼 때 쓰는 토큰(AI가 글을 읽고 쓰는 최소 단위로, 한국어 기준 한 글자 안팎이라고 이해하면 된다) 자체가 늘어난 것이 원인이었다.
2026년 9월 21일(미국 시간) SpaceXAI(xAI)가 코딩·에이전트·전문 지식 작업에 특화한 새 플래그십 모델 그록 4.7을 공개하면서, 정확히 이런 궁금증을 가질 독자가 늘어날 것으로 보인다. API 단가표만 보면 그록 4.6과 100% 동일하다. 그런데 실제 업무에 투입해보면 체감 비용이 달라지는 경우가 생긴다. 이 글은 "왜 단가는 그대로인데 실제 지출은 달라질 수 있는가"라는 질문 하나에 집중해, 단가 구조와 추론 강도, 그리고 과제당 실제 토큰 사용량까지 함께 짚어본다. 그록 4.7을 도입할지 고민 중인 개발자나 코딩 AI 예산을 관리해야 하는 담당자라면, 이 글에서 실제로 비용을 통제할 수 있는 조절 지점을 확인할 수 있다.

토큰 단가표는 "1개당 가격"일 뿐, 실제 청구액은 "가격 × 사용량"으로 결정된다. 이 단순한 곱셈 구조를 놓치면 그록 4.7의 가격 정책을 오해하기 쉽다. xAI 공식 문서(docs.x.ai) 기준으로 그록 4.7의 API 모델 ID는 grok-4.7이며, 입력이 20만 토큰 미만일 때 100만 토큰당 입력 2달러, 캐시 입력 0.5달러, 출력 6달러로 책정돼 있다. 이는 그록 4.6과 완전히 같은 숫자다. 즉 xAI 입장에서는 "가격 인상 없이 성능만 올렸다"는 메시지를 전달하려는 구조로 읽힌다.
문제는 컨텍스트(한 번에 읽을 수 있는 입력 분량)가 50만 토큰까지 지원되고, 추론 강도가 low·medium·high(기본)·xhigh 4단계로 나뉘면서 같은 작업이라도 모델이 실제로 소비하는 토큰 양이 달라질 수 있다는 점이다. 추론 강도란 답을 내기 전에 모델이 얼마나 오래, 얼마나 깊게 생각할지 정하는 설정으로 이해하면 된다. 강도를 높이면 정확도는 올라가지만 그만큼 모델이 내부적으로 더 많은 출력 토큰을 소모하게 되고, 출력 토큰은 입력 토큰보다 단가 자체가 3배(100만 토큰당 6달러 대 2달러) 높기 때문에 비용에 미치는 영향이 크다.
여기에 더해 입력이 20만 토큰을 넘어가는 순간 단가 자체가 두 배로 뛴다. 입력 4달러, 캐시 1달러, 출력 12달러로 오르는 구조다. 긴 코드베이스나 긴 문서를 통째로 넣는 작업이라면 이 구간을 넘나드는지 여부가 비용에 직접 영향을 준다. 결국 그록 4.7의 비용을 정확히 이해하려면 "단가표"가 아니라 "추론 강도 설정 값"과 "입력 길이가 20만 토큰을 넘는지 여부", 그리고 "과제당 실제 출력 토큰 수"라는 세 가지 변수를 함께 봐야 한다.

그록 4.7의 API 단가는 입력 길이 기준 20만 토큰을 경계로 2단계 구조로 나뉜다. 이 기준선을 넘느냐 넘지 않느냐에 따라 같은 작업이라도 청구액이 완전히 달라질 수 있어, 실제 작업 규모를 이 기준에 맞춰 설계하는 것이 비용 관리의 출발점이 된다.
먼저 20만 토큰 미만 구간을 보면, 100만 토큰당 입력 2달러, 캐시 입력 0.5달러, 출력 6달러다. 캐시 입력이란 이전에 이미 처리한 내용을 다시 보낼 때 저렴하게 처리해주는 구간으로, 같은 코드베이스나 문서를 반복해서 참조하는 작업에서 비용을 절감하는 핵심 레버가 된다. 반복 질의가 많은 코딩 에이전트 작업이라면 캐시 입력 활용 여부만으로도 체감 비용이 크게 달라질 수 있다.
다음으로 20만 토큰을 초과하는 구간을 보면, 입력 4달러, 캐시 1달러, 출력 12달러로 정확히 두 배가 된다. 대형 저장소 전체를 한 번에 읽히거나, 긴 설계 문서·API 명세서를 통째로 입력하는 작업에서는 이 경계를 의식하지 않으면 예상보다 훨씬 큰 비용이 청구될 수 있다.
마지막으로 속도를 두 배로 높인 그록 4.7 Fast가 별도로 존재한다는 점도 짚어야 한다. 이 모델은 토큰 단가도 정확히 두 배이며, 무엇보다 공개된 xAI API로는 쓸 수 없고 커서(Cursor)와 그록 빌드라는 특정 플랫폼 안에서만 이용 가능하다. 자체 서비스에 API를 직접 연동해 쓰려는 개발자라면 그록 4.7 Fast는 선택지에서 제외되고, 표준 grok-4.7만 이용할 수 있다는 점을 미리 확인해둘 필요가 있다.
| 구분 | 20만 토큰 미만 | 20만 토큰 초과 | 그록 4.7 Fast |
|---|---|---|---|
| 입력 (100만 토큰당) | $2 | $4 | 표준 단가의 2배 |
| 캐시 입력 (100만 토큰당) | $0.5 | $1 | 표준 단가의 2배 |
| 출력 (100만 토큰당) | $6 | $12 | 표준 단가의 2배 |
| 이용 경로 | 공개 API | 공개 API | 커서·그록 빌드 전용 |

추론 강도를 xhigh로 올리면 정확도는 올라가지만, 그만큼 출력 토큰 사용량이 크게 늘어나 비용도 함께 오른다. 이는 그록 4.7만의 특성이 아니라 추론형 AI 모델 전반의 구조이지만, 독립 평가기관 Artificial Analysis가 측정한 수치를 보면 그 폭이 구체적으로 드러난다.
Artificial Analysis 평가에 따르면 그록 4.7(xhigh 강도)은 과제당 출력 토큰이 약 8만 1천 개로 집계됐다. 이는 그록 4.6의 약 3만 8천 개와 비교하면 두 배가 넘는 수치이고, 같은 평가에서 측정된 GPT-6 아스트라의 약 2만 7천 개와 비교하면 세 배 수준에 달한다. 출력 토큰 단가가 20만 토큰 미만 기준 100만 토큰당 6달러라는 점을 고려하면, 과제당 출력 토큰이 두 배 이상 늘어난다는 것은 곧 같은 작업 한 건을 처리하는 데 드는 실제 비용도 그만큼 늘어난다는 뜻이 된다.
실제로 이 평가에서 그록 4.7의 지수 산출 비용은 과제당 약 3.74달러로 집계됐다. 이 수치는 단가가 오른 결과가 아니라, 같은 단가에서 더 많은 토큰을 소비한 결과라는 점을 분명히 해둘 필요가 있다. xAI는 이번 개선점으로 더 큰 베이스 모델, 더 길고 어려운 과제 위주의 강화학습, 자기 검증 강화를 꼽았는데, 자기 검증을 강화한다는 것은 모델이 답을 내기 전에 스스로 한 번 더 점검하는 과정을 늘린다는 의미이고, 이 과정 자체가 추가 출력 토큰으로 이어진다.
여기서 실무적으로 중요한 판단 포인트가 나온다. 모든 작업에 xhigh를 쓸 필요는 없다는 점이다.
간단한 코드 리뷰나 짧은 리팩터링 작업이라면 low나 medium 강도로도 충분한 경우가 많고, 복잡한 에이전트형 작업이나 긴 디버깅 세션처럼 정확도가 중요한 작업에만 high 이상을 선택적으로 적용하는 방식이 비용 관리 측면에서 합리적이다. 추론 강도는 작업 난이도에 맞춰 조절하는 다이얼이지, 항상 최대치로 고정해두는 옵션이 아니라는 점을 기억할 필요가 있다.

코딩 관련 점수가 오른 것은 사실이지만, 이 점수는 xAI 자체 측정이라는 점과 비용 증가가 함께 발생했다는 점을 같이 봐야 균형 잡힌 판단이 가능하다. xAI가 발표한 세 가지 코딩 벤치마크(코딩 과제 모음 시험) 결과를 보면 그록 4.7의 개선폭이 상당히 크게 나타난다.
CursorBench 4.0에서는 46.3%를 기록해 그록 4.6의 40.4%보다 올랐고, DeepSWE v1.1에서는 high 추론 기준 71.0%로 그록 4.6의 65.2%보다 상승했으며, Terminal-Bench 4.0에서는 37.6%로 그록 4.6의 20.3%보다 큰 폭으로 올랐다. 다만 이 세 지표는 모두 xAI 자체 발표 수치이므로, 제3자가 동일 조건에서 재현했을 때도 동일한 격차가 나올지는 별도로 확인이 필요한 부분이다.
한편 독립 평가기관 Artificial Analysis가 측정한 종합 지능 지수는 46점(xhigh 기준)으로 그록 4.6의 44점보다 2점 오르는 데 그쳤다. 같은 평가에서 선두권인 GPT-6 아스트라와 클로드 페이블 5.1은 각각 53점을 기록해, 종합 지능 지수만 놓고 보면 그록 4.7이 선두 그룹과는 여전히 격차가 있는 것으로 나타났다. 반면 코딩 에이전트 지수는 47점에서 56점으로 크게 올라, "종합적인 범용 능력"보다는 "코딩·에이전트 작업에 특화된 개선"이라는 성격이 뚜렷하게 드러난다.
실무 문서 작업을 평가하는 GDPval 지수에서는 1695 Elo를 기록해 그록 4.6보다 90점 올랐고, 같은 평가에서 클로드 페이블 5.1(1735 Elo)에 이어 2위로 보도됐다. 이 지표 역시 xAI가 발표한 수치이며, 특정 업무 영역에서의 상대적 위치를 보여줄 뿐 절대적인 우열을 단정하는 근거로 보기는 어렵다.
여기서 짚어야 할 균형점은 이렇다. 코딩·에이전트 작업 점수는 눈에 띄게 올랐지만, 그 개선이 과제당 출력 토큰 증가(약 8만 1천 개, 그록 4.6 대비 두 배 이상)를 동반했다는 점이다. 결국 "점수가 오른 만큼 비용도 오를 수 있다"는 전제를 깔고 도입 여부를 검토하는 것이 합리적이며, 단순히 벤치마크 점수표만 보고 도입을 결정하면 실제 청구액에서 예상과 다른 결과를 마주할 수 있다.


Artificial Analysis 측정 기준으로 그록 4.7은 모르는 질문에 지어내 답하는 비율(환각률)이 34%에서 29%로 줄었지만, 정답률은 48%에서 47%로 거의 비슷한 수준을 유지했다. 이 조합은 비용 판단에도 참고할 만한 신호를 준다. 코딩 에이전트 작업에서는 모델이 모르는 것을 아는 것처럼 지어내는 오류가 치명적인 버그로 이어지기 쉬운데, 환각률이 줄었다는 것은 최소한 이 위험이 다소 완화됐다는 뜻으로 해석할 수 있다.
다만 정확도 자체는 크게 개선되지 않았다는 점도 함께 봐야 한다. 즉 "더 정확해졌다"기보다는 "모르는 걸 모른다고 인정하는 비율이 늘었다"는 쪽에 가까운 변화다. 코딩 작업에서는 이런 변화가 실질적으로 유용할 수 있다. 확신 없는 답을 지어내는 대신 재질의를 유도하거나 추가 정보를 요청하는 방향으로 작동한다면, 결과적으로 디버깅 시간을 줄이는 효과로 이어질 가능성이 있기 때문이다.
이런 흐름은 업계 전반에서 나타나는 추세와도 맞닿아 있다. 최근 출시되는 대형 모델들이 공통적으로 "정확도 자체를 극적으로 끌어올리기"보다 "모르는 것을 인정하는 능력"과 "특정 도메인(코딩·에이전트·문서 작업)에서의 실행력"에 집중하는 경향을 보이고 있다는 점이다. 그록 4.7 역시 종합 지능 지수(46점)는 소폭 상승에 그친 반면 코딩 에이전트 지수(47점→56점)는 크게 오른 것이 이런 흐름을 보여주는 사례로 볼 수 있다. 범용 성능을 끌어올리는 경쟁보다 특정 작업 영역에서의 실전 활용도를 높이는 쪽으로 개발 방향이 세분화되고 있다는 뜻이다.

단가는 완전히 동일하지만 과제당 실제 사용 토큰량에서 두 모델의 차이가 명확히 갈린다. 아래 비교를 보면 왜 "단가가 같다"는 말이 "비용이 같다"는 뜻이 될 수 없는지가 드러난다.
| 구분 | 그록 4.6 | 그록 4.7 |
|---|---|---|
| API 단가(20만 토큰 미만) | 입력 $2·캐시 $0.5·출력 $6 | 입력 $2·캐시 $0.5·출력 $6 (동일) |
| 과제당 출력 토큰(xhigh 기준) | 약 3만 8천 개 | 약 8만 1천 개 |
| AA 종합 지능 지수 | 44점 | 46점 |
| CursorBench 4.0 | 40.4% | 46.3% |
| Terminal-Bench 4.0 | 20.3% | 37.6% |
이 표에서 확인할 수 있는 핵심은 단가 행은 완전히 같지만 출력 토큰 행에서 두 배 이상 차이가 난다는 점이다. 코딩 점수가 오른 것은 긍정적인 변화지만, 그 대가로 과제당 소비 토큰이 늘어난 것도 함께 고려해야 하는 트레이드오프 관계에 있다. 도입을 검토할 때는 "단가표가 같으니 비용도 같겠지"라는 가정을 버리고, 실제 사용 패턴에서 추론 강도를 얼마나 쓸지, 입력 길이가 20만 토큰 경계를 얼마나 자주 넘나들지를 함께 시뮬레이션해보는 것이 정확한 예산 산정에 가깝다.

그록 4.7 도입을 검토할 때 가장 먼저 확인해야 할 것은 벤치마크 점수가 아니라 "우리 작업의 평균 입력 길이"와 "요구되는 추론 강도"다. 이 두 가지를 먼저 파악하지 않고 점수표만 보고 도입을 결정하면, 실제 청구서를 받아본 뒤 예상과 다른 결과를 마주하기 쉽다.
먼저 흔히 저지르는 실수 중 하나는 모든 요청에 xhigh 강도를 기본값으로 고정해두는 것이다. 짧고 단순한 작업까지 최고 강도로 처리하면 정확도 개선폭 대비 비용 증가폭이 비효율적으로 커질 수 있다. 반대로 복잡한 리팩터링이나 멀티스텝 에이전트 작업에 low 강도를 쓰면 결과물 품질이 떨어져 재작업이 늘어나고, 결과적으로 총비용이 더 커지는 역효과가 날 수도 있다.
다음으로 20만 토큰 경계를 의식하지 않고 대형 저장소나 긴 문서를 그대로 통째로 입력하는 경우도 흔한 실수에 속한다. 입력을 나눠서 캐시 입력을 활용하거나, 꼭 필요한 부분만 발췌해 전달하는 방식으로 재설계하면 20만 토큰 초과 구간(입력·캐시·출력 단가가 모두 두 배)에 걸리는 빈도를 줄일 수 있다.
또한 GitHub 코파일럿 Pro·Pro+·Max·Business·Enterprise 요금제에 그록 4.7이 순차 적용되고 있으며, 기업 관리자는 모델 정책에서 이를 끌 수 있다는 점도 실무적으로 중요하다. 조직 단위로 AI 코딩 도구를 운영하고 있다면, 특정 모델을 팀 전체에 일괄 허용하기보다 작업 성격별로 모델·추론 강도 접근 권한을 세분화해 관리하는 방식이 비용 통제에 유리하다. 벤치마크 점수만으로 도구를 선택하기보다, 실제 업무에서 반복되는 작업 유형을 먼저 분류한 뒤 그에 맞는 추론 강도와 입력 설계를 적용하는 접근이 결과적으로 더 안정적인 비용 관리로 이어진다.

그록 4.7을 실제 업무에 투입하기 전 아래 순서로 점검하면 예상치 못한 비용 증가를 크게 줄일 수 있다.
1. 현재 작업 유형을 난이도별로 분류한다 — 단순 코드 스타일 정리, 일반 버그 수정, 복잡한 아키텍처 설계·멀티스텝 에이전트 작업으로 나눠본다
2. 난이도별로 추론 강도를 다르게 배정한다 — 단순 작업은 low·medium, 복잡한 작업만 high·xhigh로 제한한다
3. 입력 길이를 20만 토큰 기준으로 사전 측정한다 — 대형 저장소나 긴 문서를 넣기 전에 토큰 수를 가늠해 경계를 넘는지 확인한다
4. 반복 참조되는 코드·문서는 캐시 입력 구조로 설계한다 — 매번 새로 입력하지 않고 캐시를 활용해 단가를 낮춘다
5. 도입 초기 일정 기간은 소규모로 시범 운영하며 실제 청구 데이터를 수집한다 — 벤치마크 점수가 아니라 실측 비용으로 최종 판단한다
6. 조직 단위 운영이라면 관리자 정책에서 모델·강도 접근 권한을 팀별로 세분화한다 — GitHub 코파일럿 등 플랫폼의 관리자 설정을 활용한다

추론 강도와 입력 길이를 작업 성격에 맞게 조절하는 전제하에서라면, 그록 4.7이 제공하는 코딩·에이전트 성능 개선을 비용 부담을 통제하며 활용할 여지가 있다. CursorBench·DeepSWE·Terminal-Bench에서 나타난 점수 향상은 xAI 자체 측정이라는 한계는 있지만, 복잡한 코딩·터미널 작업에서 체감 가능한 실행력 개선으로 이어질 가능성을 보여준다.
다만 이 기대 효과는 "무조건 xhigh로 모든 작업을 처리한다"는 전제가 아니라 "작업 난이도에 맞춰 강도를 조절한다"는 전제 위에서만 성립한다. 과제당 출력 토큰이 그록 4.6 대비 두 배 이상 늘어날 수 있다는 사실을 무시한 채 도입하면 벤치마크 점수만큼의 체감 만족도를 얻지 못한 채 비용만 늘어날 위험이 있다. 결국 도구 자체의 성능과, 그 도구를 어떻게 운영하느냐 하는 문제는 별개이며, 후자를 설계하는 과정에서 실질적인 가치가 결정된다.

Q1. 그록 4.7 API 단가가 그록 4.6과 완전히 같다는데, 그럼 비용도 그대로인가요?
단가 자체는 20만 토큰 미만 기준 입력 2달러·캐시 0.5달러·출력 6달러로 동일하다. 다만 Artificial Analysis 측정 기준 과제당 출력 토큰이 약 8만 1천 개로 그록 4.6(약 3만 8천 개)보다 두 배 이상 늘어, 실제 청구액은 사용 패턴에 따라 달라질 수 있다.
Q2. 그록 4.7 Fast를 API로 직접 연동해서 쓸 수 있나요?
불가능하다. 그록 4.7 Fast는 속도가 두 배 빠르고 단가도 두 배지만, 공개된 xAI API로는 제공되지 않고 커서(Cursor)와 그록 빌드에서만 이용할 수 있다.
Q3. 입력이 20만 토큰을 넘으면 정확히 얼마나 비싸지나요?
입력·캐시·출력 단가가 모두 정확히 두 배가 된다. 20만 토큰 미만에서는 입력 2달러·캐시 0.5달러·출력 6달러지만, 초과 시 입력 4달러·캐시 1달러·출력 12달러로 전환된다.
Q4. 코딩 점수가 올랐다는 CursorBench 등의 수치는 믿을 수 있나요?
CursorBench, DeepSWE, Terminal-Bench 수치는 모두 xAI 자체 측정 결과다. 반면 종합 지능 지수와 과제당 토큰 사용량은 독립 평가기관 Artificial Analysis가 측정한 수치로, 두 출처를 구분해 참고하는 것이 균형 잡힌 판단에 도움이 된다.
Q5. GitHub 코파일럿에서 그록 4.7을 강제로 써야 하나요?
그렇지 않다. Pro·Pro+·Max·Business·Enterprise 요금제에 순차 적용되지만, 기업 관리자는 모델 정책 설정에서 그록 4.7 사용을 끌 수 있다.
---
그록 4.7은 단가표만 보면 이전 모델과 차이가 없지만, 실제 비용은 추론 강도와 입력 길이, 그리고 과제당 소비되는 토큰량에 따라 달라진다. 이 구조를 이해하고 작업 유형별로 설정을 조절하는 것이 코딩 AI 도입 비용을 통제하는 실질적인 방법이다. 2026년 9월 발표 기준 수치이며, 가격 정책과 벤치마크 순위는 이후 변동될 수 있다는 점도 함께 참고할 필요가 있다.
상담요청