새소식

300x250
AI/Grok

Grok 4.6 출시 요약 - Grok 4.6 어떤 사람에게 맞을까("코딩 1위"는 어디까지 맞나?)

  • -
728x90

안녕하세요! 갓대희입니다.

지난 글에서 Grok 4.5를 정리했다. 그때 제일 눈에 들어온 건 코딩 점수가 아니라 가격이었다.

그리고 한 달 남짓 만에 4.6이 나왔다. 가격표를 열어 보니 입력 100만 토큰당 2달러, 출력 6달러. 1편에 적었던 숫자 그대로였다.

그래서 처음엔 그냥 갈아타면 되는 후속이겠거니 하고 넘어가려 했다.

 

그런데 최근 들어 grok의 행보가 심상치 않다.

출시 당일 일론 머스크는 벌써 4.7 트윗까지 올렸다. 3~4주 안에 나온다고 한다. 여기에 최근 나온 Grok Bot까지 화제라, 그냥 지나치기 아쉬워 4.6부터 살펴보려고 한다.

이 글은 2026년 8월 13일 기준으로 작성됐다. 공식 소스: Introducing Grok 4.6 · xAI 가격 문서. 가격·사용량은 바뀔 수 있으니 공식 페이지에서 다시 확인하자.
이 글의 핵심 6가지
  • 4.6의 기본 단가는 4.5와 같은 $2/$6이다. 캐시만 $0.30에서 $0.50으로 올랐다.
  • 공식 표 안 1위는 GDPVal-AA, AA-Briefcase, Harvey LAB 세 칸이다. 이 표에는 Opus 5가 없다.
  • 독립 AA Intelligence Index는 4.6이 61, Opus 5가 63, Fable 5가 62다.
  • 공식 Terminal-Bench v3.0 26%와 AA의 v2.1 88.4%는 다른 시험이다.
  • 첫 주 Grok Build랑 Cursor는 포함 사용량이 2배다. API로 같은 대화를 오래 이어 갈 때는 prompt_cache_key를 먼저 넣자.
  • 일론의 4.7 트윗은 3~4주 안에 나오고 SpaceX 데이터로 더 학습시킨다는 말이다. 스펙이 아니다.

용어 정리

  • GDPVal: 실제 지식 노동 업무를 점수로 매기는 시험. 공식 표의 GDPVal-AA는 Artificial Analysis가 같은 과제를 다시 잰 값이다
  • Intelligence Index(지능 지수): Artificial Analysis가 여러 시험을 묶어 매기는 종합 점수
  • 추론 강도(reasoning effort): 답을 내기 전에 얼마나 오래 생각할지 고르는 값. 단계는 low / medium / high(기본) / xhigh
  • prompt_cache_key(프롬프트 캐시 키): 같은 대화라는 표시. 이 키가 있어야 앞에서 보낸 글을 할인해서 다시 쓴다
  • 컨텍스트 압축(context compaction): 긴 에이전트 대화를 짧게 줄여 다음 턴에 다시 쓰는 기능
  • 빠른 옵션(fast variant): 같은 모델의 더 비싼 저지연 옵션. SpaceXAI는 기본 단가의 2배라고 한다
  • 보충 학습(supplemental training): 기본 학습 뒤에 데이터를 더 넣어 이어 가는 추가 학습
  • 오래 돌리는 에이전트(long-running agents): 여러 단계에 걸쳐 작업을 이어 가는 에이전트. SpaceXAI는 kernel·web·CAD 같은 도메인 RL에 쓴다고 한다
  • Elo: 상대 비교로 매기는 점수. 맞힌 비율(%)과 같은 눈금이 아니다
  • permalink(원문 글 주소): 그 게시물만 가리키는 고정 링크

 

1. 4.6은 뭐가 달라졌나

SpaceXAI는 2026년 8월 12일에 4.6을 공개했다.

코딩과 에이전트, 지식 업무를 겨냥한 모델인데, 발표에서 특히 앞세운 건 오래 돌리는 에이전트와 화면 만드는 일 두 가지였다.

입력·출력 단가는 4.5와 같으니, 같은 2달러·6달러인데 뭐가 달라졌는지부터 보자.

1편과 이번 편

입력 2달러, 출력 6달러는 1편 그대로다. 달라진 건 공식 표와 독립 리더보드에서 각각 누가 1위인지, 그리고 표에 잘 안 보이는 캐시 한 줄이다.

 

4.5보다 오래 배웠다고 한다

SpaceXAI 설명으로는 4.6의 보충 학습이 4.5보다 길었다.

Grok 4.5로 대화·작업 기록(SFT)을 새로 짠 다음, kernel·web·CAD를 넣어 에이전트 강화 학습(RL)까지 돌렸다고 한다.

다만 발표문에 있는 건 여기까지다. 파라미터 수도, 학습 토큰도, 안에 넣은 데이터가 뭔지도 밝히지 않았다.

(개인적으로 실제로 사용해보면 글쓰기에 활용했을 때에는 정말 많이 부족했지만, 개발 시에 오버엔지니어링을 잘만 제어해 주면 성능, 속도 측면에서는 매우 만족스러웠다.)

 

초안 뽑는 건 나아졌다고 한다

SpaceXAI는 큰 그림만 던져도 초안을 잘 뽑고, 화면 만드는 첫 결과물이 4.5보다 낫다고 했다.

여기까지는 SpaceXAI 주장이고, 이 글에서 같은 조건으로 재현해 보진 못했다.

한 줄로 묶으면 4.6은 가격이 달라진 제품이 아니라, 같은 단가에서 에이전트를 더 오래 돌리게 만든 후속이다. SpaceXAI도 코딩을 전부 1위라고는 안 했다.

 

2. 공식 사양과 가격

모델 이름은 grok-4.6이다.

한 번에 넣을 수 있는 양은 50만 토큰까지고, 학습된 지식은 2026년 2월 1일까지다.

그림은 넣을 수 있지만 나오는 건 글뿐이라 이미지 생성은 불가능하다.

출력 길이에는 제한이 없다. 추론 강도는 답을 내기 전에 얼마나 오래 생각할지 고르는 값인데, low·medium·high·xhigh 네 단계이고 기본값은 high다. (이번에 xhigh가 추가되었다.)

항목 2026-08-13 문서 기준 같이 볼 점
모델 이름 grok-4.6 API·CLI 모두 이 ID
컨텍스트 500,000 토큰 200k를 넘는 요청은 단가가 달라진다
지식 컷오프 2026-02-01 그 이후 사건은 검색 도구에 의존
입출력 텍스트·이미지 입력 / 텍스트 출력 이미지 생성은 이 모델 카드 밖
출력 제한 없음 길수록 출력 토큰 비용이 쌓인다
추론 강도 low / medium / high(기본) / xhigh xhigh는 4.5 카드에 없던 칸

표에서 먼저 눈여겨볼 건 컨텍스트 50만이다. 이게 "50만까지 같은 값으로 쓴다"는 뜻이 아니라서, 바로 아래 단가 표와 같이 봐야 한다.

 

토큰 단가

기본 단가는 입력 100만 토큰당 $2, 출력 100만 토큰당 $6이다.

같은 모델의 저지연 옵션(fast variant)을 쓰면 그 두 배를 낸다.

여기에 200k를 넘어가면 붙는 구간이 따로 있는데, 4.5까지 같이 놓고 보면 아래와 같다.

모델·구간 입력 캐시 입력 출력
grok-4.6, 200k 미만 $2.00 $0.50 $6.00
grok-4.6, 200k 이상 $4.00 $1.00 $12.00
grok-4.5, 200k 미만 $2.00 $0.30 $6.00
grok-4.5, 200k 이상 $4.00 $0.60 $12.00

결론만 보면 입력·출력 단가는 4.5와 같은데 캐시만 $0.30 / $0.60에서 $0.50 / $1.00으로 올랐다.(출처: xAI 가격 문서)

키를 빼먹으면 할인이 안 된다

캐시는 이미 보낸 글의 앞부분을 다시 계산하지 않고 재사용하는 할인이다. 에이전트를 오래 돌릴수록 그 앞부분이 계속 반복되니까 아낄 여지도 커진다. 그런데 이 할인은 자동이 아니라서, 요청에 prompt_cache_key를 안 넣으면 할인이 그냥 안 붙고, 입력은 정가 그대로 청구된다. 붙이는 방법은 §7에 코드로 적어 뒀다.

 

Fable 5와 비교하자면

Fable 5는 입력 $10 / 출력 $50이다.

Grok 4.6은 입력 $2 / 출력 $6이니, 입력은 80%, 출력은 88% 싼 셈이다.

예를 들어 입력 100만 토큰에 출력 20만 토큰을 쓰는 작업이라면

Grok 4.6은 2 + 1.2로 $3.2,

Fable 5는 10 + 10으로 $20이다.

같은 조건에서 여섯 배 넘게 벌어진다.

두 공식 가격 페이지의 단가를 그대로 곱한 계산 예시이고, 캐시 할인과 실제 소비 토큰 차이는 뺀 값이다.

 

한 가지만 짚어 두면 이건 Fable 5와 견줬을 때의 이야기다. 4.5보다 내려간 값이 아니다.

20만을 넘기면 그 요청 전부가 비싸진다

 


컨텍스트가 50만이라고 50만 전체를 $2/$6로 쓰는 건 아니다. 프롬프트가 20만에 닿는 순간 그 요청 전부가 $4/$12로 올라간다. 이 20만에는 할인한 토큰도 들어간다. 넘어가면 캐시 단가도 $0.50에서 $1.00으로 같이 오른다.
(출처: xAI Docs — Prompt caching usage)

 

3. 어디서 쓸 수 있나

쓸 수 있는 곳은 xAI API, Grok Build(코딩 에이전트 기본 모델), Cursor 전 플랜, 그리고 OpenRouter·Vercel·Cloudflare다.

Grok Bot은 좀 애매하다. xAI 문서에는 안 나오고, 2026년 8월 12일 SpaceXAI 공식 X 계정의 출시 안내에만 들어 있다.

문서와 공지 중 어느 쪽이 최신인지는 확인하지 못해, 아래 표에는 출처를 나눠 뒀다.

사용 경로 처음 해볼 작업 따로 확인할 것
Grok Build /model에서 Grok 4.6 선택 첫 주 포함 사용량 2배
Cursor 모델 목록에서 4.6 선택 첫 주 포함 사용량 2배, 플랜별 한도
xAI API model=grok-4.6 prompt_cache_key, 200k 구간
OpenRouter·Vercel·Cloudflare 게이트웨이 모델 목록 중개 단가·한도는 각 콘솔
Grok Bot X 안내에만 있음 (개발자 문서에는 없음) 봇 자체 설정은 봇 문서

 

이름이 비슷해서 헷갈리기 쉬운데, 차이는 간단하다.

Grok 4.6은 모델 ID고 Grok Build는 그 모델을 기본값으로 쓰는 코딩 에이전트다. (클로드 코드, 코덱스라고 생각하면 된다.)

API에서 빠지기 쉬운 설정

xAI는 같은 대화를 길게 이어 갈 때 prompt_cache_key를 꼭 쓰라고 한다. Responses API는 이 키를 쓰고, Chat Completions는 x-grok-conv-id 헤더를 쓴다.

앞글을 짧게 줄이는 압축(context compaction)도 같이 보라고 하는데, 이게 자동이 아니라는 게 함정이다.

POST /v1/responses/compact를 직접 부르고, 돌려받은 항목을 다음 요청 맨 앞에 붙여야 한다.

처음 붙이는 쪽이라면 콘솔에서 키부터 받는 것보다 Grok Build 화면을 먼저 여는 게 빠르다.

구체적인 순서는 §7에 화면과 함께 적어 뒀다.

 

4. 공식 표에서 1위는 세 칸뿐이다

발표 페이지에 있는 표에는 Grok 4.6 High, Grok 4.5 High, GPT-5.6 Sol Max, Fable 5 Max 네 개가 올라 있다.

표 아래 작은 글씨를 보면, 항목마다 제일 높은 점수는 굵게 칠했고 경쟁 모델은 자기네가 발표한 값과 공개된 결과 중 더 좋은 쪽을 가져왔다고 한다.

평가 4.6 High 4.5 High Sol Max Fable 5 Max
AA Intelligence Index 61 56 61 62
GDPVal-AA v2 1753 1526 1728 1741
CursorBench v3.2 69.9% 66.7% 67.2% 70.5%
DeepSWE v1.1 65.9% 54% 73% 70%
FrontierCode v1.1 (Extended) 61.3% 56.6% 60.6% 63.6%
APEX-Agents 57.5% 47.1% 56.7% 59.2%
Terminal-Bench v3.0 26% 15.7% 34.6% 34.1%
APEX-SWE 56.4% 53.6% 해당 없음 58.8%
AA-Briefcase 1577 1313 1502 1574
Harvey LAB (Vals) 15.8% 12.9% 2.5% 11.3%

사실 코딩 쪽은 Sol과 Fable이 위다. 

벤치마크보다 개인적으로 만족스러웠던 건 Grok Build를 썼을 때의 압도적인 속도, 그리고 같은 비용에 사용량도 넉넉히 준다는 점이다. 그럼에도 성능도 어느 정도 만족할 만하다 (물론 아직 클로드 opus5, fable이나 gpt sol까지는 안 되는 것 같지만 .. 개인적으로 세컨 모델, 빠른 생산성을 중요하게 여기는 업무에서는 주요 모델로 사용하고 있다.)

 

SpaceXAI 발표로는 Intelligence Index에서 4.6이 GPT-5.6 Sol과 같다고 한다. 그냥 참고로만 살펴보자.

 

5. 독립 평가를 겹쳐 보면 순위가 갈린다

Artificial Analysis는 Grok 4.6 Intelligence Index를 61로 발표했다.

같은 글에서 Claude Opus 5 max는 63, Fable 5(max, fallback)는 62다.

 

GPT-5.6 Sol max에는 Grok 4.6과 "같은 수준"이라고만 적었다. — 위 표의 Sol 61은 SpaceXAI가 발표한 값이다. (출처: Artificial Analysis 분석 (2026-08-12))

  공식 표 Artificial Analysis (2026-08-12)
Intelligence Index 61, Sol과 동률, Fable 62 아래 61, Opus 5 63 · Fable 62 아래
GDPVal-AA 표 안 1위 1753 1753, Opus 5 다음
Terminal-Bench v3.0 26% v2.1 88.4%
비교 상대 4.5 / Sol Max / Fable 5 Max Opus 5를 포함한 공개 리더보드
작업당 비용 표에 없음 $0.84 / task

 

위 표를 보면 답이 나온다. 공식 표에는 Claude Opus 5가 아예 없고, AA는 그 Opus 5를 1위에 뒀다.

결국 어떤 모델을 비교 대상으로 표에 넣었느냐에서 갈린다.

공식 표만 보면 이 네 모델 중 누가 앞서는지까지가 전부다.

 

AA(Artificial Analysis)를 같이 놓아야 Opus 5까지 들어간 순위에서 4.6이 어디쯤인지 보인다.

이 차이는 출시 당일 커뮤니티도 먼저 짚었다. Hacker News 댓글은 "Fable급인데 훨씬 싸다"는 쪽과 "실사용은 Opus 4.8 근처"라는 쪽으로 갈렸다.

 

26%와 88.4%는 다른 시험이다

공식 표의 26%는 v3.0이다. AA의 88.4%는 v2.1이다.

같은 이름에 점수가 세 배 넘게 갈리니, 버전을 빼고 "터미널 벤치 88%" 또는 "26%"만 남기면 틀린 숫자가 된다.

AA는 AA-Briefcase에서 4.6이 약 53턴에 입력 약 0.5B를 썼고, Opus 5 max는 약 103턴에 입력 약 2.0B를 썼다고 한다. 같은 글의 작업당 비용은 $0.84다.

에이전트를 오래 돌릴 생각이라면 지수 순위보다 이 턴·토큰 쪽이 실제 청구서에 가깝다.

SpaceXAI가 앞세운 Briefcase 1577도 이 턴 수와 같이 봐야 의미가 생긴다.

 

6. 일론이 말한 Grok 4.7

4.6이 나온 바로 그날, 일론 머스크가 4.7 이야기를 먼저 꺼냈다.

Grok 4.7 is significantly better than 4.6 and should be ready in 3 to 4 weeks. Initial training is complete and now we're adding a massive amount of SpaceX company data in supplemental training. This will be something special.
(“Grok 4.7은 4.6보다 훨씬 낫고, 3~4주면 준비된다. 초기 학습은 끝났고, 지금은 SpaceX 사내 데이터를 대량으로 보충 학습에 넣고 있다. 이번 건 특별할 것이다.”)

(원문: Elon Musk, 2026-08-12 18:18 GMT)

 학습은 이미 끝났다는 이야기라, 남은 건 일정뿐이라는 말로 읽힌다.

 

이어진 포스트에서는 "Grok 4.7 will exceed all current models."라고 썼다.

같은 타래에서 SpaceX 학습 데이터가 독특하다고 했고, 실제 공학 쪽에서 더 나은 모델이 나온다면 놀랄 일이라고도 했다. (참고: Elon Musk 후속 포스트)

일론이 한 말이지, 제품 스펙이 아니다

출시일, 파라미터, 가격, 벤치 점수는 이 트윗에 없다. "3~4주"는 달력 일정이 아니다. 4.7 스펙도 아직 없다.

그래서 오늘 뭘 쓸지는 오늘 쓸 수 있는 곳과 이미 나온 표로 정하자. 4.7 permalink는 저장만 해 두고, 제품 스펙이 나온 뒤에 다시 열어 보자.

 

7. 지금 바로 써 보기

그럼 직접 해 보자. 아래는 2026년 8월 13일에 내 환경에서 따라 한 순서 그대로다. 아직 안 깔았다면 조금 뒤에 나오는 설치 한 줄부터 실행하자.

 

Grok Build 1.0.3을 실행하면 splash에 Grok 4.6 is here! Select 'Grok 4.6' under /model.이 뜬다.

 

그래서 /model을 안내대로 열어 봤다. Grok 4.6 (current) 옆에 SpaceXAI's latest frontier model이 붙어 있고, 하단은 Grok 4.6 (high) · always-approve다.

 

추론 강도 기본값은 화면 라벨과 문서 모두 high로 같다.

필자 화면, /model 선택 화면. 공식 문서 스크린샷이 아니다.
내가 본 범위

위 두 장은 2026년 8월 13일 Grok Build 1.0.3에서 직접 본 화면이다. 다만 API로 벤치를 오래 돌려 본 기록은 없다.

이 글의 점수는 전부 공식 표와 AA 기사에서 가져온 값이다.

 

설치는 공식 릴리스 노트에 있는 한 줄로 끝난다.

curl -fsSL https://x.ai/cli/install.sh | bash

 

이 한 줄이면 Grok Build CLI가 깔린다.

그 뒤 옵션·권한·프로젝트 연결은 이미 써 둔 Grok Build CLI 초보자 가이드를 보면 된다.

 

API 쪽만 시험해 볼 거라면 모델 이름을 grok-4.6으로 두자. 키는 xAI 콘솔에서 받아 export XAI_API_KEY=...로 넣자.

curl https://api.x.ai/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -d '{"model":"grok-4.6","input":"Find and fix the bug, then explain it."}'

 

이 curl이 JSON을 돌려주면 연결은 된 거다.

여기까지가 최소한이고, 실제로 대화를 이어 갈 거면 §2에서 말한 prompt_cache_key를 여기에 붙여야 한다.

 

키가 없으면 같은 대화로 안 묶여서 할인이 통째로 날아간다.

모델 ID 오타보다 키 환경 변수가 안 잡힌 경우가 훨씬 많으니, 안 되면 echo $XAI_API_KEY부터 찍어 보자.

 

캐시 할인이 붙었는지 보는 법

키를 넣었으면 할인이 실제로 붙었는지도 눈으로 확인할 수 있다. 요청에 키를 넣고, 응답에서 재사용된 토큰 수를 보자.

curl https://api.x.ai/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -d '{
    "model": "grok-4.6",
    "input": "What is prompt caching?",
    "prompt_cache_key": "b79ad29b-b3f9-463c-bca6-041d5058d366"
  }'

 

응답의 usage.input_tokens_details.cached_tokens가 재사용된 토큰 수다.

 

0이면 할인이 적용되지 않은 건데, 첫 요청이거나 예전에 보낸 앞글이 서버에서 사라진 경우일 수 있어서 곧바로 문제는 아니다.

같은 키로 두 번째 요청을 보냈는데도 0이면 그때 의심하자.

API 키를 넣는 곳 할인이 붙었는지 보는 곳
Responses 본문 prompt_cache_key usage.input_tokens_details.cached_tokens
Chat Completions x-grok-conv-id 헤더 usage.prompt_tokens_details.cached_tokens

 

Chat Completions로 옮기면 두 가지가 같이 바뀐다.

키는 Responses면 본문에 넣고, Chat Completions면 헤더에 넣는다.

읽는 필드 이름도 input_prompt_로 갈린다.

추론 모델이라서 생기는 함정

이어서 보낼 때 이전 응답의 reasoning_content, 그러니까 모델이 속으로 생각한 글을 빼먹으면 할인이 안 붙는다.

제일 흔한 실수인데, 4.6은 추론을 끌 수도 없어서 피해 갈 방법이 없다. 대신 previous_response_id를 쓰면 된다.

앞쪽 메시지를 고치거나 지우거나 순서를 바꿔도 마찬가지로 할인이 날아가니, 새 메시지는 끝에만 붙이자. (출처: xAI Docs — Prompt caching, multi-turn)

 

추론 강도 지정하고 청구액 찍어 보기

§2 표에서 본 low·medium·high·xhigh는 요청에서 이렇게 지정한다.

curl https://api.x.ai/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -m 3600 \
  -d '{
    "model": "grok-4.6",
    "reasoning": {"effort": "xhigh"},
    "input": "Find and fix the bug, then explain it."
  }'

 

xhigh는 4.6부터 생긴 값이다. 같은 값을 4.5에 보내면 에러가 나는 게 아니라 조용히 high로 처리된다.

그럼 high와 xhigh가 실제로 얼마나 다르냐는 질문이 남는데, 점수·지연 차이를 수치로 밝힌 공식 문서는 찾지 못했다. 문서에 있는 말은 "지연이 그만큼 늘어난다"까지다.

20만을 넘겼을 때 청구액이 뛰는지 보는 법

이 값은 캐시 할인까지 반영된 뒤의 금액이다.

프롬프트를 조금씩 키우면서 cost_in_usd_ticks를 찍어 보면 §2에서 본 20만 경계를 표가 아니라 내 청구액으로 직접 확인할 수 있다.

스트리밍이면 stream_optionsinclude_usage를 켜야 마지막 청크에 붙는다. (출처: xAI Docs — Cost tracking)

 

8. 그래서 누가 쓰면 되나

여기까지가 확인한 전부다.

단가를 아끼면서 에이전트를 오래 돌릴 생각이면 4.6은 충분히 후보다.

반대로 독립 평가에서 1위인 모델만 쓰겠다면 4.6은 아니다.

상황 4.6을 후보에 넣는 이유 다른 쪽을 먼저 보는 이유
Cursor·Grok Build로 에이전트를 오래 돌린다 SpaceXAI가 앞세운 용도, 첫 주 2배 사용량, Briefcase 턴 수 코딩 전 항목 1위가 필요하면 표에서 앞서는 건 다른 모델이다
API 비용을 민감하게 본다 기본 $2/$6, Fable $10/$50 대비 낮음 캐시는 4.5보다 비싸다. 키를 안 쓰면 혜택이 줄어든다
독립 리더보드 1위만 고른다 해당 없음 AA 지수는 Opus 5 63이 위다
법률·지식 노동 쪽 성능을 본다 공식 표에서 Harvey 15.8%가 1위 독립 재현과 실제 사건 파일은 이 글 범위 밖
4.7 일정을 기다린다 해당 없음 트윗은 전망이다. 오늘 쓸 건 4.6이다

 

결국 물어볼 건 하나다. 에이전트를 오래 돌릴 거냐, 독립 평가 1위가 필요하냐.

 

4.5를 이미 쓰는 팀이라면 모델 ID만 grok-4.6으로 바꾸면 그대로 돌아간다. 다만 캐시를 자주 쓰는 작업이라면 §2에서 본 대로 캐시 단가가 올랐으니, 갈아탄 다음 청구서를 한 번 더 보는 게 좋다.

문서만 보면 빠지는 것
  • 공식 표에 Opus 5가 빠져 있다
  • 캐시가 4.5보다 올랐다. 가격 페이지에는 숫자만 나란히 있고, "인상"이라는 말은 없다
  • Terminal-Bench v3.0과 v2.1이 다른 시험이다
  • 일론의 4.7 트윗은 제품 스펙이 아니다
오늘 바로 확인할 것
  • Grok Build /model에서 Grok 4.6 (current)인지 확인하자.
  • API를 쓰면 model=grok-4.6prompt_cache_key를 같이 넣자.
  • 공식 표 1위(GDPVal-AA 1753)와 AA 지수(4.6 61, Opus 5 63)를 같은 1위로 읽지 말자.
  • Terminal-Bench 88.4%가 v2.1인지, 공식 표 26%가 v3.0인지 버전을 보자.
  • 4.7 permalink는 저장만 하고, 오늘 쓸 건 4.6이다.
오늘 고른다면

오늘 터미널에서 에이전트를 돌릴 거면 4.6을 고르면 된다.

독립 평가 1위가 꼭 필요한 일이라면 Opus 5를 같이 놓고 보자. 그리고 4.7은 제품 스펙이 나오기 전까지는 선택지에 넣지 않는 편이 낫다.

 

9. 자주 묻는 질문

Q1. Grok 앱에서도 Grok 4.6을 고를 수 있나?

소비자 앱 모델 목록은 못 찾았다.

확인한 경로는 Grok Build, Cursor, Grok Bot, API, OpenRouter·Vercel·Cloudflare다.

앱 화면은 그 앱에서 직접 보자.

Q2. 500k 컨텍스트면 50만 토큰까지 모두 기본 가격인가?

아니다. 컨텍스트 한도와 청구 구간은 별개다. 프롬프트가 200k에 닿으면 그 요청 전부가 $4 / $1 / $12로 올라간다.

Q3. Grok 4.6과 Grok Build는 같은 것인가?

아니다. grok-4.6은 모델 ID다. Grok Build는 그 모델을 기본값으로 쓰는 코딩 에이전트다.

Q4. Grok 4.6은 코딩 모델 전체 1위인가?

아니다. 공식 표에서도 DeepSWE·FrontierCode·CursorBench·Terminal-Bench v3.0은 다른 모델이 앞선다.

독립 지수는 Opus 5가 위다.

Q5. Grok 4.7은 언제 나오나?

일론은 트윗에서 "3 to 4 weeks"와 SpaceX 보충 학습을 말했다. 출시일·가격·벤치는 없다. 일론이 한 말로만 읽자.

Q6. 4.5보다 가격이 내렸나?

입력 $2 / 출력 $6은 같고, 캐시 입력만 $0.30에서 $0.50으로 올랐다. 인하가 아니다.

터미널에서 쓸 거면 설치 가이드를 따라 Grok Build를 깔고 /model에서 4.6을 고르면 되고, API로 붙일 거면 모델 이름을 grok-4.6으로 두고 prompt_cache_key를 같이 넣으면 된다.

나머지는 오늘 나온 표 안에서 판단하자.

 

10. 참고 자료

공식 자료

독립 평가

가격 비교용 공식 페이지

일론 머스크 발언

커뮤니티 논의 (의견)

이 시리즈

작성일 2026-08-13 · 기준 버전 grok-4.6. 모델·가격·사용량·벤치 숫자는 바뀔 수 있다. 최신 값은 공식 모델 페이지와 공식 가격표에서 다시 확인하자. 벤치 수치는 각 출처의 비교 범위 안에서만 유효하다. 이 글의 Grok Build 화면은 필자 환경 1.0.3 캡처이며, API 장시간 실측은 포함하지 않는다. 면책: 이 글은 2026-08-13 기준으로 작성되었다. 이후 변경될 수 있다.

 

300x250
Contents

포스팅 주소를 복사했습니다

이 글이 도움이 되었다면 공감 부탁드립니다.

💡 AI 관련 질문이 있나요? 눌러보세요!