잡탕랜드21:15 갱신
지금 끓는 중
잡탕랜드도구
2026.09.01

같은 Grok 4.6인데 Cursor랑 Build가 다르다?

X에서 이런 글을 봤습니다. 같은 Grok 4.6 xHigh인데 Build랑 Cursor 결과물이 다르다는 거였어요.

🐦 X에서

Grok Build vs Cursor, Grok 4.6 xHigh
원글 커버. 출처: @SPAC89 / X

토큰 한도 비교하는 쪽에서 올린 글입니다. SuperGrok Heavy를 월 $300, Cursor Ultra를 월 $200 쓴다고 하고, 둘 다 꽤 굴려 본 뒤에 자기 결과랑 소감을 적었어요.

쉽게 말해서 이겁니다. 픽커에 Grok 4.6 xHigh라고 똑같이 찍히는데, Build랑 Cursor가 다른 물건처럼 나온다는 거예요. Build 쪽 컨텍스트는 50만, Cursor는 25만6천이라고 적었고, Cursor 팀이 “500k를 잘라 넣은 게 아니라 다른 설정”이라고 했다고 포럼 링크를 달았습니다.

요금 이야기도 길게 나옵니다. Build에서 1억 7천만 토큰쯤 썼더니 주간 한도의 30%가 빠졌고, 그래서 Heavy가 주에 6억, 달에 25억 토큰이라고 본인이 환산했어요. Cursor Ultra는 같은 모델로 달에 90~100억 토큰에, 다른 모델용으로 $400쯤 더 들어간다고 합니다. Heavy가 $300인데도 토큰은 Ultra의 25~30%밖에 안 나온다는 식이에요.

Cursor Ultra 포함 사용량 캡처
원글에 올린 Cursor Ultra 사용량 캡처. 출처: @SPAC89 / X

그러면 왜 Heavy를 쓰냐는 질문에, 그 사람은 Grok Bot 한도가 플랜마다 같아서가 아니라고 적습니다. 팀이 그렇게 확인했다고요. 진짜 차이는 컨텍스트 크기랑, 본인 테스트에서 Build가 더 잘 나온다는 점이래요. Cursor는 목표를 더 자주 포기하고 실수도 많다고 했고, Heavy는 CLI에서 실시간 X가 붙어서 API 검색비(호출당 $0.005쯤)를 안 내도 된다고 적었어요. 이미지·영상 생성도 Heavy 쪽에 있다고 하고요.

바로 뒤에 비교 영상도 올렸습니다. 같은 프롬프트, 같은 Grok 4.6 xHigh, 왼쪽이 Build 오른쪽이 Cursor. “모든 면에서 Build가 낫다. 컨텍스트 차이만으로 설명이 되나?”가 그 글의 질문이에요.

Grok Build 왼쪽, Cursor 오른쪽 비교 영상 장면
비교 영상 한 장면. 왼쪽 Build, 오른쪽 Cursor. 출처: @SPAC89 / X

양쪽 구독 긁어 본 사람 후기다.

💬 댓글

댓글은 품질 쪽을 더 잡고 가요. 제일 눈에 띈 건 이 말입니다. 나오기 전에 모델이 하네스에서 한 번 더 학습한다고 들었다. 그래서 클로드랑 GPT를 다른 제품에서 쓰면 결과가 다르다고 사람들이 하는 거고, 이번에도 그게 먹힐 수 있다.

다른 댓글은 Cursor 쪽 Grok 하네스에 제한이 많아서 Cursor Grok이 별로라는 투였고, 또 다른 사람은 자기도 Build에서 더 잘 나온다고 했습니다. Grok 팀이 자기네 하네스에서 제일 잘 돌아간다고 말한 적 있다는 식이에요.

컨텍스트 숫자보다 하네스 얘기로 간다.

🔍 찾아본 것

컨텍스트 크기 자체는 맞아요. xAI 모델표에서 Grok 4.6은 50만 토큰이다. Cursor 포럼에서 스태프가 Cursor 쪽 Grok 4.6은 25만6천이라고 두 번 확인했습니다. 4.5 때도 그랬고, 4.6 나와서도 그대로래요.

xAI Grok 4.6 컨텍스트 50만 토큰
xAI 모델표. 컨텍스트 50만 토큰. 출처: docs.x.ai
Cursor 스태프가 Grok 4.6 컨텍스트 256k라고 확인
Cursor 포럼 스태프 답. 256k가 맞다고 했다. 출처: Cursor Forum

다만 그가 단 4.6 스레드에서 스태프가 찍은 건 “256k다”예요. “잘라 넣은 게 아니라 다른 설정”이라는 문장은 그 전, 4.5 때 나온 답이다. 4.6 글에는 그 문장이 다시 안 나옵니다. 대신 Cursor 공식 모델표에는 이 모델을 Cursor와 xAI가 같이 훈련했다고 적혀 있어요. 컨텍스트만 다른 건 아닐 수도 있다. 공식에도 그 말은 있다.

Cursor 문서 Grok 4.6, Cursor와 SpaceXAI, 컨텍스트 256k
Cursor 문서. Grok 4.6은 Cursor와 SpaceXAI, 컨텍스트 256k. 출처: cursor.com/docs

댓글에 나온 “하네스에서 한 번 더 학습한다”도 발표문이랑 맞춰 봤어요. xAI가 Grok 4.6 내놓을 때 이렇게 적는다. Grok 4.5로 학습 데이터를 다시 뽑았는데, 추론 강도랑 에이전트 하네스랑 분야를 나눠서 뽑았다고. 쉽게 말해서 모델만 키운 게 아니라, 에이전트가 도구 쓰는 환경에서 한번 더 다듬었다는 문장이다. xAI는 Build를 자기네 코딩 에이전트 하네스라고 소스까지 공개해 둔 상태고요.

그래서 그 댓글이 그냥 지어낸 말은 아닙니다. 다만 나오기 직전에 Cursor용·Build용으로 가중치를 살짝 따로 깎는다까지는 공식으로 확인 못 했어요. 같이 훈련했다, 하네스별로 학습 데이터를 뽑았다. 여기까지가 공식에 있는 문장이다.

클로드나 GPT가 제품마다 다르게 나온다는 말도, Cursor가 직접 적어 둔 게 있어요. 에이전트 하네스를 계속 손본다는 글에서 이래요. OpenAI 모델은 파일 수정을 패치 형식으로 학습했고, 앤트로픽은 문자열 교체로 학습했다. 익숙하지 않은 쪽을 주면 생각하는 데 더 들고 실수가 늘어난다. 그래서 Cursor는 학습 때 쓰던 형식을 맞춰 준다. 새 모델이 나오기 전에는 몇 주씩 하네스를 그 모델 버릇에 맞춘다고도 적혀 있어요. 댓글이 말한 그 구조가 Cursor 글에도 있다.

Cursor 하네스 글 OpenAI 패치 vs 앤트로픽 문자열 교체
Cursor 하네스 글. 학습 때 쓰던 도구 형식을 맞춰 준다고 한다. 출처: cursor.com/blog

다만 그 글이 말하는 건 Cursor가 클로드·GPT 가중치를 따로 깎는다는 게 아니라, 이미 학습된 도구 형식에 하네스를 맞춘다는 쪽이에요. xAI 문서에는 Build를 돌리는 그 모델이 grok-4.6이고, 그 ID가 API에도 같다고 적혀 있습니다. Cursor 쪽 Grok은 같이 훈련했다고 스스로 적고요. 모델카드에는 Cursor 작업 데이터로 보충 학습했다는 각주도 있습니다. Cursor용 가중치 파일, Build용 가중치 파일이 따로 있다는 문장은 못 찾았어요.

벤치도 하나 봤다. VulcanBench가 같은 Grok 4.6을 Build, Cursor, 그냥 API에 넣어 봤어요. Build는 effort를 올릴수록 점수가 올라갔고, Cursor는 거의 안 움직였고, API는 high에서 꺾였다고 적혀 있습니다. 과제 23개짜리 한 묶음이고, Build랑 Cursor 차이가 애매하다는 말도 같이 적혀 있어요. 원글 테스트랑은 별개다. Grok 팀이 자기 하네스가 제일 낫다고 했다는 댓글은 공개 문장으로 못 찾았습니다.

VulcanBench Grok 4.6 Build vs Cursor vs API
같은 Grok 4.6을 Build, Cursor, API에 넣은 표. 출처: VulcanBench

와 컨텍스트만 다른 줄 알았는데 학습 문장에 하네스가 들어가 있었네.

요금은 이렇습니다. Cursor Ultra는 도움말에 월 $200이라고 나와요. Grok 4.6은 Cursor 모델 포함 사용량에서 깎이고, 다른 회사 모델은 따로 깎입니다. 그 다른 쪽을 공식 표가 $400이라고 찍어 둔 문장은 이번엔 못 열었어요. xAI 공개 표에서 SuperGrok는 월 $30, Plus는 월 $100이고 Heavy 칸은 있습니다. $300은 그 사람이 자기 구독이라고 적은 숫자고, 열어 본 페이지에는 달러가 안 찍혀 있었어요.

20만 토큰을 넘기면 API 요금이 대략 두 배가 되는 건 모델표에 있습니다. “20만 아래가 반값”은 그 표랑 맞아요. 근데 1억 7천만 토큰이 주간 한도의 30%라서 월 25억이다, Ultra가 월 90~100억이다, 이건 본인 대시보드 환산입니다. 공식 한도가 그 억 단위로 적혀 있진 않아요.

Grok Bot 한도가 플랜마다 같다는 “팀 확인”은 공개문으로 못 찾았습니다. 문서에는 구독 단계가 다르면 한도도 다르다고 나와요. API 검색 호출당 $0.005는 예전에 도구 가격을 그렇게 내린 적 있는 숫자랑 비슷한데, 지금 표에서 다시 확인하진 못했습니다.

이름 하나 더. API에 코딩 전용 grok-build-0.1이 따로 있고 컨텍스트는 25만6천입니다. 이번 글이 말한 건 그 모델이 아니라, Build 안에서 돌린 Grok 4.6이에요.

숫자로 남는 건 컨텍스트랑 Ultra $200이랑 20만 토큰 요금 구간. 나머지는 그 사람 숙제다.

🤔 돌려 본 느낌

궁금해서 나도 Grok 4.6한테 실제 질문을 해봤어요. 이름만 같다고 같은 물건은 아니라는 답이 왔다. 컨텍스트가 반이면 Extra High처럼 오래 생각하는 설정은 더 빨리 차고, 도구랑 시스템 프롬프트랑 어디서 멈추느냐가 제품마다 다르다는 거였습니다. Cursor가 더 게으르다는 말은, 에이전트가 일을 미루는 그 느낌으로 읽으면 이해가 간다. 그 정도예요.

제 체감에도 그런 느낌은 조금 있었습니다. Cursor에서 Grok 4.6 굴리다 보면 컨텍스트가 빨리 차고, 이름만 믿고 같은 물건처럼 쓰면 안 되는 순간이 있어요.

와 ㅋㅋ 이름 같다고 같은 줄 알았는데 픽커만 같은 거였네.

📝 그래서

컨텍스트가 다른 건 맞고, Cursor가 이 모델을 같이 만들었다고 스스로 적은 것도 맞습니다. 댓글에 나온 하네스에서 한 번 더 학습한다는 얘기도, 발표문에 하네스별 학습이 있어서 그냥 루머만은 아니에요. 제품마다 가중치를 따로 깎는지는 거기까지는 못 봤습니다.

Grok Build랑 Cursor에 Grok 4.6을 같은 effort로 많이 써 봤는데, 실제 체감은 꽤 달라서 저 글이 과장만은 아닌 것 같습니다.

원글 @SPAC89. 숫자는 Cursor 도움말·하네스 글·모델표, 포럼 스태프 답, xAI 발표·모델표. 독립 벤치는 VulcanBench. 이미지는 원글 캡처와 각 출처 페이지.

댓글 0
0/500

    도구2

    갱신
    같은 20x인데 Claude랑 Codex가 다르다고?같은 20x라도 클로드는 5시간, 코덱스는 주간이라는 글을 봤다.10:52
    같은 Grok 4.6인데 Cursor랑 Build가 다르다?X에서 같은 Grok 4.6인데 Build랑 Cursor가 다르다는 글을 봤다. 컨텍스트는 50만 vs 25만6천이 맞고, 품질은 한 사람 테스트다.05:23