
AI를 유료로 하나만 구독하려고 검색하면 금세 벤치마크 순위표를 만나게 된다. 그런데 순위가 높다는 모델이 나에게도 가장 좋은 구독일까?
비전공자에게는 무엇을 비교해야 하고 어떤 조건을 말해야 하는지부터 어렵다. 나 역시 처음부터 비교 기준이나 예산을 정리해 질문하지 못했다.
그래서 세 AI에 잘 다듬은 프롬프트를 넣는 대신, 머릿속에 처음 떠오른 질문을 그대로 보냈다.
요즘 ai 모델 성능은 어떤 걸로 비교를 하고 어떤 모델이 가장좋아?
이 글의 목차
성능 1위가 구독 1위는 아니다
먼저 ‘가장 좋은 모델’을 고르려면 어떤 시험에서 가장 좋은지부터 따져봐야 한다. Chatbot Arena는 사람이 두 답변을 블라인드로 비교하고, SWE-bench는 실제 소프트웨어 문제 해결 능력을 평가한다. 시험 과목이 다른 만큼 한 곳의 1위가 모든 용도의 1위라는 뜻은 아니다.
그런데 우리가 실제로 결제하는 것은 모델 하나가 아니라 구독 상품이다. 구독에는 검색, 파일 분석, 이미지, 음성, 코딩 도구와 사용 한도가 함께 묶인다. 따라서 비전공자에게는 벤치마크 점수보다 “내가 하려는 일을 이 구독으로 얼마나 쉽게 끝낼 수 있는가”가 더 현실적인 기준이 된다.
이때 가격도 단순한 참고 정보가 아니라 성능·기능과 함께 살펴야 할 경쟁력이다. 2026년 8월 25일 미국 표시 가격 기준으로 ChatGPT Plus와 Claude Pro는 월 20달러, SuperGrok은 월 30달러다. Claude Pro는 연간 선결제 시 월 환산 17달러로 표시된다. 실제 원화 결제액은 환율·세금·결제 경로에 따라 달라질 수 있다. (ChatGPT 가격, Claude 가격, Grok 가격)
같은 질문을 세 서비스에 보냈다
이런 기준이 실제 답변에서 어떻게 드러나는지 확인하기 위해 ChatGPT, Claude, Grok에 같은 질문을 보냈다. Mac에서 각 서비스의 새 비공개 대화를 열고, 별도로 모델을 선택하지 않은 채 화면의 기본 상태를 사용했다.
다만 ChatGPT는 보유한 상위 플랜으로 실행했기 때문에 Plus에서도 제공되는 모델과 기능만 평가했다. 상위 플랜의 전용 기능과 추가 사용 한도는 결과에서 제외했다. 순수 모델 성능이 아니라 첫 유료 구독자가 만나는 제품 경험을 비교하기 위해서다.
처음부터 조건을 모두 알려주면 모호한 질문을 어떻게 다루는지 확인할 수 없다. 그래서 질문을 세 단계로 나눴다.
- 앞에서 소개한 모호한 최초 질문
- 월 2만~4만원대에서 세 구독을 비교하되, 단일 우승자를 강요하지 않고 최신 공식 자료와 원 벤치마크를 요청한 질문
- 가격·기능·벤치마크를 공식 원문으로 재검증하고 사실·추정·의견을 구분해 달라는 질문
결과는 하나의 총점으로 합치지 않았다. 설명의 이해하기 쉬운 정도, 출처의 품질, 가격 대비 가치, 자기수정 능력과 응답 시간을 각각 관찰했다.
결과: 잘하는 방식이 달랐다
세 서비스 모두 질문에는 답했지만, 설명의 깊이와 출처를 다루는 방식, 오류를 수정하는 과정에서는 차이가 나타났다.
| 관찰 항목 | ChatGPT | Claude | Grok |
|---|---|---|---|
설명 |
상세하고 구매 조건까지 깊게 연결 |
짧고 읽기 쉬움 |
표와 유형 구분은 좋지만 전문용어가 많음 |
공식 근거 |
공식 문서와 원 평가 연결이 비교적 충실 |
2차 출처 의존이 많고 일부 공식 페이지 확인 실패 |
공식 가격은 확인했지만 초기 성능 근거가 흔들림 |
자기수정 |
컨텍스트·음성·연동 기능·벤치마크 해석을 구체적으로 수정 |
오래된 기능명과 미확인 정보를 솔직하게 낮춰 표시 |
연간 가격·모델명·한도·벤치마크를 다시 구분 |
속도 |
31초, 1분 57초, 2분 57초 |
56초·90초·123초 이내(확인 시점 기준) |
8초, 14초, 49초 |
시간은 서로 다른 기본 표시 모드(ChatGPT 높음, Claude Sonnet 5 중간, Grok 빠른)에서 측정했다. 동일 모델·추론 강도 조건의 속도 대결이 아니라 기본 제품 경험의 관찰값이다.
표의 Claude 시간은 화면을 다시 확인했을 때 이미 응답이 끝나 있었던 상한이며 정확한 완료 시간이 아니다. 또한 ChatGPT에서 Plus 공통 기능만 평가했더라도 상위 계정의 기본 모델·추론 설정까지 Plus와 같다고 확인한 것은 아니다. 따라서 이 결과를 Plus 가입자의 응답 품질이나 속도를 그대로 재현한 결과로 볼 수는 없다. 세 서비스의 답변 모두 개인정보 처리 방식을 실질적으로 비교하지는 않았다.
ChatGPT: 조사·수정은 깊었고 응답은 길었다
ChatGPT는 최상위 API 모델과 월 구독에서 실제로 쓸 수 있는 모델을 구분하고, 공식 가격과 기능, 원 벤치마크까지 상세히 조사했다. 반면 첫 비교에서는 일부 기능과 외부 도구의 제공 범위를 잘못 설명했고, 계속 변하는 벤치마크 점수를 구독의 실제 성능과 너무 가깝게 연결했다.
세 번째 질문에서는 컨텍스트·음성·도구 연동 범위와 벤치마크 설정 차이를 다시 확인해 바로잡았다. 조사와 수정 내용은 구체적이었지만 답변이 길었고, 검증 단계에는 2분 57초가 걸렸다. 첫 답변을 그대로 믿기보다 재검증까지 거쳐야 신뢰할 만한 구매 정보가 된다는 점도 확인할 수 있었다.
Claude: 간결했지만 출처가 아쉬웠다
Claude는 세 구독의 차이를 사용자 유형별로 압축해 비전공자가 읽기 쉽게 설명했다. 다만 공식 원문을 요청했는데도 일부 가격과 기능의 근거로 비교 사이트와 블로그를 사용했다. SuperGrok의 연간 가격을 300달러라고 제시했지만 해당 금액은 공식 가격표에서 확인되지 않았고, 현재 공식 표와 다른 기능명도 섞여 있었다.
세 번째 질문에서는 직접 확인하지 못한 항목을 ‘미검증’ 또는 ‘사실에 가까운 추정’으로 낮춰 표시했다. 처음부터 정확한 근거를 제시하지 못한 점은 약점이지만, 확인에 실패한 사실을 숨기지 않고 인정한 점은 긍정적이었다.
Grok: 이번 실행은 빨랐지만 출처 수와 정확성은 별개였다
Grok은 세 단계에서 각각 8초, 14초, 49초가 걸렸다. 답변에서는 자사 구독이 월 30달러로 더 비싸며, 실시간 정보와 이미지·영상 기능을 자주 사용하지 않는 사람에게는 가격 부담이 클 수 있다고 설명했다.
그러나 최초 답변에는 공식 자료에서 확인하기 어려운 모델명과 2차 리더보드가 섞여 있었다. 이번 비공개 대화에서 첫 답변에 40개, 두 번째 답변에 74개 출처가 표시됐지만 출처의 개수가 핵심 주장의 정확성을 보장하지는 않았다. 세 번째 질문에서는 공식 가격표에서 확인되지 않은 연간 할인과 구체적인 사용 한도, 벤치마크 순위를 추정으로 다시 분류했다.
가장 유용했던 것은 재검증 질문이었다
세 제품의 차이보다 더 분명하게 드러난 공통점도 있었다. 첫 비교 답변에는 세 서비스 모두 적어도 하나의 오류나 과장이 포함돼 있었다. 하지만 공식 원문으로 다시 확인하라고 요청하자, 각 서비스는 잘못된 내용이나 근거가 약한 표현을 찾아 수정했다.
실제로 사용한 재검증 질문은 다음과 같다.
방금 답변의 가격, 포함 모델과 기능, 벤치마크 설명을 공식 원문 기준으로 스스로 검증해줘. 틀렸거나 확실하지 않은 내용은 바로잡고, 사실·추정·의견을 구분해줘.
프롬프트 작성이 어려운 비전공자라면 이 문장을 안전장치처럼 활용할 수 있다. 다만 AI의 자기검증이 독립적인 사실 확인을 대신하지는 않는다. 실제 결제 전에는 각 회사의 공식 가격과 기능 페이지를 직접 확인해야 한다.
그래서 누구에게 무엇이 맞을까?
그렇다면 앞의 결과를 실제 선택에는 어떻게 활용하면 될까? 아래 내용은 공식 구독 구성에 따른 용도별 선택 후보다. 특히 ChatGPT Plus 추천은 상위 계정에서 관찰한 답변 품질이나 속도가 아니라 공식 기능 구성을 근거로 한다. 문서 작성이나 이미지 생성 품질을 별도 과제로 직접 겨룬 결과는 아니다.
- 아직 AI로 무엇을 많이 할지 모른다면 ChatGPT Plus: 검색, 문서, 데이터, 이미지, 음성 등 여러 기능을 한곳에서 탐색할 수 있다. 처음에는 다양한 기능을 사용해 보면서 자신에게 필요한 용도를 찾기 좋다.
- 읽기·쓰기와 긴 문서 작업이 중심이라면 Claude Pro: 이미지 생성보다 텍스트 작업에 집중하는 사람에게 맞는 구성이다. 연간 옵션은 200달러를 한 번에 결제하며, 공식 페이지는 이를 월 약 17달러로 표시한다.
- X의 실시간 정보와 이미지·영상을 자주 쓴다면 SuperGrok: 월 30달러이므로 다른 두 구독보다 10달러 비싸다. 이 기능들을 자주 사용할 때 추가 비용의 의미가 생긴다.
이번 실험만으로 하나의 절대적인 우승자를 정할 수는 없었다. 대신 첫 유료 AI를 고를 때 “어느 모델이 1등인가?”보다 “나는 매주 어떤 일을 맡길 것인가?”를 먼저 생각해야 한다는 결론은 분명해졌다.
한 가지 질문은 남는다. 이번에는 세 구독의 조사와 답변 경험을 비교했지만, 실제로 무언가를 만들 때도 같은 결과가 나올까?
ChatGPT의 Codex, Claude의 Claude Code, Grok의 Grok Build에 같은 제작 과제를 주면 이번과는 다른 장단점이 드러날 수 있다. 다음에는 비전공자가 모호한 요구만 가지고 앱을 처음 만들고, 수정하고, 완성하는 과정까지 비교해보고 싶다.
실험일은 2026년 8월 25일이다. 각 서비스에서 한 번씩 실행했기 때문에 이번 결과가 모든 응답의 품질과 속도를 대표하지는 않는다. 지역별 가격, 계정별 모델 배포, 사용량에 따른 제한도 달라질 수 있다.
개인정보 처리 방식과 세부 사용 한도, 구독 외 추가 비용 조건은 이번 실험에서 깊이 비교하지 않았다. 가격과 기능은 바뀔 수 있으므로 실제 발행 전과 결제 직전에 공식 페이지를 다시 확인해야 한다.
2026년 9월 6일 재공개 준비 과정에서 공식 표시 가격을 다시 확인했으며, 위 월간 가격은 동일했다. Claude의 연간 옵션은 200달러 선결제로, 공식 페이지의 월 17달러 표시는 반올림된 환산값이다.
이 글은 AI를 활용해 자료 조사와 초안 작성을 보조하고, 작성자가 직접 검증·편집했습니다.
댓글 남기기