
보기 좋은 화면과 맞는 결과는 다를 수 있다. USGS 공개 CSV로 만든 대시보드의 첫 화면에는 필터와 카드, 차트와 표가 모두 있었다. 그러나 저장한 파일의 지진 2,274건 가운데 규모 값이 2.5 미만인 행이 17건 있었고, 화면은 ‘규모 2.5 이상’이라고 설명하면서 2,274건을 전부 표시했다. 미리 계산해 둔 기본 조건의 답은 2,257건이었다. 자연어 수정 한 번 뒤에야 화면과 검산값이 일치했다.
이 사례가 도구 선택의 출발점이다. 가장 빨리 만들어 주는 제품을 찾기 전에, 내가 만들려는 결과를 어떻게 확인할지부터 정해야 한다. 이 글에서 바이브코딩은 원하는 기능을 자연어로 설명하고 AI가 코드를 만들고 고치게 하는 방식을 뜻한다.
아래 선택표는 아홉 주제의 기록을 목적별로 다시 묶은 것이다. 같은 과제를 여러 도구에 준 비교는 AI 구독 답변과 PPTX 자동화 앱뿐이었다. 나머지는 서로 다른 입력, 환경, 완료 기준을 사용한 단일 사례다. 따라서 시간·수정 횟수·성공 여부를 합산해 종합 순위를 만들 수 없다. Codex는 OpenAI의 코딩 에이전트다. 이 시리즈에서는 일부 결과물을 만드는 도구이면서, 실제 초보 참가자 대신 정해진 절차로 화면 조작과 검증을 수행한 운영자이기도 했다. 합성 입력은 실제 자료를 흉내 내 만든 가짜 샘플을 뜻한다.
이 글의 목차
한눈에 보는 목적별 선택표
| 하려는 일 | 실제로 검증한 범위 | 관찰된 결과 | 내 과제에서 더 확인할 것 | 관련 편 |
|---|---|---|---|---|
작은 개인용 로컬 도구 |
준비된 Mac에서 Codex로 할 일·Mac Calendar 전달 앱 1개 제작 |
첫 구현과 브라우저 확인까지 약 6분. 같은 생성 흐름의 자동 테스트 8개 통과 |
설치·인증 시간, 실제 휴대폰, 삭제 화면, 내보낸 폴더 재실행 |
01편 |
Excel 반복 정리 |
Claude가 만든 첫 코드와 Codex 수정본으로 합성 Excel 100개에서 값 추출 |
수정 뒤 83개 자동 확정, 17개 검토 필요 |
원본 복사, 출처 셀, 누락·중복·결측 규칙, 실제 파일 변형 |
05편 |
반복 파일 분류 |
Cursor로 합성 파일 10개를 미리보기 실행·실제 실행·재실행 |
분류 위치와 내용 대조를 통과했고 재실행 추가 이동 0건 |
폴더 범위, 중복 이름, 위험 표시, 실제 파일 복사본 |
07편 |
호스팅형 빌더로 파일 처리 앱 만들기 |
Lovable·Bolt·Replit에 같은 합성 PPTX 과제 제공 |
세 결과 모두 20장과 111개 문구를 보존했지만, 모두 가독성 문제가 남음 |
앱 코드의 GitHub·ZIP 내보내기와 타 환경 재실행, 모바일·로그아웃 상태 |
03편 |
웹사이트 빠른 시안 |
v0 실험 절차만 준비 |
관찰 결과 없음. 기존 로그인 세션이 없어 프롬프트 전송 전에 중단 |
실제 생성 품질, 크레딧 소모, 모바일, 배포, 코드 이동 |
06편 |
공개 데이터 대시보드 |
Codex로 고정한 USGS CSV 한 개의 정적 로컬 앱 제작 |
첫 화면의 기본 범위가 설명과 달랐고, 자연어 수정 1회 뒤 2,257건으로 검산 통과 |
현재 데이터와의 차이, 정답 조합, 오류 파일, 시간대·결측, 접근성, 외부 요청 |
09편 |
로그인·개인정보가 있는 앱 |
Codex로 합성 로컬 메모 앱의 회원가입·로그인과 제한된 보안 점검 |
기능 테스트 4개는 통과했지만 반복 오입력 차단 없음, 응답시간 차이, 기본 관리자 비밀번호 등이 남음 |
권한·세션·웹 보안 항목인 CSRF·XSS·비밀 관리와 전문가 검토. 결제는 이번에 시험하지 않음 |
04편 |
기존 앱에 기능 추가 |
Codex로 별도 앱 Pocket Tasks에 우선순위·마감일·제목 편집 추가 |
실행한 검사에서 기존 기능 깨짐 0건, 테스트 7→18개. 코드와 재검사 범위 증가 |
복원점, 전체 회귀 검사, 손상 저장값, 삭제 동작, 되돌리기 |
08편 |
구독·요금제 고르기 |
기본 모드가 다른 ChatGPT·Claude·Grok에 같은 구매 질문과 재검증 질문 제공 |
세 첫 답변 모두 오류나 과장이 있었고 공식 원문 재확인 뒤 개선 |
현재 지역 가격, 포함 기능, API 과금, 실제 사용 한도 |
02편 |
이 표의 ‘관련 편’은 각 관찰의 자세한 조건을 담은 글 번호다. 넷째 열은 이 실험의 미확인 목록이 아니라 독자가 자기 과제에서 다시 확인할 항목이다. 제품 전체의 성능표가 아니며, 검증하지 않은 용도까지 추천하는 표도 아니다. 웹사이트 빠른 시안 행에는 실행 결과 자체가 없다.
선택 순서는 세 질문부터 시작한다
첫째, 로그인·결제·다른 사람의 정보가 들어가는가? 그렇다면 프로토타입이 작동하는 것과 실제 운영이 안전한 것은 별개의 단계다. 로그인 앱 사례에서는 가입과 로그인이 되었고 생성된 기능 테스트도 통과했다. 그러나 별도 점검에서는 반복 시도 제한, 계정 존재를 짐작하게 할 수 있는 응답시간 차이, 기본 관리자 비밀번호 같은 문제가 드러났다. 결제는 시험하지 않았으므로 이 결과를 결제 앱의 안전성 판단으로 확대할 수 없다.
둘째, AI의 설명과 별개로 대조할 답이 있는가? 정답표는 복잡한 테스트 코드일 필요가 없다. 원본 파일 수와 파일이 바뀌지 않았는지 확인하는 고유값(해시), 손으로 계산한 샘플 세 줄, 열어 본 슬라이드 한 장, 공식 페이지의 현재 가격도 답이 된다. 대시보드의 2,274와 2,257 차이도 사전에 계산한 값이 있었기 때문에 발견했다.
셋째, 코드와 데이터를 꺼내 다시 실행할 수 있는가? ‘코드는 사용자 소유’라는 문구와 실제 이동 가능성은 다르다. 이번 호스팅형 빌더 실험에서는 결과 PPTX는 내려받았지만 앱 코드 전체의 GitHub·ZIP 내보내기와 다른 환경 재실행은 시험하지 않았다. 확인하지 않은 이동성을 장점으로 계산해서는 안 된다.
세 질문 중 하나라도 답하기 어렵다면 더 비싼 도구를 고르기 전에 과제를 줄이는 편이 안전하다. 실제 자료 대신 복사본이나 작은 합성 샘플을 쓰고, 맞아야 할 값 하나를 적고, 첫 결과를 보존하는 식으로 시작할 수 있다.
작은 로컬 도구 한 건은 확인된 첫 버전에 빠르게 도달했다
준비된 개발 환경에서 만든 로컬 할 일 앱은 첫 요청 뒤 약 6분 만에 주요 브라우저 확인까지 도달했다. 할 일을 추가하고 완료로 바꿀 수 있었고, 새로고침 뒤에도 내용이 남았다. Calendar 새 일정 화면에는 제목과 시간이 채워졌다. 자동 테스트 8개도 통과했다.
그러나 약 6분은 설치와 인증이 이미 끝난 Mac에서 Codex가 조작한 한 번의 기록이다. 삭제 버튼의 실제 화면 클릭과 실기기 모바일 사용은 끝까지 확인하지 못했다. 이 수치는 ‘초보자도 6분’이라는 약속이 아니다. 낮은 위험의 합성 입력을 사용했고, 확인할 동작이 작았기 때문에 빠른 후보가 됐다는 관찰이다.
자동화가 끝나도 예외와 검토는 남았다
Cursor 파일 정리 실험은 합성 파일 10개로 먼저 이동 예정표만 보는 미리보기 실행(dry run)을 했다. 실제 이동 뒤에는 분류 위치와 파일 내용이 바뀌지 않았는지 대조했고, 같은 명령을 다시 실행했을 때 추가 이동은 0건이었다. 생성 코드는 이 제한된 과제를 수정 없이 통과했다. 다만 폴더 접근 범위, 중복 이름 처리, 위험 표시 해석은 사람이 정해야 했다.
Excel 100개 실험에서는 91개에 정상값이 있었고, 4개에는 값이 없었으며, 5개에는 후보가 중복됐다. 첫 후보는 정상값 60개를 정확히 찾았지만 31개를 놓쳤고 차트도 빠졌다. 규칙과 차트를 보완한 뒤 83개를 자동 확정했으며, 나머지 17개는 검토 대상으로 남았다. 스크립트 자체는 1초 미만에 실행됐지만 사람의 100개 수작업 시간과 전체 요구 정리·수정·검산 시간을 재지 않았다. ‘사람보다 몇 배 빠르다’는 결론은 낼 수 없다.
여기서 도구보다 중요한 것은 결과가 원본 파일·시트·셀로 되돌아갈 수 있는지, 누락·중복·결측이 검토 목록으로 분리되는지다. 입력 형식이 제각각이고 정답 샘플이 없다면 빠른 실행은 품질을 보장하지 않는다.
유효한 파일과 바로 쓸 수 있는 파일은 달랐다
Lovable·Bolt·Replit에는 같은 합성 PPTX 두 개와 같은 요구를 보냈다. 세 도구 모두 최종적으로 20장과 111개 문구를 보존한 유효한 파일을 만들었다. 하지만 세 출력 모두 글자와 배경의 대비가 부족하거나 내용이 보이지 않는 슬라이드가 남아 일관된 가독성 기준에는 미달했다.
이는 PPTX 포맷 통일이라는 한 과제의 결과다. 세 서비스의 웹사이트 제작 품질이나 일반적인 우열을 뜻하지 않는다.
웹사이트 시안 실험에는 실행 결과가 없다
v0로 랜딩 페이지를 만드는 별도 실험은 로그인 전에 중단됐기 때문에 생성 품질, 크레딧 소비, 모바일 화면, 공개 배포에 관해 관찰한 결과가 없다. 공식 문서에 기능이 있다는 사실을 실험 성공으로 바꾸지 않는다.
데이터 화면은 차트보다 숫자 관계를 먼저 고정해야 했다
USGS 피드에서 저장한 파일은 2,276행이었고, 이 가운데 지진은 2,274행이었다. 피드 이름은 M2.5+였지만 고정 스냅샷에는 저장된 규모 값이 2.5 미만인 지진 17행이 있었다. 단일 스냅샷만으로 그 값의 이전 버전이나 수정 이력까지 확인한 것은 아니다. 첫 화면은 최소 규모 값을 비워 둔 채 2,274건을 모두 보여 주면서 ‘2.5 이상’이라고 설명했다. 자연어로 초기 최소 규모와 초기화 값을 2.5로 맞춘 뒤 기본 건수는 2,257건이 됐고 사전 계산과 일치했다.
수정 뒤에는 다섯 필터 조합, 오류 파일, 375×812 화면, 키보드 조작, 내보낸 폴더 재실행을 확인했다. 브라우저 관찰에서는 로컬 주소 127.0.0.1 밖으로 나간 요청이 없었다. 이는 정적 앱 한 개의 제한된 네트워크 관찰이지 Codex나 다른 공급사의 개인정보 처리 점수가 아니다. USGS 피드는 계속 바뀌므로 같은 URL의 현재 값과 이 고정 스냅샷도 구분해야 한다.
유지보수는 새 기능보다 다시 확인할 범위가 늘어났다
별도 앱 Pocket Tasks에는 우선순위, 마감일, 제목 편집을 차례로 추가했다. 자동 테스트는 7개에서 18개로 늘었고, 실제로 실행한 검사에서는 기존 기능이 깨지는 회귀를 발견하지 못했다. AI에 보낸 수정 요청도 0회였다.
그렇다고 유지보수가 쉽다는 뜻은 아니다. 빈 줄을 뺀 앱 코드는 214줄에서 361줄, 테스트는 37줄에서 123줄로 늘었다. 삭제 동작 일부와 손상된 저장값을 화면에 직접 넣는 검사는 반복하지 못했다. 이 사례가 보여 준 것은 테스트가 이전 동작을 반복해서 확인할 경로를 제공했다는 점과, 기능이 늘수록 검증 표면도 커진다는 점이다.
가격은 순위가 아니라 발행일의 조건이다
구독 질문 실험에서도 기본 모드가 서로 다른 ChatGPT·Claude·Grok의 첫 답변 모두에 오류나 과장이 있었고, 공식 원문을 다시 확인한 뒤에야 개선됐다. 그래서 가격 정보는 AI 답변이 아니라 2026년 9월 6일 다시 확인한 공식 페이지를 기준으로 삼았다. 여러 무료 시작 경로가 있었지만 서비스마다 무료 사용량 단위가 빌드 크레딧, 토큰, 에이전트 크레딧, 메시지 수로 달라 서로 환산할 수 없다. 추가 결제 0원으로 실험했다는 사실도 모든 독자가 무료로 같은 결과를 얻는다는 뜻이 아니다.
결제하거나 공개 발행하기 직전에는 ChatGPT, Claude, Grok, Lovable, Bolt, Replit, v0, Cursor의 현재 공식 페이지를 다시 확인해야 한다. USGS 데이터의 필드와 갱신 조건은 USGS CSV 문서, 로그인 보안의 출발점은 OWASP Authentication Cheat Sheet와 NIST SP 800-63B에서 확인할 수 있다.
결론: 제품보다 먼저 멈출 기준을 고르자
아홉 주제는 하나의 최고 도구를 가리키지 않았다. 대신 낮은 위험의 작은 과제에서는 합성 입력과 독립적인 정답이 있을 때 첫 결과가 빠르게 실제 도구 후보가 될 수 있음을 보여 줬다. 반대로 화면이 완성처럼 보여도 숫자, 가독성, 권한, 보안, 내보내기, 유지보수는 따로 확인해야 했다.
시작할 때는 다음 여섯 단계로 시작할 수 있다.
- 실제 자료 대신 복사본이나 작은 합성 샘플을 넣는다.
- 맞아야 할 숫자·문구·동작 하나를 먼저 적는다.
- 첫 결과를 덮어쓰지 않고 보존한다.
- 결과 파일이나 코드를 도구 밖으로 꺼내 실제 프로그램에서 연다.
- 같은 입력으로 다시 실행하고 결과가 유지되는지 본다.
- 로그인·타인의 정보·결제처럼 위험이 큰 기능인데 대조할 답이 없다면 범위를 줄이거나 전문가 검토를 받는다.
이것은 실제 초보자 집단에서 검증한 완전한 안전 절차가 아니다. 이 시리즈가 그럴듯한 결과와 확인된 결과를 구분하기 위해 사용한 출발점이다.
이 글은 AI를 활용해 자료 조사와 초안 작성을 보조하고, 작성자가 직접 검증·편집했습니다.
댓글 남기기