본문 바로가기

IT & AI

AI 코딩 모델 11개를 같은 조건으로 돌려보니 비용과 결과가 달랐어요

728x90

AI 코딩 모델 11개를 같은 조건으로 돌려보니 비용과 결과가 달랐어요

AI 뉴스 썸네일
AI 뉴스 썸네일

Netlify가 AI 코딩 모델 11개에 같은 커피숍 웹사이트 제작 지시를 주고, 모델마다 3번씩 실행했어요. 가장 비싼 실행이 늘 가장 나은 결과를 내지는 않았고, 같은 모델 안에서도 비용과 디자인 편차가 컸어요. 1

핵심 요약

구분확인된 결과실무에서 볼 점
비용실행당 2.4~1,055 크레딧으로 차이가 컸어요모델 이름보다 작업별 예산 범위를 먼저 정해야 해요
결과물같은 모델을 3번 실행해도 디자인과 콘텐츠가 달라졌어요한 번의 결과만으로 모델을 평가하기 어려워요
고가 모델Claude Opus 5가 풍부한 화면을 만들었지만 비용 변동도 컸어요높은 비용이 같은 비율의 품질 향상을 보장하지 않아요
저가 모델GLM 5.2, Kimi K2.7 Code, DeepSeek V4 Flash도 웹페이지를 만들었어요여러 번 시도하고 사람이 고르는 방식도 비교할 만해요

1. 모델 가격표보다 작업별 결과를 먼저 비교해야 해요

Netlify는 영업시간, 주소, 메뉴, 사진이 들어간 동네 커피숍 한 페이지를 만들어 달라고 요청했어요. 콘텐츠 관리 시스템이나 데이터베이스가 필요하지 않은 정적 사이트였어요. 11개 모델을 기본 설정으로 각각 3번 실행한 뒤 화면 구성과 소비 크레딧을 함께 비교했어요. 2

비용 범위는 예상보다 넓었어요. Claude Opus 5는 평균 519 크레딧을 썼고, 세 번의 실행 중 하나는 1,055 크레딧까지 올라갔어요. 같은 모델의 나머지 두 번은 253, 249 크레딧이었어요. 한 모델 안에서도 실행 비용이 4배 넘게 벌어진 셈이에요.

728x90

Claude Opus 5는 스탬프 모양 장식, 맞춤 지도, 다크 모드처럼 시각적 디테일이 많은 결과를 냈어요. 다만 1,055 크레딧을 쓴 화면이 249 크레딧 결과보다 4배 낫다고 평가하기는 어려웠어요. 고가 모델을 고르면 결과가 풍부해질 여지는 있지만, 예산을 그대로 품질 점수로 읽으면 안 되는 이유예요.

비슷한 비용에서도 모델별 성향이 달랐어요. Claude Sonnet 5는 평균 143 크레딧, GPT 5.6 Sol은 평균 141 크레딧을 썼어요. Netlify의 이번 작업에서는 GPT 5.6 Sol 쪽이 콘텐츠가 더 풍부했고 기본 디자인도 나았다고 평가했어요. 이 결과는 단순 웹 디자인 작업 하나에 한정돼요. 복잡한 코딩이나 추론 능력의 종합 순위로 받아들이면 범위를 벗어나요.

저가 모델도 선택지에서 빠지지 않았어요. GPT 5.6 Terra는 평균 39 크레딧으로 단순하지만 별도의 시각 방향을 제시했어요. GLM 5.2는 평균 27 크레딧, Kimi K2.7 Code는 19 크레딧을 썼어요. DeepSeek V4 Flash 0731은 평균 2.4 크레딧으로 가장 저렴했어요. 대신 이미지 누락, 낮은 텍스트 대비, 깨진 이미지 경로처럼 완성도를 낮추는 문제가 일부 결과에서 나왔어요.

평균만 보면 놓치는 실행 편차

모델 비교표의 평균값은 예산을 가늠하는 출발점이에요. 실제 운영에서는 같은 모델을 다시 돌렸을 때 비용과 화면이 얼마나 흔들리는지도 봐야 해요. GLM 5.2는 세 번에 15, 42, 24 크레딧을 썼고, 결과 디자인도 서로 다른 모델이 만든 것처럼 달랐어요. 반복 실행을 전제로 한다면 평균 비용뿐 아니라 최댓값과 실패 결과를 버리는 비용까지 계산해야 해요.

작업 유형이 바뀌면 순위도 달라질 수 있어요

이번 비교는 정적 커피숍 사이트의 첫 생성 결과만 다뤘어요. 여러 사용자가 쓰는 할 일 앱, 사진 업로드, AI 요리 추천처럼 데이터베이스와 서비스 기능이 필요한 작업은 후속 비교 대상이에요. Kimi K3처럼 장시간 복합 작업을 겨냥한 모델이 단순 디자인에서 돋보이지 않았다고 해서 코딩 능력이 낮다고 볼 근거는 없어요.

Netlify도 기능 검증에는 별도의 평가 도구를 사용해요. 필요한 데이터베이스를 제대로 붙였는지, 단순한 사이트를 불필요하게 복잡하게 만들지 않았는지처럼 작동 여부를 따로 검사해요. 화면이 보기 좋은지와 실제 앱이 안전하고 정확하게 작동하는지는 같은 평가 항목이 아니에요.

왜 중요한가요

AI 코딩 도구를 도입할 때 최고가 모델 하나를 고정하면 선택은 간단해져요. 하지만 반복 작업이 많으면 예상 밖의 크레딧 소비가 누적될 수 있어요. 반대로 저가 모델만 고르면 사람이 고치거나 다시 실행하는 시간이 늘어날 수 있어요. 팀은 생성 비용과 수정 시간을 함께 기록해야 실제 작업당 비용을 비교할 수 있어요. 2

모델을 고를 때는 대표 작업 3~5개를 정하고, 각 작업을 여러 번 실행해 보는 편이 안전해요. 결과가 기능 요구를 충족했는지, 수정에 몇 분이 들었는지, 실행 비용이 얼마나 흔들렸는지를 같은 표에 남기면 돼요. 디자인 초안은 저가 모델로 여러 방향을 받아 보고, 인증·결제·데이터 변경처럼 오류 비용이 큰 작업은 검증 강도를 높이는 식으로 나눌 수도 있어요.

이번 수치는 Netlify의 크레딧 체계와 기본 설정에서 나온 값이에요. 다른 서비스의 토큰 가격이나 개발 환경에 그대로 대입할 수 없어요. 그래도 모델 가격과 결과 품질이 일직선으로 움직이지 않았고, 한 번의 실행만으로도 판단하기 어려웠다는 관찰은 모델 평가 방식을 정할 때 참고할 만해요.

참고 자료

  1. AI 모델 고르기: 같은 프롬프트, 11개 모델, 매우 다른 결과 — GeekNews
  2. Choosing an AI model: one prompt, 11 models, very different results — Netlify
728x90