본문 바로가기

IT & AI

100달러로 AI가 뮤직비디오를 만들었지만, 편집 감각은 따라오지 못했어요

728x90

100달러로 AI가 뮤직비디오를 만들었지만, 편집 감각은 따라오지 못했어요

AI 뉴스 썸네일
AI 뉴스 썸네일

Claude Fable 5와 GPT-5.6 Sol이 같은 노래를 받아 뮤직비디오 제작 전 과정을 맡았어요. 두 모델은 영상 생성 도구를 직접 고르고, 클립을 만든 뒤 ffmpeg로 이어 붙여 1시간 안에 완성본을 내놓았어요. 제작 자동화는 꽤 멀리 왔지만, 캐릭터와 이야기의 일관성은 아직 사람이 챙겨야 했어요. 1

핵심 요약

구분확인된 결과눈여겨볼 점
완주 능력4번의 실행이 모두 원곡 전체 길이의 영상을 완성했어요조사, 생성, 편집을 한 번에 이어 가는 작업은 가능했어요
제작 시간실행마다 약 39~50분이 걸렸어요긴 영상도 1시간 안에 조립했어요
실제 비용100달러 실행의 총비용은 Sol 39.82달러, Fable 73.65달러였어요생성비 외에 언어 모델 토큰 비용도 따로 봐야 해요
영상 품질인물 외형, 이야기, 동작과 음악의 박자가 자주 어긋났어요클립 생성보다 선별과 재편집이 더 큰 약점으로 남았어요

1. 1시간 안에 완성본은 만들었지만, 좋은 연출까지 자동화하진 못했어요

실험에서는 두 모델에 같은 곡인 `Uptown Funk`, 가사와 타임스탬프, 25달러 또는 100달러의 영상 생성 예산을 줬어요. 웹 검색, 이미지·영상 생성, 예산 확인, 로컬 ffmpeg 실행 도구도 함께 제공했어요. 모델은 사용할 생성 서비스를 조사하고 클립을 만든 뒤 음원과 결합했어요. 네 번 모두 중간에 멈추지 않고 원곡 전체 길이의 720p 또는 1080p 영상을 완성했어요. 1

방식은 실행마다 달랐어요. Fable의 25달러 실행은 Wan 2.5 텍스트 투 비디오를 골랐어요. Sol의 25달러 실행은 FLUX schnell로 정지 이미지를 만든 뒤 Wan 2.2-5b로 움직임을 더했어요. Sol의 100달러 실행은 Wan 2.5, Veo 3.1 Lite, Hailuo 2.3 Standard를 섞었고, Fable의 100달러 실행은 Seedance 1.0 Pro만 사용했어요. 같은 입력과 도구를 줘도 모델이 고른 제작 경로는 달랐어요.

728x90

비용 차이도 컸어요. 100달러 예산에서 Sol은 영상 생성에 36.57달러를 썼고, 언어 모델 비용까지 더한 총비용은 39.82달러였어요. Fable은 생성에 48.60달러를 썼으며 총비용은 73.65달러였어요. Fable 쪽은 언어 모델 비용이 전체의 약 30~40%를 차지했어요. 영상 API 가격만 비교하면 실제 제작비를 낮게 잡을 수 있다는 뜻이에요.

완성 여부와 작품성은 따로 봐야 해요. 네 영상 모두 장면마다 인물의 외형이 달라졌고, 처음부터 끝까지 이어지는 이야기도 약했어요. 컷의 시작점은 음악 비트에 맞췄지만, 춤이나 카메라 이동처럼 클립 안에서 일어나는 동작은 곡의 템포와 잘 맞지 않았어요. 가사를 문자 그대로 화면에 옮기는 장면도 반복됐어요. 제작진도 네 결과물 가운데 뛰어난 영상은 없었다고 평가했어요.

생성한 클립을 다시 보고 버리거나 고쳐 쓰는 과정도 부족했어요. 대부분의 실행은 여러 클립을 만든 뒤 순서대로 연결하는 수준에 머물렀어요. 남은 예산으로 캐릭터 기준 이미지를 만들거나 품질이 낮은 장면을 다시 생성할 수도 있었지만, 모델은 그 선택을 거의 하지 않았어요. 생성 모델의 성능보다 무엇을 남기고 버릴지 판단하는 편집 과정에서 차이가 더 선명하게 드러났어요.

실험 코드는 공개돼 있어요. 곡과 예산, 비교할 모델을 바꿔 같은 방식으로 실행해 볼 수 있고, 각 실행이 어떤 도구를 썼는지도 확인할 수 있어요. 3

왜 중요한가요

영상 제작 도구를 평가할 때는 짧은 샘플의 화질만 보기 쉬워요. 이번 결과는 긴 작업에서 다른 기준이 필요하다는 걸 보여줘요. 40~50분 동안 도구를 고르고 수십 개의 클립을 만들어 완성 파일까지 내는 능력은 확인됐어요. 반면 반복되는 인물을 유지하고, 장면을 이야기로 묶고, 음악에 맞춰 동작을 조절하는 능력은 부족했어요. 1

실무에서는 영상 생성 횟수를 늘리는 것보다 검토 단계를 구체적으로 설계하는 편이 나아요. 캐릭터 기준 이미지 고정, 장면별 품질 점수, 박자와 동작의 동기화 검사, 낮은 점수 클립 재생성 같은 절차가 필요해요. 예산 상한만 높여도 모델이 남은 돈을 품질 개선에 쓰지는 않았기 때문이에요.

비용 계산도 생성 API와 언어 모델을 나눠 봐야 해요. 같은 100달러 조건에서도 총비용이 39.82달러와 73.65달러로 벌어졌어요. 제작 시간은 Fable이 더 짧았지만, 비용은 더 높았어요. 빠른 완성, 낮은 비용, 영상 품질을 한 숫자로 비교하기 어려워요. 자동 영상 제작 서비스를 설계한다면 각 항목을 따로 측정해야 해요.

참고 자료

  1. $100 AI Music Video: Claude Fable 5 vs. GPT-5.6 Sol — TryAI
  2. 100달러 AI 뮤직비디오 제작 대결: Claude Fable 5 vs. GPT-5.6 Sol — GeekNews
  3. music-video-arena — GitHub
728x90