3,271원으로 유튜브 쇼츠 한 편을 만들었다 — 세 편을 만들며 배운 것

AI로 영상을 만드는 일의 어려움은 생성이 아니라 그 앞뒤에 있다. 세 편을 만드는 동안 편당 비용은 5,568원에서 3,271원으로 41% 내려갔다 — 소재를 줄여서가 아니라 도구가 늘어서다.

AI로 영상을 만드는 일의 어려움은 생성이 아니라 그 앞뒤에 있습니다. 소재를 고르는 일과, 나온 것을 검수하는 일입니다. 이 글은 지식 쇼츠 세 편을 기획부터 업로드까지 만들며 실측한 기록입니다.
결과부터 — 세 편 실적표
세 편 모두 유튜브에 공개돼 있습니다. 값이 41% 내려간 건 소재를 줄여서가 아니라 도구가 늘어서입니다.
| 001 뮐러-라이어 | 002 최후통첩 | 003 닉스타말화 | |
|---|---|---|---|
| 공개 | 2026-08-19 | 2026-08-19 | 2026-08-20 |
| 길이 | 71.1초 | 64.3초 | 72.6초 |
| 소재 | 영상 16 | 영상 10 | 영상 8 + 이미지 8 |
| 크레딧 | 192 | 120 | 96 |
| 비용 | 5,568원 | 3,480원 | 3,271원 |
| 재생성 | 0 | 0 | 0 |
| 내보내기 | 4회 | 1회 | 3회 |
| 오디오 정렬 | 0.15초 | 0.05초 | 0.05초 |
생성은 348원이면 끝난다. 비싼 건 그 앞의 소재 선정과 그 뒤의 검수다.
무엇을 만드는 채널인가
문화인류학·심리학 지식을 다루는 채널입니다. 한 편의 뼈대는 예측오류입니다 — 누구나 아는 상식을 한 문장으로 세우고, 그 상식이 실제로는 틀렸거나 반만 맞다는 걸 1차 자료로 보여줍니다. 첫 편으로 뮐러-라이어 착시를 고른 이유, 채점 기준, 팩트체크 절차는 3편에서 따로 다룹니다.
파이프라인 전경
여덟 단계를 거칩니다. 3편부터는 영상 생성 옆에 이미지 생성이 갈라져 나왔습니다 — 피사체가 안 움직이는 컷은 영상 대신 이미지로 뽑습니다.
| 단계 | 산출물 | 도구 |
|---|---|---|
| 1. 소재 발굴 | 채점된 후보 목록 | WebSearch |
| 2. 대본 + 팩트체크 | 예측오류 5비트 대본 | Claude Code |
| 3. 영상 프롬프트 | 멀티샷 프롬프트 | Claude |
| 3-b. 이미지 프롬프트 | 정물 컷 | Claude |
| 4. 음성 | 나레이션 오디오 | 타입캐스트 '필재' |
| 5. 영상 생성 | 8초 클립 | 구글 플로우(Veo / Omni Flash) |
| 5-b. 이미지 생성 | 9:16 정물 이미지 | Gemini API(Nano Banana 2) |
| 6. 편집 | 완성본 mp4 | 캡컷 |
| 7. 검수 | 합격/불합격 판정 | ffmpeg/ffprobe + 자작 스크립트 |
| 8. 업로드 | 공개된 쇼츠 | 유튜브 |
도구를 왜 이렇게 골랐나
| 단계 | 도구 | 이유 |
|---|---|---|
| 소재·대본 | Claude Code | 웹 조사와 팩트체크를 같은 자리에서 한다 |
| 영상 | 구글 플로우(Veo / Omni Flash) | 8초·멀티샷·9:16 지원. 컷당 348원 |
| 이미지 | Gemini API(Nano Banana 2) | 정물 컷. 장당 61원 · 가시 워터마크 없음 |
| 음성 | 타입캐스트 '필재' | 이 장르에서 익숙한 목소리 = 장르 신호 |
| 편집 | 캡컷 | 9:16과 자막 처리가 쇼츠에 맞는다 |
| 검수 | ffmpeg/ffprobe + 자작 스크립트 | 눈으로 안 보이는 사고가 있다 |
시간이 어디서 샜나
기획·대본·프롬프트는 매끄러웠습니다. 왕복은 전부 편집과 내보내기에서 났습니다. 1편은 내보내기를 네 번 했고, 네 번 모두 재생해서는 못 잡는 문제였습니다.
| 내보내기 | 문제 | 어떻게 발견 |
|---|---|---|
| 1회 | 자막이 하단 8% — 쇼츠 UI가 덮는 자리 | 격자 크롭 실측 |
| 2회 | 타임라인 앞 2.4초 유실(훅이 통째로 사라짐) | 오디오 상관분석 |
| 3회 | 자막 텍스트 3건이 대본과 다름(건물은 누락) | 자막 컨택트 시트 |
| 4회 | 출처 자막이 상단 11% — 이번엔 위쪽 UI에 걸림 | 격자 크롭 실측 |
"재생해서 괜찮아 보였다"는 검수가 아니다.
그리고 세 편 다 자막 높이에서 걸렸습니다. 1편 4회, 3편 3회. 같은 실수를 세 번 하면 그건 사람 문제가 아니라 기본값을 안 정해 둔 것입니다 — 2편이 유일하게 1회로 끝난 이유는 캡컷 트리밍 자체를 없앴기 때문입니다. 6편에서 그 방법을 다룹니다.
시리즈 안내
이 글은 전체 지도입니다. 각 항목의 상세는 아래 여섯 편으로 넘어갑니다.
- 2편 — RTX 5070으로 AI 영상 공짜 생성? 재보고 접었다: 로컬 GPU를 재본 실측과, 시도했다가 틀렸던 가설 두 개
- 3편 — 소재 고르기가 가장 비싼 단계다: 채점표·팩트체크·압축하다 어법이 깨진 실패담, 세 편 실측한 분량 추정 오차
- 4편 — 크레딧 경제학: 멀티샷으로 화면 3배, 워터마크 정정, 안전 필터에 거부당한 이야기
- 5편 — AI 영상 절반을 이미지로 바꿨다: 피사체가 안 움직이면 영상을 뽑지 않는다 — 비용도 워터마크도 같이 풀린 이유
- 6편 — 재생해서는 안 보이는 사고들: 이 시리즈에서 가장 강한 글. 오디오 상관분석으로 잘린 2.4초를 찾은 과정, 왕복을 없앤 방법
- 7편 — 사고를 스크립트로 바꾸기: 합성 콘텐츠 고지, 무엇이 잘못됐는지, 검사 도구 자신을 검사한 이야기
글로 설명한 내용이 실제로 어떤 문서였는지 궁금하다면, 실물 제작 런북을 그대로 공개해 뒀습니다 — 대본 전문·16개 영상 프롬프트·조립 타이밍표까지 한 글자도 고치지 않은 원본입니다.
이 시리즈는 제가 실제로 만든 유튜브 쇼츠(1편 완성본 보기)의 제작 기록입니다. 문화인류학·심리학 소재로 상식을 뒤집는 지식 쇼츠를 만듭니다.
발행 2026-08-19 · 최종 확인 2026-08-20(3편 반영)