쓸모 쓸모연구소 · 실전 노트
제 106 호이번 주 새 글 1 편2026 · 09 · 26
AI 크리에이티브
Gemini · Google Flow · CapCut

AI 건축 쇼츠 만드는 법: 제미나이 대본부터 구글 플로우 영상까지

AI 건축 쇼츠 만드는 법을 처음부터 끝까지 따라 할 수 있게 정리했습니다. 제미나이(구글의 AI 챗봇)로 잘 되는 채널의 구조를 뜯고, 이미지 작업은 통째로 건너뛰고, 구글 플로우(구글의 AI 영상 제작 사이트)에서 Veo 옴니 플래시(구글의 영상 생성 AI 모델)로 8초 영상만 뽑은 뒤, 타입캐스트(AI 성우 목소리 서비스) 목소리를 얹어 캡컷(영상 편집 앱)에서 붙이는 순서입니다. 영상 출연자는 이 과정을 30분에 끝냈다고 말합니다.

AI 건축 쇼츠 만드는 법: 제미나이 대본부터 구글 플로우 영상까지 삽화
삽화 · 쓸모연구소

이 글은 유튜브 자막을 기반으로 정리했습니다. 일부 도구명 표기가 부정확할 수 있고, 성과·비용 수치는 모두 출연자 주장입니다. 원본 영상: youtu.be/…

왜 이 AI 건축 쇼츠 방식이 통한다고 보는가

참고한 채널은 "신비한 건축 사전"입니다. 최근 구독자 50만을 넘겼습니다. 그러니까 지금부터 뜯어볼 구조는 그럴듯한 이론이 아니라 숫자로 한 번 증명된 구조라는 게 출연자의 전제입니다.

핵심은 두 가지로 요약됩니다. 하나는 대본 구조, 다른 하나는 이미지 단계를 건너뛴 생산 속도.

준비물은 구글 계정 하나로 시작합니다. 제미나이와 구글 플로우 모두 구글 계정으로 로그인해서 쓰고, 목소리를 만들 타입캐스트는 따로 가입합니다.

1단계 — 레퍼런스 영상 URL 복사하기

레퍼런스는 따라 할 구조를 배울 참고 영상을 말합니다.

  1. 참고할 채널에 들어가 영상을 인기순으로 정렬합니다.
  2. 조회수가 가장 높은 영상을 클릭합니다. 출연자가 고른 건 한강 관련 영상이었습니다.
  3. 영상 위 주소창의 URL만 복사합니다.

확인: 채널 주소가 아니라 개별 영상 주소를 복사했는지 보세요.

2단계 — 제미나이로 그 영상을 분해한다

접속 경로

구글 접속 → 우측 상단 구글 앱 메뉴 클릭 → 목록에서 제미나이 앱 클릭.

입력할 질문

복사한 URL을 붙여넣고 이렇게 묻습니다.

프롬프트
이 영상이 어떤 스타일인지, 시각 자료는 어떻게 구성했는지,
조회수는 왜 잘 나오는지 분석해 줘.

유튜브도 구글이고 제미나이도 구글이라 유튜브 링크를 잘 읽는다는 게 출연자 설명입니다.

나온 분석을 그냥 넘기지 마세요

콘텐츠가 익숙하지 않다면 결과를 한 줄씩 읽어 보는 게 좋습니다. 실제로 나온 내용은 이렇습니다.

  • 오프닝 훅(첫 몇 초에 시청자를 붙잡는 장면이나 문장): "한강이 사실 강이 아니라 인공적으로 가둔 물"이라는 상식 파괴를 초반 3초에 배치
  • 서사 구조: 문제 제기 → 해결 → 질문 유도 → 발상의 전환 → 다음 내용에 대한 궁금증
  • 이 구조의 이름은 예측 오류입니다. 마술사가 손수건을 흔들어 한쪽만 보게 만든 다음, 전혀 다른 데서 비둘기를 꺼내는 그 구조요.

구조만 참고하고 내용은 베끼지 않는다

구조를 참고하라는 거지 내용을 그대로 가져오라는 게 아닙니다. 소재도 다르게, 문장도 내 말로 다시 씁니다.

3단계 — 소재 후보 좁히고 대본 만들기

후보 요청 프롬프트

프롬프트
해당 영상의 반전 요소와 전개 구조를 고려해서 새로운 나만의 영상을 만들 거야.
주제는 해외에서 반전 및 문제 해결이 필요했던 서사가 있는 건물로 후보를 줄여 줘.

"산 한가운데 구멍을 뚫은 교량" 같은 후보들이 쭉 나옵니다. 출연자는 그중에서 고르지 않았습니다. 전에 유튜브에서 본 적 있는 런던 밀레니엄 브리지를 직접 지목해 그 서사를 반영해 달라고 다시 요청했습니다. 개통 직후 폐쇄됐다가 과학으로 극복한 이야기라 반전 구조에 맞아떨어졌기 때문입니다.

나온 훅

새천년을 기념해 300억을 들여 만든 다리가 개통 3일 만에 문을 닫았습니다.

300억을 썼는데 3일 만에 닫았다. 이 대비가 훅입니다. 본문에는 "동조 현상" 같은 과학 용어도 들어갑니다. 동조 현상은 많은 사람의 발걸음이 다리의 흔들림에 맞춰지면서 흔들림이 점점 커지는 현상입니다.

대본은 손으로 고친다

출연자는 여기서 대본을 자기 스타일로 수정했습니다. 더 흥미롭게, 인간미가 살아 있게. 그다음 수정본을 다시 넣고 이렇게 요청합니다.

프롬프트
이 스크립트에서 부족한 점을 확인해 주고, 팩트 체크도 해 줘.

날짜 하나가 살짝 틀렸다고 잡아 줬습니다.

확인: 이 단계는 건너뛰지 마세요. 지식 콘텐츠는 숫자 하나 틀리면 댓글에서 바로 잡히고, 그 순간 신뢰가 무너집니다.

4단계 — 이미지를 건너뛰고 영상 프롬프트 18개를 뽑는다

보통은 이미지를 만들고 그 이미지로 영상을 만듭니다. 그런데 레퍼런스 채널을 자세히 뜯어보니 영상 사이에 일관성을 유지하려는 흔적이 딱히 없었습니다. 바로 영상화 프롬프트로 뽑은 케이스라는 거죠. 하루에 6~7개씩 올릴 수 있는 이유도 이미지 단계를 스킵했기 때문이라고 출연자는 봅니다.

제미나이에 요청한 것

  • 스크립트 기준으로 영상 프롬프트 18개 제작
  • Veo 옴니 모델용 프롬프트로 제시 (레퍼런스 채널들이 이 모델을 쓰는 걸 확인해서)
  • "하단의 프롬프트와 똑같은 구조·어휘·길이로 만들되 내용은 스크립트에 맞춰 달라"
  • 본인이 삽질해 가며 결과가 괜찮았던 레퍼런스 프롬프트를 아래에 첨부

레퍼런스 프롬프트에 넣어 둔 설정

  • 카메라는 8초에 비트 2개까지. 한 영상 안에서 장면 구분은 최대 2개까지만.
  • 사건이 진행되는 동안에는 횡이동만.
  • 끝날 때 급속 푸시인 클로즈업.
  • 계측선은 빨간색으로 표시.
  • 한국어로 설명하고 영문 코드 블록으로 출력. 바로 복사할 수 있는 코드 박스 형태로.
  • 설정표와 글자수를 함께 전달.
  • 영상에서 충돌이 날 수 있는 부분을 점검해 위험도까지 알려 달라.

몇 가지 용어를 풀면 이렇습니다. 비트는 한 영상 안에서 카메라 움직임이 바뀌는 단위, 횡이동은 카메라가 옆으로 미끄러지듯 움직이는 것, 푸시인 클로즈업은 카메라가 빠르게 다가가며 대상을 크게 잡는 것, 계측선은 길이나 흔들림 폭을 보여 주는 표시선입니다.

결과로 18개 장면 분해와 장면별 복사용 프롬프트(AI에게 입력하는 지시문)가 나옵니다.

8초 × 18개면 2분이 넘는데요

쇼츠는 1분 남짓입니다. 통째로 쓰는 게 아니라서 그렇습니다.

여행 가서 사진 100장 찍으면 다섯 장 건지죠. 영상도 같습니다. 그중 진짜 좋은 건 3초 정도. 넉넉하게 뽑아 두고 좋은 부분만 잘라 씁니다. 나중에 말이 끝나는 지점에서 화면을 넘기려면 애초에 잘라 낼 여유분이 있어야 합니다.

멀티샷 (선택)

레퍼런스 채널 영상을 보면 한 문장 말하는 동안 화면이 두세 번 바뀝니다. 많이 뽑아 이어 붙인 게 아니라 멀티샷입니다.

영상 하나를 뽑을 때 그 안에 샷을 여러 개 넣어 달라고 지정하는 방식입니다. 8초를 3초·3초·2초 세 장면으로요. 크레딧(구글 플로우에서 영상을 만들 때마다 차감되는 사용 단위)은 똑같이 12크레딧인데 쓸 수 있는 화면은 세 배가 됩니다. 같은 프롬프트 안에서 만들어지니 톤도 안 흔들립니다.

출연자 본인은 컷마다 한두 장면씩 통으로 뽑았습니다. 더 촘촘하게 가고 싶으면 멀티샷으로 요청하면 됩니다.

5단계 — 구글 플로우에서 AI 영상 생성

진입 경로

구글에 "플로우"(FL)로 검색 → 구글 랩스의 Google Flow 클릭 → New 프로젝트 클릭.

설정값

프롬프트 입력창 옆의 이미지 혹은 동영상을 클릭한 뒤 세팅을 이렇게 잡습니다.

  • 세팅: 동영상
  • 비율: 9:16 (쇼츠니까, 세로 화면 비율)
  • 모델: 옴니 플래시
  • 길이: 8초
  • 곱하기: 1 → 생성 시 12크레딧 소모

이제 제미나이가 준 장면별 프롬프트를 복사해 붙여넣고 생성하면 됩니다.

마음에 안 들 때 고치는 법 (실제 사례)

4번째 샷이 흔들리는 다리 장면이었는데, 뽑아 보니 배경에 물이 없어 지루해 보였습니다.

  1. 플로우에서 "물과 전경이 더 보이게 만들어 달라"고 요청 → 개선됨
  2. 이번엔 흔들림 폭 7cm를 화면에 표기하고 싶어짐
  3. 그런 수정 사항은 제미나이로 돌아가 4번째 샷 프롬프트만 수정 요청
  4. 수정된 프롬프트를 복사 → 구글 플로우 입력창에 붙여넣기 → 동일하게 8초로 세팅 → 재생성

오류는 그냥 두세요

솔직히 오류가 납니다. 텍스트가 뭉개지고 깨지는 경우가 있어요. 그런데 이런 건 굳이 잡지 않는 편이 낫다는 게 출연자 입장입니다. 그거 잡자고 시간 쓸 바에 다음 영상을 만드는 게 쇼츠에서는 유리하니까요. 완벽하게 만들려고 붙잡고 있는 시간에 하나 더 만드는 쪽이 이득입니다.

비용은 얼마나 드나 (출연자 계산)

  • 구글 원 프로(구글의 유료 구독 요금제) 계정 월 29,000원 → 옴니 플래시 사용 가능, 구글 플로우 크레딧 월 1,000크레딧 제공
  • 1크레딧 = 29원
  • 8초 영상 1개 = 12크레딧 = 348원
  • 한 편에 8초짜리 10~12개를 쓴다면
  • 10개 = 120크레딧 = 3,480원
  • 12개 = 144크레딧 = 4,176원
  • 즉 한 편당 3,500~4,200원. 커피 한 잔값입니다.
  • 월 1,000크레딧이면 6~8편.

아끼고 싶다면 8초를 6초로 줄여 컷 수를 더 확보하는 방법이 있습니다. 다만 편집할 때 여유 폭이 줄어듭니다. 출연자는 18개를 8초로 뽑아 216크레딧을 썼습니다. 넉넉하게 쓴 편이죠.

그리고 구글 플로우에 데일리 보너스가 있습니다. 8월 31일까지 매일 50크레딧. 기한이 있으니 할 거면 지금 쓰는 게 좋고, 무료로도 옴니 플래시 6초 영상 다섯 개 정도는 뽑을 수 있는 양입니다. 이 기한과 보너스 양은 영상 시점 기준이라, 지금 조건은 구글 플로우 공식 안내에서 확인해야 합니다.

6단계 — 목소리는 타입캐스트에서

이 장르에서 익숙한 그 목소리, 타입캐스트의 필제입니다.

  1. 구글에 타입캐스트 검색 → 제일 위에 뜨는 아이콘 클릭
  2. New 프로젝트 클릭 → 제목 설정 → 확인
  3. 검색을 클릭하고 "필제"를 찾아 선택
  4. 스크립트를 그대로 복사해 입력

심리학 콘텐츠를 보는 분이면 바로 알아챌 목소리입니다. 교육 영상에서 자주 들리는 모건 같은 캐릭터도 있습니다. 잘 되는 채널이 쓰는 목소리는 대부분 여기 있다는 게 출연자 설명입니다.

팁 하나. 쇼츠 속 목소리를 찾아주는 사이트가 따로 있으니 영상 하단 정리를 참고하세요.

7단계 — 캡컷에서 편집

세로 화면 만들기

캡컷 앱을 다운로드해 실행하면 수정 버튼이 있습니다. 여기서 가로세로 비율을 쇼츠용 9:16으로 설정하고 저장하면 플레이어와 타임라인이 세로로 바뀝니다.

소스 가져오기

  1. 구글 플로우에서 만든 영상을 ⋯(점 세 개) 클릭 → 다운로드 → 원본 크기로 받습니다.
  2. 다 받았으면 캡컷에 드래그해서 올립니다.
  3. 미디어에 올린 영상들을 아래 타임라인으로 드래그합니다.
  4. 음성은 타입캐스트 옆 다운로드 버튼으로 오디오 파일을 받아, 영상 하단 트랙에 넣습니다.

자막

위쪽 텍스트로 직접 넣거나, 캡션 메뉴의 자동 생성 캡션(음성을 알아듣고 자막을 자동으로 만들어 주는 기능)을 씁니다. 캡션이 완료되면 옆에서 텍스트 스타일을 조정하면 됩니다.

참고로 출연자 본인은 프리미어 프로(어도비의 전문 영상 편집 프로그램)를 씁니다.

편집에서 지킬 건 딱 두 가지

  1. 말이 끝나는 지점에서 장면을 전환한다. 말은 이어지는데 화면만 혼자 넘어가면 시청자가 붕 뜹니다. 영상이 넘어갈 때 자막도 같은 시점에서 끊기게 맞춰 주세요.
  2. 자막을 넣는다. 쇼츠는 소리 없이 보는 사람이 굉장히 많습니다.

쇼츠는 업로드 주기가 핵심, 반복 작업은 스킬로

출연자는 결과물이 레퍼런스 채널보다 부족하다고 스스로 인정합니다. 똑같이 따라 하면 곤란하니 이 정도로만 구현했다는 이야기입니다.

쇼츠의 진짜 핵심은 업로드 주기입니다. 한 편을 잘 만드는 것보다 꾸준히 올리는 게 훨씬 중요한데, 대본 과정을 매번 손으로 반복하고 프롬프트를 매번 새로 짜면 지칠 수밖에 없습니다. 그래서 이런 반복 작업은 클로드 코드나 코덱스 같은 에이전트(컴퓨터에서 작업을 대신 수행하는 AI 도구)에 스킬(작업 순서를 적어 둔 설명서 파일)로 미리 세팅해 두고 돌립니다. 신입에게 하나하나 알려 준 뒤 매뉴얼을 만들어 놓고, 다음부터는 소재만 바꿔 달라고 시키는 것과 비슷합니다.

소재는 해외 건축물로 갔지만, 익숙한 한국 소재라면 조회수가 더 잘 나올 수 있습니다.

모든 프롬프트는 원본 영상 고정 댓글에 정리해 둔다는 안내도 있었습니다.

자주 묻는 질문

구글 플로우는 무료로 쓸 수 있나요?

무료 크레딧만으로도 조금은 만들 수 있습니다. 영상 시점에는 8월 31일까지 매일 50크레딧의 데일리 보너스가 있었고, 구글 원 프로 유료 계정은 월 1,000크레딧을 줬습니다. 보너스와 요금은 바뀌므로 구글 플로우 공식 안내를 확인해야 합니다.

AI 건축 쇼츠 한 편 만드는 데 비용은 얼마나 드나요?

출연자 계산으로는 한 편에 3,500~4,200원 정도입니다. 8초 영상 1개에 12크레딧, 한 편에 8초짜리 10~12개를 쓴다는 가정입니다. 실제 비용은 뽑는 개수와 길이에 따라 달라집니다.

이미지를 만들지 않고 바로 영상을 뽑아도 되나요?

장면 사이 일관성이 크게 중요하지 않은 쇼츠라면 됩니다. 출연자는 레퍼런스 채널도 이미지 단계를 건너뛴 것으로 보고, 제미나이로 영상 프롬프트를 바로 뽑아 구글 플로우에 넣었습니다. 대신 넉넉하게 뽑아 좋은 부분만 잘라 쓰는 걸 전제로 합니다.

쇼츠에 많이 나오는 AI 목소리는 어디서 구하나요?

영상에서는 타입캐스트의 "필제" 목소리를 썼습니다. 타입캐스트에서 새 프로젝트를 만들고 검색창에 "필제"를 찾아 선택한 뒤 대본을 붙여 넣으면 됩니다.

잘 되는 채널의 대본을 그대로 가져와도 되나요?

안 됩니다. 참고할 건 훅과 전개 같은 구조이고, 소재와 문장은 내 것으로 새로 써야 합니다. 쓴 대본은 제미나이에 팩트 체크를 맡겨 틀린 숫자나 날짜를 잡아 두는 게 좋습니다.

출처: youtu.be/…

원본 영상 보러가기 ↗