쓸모 쓸모연구소 · 실전 노트
제 106 호이번 주 새 글 1 편2026 · 09 · 26
AI 크리에이티브
Codex · Google Flow · CapCut

AI 건축 영상 만들기, 코덱스와 구글 플로우로 하는 법

코덱스(Codex)로 장면별 프롬프트를 만들고 구글 플로우(Google Flow)로 이미지와 동영상을 뽑아 AI 건축 영상을 만드는 순서를 정리했습니다. 준비물부터 플로우 세팅, 인포그래픽 이미지, 동영상 생성, 캡컷 편집, 타입캐스트 목소리까지 차례로 따라 할 수 있게 적었습니다. 영상이 말로만 넘긴 프롬프트는 바로 복사해 쓸 수 있는 예시로 채웠습니다.

AI 건축 영상 만들기, 코덱스와 구글 플로우로 하는 법 삽화
삽화 · 쓸모연구소

AI 건축 영상 포맷이 뜨는 이유

AI 건축 영상 만들기가 최근 유튜브에서 하나의 포맷으로 자리 잡고 있습니다. 화자는 이 포맷을 쓴 한 채널이 한 달 만에 구독자 40만 명을 넘겼다고 말합니다. 화자는 여러 제작 방법을 직접 테스트해 가장 안정적인 방식을 정리했고, 이 방식은 건축뿐 아니라 다양한 지식형 콘텐츠에도 쓸 수 있다고 합니다.

AI 건축 영상 만들기 준비물

  • 코덱스(Codex). OpenAI의 코딩 에이전트입니다. 말로 시키면 글을 쓰고 파일을 정리해 주는 AI 도우미라고 보면 됩니다. 영상은 "구글에 검색해서 받으라"고만 안내하는데, 실제로는 OpenAI 코덱스 페이지에서 데스크톱 앱을 내려받거나 브라우저에서 바로 실행합니다. 어느 쪽이든 ChatGPT 계정으로 로그인하며, 사용량은 가입한 요금제에 딸려 옵니다.
  • 구글 플로우(Google Flow) 계정. 구글의 AI 이미지·동영상 제작 도구이고, 구글 계정으로 들어갑니다.
  • 준비한 대본과 음성(내레이션) 파일. 내레이션은 화면 밖에서 설명하는 목소리를 말합니다.
  • 캡컷(CapCut) 등 편집 프로그램
  • (선택) 타입캐스트 유료 계정. 타입캐스트는 글을 넣으면 사람 목소리로 읽어 주는 AI 음성(TTS) 서비스입니다.
  • 영상 설명란의 "프롬프트 모음집" MD 파일과 구글 공유 링크. MD 파일은 메모장 같은 텍스트 편집기로 열 수 있는 문서 파일입니다.

1. 코덱스와 구글 플로우 역할 나누기

코덱스는 프롬프트(AI에게 넣는 지시문)를 만들고, 플로우는 그 프롬프트로 이미지와 동영상을 만듭니다. 둘은 서로 연결되어 있지 않습니다. 코덱스가 뱉은 텍스트를 사람이 복사해 플로우에 옮기는 구조라고 보면 정확합니다.

2. 코덱스에 프롬프트 모음집과 대본 넣기

여기서 "학습시킨다"는 말은 코덱스가 작업 규칙과 대본을 먼저 읽게 한다는 뜻입니다.

  1. 영상 설명란의 "프롬프트 모음집"에서 MD 파일을 내려받습니다.
  2. 파일을 텍스트 편집기로 열어 내용 전체를 복사합니다.
  3. 코덱스 채팅창에 붙여넣고 엔터를 누릅니다.
  4. 이어서 준비한 대본 전체를 붙여넣어 학습시킵니다.

3. 장면별 프롬프트 뽑기

여기서 영상은 "구글 공유 링크의 첫 번째 프롬프트를 붙여넣으라"고만 하고 그 문구를 화면에 띄우지 않습니다. 대신 같은 일을 하도록 편집자가 새로 쓴 예시를 아래에 둡니다. 그대로 복사해 쓰거나 자기 대본에 맞춰 고치면 됩니다.

프롬프트
아래 대본을 영상 장면 단위로 나눠 줘.

- 내레이션 음성 길이: 3분 20초
- 화면비: 16:9
- 장면 하나가 화면에 머무는 시간은 5~8초로 잡고, 필요한 이미지 장수를 먼저 계산해서 알려 줘
- 장면마다 (1) 해당 대본 구간 (2) 이미지 생성 프롬프트 (3) 화면에 얹을 짧은 자막 문구를 표로 정리해 줘
- 이미지 프롬프트에는 건축물 이름, 카메라 앵글, 시간대, 조명, 재질, 스타일(사진 실사인지 단면 일러스트인지)을 반드시 넣어 줘
- 이 단계에서는 글자와 도해를 넣지 말고 순수한 그림만 묘사해 줘

대본:
(여기에 대본 전체를 붙여넣기)

준비한 음성 길이를 먼저 확인하고 대본 길이를 그에 맞춰 다듬으면, 코덱스가 필요한 이미지 장수와 장면별 프롬프트를 한 번에 만들어줍니다.

4. 구글 플로우 세팅과 이미지 생성

화자는 "붙여넣으면 이미지가 생성된다"고 했다가 "세팅을 먼저 해야 한다"고 바로 정정합니다. 세팅이 먼저입니다.

  1. 플로우 채팅창 우측 하단 "에이전트 설정"을 클릭합니다.
  2. 설정 안의 체크 항목을 켭니다(자막에 "아함"으로만 들려서 항목 이름은 확정하지 못했습니다).
  3. 화면비를 고릅니다. 롱폼(가로로 긴 일반 유튜브 영상)은 16:9, 쇼츠는 9:16입니다.
  4. "곱하기"(1회 생성 장수)를 1로 설정합니다.
  5. 이미지 모델은 Nano Banana 2를 고릅니다. 자막에는 "나노바나 2"로 들리는데, 구글의 이미지 생성 모델 이름입니다.
  6. 동영상 모델은 자막상 "옴니 1.1 플래시"로 들립니다. 모델 이름은 시기마다 바뀌므로, 플로우 동영상 모델 목록에서 "1.1 플래시" 계열로 표시된 항목을 그 자리에서 고르는 편이 확실합니다.

세팅을 마친 뒤 코덱스가 만든 프롬프트 전체를 복사해 플로우에 붙여넣고 엔터를 누르면, 인포그래픽 없는 이미지가 여러 장 자동 생성됩니다. 인포그래픽은 그림 위에 화살표, 라벨, 치수선 같은 설명 요소를 얹은 도해를 말합니다.

이미지가 다 나오면 같은 장면의 인포그래픽 버전을 한 벌 더 받습니다. 영상은 이 대목도 "두 번째 프롬프트를 입력한다"로만 넘어가므로, 편집자가 쓴 예시를 둡니다.

프롬프트
방금 만든 장면 목록은 그대로 두고, 같은 장면의 "인포그래픽 버전" 프롬프트를 한 벌 더 만들어 줘.

- 앞 이미지와 구도, 색감, 시점은 똑같이 유지할 것
- 그 위에 화살표, 치수선, 라벨, 단면 지시선 같은 도해 요소만 얹을 것
- 라벨 문구는 한국어로 다섯 단어를 넘기지 말 것
- 장면 번호는 앞과 같은 번호를 그대로 쓸 것

5. 구글 플로우로 동영상 생성

세 번째 프롬프트는 이미지 두 장을 움직이게 만드는 단계입니다. 코덱스에 아래처럼 시키면 장면 수만큼 동영상 프롬프트가 나오고, 그걸 복사해 플로우에 붙여넣으면 장면마다 움직임과 인포그래픽 애니메이션이 들어간 동영상이 일괄 생성됩니다. 시작 프레임과 끝 프레임은 동영상의 첫 장면과 마지막 장면으로 쓸 이미지를 뜻합니다.

프롬프트
장면마다 이미지가 두 장 있어. 기본 이미지와 인포그래픽 이미지야.
이 두 장을 시작 프레임과 끝 프레임으로 삼는 동영상 프롬프트를 장면별로 만들어 줘.

- 카메라 움직임은 한 장면에 하나만 쓸 것(천천히 밀기, 위로 올리기, 좌우 이동 중 택 1)
- 인포그래픽 요소는 처음부터 떠 있지 말고 순서대로 나타나게 할 것
- 장면 길이는 8초
- 사람 얼굴이 화면 가운데에 오래 머무는 구도는 피할 것

6. 캡컷 편집과 파일 순서 정리

편집 프로그램에서 음성과 타이밍만 맞추면 영상이 완성됩니다. 동영상이 여러 개면 순서부터 정리합니다.

  1. 플로우 화면 우측 상단 점 세 개에서 "프로젝트 다운로드"를 눌러 받습니다.
  2. 받은 압축 파일을 풉니다.
  3. 풀린 폴더의 경로를 복사합니다.
  4. 코덱스에 폴더 경로를 넘겨 넘버링을 시킵니다.

영상은 여기서도 "순서 프롬프트를 첨부한다"고만 하는데, 실제로 시키는 말은 이 정도면 됩니다.

프롬프트
아래 폴더 안의 mp4 파일들을 내 대본 순서대로 정렬하고,
scene_01_..., scene_02_... 형식으로 이름을 바꿔 줘.
원본은 지우지 말고 복사본을 만들어서 이름을 붙여 줘.
어떤 파일이 몇 번 장면인지 판단한 근거도 표로 같이 알려 줘.

폴더 경로: (붙여넣기)

그다음 캡컷 좌측 상단 정렬 버튼에서 "이름 A부터 Z"를 선택하면 영상이 순서대로 배치되어 한 번에 드래그 편집할 수 있습니다.

7. 타입캐스트로 건축 채널 목소리 내기

"신비한 건축 사전" 채널 목소리를 원하면 타입캐스트 유료 캐릭터 "필제"를 선택하고 "AI 이모션" 기능을 켭니다. 금액은 영상에 나오지 않는데, 타입캐스트는 무료로 쓸 수 있는 분량과 유료 구독이 나뉘어 있고 유료 전용 캐릭터와 감정 표현 기능은 구독을 해야 열립니다. 금액은 시기마다 바뀌므로 타입캐스트 사이트의 요금제 안내에서 직접 확인하는 편이 정확합니다. 캐릭터가 꼭 그 목소리일 필요가 없다면 다른 TTS 서비스로 대체해도 나머지 절차는 그대로입니다.

8. AI 건축 영상 방식, 다른 주제에도 쓸 수 있을까

화자는 기계·발명품 원리, 인체 구조, 역사적 사건, 자연 현상, 일상 호기심 같은 소재에도 이 방식이 응용된다고 말합니다. "클릭할 수밖에 없는 주제"와 "끝까지 보게 만드는 AI 영상 제작 방식"이 합쳐질 때 채널이 자란다는 게 결론입니다.

제목은 제작 시간을 10분이라 내세우지만, 실제 시간을 잰 근거는 본문에 없습니다.

자주 묻는 질문

AI 건축 영상은 어떤 도구로 만드나요?

프롬프트는 코덱스, 이미지와 동영상은 구글 플로우, 편집은 캡컷으로 만드는 조합입니다. 목소리는 준비한 내레이션 파일을 쓰거나 타입캐스트 같은 TTS 서비스로 만듭니다. 코덱스는 ChatGPT 계정으로, 플로우는 구글 계정으로 로그인합니다.

코덱스와 구글 플로우는 자동으로 연결되나요?

연결되지 않습니다. 코덱스가 만든 프롬프트를 사람이 복사해 플로우 채팅창에 붙여넣는 방식입니다. 대신 플로우에서 받은 동영상 파일의 이름 정리는 폴더 경로를 코덱스에 넘겨 맡길 수 있습니다.

구글 플로우에서 이미지와 동영상 모델은 무엇을 고르나요?

이미지 모델은 Nano Banana 2를 고르고, 동영상 모델은 자막상 "옴니 1.1 플래시"로 들린 모델을 고릅니다. 모델 이름은 시기마다 바뀌므로 플로우의 모델 목록에서 "1.1 플래시" 계열 항목을 직접 확인하는 편이 확실합니다. 모델을 고르기 전에 에이전트 설정, 화면비, 1회 생성 장수를 먼저 맞춰야 합니다.

"신비한 건축 사전" 같은 목소리는 어떻게 내나요?

타입캐스트에서 유료 캐릭터 "필제"를 고르고 "AI 이모션" 기능을 켜면 됩니다. 이 캐릭터와 감정 표현 기능은 유료 구독을 해야 열리고, 금액은 타입캐스트 요금제 안내에서 확인해야 합니다. 꼭 같은 목소리가 아니어도 된다면 다른 TTS 서비스로 바꿔도 나머지 절차는 같습니다.

이 글은 자막 기반 빠른 모드로 정리했습니다. 영상이 건너뛴 절차와 프롬프트는 편집자가 채워 넣었고, 어디서부터가 보충인지 그 자리에 밝혀 두었습니다. 이 글의 프롬프트 예시는 편집자가 새로 쓴 것이고, 영상에 나온 문구가 아닙니다. 자막에 "나노바나 2"로 들리는 모델은 Nano Banana 2로 적었습니다.

원문 영상: youtu.be/…

원본 영상 보러가기 ↗