코덱스 ComfyUI 영상 자동화, LTX 2.5 무료 설치부터 생성까지
코덱스(Codex, AI 코딩 에이전트)에게 컨셉만 설명하면 내 컴퓨터의 ComfyUI에서 오픈소스 영상 모델 LTX 2.5를 자동으로 돌려 영상을 만들어줍니다. 이 글은 코덱스 ComfyUI 영상 자동화를 설치부터 실제 생성, 여러 장면의 목소리 맞추기까지 영상에 나온 절차 그대로 정리했습니다.

처음 보는 이름이 셋이라 먼저 풀어 둡니다. 코덱스는 OpenAI가 만든 AI 에이전트로, 말로 시키면 내 컴퓨터에서 파일을 만들고 프로그램을 실행해 줍니다. ComfyUI는 AI 이미지·영상 모델을 내 컴퓨터에서 돌리는 무료 프로그램입니다. LTX 2.5는 누구나 받아 쓸 수 있게 공개된(오픈소스) 영상 생성 모델입니다.
코덱스, ComfyUI, LTX 2.5는 어떻게 연결되나
영상 도입부에는 이 방식으로 만든 결과물 세 개가 먼저 나옵니다. "나 사실 너를 좋아해, 1년 내내 이 말만 연습했어", "무서워서 온 게 아니에요, 부탁하러 왔어요, 우리 마을을 구해 주세요", "아이디어는 작게 시작해도 매일 쌓이면 콘텐츠가 됩니다" 같은 대사를 말하는 클립입니다. 전부 AI에게 컨셉만 설명하고 본인 컴퓨터에서 무료로 만든 것입니다.
구조를 정확히 짚고 넘어갈 필요가 있습니다. GPT에서 바로 영상이 나오는 게 아닙니다. GPT 모델이 ComfyUI를 조작해서 LTX 2.5라는 오픈소스 모델을 돌리는 방식입니다. 예전에는 오픈소스 모델을 쓰려면 ComfyUI를 하나하나 직접 다뤄야 했는데, 이제는 AI에게 ComfyUI를 활용해서 돌려달라고 하면 자동으로 처리된다는 게 이 영상의 출발점입니다.
코덱스 ComfyUI 영상 자동화 준비물과 PC 사양
필요한 건 AI 코딩 에이전트, ComfyUI 포터블 버전, 영상 모델 LTX 2.5 세 가지입니다. 포터블 버전은 설치 과정 없이 압축만 풀면 바로 쓰는 판을 말합니다. AI 앱은 어느 모델이든 가능하지만 영상에서는 무료 티어(무료로 쓸 수 있는 사용량)가 어느 정도 있는 코덱스를 씁니다. 영상 모델로 LTX 2.5를 고른 이유는 한국어가 어느 정도 되면서 속도가 빨라졌기 때문입니다.
여기에 두 가지가 더 필요합니다. 영상으로 만들 이미지 소스, 그리고 배포 워크플로 파일(워크플로 + 에이전트 지침 MD)입니다. 워크플로는 ComfyUI에서 어떤 모델을 어떤 순서로 돌릴지 연결해 둔 설계도 파일입니다. 에이전트 지침 MD는 AI가 읽고 따를 작업 규칙을 적어 둔 텍스트 문서입니다.
하드웨어는 저자 기준 노트북 RTX 4070, VRAM 8GB에서 구동을 확인했습니다. VRAM은 그래픽카드에 달린 전용 메모리로, AI 영상 모델을 돌릴 때 가장 먼저 부족해지는 부분입니다. 저장 공간은 모델 다운로드까지 감안해 50GB 이상 여유가 필요합니다.
코덱스·ComfyUI·LTX 2.5 설치 순서
- 코덱스 사이트에서 앱을 받아 설치하고 실행합니다. 로그인은 ChatGPT 계정으로 합니다. 처음엔 "챗GPT"로 표시되는데, 그 부분을 눌러 "코덱스"로 전환합니다.
- 작업 폴더를 새로 만들고 영상으로 만들고 싶은 이미지 소스를 넣습니다.
- 배포 워크플로 파일을 받아 작업 폴더에 넣습니다. 이 파일에는 VRAM 8GB 정도에서도 구동되게 하는 워크플로 방법과 그걸 AI에게 안내하는 지침이 함께 들어 있습니다. AI가 이 파일을 참조해야 시행착오가 줄어듭니다.
- ComfyUI가 없다면 포터블 버전을 설치합니다. 영상은 링크를 읽어주지 않는데, 포터블 빌드는 ComfyUI 깃허브(개발자들이 프로그램을 공개하는 사이트) 저장소(comfyanonymous/ComfyUI)의 릴리스 페이지에 윈도우용 압축 파일로 올라옵니다. 받아서 원하는 위치에 풀면 설치가 끝나고, 폴더 안의 실행 배치 파일(더블클릭하면 프로그램이 켜지는 파일)로 켭니다. 데스크탑 버전도 있지만 LTX 2.5 워크플로를 제대로 돌리려면 포터블 쪽이 편했다는 게 저자 경험입니다. 이미 설치돼 있다면 AI에게 "설치가 돼 있다"고 알려주기만 하면 됩니다. 설치가 어려우면 AI에게 다운로드 링크를 주고 위임할 수 있습니다.
- 허깅페이스(AI 모델 파일을 공개하는 사이트)에서 LTX 모델 파일 5개를 받습니다. LTX 계열 모델은 제작사 Lightricks의 허깅페이스 계정에 올라와 있고, 검색창에 LTX를 넣으면 바로 나옵니다. 영상 모델만으로는 안 되고 프롬프트를 이해하는 텍스트 인코더, 영상을 압축하는 VAE 같은 파일이 함께 필요하기 때문입니다. 영상 모델은 디스틸드(distilled, 가볍고 빠르게 줄인) 버전을 받으면 됩니다.
받은 파일은 종류별로 ComfyUI 폴더 안 제자리에 넣어야 워크플로가 인식합니다. ComfyUI 폴더의
models아래에checkpoints,diffusion_models,text_encoders,vae같은 하위 폴더가 있고, 파일 이름에 붙은 단어를 보고 같은 이름의 폴더에 넣으면 됩니다. 하위 폴더 이름은 ComfyUI 판에 따라 조금씩 다르므로 실제 폴더 목록을 열어보고 고릅니다. 번거로우면 이 정리 작업 자체를 AI에게 맡겨도 됩니다. - 코덱스에서 폴더 아이콘을 눌러 새 프로젝트를 만들고 2단계에서 만든 폴더를 추가합니다. 프로젝트 이름은 폴더명과 다르게 정할 수도 있고, 같게 하려면 그대로 "프로젝트 만들기"를 누르면 됩니다.
- 에이전트 MD 파일을 첨부해 "이렇게 작업하려는데 이 내용을 먼저 숙지해 달라"고 요청합니다. 지침 없이 처음부터 요구사항만 설명해도 작동하긴 하지만, 저자가 겪었던 시행착오를 그대로 반복하게 됩니다. 실제로 넣는 말은 이 정도면 충분합니다.
첨부한 지침 문서를 먼저 읽어 줘.
앞으로 이 폴더에서 ComfyUI와 LTX 모델로 짧은 영상을 만들 거야.
지침에 적힌 워크플로와 VRAM 조건을 지켜서 작업해 주고,
지침과 어긋나는 방법을 쓰게 될 때는 먼저 나한테 알려 줘.
- 하단에서 GPT 액션 승인 범위를 선택합니다. AI가 내 컴퓨터에서 파일을 옮기거나 프로그램을 실행할 때 매번 허락을 받을지 정하는 설정입니다. 전체 권한이 부담되면 "나 대신 승인"만 골라도 됩니다.
- AI가 ComfyUI 설치 여부와 모델 위치를 점검합니다. 모델이 다운로드 폴더에 그대로 있다면 "LTX 2.5 모델은 다운로드 폴더에 저장돼 있으니 적절한 위치로 이동해 달라"고 요청하면 ComfyUI의 모델 폴더 안으로 알아서 옮겨줍니다.
LTX 2.5 영상 생성하기, 두 가지 방식
단일 이미지로 짧은 영상: 이미지를 첨부하고 "이 이미지로 컴피에서 LTX 2.5 모델로 영상을 만들어 달라"에 원하는 내용과 길이를 구체적으로 더합니다. 컴피는 ComfyUI를 줄여 부르는 말입니다. 실제 문장은 이렇게 씁니다.
첨부한 이미지로 ComfyUI에서 LTX 2.5 기본 워크플로를 돌려서 영상을 만들어 줘.
- 길이 10초
- 인물이 정면을 보며 따뜻한 말투로 말하는 장면
- 대사: "오늘도 충분히 잘하고 있어요"
- 카메라는 거의 고정, 아주 느린 밀기까지만
- 결과물은 작업 폴더 안 '완성 영상' 폴더에 넣어 줘
생성이 끝나면 영상 길이와 오디오가 제대로 붙었는지 확인하고 알려 줘.
영상 예시는 "사람들에게 따뜻한 말을 하는 영상"에 "10초 분량"이었습니다. AI가 지침대로 프롬프트를 만들고 생성에 들어가면 ComfyUI 화면이 돌아가는 걸 볼 수 있습니다. 생성이 끝나면 AI가 영상과 오디오 스트림, 장면이 유지되는지까지 확인합니다. 그 사이 작업 폴더 안에는 없던 "완성 영상" 폴더가 새로 만들어지고 그 안에 결과물이 들어갑니다. 실제로 나온 대사는 "오늘도 충분히 잘하고 있어요, 조금 늦어도 괜찮아요, 당신의 속도로 천천히 가세요"였습니다.
여러 장면 이어 붙이기: 신(장면)별 구성안을 첨부하고 "이 구성안대로 신별로 자연스럽게 영상이 나오게 만들어 달라"고 요청하면, AI가 구성안을 읽고 프롬프트를 다듬어 신을 순서대로 생성합니다. 구성안은 거창할 필요가 없고 이 정도 표 하나면 됩니다.
신 1 | 이미지: scene1.png | 대사: "AI 영상, 어디서부터 시작해야 할지 막막하셨죠?" | 6초
신 2 | 이미지: scene2.png | 대사: "이 책 한 권으로 시작하시면 됩니다." | 6초
신 3 | 이미지: scene3.png | 대사: "기획부터 이미지, 영상, 음악, 보이스, 편집까지 한 번에 배웁니다." | 7초
신 4 | 이미지: scene4.png | 대사: "보는 사람에서 만드는 사람으로 넘어가 보세요." | 6초
위 구성안대로 신을 순서대로 생성하고, 다 만들면 하나로 이어 붙여 줘.
신마다 톤과 조명이 튀지 않게 프롬프트를 다듬어도 좋아.
영상에서는 저자의 책 "하루 10분 AI 동영상 제작하기"를 홍보하는 영상을 신 4개로 구성했습니다. AI 영상을 어디서부터 시작할지 막막했다는 문제 제기로 시작해, 이 책으로 시작하라는 권유, 기획부터 이미지·영상·음악·보이스·편집까지 한 번에 배울 수 있다는 소개, 보는 사람에서 만드는 사람이 되어보라는 마무리로 이어지는 흐름입니다.
작업 중에는 ComfyUI가 계속 활성화되고, 채팅에서 "모든 작업 보기"를 누르면 실행 중이라는 표시와 지금까지의 작업 내역을 볼 수 있습니다. 신 4개 생성이 끝나면 통합본으로 자동 병합되고, 결과는 23초짜리 영상이었습니다. 어색한 부분이 있긴 해도 어느 정도 자연스럽게 나왔다는 게 저자 평가입니다.
이 예시에서는 이미지를 미리 만들어뒀지만, 이미지 역시 오픈소스 모델을 쓰면 자동 생성이 가능합니다. 저자는 그 방법을 이전 오디오북 영상 제작 편에서 다뤘다고 안내하고 이 영상에서는 넘어갑니다.
원리는 앞과 똑같습니다. 이미지 생성용 오픈소스 모델을 같은 ComfyUI에 하나 더 얹고, 영상 만들기 전 단계로 이미지 생성을 먼저 시키는 것뿐입니다. VRAM 8GB에서는 SDXL 계열이 무난하고, Flux 계열은 용량을 줄인 경량 파일을 골라야 무리가 없습니다. SDXL과 Flux는 둘 다 공개된 이미지 생성 모델 이름입니다. 모델 파일을 받는 곳과 넣는 폴더는 5단계와 같습니다. 시키는 말은 이렇게 이어 붙이면 됩니다.
신별 구성안을 보고, 각 신에 쓸 이미지를 먼저 ComfyUI에서 만들어 줘.
이미지 모델은 지금 설치된 것 중에서 8GB VRAM으로 돌아가는 걸로 골라 주고,
무엇을 골랐는지 이유와 함께 알려 줘.
이미지가 다 나오면 그 이미지를 그대로 LTX 워크플로에 넣어 영상까지 이어서 만들어 줘.
LTX 2.5 영상 품질 다듬는 팁
LTX 2.5는 한국어를 어느 정도 잘 처리하지만 움직임이 엉뚱하게 나올 때가 있습니다. 그래서 신마다 3~4개씩 만들어 그중 자연스러운 걸 골라 편집하는 방식을 권합니다. 유독 잘 안 나오는 신도 생깁니다. 그럴 때는 어떤 문제가 있는지 설명하고 어떻게 만들면 좋을지 AI와 논의하면서 다양하게 시도해보는 편이 낫습니다. 프롬프트 관련 팁은 배포 자료의 지침 문서 안에 AI가 참조할 수 있게 적혀 있어서, 기본적으로는 그걸 따라 만들어줍니다.
여러 신의 목소리 톤 맞추기
저자가 가장 많이 받은 질문이 목소리 일관성 문제였습니다. 여러 방법을 테스트한 끝에 찾은 최선은 마음에 드는 목소리의 영상을 참조시키는 방식입니다.
- 첫 신을 여러 개 생성합니다.
- 그중 가장 마음에 드는 목소리를 고릅니다.
- 그 영상을 워크플로에 참조시키고 나머지 신을 이어서 생성합니다.
영상에는 비교 데모가 나옵니다. 기준이 되는 목소리("안녕. 오늘 날씨 정말 좋다")를 들려준 뒤, 참조를 시키지 않은 결과와 참조를 시킨 결과를 나란히 재생합니다. 참조를 시킨 쪽이 앞선 목소리와 더 비슷하게 들립니다. 100% 똑같지는 않아도 비슷한 톤은 유지됩니다.
이를 위해 배포 자료에는 워크플로가 두 가지 들어 있습니다. 하나는 그냥 생성할 때 쓰는 기본 워크플로, 다른 하나는 목소리 참조가 필요할 때 쓰는 워크플로입니다. 에이전트 지침에도 기본은 일반 모드를 쓰고 목소리를 맞춰달라는 요청이 있을 때만 목소리 워크플로를 쓰라고 적어놨기 때문에, 사용자는 원하는 것만 말하면 AI가 알아서 골라 씁니다. 부를 때는 "첫 신 목소리를 참조해서 나머지 신을 만들어 줘"처럼 목적만 말하면 되고, 워크플로 파일 이름을 외울 필요는 없습니다.
코덱스 무료 사용량과 배포 파일 받는 곳
코덱스 무료 티어의 사용량 한도는 영상에 나오지 않고, 사실 고정된 숫자도 아닙니다. 요금제와 시기에 따라 바뀌기 때문에 정확한 값은 로그인한 계정의 사용량 표시에서 그때그때 확인하는 수밖에 없습니다. 한도를 넘겨 작업이 끊기는 게 걱정되면 신을 여러 개 한꺼번에 시키지 말고 한두 개씩 나눠 시키는 편이 안전합니다.
배포 워크플로 파일과 에이전트 지침 문서는 영상 설명란에서 받습니다. 이 두 파일만큼은 대체품이 없으니 먼저 챙기고 시작하는 게 좋습니다.
자주 묻는 질문
코덱스로 ComfyUI를 자동으로 돌릴 수 있나요?
돌릴 수 있습니다. 코덱스에 작업 폴더와 에이전트 지침 문서를 주고 "이 이미지로 LTX 2.5 영상을 만들어 달라"고 하면, 코덱스가 ComfyUI를 조작해 영상을 생성하고 결과까지 확인합니다. 코덱스가 영상을 직접 그리는 것이 아니라, 내 컴퓨터의 ComfyUI와 LTX 2.5 모델을 대신 실행해 주는 구조입니다.
LTX 2.5는 VRAM 8GB 노트북에서도 돌아가나요?
저자는 노트북 RTX 4070, VRAM 8GB에서 구동을 확인했습니다. 다만 배포 워크플로가 8GB에서 돌아가도록 맞춰져 있다는 전제가 붙습니다. 저장 공간은 모델까지 감안해 50GB 이상 비워 두는 것이 좋습니다.
코덱스는 무료로 쓸 수 있나요?
코덱스에는 무료로 쓸 수 있는 사용량이 어느 정도 있고, ChatGPT 계정으로 로그인해 씁니다. 한도는 요금제와 시기에 따라 바뀌므로 로그인한 계정의 사용량 표시에서 확인해야 합니다. ComfyUI와 LTX 2.5 모델은 내 컴퓨터에서 돌아가므로 영상 생성 자체에 따로 크레딧이 들지 않습니다.
ComfyUI 모델 파일은 어느 폴더에 넣나요?
ComfyUI 폴더 안 models 아래의 하위 폴더에 종류별로 넣습니다. checkpoints, diffusion_models, text_encoders, vae처럼 파일 이름에 붙은 단어와 같은 이름의 폴더를 고르면 됩니다. 헷갈리면 코덱스에 "다운로드 폴더의 LTX 모델을 제자리로 옮겨 달라"고 맡겨도 됩니다.
여러 장면의 AI 목소리를 똑같이 맞추려면 어떻게 하나요?
첫 장면을 여러 번 만들어 마음에 드는 목소리를 고른 뒤, 그 영상을 참조시켜 나머지 장면을 만듭니다. 배포 자료에 목소리 참조용 워크플로가 따로 들어 있어서 "첫 신 목소리를 참조해서 나머지를 만들어 줘"라고만 하면 됩니다. 100% 같지는 않아도 비슷한 톤은 유지됩니다.
이 글은 자막 기반(빠른 모드)으로 캡처한 글이라 화면 판독은 없고, 발화만 근거로 삼았습니다. 영상이 말로 넘어간 절차와 프롬프트는 편집자가 채워 넣었고, 어디서부터가 보충인지 그 자리에 밝혀 두었습니다. 본문의 프롬프트 예시는 편집자가 새로 쓴 것이고 영상에 나온 문구가 아닙니다.
원본 영상: youtu.be/…