본문으로 바로가기
AI VIDEO

OpenMontage 사용법: GPU 없는 노트북으로 AI 영상 만드는 5가지 방법 (+RTX 5090 실행 후기)

코딩 에이전트에게 영상 제작을 맡기는 오픈소스 OpenMontage를 일반 노트북 기준으로 정리했습니다. 설치 순서, 키 없이 되는 것과 안 되는 것, 상황별 추천 경로와 한국어 프롬프트, 그리고 RTX 5090에서 0원으로 31초 영상을 만들어 본 짧은 후기까지 담았습니다.

작성 2026년 10월 4일수정 2026년 10월 5일읽기 13분
OpenMontage 마스코트 클래퍼보드 Monty 옆에 GPU 없이 노트북으로 AI 영상 만들기라는 제목과 키 0개·무료 키·몇백 원 경로를 배치한 대표 이미지

요즘 영상 자동화 쪽에서 가장 많이 보이는 오픈소스가 OpenMontage입니다. GitHub 스타가 반년 만에 6만 개를 넘었고, 소개 문구는 "AI 코딩 어시스턴트를 영상 제작 스튜디오로 바꿔준다"는 쪽에 가깝습니다. 저도 궁금해서 RTX 5090 PC에 직접 설치해 영상 한 편을 끝까지 만들어 봤습니다.

그런데 고성능 GPU에 로컬 모델까지 붙인 제 환경은 대부분의 분들께 바로 참고가 되기 어렵습니다. 그래서 이번 글은 그래픽카드 없는 일반 노트북과 코딩 에이전트 하나만 있다고 가정하고 OpenMontage로 무엇을 할 수 있는지, 어떤 순서로 시작하면 덜 막히는지를 중심으로 정리했습니다. 제 RTX 5090 실행 결과는 글 뒷부분에 짧게 붙여 두었습니다.

(작성일 2026-10-05 기준입니다. 저장소가 하루에도 여러 번 바뀌고 있어서 지금 보시면 파이프라인 구성이나 설치 절차가 다를 수 있습니다. 비용과 소요 시간은 별도 표시가 없으면 공식 문서 기준입니다.)

사용 도구 및 준비물

OpenMontage란?

OpenMontage는 프로그램이라기보다 영상 제작 지시서 묶음이 들어 있는 폴더에 가깝습니다. 따로 실행하는 앱이 없습니다. 이 폴더를 Claude Code, Codex, Cursor 같은 coding agent(파일을 읽고 고치고 프로그램을 실행할 수 있는 AI 도구)로 열고 "이런 영상 만들어줘"라고 말하면, 에이전트가 안에 든 지시서를 읽고 제작 진행자 역할을 합니다.

식당에 비유하면 OpenMontage는 주방장이 아니라 레시피북과 주방 도구 세트입니다. 요리는 에이전트가 하고, 레시피북에는 "조사 → 제안 → 대본 → 장면 계획 → 재료 만들기 → 편집 → 합성" 순서와 단계마다 확인할 기준이 적혀 있습니다.

항목내용 (2026-10-05 확인)
라이선스AGPL-3.0 (오픈소스, 수정해서 서비스로 내놓으면 소스 공개 의무)
파이프라인(영상 종류별 작업 순서)12개. 안정판 6개 + beta 6개
필요한 것Python 3.10 이상, Node.js 18 이상, FFmpeg, 코딩 에이전트
GPU필수 아님. 있으면 로컬 영상 생성 모델을 추가로 붙일 수 있음
렌더Remotion·HyperFrames(코드로 영상을 그리는 도구) + FFmpeg
공식 예시 비용키 0개면 0원, 이미지 키 하나면 편당 약 0.151달러, 전체 설정 시 15달러

제가 써 보면서 가장 좋았던 부분은 사람 승인 단계입니다. 제안, 대본, 장면 계획, 재료가 끝날 때마다 에이전트가 멈추고 승인을 기다립니다. 영상을 통째로 맡기는 게 아니라 중간중간 방향을 고칠 수 있어서, 처음 쓰는 분들께는 오히려 이 구조가 안전장치 역할을 하는 것 같습니다. 진행 상황은 Backlot이라는 로컬 보드에서 장면 카드와 비용까지 한눈에 볼 수 있습니다.

한 가지 꼭 주의하실 점이 있습니다. 같은 이름으로 도는 exe·7z 배포본이 이슈 #175, #200, #444에서 악성 파일로 보고됐습니다. 공식 저장소 github.com/calesthio/OpenMontage에서 git clone으로만 받으세요.

비용은 어떻게 나뉘나

OpenMontage는 "어떤 키를 넣었느냐"에 따라 쓸 수 있는 도구가 달라집니다. 키는 전부 선택 사항이고, 넣은 만큼 도구가 늘어나는 구조입니다. 일반 노트북 기준으로 단계를 나눠 보면 이렇습니다.

단계넣는 키화면을 채우는 재료공식 예시 비용
1. 키 0개없음글자·차트·통계 카드, 무료 아카이브 영상0원
2. 무료 키Pexels·Pixabay·Unsplash (가입만 하면 무료 발급)실사 스톡 영상·사진0원
3. 이미지 키 하나FAL_KEY (fal.ai)AI 생성 이미지 + 카메라 움직임30초 애니풍 약 0.15달러, 설명 영상 약 0.6~1달러
4. 전체 설정영상 생성·고급 음성·음악 키AI 영상 클립, 자연스러운 내레이션, 맞춤 음악편당 약 1~5달러

여기에 빠져 있는 비용이 하나 있습니다. 진행을 맡는 코딩 에이전트 비용(Claude Code 요금제나 API 사용료)은 이 표에 들어 있지 않습니다. "0원"은 영상 재료를 만드는 비용 기준이라는 점은 감안하시면 좋겠습니다.

1. 설치하기

설치는 공식 README의 명령 세 줄이면 됩니다. 저는 직접 입력하기보다 코딩 에이전트에게 설치까지 맡기는 쪽을 추천합니다. 빠진 프로그램이 있으면 에이전트가 알려 주고, 에러가 나면 그 자리에서 고쳐 주기 때문입니다.

먼저 Python, Node.js, FFmpeg가 깔려 있는지 확인한 뒤, 빈 폴더에서 Claude Code를 열고 아래처럼 요청하면 됩니다.

HLJS TEXT
https://github.com/calesthio/OpenMontage 저장소를 git clone으로 받아서 설치해줘.
- README의 Quick Start 순서를 따르고, Windows라면 PowerShell 안내를 써줘.
- exe나 압축 배포본은 절대 받지 마.
- 설치가 끝나면 지금 쓸 수 있는 도구 목록(support envelope)을 확인해서
  음성·이미지·영상·음악이 각각 몇 개 켜져 있는지 표로 보여줘.
- API 키는 아직 없으니 유료 도구는 쓰지 마.

직접 하실 경우 macOS·Linux는 아래 세 줄입니다.

HLJS BASH
git clone https://github.com/calesthio/OpenMontage.git
cd OpenMontage
make setup

Windows는 make가 없어서 README의 PowerShell 한 줄짜리 명령을 써야 합니다. npm install에서 ERR_INVALID_ARG_TYPE 에러가 나면 npx --yes npm install로 바꾸라는 안내도 README에 있습니다.

2. 설치 후 꼭 확인할 두 가지

제가 처음 설치했을 때 가장 당황했던 부분이 여기입니다. 설치가 에러 없이 끝났는데, 사전 점검을 돌려 보니 음성 0/10, 이미지 0/16, 영상 0/26으로 아무것도 켜져 있지 않았습니다. 설치 완료와 "영상을 만들 수 있는 상태"는 다르다는 점을 먼저 알고 시작하시면 좋겠습니다.

첫째, 음성 파일을 따로 받아야 합니다. 무료 오프라인 음성인 Piper는 프로그램만 설치되고 목소리 파일(.onnx)은 따로 받아야 켜집니다. 한국어 목소리 ko_KR-kss-medium이 Piper 공식 음성 목록에 있으니, 에이전트에게 "Piper 한국어 음성 받아서 연결해줘"라고 하시면 됩니다.

둘째, 데모 렌더로 렌더링 환경부터 확인하세요. make demo(또는 python render_demo.py)를 돌리면 키 없이 미리 만들어 둔 차트·통계 영상 3편이 렌더됩니다. 이게 나오면 Remotion과 FFmpeg는 정상이라는 뜻이라, 본 제작에서 막혔을 때 원인을 좁히기 쉽습니다.

3. 상황별로 할 수 있는 5가지

여기부터가 이 글의 본론입니다. 공식 문서와 파이프라인 정의를 읽고, GPU 없는 노트북에서 현실적으로 해 볼 만한 것만 골랐습니다. 각 항목의 프롬프트는 바로 복사해서 쓰실 수 있게 한국어로 옮겼습니다.

하고 싶은 것파이프라인필요한 키안정성
① 숫자·개념 설명 영상설명 영상 (animated-explainer)없음안정판
② 실사 분위기 영상다큐 몽타주 (documentary-montage)없음 (무료 스톡 키 있으면 좋음)beta
③ 내가 찍은 영상 다듬기·쇼츠로 자르기토킹헤드, 클립 팩토리없음beta
④ 마음에 드는 영상 따라 만들기레퍼런스 분석없음공통 기능
⑤ 애니풍 일러스트 영상애니메이션 (animation)FAL_KEY안정판

① 키 0개: 숫자·개념 설명 영상

가장 먼저 해 보실 만한 경로입니다. 조사 → 대본 → Piper 내레이션 → 차트·통계 카드·자막 애니메이션으로 영상이 만들어집니다. 공식 예시 기준 5~15분, 0원입니다.

HLJS TEXT
40초짜리 세로 9:16 설명 영상 만들어줘. 주제: 직장인이 하루에 마시는 커피 양.
- 이미지 없이 막대그래프, 통계 카드, 움직이는 자막으로만 구성해줘.
- 대상은 20~30대 직장인, 말투는 친근하게.
- 내레이션은 Piper 한국어 음성으로, 숫자는 "칠십 개"처럼 한글로 풀어 써줘.
- 무료 도구만 쓰고, 단계마다 멈추고 나한테 승인 받아.

솔직히 말씀드리면 이 경로의 화면은 글자와 차트가 중심입니다. OpenMontage 이슈 #210에도 "키 없이 돌리면 글자 카드만 넘어가는 슬라이드쇼가 나온다"는 불만이 있습니다. 그래서 처음부터 차트와 통계가 주인공인 주제를 고르시는 게 좋습니다. 데이터 비교, 단계별 설명, 개념 정리 같은 주제가 잘 맞고 감성 브이로그 같은 주제는 맞지 않습니다.

② 무료 키: 실사 영상으로 만드는 분위기 영상

OpenMontage가 다른 "무료 AI 영상" 도구와 가장 다른 부분입니다. Archive.org, NASA, Wikimedia Commons 같은 공개 아카이브와 Pexels·Pixabay 스톡에서 실제로 움직이는 영상을 모아, 주제에 맞는 컷을 골라 편집합니다. 사진 몇 장에 줌만 주는 방식이 아니라 진짜 영상 클립을 잇는 방식입니다.

HLJS TEXT
60초짜리 다큐 몽타주 만들어줘. 주제: 비 오는 날 도시의 퇴근길.
- 실제 영상(real footage)만 쓰고 AI 생성은 하지 마.
- 내레이션 없이 음악만, 차분하고 쓸쓸한 분위기로.
- Pexels와 Archive.org 영상을 우선 써줘.
- 단계마다 멈추고 승인 받아.

Pexels 키는 Pexels API 페이지에서 가입만 하면 무료로 발급됩니다. 이 파이프라인은 아직 beta라서 결과가 들쭉날쭉할 수 있고, 저는 이번 글에서 직접 돌려보지 않았습니다. 그리고 스톡·아카이브 영상은 출처마다 사용 조건이 다르니 상업용으로 쓰실 거라면 최종 컷의 출처 목록을 에이전트에게 따로 뽑아 달라고 하세요.

③ 키 0개: 내가 찍은 영상 다듬기·쇼츠로 자르기

일반인에게 가장 실용적인 경로는 사실 이쪽인 것 같습니다. 새 영상을 만드는 게 아니라 이미 있는 영상을 편집하는 파이프라인들입니다.

  • 토킹헤드(talking-head): 카메라 보고 말한 영상을 받아 적고, 군더더기 구간을 자르고, 자막과 소리를 정리합니다.
  • 클립 팩토리(clip-factory): 웨비나·라이브·강의 같은 긴 영상에서 쇼츠로 쓸 만한 구간을 여러 개 골라 순위를 매기고 잘라 줍니다.
  • 팟캐스트 재가공(podcast-repurpose): 음성만 있는 팟캐스트를 자막 중심 영상 클립으로 바꿉니다.

세 가지 모두 받아쓰기(transcriber)가 필수인데, faster-whisper를 CPU 모드로 설치하면 GPU 없이도 돌아갑니다. 대신 긴 영상일수록 받아쓰기에 시간이 꽤 걸립니다.

HLJS TEXT
projects 폴더에 넣어 둔 lecture.mp4(40분짜리 강의 녹화)로 쇼츠 5개 뽑아줘.
- 각 30~50초, 세로 9:16으로 잘라서 한국어 자막 넣어줘.
- 받아쓰기는 faster-whisper CPU 모드로 해줘. 없으면 설치부터.
- 후보 구간을 먼저 10개 보여주고, 내가 고른 5개만 렌더해.

이 세 파이프라인도 모두 beta입니다. 저는 비슷한 작업을 제 쇼츠·릴스 자동화에서 다른 방식으로 하고 있어서 OpenMontage로는 아직 비교해 보지 못했습니다.

④ 마음에 드는 영상을 붙여넣고 따라 만들기

빈 화면에서 프롬프트를 짜는 게 막막하다면 이 방법이 제일 편합니다. 유튜브 쇼츠, 릴스, 틱톡 링크나 내 PC의 영상 파일을 주면 에이전트가 대본·템포·장면 구성·화풍을 분석하고, 무엇을 가져오고 무엇을 바꿀지 콘셉트 2~3개와 예상 비용을 먼저 보여 줍니다.

HLJS TEXT
이 쇼츠의 훅과 템포가 마음에 들어: (유튜브 쇼츠 링크)
이 구조는 유지하되 주제를 "직장인 점심값 아끼는 법"으로 바꾼 버전을 만들고 싶어.
- 먼저 원본 분석 결과와 콘셉트 3개, 지금 내 도구로 가능한 수준, 예상 비용만 보여줘.
- 내가 고르기 전까지는 재료 생성을 시작하지 마.

여기서 중요한 건 "지금 내 도구로 가능한 수준"입니다. 키가 없는 상태에서는 원본처럼 화려한 화면이 나오지 않을 수 있는데, 에이전트가 시작 전에 이걸 솔직하게 알려 주도록 설계되어 있습니다.

⑤ 몇백 원 쓰기: 애니풍 일러스트 영상

FAL_KEY 하나만 넣으면 AI 이미지 생성이 켜집니다. 공식 프롬프트 갤러리 기준 30초 지브리풍 영상이 약 0.15달러(200원대)입니다. 영상 생성 모델을 쓰는 게 아니라, 생성한 이미지 여러 장에 카메라 이동·장면 전환·빛 입자 효과를 입혀 움직이는 것처럼 만드는 방식이라 저렴합니다.

HLJS TEXT
30초짜리 세로 9:16 지브리풍 애니메이션 영상 만들어줘.
주제: 비 오는 오후, 작은 동네 서점에서 고양이가 졸고 있는 장면.
- 따뜻한 노란 조명, 창밖 빗방울, 책장 사이로 떠다니는 먼지.
- 내레이션 없이 잔잔한 음악만.
- 비용이 0.5달러를 넘으면 시작 전에 물어봐.

예산은 기본으로 총 10달러 한도, 0.5달러가 넘는 작업은 실행 전에 확인을 받도록 설정되어 있습니다. 그래도 처음에는 위처럼 금액 상한을 요청에 직접 적어 두시는 걸 권합니다.

4. 결과물을 좋게 만드는 요청 습관

공식 갤러리의 팁과 제가 직접 돌려보며 얻은 교훈을 합쳐 보면 아래 다섯 가지로 정리됩니다.

  1. 길이와 대상을 숫자로 적기. "45초, 중학생 대상"처럼 적으면 대본 분량과 말투가 확 달라집니다. 공식 문서 기준 45초 내레이션은 약 110단어(영어 기준)입니다.
  2. 화면 구성 요소를 이름으로 부르기. "보기 좋게"보다 "막대그래프로 비교, 도넛 차트로 비율, 통계 카드로 핵심 숫자"가 훨씬 잘 나옵니다.
  3. "무료 도구만", "단계마다 승인"을 매번 넣기. 비용과 방향을 지키는 가장 쉬운 장치입니다.
  4. 한국어 내레이션은 숫자를 한글로. Piper 한국어 음성은 아라비아 숫자를 잘 못 읽습니다. 대본 단계에서 "이백 도", "칠십 개"처럼 풀어 쓰게 하세요. 이 문제는 TTS 발음용 대본 실험에서 자세히 다뤘습니다.
  5. 첫 장면 하나를 먼저 보고 나머지를 승인하기. 뒤에 나오는 제 실행에서 첫 클립만 화풍이 실사로 바뀌는 사고가 있었습니다. 장면 재료 승인 단계에서 첫 컷부터 확인하면 같은 실수를 반복하지 않습니다.

승인 단계마다 무엇을 보면 되는지도 정리해 두겠습니다. 제 로컬 실행에서 승인자가 실제로 열어본 항목을 기준으로 했습니다.

승인 단계확인할 것
제안콘셉트가 주제와 맞는지, 예상 비용, 어떤 무료·유료 도구를 쓸지
대본문장 수와 길이, 숫자 표기, 사실 수치의 출처
장면 계획장면 수, 장면마다 무엇이 화면에 나오는지
재료이미지 시트, 첫 클립, 내레이션을 직접 들어보기
최종1초 간격 캡처, 자막 크기, 소리 크기

제 경험: RTX 5090으로 0원 영상 만들어 보기

여기까지가 일반 노트북 기준 사용법이고, 아래는 제 PC(RTX 5090 32GB, Windows, Claude Code)에 로컬 생성 모델을 붙여 API 키 없이 0원으로 영상 한 편을 끝까지 만들어 본 짧은 후기입니다. 실행 1회, 주제 1개라 표본이 작다는 점은 감안해 주세요.

항목결과
쓴 모델이미지 qwen_image 2.1, 영상 MiniMax H3 (ComfyUI), 음성 Piper 한국어
첫 시도설치 약 5분 만에 멈춤. npm install이 Claude Code 권한 확인에 걸려 직접 실행
로컬 모델 연결약 25분, 에이전트가 연결 코드 1,206줄 작성 (기본 워크플로 모델이 제 PC에 없었음)
영상 제작약 57분 (재료 생성 38분, 5초 클립당 약 7.5분), 생성 비용 0원
결과물31초 세로 영상, 움직이는 컷 약 19초(61%)

요청은 한 줄이었습니다.

30초짜리 세로 9:16 애니메이션 설명 영상 만들어줘. 주제: 커피 한 잔이 우리 손에 오기까지. API 키는 없으니 무료 도구만 써. 단계마다 멈추고 나한테 승인 받아.

완성된 31초 영상입니다. 소리를 켜면 Piper 한국어 내레이션도 들으실 수 있습니다.

OpenMontage 로컬 실행 결과, 커피 한 잔이 우리 손에 오기까지 (31초)

이슈 #210의 "키 없이 돌리면 글자 카드 슬라이드쇼가 나온다"는 불만과 달리, 로컬 모델을 붙이니 컷마다 실제로 무언가가 움직였습니다. 다만 1초 간격으로 뽑은 컨택트 시트를 보면 첫 줄만 그림체가 다릅니다.

OpenMontage 로컬 실행 결과 31초 영상의 1초 간격 컨택트 시트

첫 클립 프롬프트에 화풍 지시가 없어서 H3가 플랫 일러스트 참조를 실사처럼 다시 그렸습니다. 이후 클립에는 "Keep the exact flat vector illustration style… not photorealistic" 같은 화풍 유지 문장을 붙였고, 그 클립들은 플랫을 유지했습니다. 위 요청 습관 5번이 여기서 나온 교훈입니다.

플랫 일러스트 참조 이미지와, 이를 실사풍으로 바꿔 그린 MiniMax H3 첫 클립 비교

그 밖에 자막이 작고(템플릿 고정 42px), 한국어 음성은 첫 버전에서 6문장 중 3문장이 Whisper로 잘못 받아 적힐 정도로 발음이 뭉개졌습니다. 단어를 바꿔 다시 만들어 알아들을 수는 있게 됐지만 억양은 평평합니다. 그리고 이번 런의 승인 단계는 제가 하나하나 누른 게 아니라 Claude 서브에이전트에게 승인자 역할을 위임해서 진행했습니다(판정 12건, 승인 7·수정 요청 5). 결론은 "움직이는 설명 영상의 초안까지는 나온다"였고, 발행용으로 쓰기에는 손이 더 필요했습니다.

개인적인 생각 & 한계점

저는 OpenMontage를 "AI가 영상을 알아서 만들어 주는 도구"보다는 영상 제작 순서와 검수 기준을 문서로 만들어 둔 틀로 보는 게 맞는 것 같습니다. 이 틀 덕분에 영상 편집을 해 본 적 없는 분도 "조사 → 대본 → 장면 → 재료 → 편집" 순서를 따라가며 단계마다 판단만 내리면 됩니다.

다만 기대치는 현실적으로 잡으시는 게 좋겠습니다.

  • 공식 쇼케이스 영상들은 대부분 유료 영상 생성 모델과 직접 짠 화면 구성의 결과물입니다. 키 없이 돌려서 그 수준을 기대하시면 실망하실 수 있습니다.
  • 12개 파이프라인 중 6개가 beta입니다. 특히 일반인에게 유용한 클립 팩토리·토킹헤드·다큐 몽타주가 모두 beta라서 중간에 에이전트가 길을 잃는 경우가 있을 수 있습니다.
  • 한국어 무료 음성(Piper)은 알아들을 수는 있지만 억양이 평평하고 기계적입니다. 발행용이라면 Google TTS(한국어 지원, 신규 가입 시 Google Cloud 크레딧 제공)나 ElevenLabs 같은 유료 음성을 고려하시는 게 좋겠습니다.
  • 처음 한두 번은 설치와 도구 연결에 시간이 듭니다. "깔면 바로 영상이 나온다"보다는 "첫날은 세팅, 둘째 날부터 제작" 정도로 생각하시면 덜 막힙니다.

본인 상황에 맞춰 시작점을 정리하면 이렇습니다.

  1. 영상 편집 경험이 없고 일단 구경하고 싶다면: 설치 후 make demo → ① 설명 영상 한 편.
  2. 이미 찍어 둔 강의·라이브·팟캐스트가 있다면: ③ 클립 팩토리로 쇼츠 후보 뽑기.
  3. SNS용 분위기 영상이 필요하다면: ② 다큐 몽타주, 또는 몇백 원 들여 ⑤ 애니풍 영상.
  4. 고성능 GPU가 있다면: 로컬 영상 생성 모델을 붙여 0원으로 AI 클립까지 만들 수 있습니다. 다만 위 후기처럼 연결 작업과 꽤 긴 생성 시간이 필요합니다.

(이 글의 ①~⑤ 경로 중 제가 직접 끝까지 돌린 것은 위 후기의 설명 영상 파이프라인 하나이고, 나머지는 공식 문서와 파이프라인 정의를 읽고 정리했습니다. 틀린 부분이 있을 수 있습니다.)

이 글을 마치며 & Reference

다음에는 이번 글에서 직접 돌리지 못한 ③ 클립 팩토리로 실제 강의 녹화본을 쇼츠로 잘라 보고, 제 기존 쇼츠 자동화 방식과 비교해 보겠습니다.

같이 보시면 좋은 글입니다.

Reference

  • OpenMontage 공식 저장소: 설치 방법, 파이프라인 목록, 공식 쇼케이스 영상과 제작 비용이 한 페이지에 있습니다. exe 배포본이 아니라 여기서만 받으시면 됩니다.
  • PROMPT_GALLERY.md: 키 0개, 키 1개, 전체 설정별 요청 예시와 예상 비용·시간. 이 글의 비용 수치 대부분이 여기서 왔습니다.
  • AGENT_GUIDE.md: 에이전트가 처음 읽는 문서. 승인 단계와 도구 선택 규칙이 어떻게 적혀 있는지 보면 구조가 빨리 이해됩니다.
  • Piper 음성 목록: 한국어 음성 ko_KR-kss-medium을 받을 수 있는 곳입니다.
  • Pexels API: 다큐 몽타주 경로에서 쓰는 무료 스톡 영상 키 발급 페이지입니다.
  • Coffee in South Korea (Wikipedia): 후기 영상 속 "1인당 연 416잔(2024)" 수치의 출처입니다. 조사 단계에서 에이전트가 찾은 출처를 그대로 표기했습니다.

긴 글 읽어주셔서 감사합니다 :)

추가 학습 자료 신청

ZEXEA 메인 사이트의 자료 신청 페이지로 이동합니다. 이름·이메일·전화번호 등의 입력이 필요합니다. 블로그 글과 실습 예제는 신청 없이 모두 읽을 수 있습니다.

자료 신청 안내 보기

관련 가이드

이미지·아바타·영상·음악 로컬 AI 모델 로고 4개 옆에서 결과를 소개하는 유튜브 영상 썸네일
AUTOMATION2026년 10월 1일읽기 18분

로컬 AI 모델 4종, 콘텐츠 자동화에 쓸 수 있을까? RTX 5090에서 잰 생성 시간과 VRAM

로컬 AI 모델 4종(Qwen Image 2.1, InfiniteTalk, MiniMax H3, YuE2)을 RTX 5090과 ComfyUI로 돌려 생성 시간과 VRAM을 실측했습니다. 한글 인포그래픽, 20분 립싱크, 양자화 품질 저하까지 자동화 합격선을 적었습니다.

전체 과정 보기
Octop 소재로 만든 쇼츠·릴스의 훅과 화면 구성 비교
AI VIDEO2026년 9월 24일읽기 17분

쇼츠·릴스 로컬 자동화 제작기: 대본부터 아바타, 검수까지

두 달간 만든 쇼츠·릴스 자동화 파이프라인을 실제 영상과 이미지로 공개합니다. 로컬 TTS, 자막 타이밍, Remotion 편집, InfiniteTalk 아바타, 32개 검사와 실패 사례를 정리했습니다.

전체 과정 보기
마이크 캐릭터 옆에 TTS 대본 원문은 그대로라는 제목과 버전 2.5를 버전 이 점 오로 바꾼 발음용 대본 예시를 배치한 대표 이미지
AUTOMATION2026년 9월 5일읽기 9분

한국어 TTS 대본 전처리 실습: 원문을 보존하고 발음용 대본 따로 만들기

API·버전·시간·금액을 명시적인 발음 사전으로 바꾸는 파이썬 코드와 10문장 실행 결과를 제공합니다. 식별자 오변환을 막고 미등록 숫자·명령어를 검토 대상으로 남기는 방법을 다룹니다.

전체 과정 보기