이 글의 핵심 요약
- 선 결론: 하루 100편의 핵심은 더 강한 모델이 아니라 파이프라인 유형 선택——「텍스트-투-비디오」와 「소재 정밀 편집」은 완전히 다른 생산 곡선을 따릅니다.
- Video-use는 오픈소스 에이전트 편집 워크플로: 원본 소재를 폴더에 넣으면 Claude Code / Codex가 전사 텍스트를 읽어 단어 경계로 컷하고 FFmpeg가
final.mp4를 출력——토크·튜토리얼·인터뷰 대량 정밀 편집에 적합합니다. - M4 Mac mini 한 대 실측 안정 처리량 약 40–60편/일(30–45초 세로). 안정적으로 100편을 넘기려면 2–3대 병렬 노드 + 큐 스케줄링이 필요하며, 단일 Agent를 밤새 돌리는 방식은 비현실적입니다.
- 5축 비교: Video-use는 n8n 템플릿 플로우보다 「실행 능력」과 「권한 경계」에서 우위지만, 「화면을 처음부터 생성」에서는 Pixelle-Video / Sora 파이프라인에 뒤집니다——조합 사용이 100편/일의 현실적 경로입니다.
- 대량 렌더링, 전사 콜백, 에이전트 장시간 세션은 클라우드 Mac에서 돌리는 것이 최적——노트북 뚜껑을 한 번 닫으면 큐가 끊깁니다.
선 결론: 생산 병목은 모델이 아니라 파이프라인
모델이 화면을 생성할 수 있지만, 단어 경계 편집 + 대량 렌더링 + 큐 스케줄링이 100편/일의 진짜 분수령입니다.
선 결론: 토크 영상, 화면 녹화, 인터뷰 등 원본 소재가 있다면 Video-use가 현재 가장 실용적인 에이전트 편집 방안입니다——소재를 폴더에 넣고 Claude Code가 전사 텍스트로 정밀 컷한 뒤 FFmpeg 하드웨어 가속으로 출력합니다. 화면을 처음부터 만들어야 한다면 Pixelle-Video, n8n + Sora 같은 「텍스트-투-비디오」 파이프라인을 상류에 두고 Video-use로 하류 템포를 최적화하세요.
kvmboot 클라우드 Mac mini M4(24GB)에서 실측: 30–45초 세로 토크 슬라이스가 전사부터 final.mp4까지 평균 8–14분(ElevenLabs 전사·자체 검수 포함). 3대 노드 병렬 + 야간 큐로 하루 90–120편 안정 생산. 키워드: AI 숏폼 · Video-use · 자동화 워크플로
1. 왜 「하루 100편」이 어려운가
숏폼 대량 생산의 병목은 「대본 쓰기」가 아닙니다——GPT-4급 모델은 1분에 20개 대본을 뽑을 수 있습니다. 진짜 병목은 세 곳에 있습니다:
- 렌더링은 CPU/GPU 집약적: 45초 세로 영상에 FFmpeg 트랜스코드 + 자막 번인 + 색보정 필터, M4에서 약 3–6분. 100편이면 순수 렌더만 5–10시간이며, 전사와 Agent 판단 시간은 아직 포함되지 않았습니다.
- 품질과 속도는 트레이드오프: 완전 자동 n8n 파이프라인은 3–8분에 1편이지만, 화면 일관성과 리듬감은 정밀 편집에 크게 뒤집니다. Video-use 품질은 높지만 편당 시간이 더 깁니다.
- Agent 세션은 끊기면 안 됨: Video-use는 코딩 Agent가
takes_packed.md를 읽고,timeline_view.py로 시각 검사를 호출하며, 자체 검수 루프를 돌리는 구조입니다. 노트북 뚜껑을 닫거나 네트워크가 흔들리면 한 편이 처음부터 다시 시작될 수 있습니다.
그래서 「하루 100편」은 하나의 도구에 모든 것을 맡기지 말고 파이프라인 유형별로 나눠야 합니다. 이미 Agent로 정기 작업을 오케스트레이션 중이라면 클라우드 Mac에서 Cursor Automations 설정하기의 큐·Webhook 패턴을 영상 배치 스케줄링에 그대로 재사용할 수 있습니다.
2. 숏폼 파이프라인 3가지 유형
2.1 A유형: 텍스트-투-비디오(Text-to-Video)
주제 하나를 입력하면 대본 → 이미지/영상 → TTS 더빙 → 합성까지 전자동. 대표 도구: Pixelle-Video, n8n + Sora 2 + Shotstack, Viral Shorts Engine. 장점: 소재 제로 문턱. 단점: 화면 일관성 통제 어려움, API 비용 높음(편당 $0.5–3), 플랫폼 심사 리스크.
2.2 B유형: 소재 정밀 편집(Agent Editing)
원본 녹화본을 입력하면 Agent가 전사 텍스트로 단어 경계 컷, 군더더기 제거, 색보정, 자막, 자체 검수를 수행. 대표 도구: Video-use. 장점: 인간 정밀 편집에 근접한 품질, 오픈소스·자체 호스팅 가능. 단점: 원본 소재 필요, 편당 8–14분, Agent 환경 의존.
2.3 C유형: 리믹스/클립(Remix / Clip)
긴 영상에서 자동 슬라이스, 자막 추가, 화면비 변경. 대표 도구: ViralMint MCP, Descript, Opus Clip. 장점: 팟캐스트·장시간 라이브 클립에 적합. 단점: 토크형 숏폼 리듬 제어는 Video-use보다 거칩니다.
3. Video-use 워크플로 분해
Video-use(browser-use/video-use)는 코딩 에이전트용 오픈소스 편집 Skill입니다. 영상을 「본다」기보다 읽습니다——두 층 정보로 단어 경계 정밀 편집을 수행합니다:
3.1 1층: 오디오 전사(항상 로드)
각 원본 소재마다 전사 API를 한 번 호출(공식 저장소 기본값 ElevenLabs Scribe, 국내 fork는 iFLYTEK 지원). 단어별 타임스탬프, 화자 분리, 웃음·박수 등 오디오 이벤트 태그를 얻습니다. 모든 테이크가 약 12KB의 takes_packed.md로 압축——LLM이 컷 포인트를 고르는 주요 읽기 자료입니다.
3.2 2층: 시각 복합(필요 시 호출)
timeline_view.py가 임의 구간에 필름스트립 + 파형 + 단어 라벨 PNG를 생성합니다. 멈춤 판단, 재촬영 비교, 컷 포인트 검증 같은 핵심 의사결정 시점에만 호출——LLM에게 「프레임 단위로 영상을 보라」고 시키는 것보다 수량급 효율적입니다.
3.3 렌더링과 자체 검수
컷 포인트 확정 후 FFmpeg 실행: 30ms 오디오 페이드 인/아웃으로 팝 노이즈 방지, 색보정 필터(warm_cinematic / neutral_punch), 자막 번인, 선택적 Manim/Remotion 애니메이션 오버레이. 자체 검수 단계에서 렌더 완료본의 컷 근처 화면·파형·자막 가림을 점검——점프 컷과 싱크 불일치를 납품 전에 잡습니다.
3.4 프로젝트 메모리
매 편집 결정이 project.md에 기록됩니다. 같은 시리즈를 이어서 자를 때 컨텍스트를 이어받을 수 있어——동일 IP 시리즈 숏폼 대량 생산에 필수적입니다.
Set up https://github.com/browser-use/video-use for me. Read install.md first to install this repo, wire up ffmpeg, register the skill with whichever agent you're running under, and set up the ElevenLabs API key. Then read SKILL.md for daily usage, and always read helpers/. After install, don't transcribe anything on your own — just tell me it's ready and wait for me to drop footage into a folder.
클라우드에서 Agent를 장기 실행하는 모범 사례는 클라우드 Mac 듀얼 AI 에이전트: Claude Code + Codex 분리를 참고하세요.
4. 5축 비교표
| 도구/방안 | 진입점 | 실행 능력 | 컨텍스트 | 비용 | 권한 경계 | 적합 대상 |
|---|---|---|---|---|---|---|
| Video-use | CLI + Agent Skill | 단어 경계 정밀 컷, 색보정, 자막, 자체 검수 | 원본 소재 + 전사 텍스트 | 오픈소스 + 전사 API(~$0.01/분) | 로컬/클라우드 shell 전권한 | 소재 있는 토크/튜토리얼 크리에이터 |
| Pixelle-Video | Web UI / API | 대본→이미지→TTS→합성 풀체인 | 주제 키워드 | 오픈소스 + 다중 모델 API | 로컬 서비스 / ComfyUI | 무얼굴 숏폼 매트릭스 계정 |
| n8n + Sora 2 | 시각적 오케스트레이션 | 대본 생성 + AI 영상 + 멀티 플랫폼 배포 | Google Sheet 주제표 | 자체 호스팅 n8n + Sora API(고비용) | 워크플로 샌드박스 | 마케팅 팀 대량 출고 |
| CapCut 수동 | GUI 편집기 | 풀기능 편집 | 로컬 소재 | 무료/Pro $9.99/월 | 데스크톱 앱 | 프리미엄 단편(<10편/일) |
| ViralMint MCP | Claude Code MCP | 트렌드 정찰 + 슬라이스 +보내기 | 플랫폼 인기 콘텐츠 | 오픈소스 + 로컬 연산 | MCP 도구 호출 | 2차 창작 / 클립 매트릭스 |
표 읽는 법: Video-use의 「실행 능력」은 화면 생성이 아니라 편집 정밀도에 집중됩니다. 하루 100편은 보통 Pixelle-Video나 화면 녹화로 A유형 소재를 만들고(A), Video-use로 B유형 리듬을 다듬은 뒤(B), n8n이나 스크립트로 대량 업로드(배포층)합니다.
5. 시나리오 선택 매트릭스
| 사용 시나리오 | 추천 방안 | 핵심 이유 | 일일 예상 |
|---|---|---|---|
| 토크 크리에이터 일 10편 정밀 편집 | Video-use × M4 1대 | 품질 우선, 단일 노드로 충분 | 10–15편 |
| 지식 유료 매트릭스 50+편/일 | 대량 화면 녹화 + Video-use × 클라우드 Mac 2대 | 병렬 렌더, 큐 스케줄링 | 50–70편 |
| 무얼굴 뉴스 계정 100편/일 | Pixelle-Video 소재 + Video-use 정밀 편집 + n8n 배포 | A+B 조합, 풀체인 자동화 | 80–120편 |
| 이커머스 제품 숏폼 | n8n + Sora 2 + Shotstack | 제품 데이터 기반, 화면 일관성 요구 낮음 | 30–50편 |
| 팟캐스트/장시간 라이브 클립 | ViralMint MCP + Video-use 정밀 보정 | 거친 컷 후 정밀 편집, 효율 최대 | 20–40편 |
| 브랜드 프리미엄 단편 | CapCut 수동 + Video-use 보조 | 품질 상한, 대량 생산 부적합 | 1–5편 |
6. 추천 조합(Stack)
개인 크리에이터——일 10편 정밀 편집:
iPhone으로 토크 10편 일괄 녹화(회당 60–90초 원본) → 소재를 클라우드 Mac 프로젝트 디렉터리에 동기화 → Claude Code + Video-use Skill로 편당 정밀 편집 → 수동 검수 후 유튜브 쇼츠·틱톡·릴스 업로드 = M4 클라우드 Mac 1대, 월 렌탈로 전체 연산 커버
매트릭스 운영——목표 100편/일:
주제표(Google Sheet / Airtable) 100개 테마 → 대본 일괄 생성(GPT-4 / Claude API) → 화면 녹화 or Pixelle-Video B-roll(3대 노드 병렬) → Video-use 정밀 편집 큐(Redis / 파일 락 스케줄러) → FFmpeg 통일 출력 1080×1920 + 자막 템플릿 → n8n 대량 업로드 + 플랫폼 API 배포 = 클라우드 Mac M4 24GB 2–3대 + API 예산 ~$50–80/일
개발 팀——CI 통합 영상 산출:
GitHub Actions 트리거 → Cloud Mac Runner가 소재 pull → Video-use headless 모드 렌더 → 산출물 S3 / CDN 업로드 → Slack 콜백 알림 = iOS CI와 Cloud Mac 노드 공유, Runner 격리 가이드 참고
CI 통합 세부는 iOS 18 CI/CD 클라우드 Mac M4 전체 가이드의 Runner 격리·병렬 전략을 참고하세요. 대량 렌더 노드 구성 시 Mac mini AI Agent 서버 2026 구성 가이드의 메모리·병목 분석도 도움이 됩니다.
7. 자주 하는 오해
- 오해 1: 「Video-use가 텍스트에서 100편을 직접 생성한다」——아닙니다. 편집 도구이지 생성 도구가 아닙니다. 원본 소재가 없으면 입력도 없습니다.
- 오해 2: 「Mac 한 대로 100편을 억지로」——M4 단일 노드 안정 처리량 약 40–60편/일. 100편을 억지로 맞추면 품질 하락 또는 밤새 큐 대기, Agent 세션 중단 리스크가 급증합니다.
- 오해 3: 「전사 API를 생략할 수 있다」——단어별 타임스탬프 없이는 Agent가 단어 경계 정밀 컷을 못 하고, 고정 길이 컷으로 퇴화해 품질이 급락합니다.
- 오해 4: 「완전 자동이면 사람 검수 불필요」——100편/일에서 5% 불량률만 되어도 5편의 쓰레기 콘텐츠입니다. 「10% 샘플 검수 + 첫 편 전체 검수」 게이트를 유지하세요.
- 오해 5: 「노트북에서 대량 큐 실행」——뚜껑 닫기 = 큐 중단 = 처음부터 재렌더. 배치 작업은 클라우드 Mac이나 항상 켜 둔 데스크톱에서 돌려야 합니다.
- 오해 6: 「플랫폼 심사 규칙 무시」——AI 생성 화면은 틱톡·유튜브 쇼츠 등에서 추가 심사 가중치가 있습니다. 순수 토크 정밀 편집(Video-use 주력 시나리오)이 텍스트-투-비디오보다 통과율이 훨씬 높습니다.
8. 7단계 체크리스트
- 파이프라인 유형 확정: 소재 있음 → Video-use. 소재 없음 → A유형 먼저 구축(Pixelle-Video / 화면 녹화) 후 Video-use로 정밀 편집.
- 실행 환경 준비: macOS + FFmpeg + Python 3.10+ + Claude Code / Codex. 렌더가 일상용 Mac을 점유하지 않도록 클라우드 Mac mini M4 24GB 권장.
- Video-use 설치: browser-use/video-use 클론,
install.md로 FFmpeg·ElevenLabs API Key 설정, Agent Skill 등록. - 단일 편 풀 플로우 검증: 60초 토크 소재 1편 투입, 전사 → 컷 → 렌더 → 자체 검수 전체 소요 측정, 병목 기록.
- 배치 디렉터리 구조:
projects/{date}/{topic_id}/raw/+projects/{date}/{topic_id}/output/,project.md로 시리즈 일관성 유지. - 병렬 큐 배포: 클라우드 Mac 2–3대에 파일 락 또는 Redis 큐. 전사와 렌더를 다른 노드로 분리. Cursor Automations Webhook 트리거 스케줄링 패턴 참고.
- 품질·배포 폐루프: 렌더 완료 후 자체 검수 스크립트 자동 실행 → 사람 10% 샘플 검수 → 통과 시 n8n/스크립트 대량 업로드. 주간 불량률·편당 비용 회고.
9. FAQ
Video-use는 텍스트에서 100편의 숏폼을 직접 생성할 수 있나요?
아닙니다. Video-use는 코딩 에이전트용 편집 워크플로로, 원본 소재의 단어별 전사·단어 경계 컷·색보정·자막·자체 검수가 핵심입니다. 하루 100편을 내려면 대량 소재 공급과 병렬 렌더링 노드가 필요합니다.
하루 100편, Mac 한 대면 충분한가요?
M4 Mac mini에서 30–45초 세로 숏폼·FFmpeg 하드웨어 가속 조건에서 실측 안정 처리량은 약 40–60편/일입니다. 100편을 안정적으로 달성하려면 2–3대의 클라우드 Mac 병렬, 또는 큐로 전사와 렌더링을 다른 노드에 분리하세요.
Video-use와 Pixelle-Video는 어떻게 선택하나요?
Pixelle-Video는 「주제 입력→전자동 생성」 무얼굴 숏폼에 적합합니다. Video-use는 「원본 소재 있음→에이전트 정밀 편집」 토크·튜토리얼·인터뷰에 적합합니다. 필요 시 연계 사용하세요.
왜 Video-use를 클라우드 Mac에서 실행하나요?
대량 FFmpeg 렌더링, 전사 API 콜백, 에이전트 장시간 세션은 7×24 안정 가동이 필요합니다. 클라우드 Mac mini M4는 영구 tmux, Apple Silicon 하드웨어 인코딩, 격리 환경을 제공해 로컬 머신 점유·절전 중단을 피합니다.
Video-use에 필요한 API Key는?
공식 저장소는 ElevenLabs Scribe를 단어별 전사 기본값으로 사용합니다. 국내 fork는 iFLYTEK를 지원합니다. 추가로 FFmpeg, Python 3.10+, shell 실행 가능한 에이전트(Claude Code, Codex, OpenClaw 등)가 필요합니다.
100편/일 API 비용은 대략 얼마인가요?
30초 토크 기준: ElevenLabs 전사 약 $0.005/편, Claude API 컷 결정 약 $0.02–0.05/편, FFmpeg 렌더는 API 비용 없음. 100편 합계 약 $2.5–5.5/일(클라우드 Mac 렌탈 제외). 텍스트-투-비디오(Sora / Kling)는 10–50배 높습니다.
10. 요약
하루 100편 숏폼은 2026년에도 충분히 가능합니다——전제는 「모델 선택」보다 「파이프라인 오케스트레이션」을 앞세우는 것입니다. Video-use는 가장 어려운 「정밀 편집 품질」 문제를 해결합니다. 화면을 생성하지는 않지만, 기존 소재의 리듬·자막·관람감을 인간 정밀 편집에 근접하게 만듭니다.
현실적 경로: A유형 소재 생산 → B유형 리듬 정밀 편집 → 병렬 노드 + 큐 스케줄링 → 샘플 검수·배포. M4 한 대로 일 10–15편 정밀 편집. 100편 돌파는 클라우드 Mac 2–3대 병렬이 가성비 최고의 확장 레버입니다.
다음 행동: 클라우드 Mac에서 60초 토크 소재 1편으로 Video-use 풀 플로우를 먼저 검증하고, 소요 시간을 기록한 뒤 노드 확장 여부를 결정하세요. 단일 편도 통과하기 전에 Mac 세 대를 사지 마세요——워크플로 검증 > 하드웨어 쌓기입니다.
대량 영상 렌더링, 클라우드 Mac이 노트북보다 10배 안정적
Video-use 배치 큐가 가장 두려워하는 것 두 가지: 뚜껑 닫기로 Agent 세션 중단과 FFmpeg가 일상용 Mac을 점유하는 상황입니다. kvmboot 클라우드 Mac mini M4는 영구 tmux 세션, Apple Silicon 하드웨어 인코딩(VideoToolbox H.264/HEVC 가속), 24GB 통합 메모리로 전사 + 렌더 병렬을 지원합니다. M4 노드 3대 병렬로 일 90–120편 세로 숏폼——MacBook은 그대로 코딩·회의·브라우징에 쓰세요. M4 대기 전력 약 4W, 7×24 배치 렌더 종합 전기비는 자체 조립 Windows 워크스테이션보다 낮습니다.
일 렌탈로 시작해 소재 1편으로 Video-use 풀 플로우를 검증한 뒤 확장하세요——kvmboot 클라우드 Mac mini M4가 대량 숏폼 워크플로 검증의 최단 경로입니다. 요금제 바로 보기, 렌더 큐는 클라우드에서, 창의력은 로컬에 남기세요.