🎬 Como Criar Vídeos com IA — Do Zero ao MP4 Final
Por Diogo Kopke — KopkAI
Por Diogo Kopke — KopkAI
Este guia mostra-te exactamente como criar vídeos verticais (Shorts, Reels, TikToks) 100% com IA, sem software de edição, sem experiência em vídeo. Descreves o que queres, e o computador constrói-o por ti.
O Que Vais Precisar
| Ferramenta | O que faz | Custo |
|---|---|---|
| Claude Code | O "cérebro" que orquestra tudo — escreve código, chama APIs, monta o vídeo | ~20€/mês (Pro) |
| Remotion | Framework React para criar vídeos programaticamente | Grátis (open source) |
| Kie.ai | API unificada para gerar imagens (Flux) e vídeos (Kling 3.0) com IA | Pay-per-use |
| ElevenLabs | Vozes ultra-realistas em qualquer idioma | Plano gratuito disponível |
| FFmpeg + yt-dlp | Processamento de áudio/vídeo e download | Grátis |
Tempo total da primeira vez: ~30 minutos de setup + 15 minutos por vídeo.
Parte 1: Setup Inicial (Faz Isto Uma Vez)
1.1 Instalar o Claude Code
O Claude Code é o que torna tudo possível. Em vez de aprenderes 5 ferramentas diferentes, descreves o que queres e ele faz por ti.
Opção A — VS Code (recomendada):
- Abre o VS Code
- Extensões → pesquisa "Claude Code" → Instalar
- Faz login com a tua conta Anthropic (plano Pro ou Max)
Opção B — Terminal:
npm install -g @anthropic-ai/claude-code
claude1.2 Instalar a Skill de Vídeo (Remotion)
Uma skill ensina o Claude Code a fazer uma coisa específica. A skill do Remotion dá-lhe conhecimento profundo sobre criação de vídeo.
npx skills add remotion-dev/skillsIsto instala automaticamente em .claude/skills/ e o Claude Code passa a saber:
- Criar composições animadas
- Adicionar texto, transições e efeitos
- Pré-visualizar no browser
- Renderizar MP4
1.3 Instalar Ferramentas de Linha de Comando
# macOS
brew install ffmpeg yt-dlp
# Whisper (transcrição de áudio)
pip3 install openai-whisper
# Edge TTS (voz alternativa, grátis)
pip3 install edge-tts1.4 Criar Contas nas APIs
| Serviço | URL | O que precisas |
|---|---|---|
| Kie.ai | https://kie.ai | Criar conta, ir a API Keys, copiar a chave |
| ElevenLabs | https://elevenlabs.io | Criar conta, ir a Profile → API Key |
Guarda as chaves num ficheiro .env no teu projecto:
KIE_AI_API_KEY=a_tua_chave_aqui
ELEVENLABS_API_KEY=a_tua_chave_aqui⚠️ Nunca faças commit do.env— adiciona-o ao.gitignore.
Parte 2: Criar a Tua Identidade Visual
Antes de criares o primeiro vídeo, define o teu estilo. Isto garante que todos os teus vídeos são reconhecíveis e consistentes.
2.1 Analisar Referências
Escolhe 3-5 criadores cujo estilo de edição admiras. Dá os links dos vídeos ao Claude Code:
Analisa estes vídeos frame a frame e diz-me o estilo de edição:
https://youtube.com/shorts/xxx
https://youtube.com/shorts/yyyO Claude vai:
- Descarregar os vídeos com
yt-dlp - Extrair frames com
ffmpeg - Analisar visualmente cada frame
- Dar-te um resumo completo: cores, fontes, transições, ritmo, layout
2.2 Definir o Teu Style Guide
Com base na análise, cria um style guide. Estes são os elementos que deves definir:
Formato:
- Resolução: 1080x1920 (vertical 9:16)
- FPS: 30
- Plataformas: Shorts, Reels, TikTok
Tipografia:
- Fonte dos títulos (ex: Montserrat Extra Bold)
- Fonte das legendas (ex: Montserrat Regular)
- Fonte de destaque (ex: Montserrat Bold)
Paleta de Cores:
- Cor de fundo dominante (ex: #000000)
- Cor do texto (ex: #FFFFFF)
- Cor de acento/marca (ex: #7DF9FF)
- Cor secundária (ex: #D4A017)
Branding:
- Logo em PNG transparente
- Posição do logo (ex: canto inferior esquerdo, 64px)
- Opacidade (ex: 85%)
Padrão de Edição:
HOOK (0-2s) → Texto grande ou afirmação forte
CONTEÚDO (2-Xs) → Alternância rápida entre cenas (2-4s cada)
CTA (últimos 3s)→ Chamada à acção2.3 Guardar Como Skill
Guarda o teu style guide como uma skill do Claude Code para que ele a siga automaticamente:
.claude/skills/o-teu-estilo/
├── SKILL.md # Entrada principal
└── rules/
├── style-guide.md # Cores, fontes, layout
├── editing-pattern.md # Estrutura dos vídeos
├── captions.md # Estilo das legendas
├── branding.md # Logo e marca
└── kie-ai-workflow.md # Como gerar assetsA partir daqui, cada vídeo que pedires vai seguir automaticamente o teu estilo.
Parte 3: O Pipeline de Produção
Este é o fluxo que o Claude Code segue para criar cada vídeo. Tu descreves o que queres, ele executa cada passo.
Passo 1: Descrever o Vídeo
Cria um vídeo de 15 segundos sobre [tema].
Com música de fundo e narração em PT-PT.
No final, adiciona este vídeo meu como CTA: [caminho do ficheiro]Passo 2: Shot List (O Claude Propõe, Tu Aprovas)
O Claude cria uma tabela com cada cena:
| # | Tempo | Visual | Narração |
|---|---|---|---|
| 1 | 0-3s | Descrição da cena | "Texto da narração" |
| 2 | 3-6s | Descrição da cena | "Texto da narração" |
| ... | ... | ... | ... |
Tu validas. Se algo não te agrada, dizes e ele ajusta.
Passo 3: Gerar Assets Visuais (Kie.ai)
O Claude usa a API do Kie.ai para gerar cada cena. Há duas abordagens:
Abordagem A — Imagem + Animação:
- Gera uma imagem estática com Flux Kontext (text-to-image)
- Anima essa imagem com Kling 3.0 (image-to-video)
- Resultado: clip de 5s com movimento natural
Abordagem B — Vídeo Directo:
- Gera o vídeo directamente com Kling 3.0 (text-to-video)
- Mais rápido, menos controlo sobre o frame inicial
API do Kie.ai — Resumo
Base URL: https://api.kie.ai/api/v1 Autenticação: Authorization: Bearer {API_KEY}
Gerar Imagem (Flux Kontext):
POST /flux/kontext/generate
{
"prompt": "descrição da cena",
"model": "flux-kontext-pro",
"aspectRatio": "9:16",
"outputFormat": "png"
}
# Resposta: { "data": { "taskId": "..." } }
# Poll: GET /flux/kontext/record-info?taskId=...Gerar Vídeo (Kling 3.0):
POST /jobs/createTask
{
"model": "kling-3.0/video",
"input": {
"prompt": "descrição do movimento",
"image_urls": ["url_da_imagem"], # opcional
"duration": "5",
"aspect_ratio": "9:16",
"mode": "std",
"sound": false,
"multi_shots": false
},
"callBackUrl": "https://..."
}
# Poll: GET /jobs/recordInfo?taskId=...Gerar Música (Suno):
POST /generate
{
"prompt": "descrição do estilo musical",
"model": "V4_5",
"instrumental": true,
"callBackUrl": "https://..."
}
# Poll: GET /generate/record-info?taskId=...Todas as gerações são assíncronas. Submetes o pedido, recebes umtaskId, e fazes polling até o estado sersuccess.
Passo 4: Gerar Narração (ElevenLabs)
POST https://api.elevenlabs.io/v1/text-to-speech/{voice_id}
Headers: xi-api-key: {API_KEY}
{
"text": "<lang xml:lang=\"pt-PT\">O teu texto aqui</lang>",
"model_id": "eleven_multilingual_v2",
"voice_settings": {
"stability": 0.45,
"similarity_boost": 0.8,
"style": 0.5,
"use_speaker_boost": true
}
}Dica importante: A tag <lang xml:lang="pt-PT"> força o modelo a usar sotaque português europeu em vez de brasileiro.
Vozes recomendadas para PT-PT:
onwK4e9ZLuTAKqWW03F9— Daniel (broadcaster, tom sério)nPczCjzI2devNBz1zQrb— Brian (profundo, confortante)TX3LPaxmHKxFdv7VOQHJ— Liam (energético, social media)
Passo 5: Montar no Remotion
O Claude cria um projecto Remotion com esta estrutura:
meu-video/
├── src/
│ ├── Root.tsx # Regista a composição
│ ├── Video.tsx # Orquestra tudo
│ ├── components/
│ │ ├── Scene.tsx # Reproduz cada cena (imagem ou vídeo)
│ │ ├── Captions.tsx # Legendas word-by-word
│ │ ├── TitleBadge.tsx # Título fixo no topo
│ │ ├── Logo.tsx # Logo da marca
│ │ └── CTAGraphic.tsx # Motion graphic final
│ ├── data/
│ │ └── captions.ts # Timestamps das legendas
│ └── styles/
│ └── brand.ts # Cores e constantes
├── public/
│ ├── logo.png # O teu logo
│ ├── music.m4a # Música de fundo
│ ├── narration.m4a # Narração TTS
│ ├── cta.mp4 # O teu vídeo CTA (se tiveres)
│ └── b-roll/ # Cenas geradas pela IA
│ ├── scene-01.mp4
│ ├── scene-02.mp4
│ └── ...
└── package.jsonConceito-chave: O Remotion funciona em camadas. O conteúdo visual está numa camada, as legendas noutra, o logo noutra. Todas se sobrepõem.
<AbsoluteFill>
{/* Camada 1: Vídeo de fundo */}
<Series>
<Scene src="b-roll/scene-01.mp4" />
<Scene src="b-roll/scene-02.mp4" />
...
</Series>
{/* Camada 2: Overlays */}
<TitleBadge text="TÍTULO" />
<Captions words={palavras} />
<Logo />
</AbsoluteFill>Passo 6: Preview e Ajustes
npx remotion studioAbre um browser onde vês o vídeo em tempo real. Podes:
- Avançar frame a frame
- Ajustar timings
- Pedir alterações ao Claude ("muda a cor do título", "aumenta o texto")
Passo 7: Render Final
npx remotion render NomeDaComposicao out/video-final.mp4O ficheiro MP4 fica pronto para upload directo nas plataformas.
Parte 4: Legendas Automáticas
Para Cenas com Narração (TTS)
As legendas são criadas manualmente porque tu controlas o texto. Define timestamps aproximados para cada grupo de palavras:
{ word: "Bomba", start: 3.4, end: 3.9, emphasis: true },
{ word: "de água!", start: 3.9, end: 4.8, emphasis: true },Para o Teu Vídeo (Talking Head)
Usa o Whisper para transcrever automaticamente com timestamps word-by-word:
whisper video.wav --language pt --model small --word_timestamps True --output_format jsonO resultado é um JSON com o tempo exacto de cada palavra, que depois alimenta o componente de legendas.
Estilo das Legendas
- Posição: terço inferior, centrado
- 1-3 palavras de cada vez (word-by-word)
- Brancas para texto normal
- Cor de acento para palavras de destaque
- Sem caixa/background — flutuam sobre o vídeo
- Sombra para garantir legibilidade
Parte 5: Dicas e Boas Práticas
Prompts para Gerar Cenas Melhores
Inclui sempre:
- Estilo visual: "Pixar quality 3D animation", "cinematic", "photorealistic"
- Iluminação: "golden hour", "neon glow", "soft backlight"
- Composição: "vertical composition 9:16", "close-up", "bird eye view"
- Atmosfera: "whimsical", "dramatic", "peaceful"
Estrutura que Funciona
HOOK forte (0-2s) → Prende a atenção imediatamente
CONTEÚDO visual (2-12s) → Alternar cenas a cada 2-4 segundos
CONCLUSÃO (12-15s) → Fechar com impacto
CTA pessoal (15s+) → Tu a falar directamente para a câmara
MOTION GRAPHIC → Indicação visual do que fazer (comentar, seguir, etc.)Música
- Gera com Suno via Kie.ai (instrumental, sem voz)
- Volume a 30-35% para não tapar a narração
- Fade out antes do CTA pessoal
- Escolhe o estilo musical que combina com o tema
CTA (Call to Action)
- Grava um vídeo curto (8-12s) no telemóvel a falar directamente
- Converte para 1080x1920 vertical
- Adiciona legendas automáticas (Whisper)
- Adiciona um motion graphic animado (ex: "Comenta X")
- Sem música de fundo — só a tua voz
Parte 6: Exemplo Prático Completo
Aqui está exactamente o que dissemos ao Claude Code para criar o nosso vídeo "Smurfs Pool Party":
Prompt Inicial:
Cria um vídeo de 15 segundos que tem música por trás e narração.
São os Smurfs a mandar mergulhos numa poça de água porque acabou de chover.
Eles saltam de folhas para dentro de água, nadam e divertem-se em boias feitas de gomas.O Que o Claude Fez:
- Criou um shot list com 5 cenas de 3 segundos
- Gerou 5 vídeos via Kling 3.0 (Kie.ai) — um por cena
- Gerou música whimsical via Suno (Kie.ai)
- Gerou narração PT-PT via ElevenLabs (Daniel, multilingual v2)
- Transcreveu o vídeo CTA com Whisper para legendas automáticas
- Montou tudo no Remotion com legendas, título, logo e motion graphic
- Renderizou o MP4 final
Resultado:
- 26 segundos totais (15s animação + 11s CTA)
- 5 cenas AI de Smurfs animados
- Narração em português de Portugal
- Música de fundo whimsical
- Legendas word-by-word
- Talking head CTA com legendas
- Motion graphic "Comenta SMURF" no final
- Logo KopkAI sempre visível
Tempo total de produção: ~15 minutos (maioria é espera pela geração das cenas).
Resumo do Fluxo
Tu descreves o vídeo
↓
Claude Code cria shot list → Tu aprovas
↓
Kie.ai gera imagens (Flux) → anima em vídeo (Kling 3.0)
Kie.ai gera música (Suno)
ElevenLabs gera narração (PT-PT)
↓
Remotion monta tudo (cenas + legendas + logo + música)
↓
Preview no browser → Tu ajustas
↓
Render MP4 → Upload para as plataformasSem timeline. Sem software de edição. Sem experiência necessária.
Descreves. O Claude constrói.
Guia criado por Diogo Kopke — KopkAI Gerado inteiramente com Claude Code
Preferes que isto seja feito por nós? Conhece o nosso serviço de automação de processos.
