NovedadIA

Cómo construir un AI Video Agent desde cero con frameworks abiertos

Guia

Guía práctica para construir un AI Video Agent capaz de automatizar todo el proceso de producción de vídeo, desde el guion y las imágenes hasta la voz, los subtítulos, el montaje y la revisión.

Hoy en día, muchas personas ya utilizan IA para escribir artículos, generar código o crear imágenes. Sin embargo, conseguir que una IA complete por sí sola todo un proceso de producción de vídeo es bastante más complejo.

Por ejemplo, podemos darle a un Agent una instrucción como:

«Ayúdame a crear un vídeo de presentación de un producto de 60 segundos».

En un escenario ideal, el Agent debería poder encargarse de todo el proceso:

analizar el guion → dividirlo en planos → generar las imágenes → crear la voz en off → generar los subtítulos → montar el vídeo → comprobar el resultado → corregir los problemas → exportar el vídeo final.

Esto ya no es simplemente un chatbot. Es un ejemplo típico de un workflow basado en AI Agent.

En este artículo no vamos a depender de un framework concreto. Partiremos de una arquitectura general que puede implementarse con LangGraph, CrewAI, AutoGen, OpenAI Agents SDK u otros frameworks de agentes de código abierto o de ecosistemas abiertos.

Cada framework utiliza sus propias abstracciones para conceptos como Agent, Tool, State o Workflow, pero los principios de diseño son muy similares.


Paso 1: entender qué es realmente un Agent

Cuando alguien descubre los AI Agents por primera vez, es habitual pensar que son simplemente una versión «más inteligente» de ChatGPT.

En realidad, la diferencia principal no está necesariamente en el modelo, sino en su capacidad para ejecutar tareas de forma continuada y utilizar herramientas externas.

Un modelo conversacional tradicional suele funcionar así:

Usuario
   ↓
LLM
   ↓
Respuesta

Un Agent se parece mucho más a esto:

Usuario define un objetivo
        ↓
      Agent
        ↓
   Decide el siguiente paso
        ↓
    Utiliza una herramienta
        ↓
    Obtiene un resultado
        ↓
 Comprueba si la tarea terminó
      ↙       ↘
  Continuar    Completado
      ↓
 Volver a utilizar herramientas

Podemos resumir este proceso como:

Goal → Think → Act → Observe → Repeat

Es decir:

  1. Comprender el objetivo.

  2. Decidir qué hacer a continuación.

  3. Utilizar una herramienta.

  4. Obtener el resultado.

  5. Evaluar ese resultado y decidir el siguiente paso.

  6. Repetir el proceso hasta completar la tarea.

Esto es lo que se conoce como Agent Loop.

El Agent más sencillo posible

Imaginemos que el usuario pide:

«Consulta el tiempo de hoy en Tokio y dime si necesito llevar paraguas».

El Agent no debería limitarse a responder basándose en lo que recuerda el modelo. Debería hacer algo parecido a esto:

Petición del usuario
        ↓
      Agent
        ↓
 Utilizar herramienta meteorológica
        ↓
 Obtener datos meteorológicos
        ↓
Analizar probabilidad de lluvia
        ↓
 Generar respuesta final

Lo que convierte este sistema en un Agent es precisamente la combinación de uso de herramientas y ejecución iterativa.


Paso 2: elegir un framework de Agent

En teoría, puedes implementar todo el Agent Loop manualmente. En la práctica, un proyecto real empieza rápidamente a plantear muchos problemas:

  • ¿Cómo registrar las Tools?

  • ¿Cómo definir sus parámetros?

  • ¿Qué ocurre si el modelo devuelve un resultado incorrecto?

  • ¿Cómo guardar el estado de ejecución?

  • ¿Cómo gestionar los errores a mitad del proceso?

  • ¿Cómo implementar múltiples Agents?

  • ¿Cómo evitar que el Agent entre en un bucle infinito?

  • ¿Cómo registrar cada paso de ejecución?

  • ¿Cómo pausar una tarea y continuarla posteriormente?

Por eso, en proyectos reales suele ser más práctico utilizar un Agent Framework.

Algunas opciones habituales son:

FrameworkIdea principalAdecuado para
LangGraphGrafos y máquinas de estadosWorkflows complejos y controlables
CrewAIAgent + Task + CrewColaboración entre múltiples Agents
AutoGenComunicación entre AgentsSistemas multi-Agent
OpenAI Agents SDKAgent + Tool + HandoffAgents relativamente ligeros
Otros frameworks open sourceDiferentes abstraccionesProyectos específicos

No existe un framework que sea objetivamente «el mejor» para todos los casos.

LangGraph pone más énfasis en el estado y el control del flujo. CrewAI resulta especialmente cómodo para organizar Agents con diferentes roles. AutoGen se centra más en la comunicación y colaboración entre Agents.

Para nuestro AI Video Agent, podemos entender el framework como la infraestructura sobre la que se ejecuta el Agent.

Lo realmente importante es comprender estos conceptos:

Agent
Tool
State / Context
Workflow
Memory
Execution Loop

Una vez dominados estos conceptos, cambiar de framework no obliga a rediseñar todo el sistema desde cero.


Paso 3: empezar con el Agent más sencillo

No conviene intentar construir un sistema completo de generación de vídeo desde el primer momento.

La primera versión solo necesita hacer esto:

Entrada del usuario
        ↓
      Agent
        ↓
 Utilizar una Tool
        ↓
 Obtener resultado
        ↓
 Devolver resultado

Por ejemplo, podemos empezar creando un Agent de generación de imágenes.

Le damos una Tool:

generate_image(prompt)

El usuario escribe:

«Genera una imagen de una ciudad futurista».

El Agent determina que necesita utilizar la herramienta de generación:

generate_image(
    "a futuristic city at night..."
)

La herramienta devuelve:

https://example.com/image.png

Y el Agent entrega el resultado al usuario.

En esta primera fase, el objetivo no es construir un producto complejo. Lo importante es comprobar que funciona correctamente la cadena:

Model → Tool → Tool Result → Agent


Paso 4: añadir más herramientas al Agent

Una vez que la primera llamada a una Tool funciona correctamente, podemos empezar a añadir nuevas capacidades.

Un AI Video Agent puede necesitar, como mínimo, las siguientes herramientas.

1. Herramienta de storyboard

create_storyboard(script)

Su función es dividir un guion completo en diferentes planos.

Por ejemplo:

Plano 1
Tiempo: 0-5 segundos
Imagen: ciudad de noche
Voz en off: Hoy vamos a conocer un nuevo producto.

Plano 2
Tiempo: 5-10 segundos
Imagen: primer plano del producto
Voz en off: Su principal característica es...

Plano 3
Tiempo: 10-18 segundos
Imagen: usuario utilizando el producto
Voz en off: En la experiencia real...

2. Herramienta de generación de imágenes

generate_image(prompt)

Se encarga de crear las imágenes estáticas que utilizará el vídeo.


3. Herramienta de generación de voz

generate_voice(text, voice)

Convierte la narración en un archivo de audio.


4. Herramienta de subtítulos

create_subtitles(audio)

Genera un archivo de subtítulos a partir del audio.


5. Herramienta de generación de vídeo

generate_video(image, prompt, duration)

Convierte una imagen estática en un plano de vídeo animado.


6. Herramienta de comprobación del vídeo

check_video(video)

Puede comprobar aspectos como:

  • si existe una pantalla en negro;

  • si los planos se reproducen correctamente;

  • si los subtítulos salen fuera de la pantalla;

  • si existen errores visuales evidentes;

  • si el audio y el vídeo están razonablemente sincronizados.

A partir de este punto, el Agent deja de ser simplemente un chatbot y empieza a convertirse en un verdadero Agent basado en herramientas.


Paso 5: conectar las Tools en un workflow de producción

Aquí aparece una de las partes más interesantes.

El usuario no debería tener que ejecutar cada herramienta manualmente.

Podría limitarse a decir:

«Crea un vídeo de 60 segundos sobre una máquina de café».

Y el Agent debería encargarse de planificar el proceso:

Petición del usuario
        ↓
 Analizar el guion
        ↓
 Crear storyboard
        ↓
       ┌→ Generar plano 1
       ├→ Generar plano 2
       ├→ Generar plano 3
       └→ Generar plano 4
        ↓
 Generar voz
        ↓
 Generar subtítulos
        ↓
 Montar vídeo
        ↓
 Comprobar vídeo
        ↓
 ¿Hay problemas?
      ↙       ↘
    Sí         No
    ↓           ↓
 Corregir     Exportar
    ↓
Volver a generar

En este punto ya no basta con pensar únicamente en Tools. Hay que empezar a diseñar el Workflow.


Paso 6: añadir State al Agent

La producción de vídeo es una tarea relativamente larga.

Si toda la información se almacena únicamente dentro del historial de conversación, el contexto puede crecer rápidamente y convertirse en un problema.

Por eso conviene crear un estado explícito para cada tarea.

Por ejemplo:

{
  "project": {
    "title": "Presentación de una máquina de café",
    "duration": 60
  },
  "script": "...",
  "storyboard": [],
  "images": [],
  "voices": [],
  "subtitles": "",
  "video": "",
  "status": "rendering"
}

Cada vez que el Agent termina una etapa, actualiza el estado.

Por ejemplo:

status = storyboard_completed

Después:

status = images_completed

A continuación:

status = voice_completed

Y finalmente:

status = completed

Esto proporciona una ventaja fundamental:

si la tarea falla a mitad del proceso, no es necesario empezar desde cero.

Por ejemplo, si falla la generación del cuarto plano, el sistema puede continuar directamente desde ese punto.

Por eso el State se convierte en una pieza fundamental en los proyectos de Agents complejos.


Paso 7: enseñar al Agent a comprobar sus propios resultados

Un Agent realmente útil no debería limitarse a:

Utilizar una herramienta → obtener un resultado → terminar.

Debería incorporar un ciclo de:

ejecutar → comprobar → corregir → volver a ejecutar.

Por ejemplo, después de generar un vídeo:

Generar vídeo
     ↓
Comprobar vídeo
     ↓
Los subtítulos están demasiado abajo
     ↓
Modificar posición de subtítulos
     ↓
Volver a renderizar
     ↓
Comprobar de nuevo

Esto constituye un sencillo mecanismo de autocorrección del Agent.

Podemos representarlo así:

Generate
   ↓
Evaluate
   ↓
Improve
   ↓
Generate again

Este mecanismo es especialmente importante en la producción de vídeo porque las imágenes, voces, subtítulos y vídeos generados por IA tienen cierto grado de variabilidad.


Paso 8: dividir el sistema en varios Agents especializados

Si el proyecto sigue creciendo, podemos evolucionar hacia una arquitectura Multi-Agent.

Por ejemplo:

                  Agent principal de vídeo
                           │
          ┌────────────────┼────────────────┐
          ↓                ↓                ↓
     Agent guionista   Agent visual     Agent de audio
          │                │                │
       Escribir          Crear imágenes    Generar voz
        guion                ↓                ↓
          ↓             Agent de vídeo   Agent de subtítulos
     Storyboard              │                │
          │                  │                │
          └──────────────────┴────────────────┘
                           ↓
                    Agent de revisión
                           ↓
                      Vídeo final

Agent guionista

Se encarga de:

  • guion;

  • ritmo;

  • narración.

Agent visual

Se encarga de:

  • storyboard;

  • imágenes;

  • prompts de vídeo;

  • estilo visual.

Agent de audio

Se encarga de:

  • voz;

  • música;

  • efectos de sonido.

Agent de revisión

Se encarga de:

  • comprobar las imágenes;

  • comprobar los subtítulos;

  • comprobar la sincronización;

  • decidir si es necesario volver a generar algún elemento.

La ventaja es que cada Agent tiene responsabilidades más claras.

Pero no todos los proyectos necesitan una arquitectura Multi-Agent.

Si un solo Agent equipado con varias Tools puede completar correctamente la tarea, no tiene sentido dividir el sistema en múltiples Agents solo para hacerlo parecer más sofisticado.


Paso 9: convertir las capacidades en un Preset o Workflow

Cuando el Agent ya puede utilizar diferentes herramientas de forma autónoma, podemos combinar esas capacidades en un workflow de producción de vídeo relativamente estable.

Por ejemplo:

Video Agent
│
├── Analyze Script
├── Create Storyboard
├── Generate Images
├── Generate Videos
├── Generate Voice
├── Generate Subtitles
├── Compose Video
├── Check Result
└── Export

El usuario solo tendría que proporcionar:

Tema
Duración del vídeo
Estilo visual
Plataforma de destino

El resto del proceso lo realizaría el Agent.

En este punto ya no estamos hablando simplemente de un «chatbot de IA», sino de un auténtico:

sistema de producción de vídeo basado en IA.


Paso 10: añadir una Web UI

Si el sistema es exclusivamente para uso personal, una interfaz de línea de comandos puede ser suficiente.

Pero si queremos que otras personas puedan utilizarlo, necesitaremos una Web UI.

La interfaz inicial puede ser muy sencilla:

┌────────────────────────────────────┐
│          AI Video Agent            │
├────────────────────────────────────┤
│ Tema del vídeo                     │
│ [Presentación de una cafetera____] │
│                                    │
│ Duración                           │
│ [60 segundos]                      │
│                                    │
│ Estilo                             │
│ [Moderno / Tecnología / Producto] │
│                                    │
│       [Crear vídeo]                │
└────────────────────────────────────┘

Después de pulsar el botón, el usuario puede acceder a una página de progreso:

Creando vídeo

✓ Analizando el guion
✓ Creando storyboard
✓ Generando plano 1
✓ Generando plano 2
● Generando plano 3
○ Generando voz
○ Generando subtítulos
○ Montando vídeo

En el lateral puede aparecer una vista previa:

┌──────────────────────────┐
│                          │
│      Vista previa        │
│                          │
│                          │
└──────────────────────────┘

Al terminar:

✓ Vídeo terminado

[Reproducir vídeo]

[Volver a generar]

[Descargar vídeo]

Paso 11: registrar todo lo que hace el Agent

La Web UI no debería limitarse a mostrar:

«Procesando...»

Es mucho más útil mostrar el estado real de ejecución.

Por ejemplo:

13:21:04  Inicio del análisis del guion
13:21:07  Se han creado 8 planos
13:21:10  Inicio de generación del plano 1
13:21:35  Plano 1 completado
13:21:36  Inicio de generación del plano 2
13:22:01  Plano 2 completado
13:22:02  Inicio de generación de voz
13:22:16  Voz completada
13:22:18  Inicio de generación de subtítulos
13:22:25  Subtítulos completados
13:22:30  Inicio del montaje del vídeo

Esto permite al usuario entender qué está haciendo realmente el Agent.

Para el desarrollador, estos registros son todavía más importantes.

Cuando algo falla, necesitas saber:

¿Qué Agent?
¿Qué Tool?
¿Qué parámetros?
¿Qué respuesta?
¿En qué paso falló?
¿Se realizó algún reintento?

Esto forma parte de la observabilidad del Agent.


Paso 12: arquitectura completa

Llegados a este punto, una arquitectura completa para el AI Video Agent podría tener este aspecto:

                    Web UI
                      │
                      ↓
                Agent API Server
                      │
                      ↓
                 Agent Runtime
                      │
             ┌────────┴────────┐
             ↓                 ↓
           Agent             State
             │                 │
      ┌──────┼──────┐          │
      ↓      ↓      ↓          │
   Story   Image   Audio        │
    Tool    Tool    Tool        │
      │      │      │           │
      └──────┼──────┘           │
             ↓                  │
         Video Tool             │
             ↓                  │
        Check Tool ─────────────┘
             │
             ↓
          Final Video

Lo importante aquí no es un framework concreto, sino la arquitectura completa:

LLM + Agent Loop + Tool + State + Workflow + Evaluation + UI


¿Qué framework de Agent deberías utilizar?

Si estás aprendiendo los fundamentos de los Agents, puedes empezar directamente con un Agent Loop sencillo, incluso sin utilizar ningún framework.

Cuando el proyecto empiece a crecer, puedes elegir el framework que mejor se adapte a tus necesidades.

LangGraph

Adecuado para:

  • workflows con múltiples pasos;

  • gestión de estado;

  • bifurcaciones condicionales;

  • ciclos;

  • tareas de larga duración;

  • Agents cuyo flujo de ejecución necesita un control preciso.

CrewAI

Adecuado para:

  • Agents con diferentes roles;

  • Agent guionista;

  • Agent de investigación;

  • Agent de revisión;

  • modelos de colaboración como Writer + Reviewer.

AutoGen

Adecuado para:

  • conversaciones entre múltiples Agents;

  • discusión entre Agents;

  • colaboración dinámica.

Otros Agent Frameworks

También son perfectamente válidos.

Siempre que el framework proporcione mecanismos para trabajar con:

Model
Tool
State
Memory
Workflow
Execution

puedes seguir una arquitectura similar.

Por eso, aprender Agent no debería convertirse en aprender únicamente un framework concreto.

Los frameworks cambiarán continuamente, pero los principios fundamentales de los Agents son mucho más estables.


Conclusión

Si reducimos todo el proyecto a una ruta de aprendizaje, el proceso puede resumirse así:

Paso 1: entender los fundamentos de Agent

Comprender:

Goal
↓
Think
↓
Tool
↓
Observe
↓
Repeat

Paso 2: construir un Agent básico

Conseguir que el modelo sea capaz de utilizar una Tool.

Paso 3: añadir herramientas

Incorporar generación de imágenes, vídeo, voz, subtítulos y otras capacidades.

Paso 4: diseñar el Workflow

Conseguir que varias Tools se ejecuten automáticamente siguiendo un proceso definido.

Paso 5: añadir State y mecanismos de evaluación

Permitir que el Agent conserve el progreso, detecte problemas y vuelva a ejecutar determinadas etapas.

Paso 6: añadir una Web UI

Permitir que el usuario introduzca una tarea, consulte el progreso y vea el vídeo final.

Al final, la arquitectura queda así:

Usuario
 ↓
Web UI
 ↓
Agent
 ↓
Workflow
 ↓
Múltiples Tools
 ↓
Comprobación / Corrección
 ↓
Vídeo final

Y esta metodología no se limita a la producción de vídeo.

Si cambiamos las Tools, podemos construir arquitecturas similares para:

  • AI Coding Agents;

  • AI Research Agents;

  • AI Writing Agents;

  • AI Data Analysis Agents;

  • AI Automation Agents;

  • AI Cybersecurity Agents;

  • AI Ecommerce Agents.

Por eso, lo realmente importante no es aprender un framework de Agent concreto, sino entender:

cómo combinar modelos, herramientas, estado y workflows para construir un sistema de software capaz de completar tareas de forma autónoma.