Saltar al contenido principal

Torus Academy

Ensamblaje del agente en Vapi

Datos de esta lección
FaseF2 — Capa de telefonía y generación de voz
MóduloM2.3 — Ensamblaje del agente en Vapi / Retell
Puntos de profesionalidad al superar el test60

Objetivo práctico

Al terminar esta lección tendrás una cuenta de Vapi creada y un primer asistente (agente) configurado con modelo, transcripción y voz, probado mediante llamada de voz en el navegador (sin necesidad de un número de teléfono todavía).

Resultado que obtendrás

Un asistente de Vapi funcional, con tu Prompt Maestro cargado, que responde correctamente a una conversación de prueba por voz desde el navegador.

Dónde encaja dentro del sistema final

Vapi es, en este curso, una de las dos plataformas de orquestación de referencia (junto a Retell): la pieza que conecta STT, LLM y TTS en un único agente coherente, antes de conectarlo con un número de teléfono real (módulo 2.4).

Conocimientos previos

Herramientas necesarias

Posible coste

Según la documentación oficial de precios de Vapi verificada el 30 de agosto de 2026, la plataforma cobra 0,05 USD por minuto de orquestación, más el coste de los proveedores de modelo, voz y transcripción que elijas (pasados directamente al coste, o gratuitos si usas tus propias claves de API). Vapi ofrece crédito de prueba inicial para empezar a experimentar sin necesidad de introducir un método de pago de inmediato; comprueba la cantidad exacta vigente en tu propio panel al registrarte.

Advertencia de seguridad

Sigue el protocolo del módulo 2.1 al crear la cuenta, y revisa el módulo 2.1 sobre límites de gasto antes de realizar pruebas extensas: la documentación oficial de precios de Vapi consultada no menciona una función de límite de gasto configurable nativa.

Modelo mental

Piensa en Vapi como en la centralita completa de la oficina: no es el telefonista (el LLM) ni sus cuerdas vocales (el TTS) ni su oído (el STT) por separado, sino el mueble que los conecta a todos y gestiona la llamada de principio a fin.

Explicación

Según la documentación oficial de Vapi verificada el 30 de agosto de 2026, un asistente se crea desde el panel («Dashboard → Assistants → Create Assistant»). Por defecto, el transcriptor (STT), el modelo (LLM) y la voz (TTS) se configuran con un preajuste equilibrado («Balanced»), pero puedes elegir manualmente cada proveedor de forma independiente entre varias opciones (OpenAI, Anthropic, Google para el modelo; ElevenLabs entre otros para la voz; Deepgram y Gladia entre otros para la transcripción). El asistente incluye también un campo de prompt del sistema y un primer mensaje configurable, y una sección de «Tools» (herramientas) donde se configuran las funciones que el agente puede invocar mediante Tool Calling (ver módulo 3.4), conectadas normalmente a un Webhook externo.

Para probar el asistente sin necesidad de un número de teléfono real, la documentación oficial confirma una función de llamada web («Talk»/«Web call») que permite conversar con el agente directamente desde el navegador, usando el micrófono del equipo.

Vocabulario nuevo

Asistente (Vapi)

Piénsalo así: El telefonista completo ya montado: cerebro, oído y voz configurados juntos.

Configuración completa de un agente dentro de Vapi: modelo, voz, transcripción, prompt y herramientas asociadas.

Ejemplo: El asistente «Recepción Fontanería Ejemplo» que construirás en la Fase 6 de este curso.

Preparación

Ten a mano tu Prompt Maestro personalizado (módulo 1.3) y la clave de API de ElevenLabs con cuota de créditos restringida (módulo 2.2).

Procedimiento paso a paso

  1. Contexto: Vas a crear tu cuenta de Vapi y tu primer asistente.

    Acción de teclado: Ve a la dirección oficial vapi.ai, regístrate siguiendo el protocolo del módulo 2.1, y una vez dentro del panel, recorre encabezados con H hasta «Assistants». Localiza el botón «Create Assistant» con B o Tab.

    Respuesta esperada de NVDA: NVDA debería anunciar un texto similar a «Create Assistant, botón».

    Qué significa: Se abrirá el editor de configuración de un asistente nuevo.

    Acción siguiente: Ponle un nombre identificable, por ejemplo «Prueba Torus Academy».

  2. Contexto: Vas a cargar tu Prompt Maestro y elegir modelo, transcripción y voz.

    Acción de teclado: Localiza el campo de prompt del sistema («System Prompt») con Tab, y pega tu Prompt Maestro completo con Ctrl + V. Después, recorre los selectores de modelo, transcriptor y voz, eligiendo el proveedor de modelo que prefieras, un transcriptor en español, y tu voz de ElevenLabs guardada.

    Respuesta esperada de NVDA: NVDA anunciará cada selector y sus opciones disponibles conforme los recorras.

    Qué significa: Estás ensamblando, en una única configuración, las piezas STT, LLM y TTS trabajadas en los módulos anteriores.

    Acción siguiente: Guarda la configuración del asistente.

  3. Contexto: Quieres probar el asistente sin usar todavía un número de teléfono real.

    Acción de teclado: Busca el botón «Talk» o «Web Call» con B y actívalo con Enter. Concede permiso de micrófono si el navegador lo solicita.

    Respuesta esperada de NVDA: NVDA anunciará el inicio de la llamada de prueba; deberías escuchar el primer mensaje configurado del asistente.

    Qué significa: Esta es una llamada real por voz, gestionada íntegramente por el asistente que acabas de configurar, sin necesidad de telefonía.

    Acción siguiente: Haz al menos tres preguntas de prueba, incluida una fuera del alcance de tu Prompt Maestro, para verificar que no inventa datos.

Posibles diferencias de interfaz

Vapi actualiza su panel con cierta frecuencia. Los conceptos (asistente, modelo/voz/transcriptor, herramientas, llamada web de prueba) son estables aunque el nombre exacto de un botón cambie.

Errores frecuentes y diagnóstico

La llamada de prueba por voz no capta el micrófono.

Cómo localizarlo: Puede deberse a permisos de micrófono no concedidos al navegador, o a un micrófono no seleccionado como predeterminado en Windows.

Solución: Revisa los permisos de micrófono del navegador para el sitio de Vapi, y confirma en la configuración de sonido de Windows qué micrófono está activo.

El asistente responde con un idioma distinto al esperado.

Cómo localizarlo: El transcriptor (STT) o el modelo pueden no estar configurados explícitamente en español.

Solución: Revisa la configuración del transcriptor y añade una instrucción explícita de idioma en el Prompt Maestro si es necesario.

Comprobación final

Realiza una llamada de prueba por voz desde el navegador y confirma que el asistente responde según las reglas de tu Prompt Maestro, incluida la prohibición de inventar datos ante una pregunta fuera de alcance. Si el comportamiento es correcto, la comprobación es positiva.

Qué acabas de conseguir

Tienes un agente conversacional completo y funcional, aunque todavía no conectado a un número de teléfono real. Esa conexión se completa en el módulo 2.4.

Ejercicio práctico

Duplica el asistente y cambia únicamente el proveedor de voz por otra voz distinta de tu biblioteca de ElevenLabs, para comparar cómo cambia la experiencia de la llamada de prueba.

Resumen de lo imprescindible

No necesitas aprender todavía

Todavía no necesitas configurar herramientas (Tools) ni un número de teléfono real: se trabajan en los módulos 3.4 y 2.4 respectivamente.

Estoy preparado para continuar si puedo…

Fuentes

Última actualización de esta lección: 2026-08-30.

Test de la lección

Para realizar el test y obtener Puntos de profesionalidad necesitas iniciar sesión o crear una cuenta.

Navegación

Lección anterior: Hito: primera prueba de voz generada

Continuar con la siguiente lección: Ensamblaje del agente en Retell AI

Descargar esta lección en PDF accesible