ElevenAPI para desarrolladores
Crea audio con IA listo para producción en minutos
APIs en las que confían equipos que trabajan a gran escala, incluyendo Texto a Voz, Voz a Texto, Voice Agents y Música.
API de Texto a Voz
Transcripción
Música
Efectos de Sonido
Motor de Voz
En la antigua tierra de Eldoria, donde los cielos brillaban y los bosques susurraban secretos al viento, vivía un dragón llamado Zephyros. [sarcastically] No del tipo que “lo quema todo... [giggles] sino que era amable, sabio, con ojos como estrellas antiguas. [whispers] Incluso los pájaros guardaban silencio cuando él pasaba.
- Lovable
- Synthesia
- Stripe
- Perplexity
- Twilio
Crea con toda la suite de APIs de ElevenLabs
Crea cualquier proyecto de audio con los SDKs nativos de ElevenLabs para TypeScript y Python, o con nuestra REST API. Empieza con demos detalladas, ejemplos y documentación.
Genera voz
Convierte texto en voz con el modelo más expresivo del mundo.

Transcribe voz
Voz a Texto en tiempo real o por lotes para cualquier plataforma.

Crea música
Genera stems, letras y composiciones completas con total flexibilidad.

Crea efectos de sonido
Efectos de sonido profesionales, de cualquier duración y con bucles perfectos.

Crea voces
Clona una voz, crea una con un prompt o usa una de nuestras 10.000 voces.

Lanza agentes
Plataforma de agentes totalmente gestionada, con SDKs nativos para móvil y web.

Impulsamos a las principales empresas y marcas del mundo
“Desde doblar Reels a idiomas locales hasta generar música y voces de personajes en Horizon, la plataforma de ElevenLabs permite a creadores, empresas y organizaciones crear con voz, música y sonido a gran escala.”
“Millones de personas aprenden ajedrez cada día con creadores como Hikaru, Levy y Magnus en YouTube y Twitch. Ahora puedes aprender con ellos dentro de Chess.com de una forma inmersiva, personal y llena de carácter. Nuestra misión es crear un entrenador de ajedrez que enseñe al nivel adecuado, dé la bienvenida a jugadores de todos los niveles y desmitifique el ajedrez manteniéndolo divertido y con personalidad. Con ElevenLabs y estas nuevas voces increíbles, hemos dado un gran paso para hacer realidad esa visión.”
“Elegimos ElevenLabs para transcribir voz porque sus modelos son muy precisos.”
“Twilio ha integrado la tecnología de voz generativa con IA de ElevenLabs en su CPaaS, mejorando ConversationRelay. Esta integración permite a empresas y desarrolladores crear interacciones de voz con IA conversacional que suenan humanas, son expresivas y responden en tiempo real directamente desde la plataforma CPaaS de Twilio. En ElevenLabs nos alegra que Twilio haya elegido nuestra tecnología para potenciar ConversationRelay con las voces más expresivas y naturales.”
Precios de la API
1
Modelo de pago
Suscripción
Pago por uso
2
Productos
100k caracteres
015M+

10 $
Coste estimado
- Sin compromiso, sin mínimo
- Recarga créditos cuando lo necesites
APIs listas para producción

Preguntas frecuentes
La API de ElevenLabs proporciona acceso programático a nuestros modelos de IA para voz, música, efectos de sonido, doblaje y transcripción. Puedes integrar estas capacidades directamente en tus aplicaciones, flujos de trabajo y líneas de producción.
Texto a Voz - Genera voz a partir de texto
Speech to Text - Transcribe y diariza audio
Voice Library - Accede y clona voces
Doblaje - Traduce y localiza audio en más de 70 idiomas
Sound Effects - Genera audio personalizado
Música - Crea pistas instrumentales y líricas
Voice Isolation - Elimina el ruido de fondo
Casos de uso comunes incluyen la localización de contenido, producción de video automatizada, interfaces conversacionales, herramientas de accesibilidad y generación de contenido para formación. La API está diseñada para procesamiento en tiempo real y por lotes.
Todas las solicitudes a la API requieren una clave API pasada en el encabezado xi-api-key. Las claves se generan en la configuración de tu cuenta y pueden estar limitadas a espacios de trabajo específicos.
Los límites de uso varían según el plan y la ruta de API. El uso PAYG está habilitado desde nuestro plan Starter en adelante.
Sí. Hay SDKs oficiales disponibles para Python y JavaScript/TypeScript, y plataformas adicionales como Flutter, Swift y Kotlin para nuestra plataforma de Agentes.
Texto a Voz se factura por carácter. Speech to Text se factura por minuto de audio. Música y Sound Effects se facturan por generación. Doblaje se factura por minuto de audio fuente.
Sí. Puedes referenciar cualquier voz en tu biblioteca por ID, incluidas voces profesionales, voces clonadas y voces que hayas diseñado.
Sí. El contenido generado a través de la API usando modelos de ElevenLabs tiene licencia comercial. La música requiere una licencia adicional para publicidad, cine, TV, juegos y distribución empresarial.
Texto a Voz responde típicamente en menos de 500ms para streaming. Speech to Text procesa a 20-50x en tiempo real dependiendo del tamaño del archivo. Doblaje y Música son operaciones por lotes con tiempos de procesamiento proporcionales a la longitud del contenido.
Sí. Texto a Voz y Speech to Text soportan salida en streaming, permitiéndote usar las APIs en aplicaciones en tiempo real.
La API devuelve códigos de estado HTTP estándar. Los errores de límite de tasa devuelven 429. Las solicitudes inválidas devuelven 400 con detalles del error. Las fallas de autenticación devuelven 401.
La referencia completa de la API, ejemplos de código y guías de integración están disponibles en elevenlabs.io/docs/api-reference
Sí. Los planes empresariales incluyen soporte dedicado, SLAs, límites de tasa personalizados, SSO, cumplimiento SOC 2 y MSAs.
