텍스트 음성 변환 API
음성 인식
음악
음향 효과
음성 엔진
고대의 땅 엘도리아에서, 하늘은 반짝이고 숲은 바람에게 비밀을 속삭이던 곳에 제피로스라는 용이 살고 있었습니다. [sarcastically] ‘모두 불태워 버리는’ 그런 종류는 아니었죠... [giggles] 하지만 그는 부드럽고 현명했으며, 눈은 오래된 별처럼 빛났습니다. [whispers] 그가 지나갈 때면 새들도 조용해졌습니다.
- Lovable
- Synthesia
- Stripe
- Perplexity
- Twilio
세계 최고의 기업과 브랜드가 선택한 기술
“릴(Reels) 더빙부터 Horizon에서 음악과 캐릭터 보이스 생성까지, ElevenLabs 플랫폼은 전 세계 크리에이터, 기업, 엔터프라이즈가 보이스, 음악, 사운드로 다양한 프로젝트를 만들 수 있도록 지원합니다.”
“매일 수백만 명이 YouTube와 Twitch에서 Hikaru, Levy, Magnus 같은 크리에이터에게 체스를 배웁니다. 이제 Chess.com 안에서 이들의 목소리로 몰입감 있고, 개인적이며, 개성 넘치는 방식으로 배울 수 있습니다. 우리의 목표는 모든 실력의 플레이어를 환영하고, 체스를 쉽게 이해할 수 있도록 하면서도 재미와 개성을 잃지 않는 체스 코치를 만드는 것입니다. ElevenLabs와 새로운 보이스 덕분에 그 비전을 현실로 한 걸음 더 가까이 다가갔습니다.”
“ElevenLabs의 모델이 매우 정확해서 음성 전사에 가장 적합한 선택이었습니다.”
“Twilio는 ElevenLabs의 생성형 AI 음성 기술을 CPaaS에 통합해 ConversationRelay를 강화했습니다. 이 통합으로 기업과 개발자는 Twilio CPaaS 플랫폼에서 바로 사람처럼 자연스럽고, 표현력 있으며, 실시간으로 반응하는 대화형 AI 음성 상호작용을 만들 수 있습니다. ElevenLabs는 Twilio가 가장 표현력 있고 사람 같은 목소리로 ConversationRelay를 강화하기 위해 ElevenLabs를 선택한 것을 기쁘게 생각합니다.”
API 요금제
1
결제 방식
구독
종량제
2
제품
100k 자
015M+

실제 서비스에 최적화된 API

자주 묻는 질문
ElevenLabs API는 음성, 음악, 음향 효과, 더빙, 트랜스크립션 등 AI 모델에 프로그래밍 방식으로 접근할 수 있게 해줍니다. 이 기능들을 앱, 워크플로우, 프로덕션 파이프라인에 직접 통합할 수 있습니다.
텍스트 음성 변환(TTS): 텍스트를 자연스러운 오디오로 변환하며, 미묘한 억양, 속도, 감정까지 표현합니다.
음성 텍스트 변환(트랜스크립션): 최첨단 정확도로 음성 오디오를 텍스트로 변환합니다.
음악: 텍스트로 음악을 생성합니다.
스튜디오: ElevenLabs Studio 프로젝트를 API로 관리합니다.
텍스트 대화 생성: 텍스트로 자연스러운 대화를 만듭니다.
보이스 체인저: 한 목소리를 다른 목소리로 바꿉니다.
보이스 아이솔레이터(오디오 분리): 오디오에서 배경 소음을 제거하고 목소리만 분리합니다.
더빙: 오디오와 비디오를 다른 언어로 자연스럽게 더빙(번역 및 보이스오버)합니다.
음향 효과: 텍스트 설명만으로 영화 같은 음향 효과를 만듭니다.
보이스 디자인: 라이브러리에 없는 목소기가 필요할 때 텍스트 프롬프트로 AI 보이스를 만듭니다.
보이스 리믹싱: 기존 목소리의 특성이나 스타일을 변형·강화합니다.
포스드 얼라인먼트: 텍스트와 오디오를 정밀하게 맞춰 단어별 타임스탬프를 얻습니다.
발음 사전: 특정 단어나 구의 발음을 TTS 모델에 맞게 커스터마이즈(렉시콘 파일 업로드)할 수 있습니다.
오디오 네이티브: ElevenLabs TTS 서비스로 웹페이지 콘텐츠를 자동으로 음성화하는 임베디드 오디오 플레이어입니다.
에이전트 플랫폼(보이스 에이전트): 대화형 앱을 위한 지능형 보이스 에이전트를 배포할 수 있습니다. 이 엔드포인트로 AI 기반 보이스 에이전트(대화, 지식베이스, 전화 통합 등)를 구축, 런칭, 관리할 수 있습니다.
주요 활용 예시는 콘텐츠 현지화 파이프라인, 자동 영상 제작, 대화형 인터페이스, 접근성 도구, 교육 콘텐츠 생성 등입니다. API는 실시간 및 일괄 처리 모두에 적합하게 설계되었습니다.
모든 API 요청에는 xi-api-key 헤더에 API 키가 필요합니다. 키는 계정 설정에서 생성하며, 특정 워크스페이스에 한정할 수 있습니다.
사용량 제한은 요금제와 엔드포인트에 따라 다릅니다. PAYG(사용량 기반 결제)는 스타터 요금제 이상에서 이용할 수 있습니다.
네, 공식 SDK가 Python, JavaScript/TypeScript용으로 제공되며, 에이전트 플랫폼용으로 Flutter, Swift, Kotlin 등 추가 플랫폼도 지원합니다.
텍스트 음성 변환은 글자 수 기준으로, 음성 텍스트 변환은 오디오 분당 과금됩니다. 음악과 음향 효과는 생성 건당, 더빙은 원본 오디오 분당 과금됩니다.
네, 라이브러리의 모든 보이스(프로페셔널, 복제, 직접 디자인한 보이스 포함)를 ID로 참조할 수 있습니다.
네, ElevenLabs 모델로 API에서 생성한 콘텐츠는 상업적 라이선스가 적용됩니다. 음악은 광고, 영화, TV, 게임, 엔터프라이즈 배포 시 별도 라이선스가 필요합니다.
텍스트 음성 변환은 스트리밍 기준 500ms 이내로 응답합니다. 음성 텍스트 변환은 파일 크기에 따라 실시간 대비 20~50배 속도로 처리됩니다. 더빙과 음악은 콘텐츠 길이에 비례해 일괄 처리됩니다.
네, 텍스트 음성 변환과 음성 텍스트 변환 모두 스트리밍 출력을 지원해 실시간 앱에서도 API를 사용할 수 있습니다.
API는 표준 HTTP 상태 코드를 반환합니다. 속도 제한 오류는 429, 잘못된 요청은 400(에러 상세 포함), 인증 실패는 401을 반환합니다.
전체 API 레퍼런스, 코드 예시, 통합 가이드는 elevenlabs.io/docs/api-reference에서 확인할 수 있습니다.
네, 엔터프라이즈 요금제에는 전담 지원, SLA, 맞춤 속도 제한, SSO, SOC2 준수, MSA가 포함됩니다.






