ElevenAPI dla deweloperów
Stwórz gotowe do wdrożenia AI audio w kilka minut
API, którym ufają zespoły działające na dużą skalę: Text to Speech, Speech to Text, Voice Agents i Music.
Text to Speech API
Transkrypcja
Muzyka
Sound Effects
Speech Engine
W starożytnej krainie Eldoria, gdzie niebo migotało, a lasy szeptały tajemnice wiatrowi, żył smok o imieniu Zephyros. [sarcastically] Nie taki, co wszystko podpala... [giggles] ale był łagodny, mądry, z oczami jak stare gwiazdy. [whispers] Nawet ptaki milczały, gdy przechodził.
- Lovable
- Synthesia
- Stripe
- Perplexity
- Twilio
Buduj z pełnym zestawem API ElevenLabs
Twórz dowolne projekty audio z natywnymi SDK ElevenLabs dla TypeScript i Pythona lub przez nasze REST API. Zacznij od szczegółowych demo, przykładów i dokumentacji.
Generuj mowę
Zamieniaj tekst na mowę z najbardziej ekspresyjnym modelem głosu na świecie.

Transkrybuj mowę
Transkrypcja mowy na tekst w czasie rzeczywistym lub wsadowo na dowolnej platformie.

Komponuj muzykę
Generuj ścieżki, teksty i całe utwory z pełną swobodą.

Twórz efekty dźwiękowe
Płynne loopowanie, dowolna długość, profesjonalne efekty dźwiękowe.

Twórz głosy
Klonuj czyjś głos, generuj nowy na podstawie promptu lub wybierz jeden z naszych 10 000 gotowych głosów.

Wdrażaj agentów
W pełni zarządzana platforma agentów z natywnymi SDK na web i mobile.

Zasilamy największe firmy i marki na świecie
“Od dubbingu Reels w lokalnych językach po generowanie muzyki i głosów postaci w Horizon — platforma ElevenLabs pozwala twórcom, firmom i organizacjom na całym świecie działać z głosem, muzyką i dźwiękiem na dużą skalę.”
“Miliony osób uczą się szachów od twórców takich jak Hikaru, Levy i Magnus na YouTube i Twitchu. Teraz możesz uczyć się od nich także na Chess.com — w sposób wciągający, osobisty i pełen charakteru. Naszym celem jest stworzenie trenera szachowego, który uczy na odpowiednim poziomie, zaprasza graczy o różnych umiejętnościach i upraszcza szachy, zachowując przy tym zabawę i osobowość. Dzięki ElevenLabs i tym nowym głosom zrobiliśmy duży krok, by to urzeczywistnić.”
“Wybraliśmy ElevenLabs do transkrypcji głosu, bo ich modele są bardzo precyzyjne”
“Twilio zintegrowało technologię generowania głosu AI od ElevenLabs ze swoim CPaaS, ulepszając ConversationRelay. Dzięki temu firmy i deweloperzy mogą tworzyć rozmowy głosowe AI, które brzmią naturalnie, są ekspresyjne i reagują w czasie rzeczywistym bezpośrednio z platformy Twilio CPaaS. Cieszymy się, że Twilio wybrało ElevenLabs, by ConversationRelay miało najbardziej ekspresyjne, ludzkie głosy.”
Cennik API
1
Model płatności
Subskrypcja
Płać za zużycie
2
Produkty
100k znaki
015M+

API gotowe do wdrożenia

Najczęściej zadawane pytania
API ElevenLabs zapewnia programowy dostęp do naszych modeli AI dla głosu, muzyki, efektów dźwiękowych, dubbingu i transkrypcji. Możesz zintegrować te możliwości bezpośrednio w swoich aplikacjach, przepływach pracy i liniach produkcyjnych.
Text to Speech - Generuj głos z tekstu
Speech to Text - Transkrybuj i diarizuj audio
Voice Library - Dostęp i klonowanie głosów
Dubbing - Tłumaczenie i lokalizacja audio w ponad 70 językach
Sound Effects - Generowanie niestandardowego audio
Music - Tworzenie utworów instrumentalnych i lirycznych
Voice Isolation - Usuwanie szumów tła
Typowe zastosowania obejmują lokalizację treści, automatyczną produkcję wideo, interfejsy konwersacyjne, narzędzia dostępności i generowanie treści szkoleniowych. API jest zaprojektowane zarówno do przetwarzania w czasie rzeczywistym, jak i batch.
Wszystkie żądania API wymagają klucza API przekazywanego w nagłówku xi-api-key. Klucze są generowane w ustawieniach konta i mogą być przypisane do konkretnych przestrzeni roboczych.
Limity użytkowania różnią się w zależności od planu i punktu końcowego. Użytkowanie PAYG jest dostępne od naszego planu Starter i wyżej.
Tak. Oficjalne SDK są dostępne dla Python i JavaScript/TypeScript oraz dodatkowe platformy jak Flutter, Swift i Kotlin dla naszej platformy Agents.
Text to Speech jest rozliczane za znak. Speech to Text jest rozliczane za minutę audio. Muzyka i efekty dźwiękowe są rozliczane za generację. Dubbing jest rozliczany za minutę źródłowego audio.
Tak. Możesz odwołać się do dowolnego głosu w swojej bibliotece za pomocą ID, w tym głosów profesjonalnych, sklonowanych i zaprojektowanych przez ciebie.
Tak. Treści generowane przez API z użyciem modeli ElevenLabs są licencjonowane komercyjnie. Muzyka wymaga dodatkowej licencji na reklamy, filmy, TV, gry i dystrybucję korporacyjną.
Text to Speech zazwyczaj odpowiada w mniej niż 500ms dla streamingu. Speech to Text przetwarza w tempie 20-50x czasu rzeczywistego w zależności od rozmiaru pliku. Dubbing i Muzyka to operacje batch z czasem przetwarzania proporcjonalnym do długości treści.
Tak. Text to Speech i Speech to Text obsługują streaming output, co pozwala na użycie API w aplikacjach w czasie rzeczywistym.
API zwraca standardowe kody statusu HTTP. Błędy limitu zwracają 429. Nieprawidłowe żądania zwracają 400 z szczegółami błędu. Błędy uwierzytelniania zwracają 401.
Kompletna dokumentacja API, przykłady kodu i przewodniki integracyjne są dostępne na elevenlabs.io/docs/api-reference
Tak. Plany dla przedsiębiorstw obejmują dedykowane wsparcie, SLA, niestandardowe limity, SSO, zgodność z SOC 2 i MSA.
