Sprache erstellen
Generiert Audio aus einem Text-Prompt. Kompatibel mit der OpenAI /v1/audio/speech API.
Gibt einen binären Audiostream im angeforderten response_format zurück. Verwenden Sie /v2/models/all, um verfügbare TTS-Modelle zu entdecken. Unterstützte Stimmen und Antwortformate werden pro Modell validiert — ein nicht unterstützter Wert gibt eine 400-Antwort zurück, die die akzeptierten Optionen auflistet.
Beispielaufruf
curl https://api.deutschlandgpt.de/v2/audio/speech \
-X POST \
-H "Authorization: Bearer $DGPT_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-4o-mini-tts",
"input": "Hallo, wie geht es Ihnen heute?",
"voice": "nova",
"response_format": "mp3",
"speed": 1,
"instructions": "string",
"language_code": "de",
"voice_settings": {},
"parameters": {}
}'curl https://api.deutschlandgpt.de/v2/audio/speech \
-X POST \
-H "Authorization: Bearer $DGPT_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-4o-mini-tts",
"input": "Hallo, wie geht es Ihnen heute?",
"voice": "nova",
"response_format": "mp3",
"speed": 1,
"instructions": "string",
"language_code": "de",
"voice_settings": {},
"parameters": {}
}'import os, requests
response = requests.post(
"https://api.deutschlandgpt.de/v2/audio/speech",
headers={"Authorization": f"Bearer {os.environ['DGPT_API_KEY']}"},
json={
"model": "gpt-4o-mini-tts",
"input": "Hallo, wie geht es Ihnen heute?",
"voice": "nova",
"response_format": "mp3",
"speed": 1,
"instructions": "string",
"language_code": "de",
"voice_settings": {},
"parameters": {}
},
)
print(response.json())import os, requests
response = requests.post(
"https://api.deutschlandgpt.de/v2/audio/speech",
headers={"Authorization": f"Bearer {os.environ['DGPT_API_KEY']}"},
json={
"model": "gpt-4o-mini-tts",
"input": "Hallo, wie geht es Ihnen heute?",
"voice": "nova",
"response_format": "mp3",
"speed": 1,
"instructions": "string",
"language_code": "de",
"voice_settings": {},
"parameters": {}
},
)
print(response.json())const response = await fetch('https://api.deutschlandgpt.de/v2/audio/speech', {
method: 'POST',
headers: {
Authorization: `Bearer ${process.env.DGPT_API_KEY}`,
'Content-Type': 'application/json',
},
body: JSON.stringify({
"model": "gpt-4o-mini-tts",
"input": "Hallo, wie geht es Ihnen heute?",
"voice": "nova",
"response_format": "mp3",
"speed": 1,
"instructions": "string",
"language_code": "de",
"voice_settings": {},
"parameters": {}
}),
});
console.log(await response.json());const response = await fetch('https://api.deutschlandgpt.de/v2/audio/speech', {
method: 'POST',
headers: {
Authorization: `Bearer ${process.env.DGPT_API_KEY}`,
'Content-Type': 'application/json',
},
body: JSON.stringify({
"model": "gpt-4o-mini-tts",
"input": "Hallo, wie geht es Ihnen heute?",
"voice": "nova",
"response_format": "mp3",
"speed": 1,
"instructions": "string",
"language_code": "de",
"voice_settings": {},
"parameters": {}
}),
});
console.log(await response.json());Anfrage-Body
modelstringerforderlichZu verwendendes Modell. Verwenden Sie /v2/models, um TTS-Modelle aufzulisten.
inputstringerforderlichZu synthetisierender Text. Zeichenlimit pro Modell (4096 für gpt-4o-mini-tts).
voicestringerforderlichZu verwendende Stimme. Optional — standardmäßig die Standardstimme des Modells. Für gpt-4o-mini-tts: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar. Für ElevenLabs-Modelle (eleven_multilingual_v2, eleven_flash_v2_5, eleven_v3) ist es eine beliebige voice_id aus Ihrer ElevenLabs-Stimmbibliothek.
response_formatstringoptionalAudioformat. Standardmäßig das Standardformat des Modells (mp3). ElevenLabs unterstützt mp3, opus, wav, pcm (nicht aac/flac).
speednumberoptionalSprachgeschwindigkeitsmultiplikator.
instructionsstringoptionalFreitext-Steuerung für Ton und Stil. Wird nur bei Modellen angewendet, die dies unterstützen (z. B. gpt-4o-mini-tts).
language_codestringoptionalISO 639-1-Sprachcode zur Erzwingung (nur ElevenLabs).
voice_settingsobjectoptionalFeinkörnige Stimmsteuerung (nur ElevenLabs). Wird von OpenAI/Azure-Modellen ignoriert.
stabilitynumberoptionalsimilarity_boostnumberoptionalstylenumberoptionaluse_speaker_boostbooleanoptionalparametersobjectoptionalProvider-spezifischer Passthrough (nur ElevenLabs). Unbekannte Schlüssel werden ignoriert; OpenAI/Azure-Modelle ignorieren dieses Feld vollständig.
seedintegeroptionalDeterministischer Sampling-Seed.
previous_textstringoptionalText, der dieser Anfrage voranging, für Prosodie-Kontinuität bei zusammengefügten Generierungen.
next_textstringoptionalText, der auf diese Anfrage folgt, für Prosodie-Kontinuität.
previous_request_idsstring[]optionalBis zu 3 request_ids früherer Generierungen, für Kontinuität beim Zusammenfügen.
next_request_idsstring[]optionalBis zu 3 request_ids nachfolgender Generierungen.
apply_text_normalizationstringoptionalSteuerung der Zahlen-/Datumsausschreibung. Standard: automatisch.
apply_language_text_normalizationbooleanoptionalSprachspezifische Normalisierung (z. B. Japanisch). Erhöht die Latenz.
use_pvc_as_ivcbooleanoptionalDie IVC-Version einer Stimme anstelle der PVC-Version verwenden.
optimize_streaming_latencyintegeroptionalAbwägung zwischen Latenz und Qualität (0 = beste Qualität, 4 = niedrigste Latenz).
Antwort
Binärer Audiostream.
Antwort-Header
X-Request-IDstringEindeutige Anfrage-ID (req_<id>). In Support-Tickets angeben.
Statuscodes
Binärer Audiostream.
Ungültige Anfrage — nicht unterstützte Stimme/Format, Eingabe zu lang oder Validierungsfehler.
ErrorNicht autorisiert — fehlender oder ungültiger API-Key.
Nicht genügend Guthaben.
API-Key hat keine Berechtigung für dieses Modell.
Modell nicht gefunden oder für diesen Workspace nicht konfiguriert.
Serverfehler.