Zum Inhalt springen
DeutschlandGPT

Sprache erstellen

Generiert Audio aus einem Text-Prompt. Kompatibel mit der OpenAI /v1/audio/speech API.

Gibt einen binären Audiostream im angeforderten response_format zurück. Verwenden Sie /v2/models/all, um verfügbare TTS-Modelle zu entdecken. Unterstützte Stimmen und Antwortformate werden pro Modell validiert — ein nicht unterstützter Wert gibt eine 400-Antwort zurück, die die akzeptierten Optionen auflistet.

POSThttps://api.deutschlandgpt.de/v2/audio/speechAusprobieren

Beispielaufruf

curl https://api.deutschlandgpt.de/v2/audio/speech \
  -X POST \
  -H "Authorization: Bearer $DGPT_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
  "model": "gpt-4o-mini-tts",
  "input": "Hallo, wie geht es Ihnen heute?",
  "voice": "nova",
  "response_format": "mp3",
  "speed": 1,
  "instructions": "string",
  "language_code": "de",
  "voice_settings": {},
  "parameters": {}
}'

Anfrage-Body

modelstringerforderlich

Zu verwendendes Modell. Verwenden Sie /v2/models, um TTS-Modelle aufzulisten.

inputstringerforderlich

Zu synthetisierender Text. Zeichenlimit pro Modell (4096 für gpt-4o-mini-tts).

voicestringerforderlich

Zu verwendende Stimme. Optional — standardmäßig die Standardstimme des Modells. Für gpt-4o-mini-tts: alloy, ash, ballad, coral, echo, fable, nova, onyx, sage, shimmer, verse, marin, cedar. Für ElevenLabs-Modelle (eleven_multilingual_v2, eleven_flash_v2_5, eleven_v3) ist es eine beliebige voice_id aus Ihrer ElevenLabs-Stimmbibliothek.

response_formatstringoptional

Audioformat. Standardmäßig das Standardformat des Modells (mp3). ElevenLabs unterstützt mp3, opus, wav, pcm (nicht aac/flac).

speednumberoptional

Sprachgeschwindigkeitsmultiplikator.

instructionsstringoptional

Freitext-Steuerung für Ton und Stil. Wird nur bei Modellen angewendet, die dies unterstützen (z. B. gpt-4o-mini-tts).

language_codestringoptional

ISO 639-1-Sprachcode zur Erzwingung (nur ElevenLabs).

voice_settingsobjectoptional

Feinkörnige Stimmsteuerung (nur ElevenLabs). Wird von OpenAI/Azure-Modellen ignoriert.

stabilitynumberoptional
similarity_boostnumberoptional
stylenumberoptional
use_speaker_boostbooleanoptional
parametersobjectoptional

Provider-spezifischer Passthrough (nur ElevenLabs). Unbekannte Schlüssel werden ignoriert; OpenAI/Azure-Modelle ignorieren dieses Feld vollständig.

seedintegeroptional

Deterministischer Sampling-Seed.

previous_textstringoptional

Text, der dieser Anfrage voranging, für Prosodie-Kontinuität bei zusammengefügten Generierungen.

next_textstringoptional

Text, der auf diese Anfrage folgt, für Prosodie-Kontinuität.

previous_request_idsstring[]optional

Bis zu 3 request_ids früherer Generierungen, für Kontinuität beim Zusammenfügen.

next_request_idsstring[]optional

Bis zu 3 request_ids nachfolgender Generierungen.

apply_text_normalizationstringoptional

Steuerung der Zahlen-/Datumsausschreibung. Standard: automatisch.

apply_language_text_normalizationbooleanoptional

Sprachspezifische Normalisierung (z. B. Japanisch). Erhöht die Latenz.

use_pvc_as_ivcbooleanoptional

Die IVC-Version einer Stimme anstelle der PVC-Version verwenden.

optimize_streaming_latencyintegeroptional

Abwägung zwischen Latenz und Qualität (0 = beste Qualität, 4 = niedrigste Latenz).

Antwort

200audio/mpeg, audio/opus, audio/aac, audio/flac, audio/wav, audio/pcm

Binärer Audiostream.

Antwort-Header
X-Request-IDstring

Eindeutige Anfrage-ID (req_<id>). In Support-Tickets angeben.

Statuscodes

200

Binärer Audiostream.

400

Ungültige Anfrage — nicht unterstützte Stimme/Format, Eingabe zu lang oder Validierungsfehler.

Error
401

Nicht autorisiert — fehlender oder ungültiger API-Key.

402

Nicht genügend Guthaben.

403

API-Key hat keine Berechtigung für dieses Modell.

404

Modell nicht gefunden oder für diesen Workspace nicht konfiguriert.

500

Serverfehler.

War diese Seite hilfreich?