Transkription erstellen
Transkribiert Audio in Text. Kompatibel mit der OpenAI /v1/audio/transcriptions API.
Akzeptiert eine Audiodatei (max. 25 MB) als multipart/form-data und gibt das Transkript im angeforderten response_format zurück. Verfügbare Modelle umfassen den EU-gehosteten Voxtral-Standard und ElevenLabs Scribe (scribe_v2, scribe_v1) — tauschen Sie den model-String aus. Die Felder diarize, num_speakers, timestamps_granularity, tag_audio_events und temperature sind ElevenLabs-Scribe-Optionen (werden von Voxtral ignoriert). Sprecher-Segmente und Wort-Zeitstempel werden nur zurückgegeben, wenn Sie response_format=verbose_json mit einem ElevenLabs-Scribe-model anfordern: diarize=true ergänzt ein segments-Array (nach Sprecher gruppiert) und timestamps_granularity (word/character) ein words-Array. Die Formate json/text geben stets nur das reine Transkript zurück. Untertitelformate wie srt und vtt werden nicht unterstützt. Verwenden Sie /v2/models/all, um Audio-Transkriptionsmodelle zu entdecken.
Beispielaufruf
curl https://api.deutschlandgpt.de/v2/audio/transcriptions \
-X POST \
-H "Authorization: Bearer $DGPT_API_KEY"curl https://api.deutschlandgpt.de/v2/audio/transcriptions \
-X POST \
-H "Authorization: Bearer $DGPT_API_KEY"import os, requests
response = requests.post(
"https://api.deutschlandgpt.de/v2/audio/transcriptions",
headers={"Authorization": f"Bearer {os.environ['DGPT_API_KEY']}"},
)
print(response.json())import os, requests
response = requests.post(
"https://api.deutschlandgpt.de/v2/audio/transcriptions",
headers={"Authorization": f"Bearer {os.environ['DGPT_API_KEY']}"},
)
print(response.json())const response = await fetch('https://api.deutschlandgpt.de/v2/audio/transcriptions', {
method: 'POST',
headers: {
Authorization: `Bearer ${process.env.DGPT_API_KEY}`,
},
});
console.log(await response.json());const response = await fetch('https://api.deutschlandgpt.de/v2/audio/transcriptions', {
method: 'POST',
headers: {
Authorization: `Bearer ${process.env.DGPT_API_KEY}`,
},
});
console.log(await response.json());Antwort
{
"text": "string"
}{
"text": "string"
}Transkriptionsergebnis. Der Medientyp hängt von response_format ab.
Ebenfalls verfügbar als text/plain
Die Antwort hat eine der folgenden Formen:
Variante 1
Wird zurückgegeben, wenn response_format json ist (Standard).
textstringerforderlichDer transkribierte Text.
Variante 2
Wird zurückgegeben, wenn response_format verbose_json ist. words und segments erscheinen nur auf dem ElevenLabs-Scribe-Pfad.
textstringerforderlichDer transkribierte Text.
wordsobject[]optionalWort-Zeitstempel. Nur auf dem ElevenLabs-Scribe-Pfad vorhanden, wenn timestamps_granularity word oder character ist (bei none entfällt es).
wordstringerforderlichDas transkribierte Wort oder Geräusch.
startnumberoptionalStartzeit des Tokens in Sekunden.
endnumberoptionalEndzeit des Tokens in Sekunden.
typestringerforderlichToken-Typ. audio_event markiert nicht-sprachliche Geräusche wie Lachen (siehe tag_audio_events).
speakerstringoptionalKennung des Sprechers dieses Tokens. Nur vorhanden, wenn diarize=true.
segmentsobject[]optionalTranskript in aufeinanderfolgende Abschnitte pro Sprecher gruppiert. Nur auf dem ElevenLabs-Scribe-Pfad vorhanden, wenn diarize=true.
speakerstringoptionalKennung des Sprechers dieses Abschnitts.
textstringerforderlichDer in diesem Abschnitt gesprochene Text.
startnumberoptionalStartzeit des Abschnitts in Sekunden.
endnumberoptionalEndzeit des Abschnitts in Sekunden.
usageobjecterforderlichaudioSecondsnumbererforderlichDauer des Eingangsaudios in Sekunden, wie vom Provider gemeldet.
costInEuronumbererforderlichVom Workspace-Guthaben für diese Anfrage abgezogener Betrag in EUR.
Antwort-Header
X-Request-IDstringEindeutige Anfrage-ID (req_<id>). In Support-Tickets angeben.
Statuscodes
Transkriptionsergebnis. Der Medientyp hängt von response_format ab.
Ungültige Anfrage — fehlende file, Datei überschreitet 25 MB oder Provider-Fehler.
Nicht autorisiert — fehlender oder ungültiger API-Key.
Nicht genügend Guthaben.
API-Key hat keine Berechtigung für dieses Modell.
Modell nicht gefunden oder für diesen Workspace nicht konfiguriert.
Serverfehler.