Zum Inhalt springen
DeutschlandGPT

Transkription erstellen

Transkribiert Audio in Text. Kompatibel mit der OpenAI /v1/audio/transcriptions API.

Akzeptiert eine Audiodatei (max. 25 MB) als multipart/form-data und gibt das Transkript im angeforderten response_format zurück. Verfügbare Modelle umfassen den EU-gehosteten Voxtral-Standard und ElevenLabs Scribe (scribe_v2, scribe_v1) — tauschen Sie den model-String aus. Die Felder diarize, num_speakers, timestamps_granularity, tag_audio_events und temperature sind ElevenLabs-Scribe-Optionen (werden von Voxtral ignoriert). Sprecher-Segmente und Wort-Zeitstempel werden nur zurückgegeben, wenn Sie response_format=verbose_json mit einem ElevenLabs-Scribe-model anfordern: diarize=true ergänzt ein segments-Array (nach Sprecher gruppiert) und timestamps_granularity (word/character) ein words-Array. Die Formate json/text geben stets nur das reine Transkript zurück. Untertitelformate wie srt und vtt werden nicht unterstützt. Verwenden Sie /v2/models/all, um Audio-Transkriptionsmodelle zu entdecken.

POSThttps://api.deutschlandgpt.de/v2/audio/transcriptionsAusprobieren

Beispielaufruf

curl https://api.deutschlandgpt.de/v2/audio/transcriptions \
  -X POST \
  -H "Authorization: Bearer $DGPT_API_KEY"

Antwort

200application/json
{
  "text": "string"
}

Transkriptionsergebnis. Der Medientyp hängt von response_format ab.

Ebenfalls verfügbar als text/plain

Die Antwort hat eine der folgenden Formen:

Variante 1

Wird zurückgegeben, wenn response_format json ist (Standard).

textstringerforderlich

Der transkribierte Text.

Variante 2

Wird zurückgegeben, wenn response_format verbose_json ist. words und segments erscheinen nur auf dem ElevenLabs-Scribe-Pfad.

textstringerforderlich

Der transkribierte Text.

wordsobject[]optional

Wort-Zeitstempel. Nur auf dem ElevenLabs-Scribe-Pfad vorhanden, wenn timestamps_granularity word oder character ist (bei none entfällt es).

wordstringerforderlich

Das transkribierte Wort oder Geräusch.

startnumberoptional

Startzeit des Tokens in Sekunden.

endnumberoptional

Endzeit des Tokens in Sekunden.

typestringerforderlich

Token-Typ. audio_event markiert nicht-sprachliche Geräusche wie Lachen (siehe tag_audio_events).

speakerstringoptional

Kennung des Sprechers dieses Tokens. Nur vorhanden, wenn diarize=true.

segmentsobject[]optional

Transkript in aufeinanderfolgende Abschnitte pro Sprecher gruppiert. Nur auf dem ElevenLabs-Scribe-Pfad vorhanden, wenn diarize=true.

speakerstringoptional

Kennung des Sprechers dieses Abschnitts.

textstringerforderlich

Der in diesem Abschnitt gesprochene Text.

startnumberoptional

Startzeit des Abschnitts in Sekunden.

endnumberoptional

Endzeit des Abschnitts in Sekunden.

usageobjecterforderlich
audioSecondsnumbererforderlich

Dauer des Eingangsaudios in Sekunden, wie vom Provider gemeldet.

costInEuronumbererforderlich

Vom Workspace-Guthaben für diese Anfrage abgezogener Betrag in EUR.

Antwort-Header
X-Request-IDstring

Eindeutige Anfrage-ID (req_<id>). In Support-Tickets angeben.

Statuscodes

200

Transkriptionsergebnis. Der Medientyp hängt von response_format ab.

object | object
400

Ungültige Anfrage — fehlende file, Datei überschreitet 25 MB oder Provider-Fehler.

Error
401

Nicht autorisiert — fehlender oder ungültiger API-Key.

402

Nicht genügend Guthaben.

403

API-Key hat keine Berechtigung für dieses Modell.

404

Modell nicht gefunden oder für diesen Workspace nicht konfiguriert.

500

Serverfehler.

War diese Seite hilfreich?