Transkriptions-API | speech to text API

Transkription und KI-Analyse — in einem API-Request

Ein POST mit der Datei — die Antwort liefert Text nach Sprechern und einen KI-Bericht nach deiner Vorlage.

POST /transcriptions?reports=summary
curl -X POST "https://app.specala.ai/api/v1/developer/transcriptions?reports=summary" \-H "Authorization: Bearer sk_live_…" \-H 'Content-Disposition: attachment; filename="call-48213.mp3"' \-H "X-External-Id: deal-48213" \--data-binary @call-48213.mp3
Responsecompleted1 Min. 34 Sek.
{"status": "completed","language": "de","duration_seconds": 1384.2,"segments": [{ "start": 0.0, "speaker_name": "Sprecher 1","text": "Hallo Jennifer, hier ist Marcus von Crumbwell." },{ "start": 6.9, "speaker_name": "Sprecher 2","text": "Hallo. Wir brauchen eine Probelieferung für unser Café." },{ "start": 13.1, "speaker_name": "Sprecher 1","text": "Die Muster schicken wir am Donnerstag, die Preisliste heute." }],"prompt_results": [{ "slug": "summary", "status": "completed","text": "Café, Probelieferung: Muster am Donnerstag, Preisliste heute." }]}

Anrufbericht

Zusammenfassung

  • Der Kunde ist ein Café und braucht eine Probelieferung.
  • Vereinbart: Muster am Donnerstag, Preisliste heute.

Aufgaben

  • Zwei Kartons Muster schicken
  • Preisliste schicken
  • Am Montag anrufen
2 GB
Datei in einem Request
10 Std.
pro Aufnahme
99
Sprachen, automatisch erkannt
~4 Min.
pro Stunde Audio
73
Audio- und Videoformate

CRM und Telefonie

Call transcription API: von der Telefonanlage bis zur Deal-Karte

Schick mit der Aufnahme die Deal-Nummer, eigene Felder und die ID des Vertriebsmitarbeiters aus deinem CRM oder deiner Telefonanlage mit — die Analyse kommt damit verknüpft zurück.

  1. 01 | Deine Telefonanlage oder dein CRM

    Der Anruf ist vorbei, die Aufnahme liegt bereit

    call-48213.mp323:04 | 21.4 MB
  2. 02 | Request

    Die Datei reist mit Deal-Nummer und Mitarbeiter

    POST /transcriptions?reports=call-checklistX-External-Id: deal-48213X-Author: external:hubspot:1729
  3. 03 | Response

    Text nach Sprechern

    "status": "completed","external_id": "deal-48213","segments": [ … ]
  4. 04 | Response

    Ein Bericht nach deiner Checkliste

    "slug": "call-checklist","text": "Bedarf geklärt: ja\nPreis genannt: nein"
  5. 05 | Dein Code

    Die Analyse landet in der Deal-Karte

    GET /transcriptions?external_id=deal-48213# alle Anrufe zum Deal in einem Request

Passt zu dem CRM und der Telefonanlage, die du schon hast

  • HubSpot
  • Salesforce
  • Pipedrive
  • Twilio
  • Aircall
  • RingCentral
  • Jedes System mit API

CRM-Anbindung

Jeder Anruf kennt seinen Deal und seinen Mitarbeiter

Drei Header im selben Request, und die Aufnahme ist ab der ersten Sekunde mit deinem CRM verknüpft: Du findest sie über die Deal-Nummer, filterst sie nach eigenen Feldern, und sie landet beim richtigen Vertriebsmitarbeiter.

Request
curl -X POST "https://app.specala.ai/api/v1/developer/transcriptions?reports=call-checklist" \-H "Authorization: Bearer sk_live_…" \-H 'Content-Disposition: attachment; filename="call-48213.mp3"' \-H "X-External-Id: deal-48213" \-H 'X-Metadata: {"pipeline":"b2b","source":"aircall"}' \-H "X-Author: external:hubspot:1729" \--data-binary @call-48213.mp3
Response
{"status": "completed","external_id": "deal-48213","metadata": { "pipeline": "b2b", "source": "aircall" },"author": { "id": "9c2d4e6f-…", "name": "Marcus" }}

Die App

Kein Admin-Panel, das du bauen musst

Alles, was über die API hochgeladen wird, erscheint in Specala AI: Führungskräfte lesen die Analysen, durchsuchen alle Anrufe und fragen den KI-Assistenten — im Browser und in der Desktop-App.

Eigene KI-Berichte

Dein Prompt, dein Bericht zu jedem Gespräch

Schreib einen Prompt in der App, und der Bericht bekommt eine Kennung. Übergib sie im Parameter reports, und mit dem Transkript kommt ein Bericht nach deinen Regeln zurück: Anruf-Checkliste, Einwandanalyse, Karte fürs CRM.

Einstellungen → KI-Berichte

Name
Anruf-Checkliste
Kennung
call-checklist
Prompt
Du bist Vertriebsleiter. Prüfe den Anruf anhand der Checkliste: Hat sich der Mitarbeiter vorgestellt, den Bedarf ermittelt, den Preis genannt und einen nächsten Schritt vereinbart? Antworte zu jedem Punkt mit Ja oder Nein und nenne ein Zitat.
Request
curl -X POST "https://app.specala.ai/api/v1/developer/transcriptions?reports=call-checklist" \-H "Authorization: Bearer sk_live_…" \-H 'Content-Disposition: attachment; filename="call-48213.mp3"' \--data-binary @call-48213.mp3
Response201 Createdqueuedprocessingcompleted
{"status": "completed","prompt_results": [{ "slug": "call-checklist", "name": "Anruf-Checkliste","text": "Vorgestellt: ja, „Hier ist Marcus von Crumbwell“\nBedarf ermittelt: ja, „Wir brauchen eine Probelieferung“\nPreis genannt: nein\nNächster Schritt: ja, „Wir sprechen am Montag“" }]}

KI-Berichte

KI-Analyse ist ein Request-Parameter

Häng ?reports= an, und das Transkript kommt mit Zusammenfassung und Aufgaben zurück — ohne separaten Aufruf eines Sprachmodells.

Request
curl -X POST "https://app.specala.ai/api/v1/developer/transcriptions?reports=summary" \-H "Authorization: Bearer sk_live_…" \-H 'Content-Disposition: attachment; filename="call-48213.mp3"' \--data-binary @call-48213.mp3
Response
{"status": "completed","prompt_results": [{ "slug": "summary", "name": "Zusammenfassung","text": "Der Kunde ist ein Café und braucht eine Probelieferung. Muster am Donnerstag, Preisliste heute." }]}
Sicherheit

Die Aufnahmen deiner Kunden bleiben unter deiner Kontrolle

  • Schlüssel dürfen standardmäßig nur lesen

    Rechte für Upload, Löschen und Berichte werden beim Erstellen des Schlüssels vergeben und ändern sich danach nie.

  • Transkripte sind verschlüsselt

    Ein eigener Schlüssel für jeden Workspace.

  • Die Originalaufnahme wird nicht aufbewahrt

    Die Datei wird bei der Verarbeitung gelöscht — es bleibt nur der Text.

  • Löschen hinterlässt keine Spuren

    Ein Request löscht Transkript und Berichte von unseren Servern — für alle Mitglieder.

KI-Agenten

Dein Agent bindet die API selbst an

Eine OpenAPI-Spezifikation, die Dokumentation als eine einzige Datei für ein Modell und ein MCP-Server: Claude Code, Cursor und ChatGPT arbeiten direkt mit deinen Aufnahmen.

MCP-ServerClaude Code, Cursor, ChatGPT

terminal
claude mcp add --transport http specala-ai https://mcp.specala.ai/mcp

OpenAPI 3.1für Client-Generatoren und Agenten

terminal
curl https://specala.ai/openapi.json

Dokumentation als eine Dateiin einem Rutsch ans Modell geben

terminal
curl https://specala.ai/docs/llms-full.txt

Der Unterschied zur Whisper API

Verglichen anhand der öffentlichen Dokumentation — inklusive der Zeile, in der wir nicht besser sind.

KriteriumSpecala AIWhisper API (OpenAI)
Was zurückkommtText nach Sprechern und ein KI-BerichtText
KI-Bericht im selben Requestja, auch nach deiner eigenen Vorlagenein, ein separater Modellaufruf
Dateigrößebis 2 GB und 10 Stundenbis 25 MB
Sprecherstandardmäßig getrenntein separates Modell
Sprachen99, automatisch erkanntDutzende
Woran du merkst, dass es fertig istStatus abfragendie Antwort kommt sofort, ohne Warteschlange
Oberfläche fürs Teamja: Aufnahmen erscheinen in der Appnein

Angaben zur Whisper API stammen aus der öffentlichen Dokumentation von OpenAI, Stand September 2026.

Preise

Abrechnung pro Audiominute mit Sprechern und KI-Analyse

  • Minuten aus dem Tarif

    Die API verbraucht dieselben Minuten wie die App — Sprechertrennung inklusive.

  • Tarife Pro und Expert

    Der API-Zugriff ist in beiden Tarifen enthalten.

  • Zahlung per Karte

    Monatliche oder jährliche Abrechnung.

Dein erstes Transkript — in fünf Minuten

  1. Schlüssel erstellen

    In der App: Einstellungen → API & MCP. Der Schlüssel wird nur einmal angezeigt.

    Authorization
    Authorization: Bearer sk_live_…
  2. Datei senden

    Ein POST mit der Datei als Request-Body. Zurück kommt die ID der Aufnahme.

    curl
    curl -X POST "https://app.specala.ai/api/v1/developer/transcriptions" \-H "Authorization: Bearer sk_live_…" \-H 'Content-Disposition: attachment; filename="call-48213.mp3"' \--data-binary @call-48213.mp3
  3. Ergebnis abholen

    Frag den Status alle 5–10 Sekunden ab, bis er completed ist.

    status.sh
    curl "https://app.specala.ai/api/v1/developer/transcriptions/$UUID" \-H "Authorization: Bearer sk_live_…"
FAQ

Fragen und Antworten

Was kann die speech recognition API von Specala AI?
Die Spracherkennungs-API (speech recognition API, manche Teams sagen voice recognition API) nimmt Audio und Video bis 2 GB und 10 Stunden in einem Request an und liefert Text nach Sprechern mit Zeitstempeln. Unter der Haube ist das automatische Spracherkennung (automatic speech recognition) für 99 Sprachen, und die Sprache wird automatisch erkannt. Auf Wunsch erstellt sie KI-Berichte: eine Zusammenfassung, Aufgaben oder einen Bericht nach der Vorlage deines Teams. Deal-Nummer und Mitarbeiter reisen mit der Aufnahme: Die API ist für CRM- und Telefonie-Integrationen gebaut. API-Referenz
Was kostet das, und gibt es kostenlosen Zugang?
Die API verbraucht die Minuten deines Tarifs. Der API-Zugriff ist in den Tarifen Pro und Expert enthalten, im kostenlosen Tarif nicht — eine kostenlose speech to text API ist das also nicht. Preise von Specala AI
Wie schnell wird eine Aufnahme verarbeitet?
Eine Stunde Audio dauert rund 4 Minuten: Das ist der Median aus 28.000 Aufnahmen über zwei Wochen, vom Ende des Uploads bis zum fertigen Text nach Sprechern. Kurze Aufnahmen sind in Sekunden fertig. Eine garantierte Verarbeitungszeit gibt es nicht.
Welche Formate und welche Dateigröße?
73 Audio- und Videoendungen — mp3, wav, m4a, ogg, flac, mp4, mov, mkv, webm und mehr; aus Videos wird der Ton automatisch extrahiert. Eine Datei bis 2 GB und 10 Stunden geht als Request-Body raus: Diese audio transcription API braucht weder Multipart-Formulare noch Chunked Upload.
In welchen Formaten kann ich ein Transkript exportieren?
In Markdown, txt und JSON. Markdown kommt mit YAML-Frontmatter (Titel, Datum, Sprache, Sprecher, Themen) und den KI-Berichten — es passt direkt in Obsidian oder deine Wissensdatenbank; txt ist reiner Text; JSON behält Zeitstempel und Sprecher-IDs. Bis zu 100 Transkripte holst du als ein ZIP ab. SRT, DOCX und PDF gibt es über die API nicht — sie stehen in der App bereit. Transkript exportieren
Funktioniert das für Anrufe aus einem CRM oder einer Telefonanlage?
Ja — genau dafür ist die API gebaut: Die automatische Transkription von Anrufen aus deinem CRM oder deiner Telefonanlage ist ihr Hauptszenario. Mit der Datei schickst du die Deal-Nummer (X-External-Id), eigene Felder wie Pipeline, Quelle oder Warteschlange (X-Metadata) und den Mitarbeiter (X-Author): Die Aufnahme landet in seiner Liste, und später findest du alle Anrufe eines Deals mit einem Request. Der Bericht nach deiner Checkliste kommt in derselben Response — du musst ihn nur noch in die Deal-Karte legen. Einen fertigen Konnektor gibt es nicht: Es ist eine call transcription API, und dein Entwickler bindet sie an CRM oder Telefonanlage an.
Wie automatisiere ich die Transkription von Anrufen?
Drei Schritte. Dein CRM oder deine Telefonanlage meldet deinem Handler, dass ein Anruf beendet ist; der Handler schickt die Aufnahme mit Deal-Nummer und Mitarbeiter an die API; sobald der Status completed ist, holt er Text und Bericht ab und legt sie in die Deal-Karte. Die automatische Transkription von Meetings, Interviews und Sprachnotizen funktioniert genauso. Ohne Code baust du das in n8n oder Make mit HTTP-Request-Nodes — eine separate App brauchst du nicht. Das Ergebnis ist eine KI-Analyse der Anrufe nach deiner Checkliste, statt Aufnahmen von Hand anzuhören. Datei-Upload und Integrations-Header
Was ist der Unterschied zu Google Cloud Speech-to-Text oder Amazon Transcribe?
Eine Google speech to text API oder die AWS Transcribe API liefert erkannten Text, der Rest liegt bei dir: Sprecher, Analyse, Verknüpfung mit dem Deal. Diese API ist für Vertriebsintegrationen gebaut: Derselbe Request bringt Text nach Sprechern und einen KI-Bericht nach deiner Checkliste, und die Aufnahme ist sofort mit dem Deal und dem Mitarbeiter aus deinem CRM verknüpft. Der Schlüssel ist in einer Minute in den App-Einstellungen erstellt, ganz ohne Cloud-Konsole.
Was ist der Unterschied zur Whisper API?
Die Whisper API von OpenAI nimmt Dateien bis 25 MB an und braucht für die Sprechertrennung ein separates Modell — whisper diarization gehört nicht zum Basisaufruf. Hier bekommst du ein Dateilimit von 2 GB, Sprecher standardmäßig, KI-Berichte im selben Request und Aufnahmen, die mit dem Deal und dem Mitarbeiter aus deinem CRM verknüpft sind. Wenn du Whisper bisher selbst in Python betrieben hast (openai-whisper, faster-whisper), brauchst du hier weder eine GPU noch eine eigene Job-Warteschlange. Whisper antwortet sofort und ohne Warteschlange; hier fragst du den Status ab.
Gibt es ein SDK?
Ein eigenes SDK gibt es nicht. Es gibt eine OpenAPI-3.1-Spezifikation, um einen Client zu generieren, und fertige Beispiele in curl, Python und JavaScript auf jeder Referenzseite — die speech to text API nutzt du über ganz normale HTTP-Requests. Speech to text in Python ist ein einziger httpx-Request — ohne eigene Modelle. Quickstart
Wo liegen die Daten, und wie lösche ich sie?
Transkripte und Berichte werden verschlüsselt gespeichert, mit einem eigenen Schlüssel für jeden Workspace. Die Originaldatei wird bei der Verarbeitung gelöscht. Ein DELETE-Request löscht eine Aufnahme endgültig von unseren Servern, für alle Mitglieder.
Wie verbinde ich den MCP-Server?
Mit einem Befehl für Claude Code oder über den Konnektor in Claude, ChatGPT und Cursor — Anmeldung per OAuth, derselbe Account. REST (die transcription API) bleibt für deinen Code, MCP ist für deinen Assistenten. MCP-Server von Specala AI
API

Schick deine erste Aufnahme noch heute

Ein Schlüssel ist in einer Minute in den App-Einstellungen erstellt.