API de transcripción | speech to text API

Transcripción y análisis con IA, en una sola solicitud a la API

Un POST con el archivo y la respuesta trae el texto por hablantes y un informe de IA hecho con tu plantilla.

POST /transcriptions?reports=summary
curl -X POST "https://app.specala.ai/api/v1/developer/transcriptions?reports=summary" \-H "Authorization: Bearer sk_live_…" \-H 'Content-Disposition: attachment; filename="call-48213.mp3"' \-H "X-External-Id: deal-48213" \--data-binary @call-48213.mp3
Respuestacompleted1 min 34 s
{"status": "completed","language": "es","duration_seconds": 1384.2,"segments": [{ "start": 0.0, "speaker_name": "Hablante 1","text": "Hola, Jennifer, soy Marcus, de Crumbwell." },{ "start": 6.9, "speaker_name": "Hablante 2","text": "Hola. Necesitamos una entrega de prueba para nuestra cafetería." },{ "start": 13.1, "speaker_name": "Hablante 1","text": "Enviaremos las muestras el jueves y la lista de precios hoy." }],"prompt_results": [{ "slug": "summary", "status": "completed","text": "Cafetería, entrega de prueba: muestras el jueves, lista de precios hoy." }]}

Informe de la llamada

Resumen

  • El cliente es una cafetería que necesita una entrega de prueba.
  • Acordado: muestras el jueves, lista de precios hoy.

Tareas

  • Enviar dos cajas de muestras
  • Enviar la lista de precios
  • Llamar el lunes
2 GB
archivo en una sola solicitud
10 h
por grabación
99
idiomas, detección automática
~4 min
por hora de audio
73
formatos de audio y video

CRM y telefonía

Call transcription API: de la PBX a la ficha del negocio

Junto con la grabación, envía desde tu CRM o tu PBX el número del negocio, tus propios campos y el ID del vendedor: el análisis vuelve ligado a ellos.

  1. 01 | Tu PBX o CRM

    La llamada terminó, la grabación está lista

    call-48213.mp323:04 | 21.4 MB
  2. 02 | Solicitud

    El archivo viaja con el número del negocio y el vendedor

    POST /transcriptions?reports=call-checklistX-External-Id: deal-48213X-Author: external:hubspot:1729
  3. 03 | Respuesta

    Texto por hablantes

    "status": "completed","external_id": "deal-48213","segments": [ … ]
  4. 04 | Respuesta

    Un informe según tu checklist

    "slug": "call-checklist","text": "Identificó la necesidad: sí\nIndicó el precio: no"
  5. 05 | Tu código

    El análisis llega a la ficha del negocio

    GET /transcriptions?external_id=deal-48213# todas las llamadas del negocio en una solicitud

Encaja en el CRM y la telefonía que ya tienes

  • HubSpot
  • Salesforce
  • Pipedrive
  • Twilio
  • Aircall
  • RingCentral
  • Cualquier sistema con API

Vínculo con el CRM

Cada llamada sabe cuál es su negocio y su vendedor

Tres cabeceras en la misma solicitud, y la grabación queda ligada a tu CRM desde el primer segundo: la encuentras por el número del negocio, la filtras por tus propios campos y llega al vendedor correcto.

Solicitud
curl -X POST "https://app.specala.ai/api/v1/developer/transcriptions?reports=call-checklist" \-H "Authorization: Bearer sk_live_…" \-H 'Content-Disposition: attachment; filename="call-48213.mp3"' \-H "X-External-Id: deal-48213" \-H 'X-Metadata: {"pipeline":"b2b","source":"aircall"}' \-H "X-Author: external:hubspot:1729" \--data-binary @call-48213.mp3
Respuesta
{"status": "completed","external_id": "deal-48213","metadata": { "pipeline": "b2b", "source": "aircall" },"author": { "id": "9c2d4e6f-…", "name": "Marcus" }}

La app

No tienes que construir un panel de administración

Todo lo que subes por la API aparece en Specala AI: el responsable del equipo lee los análisis, busca entre las llamadas y le pregunta al asistente de IA, en el navegador y en la app de escritorio.

Tus propios informes de IA

Tu prompt, tu informe de cada conversación

Escribe un prompt en la app y el informe recibe un identificador. Pásalo en el parámetro reports y, junto con la transcripción, llega un informe hecho con tus reglas: checklist de llamada, análisis de objeciones, ficha para tu CRM.

Ajustes → Informes de IA

Nombre
Checklist de llamada
Identificador
call-checklist
Prompt
Eres director de ventas. Revisa la llamada con el checklist: ¿el comercial se presentó, identificó la necesidad, dijo el precio y acordó el siguiente paso? Responde sí o no en cada punto y añade una cita.
Solicitud
curl -X POST "https://app.specala.ai/api/v1/developer/transcriptions?reports=call-checklist" \-H "Authorization: Bearer sk_live_…" \-H 'Content-Disposition: attachment; filename="call-48213.mp3"' \--data-binary @call-48213.mp3
Respuesta201 Createdqueuedprocessingcompleted
{"status": "completed","prompt_results": [{ "slug": "call-checklist", "name": "Checklist de llamada","text": "Se presentó: sí, «Soy Marcus, de Crumbwell»\nIdentificó la necesidad: sí, «Necesitamos una entrega de prueba»\nDijo el precio: no\nSiguiente paso: sí, «Hablamos el lunes»" }]}

Informes de IA

El análisis con IA es un parámetro de la solicitud

Añade ?reports= y la transcripción llega con un resumen y tareas, sin una llamada aparte a un modelo de lenguaje.

Solicitud
curl -X POST "https://app.specala.ai/api/v1/developer/transcriptions?reports=summary" \-H "Authorization: Bearer sk_live_…" \-H 'Content-Disposition: attachment; filename="call-48213.mp3"' \--data-binary @call-48213.mp3
Respuesta
{"status": "completed","prompt_results": [{ "slug": "summary", "name": "Resumen","text": "El cliente es una cafetería que necesita una entrega de prueba. Muestras el jueves, lista de precios hoy." }]}
Seguridad

Las grabaciones de tus clientes siguen bajo tu control

  • Las claves son de solo lectura por defecto

    Los permisos de subida, borrado e informes se conceden al crear la clave y no cambian después.

  • Las transcripciones están cifradas

    Una clave de cifrado distinta para cada espacio de trabajo.

  • La grabación original no se conserva

    El archivo se borra durante el procesamiento: solo queda el texto.

  • El borrado no deja rastro

    Una solicitud borra la transcripción y los informes de nuestros servidores, para todos los miembros.

Agentes de IA

Tu agente lo conecta solo

Una especificación OpenAPI, la documentación en un solo archivo para un modelo y un servidor MCP: Claude Code, Cursor y ChatGPT trabajan directamente con tus grabaciones.

Servidor MCPClaude Code, Cursor, ChatGPT

terminal
claude mcp add --transport http specala-ai https://mcp.specala.ai/mcp

OpenAPI 3.1para generadores de clientes y agentes

terminal
curl https://specala.ai/openapi.json

Documentación en un solo archivopásasela a un modelo de una vez

terminal
curl https://specala.ai/docs/llms-full.txt

En qué se diferencia de la Whisper API

Comparamos con la documentación pública, incluida la fila en la que no salimos mejor.

CriterioSpecala AIWhisper API (OpenAI)
Qué devuelvetexto por hablantes y un informe de IAtexto
Informe de IA en la misma solicitudsí, también con tu propia plantillano, una llamada aparte a un modelo
Tamaño del archivohasta 2 GB y 10 horashasta 25 MB
Hablantesseparados por defectoun modelo aparte
Idiomas99, detección automáticadecenas
Cómo sabes que está listoconsultas el estadola respuesta llega al instante, sin cola
Interfaz para el equiposí: las grabaciones aparecen en la appno

Los datos sobre la Whisper API proceden de la documentación pública de OpenAI, a septiembre de 2026.

Precios

Precio por minuto de audio con hablantes y análisis con IA

  • Minutos del plan

    La API gasta los mismos minutos que la app, con la separación de hablantes incluida.

  • Planes Pro y Expert

    El acceso a la API viene con ambos planes.

  • Pago con tarjeta

    Facturación mensual o anual.

Tu primera transcripción, en cinco minutos

  1. Crea una clave

    En la app: Ajustes → API y MCP. La clave se muestra una sola vez.

    Authorization
    Authorization: Bearer sk_live_…
  2. Envía un archivo

    Un POST con el archivo como cuerpo de la solicitud. Recibes el ID de la grabación.

    curl
    curl -X POST "https://app.specala.ai/api/v1/developer/transcriptions" \-H "Authorization: Bearer sk_live_…" \-H 'Content-Disposition: attachment; filename="call-48213.mp3"' \--data-binary @call-48213.mp3
  3. Recoge el resultado

    Consulta el estado cada 5–10 segundos hasta que pase a completed.

    status.sh
    curl "https://app.specala.ai/api/v1/developer/transcriptions/$UUID" \-H "Authorization: Bearer sk_live_…"
FAQ

Preguntas y respuestas

¿Qué puede hacer la speech recognition API de Specala AI?
La API de reconocimiento de voz (speech recognition API; algunos equipos la llaman voice recognition API) acepta audio y video de hasta 2 GB y 10 horas en una sola solicitud y devuelve texto por hablantes con marcas de tiempo. Por dentro es reconocimiento automático del habla (automatic speech recognition) para 99 idiomas, y el idioma se detecta solo. Si lo pides, genera informes de IA: un resumen, tareas o un informe con la plantilla de tu equipo. El número del negocio y el vendedor viajan con la grabación: la API está hecha para integraciones con CRM y telefonía. Referencia de la API
¿Cuánto cuesta? ¿Hay acceso gratuito?
La API gasta los minutos de tu plan. El acceso a la API viene con los planes Pro y Expert; el plan gratuito no lo incluye, así que no es una speech to text API gratuita. Precios de Specala AI
¿Con qué rapidez se procesa una grabación?
Una hora de audio tarda unos 4 minutos: es la mediana de 28 mil grabaciones en dos semanas, desde que termina la subida hasta que el texto por hablantes está listo. Las grabaciones cortas están listas en segundos. No hay un tiempo de procesamiento garantizado.
¿Qué formatos y qué tamaño de archivo?
73 extensiones de audio y video: mp3, wav, m4a, ogg, flac, mp4, mov, mkv, webm y más; el audio se extrae del video automáticamente. Un archivo de hasta 2 GB y 10 horas va como cuerpo de la solicitud: esta audio transcription API no necesita formularios multipart ni subida por partes.
¿En qué formatos puedo exportar una transcripción?
En Markdown, txt y JSON. El Markdown llega con una cabecera YAML (título, fecha, idioma, hablantes, temas) y los informes de IA, así que entra directo en Obsidian o en tu base de conocimiento; txt es texto plano; JSON conserva las marcas de tiempo y los ID de los hablantes. Hasta 100 transcripciones se descargan en un solo ZIP. SRT, DOCX y PDF no están disponibles por la API: están en la aplicación. Exportar una transcripción
¿Sirve para llamadas de un CRM o de un sistema telefónico?
Sí, para eso está hecha la API: la transcripción automática de llamadas desde tu CRM o tu sistema telefónico es su escenario principal. Junto con el archivo envías el número del negocio (X-External-Id), tus propios campos, como embudo, origen o cola (X-Metadata), y el vendedor (X-Author): la grabación llega a su lista, y después encuentras todas las llamadas de un negocio con una sola solicitud. El informe según tu checklist llega en la misma respuesta: solo queda ponerlo en la ficha del negocio. No hay un conector listo: es una call transcription API, y tu desarrollador la conecta al CRM o a la PBX.
¿Cómo automatizo la transcripción de llamadas?
Tres pasos. Tu CRM o tu PBX avisa a tu handler de que la llamada terminó; el handler envía la grabación a la API con el número del negocio y el vendedor; cuando el estado pasa a completed, recoge el texto y el informe y los pone en la ficha del negocio. La transcripción automática de reuniones, entrevistas y notas de voz funciona igual. Sin código puedes montarlo en n8n o Make con nodos de solicitud HTTP: no hace falta una app aparte. El resultado es un análisis de llamadas con IA según tu checklist, en lugar de escuchar las grabaciones a mano. Subida de un archivo y cabeceras de integración
¿En qué se diferencia de Google Cloud Speech-to-Text o Amazon Transcribe?
Una Google speech to text API o la AWS Transcribe API devuelven el texto reconocido, y el resto corre por tu cuenta: hablantes, análisis, vínculo con el negocio. Esta API está hecha para integraciones de ventas: la misma solicitud trae texto por hablantes y un informe de IA según tu checklist, y la grabación queda ligada desde el primer momento al negocio y al vendedor de tu CRM. La clave se crea en un minuto en los ajustes de la app, sin consola en la nube.
¿En qué se diferencia de la Whisper API?
La Whisper API de OpenAI acepta archivos de hasta 25 MB y necesita un modelo aparte para separar hablantes: whisper diarization no forma parte de la llamada básica. Aquí tienes un límite de 2 GB por archivo, hablantes por defecto, informes de IA en la misma solicitud y grabaciones ligadas al negocio y al vendedor de tu CRM. Si venías ejecutando Whisper en Python por tu cuenta (openai-whisper, faster-whisper), aquí no necesitas GPU ni una cola de tareas propia. Whisper responde al instante y sin cola; aquí consultas el estado.
¿Hay un SDK?
No hay un SDK aparte. Hay una especificación OpenAPI 3.1 para generar un cliente y ejemplos listos en curl, Python y JavaScript en cada página de la referencia: la speech to text API se usa con solicitudes HTTP normales. Speech to text en Python es una sola solicitud con httpx, sin modelos propios. Guía rápida
¿Dónde se guardan los datos y cómo los borro?
Las transcripciones y los informes se guardan cifrados, con una clave distinta para cada espacio de trabajo. El archivo original se borra durante el procesamiento. Una solicitud DELETE borra una grabación de nuestros servidores para siempre y para todos los miembros.
¿Cómo conecto el servidor MCP?
Con un comando en Claude Code, o mediante el conector en Claude, ChatGPT y Cursor: inicio de sesión con OAuth, la misma cuenta. REST (la transcription API) queda para tu código; MCP, para tu asistente. Servidor MCP de Specala AI
API

Envía tu primera grabación hoy

La clave se crea en un minuto en los ajustes de la app.