API لتفريغ الصوت | speech to text API

التفريغ والتحليل بالذكاء الاصطناعي، في طلب API واحد

طلب POST واحد مع الملف، فتصلك في الاستجابة نصوص مقسّمة حسب المتحدثين وتقرير بالذكاء الاصطناعي وفق قالبك.

POST /transcriptions?reports=summary
curl -X POST "https://app.specala.ai/api/v1/developer/transcriptions?reports=summary" \-H "Authorization: Bearer sk_live_…" \-H 'Content-Disposition: attachment; filename="call-48213.mp3"' \-H "X-External-Id: deal-48213" \--data-binary @call-48213.mp3
الاستجابةcompleted1 د 34 ث
{"status": "completed","language": "ar","duration_seconds": 1384.2,"segments": [{ "start": 0.0, "speaker_name": "المتحدث 1","text": "مرحبًا جينيفر، معك ماركوس من Crumbwell." },{ "start": 6.9, "speaker_name": "المتحدث 2","text": "مرحبًا. نحتاج إلى توريد تجريبي لمقهانا." },{ "start": 13.1, "speaker_name": "المتحدث 1","text": "سنرسل العينات يوم الخميس وقائمة الأسعار اليوم." }],"prompt_results": [{ "slug": "summary", "status": "completed","text": "مقهى، توريد تجريبي: العينات يوم الخميس، وقائمة الأسعار اليوم." }]}

تقرير المكالمة

الملخص

  • العميل مقهى يحتاج إلى توريد تجريبي.
  • المتفق عليه: العينات يوم الخميس، وقائمة الأسعار اليوم.

المهام

  • إرسال صندوقين من العينات
  • إرسال قائمة الأسعار
  • الاتصال يوم الاثنين
2 GB
ملف في طلب واحد
10 ساعات
لكل تسجيل
99
لغة، بكشف تلقائي
~4 دقائق
لكل ساعة من الصوت
73
صيغة صوت وفيديو

CRM والاتصالات الهاتفية

Call transcription API: من نظام PBX إلى بطاقة الصفقة

أرسل مع التسجيل رقم الصفقة وحقولك الخاصة ومعرّف المندوب من نظام CRM أو PBX لديك، فيعود التحليل مرتبطًا بها.

  1. 01 | نظام PBX أو CRM لديك

    انتهت المكالمة والتسجيل جاهز

    call-48213.mp323:04 | 21.4 MB
  2. 02 | الطلب

    ينتقل الملف مع رقم الصفقة والمندوب

    POST /transcriptions?reports=call-checklistX-External-Id: deal-48213X-Author: external:hubspot:1729
  3. 03 | الاستجابة

    نص مقسّم حسب المتحدثين

    "status": "completed","external_id": "deal-48213","segments": [ … ]
  4. 04 | الاستجابة

    تقرير مبني على قائمة التحقق لديك

    "slug": "call-checklist","text": "حدّد الاحتياج: نعم\nذكر السعر: لا"
  5. 05 | الكود الخاص بك

    يصل التحليل إلى بطاقة الصفقة

    GET /transcriptions?external_id=deal-48213# كل مكالمات الصفقة في طلب واحد

يندمج مع نظام CRM ونظام الهاتف اللذين تستخدمهما بالفعل

  • HubSpot
  • Salesforce
  • Pipedrive
  • Twilio
  • Aircall
  • RingCentral
  • أي نظام لديه API

الربط مع CRM

كل مكالمة تعرف صفقتها ومندوبها

ثلاث ترويسات في الطلب نفسه، فيرتبط التسجيل بنظام CRM لديك من الثانية الأولى: تجده برقم الصفقة، وتصفّيه حسب حقولك الخاصة، ويصل إلى المندوب الصحيح.

الطلب
curl -X POST "https://app.specala.ai/api/v1/developer/transcriptions?reports=call-checklist" \-H "Authorization: Bearer sk_live_…" \-H 'Content-Disposition: attachment; filename="call-48213.mp3"' \-H "X-External-Id: deal-48213" \-H 'X-Metadata: {"pipeline":"b2b","source":"aircall"}' \-H "X-Author: external:hubspot:1729" \--data-binary @call-48213.mp3
الاستجابة
{"status": "completed","external_id": "deal-48213","metadata": { "pipeline": "b2b", "source": "aircall" },"author": { "id": "9c2d4e6f-…", "name": "Marcus" }}

التطبيق

لا حاجة إلى بناء لوحة إدارة

كل ما يُرفع عبر API يظهر في Specala AI: يقرأ المدير التحليلات ويبحث في المكالمات ويسأل المساعد الذكي، في المتصفح وفي تطبيق سطح المكتب.

تقاريرك الخاصة

موجّهك أنت، وتقريرك أنت عن كل محادثة

اكتب موجّهًا في التطبيق فيحصل التقرير على معرّف. مرّره في المعامل reports، فيعود مع التفريغ تقرير وفق قواعدك: قائمة تحقق المكالمة، أو تحليل الاعتراضات، أو بطاقة لنظام CRM.

الإعدادات → تقارير الذكاء الاصطناعي

الاسم
قائمة تحقق المكالمة
المعرّف
call-checklist
الموجّه
أنت مدير مبيعات. راجع المكالمة وفق القائمة: هل عرّف المندوب بنفسه، وحدّد الحاجة، وذكر السعر، واتفق على الخطوة التالية؟ أجب بنعم أو لا عن كل بند واذكر اقتباسًا.
الطلب
curl -X POST "https://app.specala.ai/api/v1/developer/transcriptions?reports=call-checklist" \-H "Authorization: Bearer sk_live_…" \-H 'Content-Disposition: attachment; filename="call-48213.mp3"' \--data-binary @call-48213.mp3
الاستجابة201 Createdqueuedprocessingcompleted
{"status": "completed","prompt_results": [{ "slug": "call-checklist", "name": "قائمة تحقق المكالمة","text": "عرّف بنفسه: نعم، «معك ماركوس من Crumbwell»\nحدّد الحاجة: نعم، «نحتاج إلى توريد تجريبي»\nذكر السعر: لا\nالخطوة التالية: نعم، «نتحدث يوم الاثنين»" }]}

تقارير الذكاء الاصطناعي

التحليل بالذكاء الاصطناعي مجرد معامل في الطلب

أضف ?reports= فيعود التفريغ ومعه ملخص ومهام، دون استدعاء منفصل لنموذج لغوي.

الطلب
curl -X POST "https://app.specala.ai/api/v1/developer/transcriptions?reports=summary" \-H "Authorization: Bearer sk_live_…" \-H 'Content-Disposition: attachment; filename="call-48213.mp3"' \--data-binary @call-48213.mp3
الاستجابة
{"status": "completed","prompt_results": [{ "slug": "summary", "name": "الملخص","text": "العميل مقهى يحتاج إلى توريد تجريبي. العينات يوم الخميس، وقائمة الأسعار اليوم." }]}
الأمان

تسجيلات عملائك تبقى تحت سيطرتك

  • المفاتيح للقراءة فقط افتراضيًا

    صلاحيات الرفع والحذف والتقارير تُمنح عند إنشاء المفتاح ولا تتغير بعد ذلك.

  • التفريغات مشفَّرة

    مفتاح تشفير مستقل لكل مساحة عمل.

  • التسجيل الأصلي لا يُحفظ

    يُحذف الملف أثناء المعالجة، ولا يبقى سوى النص.

  • الحذف لا يترك أثرًا

    طلب واحد يمحو التفريغ والتقارير من خوادمنا لدى جميع الأعضاء.

وكلاء الذكاء الاصطناعي

وكيلك الذكي يتولى الربط بنفسه

مواصفات OpenAPI، والتوثيق في ملف واحد مخصص للنموذج، وخادم MCP: يعمل Claude Code وCursor وChatGPT مع تسجيلاتك مباشرة.

خادم MCPClaude Code وCursor وChatGPT

terminal
claude mcp add --transport http specala-ai https://mcp.specala.ai/mcp

OpenAPI 3.1لمولّدات العملاء والوكلاء

terminal
curl https://specala.ai/openapi.json

التوثيق في ملف واحدمرّره إلى النموذج دفعة واحدة

terminal
curl https://specala.ai/docs/llms-full.txt

بماذا يختلف عن Whisper API

قارنّا استنادًا إلى التوثيق العلني، بما في ذلك الصف الذي لا نتفوق فيه.

المعيارSpecala AIWhisper API (OpenAI)
ما الذي يعودنص مقسّم حسب المتحدثين وتقرير بالذكاء الاصطناعينص
تقرير بالذكاء الاصطناعي في الطلب نفسهنعم، ومنه ما يُبنى على قالبكلا، استدعاء منفصل لنموذج
حجم الملفحتى 2 غيغابايت و10 ساعاتحتى 25 ميغابايت
المتحدثونمفصولون افتراضيًانموذج منفصل
اللغات99، بكشف تلقائيعشرات
كيف تعرف أن النتيجة جاهزةتستعلم عن الحالةتعود الإجابة فورًا دون طابور
واجهة للفريقنعم: تظهر التسجيلات في التطبيقلا

المعلومات عن Whisper API مأخوذة من وثائق OpenAI العامة حتى سبتمبر 2026.

الأسعار

التسعير بدقيقة الصوت مع فصل المتحدثين وتحليل الذكاء الاصطناعي

  • دقائق الخطة

    يستهلك API الدقائق نفسها التي يستهلكها التطبيق، ويشمل ذلك فصل المتحدثين.

  • خطتا Pro وExpert

    الوصول إلى API مضمّن في الخطتين.

  • الدفع بالبطاقة

    فوترة شهرية أو سنوية.

أول تفريغ لك، خلال خمس دقائق

  1. أنشئ مفتاحًا

    في التطبيق: الإعدادات → API وMCP. يُعرض المفتاح مرة واحدة فقط.

    Authorization
    Authorization: Bearer sk_live_…
  2. أرسل ملفًا

    طلب POST واحد والملف هو جسم الطلب. يعود إليك معرّف التسجيل.

    curl
    curl -X POST "https://app.specala.ai/api/v1/developer/transcriptions" \-H "Authorization: Bearer sk_live_…" \-H 'Content-Disposition: attachment; filename="call-48213.mp3"' \--data-binary @call-48213.mp3
  3. اجلب النتيجة

    استعلم عن الحالة كل 5–10 ثوانٍ حتى تصبح completed.

    status.sh
    curl "https://app.specala.ai/api/v1/developer/transcriptions/$UUID" \-H "Authorization: Bearer sk_live_…"
الأسئلة الشائعة

أسئلة وأجوبة

ماذا تستطيع speech recognition API من Specala AI أن تفعل؟
تستقبل واجهة التعرف على الكلام (speech recognition API، وتسميها بعض الفرق voice recognition API) الصوت والفيديو حتى 2 غيغابايت و10 ساعات في طلب واحد، وتعيد نصًا مقسّمًا حسب المتحدثين مع طوابع زمنية. وهي في جوهرها تعرّف تلقائي على الكلام (automatic speech recognition) لـ99 لغة، وتُكشف اللغة تلقائيًا. وتُعدّ عند الطلب تقارير بالذكاء الاصطناعي: ملخصًا أو مهامًا أو تقريرًا وفق قالب فريقك. ينتقل رقم الصفقة والمندوب مع التسجيل: فالواجهة مبنية للتكامل مع أنظمة CRM والاتصالات الهاتفية. مرجع API
كم التكلفة، وهل يوجد وصول مجاني؟
يستهلك API دقائق خطتك. الوصول إلى API مضمّن في خطتي Pro وExpert، ولا تشمله الخطة المجانية، فهذه ليست speech to text API مجانية. أسعار Specala AI
ما سرعة معالجة التسجيل؟
ساعة من الصوت تستغرق نحو 4 دقائق: هذا هو الوسيط عبر 28 ألف تسجيل خلال أسبوعين، من انتهاء الرفع حتى جاهزية النص المقسّم حسب المتحدثين. التسجيلات القصيرة تجهز في ثوانٍ. لا يوجد وقت معالجة مضمون.
ما الصيغ المدعومة وما حجم الملف؟
73 امتدادًا للصوت والفيديو، منها mp3 وwav وm4a وogg وflac وmp4 وmov وmkv وwebm وغيرها؛ ويُستخرج الصوت من الفيديو تلقائيًا. يُرسل الملف حتى 2 غيغابايت و10 ساعات بوصفه جسم الطلب: لا تحتاج audio transcription API هذه إلى نماذج multipart ولا إلى رفع مجزّأ.
بأي صيغ يمكنني تصدير التفريغ؟
بصيغ Markdown وtxt وJSON. يأتي ملف Markdown مع ترويسة YAML (العنوان والتاريخ واللغة والمتحدثون والموضوعات) ومع تقارير الذكاء الاصطناعي، فيدخل مباشرة إلى Obsidian أو قاعدة معارفك؛ أما txt فنص عادي، ويحتفظ JSON بالطوابع الزمنية ومعرّفات المتحدثين. ويمكن تنزيل ما يصل إلى 100 تفريغ في ملف ZIP واحد. صيغ SRT وDOCX وPDF غير متاحة عبر API، لكنها متوفرة في التطبيق. تصدير التفريغ
هل يصلح لمكالمات CRM أو نظام الهاتف؟
نعم، فلهذا بُنيت الواجهة: فالتفريغ التلقائي للمكالمات من نظام CRM أو نظام الهاتف لديك هو سيناريوها الرئيسي. ترسل مع الملف رقم الصفقة (X-External-Id) وحقولك الخاصة مثل مسار المبيعات أو المصدر أو قائمة الانتظار (X-Metadata) والمندوب (X-Author): يصل التسجيل إلى قائمته، ثم تجد لاحقًا كل مكالمات الصفقة بطلب واحد. ويأتي التقرير المبني على قائمة التحقق لديك في الاستجابة نفسها، فلا يبقى إلا وضعه في بطاقة الصفقة. لا يوجد موصل جاهز: إنها call transcription API، ومطوّرك هو من يربطها بنظام CRM أو PBX.
كيف أؤتمت تفريغ المكالمات؟
ثلاث خطوات. يُبلغ نظام CRM أو PBX لديك المعالج (handler) الخاص بك بانتهاء المكالمة؛ فيرسل المعالج التسجيل إلى API مع رقم الصفقة والمندوب؛ وحين تصبح الحالة completed يجلب النص والتقرير ويضعهما في بطاقة الصفقة. ويعمل التفريغ التلقائي للاجتماعات والمقابلات والملاحظات الصوتية بالطريقة نفسها. ودون كتابة كود يمكنك بناء ذلك في n8n أو Make باستخدام عُقد طلبات HTTP، فلا حاجة إلى تطبيق منفصل. والنتيجة تحليل للمكالمات بالذكاء الاصطناعي وفق قائمة التحقق لديك، بدلًا من الاستماع إلى التسجيلات يدويًا. رفع ملف وترويسات التكامل
بماذا يختلف عن Google Cloud Speech-to-Text أو Amazon Transcribe؟
تعيد Google speech to text API أو AWS Transcribe API النص المتعرَّف عليه، والباقي عليك: المتحدثون والتحليل والربط بالصفقة. أما هذه الواجهة فمبنية لتكاملات المبيعات: الطلب نفسه يأتي بنص مقسّم حسب المتحدثين وتقرير بالذكاء الاصطناعي مبني على قائمة التحقق لديك، ويرتبط التسجيل فورًا بالصفقة والمندوب في نظام CRM لديك. ويُنشأ المفتاح في دقيقة من إعدادات التطبيق دون وحدة تحكم سحابية.
بماذا يختلف عن Whisper API؟
تقبل Whisper API من OpenAI ملفات حتى 25 ميغابايت وتحتاج إلى نموذج منفصل لفصل المتحدثين، فميزة whisper diarization ليست جزءًا من الاستدعاء الأساسي. أما هنا فحد الملف 2 غيغابايت، والمتحدثون مفصولون افتراضيًا، وتقارير الذكاء الاصطناعي في الطلب نفسه، والتسجيلات مرتبطة بالصفقة والمندوب في نظام CRM لديك. وإذا كنت تشغّل Whisper بنفسك في Python (openai-whisper، faster-whisper)، فلن تحتاج هنا إلى GPU ولا إلى طابور مهام خاص بك. يجيب Whisper فورًا دون طابور، أما هنا فتستعلم عن الحالة.
هل يوجد SDK؟
لا يوجد SDK مستقل. توجد مواصفات OpenAPI 3.1 لتوليد عميل، وأمثلة جاهزة بـcurl وPython وJavaScript في كل صفحة من المرجع: تُستخدم speech to text API عبر طلبات HTTP عادية. أما speech to text في Python فهو طلب httpx واحد، دون نماذج خاصة بك. البدء السريع
أين تُخزَّن البيانات وكيف أحذفها؟
تُخزَّن التفريغات والتقارير مشفَّرة، بمفتاح مستقل لكل مساحة عمل. يُحذف الملف الأصلي أثناء المعالجة. طلب DELETE واحد يمحو التسجيل من خوادمنا نهائيًا لدى جميع الأعضاء.
كيف أربط خادم MCP؟
بأمر واحد في Claude Code، أو عبر الموصل في Claude وChatGPT وCursor: تسجيل دخول عبر OAuth وبالحساب نفسه. يبقى REST (أي transcription API) للكود الخاص بك، وMCP لمساعدك. خادم MCP من Specala AI
API

أرسل أول تسجيل لك اليوم

يُنشأ المفتاح في دقيقة من إعدادات التطبيق.