النماذج واللغات والأصوات
اختر لغة SDK 0.18.0 ونموذج ASR ومحدد المعالجة ونموذج TTS والصوت المناسبين.
اختر مسار المعالجة أولاً. ثم اختر المعاملات التي يعرضها ذلك المسار فقط: تحدد اللغة الكلام، ويختار نموذج ASR أداة التعرف، وتعدل محددات المعالجة خرج Batch، وصوت TTS ليس نموذجًا.
اتخذ الاختيارات بهذا الترتيب
- اختر Batch للتسجيلات الطويلة أو الكبيرة المكتملة، وFast لوحدة صوت مكتملة حساسة للكمون مثل دور لوكيل، وRealtime ما دام الصوت يصل، أو TTS عندما يكون النص هو الإدخال.
- لتحويل الكلام إلى نص، اختر قيمة
Languageالتي تصف الصوت. - لنسخ Batch أو Fast، اختر نموذج ASR الخاص بالمسار عندما تتطلبه العملية أو عندما يثبته تكاملك عمدًا. يختار النسخ Realtime اللغة لا نموذج ASR.
- أضف محددات معالجة Batch عند الحاجة فقط. وفي TTS، اختر النموذج ثم صوتًا متاحًا أثناء التشغيل أو مراجع صوت.
| الاختيار | ما الذي يتحكم فيه | ما الذي لا يتحكم فيه |
|---|---|---|
| اللغة | إدخال عربي أو إنجليزي أو تبديل عربي-إنجليزي | تنفيذ أداة التعرف المحددة |
| نموذج ASR | أداة التعرف التي يستخدمها Batch أو Fast | تأطير لغة Realtime أو TTS |
| محدد المعالجة | التمييز أو التنقيح أو ITN في عمل Batch | نموذج ASR نفسه |
| نموذج TTS | محرك توليف الكلام | هوية الصوت |
| الصوت | معرّف صوت مدرج أو مراجع يقدمها المستدعي | محرك TTS |
توثق هذه الجداول الثوابت التي يصدرها SDK JavaScript وPython بالإصدار 0.18.0.
لا يضمن تصدير ثابت توفير النموذج أو الصوت لكل مفتاح أو بيئة. استخدم الإعداد
الصادر لبيئتك، وتعامل مع عدم توفر النموذج وقائمة الأصوات الفارغة.
قيم اللغة
يصدر JavaScript وPython أعضاء Language نفسها.
| ثابت SDK | قيمة البروتوكول | بايت إطار Realtime | تستخدمه |
|---|---|---|---|
Language.Ar | ar | 0 | مسار Batch، وبيانات Fast، وإطارات Realtime |
Language.En | en | 1 | مسار Batch، وبيانات Fast، وإطارات Realtime |
Language.ArEn | codeswitch | 2 | مسار Batch، وبيانات Fast، وإطارات Realtime |
| — (البروتوكول المباشر فقط) | auto | 255 | مسار Batch، وبيانات Fast، وإطارات Realtime |
تختار auto الإعداد التلقائي المضبوط للبيئة، وهو يُحل حاليًا إلى نموذج تبديل
اللغات. وهي قيمة على مستوى البروتوكول المباشر: لا يصدّر SDK 0.18.0 ثابتًا
مسمى لها، لذا لا تصلها إلا عبر تكامل مباشر مع OpenAPI أو AsyncAPI. ولحذف اللغة
حيث تسمح العملية بذلك الأثر نفسه.
للعمليات المباشرة عبر HTTP، استخدم قيم اللغة التي تعلنها عملية OpenAPI
المعنية. لا تمرر تعداد نموذج Batch أو Fast إلى
RealtimeClient.startStream() / start_stream().
نماذج ASR لنسخ Batch وFast
يستخدم JavaScript وPython بالإصدار 0.18.0 أسماء الأعضاء وسلاسل البروتوكول
نفسها.
| قيمة البروتوكول | ثابت Batch | ثابت Fast | قيد SDK المنشور |
|---|---|---|---|
nida_ar | BatchTranscriptionModel.NidaAr | FastTranscriptionModel.NidaAr | نموذج موسوم للعربية |
nida_8k_ar | BatchTranscriptionModel.NidaArTelephony | — | مصدر لـBatch فقط في 0.18.0 |
bayan_ar | BatchTranscriptionModel.BayanAr | FastTranscriptionModel.BayanAr | نموذج موسوم للعربية |
bayan_cs_ar_en | BatchTranscriptionModel.BayanArEn | FastTranscriptionModel.BayanArEn | اسم مستعار غير مرقم للعربية-الإنجليزية |
bayan_cs_ar_en_v1 | BatchTranscriptionModel.BayanArEnV1 | FastTranscriptionModel.BayanArEnV1 | إصدار عربي-إنجليزي ثابت |
bayan_cs_ar_en_v2 | BatchTranscriptionModel.BayanArEnV2 | FastTranscriptionModel.BayanArEnV2 | إصدار عربي-إنجليزي ثابت |
fast_en | BatchTranscriptionModel.FastEn | FastTranscriptionModel.FastEn | نموذج موسوم للإنجليزية |
يحتوي تعداد التوافق ASRModel الأعضاء السبعة كلها، لكن ينبغي للشيفرة الجديدة
استخدام BatchTranscriptionModel أو FastTranscriptionModel ليصعب التعبير عن
توليفة غير صالحة للمسار. لا يعرّف سطح SDK ترتيب جودة أو كمون بين NidaAr
وBayanAr؛ اتبع إعداد النموذج الصادر لبيئتك.
القيم الافتراضية والأسماء المستعارة والتوافق
| الحالة | سلوك 0.18.0 المنشور |
|---|---|
| حذف ASR من Batch | يكون asr اختياريًا؛ ويترك الطلب اختيار النموذج للخدمة. |
| ASR في Fast | يتطلب FastTranscriptionClient.transcribe() نموذجًا ولغة؛ ويبقى يرسل وحدة صوت مكتملة واحدة. |
| ASR في Realtime | يتطلب startStream() / start_stream() لغة ولا يملك معامل نموذج ASR. |
| الاسم المستعار العربي-الإنجليزي | استخدم اسم التوافق غير المرقم BayanArEn؛ اختر BayanArEnV1 أو BayanArEnV2 فقط عند تثبيت قيمة البروتوكول عمدًا. |
| ثابت الاتصال الهاتفي | يغيب NidaArTelephony عمدًا عن FastTranscriptionModel؛ عامله كقيد توافق في 0.18.0، لا كتصريح دائم عن توفر المنصة. |
يشترك النسخ السريع مع Batch في اختيار اللغة والنموذج، لا في حدود حمل العمل: يستهلك Fast وحدة صوت مكتملة حساسة للكمون؛ أما الاجتماعات والبودكاست والأرشيفات والتسجيلات الطويلة الأخرى فتنتمي إلى Batch.
محددات معالجة Batch
تعدل المحددات المعالجة؛ ولا تستبدل Language أو نموذج ASR.
| الغرض | ثابت SDK أو الخيار | القيمة الصادرة | المعنى |
|---|---|---|---|
| التمييز | BatchDiarization.Off | 0 | تعطيل تقسيم المتحدثين |
| التمييز | BatchDiarization.On | 1 | تفعيل اختيار التمييز الافتراضي |
| التمييز | BatchDiarization.D1 | d1 | اختيار مفتاح التمييز d1 |
| التمييز | BatchDiarization.D2 | d2 | اختيار مفتاح التمييز d2 |
| التنقيح | BatchRedact.Off | 0 | تعطيل التنقيح |
| التنقيح | BatchRedact.On | 1 | تفعيل التنقيح |
| ITN | itn: boolean | true / false في طلبات SDK | تبديل التسوية العكسية للنص |
يؤدي حذف المحدد إلى حذف معامل الاستعلام؛ فلا تعرض القيمة المحذوفة كقيمة
افتراضية ثابتة للمعالجة. في REST المباشر، استخدم القيم المقبولة في عملية
OpenAPI الحالية بدلاً من نسخ تسلسل SDK. في Python، يصدر BatchDiarization
وBatchRedact من humain_voice.stt.batchtranscription، لا من مساحة
humain_voice.stt العليا.
نموذج TTS والصوت
| الاختيار | سطح SDK | القيمة أو القاعدة |
|---|---|---|
| النموذج | TtsModel.Nebula | قيمة البروتوكول nebula؛ وهي قيمة SDK 0.18.0 الافتراضية عند حذف model. |
| صوت مدرج | VoiceInfo مع id وlabel وprofile | استدعِ listVoices() / list_voices() ومرر معرّف الهوية المعاد في voice_id. |
| مراجع الصوت | VoiceReference مع audio وtext | قدم للمسار العام مرجع RIFF/WAVE واحدًا بترميز base64 القياسي، يحوي بيانات PCM16 أحادية غير فارغة ونصها، بدل voice_id. |
يتطلب طلب التوليف في SDK 0.18.0 واحدًا بالضبط من voice_id أو
voice_references غير الفارغة؛ ولا يمثل أي منهما ثابت نموذج. يسمح عقد السلك
المباشر بغياب المحددين، وعندها يكون اختيار الصوت محددًا بالنشر أو النموذج ولا
يضمن صوتًا. تعامل مع قائمة أصوات فارغة بدلاً من تخمين معرّف. تمرر أمثلة
الوثائق مهلة خمس ثوان لقائمة الأصوات في اللغتين؛ لا
تملك Python مهلة افتراضية، بينما تستخدم JavaScript خمس ثوان افتراضيًا لقائمة
الأصوات.
يعيد TTS عبر Socket.IO مع TtsModel.Nebula صوت PCM16 خامًا little-endian
بتردد 24 kHz وأحادي القناة. استخدم getSampleRate() / get_sample_rate()
عند كتابة حاوية.
هويات الصوت وتسمياته
تحتوي قائمة الأصوات فقط على الهويات السبع متعددة اللغات. يحمل كل عنصر
profile: { speaker: { gender, dialect }, languages } ومعرّف هوية ثابتًا، مثل
المعرّف ذي التسمية mul_youssef. أرسل ذلك المعرّف في voice_id؛ تحتفظ المنصة
بالنسخ الفعلية داخليًا وترفض معرّفاتها عند إرسالها مباشرة.
في هويات العربية/الإنجليزية الحالية، يختار وجود أي حرف من محارف الكتابة
العربية في text النسخة العربية؛ وإلا تُختار الإنجليزية. لا تختار العربية
الأرقام أو علامات الترقيم أو الرموز التعبيرية أو المسافات أو حروف الكتابات
غير العربية.
عامل كل label بوصفه تلميحًا مقروءًا فقط. اعرض بيانات profile المنظمة،
وخزّن id الثابت ومرره، ولا تشتق معرّفًا أو تطابقه اعتمادًا على label.
الخطوات التالية
استخدم نموذجًا في طلب
شغّل مثال Batch أو Realtime مختبرًا بعقد SDK المنشور.
راجع سلوك SDK
راجع دوال العملاء وخياراتهم وأنواع الاستجابة والمهل وقواعد التنظيف بدقة.
اختر صوتًا واكتب WAV
اسرد أصوات التشغيل، وولّد PCM، وأنشئ ملفًا قابلاً للتشغيل.
افحص معاملات API المباشرة
استخدم صفحات OpenAPI المولدة للقيم والمخططات المقبولة على البروتوكول.