
تساعد Omtera، بصفتها شريكًا استراتيجيًا لـ ElevenLabs، الشركات على تحويل تقنيات AI audio المتقدمة إلى عمليات أعمال آمنة وقابلة للتوسع والقياس. يقلل ElevenLabs Speech to Text، المعروف أيضًا باسم STT أو speech recognition (التعرّف على الكلام)، من عبء النسخ اليدوي على الفرق من خلال تحويل المحادثات الموجودة في المحتوى الصوتي والمرئي تلقائيًا إلى نص مكتوب.
يمكن أن تتطلب كتابة تسجيلات الاجتماعات يدويًا، وتحليل محادثات العملاء، وإعداد الترجمة النصية لمقاطع الفيديو، أو تصنيف محادثات مراكز الاتصال وقتًا طويلًا وموارد تشغيلية كبيرة. إضافة إلى ذلك، تجعل خطوات مثل فصل المتحدثين، وكتابة المصطلحات المتخصصة بصورة صحيحة، وإضافة الرموز الزمنية، ومعالجة اللغات المختلفة، العملية أكثر تعقيدًا عند استخدام الطرق التقليدية.
تقوم ElevenLabs بأتمتة هذه العملية من خلال نماذج Speech to Text التابعة لعائلة Scribe. توفر المنصة قدرات مثل النسخ المعتمد على الملفات، وspeaker diarization (فصل المتحدثين)، وword-level timestamps (الطوابع الزمنية على مستوى الكلمات)، وaudio event tagging (وسم الأحداث الصوتية)، والتعرّف على الكلام متعدد اللغات، ومعالجة تدفقات الصوت في الوقت الفعلي.
ElevenLabs Speech to Text هو حل automatic speech recognition (التعرّف التلقائي على الكلام) يحوّل المحادثات الموجودة في ملفات الصوت أو الفيديو إلى نص يمكن للأنظمة معالجته. تُعرف عائلة النماذج الرئيسية التي تقدمها ElevenLabs في هذا المجال باسم Scribe.
لا يُعد Speech to Text مجرد أداة إملاء بسيطة تكتب الكلمات التي تسمعها بالتتابع. بل يقوم بتحليل الإشارة الصوتية، وتحديد اللغة المنطوقة، والتعرّف على الكلمات، وإضافة علامات الترقيم، وفصل المتحدثين المختلفين عند استخدام الإعدادات المطلوبة. وبهذه الطريقة، يتحول التسجيل الصوتي الخام إلى مصدر بيانات يمكن البحث فيه، وتلخيصه، وإعداد التقارير منه، واستخدامه داخل الأنظمة المؤسسية الأخرى.
وفقًا لوثائق ElevenLabs الحالية، تم تطوير Scribe v2 لإنتاج نسخ دقيقة بأكثر من 90 لغة. وقد صُمم النموذج للتعامل مع الظروف التي تظهر في التسجيلات الواقعية، مثل التسجيلات الطويلة، وتغيّر نبرة الصوت، والتوقفات أثناء الكلام، وفترات الصمت الطويلة.
تُعد هذه البنية مفيدة بشكل خاص للفرق التي تحتاج إلى ما يلي:
يقوم ElevenLabs Scribe بتحليل تدفق الصوت أو ملف الوسائط المرسل إلى النظام، ثم يحوّل الكلام إلى نص منظم. ويمكن تنفيذ هذه العملية عبر واجهة ElevenLabs على الويب أو من خلال ElevenLabs API، بحسب طريقة الاستخدام.
يمكن للمستخدم رفع ملف صوت أو فيديو إلى واجهة ElevenLabs Speech to Text. أما في المشاريع المعتمدة على API، فيُرسل الملف إلى endpoint الخاص بـ Speech to Text من خلال نظام backend للتطبيق.
توفر ElevenLabs endpoint عبر API لنسخ ملفات الصوت والفيديو. وفي العمليات واسعة النطاق أو طويلة المدة، يمكن أيضًا استخدام نموذج معالجة غير متزامن يتيح استلام النتائج عبر webhook. أما التسجيلات التي تحتوي على قنوات صوتية متعددة، فيمكن نسخ كل قناة منها بشكل منفصل أو دمجها وفق الترتيب الزمني.
يحلل النموذج أنماط الكلام داخل التسجيل ويُنشئ نصًا باللغات المدعومة. ويمكن لميزة الاكتشاف التلقائي للغة أن تقلل التعقيد التشغيلي في المنصات التي يستخدمها أشخاص من دول مختلفة.
على سبيل المثال، يستطيع فريق دعم عملاء عالمي معالجة المحادثات باللغات التركية والإنجليزية والفرنسية ضمن workflow واحد. وبعد إنشاء النصوص، يمكن تصنيفها وفق معايير مثل اللغة، أو الموضوع، أو نوع العميل، أو نتيجة المحادثة.
لا يقتصر ElevenLabs Scribe على توفير مخرجات نصية بسيطة فقط. فبحسب حالة الاستخدام والإعدادات المختارة، يمكن أيضًا إنشاء المعلومات التالية:
تُسهّل هذه البنية استخدام النص داخل أدوات تحرير الفيديو، وأنظمة analytics، ومحركات البحث، ومنصات تجربة العملاء.
يدعم Scribe v2 التعرّف على الكلام بأكثر من 90 لغة. وتقلل هذه الميزة من حاجة الشركات العاملة في أسواق مختلفة إلى إنشاء بنية نسخ مستقلة بالكامل لكل لغة.
يُعد دعم اللغات المتعددة مهمًا بشكل خاص لخدمات العملاء الدولية، وتوطين المحتوى الإعلامي، والمقابلات البحثية، والمحتوى التدريبي العالمي. ومع ذلك، يمكن أن تتأثر دقة النتائج بعوامل مثل جودة التسجيل، والضوضاء الخلفية، ومستوى الميكروفون، ولهجة المتحدث، والمصطلحات الخاصة بالقطاع.
ولهذا السبب، ينبغي اختبار حالات الاستخدام المؤسسية باستخدام تسجيلات حقيقية تمثل لغات وظروفًا صوتية مختلفة.
تتيح ميزة speaker diarization تحديد من يتحدث ومتى يتحدث داخل التسجيل. ويستطيع النظام التمييز بين الأصوات المختلفة ووضع تسميات على أجزاء النص وفقًا لكل متحدث.
على سبيل المثال، يمكن تنظيم محادثة مع عميل بالشكل التالي:
العميل: أود معرفة موعد تسليم طلبي.
الموظف: هل يمكنك مشاركة رقم الطلب؟
العميل: بالتأكيد، رقم طلبي هو 87432.
لا تجعل هذه البنية قراءة النص أكثر سهولة فحسب، بل تتيح أيضًا تحليل جمل العميل والموظف بشكل منفصل. وبذلك يمكن قياس مشكلات العملاء، وجودة ردود الموظفين، ومدة الحديث، أو معدل استخدام تعبيرات محددة.
تربط word-level timestamps الكلمات الموجودة في النص بمواضعها داخل الملف الصوتي. ويمكن استخدام هذه الميزة في إنشاء الترجمة النصية، وتحرير الفيديو، والبحث داخل المحادثات، وإنشاء مقاطع وسائط تلقائيًا.
يستطيع فريق بودكاست استخدام الطوابع الزمنية للعثور على الثانية المحددة التي تمت فيها مناقشة موضوع معين داخل حلقة طويلة. كما يستطيع فريق social media اختيار جملة مهمة وتحويل ذلك الجزء إلى محتوى فيديو قصير.
يمكن لـ Scribe أيضًا تحديد بعض الأحداث الصوتية التي تقع خارج الكلام. ويمكن وسم الضحك، والتصفيق، أو الأصوات الأخرى ذات المعنى داخل النص. وتوفر هذه الميزة مخرجات أكثر ثراءً، خاصة في المحتوى الإعلامي، وأبحاث المستخدمين، والمقابلات التي يكون فيها السياق العاطفي مهمًا.
فعلى سبيل المثال، قد لا يكون الاكتفاء بكتابة جملة «لقد أعجبتني هذه الميزة حقًا» كافيًا. فقد يؤثر قول الجملة مع الضحك، أو التردد، أو تغيّر معين في نبرة الصوت على معنى التعليق.
تتيح ميزة keyterm prompting للنموذج إعطاء الأولوية لكلمات وتعبيرات محددة. ووفقًا لدليل منتجات ElevenLabs، يمكن للمستخدمين إضافة قوائم من الكلمات والعبارات لتوجيه النموذج نحو المصطلحات غير الشائعة، مثل أسماء الأشخاص، وأسماء العلامات التجارية، والمصطلحات التقنية.
تُعد هذه الميزة مهمة في المجالات التالية:
على سبيل المثال، يمكن لشركة تقنية إضافة اسم منتج معين إلى قائمة keyterms لمنع الخلط بينه وبين كلمة شائعة. ويساعد ذلك على تقليل الحاجة إلى التصحيح اليدوي بعد عملية النسخ.
بينما يمكن استخدام Scribe v2 لمعالجة ملفات الصوت والفيديو المسجلة مسبقًا، يركز Scribe v2 Realtime على تحويل تدفقات الصوت المباشرة إلى نص بشكل فوري.
وفقًا لصفحات منتجات ونماذج ElevenLabs الحالية، يعمل Scribe v2 Realtime بأكثر من 90 لغة ويستهدف زمن استجابة منخفضًا يبلغ نحو 150 مللي ثانية. ويمكن للنظام استقبال مقاطع صوتية باستمرار عبر WebSocket، وإرسال نتائج نسخ مؤقتة ونهائية أثناء استمرار المتحدث في الكلام.
يمكن استخدام Speech to Text في الوقت الفعلي في التطبيقات التالية:
على سبيل المثال، عندما يتحدث عميل مع voice agent، يقوم Scribe v2 Realtime بتحويل الصوت إلى نص. ويحلل التطبيق هذا النص لتحديد طلب العميل، وتشغيل workflow المطلوب، ثم إنشاء رد صوتي باستخدام تقنية Text to Speech.
لا يعتمد زمن الاستجابة في هذه العملية على نموذج Speech to Text وحده. إذ تؤثر أيضًا جودة اتصال الشبكة، وحجم حزم الصوت، وموقع خادم التطبيق، ونماذج AI الأخرى المستخدمة، وبنية التكامل على زمن الاستجابة الإجمالي. ولهذا السبب، ينبغي إجراء اختبارات latency (زمن الاستجابة) من البداية إلى النهاية في المشاريع التي تعمل في الوقت الفعلي.
قد يضطر مديرو المشاريع وقادة الفرق إلى الاختيار بين تدوين الملاحظات والتركيز على المحادثة أثناء الاجتماع. يقوم Speech to Text بتحويل تسجيل الاجتماع إلى نص، مما يسهّل استخراج القرارات، والإجراءات، والمسؤوليات.
يمكن إنشاء workflow نموذجي بالشكل التالي:
يتيح هذا النهج للفرق ليس فقط إنتاج النصوص، بل أيضًا تحويل المحادثات إلى مهام قابلة للتنفيذ.
تمثل محادثات العملاء مصدرًا مهمًا من first-party data (بيانات الطرف الأول) للشركات. ومع ذلك، فإن الاستماع يدويًا إلى مئات أو آلاف المكالمات ليس عملية مستدامة.
يمكن تحويل المكالمات إلى نص باستخدام ElevenLabs Speech to Text وتحليل الموضوعات التالية:
على سبيل المثال، يمكن لشركة تجارة إلكترونية نسخ تسجيلات المكالمات الأسبوعية ووضع تسميات تلقائية على المحادثات المتعلقة بتأخيرات التسليم. وعندما تتم مشاركة هذه النتائج مع فريق العمليات، يصبح من الممكن اكتشاف المشكلات المرتبطة بمنطقة معينة، أو شركة شحن محددة، أو فئة منتجات بعينها بشكل مبكر.
عندما تنشر فرق التسويق Webinar في صورة فيديو فقط، فقد تحد من القيمة التي يمكن تحقيقها من المحتوى. وبعد تحويل محادثة الـ Webinar إلى نص باستخدام Speech to Text، يمكن إنشاء المحتويات التالية:
وبهذه الطريقة، يمكن تحويل تسجيل واحد إلى عدد كبير من أصول المحتوى التي يمكن استخدامها عبر قنوات مختلفة. وتساعد الطوابع الزمنية على مستوى الكلمات في العثور على أجزاء الفيديو المطلوبة بسرعة أكبر.
تحصل فرق المنتجات والباحثون والمتخصصون في التسويق على insights مهمة من مقابلات العملاء. ومع ذلك، قد يستغرق نسخ هذه المقابلات وترميزها يدويًا عدة أسابيع.
بعد تحويل المقابلات إلى نص باستخدام Speech to Text، تستطيع الفرق تحليل المشكلات المتكررة، والتعبيرات المستخدمة، ودوافع الشراء، وتوقعات المنتجات. وتتيح ميزة speaker diarization فصل أسئلة مدير المقابلة عن إجابات المشارك.
يُعد توفير ترجمة نصية للمستخدمين الذين يعانون من ضعف السمع أحد المكونات المهمة لإمكانية الوصول الرقمي. ويمكن لـ Speech to Text دعم إنشاء الترجمة النصية تلقائيًا لمقاطع الفيديو وعمليات البث المباشر.
ومع ذلك، يجب مراجعة الترجمة النصية التي يتم إنشاؤها تلقائيًا بواسطة شخص قبل النشر، خاصة في المحتوى القانوني، أو الطبي، أو المالي، أو المحتوى الذي قد يؤثر في السمعة.
تتيح ElevenLabs API دمج إمكانات Speech to Text داخل تطبيقات الويب، وتطبيقات الهاتف المحمول، وأنظمة المكالمات، وعمليات معالجة البيانات.
تتمثل الخطوة الأولى في إنشاء مفتاح API من خلال حساب ElevenLabs. ويجب عدم إضافة مفتاح API مباشرةً إلى كود frontend أو إلى مستودع عام. بل ينبغي تخزينه داخل environment variable (متغير بيئة) على جانب الخادم أو داخل نظام آمن لإدارة secrets.
يرسل التطبيق ملف الصوت أو الفيديو المطلوب نسخه إلى endpoint الخاص بـ Speech to Text. ويمكن أثناء الطلب تحديد النموذج، واللغة، وspeaker diarization، أو خيارات المعالجة الأخرى.
تكون البنية الأساسية للمعالجة المعتمدة على الملفات كما يلي:
import osfrom elevenlabs.client import ElevenLabsclient = ElevenLabs( api_key=os.environ["ELEVENLABS_API_KEY"])with open("meeting-recording.mp3", "rb") as audio_file: transcript = client.speech_to_text.convert( file=audio_file, model_id="scribe_v2" )print(transcript)نظرًا لأن إصدارات SDK وأسماء المعلمات قد تتغير بمرور الوقت، ينبغي مراجعة أحدث وثائق ElevenLabs API قبل نقل الكود إلى بيئة الإنتاج.
يمكن عرض نتيجة النسخ مباشرةً للمستخدم أو معالجتها لاستخدامها داخل أنظمة أخرى. على سبيل المثال، يمكن أن تكون المخرجات:
يتم استخدام اتصال WebSocket للنسخ المباشر. ويرسل العميل أو الخادم الصوت إلى ElevenLabs في صورة مقاطع صغيرة، ويتلقى نتائج النسخ بشكل فوري عبر الاتصال.
لأسباب أمنية، يجب عدم نقل مفتاح API دائم إلى المتصفح. وفي مشاريع client-side streaming، يجب التخطيط للمصادقة الآمنة، وآليات الوصول المؤقت، وسياسات نقل البيانات منذ بداية تصميم البنية.
لا يعتمد نجاح مشروع Speech to Text على اختيار النموذج فقط. بل يجب النظر إلى تدفق البيانات، والأمان، والتكامل، وتجربة المستخدم، وخطة القياس معًا.
لا يمثل «تحويل الصوت إلى نص» هدفًا واضحًا بما يكفي بمفرده. ويجب على الشركة أولًا الإجابة عن السؤال التالي:
ما القرار التجاري أو الإجراء الذي سيتم اتخاذه بعد إنشاء النص؟
على سبيل المثال، إذا كان الهدف هو تحليل محادثات العملاء، فيجب تحديد الفئات التي سيتم قياسها. أما إذا كان الهدف هو إنشاء ملاحظات الاجتماعات، فيجب التخطيط للنظام الذي سيتم نقل القرارات والمهام إليه.
غالبًا لا تمثل تسجيلات العروض التوضيحية الظروف التشغيلية الحقيقية. وينبغي أن تتضمن مجموعة بيانات المشروع التجريبي متحدثين مختلفين، ولهجات متعددة، وأنواعًا مختلفة من الميكروفونات، وضوضاء خلفية متنوعة، ومدد محادثات مختلفة.
كما يجب ألا يقتصر التقييم على الدقة العامة فقط. بل ينبغي فحص أسماء المنتجات، والأرقام، والتواريخ، وعناوين البريد الإلكتروني، والمصطلحات المهمة الخاصة بالقطاع بصورة منفصلة.
يمكن قياس نجاح المشروع من خلال المؤشرات التالية:
قد تحتوي التسجيلات الصوتية على بيانات شخصية، أو أسرار تجارية، أو معلومات حساسة تخص العملاء. ولهذا السبب، ينبغي تحديد البيانات التي سيتم إرسالها، والمكان الذي سيتم تخزينها فيه، والأشخاص الذين سيتمكنون من الوصول إليها، والمدة التي سيتم الاحتفاظ بها خلالها.
في المشاريع المؤسسية، ينبغي تقييم ضوابط الوصول، والتشفير، والتسجيل، وإخفاء البيانات الشخصية، وإجراءات الحذف، واللوائح الإقليمية معًا. توفر ElevenLabs خيارات API ومنصة مخصصة للمؤسسات، إلا أنه ينبغي أيضًا مراجعة البنية المستخدمة وفقًا للمتطلبات القانونية والتقنية للمؤسسة.
على الرغم من أن ElevenLabs توفر نماذج Speech to Text قوية، فإن تحقيق قيمة تجارية من هذه النماذج يتطلب إنشاء حالة الاستخدام الصحيحة، وتدفق البيانات المناسب، وبنية التكامل المطلوبة.
تساعد Omtera، بصفتها شريكًا استراتيجيًا لـ ElevenLabs، الشركات على التعامل مع استثمارات AI audio باعتبارها مشروع تحول قابلًا للقياس، وليس مجرد شراء أداة. ويمكن أن يشمل نهج Omtera لخدمات ElevenLabs مراحل الاكتشاف، وتصميم الحل، والتنفيذ، وتكامل API، والحوكمة، والتوسع.
تشمل المجالات الرئيسية التي يمكن أن تساهم فيها Omtera ما يلي:
على سبيل المثال، قد لا يكون تحويل الصوت إلى نص وحده كافيًا في مشروع مركز اتصال. فقد يلزم فصل النصوص بين العميل والموظف، وإخفاء المعلومات الشخصية، وتصنيف موضوعات المحادثات، وكتابة النتائج داخل CRM، وعرض الأداء في quality dashboard.
تدعم Omtera وضع قدرات ElevenLabs داخل workflow متكامل من البداية إلى النهاية، مما يساعد على جعل التقنية قابلة للاستخدام في العمليات اليومية.
يمكن أن تؤثر جودة الميكروفون الضعيفة، والضوضاء الخلفية المرتفعة، وتحدث عدة أشخاص في الوقت نفسه على دقة النسخ. وعند الإمكان، ينبغي توحيد مستويات الصوت واستخدام قناة منفصلة لكل متحدث.
ينبغي استخدام keyterm prompting في التسجيلات التي تتضمن أسماء علامات تجارية، أو منتجات، أو أشخاص، أو مصطلحات تقنية. ويساعد ذلك على تقليل الأخطاء في كتابة الكلمات المهمة.
على الرغم من أن أنظمة Speech to Text يمكن أن توفر دقة مرتفعة، فلا ينبغي اعتبار نتائجها خالية من الأخطاء. ويجب مراجعة السجلات القانونية، والمحتوى الصحي، والمعلومات المالية، أو الترجمة النصية المتاحة للجمهور من قِبل شخص قبل النشر.
عند حساب التكلفة الإجمالية للملكية، ينبغي على الشركات مراعاة تكاليف تخزين البيانات، وتطوير التكامل، وmonitoring، والأمان، والمراجعة البشرية، والصيانة، إلى جانب تكلفة استخدام النسخ. ونظرًا لإمكانية تغير أسعار ElevenLabs بمرور الوقت، ينبغي التحقق من الأسعار الحالية عبر الصفحات الرسمية أثناء التخطيط للمشروع.
يتيح ElevenLabs Speech to Text للشركات تحويل تسجيلات الصوت والفيديو إلى بيانات قابلة للبحث والقياس والربط بعمليات الأتمتة. ويوفر مجموعة واسعة من حالات الاستخدام، بداية من ملاحظات الاجتماعات وتحليل مراكز الاتصال، وصولًا إلى الترجمة النصية للفيديو وتطبيقات voice agent في الوقت الفعلي.
ومع ذلك، لا يكفي اختيار النموذج المناسب وحده لإنجاح التنفيذ. بل ينبغي التخطيط لجودة الصوت، والمصطلحات المتخصصة، وبنية التكامل، وسياسات الأمان، والمراجعة البشرية، ومؤشرات النجاح معًا. ويمكن للشراكة الاستراتيجية بين Omtera وElevenLabs، إلى جانب خبرة Omtera في التنفيذ، أن تساعد الشركات على تحويل تقنية Speech to Text من مشروع تجريبي محدود إلى حل مؤسسي قابل للتوسع.
هل أنتم مستعدون لدمج ElevenLabs Speech to Text في عمليات أعمالكم؟ خططوا لاجتماع قصير مع Omtera واتخذوا الخطوة الأولى في مشروع ElevenLabs اليوم.
ما هو ElevenLabs Speech to Text؟
ElevenLabs Speech to Text هو حل للتعرّف على الكلام يعتمد على AI، ويحوّل المحادثات الموجودة في تسجيلات الصوت والفيديو إلى نص مكتوب. توفر نماذج Scribe ميزات مثل النسخ متعدد اللغات، وspeaker diarization، والطوابع الزمنية على مستوى الكلمات.
كم عدد اللغات التي يدعمها ElevenLabs Scribe؟
وفقًا لوثائق ElevenLabs الحالية، يدعم Scribe v2 وScribe v2 Realtime التعرّف على الكلام بأكثر من 90 لغة. وينبغي اختبار مستوى الدعم والأداء وفقًا لحالة الاستخدام.
هل يستطيع ElevenLabs تحويل التسجيلات الصوتية التركية إلى نص؟
نعم. اللغة التركية من بين اللغات التي يدعمها ElevenLabs Speech to Text. وقد تتأثر جودة النتائج بالتسجيل الصوتي، واللهجة، والضوضاء الخلفية، والمصطلحات المتخصصة المستخدمة.
هل يستطيع ElevenLabs نسخ المحادثات المباشرة؟
نعم. تم تصميم Scribe v2 Realtime لتحويل تدفقات الصوت المباشرة إلى نص بزمن استجابة منخفض من خلال API يعتمد على WebSocket.
هل يستطيع ElevenLabs التمييز بين المتحدثين المختلفين؟
نعم. تساعد ميزة speaker diarization على تحديد المتحدثين المختلفين داخل التسجيل، وعرض أجزاء النص مع تسميات خاصة بكل متحدث.
هل يمكن استخدام ElevenLabs لإعداد الترجمة النصية لمقاطع الفيديو؟
نعم. يمكن تحويل الكلام الموجود داخل ملف الفيديو إلى نص، ويمكن استخدام الطوابع الزمنية لإعداد subtitles أو captions. ويوصى بإجراء مراجعة جودة يدوية قبل النشر للمحتوى المتاح للجمهور.
ما الفرق بين Speech to Text وText to Speech؟
يقوم Speech to Text بتحويل الكلام المنطوق إلى نص مكتوب. أما Text to Speech فيحوّل النص المكتوب إلى صوت يتم إنشاؤه بواسطة الذكاء الاصطناعي. وعند استخدام التقنيتين معًا، يمكن إنشاء voice agents وتطبيقات محادثة.
هل يمكن دمج ElevenLabs Speech to Text عبر API؟
نعم. يمكن استخدام HTTP API للنسخ المعتمد على الملفات، بينما يمكن استخدام WebSocket API للنسخ في الوقت الفعلي. وأثناء التكامل، ينبغي تخزين مفتاح API بصورة آمنة، والتخطيط لسياسات معالجة البيانات الشخصية.
كيف تدعم Omtera تنفيذ ElevenLabs؟
يمكن لـ Omtera دعم الشركات في تحليل حالات الاستخدام، وتصميم المشاريع التجريبية، وتكامل API، وإنشاء تدفقات البيانات، والتخطيط للأمان، واختبارات الجودة، وعمليات التوسع.
.webp)

