
بصفتها شريكًا استراتيجيًا لـ ElevenLabs، تساعد Omtera، الشركات على تجاوز مرحلة التجربة في تقنيات الصوت المدعومة بالذكاء الاصطناعي ودمجها في عمليات الأعمال الفعلية، وتجارب العملاء، وعمليات إنتاج المحتوى. وتُعد Voice Design واحدة من أكثر الميزات إبداعًا ضمن منظومة ElevenLabs، إذ تتيح لكم إنشاء صوت AI جديد بالكامل من الصفر بمجرد وصف شكل الصوت الذي تريدونه، من دون نسخ صوت إنسان موجود مسبقًا.
تخيّلوا أنكم تحتاجون إلى راوٍ دافئ وموثوق لعلامتكم التجارية، أو مساعد رقمي نشِط لتطبيق الهاتف المحمول، أو صوت هادئ وسهل الفهم لمحتوى التدريب. عندما لا تجدون الصوت المطلوب داخل Voice Library الجاهزة، يمكنكم بدلًا من قضاء ساعات في البحث بين تسجيلات مختلفة وصف خصائص الصوت الذي تريدونه من خلال prompt.
تم تطوير Voice Design تحديدًا لحل هذه المشكلة.
ElevenLabs Voice Design هي ميزة من ElevenLabs تتيح للمستخدمين إنشاء صوت اصطناعي فريد عبر كتابة text prompt (أمر نصي). وبدلًا من اختيار أحد الأصوات الموجودة مسبقًا في Voice Library، يمكنكم إنشاء voice جديد من خلال وصف خصائص مثل العمر، واللكنة، والنبرة، والسرعة، والعاطفة، وأسلوب الحديث باستخدام اللغة الطبيعية.
على سبيل المثال، يمكنكم تعريف الصوت بهذه الطريقة:
"صوت نسائي دافئ وموثوق لامرأة في أواخر الثلاثينيات. بلكنة بريطانية خفيفة، وسرعة حديث متوسطة، ونبرة طبيعية واحترافية. يجب أن يكون واضحًا وهادئًا لفيديوهات التدريب المؤسسي."
يقوم Voice Design بتحليل هذا الوصف وإنشاء بدائل صوتية مختلفة تتوافق مع المواصفات التي حددتموها.
في تجربة ElevenLabs Voice Design الحالية، يتم إنشاء ثلاثة voice previews مختلفة مع كل عملية generation. ويمكن للمستخدم الاستماع إلى هذه البدائل، واختيار الأنسب، ثم حفظه داخل مجموعة الأصوات في حساب ElevenLabs.
تُعد هذه المقاربة مهمة بشكل خاص للفرق التي ترغب في إنشاء هوية صوتية جديدة تتوافق مع شخصية علامة تجارية محددة أو حالة استخدام معينة، بدلًا من الاكتفاء باستخدام أحد الأصوات الجاهزة.
يمكن تقسيم آلية عمل Voice Design بشكل أساسي إلى ثلاث مراحل: تعريف الصوت، وإنشاء العينات، وحفظ الصوت الأنسب.
في المرحلة الأولى، يجب تحديد الغرض الذي سيُستخدم فيه الصوت.
على سبيل المثال:
يؤثر الغرض من استخدام الصوت بشكل مباشر في التفاصيل التي يجب إعطاؤها الأولوية داخل prompt.
ففي حين يحتاج customer support agent إلى صوت موثوق، وواضح، ومتزن، قد تتطلب شخصية في لعبة نبرة درامية أو غير اعتيادية أو مبالغًا فيها.
المدخل الأساسي في Voice Design هو voice prompt.
وفقًا لوثائق ElevenLabs، يمكن تعريف خصائص مثل العمر، وgender، وaccent، وtone، وpacing، وemotion، وspeaking style، وaudio quality داخل prompt. وغالبًا ما تساعد الأوصاف الأكثر تفصيلًا النموذج على تفسير الصوت المطلوب بصورة أدق.
يمكن أن يتضمن Voice Design prompt الجيد العناصر التالية:
العمر: شاب، متوسط العمر، مسن، وغيرها.
شخصية الصوت: دافئ، قوي، ناعم، سلطوي، نشِط.
Accent: neutral American، British، French، Turkish accent، وغيرها.
السرعة: سريعة، بطيئة، measured أو conversational.
العاطفة: هادئة، متحمسة، موثوقة، ودودة.
حالة الاستخدام: audiobook، إعلان، AI agent أو فيديو مؤسسي.
Audio quality: جودة استوديو نظيفة أو تأثيرات إبداعية محددة.
توضح ElevenLabs أن Voice Design v3 يسمح أيضًا بتحديد عناصر مثل audio quality من خلال prompt.
عند استخدام Voice Design، يمكن كتابة وصف عام جدًا مثل “professional male voice”. ولكن إضافة السياق قد تكون نقطة انطلاق أفضل للحصول على نتائج أكثر تحكمًا.
على سبيل المثال، يمكن استخدام prompt التالي لفيديوهات تقديم المنتجات الخاصة بشركة SaaS:
Voice Design prompt:
Perfect audio quality. A confident male speaker in his late 30s with a neutral international English accent. Warm, professional and trustworthy tone. Medium speaking pace with clear pronunciation and subtle enthusiasm. Designed for enterprise SaaS product videos and executive presentations.
هنا لا يتعلم النموذج العمر ونوع الصوت فقط، بل يتعلم أيضًا أين سيُستخدم الصوت وما الانطباع الذي يجب أن يتركه لدى المستمع.
أما بالنسبة إلى AI agent لخدمة العملاء، فيمكن استخدام مقاربة مختلفة:
A friendly female voice in her early 30s. Calm, patient and reassuring personality. Neutral English accent, natural conversational pacing and clear pronunciation. The voice should sound professional but never robotic, suitable for customer support conversations.
تُعد هذه الأنواع من prompts مهمة بشكل خاص في مشاريع Conversational AI (الذكاء الاصطناعي الحواري)، لأن أحد الانطباعات الأولى التي يكوّنها العميل عن agent يأتي مباشرة من شخصية صوته.
ElevenLabs Voice Design ليست مجرد أداة لـ "إنشاء صوت ذكوري أو أنثوي". بل يمكن تعريف العديد من الأبعاد المختلفة التي تكوّن شخصية الصوت معًا.
يمكن تحديد الخصائص التي تجعل الصوت يبدو شابًا أو في منتصف العمر أو مسنًا داخل prompt.
على سبيل المثال:
“Energetic young adult voice”
أو
“Calm elderly storyteller with a warm, textured voice.”
يمكن للعلامات التجارية تحديد خصائص accent معينة عند إنتاج محتوى لأسواق مختلفة.
على سبيل المثال:
“Neutral American accent”
“Light French accent”
“British English speaker”
يمكن استخدامها.
توضح ElevenLabs أن Voice Design v3 يتضمن تحسينات لمعالجة تركيبات accent أكثر تفصيلًا وأوصاف صوتية أكثر دقة.
يمكن للنص نفسه أن يخلق تجربة مستخدم مختلفة تمامًا عند تقديمه بنبرات مختلفة.
فبينما قد يحتاج تطبيق مالي إلى صوت موثوق ومنضبط، قد تفضّل علامة تجارية في مجال الألعاب صوتًا نشِطًا ومسرحيًا.
داخل prompt يمكن استخدام أوصاف مثل:
يسمح Voice Design أيضًا بوصف pacing، أي سرعة وإيقاع الحديث، مباشرة داخل prompt.
على سبيل المثال:
“slow and reflective”
“fast-paced and energetic”
“measured professional delivery”
يمكن استخدامها.
قد يتم الخلط أحيانًا بين هاتين الميزتين.
تهدف Voice Design إلى إنشاء صوت اصطناعي جديد غير موجود مسبقًا. يصف المستخدم الصوت المطلوب باستخدام اللغة الطبيعية، ويقوم النظام بإنشاء بدائل صوتية جديدة.
أما Voice Cloning فهي عملية مختلفة تهدف إلى إعادة إنشاء صوت إنسان موجود بالفعل رقميًا بالاعتماد على خصائصه الصوتية المميزة.
لذلك، إذا كنتم تريدون إنشاء “brand voice” جديد بالكامل لشركتكم، فقد يكون Voice Design خيارًا مناسبًا. أما إذا كنتم تريدون استخدام صوت متحدث محدد ومصرّح به رقميًا، فإن Voice Cloning يخدم حالة استخدام مختلفة.
كما أن ElevenLabs لا تضع Professional Voice Clone وVoice Design باعتبارهما ميزتين يمكن استبدال إحداهما بالأخرى. وعلى وجه الخصوص، يخدم Professional Voice Clone غرضًا مختلفًا عندما تكون هناك حاجة إلى إعادة إنشاء صوت متحدث محدد ومرخص.
العملية بسيطة نسبيًا داخل تطبيق ElevenLabs على الويب.
داخل ElevenLabs:
Voices → My Voices → Add a new voice → Voice Design
يمكنكم اتباع هذا المسار.
بعد ذلك:
النقطة المهمة هنا هي اختبار الصوت الناتج في سيناريوهات مختلفة بدلًا من نقل أول نتيجة مباشرة إلى بيئة production.
نعم. لا يشترط استخدام Voice Design فقط عبر واجهة ElevenLabs على الويب.
توفر ElevenLabs دعم API لـ Voice Design. وفي workflow الرسمي للـAPI، يتم أولًا إنشاء voice previews انطلاقًا من prompt، ثم يتم استخدام generated voice ID المختار لحفظ الصوت واستخدامه في عمليات API أخرى.
وهذا يوفر ميزة مهمة، خصوصًا لفرق البرمجيات.
فعلى سبيل المثال، بدلًا من إنشاء صوت يدويًا لكل شخصية جديدة، يمكن لشركة ألعاب تطوير نظام يقوم تلقائيًا بإنشاء prompts استنادًا إلى parameters محددة لكل شخصية.
وبالمثل، يمكن لمنصة محتوى تصميم workflow مثل:
Content brief → Voice persona → Voice Design API → Voice selection → Text to Speech
في هذه المرحلة، يمكن لشريك استراتيجي متخصص في ElevenLabs مثل Omtera تحويل Voice Design من مجرد أداة محتوى مستقلة إلى جزء من voice AI architecture أوسع مرتبطة بالتطبيقات الحالية، وworkflows، والأنظمة المؤسسية.
إحدى أهم نقاط قوة Voice Design أنها لا تقتصر على قطاع واحد فقط.
كما تقوم العلامات التجارية بتوحيد الألوان، والخطوط، وdesign systems ضمن هويتها البصرية، يمكنها أيضًا توحيد هويتها الصوتية.
على سبيل المثال، يمكنكم إنشاء voice اصطناعي مخصص لشركتكم بالخصائص التالية:
وتُعد إمكانية استخدام custom voices لإنتاج المحتوى والحفاظ على اتساق العلامة التجارية ضمن ElevenCreative أيضًا من حالات الاستخدام التي تدعمها ElevenLabs.
يمكن لفرق Marketing استخدام Voice Design لإنشاء شخصيات صوتية مناسبة لمختلف الحملات والصيغ.
على سبيل المثال، يمكن للشركة نفسها استخدام:
صوت أكثر جدية في webinar مؤسسي،
صوت أكثر حيوية في فيديو Instagram،
صوت أكثر توضيحًا في product demo،
صوت أكثر دفئًا في customer story.
في أنظمة Conversational AI، لا تتشكل التجربة فقط بناءً على ما يقوله agent، بل أيضًا على كيفية قوله.
يمكن إنشاء صوت هادئ ومطمئن لـ customer support voice agent، بينما يمكن اختيار صوت أكثر حيوية مع الحفاظ على الطابع الاحترافي لـ sales agent.
في مواد التدريب الطويلة، من المهم أن يكون الصوت واضحًا، وغير مرهق، ومتسقًا.
باستخدام Voice Design، يمكن إنشاء narrator مصمم خصيصًا لمحتوى التدريب الخاص بالمؤسسة، بحيث يتم استخدام شخصية الصوت نفسها عبر modules مختلفة.
تضع ElevenLabs Voice Design v3 ضمن سيناريوهات إنشاء realistic voice وcharacter voice. ولذلك يمكن بسرعة prototyping أصوات مختلفة لشخصيات في مشاريع إبداعية تمتد من شخصيات الألعاب إلى القصص التفاعلية.
من الناحية التقنية، قد يستغرق إنشاء voice بضع دقائق فقط. لكن الحصول على "صوت جميل" وحده لا يكفي لصوت مؤسسي سيتم استخدامه في بيئة production.
قبل الانتقال إلى Voice Design، يجب الإجابة عن الأسئلة التالية:
كيف تتحدث علامتنا التجارية؟
من هو جمهورنا المستهدف؟
على أي قنوات سيتم استخدام voice؟
هل يجب أن يكون رسميًا أم ودودًا؟
نشِطًا أم هادئًا؟
بأي لغات سيتم استخدامه؟
كم دقيقة سيتفاعل المستخدم مع الصوت؟
إذا لم تتم الإجابة عن هذه الأسئلة قبل إنشاء الصوت، فقد تستمر الفرق في تجربة أصوات جديدة وتواجه مشكلات في standardization.
بدلًا من تقييم الصوت باستخدام جملة demo واحدة فقط، يجب اختباره في حالات استخدام حقيقية.
على سبيل المثال، إذا تم استخدام voice agent، فيجب اختبار أمثلة مختلفة مثل:
رسالة ترحيب،
شرح طويل،
سؤال،
رسالة اعتذار،
مصطلحات تقنية،
أرقام،
أسماء المنتجات.
إذا كانت voice التي يستخدمها فريق Marketing مختلفة تمامًا من حيث الشخصية عن voice التي يستخدمها فريق customer support، فقد تصبح تجربة العلامة التجارية مجزأة.
لذلك قد يكون من المفيد إنشاء AI voice guideline (دليل لصوت الذكاء الاصطناعي) على مستوى المؤسسة.
يمكن أن يتضمن هذا guideline عناصر مثل:
لا تقتصر قدرات ElevenLabs على voice generation فقط. فالمنصة تتيح إنشاء سيناريوهات تعتمد على توليد speech بالذكاء الاصطناعي، وConversational AI، وtranscription، وlocalization، وvoice intelligence القائمة على API.
لذلك، في المشروع المؤسسي، لا تأتي القيمة الحقيقية فقط من إنشاء صوت جديد، بل من استخدام هذا الصوت داخل business workflow المناسب.
بصفتها شريكًا استراتيجيًا لـ ElevenLabs، يمكن لـ Omtera دعم الشركات في مجالات مثل:
على سبيل المثال، يمكن لشركة إنشاء صوت مخصص لخدمة العملاء باستخدام Voice Design. لكن في سيناريو production حقيقي، يجب تصميم هذه voice بالتكامل مع Conversational AI agent، ومصادر المعرفة، وبيانات العملاء، وbusiness logic، وعمليات التحويل إلى موظف بشري عند الحاجة.
وهنا تحديدًا تظهر القيمة المؤسسية الحقيقية لتقنية ElevenLabs.
يتيح ElevenLabs Voice Design للشركات إنشاء أصوات AI تتوافق مع حالات استخدامها الخاصة دون التقيد بخيارات الأصوات الجاهزة. ويمكن تصميم أصوات جديدة باستخدام prompts بمستويات مختلفة من التفصيل، بدءًا من وصف بسيط من بضع كلمات وصولًا إلى voice persona مفصلة تشمل العمر، وaccent، وtone، وpacing، وemotion، والغرض من الاستخدام.
ومع ذلك، خصوصًا في المشاريع المؤسسية، لا ينبغي أن يقتصر الهدف على إنشاء voice مبهرة فقط. بل يجب أن تعمل voice الصحيحة مع المحتوى الصحيح، وworkflow الصحيح، وagent الصحيح، وAPI الصحيح، وbusiness system الصحيح. وبصفتها شريكًا استراتيجيًا لـ ElevenLabs، يمكن لـ Omtera المساعدة في تنفيذ هذه العملية باستخدام البنية المناسبة، بدءًا من Voice Design ووصولًا إلى تطبيقات Conversational AI وenterprise voice AI.
هل أنتم مستعدون لإنشاء تجربة AI voice واقعية وقابلة للتوسع؟ خططوا لجلسة سريعة مع Omtera وابدؤوا في تنفيذ حالة استخدام ElevenLabs الخاصة بكم اليوم.
ElevenLabs Voice Design هي ميزة تتيح للمستخدمين إنشاء صوت AI اصطناعي جديد من الصفر عبر كتابة text prompt. ويمكن تحديد خصائص مثل العمر، واللكنة، والنبرة، والسرعة، والعاطفة، وأسلوب الحديث.
داخل ElevenLabs، انتقلوا إلى Voices → My Voices → Add a new voice → Voice Design، ثم صفوا الصوت الذي تريدون إنشاءه، وحددوا نص preview، واختاروا من بين البدائل الصوتية التي يتم إنشاؤها.
في تجربة Voice Design الحالية، يتم إنشاء ثلاثة voice previews مختلفة في كل عملية generation. ويمكن للمستخدم اختيار البديل الذي يفضله وحفظه.
نعم. من خلال تحديد عمر الصوت، ونبرته، وaccent، وسرعة الحديث، وشخصيته، يمكن تصميم voice اصطناعية تتوافق مع أسلوب تواصل العلامة التجارية. كما تضع ElevenLabs استخدام custom voices ضمن حالات الاستخدام الخاصة بإنشاء brand voice متسقة.
لا. يقوم Voice Design بإنشاء voice اصطناعية جديدة، بينما يهدف Voice Cloning إلى إنشاء voice رقمية بالاعتماد على خصائص صوت إنسان موجود بالفعل.
نعم. باستخدام ElevenLabs Voice Design API، يمكنكم إنشاء voice previews من prompt، وحفظ generated voice ID المختار، ثم استخدامه لاحقًا في workflows أخرى ضمن ElevenLabs API.
يمكن استخدام Voice Design في marketing voiceovers، وaudiobooks، وpodcasts، وشخصيات الألعاب، وAI voice agents، ومحتوى التدريب، وأنظمة IVR، وbrand voices، ومختلف التجارب الرقمية.
.webp)

