الذكاء الاصطناعي ai

جيميناي يتيح الآن استنساخ صوتك وتحويل النصوص إلى أداء صوتي واقعي بهذه الطريقة!

جيميناي يستطيع الآن استنساخ صوتك وتحويل النصوص إلى أداء صوتي واقعي

أعلنت جوجل عن Gemini 3.8 Flash TTS وGemini 3.8 Flash-Lite TTS، وهما نموذجان جديدان لتحويل النص إلى صوت، يقدمان قدرات متقدمة لإنشاء أصوات واقعية والتحكم في طريقة أدائها، وصولًا إلى استنساخ صوت المستخدم من تسجيل قصير.

ولا تقتصر التقنية على قراءة النصوص، بل تسمح بتوجيه الأداء الصوتي بالتفصيل، بما يشمل النبرة والسرعة واللهجة والمشاعر والهمس والضحك والتنهدات والتوقفات الطبيعية.

استنساخ صوتك من 30 ثانية فقط

تتيح جوجل عبر Gemini 3.8 Flash TTS إنشاء نسخة متسقة من صوت المستخدم اعتمادًا على عينة صوتية مدتها 30 ثانية فقط، بشرط أن يكون الصوت للمستخدم نفسه أو يمتلك حقوق استخدامه.

كما يستطيع النموذج إنشاء صوت جديد بالكامل من وصف نصي، مع إمكانية تحديد الشخصية واللهجة وخصائص الصوت المطلوبة.

وتوفر جوجل كذلك مكتبة تضم أكثر من 2000 صوت جاهز للاستخدام الإنتاجي، مع دعم أكثر من 100 لغة ولهجة.

تحكم في الأداء مثل توجيه ممثل

الميزة الأبرز هي إمكانية توجيه طريقة إلقاء كل جملة على حدة. ويمكن للمستخدم تحديد النبرة والسرعة واللهجة، وإضافة مؤثرات طبيعية مثل الضحك والتنهد والهمس.

ويدعم Gemini أيضًا إنشاء محادثات بين متحدثين اثنين من نص واحد، مع الحفاظ على صوت مستقل لكل شخصية وطريقة طبيعية لتبادل الحوار.

وتقول قوقل إن النماذج تستطيع الحفاظ على جودة الصوت وخصائص الشخصية لساعات من المحتوى، ما يجعلها مناسبة للبودكاست والكتب الصوتية والدبلجة والألعاب والمحتوى المرئي.

نموذجان لاستخدامات مختلفة

يركز Gemini 3.8 Flash TTS على جودة الصوت والتحكم الإبداعي وتصميم الشخصيات، بينما صُمم Flash-Lite TTS للإنتاج واسع النطاق بتكلفة أقل، مثل الدبلجة والمساعدات الصوتية.

وبدأ النموذجان في الوصول إلى Google AI Studio وGemini API، فيما يتوفر Flash TTS للمستخدمين عبر Gemini Notebook، ويصل Flash-Lite TTS إلى Google Vids.

حماية من إساءة استخدام الأصوات

وضعت جوجل عدة إجراءات لحماية ميزة استنساخ الصوت، حيث يتعين تقديم تسجيل صوتي يثبت موافقة صاحب الصوت قبل إنشاء النسخة المستنسخة.

كما تضيف الشركة علامة SynthID غير المحسوسة إلى المقاطع الصوتية التي تنشئها نماذج Gemini Audio، للمساعدة في اكتشاف المحتوى المولد بالذكاء الاصطناعي.

وبهذه التطورات، تحاول جوجل تحويل تقنية تحويل النص إلى كلام من مجرد قراءة آلية إلى استوديو صوتي متكامل يمكنه تصميم الأصوات واستنساخها وتوجيه أدائها بشكل أكثر واقعية وتعبيرًا.

زر الذهاب إلى الأعلى