جوجل تطلق Gemini 3.5 Transcribe لتحويل الصوت إلى نص لحظيًا مع مزايا قوية!
وضعان مختلفان لتحويل الصوت إلى نص
أعلنت جوجل عن نموذجها الجديد Gemini 3.5 Transcribe، والمخصص لتحويل الكلام إلى نص بدقة عالية، سواء من الصوت المباشر في الوقت الفعلي أو من التسجيلات الصوتية المحفوظة مسبقًا.
ويركز النموذج الجديد على التعامل بصورة أفضل مع ضوضاء الخلفية، والمصطلحات المتخصصة، واللهجات المختلفة، وطريقة الكلام الطبيعية، مع القدرة على تنظيم النص الناتج تلقائيًا وإزالة الكلمات الزائدة، ودعم أكثر من 85 لغة.
وتستهدف جوجل بالنموذج استخدامات متعددة، تشمل الترجمة النصية المباشرة، والمساعدات الصوتية، وتفريغ الاجتماعات والمكالمات، وتحليل المحادثات بعد انتهائها.
وضعان مختلفان لتحويل الصوت إلى نص
توفر جوجل Gemini 3.5 Transcribe من خلال وضعين رئيسيين، بحسب نوع الاستخدام.
النسخ الفوري في الوقت الحقيقي
يدعم النموذج تحويل الصوت إلى نص أثناء الحديث مباشرة، مع زمن استجابة يقل عن ثانية في الظروف المناسبة.
ويتوفر هذا الوضع من خلال Gemini Live API باستخدام نموذج gemini-3.5-transcribe-live، ما يجعله مناسبًا للتطبيقات التي تحتاج إلى التعامل مع الكلام لحظة بلحظة، مثل المساعدات الصوتية وخدمات الترجمة النصية المباشرة.
تفريغ التسجيلات الصوتية
أما الوضع الثاني فيتعامل مع الملفات المسجلة مسبقًا، مثل الاجتماعات والمكالمات والتسجيلات الطويلة.
ويتوفر عبر Interactions API باستخدام gemini-3.5-transcribe، مع إمكانية تحديد المتحدثين وإضافة طوابع زمنية على مستوى الكلمات.
دعم أكثر من 85 لغة ولهجات مختلفة
من أبرز نقاط قوة Gemini 3.5 Transcribe قدرته على اكتشاف اللغة تلقائيًا ونسخ أكثر من 85 لغة.
ولا يقتصر الدعم على اللغات الرئيسية فقط، إذ صُمم النموذج أيضًا للتعامل مع الاختلافات الإقليمية واللهجات المتنوعة، وهو ما يجعله مناسبًا للتطبيقات العالمية وخدمات العملاء متعددة اللغات.
فهم الكلام الطبيعي والتصحيح الذاتي
لا يتعامل النموذج مع كل كلمة باعتبارها نصًا منفصلًا فقط، بل يحاول فهم طريقة الحديث الطبيعية وسياق الكلام.
فعندما يتوقف المتحدث لتصحيح نفسه أثناء الجملة، يستطيع Gemini 3.5 Transcribe التعامل مع هذا التصحيح وإنتاج نص نهائي أكثر وضوحًا.
كما يمكنه فهم نية المتحدث بشكل أفضل بدلًا من الاكتفاء بنسخ الصوت حرفيًا.
إزالة كلمات التردد تلقائيًا
يستطيع النموذج حذف الكلمات والأصوات غير الضرورية التي تظهر عادة أثناء الكلام، مثل أصوات التردد من نوع “أمم” و”آه”.
والنتيجة هي نص أكثر ترتيبًا وقابلية للقراءة، بدلًا من نسخة حرفية مليئة بالتوقفات والكلمات الزائدة.
ويقوم النموذج كذلك بتنسيق النص الناتج تلقائيًا.
دعم المفردات والمصطلحات المتخصصة
يتيح Gemini 3.5 Transcribe للمطورين تعريف مفردات مخصصة للنموذج.
ويمكن استخدام هذه الإمكانية لمساعدته على التعرف بدقة أكبر على المصطلحات الطبية أو التقنية أو التجارية، إلى جانب أسماء المنتجات والأسماء ذات طرق الكتابة غير التقليدية.
وتجعل هذه الميزة النموذج أكثر ملاءمة للقطاعات المتخصصة التي قد تواجه فيها أنظمة تحويل الصوت التقليدية صعوبة في فهم المصطلحات.
التعرف على المتحدثين داخل التسجيل
يدعم النموذج التمييز بين عدة أشخاص داخل التسجيلات الصوتية.
وبحسب المعلومات المنشورة، يمكنه حاليًا تحديد الكلام ونسبه إلى ما يصل إلى ثلاثة متحدثين مع إضافة التوقيتات المناسبة.
أما دعم أكثر من ثلاثة متحدثين فلا يزال في مرحلة تجريبية.
وهذه الخاصية يمكن أن تكون مفيدة بصورة خاصة في الاجتماعات والمقابلات والمكالمات الجماعية.
التعرف على الأرقام والرموز وسط الضوضاء
تقول البيانات المنشورة إن Gemini 3.5 Transcribe قادر أيضًا على التعامل مع المعلومات الأبجدية الرقمية مثل:
- الرموز البريدية.
- أرقام الطلبات.
- المعرفات التي تجمع بين الحروف والأرقام.
ويستطيع التعرف عليها حتى في بعض البيئات الواقعية التي تحتوي على ضوضاء في الخلفية.
دقة أعلى وزمن استجابة أقل
بحسب قياسات Artificial Analysis، سجل النموذج معدل خطأ كلمات WER يبلغ في المتوسط:
- 4.0% في وضع البث المباشر.
- 2.6% مع الصوت غير المباشر أو المسجل مسبقًا.
وكلما انخفض معدل WER كان أداء نظام التعرف على الكلام أفضل.
كما تشير القياسات إلى تحسن بنحو 70% في الوقت اللازم للوصول إلى النص النهائي مقارنة بنموذج جوجل السابق Chirp 3.
وفي اختبار FLEURS عبر مجموعة من اللغات والمناطق، سجل النموذج معدل خطأ قدره 5.50% في البث المباشر و5.04% في الاستخدام غير المباشر.
Gemini 3.5 Transcribe يصل إلى Gboard
بدأت جوجل بالفعل استخدام النموذج داخل بعض منتجاتها.
فعلى هواتف أندرويد، تعتمد ميزة Rambler في Gboard على Gemini 3.5 Transcribe لتحويل الأفكار المنطوقة إلى نص منظم.
ولا تقوم الميزة فقط بكتابة ما يقوله المستخدم، بل يمكنها أيضًا إزالة الكلمات الزائدة وتنظيم النص بصورة أكثر طبيعية.
ويستطيع المستخدم إعطاء أوامر صوتية لإجراء تعديلات على النص، مثل تصحيح الأخطاء الإملائية أو تغيير أسلوب الكتابة.
استخدام السياق لتحسين دقة الكتابة
في Google Antigravity، يستطيع النموذج – بعد الحصول على إذن المستخدم – الاستفادة من سياق الشاشة وسجل المحادثة.
ويمكن لهذا السياق مساعدته على التعرف بصورة أفضل على أسماء الملفات والمستندات النشطة والمصطلحات المرتبطة بما يعمل عليه المستخدم.
Gemini على macOS يحصل على إمكانات متقدمة
يُستخدم Gemini 3.5 Transcribe كذلك داخل تطبيق Gemini على نظام macOS.
ويستطيع التطبيق تحويل الكلام الطبيعي إلى نص منظم، إلى جانب تنفيذ أوامر صوتية تستفيد من محتويات الشاشة.
كما يمكن للنموذج استدعاء نماذج Gemini أخرى لتنفيذ مهام إضافية، مثل:
- تلخيص الملفات المحلية.
- إعادة صياغة النصوص واستخدامها بين التطبيقات.
- تحليل الملفات.
- إنشاء الصور في موضع المؤشر.
دعم Chrome قادم قريبًا
تعمل جوجل أيضًا على إدخال التقنية إلى متصفح Chrome.
ومن المخطط أن تسمح الميزة للمستخدم بالتحدث مباشرة لملء حقول النص الموجودة على صفحات الويب، بما يشمل الردود والمنشورات والمطالبات الموجهة إلى أدوات الذكاء الاصطناعي.
لكن دعم Chrome لم يصبح متاحًا على نطاق واسع حتى الآن.
Function Calling لتنفيذ مهام خارج النسخ الصوتي
يدعم Gemini 3.5 Transcribe أيضًا ميزة Function Calling، التي تسمح له بتفويض بعض المهام إلى نماذج Gemini أخرى.
فعلى سبيل المثال، قد يتمكن النظام من تحويل كلام المستخدم إلى نص، ثم استخدام نموذج آخر لتحليل ملف أو إنشاء صورة بناءً على الطلب.
وتتوفر بعض هذه الإمكانات حاليًا داخل تطبيق Gemini على macOS.
منصات المطورين تبدأ باستخدام Gemini Live API
بدأ عدد من منصات وتقنيات تطوير التطبيقات الصوتية باستخدام Gemini Live API لإنشاء واجهات تعتمد على الصوت، ومن بينها:
- Agora.
- Fishjam.
- LangChain.
- LiveKit.
- Pipecat.
- Vercel.
- Vision Agents.
وتتولى هذه المنصات إدارة البنية التحتية اللازمة لنقل الصوت في الوقت الحقيقي داخل التطبيقات المختلفة.
أين يتوفر Gemini 3.5 Transcribe؟
يتوفر Gemini 3.5 Transcribe حاليًا في مرحلة المعاينة العامة للمطورين والشركات.
للمطورين
يمكن الوصول إليه عبر:
- Gemini API.
- Google AI Studio.
- Google Antigravity.
للشركات
يتوفر من خلال Gemini Enterprise Agent Platform، بينما تخطط جوجل لإتاحته أيضًا ضمن Gemini Enterprise for Customer Experience.
للمستخدمين العاديين
لا يزال التوفر محدودًا حسب المنتج والدولة واللغة.
ويتاح حاليًا داخل تطبيق Gemini على macOS باللغة الإنجليزية، بالإضافة إلى ميزة Rambler على أندرويد في عدد محدد من الدول واللغات، فيما تخطط جوجل لدعم Chrome لاحقًا.
خطوة جديدة نحو الكتابة بالصوت بصورة طبيعية
يعكس Gemini 3.5 Transcribe توجه جوجل نحو جعل الصوت وسيلة إدخال أكثر ذكاءً من الإملاء التقليدي.
فالنموذج لا يكتفي بتحويل الكلمات المنطوقة إلى نص، بل يستطيع إزالة الترددات، وفهم التصحيحات أثناء الحديث، والتعامل مع مفردات مخصصة، وفصل المتحدثين، وتنظيم النص، والاستفادة من السياق في بعض منتجات جوجل.
ومع دعم أكثر من 85 لغة وزمن استجابة منخفض وتحسن واضح في سرعة الوصول إلى النص النهائي، يمكن أن تصبح التقنية أساسًا لمجموعة واسعة من تطبيقات المساعدات الصوتية، والاجتماعات، وخدمات العملاء، والكتابة بالصوت خلال الفترة المقبلة.




