أعلنت غوغل عن إطلاق نموذج جديد مخصص لتحويل الكلام إلى نص، يحمل اسم Gemini 3.5 Transcribe، في خطوة جديدة لتعزيز قدرات الذكاء الاصطناعي في فهم المحتوى الصوتي ونسخه كتابيا.
وقالت الشركة إن النموذج الجديد سيحل محل Chirp 3، مع تقديم قدرات محسنة في استيعاب السياق والتعرف التلقائي على اللغة، مؤكدة أنه يعد الأكثر دقة ضمن نماذج النسخ الصوتي التي طورتها حتى الآن.
فهم أفضل للسياق واللغة
ولا يقتصر تطوير النموذج الجديد على مجرد تحويل الكلمات المنطوقة إلى نص، بل يراهن أيضا على فهم أفضل للسياق، وهو ما قد يساعد في تحسين دقة النسخ، خاصة في المحادثات والتسجيلات التي تتضمن تغيرات في الموضوع أو اللغة.
كما يتيح النموذج ميزة التعرف التلقائي على اللغة، ما يجعل عملية النسخ أكثر مرونة بالنسبة للمستخدمين الذين يتعاملون مع محتوى صوتي بلغات متعددة.
«Gemini 3.5 Transcribe» يصل إلى منصات غوغل
وبحسب المعطيات المعلنة، ستكون الميزة الجديدة متاحة عبر منصة Google Antigravity، إلى جانب تطبيق جيميناي على نظام macOS.
وتخطط غوغل أيضا لتوسيع نطاق استخدامها مستقبلا ليشمل متصفح كروم، حيث ستتيح خاصية التحدث للكتابة (Talk-to-Type) داخل مختلف حقول النص على صفحات الويب.
ومن شأن هذه الخطوة أن تسمح للمستخدمين بإدخال النصوص صوتيا بشكل مباشر أثناء استعمال المواقع والخدمات الإلكترونية، دون الحاجة إلى الاعتماد على لوحة المفاتيح في كل مرة.
ويأتي إطلاق Gemini 3.5 Transcribe في إطار المنافسة المتسارعة بين شركات التكنولوجيا لتطوير أدوات ذكاء اصطناعي قادرة على فهم الصوت واللغة الطبيعية بشكل أكثر دقة، خاصة مع تزايد الاعتماد على المساعدات الذكية والنسخ الفوري للمحتوى الصوتي.

التعاليق (0)