حققت المبادرات التقنية السعودية خطوة جديدة ونوعية نحو المديات العالمية؛ حيث اعتمدت شركة “إنفيديا” (NVIDIA) العالمية، المتخصصة في تقنيات الحوسبة والذكاء الاصطناعي، على مجموعة البيانات الصوتية “صدى” (SADA) لتطوير وتدريب نموذجها ذكي للتعرّف الآلي على الكلام فهم اللهجات السعودية (Nemotron 3.5 ASR).
وقد أسهمت هذه البيانات السعودية الوطنية عالية الجودة في إحداث قفزة ملموسة في أداء نموذج “إنفيديا”، إذ انخفض معدل الأخطاء في التعرّف على النصوص العربية والحديث باللهجات المحلية من نحو 55% إلى نحو 30%.
وتأتي مجموعة بيانات “صدى” كإنجاز مشترك أطلقته الهيئة السعودية للبيانات والذكاء الاصطناعي (سدايا) بالتعاون مع هيئة الإذاعة والتلفزيون، وجرى نشرها عبر منصة Kaggle العالمية لعلوم البيانات لتتاح أمام الباحثين والمطورين حول العالم.
وتضم مجموعة “صدى” نحو 667 ساعة صوتية مقترنة بالتفريغ النصي المكتوب، جُمِعت من أكثر من 57 برنامجًا ومسلسلًا تلفزيونيًا بتغطية تتجاوز 10 لهجات سعودية مختلفة. وتشمل المجموعة أكثر من 125 ألف مقطع صوتي مُصنّف بدقة؛ مما مكّن فريق المطورين في “إنفيديا” من استهداف اللهجات المحلية (مثل النجدية والحجازية) لتدريب نماذجهم وتقليل الفجوة اللغوية.
ويُبرز هذا التعاون الأثر الاستراتيجي لبناء القواعد والبيانات الوطنية الجودة، والتي تُشكل الركيزة الأساسية في توجيه نماذج الذكاء الاصطناعي العالمية لفهم الخصوصيات اللغوية والثقافية للمستخدم العربي، والارتقاء بجودة التطبيقات الصوتية القائمة على معالجة اللغة العربية.












