طبّقنا مجموعة اختبارات تشمل ١٢ لهجة عربية (خليجية، شامية، مصرية، مغاربية، سودانية، عراقية…) على ثلاثة نماذج مفتوحة بارزة: Falcon و Jais و ALLaM. الهدف: قياس الفهم الحقيقي، لا مجرد التوليد.
المنهجية
بنينا ٦٠٠ سؤال يومي بلهجات مختلفة، مصنّفة إلى: طلبات خدمة، محادثات عائلية، مصطلحات مهنية، وتعابير ثقافية. راجعها متحدّثون أصليون قبل التقييم.
أبرز النتائج
تفوّق ALLaM في اللهجة الخليجية بفارق واضح، بينما أظهر Jais توازنًا أفضل عبر اللهجات الشامية والمصرية. Falcon جيد في الفصحى لكنه يفقد الدقّة في اللهجات المحلية العميقة.
لا يوجد نموذج واحد يخدم كل لهجات العربية بنفس الجودة — الاختيار يعتمد على الجمهور المستهدف.
ننشر مجموعة الاختبار مفتوحة المصدر خلال الأسابيع القادمة لتمكين الفرق الإقليمية من قياس نماذجها.