ما هي اللغات الضائعة؟

فاللغة المفقودة هي لغة لا يوجد بها متكلمون حية، وهي سجلات الباقين على قيد الحياة مجزأة أو غير موجودة تماماً، وبعض اللغات المفقودة مقتطفة ولكنها معروفة بالأحفاد، فعلى سبيل المثال، فإن اللغة اللاتينية هي أسلاف لغات الروما، ومع ذلك فإن أشكالها القديمة موثقة توثيقاً جيداً، أما الأشكال الأخرى فهي غير معروفة تماماً، ولا توجد بها أقارب محددين ولا توجد بها لغة روزيتا ستون لتقديم مفتاح، وهذه اللغات هي الأصعب.

  • Linear A] — the script of Minoan Crete (c. 1800-1450 BCE). Despite many attempts, it remains undeciphered, partly because the underlying language may not belong to any known family.
  • Harappan script] (Indus Valley Civilization, c. 2600-1900 BCE) — found on thousands of small seals and pottery shards, but no bilingual inscription exists. The direction of writing is even debated.
  • Proto-Elamite] - وهو أحد أقدم نظم الكتابة غير المُشَرَّفة، المستخدمة في ما هو الآن إيران حوالي 3100 BCE، وقد لا يكون له أي صلة بأي لغة لاحقة.
  • Rongorongo] - النص الغامض لجزيرة عيد الفصح، المقيد على أقراص خشبية بعد القرن الثالث عشر، ولا يزال مصدره ومعناه موضع منازعة حارة.
  • Meroitic] - لغة مملكة كوش (اليوم الحاضر للسودان) ويمكن قراءة النص هواتف، ولكن اللغة الأساسية لديها عدد قليل من المعرفات ولا يوجد بها جرام كامل.

إن إعادة بناء هذه اللغات بعيدة عن الممارسة الأكاديمية، وكل كلمة مفككة تُلقي الضوء على الطرق التجارية القديمة والمعتقدات الدينية والهجرة والاتصالات بين الثقافات، وعلى سبيل المثال، فإن فك الشريان باء في الخمسينات قد حوّل فهمنا للمجتمع اليوناني في منطقة ميسينيان وكشف عن نظام بيروقراطي واقتصادي يهيمن على منحدرات هومركية بقرون، كما أن نفس الإمكانية موجودة حاليا بالنسبة لفصل آخر من اللغات الضائعة:

دور التعلم في مجال تعليم اللغات

وتعتمد اللغات التاريخية التقليدية على الطريقة المقارنة: يحدد اللغويون المعرفات (الكلمات التي تتقاسم أسلافا مشتركة) ثم يستنتجون التحولات الصوتية والتغييرات الميكانيكية التي حدثت بمرور الوقت، وهذه الطريقة تعمل بشكل جميل لصالح أسر لغوية موثقة جيدا مثل اللغة الهندية الأوروبية أو شبه الأوروبية، ولكن لا يمكن أن تُظهر البيانات عندما لا توجد فيها أي أقارب معروفين، أو عندما تكشف النواحي المتسقة عن وجود أنماط قصيرة جدا.

وفي صميمها، يعامل التعلم الآلات إعادة بناء اللغات كمشكلة للاعتراف بالنمط، بينما يتم تدريب النماذج على مجموعة كبيرة من اللغات المعروفة - التي غالبا ما تشمل عشرات الأسر وألفينيا - لتعلم الاتجاهات العالمية للتغيير السليم، والهيكل القابل للتلف، والمورفولوجيا الغامضة، وعندما يقدم النموذج بجزء من لغة غير معروفة، يمكن أن يُستبقَى أشكالاً من الأسبقية أو خصائصها المفقودة.

التقنيات الرئيسية

الشبكات العصبية للتنبؤ

الشبكات العصبية، ولا سيما الشبكات العصبية المتكررة (RNNs) والهيكلات المحولاتية الأحدث، مصممة لتسلسلات نموذجية، وفي إعادة بناء اللغات، يتم تدريبها على قائمة الكلمات المتسقة من اللغات ذات الصلة، وعلى سبيل المثال، شبكة مقدمة مع مجموعات المواد الكيميائية الإيطالية ، والإسبانية

وفيما يتعلق باللغات المفقودة التي لا يوجد نص يذكر، يستخدم الباحثون أحيانا نهجاً شاملاً للغات، إذ يمكن مثلاً تطبيق شبكة مدربة على المراسلات السليمة بين اليونان وسانسكريت على لغة غير مثبتة، مثل لغة فيريجيان، مع التنبؤات القائمة على الأنماط العالمية التي استوعبتها، وقد استخدم هذا النهج لاقتراح إعادة إعمار عشرات الكلمات في اللغة الفريغية التي كانت تعتبر سابقاً غير قابلة للتحل.

الفيوجات الإحصاء

وتُستخدم النماذج الإحصائية في بيزيزيا، التي تُستَنَد من البيولوجيا التطورية، لبناء أشجار أسرية لغوية، وتبين هذه المقاييس كيف تتفاوت اللغات بمرور الوقت، وتسمح للباحثين بتقدير خصائص لغات الأجداد، وتُستخدم هذه الطريقة بمقارنة الخصائص الملزمة قانوناً ولغوياً عبر اللغات ذات الصلة، ثم تستخدم نماذج مركبة من طراز Markov Chain Monte Carlo غير المكتوبة لعينة على الأرجح.

وقد كانت هذه التقنية فعالة بشكل خاص بالنسبة للكتاب المروي، حيث يوجد تشت جزئي في الهواتف، ولكن لا تزال هناك علامات كثيرة غامضة، وببناء زهرة لغات نيلو - الصحراء، ومقارنة توزيعات الإشارات، تمكن الباحثون من تضييق نطاق النطق المحتمل لعدة خصائص غير مؤكدة في السابق.

التعلم في مجال النقل والتعدد اللغوي قبل التدريب

كما أن قواعد التعلم في مجال النقل قد تم تدريبها مسبقاً على كميات هائلة من البيانات النصية - أحياناً من عشرات اللغات - ثم تُحَسَّم على مجموعة صغيرة من اللغات المفقودة، وهذا أمر حاسم لأن معظم اللغات المفقودة لا توجد سوى بضع مئات أو بضعة آلاف من خصائص النص، ونموذج مُدرب قبل ذلك، وقد تعلم سمات لغوية عامة (مثل الحد الأدنى من الأصوات التي تُحدَّد في الأصل بلغات معينة، أو الهيكل النموذجي للكلمات غير مُت).

دراسات حالة في مجال إعادة البناء المهيمنة على الآلات

الصف باء والغز المينوان - البحر

وكان انحراف الخط باء في عام 1952 من قبل مايكل فينتريس علامة بارزة في اللغات التاريخية، وأظهرت فينتريس أن الخط باء سجل شكلا مبكرا من أشكال اللغة اليونانية، واستخدم مزيجا من التحليلات البكائية والأدلة المقارنة لكسر الشفرة، ولكن قريبه الأكبر سنا، الخط ألف، لا يزال يقاوم، ولا يوجد في مجموعة الطول ألف حوالي 500 1 وصفة، والكثير منها مجزأة، ولا في اللغة الأصلية.

وقد اتجهت الدراسات الحديثة للتعلم الآلي إلى الخط ألف بمعالجة المشكلة باعتبارها مهمة للمواءمة الإحصائية، بينما درب الباحثون شبكة عصبية على زوج من العلامات من الخط باء والخط ألف، باستخدام القيم الهاتفية المعروفة للخط باء كهدف تدريبي، وقد حققت الشبكة تسلسلاً للعلامات من خط ألف لتسلسل العلامات من خط باء، ومن تلك التي تُستخدم في القيم الهاتفية، وكانت النتائج توحي بأن الدلائل المصورة التي كانت تُعدّتُعدّها على الدلّة.

Mayan Hieroglyphs: Automating the Gaps

وقد تم فصل السيناريو المائي إلى حد كبير خلال القرن العشرين بفضل العمل الرائد الذي قام به يوري نوروزووف وعلماء لاحقون، غير أن العديد من التسجيلات لا تزال مضرة، وبعض اللبنات التي لا يمكن تصورها، ويجري الآن استخدام التعلم الآتي لاستعادة النص المفقود.

وفي دراسة أجريت في عام 2021، قدم الباحثون نموذجا للمحولات يستكمل مجموعة النصوص الهرجوفية المايا من الفترة الكلاسيكية، وقد تعلم النموذج استكمال الأحكام المجزأة بالتنبؤ بالجليف المفقودة، وعندما جرى اختباره على النصوص المضرورة عمدا، أعادوا قراءة القراءة بدقة تبلغ نحو 80 في المائة، مما يتجاوز كثيرا التخمين العشوائي، ويستخدم الكاتبون هذه التنبؤات كنقطة مرور أولى، ويتحققون من الكفاءة.

إعادة بناء الروت في سكالي

وقد قامت دراسة تاريخية نشرت في Proceedings of the National Academy of Sciences (2019) بتطبيق شبكة عصبية على مشكلة إعادة بناء جذور بروتو إندو - أوروبية، وقد تم تدريب الشبكة على أكثر من 000 100 مجموعة من مجموعات المعرفة من أكثر من 200 لغة من لغات الهند الأوروبية القديمة والحديثة على حد سواء.

وقد أدى هذا النجاح إلى استلهام الباحثين لتطبيق أساليب مماثلة على أسر اللغات التي لديها الكثير من الوثائق الخاصة بالفريق، وعلى سبيل المثال، فإن الأسر الأفريقية والأوسترونية لديها الآن مشاريع إعادة البناء التي تدعمها حركة التحرير، ويمكن أن تقترح النماذج نماذج للكلمات التي لم تُعاد صياغتها من قبل، مما يعرض فرضيات ملموسة يمكن أن يختبرها اللغويون الميدانيون ضد بيانات جديدة أو أدلة مقارنة.

التحديات والحدود

وعلى الرغم من وعدها، فإن التعلم الآلاتي ليس عصا سحرية لإعادة بناء اللغات الضائعة، ويواجه الميدان عدة عقبات حاسمة تحد من ما يمكن أن تحققه حركة تحرير الكونغو اليوم.

سجّالة البيانات ونوعيتها

ولا تزال معظم اللغات المفقودة قائمة إلا بعد بضع مئات من الشخصيات أو بالتسجيل الجزئي، إذ إن التدريب على نموذج متين للتعلم العميق يتطلب عادة آلاف أو حتى ملايين من نقاط البيانات، ولعمله على هذا النحو، يستخدم الباحثون تقنيات زيادة البيانات: توسيع نطاق الجسد بصورة مصطنعة عن طريق إصدار أوامر بالعلامات، أو إضافة الضوضاء الاصطناعية، أو توليد مواصف تستند إلى قواعد جمهية معروفة، ولكن احتمال الإفراط في استخدام نماذج محددة

اليونيك المقدس والحاجة إلى أنكور

ولا يمكن لبعض النصوص، مثل نص هارابان أو بروتو - إلاميت، أن تكون نصاً ثنائي اللغة معروفاً ولا توجد أسرة لغوية محددة، وبدون أي مذيع خارجي مثل لغة معروفة أو اسم مناسب يمكن قراءة نماذجها - لا يمكن أن يكشف إلا الأنماط الداخلية: ترددات الإشارة، والقيود على تحديد المواقع، وإحصاءات التكوين المشترك، ويمكن أن تكشف هذه القيم عن هيكل الكتابة.

الترجمة الشفوية والتحقيـق

إن نواتج التعلم المكبوت هي افتراضات مرجحة، وليست وقائع ثابتة، ولا يوجد قياس موحد لتقييم دقة إعادة البناء عندما تكون الحقيقة الحقيقية غير معروفة، وقد يقترح نموذجاً لقراءة هاتفية تبدو معقولة من الناحية الإحصائية، ولكنها متناقضة مع السياق الأثري أو من التطورات اللغوية اللاحقة، ولا تزال الخبرة البشرية أساسية للتحقق من اقتراحات حركة التحرير المتعددة ضد المجموعة الكاملة من المعارف التاريخية واللغوية.

مستقبل إعادة إعمار اللغات

ويوعِد العقد المقبل بتقدم كبير في إعادة بناء اللغات الآلية، معززاً بعدة اتجاهات متفاوتة في التعلم الآلاتي والإنسانيات الرقمية.

عدد قليل من المتعلمين غير المشرفين من أجل سيناريوهات منخفضة الموارد

وينشط الباحثون في تطوير التعليم المميت والتصويرات التعليمية القليلة الطلقات التي تتطلب فقط مجموعة من الأمثلة لتعميمها، ويمكن لهذه الأساليب، وفقا للخطوط الفريدة، أن تُفضي إلى قواعد مميتة ومراسلات هاتفية من أقل من ٥٠ إلى ١٠٠ طن، كما أن التعلم غير المشرف يمضي قدما: فالنماذج يمكن أن تكتشف الآن مراسلات هاتفية عبر اللغات دون أي بيانات مقترنة متماثلة، عن طريق المواءمة بين الإشارات الفضائية المعروفة.

تبادل البيانات عبر التخصصات

وتتاح مشاريع رقمنة واسعة النطاق صوراً عالية الاستبانة للتسجيلات بحرية، مثل قاعدة بيانات لينينا ] للخط ألف و] مبادرة المكتبة الرقمية العامة [وليست] نماذج إرشادية متاحة مباشرة في إطار برنامج " ليسبيكا " ، وهي نماذج يمكن أن تكون أكثر انفتاحاً.

المنصات التعاونية للتعاون بين منظمة العمل الدولية

ومنابر على الإنترنت مثل مشروع تشفير اللغة المرنة، يتيح للمتطوعين الذين يُستخدمون في اختبارات اللغتين، ويُستخدم فيها مقياساً للتطورات التاريخية، ويُمكن نظاماً للمبادرة من التعاون في الوقت الحقيقي، ويُثبت المتطوعون البشريون صحة المقترحات المولدة آلياً، ويُعلِّمون القراءة غير القابلة للوصف، ويؤكِّدوا نماذج الارتباطعات التي تُخِم بالفعل.

خاتمة

إن التعلم الماكنة لن يكشف كل لغة ضائعة بين عشية وضحاها، وقد لا يثمر قط أصعب الحالات التي تكتنفها شظايا صغيرة ولا يوجد فيها أقارب، دون العثور على آثار جديدة، ولكن القانون النموذجي يوفر بالفعل لغويين تاريخيين لديهم أدوات قوية لاختبار الأفكار وسد الثغرات واستكشاف حيز مختلط يمكن أن يُستعصي على البشر أن يُديروا يدوياً، ويُستدلى الخبراء الذين يُعِدون إلى الأمام على التعاون الوثيق بين مجالات التجزؤهمس.