ניתוח היסטורי וטכניקות מחקר
חידוש שפות אבודות באמצעות טכניקות למידת מכונות
Table of Contents
מה הן שפות אבודות?
שפה אבודה היא זו שאין לה רמקולים חיים, שעבורה רשומות ששרדו הן מפולגת או נעדרות לחלוטין.יש שפות אבודות נכחדו אך הן צאצאים ידועים – למשל, הלטיני הוא האב הקדמון של שפות הרומנטיות, אך צורותיה הישנות יותר מתועדות היטב. אחרים אינם ידועים לחלוטין, ללא קרובי משפחה מזוהים ואין ורודטה סטון לספק מפתח.
- (ב) [ה]"התסריט של מינוס 1" (התסריט של מינוס 1,00 לפנה"ס) על אף ניסיונות רבים, הוא נותר ללא פענוח, חלקית משום ששפת היסוד אינה שייכת לכל משפחה ידועה.
- (FLT:0) התסריטאיים של הארפלאן (Indus Valley Civilization, c. 2600–1900 לפני הספירה) – נמצא על אלפי חותמות זעירות וקשים צפים, אך אין כתובת דו לשונית קיימת.
- (ב) ⁇ :0) פרוטו-אלמטית' 1 (Proto-ElamiteFLT:1), אחת ממערכות הכתיבה העתיקות ביותר שלא מפוצלות, המשמשות במה שנמצא כיום באיראן בסביבות 3100 לפני הספירה, ייתכן שאין לו קשר לכל שפה מאוחרת יותר.
- (ב) [ה]:0 [RongorongveoFLT]: התסריט המסתורי של האי הפסחא, המתואר בטבלי עץ לאחר המאה ה-13, מקורו ומשמעותו עדיין שנויים במחלוקת.
- (ב) ⁇ :0 (הראשונה) ניתן לקרוא באופן סלולארי, אך השפה הבסיסית יש מעט קוגניטים ואין דקדוק מלא.
שינוי שפות כאלה רחוק מפעילות אקדמית.כל מילה מנומקת מאירה נתיבי סחר עתיקים, אמונות דתיות, הגירה, קשרים בין-תרבותיים.לדוגמה, הפענוח של קואר B בשנות החמישים שינתה את ההבנה שלנו של החברה היוונית של יוסדה מערכת בירוקרטית וכלכלית שקדמה לאפוסי הבית במאות.
תפקיד הלמידה של מכונות בשיקום שפה
בלשנות היסטוריות מסורתיות מסתמכות על השיטה השוואתית: בלשנות לזהות קוגניות (מילים שחולקים אב קדמון משותף) ולאחר מכן מדגימות את השינויים הקוליים והשינויים המורפולוגיים שהתרחשו לאורך זמן. שיטה זו עובדת יפה למשפחות שפה מתועשות היטב כגון Indo-אירופי או אנטישמיים.אבל היא נכשלת כאשר הנתונים אינם ידועים, כאשר השפה אינה ידועה, או כאשר הטקסטים הזמינים מציעים גם תבניות ראייה קבועות (de-מופתות) לערכים חזותיים (de-מופתים).
בלבה, למידת מכונה מתייחסת לשיקום שפה כבעיה זיהוי דפוס.מודלים מאומנים על אור גדול של שפות ידועות - לעתים קרובות המשתרעת על עשרות משפחות ומילניום - ללמוד את הנטיות האוניברסליות של שינוי קול, מבנה סינפר, ומורפולוגיה דקדוקית, כאשר מוצגות עם שבר של שפה לא ידועה, המודל יכול להקיש את הצורות האסטרליות או חסרות, מה שמוכיח על ידי שימוש בשפה אחת-לאומית:
טכניקות מפתח
רשתות נידור לחיזוי
(הרשתות הניאנדרליות, במיוחד רשתות עצביות חוזרות ונשנות (RNN) והאדריכלות המתנורת יותר, נועדו לדגם רצפים.בשיקום שפה, הן מאומנות על רשימות מילים משפות קשורות למשל, רשת המוצגת עם ה-FLT האיטלקי:0vinoFLT:1, ספרדיתFLT:2vinoFLT 3, ו-Fvinirdowalvinal) ניתן לעתים קרובות לנבא את אותו מספר 1 של מדרגה ראשונה.
עבור שפות אבודות עם טקסט קטן מאוד, החוקרים לפעמים להשתמש בגישה בין שפה חוצה שפה. a רשת מאומנת על התכתבויות הקוליות בין יווני לסנסקריט, למשל, ניתן ליישם בשפה גרועה, כפי שציטטו פילוסופי, מה שהופך תחזיות המבוססות על הדפוסים האוניברסליים שהוא הפנה. גישה זו שימשה להצגת שחזורים עבור עשרות מילים Phgian שהיו בעבר נחשבות ללא השגה.
PHAL Dylogenetics
משועמם מהביולוגיה האבולוציונית, מודלים סטטיסטיים בייסיים משמשים לבניית עצי שפה.פילוגים אלה מראים כיצד שפות שונות לאורך זמן ומאפשרים לחוקרים להעריך את המאפיינים של שפות אסטרליות.השיטה פועלת על ידי השוואת דמויות lexical ודקדוקיות על פני שפות קשורות, ולאחר מכן באמצעות אלגוריתם מארקוב קרלו כדי לדגום את התכונות של מזג האוויר הסביר ביותר ומערכת אסטרלי.
טכניקה זו הייתה יעילה במיוחד עבור התסריט המירוי, שבו קיים פענוח טלפוני חלקי, אך סימנים רבים נותרו מעורפלים.על ידי בניית פילוניה של שפות של נילו סהרה והשוואה של התפלגות סימנים, החוקרים הצליחו לצמצם את ההיגוי האפשרי עבור מספר דמויות לא ידועות קודם לכן.
למידה מרחוק ו- Multilingual Pre-training
מודלים ללמידה העברה שהוכשרו מראש על כמויות עצומות של נתונים טקסט - לפעמים מעשרות שפות - ולאחר מכן כוונון עדין על קורפוס קטן זמין של שפה אבודה.זה חיוני כי ברוב השפות שאבדו יש רק כמה מאות או כמה אלפי תווים של טקסט. מודל לפני אימון כי למד תכונות לשוניות כלליות (כגון הנטייה לצלילים להשתנות בדרכים מסוימות, או מבנה טיפוסי של טקסט לא ניתן היה לראות אותו במקור עם מודל בעל שם של 50 גוונים מודרניים).
מחקרים ב- Machine-Learning-Assisted Reשיקום
קואר B והחידה Minoan-mycenaean
הפענוח של קואר B בשנת 1952 על ידי מייקל ונטרס היה ציון דרך בלשנות היסטורית.ונטריס הראה כי קואר B הקליט צורה מוקדמת של יווני, והוא השתמש בשילוב של ניתוח קריפטוגרפיים וראיות השוואתיות כדי לפענח את הקוד.אבל יחסיו הוותיקים, קואר A, ממשיך להתנגד.הקורפוס הזמין של קואר A מורכב בערך 1,500 כתובות, רבים של שברים, ולא ידוע על שפת האגאי אחרת.
מחקרים עדכניים של למידת מכונה פנו ל- Linear A על ידי טיפול בבעיה כמשימה סטטיסטית של היערכות.חוקרים פיתחו רשת עצבית על זוגות סימנים של קואר B ו- Linear A, תוך שימוש בערכים הטלטיים הידועים של קואר B כמטרות אימון.הרשת למדה למפות רצף סימנים מבטיח ל- Linear Bar Bar Bar B, ומערכים טלפוניים אלה הוצעו: הדגם הפילולוגי ל-עשר סימנים מוקדמים יותר, אף הם לא ניתן לקודמים לשוניים, כי לא השיגו קודם לכן, כי לא היו מציעים גם כן, כי הם לא מעט יותר מאשר סימנים ברורים יותר, כי הם לא ניתן ל-זמנית של קודים, כי הם לא היו מוכנים מראש, כי הם לא ניתן לקודמים לשוניים, כי הם לא היו מוכנים מראש, כי הם לא היו מוכנים מראש, כי הם לא היו מוכנים מראש, כי הם אלה, כי הם אלה, כי הם מציעים, כי הם לא זמין מראש, כי הם מציעים, כי הם לא ניתן לקודים, כי הם מציעים, כי הם לא ניתן לקודים על ידי קודים כפולים, כי הם מציעים, כי הם לא זמין מראש, כי הם לא זמין מראש, כי הם לא זמין מראש, כי הם לא זמין מראש
Mayan Hieroglyphs: Automating the Gaps
התסריט המאיה היה במידה רבה מפוצל במהלך המאה ה-20, הודות לעבודה החלופית של יורי קנורוזוב וחוקרים מאוחר יותר.עם זאת, כתובות רבות נותרו פגועות, וכמה בלוקים של גליפים אינם קריאים. למידת מכונה משמשת כעת לשיקום טקסט חסר. מהפכת רשתות עצביות (CNN) מאומן על אלפי לוחות גרוטציות מצולם יכול לסווג סימנים בודדים עם דיוק של 90%, אשר עשוי להופיע על רצף פיזי (Dirds) אשר עשוי להופיע על בסיס סביר יותר.
במחקר שנערך בשנת 2021, החוקרים האכילו מודל מהפך את הגוף המלא של טקסטים היררגליפים של מאיאן מהתקופה הקלאסית.המודל למד להשלים משפטים מפרקים על ידי חיזוי הגליפים החסרים.כאשר נבדקו בטקסטים פגומים בכוונה, הוא תיקן קריאה עם דיוק של כ-80%, באופן משמעותי מזרז ניחושים אקראיים.
Proto-Indo-אירופה Root Reשיקום בקנה מידה
מחקר ציוני דרך שפורסם ב-FLT:0 (Proceedings of the National Academy of SciencesFillo 1:19) החל רשת עצבית לבעיה של בניית השורשים הפרוטו-אינדו-אירופיים (PIE) ברשת הוכשרה ביותר מ-100,000 קבוצות cognate ממעל 200 שפות הודו-אירופיות, הן עתיקות ומודרניות.
הצלחה זו עוררה את החוקרים ליישם שיטות דומות למשפחות שפה עם תיעוד ⁇ רבים.לדוגמה, משפחות אפרו-אסיה ו-Austronesian יש עכשיו פרויקטים לשחזור מונעים על ידי ML.המודלים יכולים להציע צורות עבור פרו-מילים שמעולם לא שוחזרו לפני, המציעות היפותזה קונקרטית כי בלשנות שדה יכולות לבדוק נגד נתונים חדשים או ראיות השוואתיות.
אתגרים ומגבלות
למרות הבטחתו, למידת מכונה אינה קסם עבור שחזור שפה אבודה.השדה ניצב בפני כמה מכשולים קריטיים המגדירים את מה ש-ML יכול להשיג כיום.
מחסור בנתונים ואיכות
רוב השפות שאבדו שורדות רק כמה מאות תווים או כתובות חלקית.אימון מודל למידה עמוק חזק בדרך כלל דורש אלפי או אפילו מיליוני נקודות נתונים. לעבוד סביב זה, החוקרים משתמשים בטכניקות של הגדלת נתונים: באופן מלאכותי להרחיב את הגוף על ידי הוראות סימנים מחלחל, הוספת רעש סינתטי, או יצירת פרמצבציות המבוססות על כללים מתודולוגיים ידועים.
סיקור ו-The Need for a Anchor
כמה תסריטים, כמו תסריט ה-Harappan או Proto-Elamite, לא ידועים טקסט דו לשוני ואין שפה מזוהה.ללא כל עוגן חיצוני - כגון שפה משותפת ידועה או שם נכון שניתן לקרוא - מודלים של ML יכולים רק לזהות דפוסים פנימיים: תדרי סימנים, מגבלות מיקום, וסטטיסטיקות קוגניציה משותף יכול לחשוף משהו על המבנה של הכתובת, כגון ניתוח סימבולטי או זיהוי סימפוני, אך לא יכול להיות יעיל של דרך חדשה.
פרשנות ואימות
פלטי למידה מכונות הם השערות פרוביביליסטיות, לא עובדות מבוססות.אין מדד סטנדרטי להערכת הדיוק של שחזור כאשר האמת הקרקעית אינה ידועה.מודל עשוי להציע קריאה טלפונית שנראה בלתי סבירה סטטיסטית אך מנוגדת להקשר ארכיאולוגי או על ידי התפתחויות לשוניות שונות.
עתידה של שיקום שפה
העשור הבא מבטיח התקדמות משמעותית בשחזור שפה אוטומטית, המופעלת על ידי מספר מגמות בלמידה מכונה ובמדעיות דיגיטליות.
למידה קצרה ולא מבוססת על למידה עבור Low-Resource Scenarios
חוקרים מפתחים באופן פעיל אלגוריתמים של למידה ומעט-shot הדורשים רק קומץ דוגמאות להכללה. יישומי לתסריטים ייחודיים, שיטות אלה יכולות להפר חוקים מורפיולוגיים והתכתבות טלפונית מכמה כ-50 עד 100 אסימונים.לא סמך למידה מתקדמת גם: מודלים יכולים כעת לגלות התכתבות טלפונית בשפות ללא כל נתונים מקבילים, על ידי הטמעת חללים גולמיים מטקסט ידוע, כמו טקסט דו-לשוני, ללא מפונקציה ראשונה, ללא מצופה.
שיתוף נתונים חוצה-דיסקלינרי
פרויקטים בקנה מידה גדול של דיגיטציה הם ביצוע תמונות ברזולוציה גבוהה של כתובות זמין בחופשיות. Corpora כגון FLT:0Linnea DatabaseFLT 1 עבור Linear A ו-FLT:2Cuneiform Digital Library Initiative EvolutionFLT 3: עבור תסריטים mesopotian לספק נתונים סטנדרטיים לחתום על מוטציות שניתן להאכיל ישירות לתוך מכונות למידה, מקושרים יותר קוד פתוח נתונים.
פלטפורמות שיתופיות עבור יצירה אנושית-AI Co-
פלטפורמות מקוונות כמו ההרחבה:0 (Ancient Language Decipherment ProjectFLT:1 מאפשרות ללשוניות, חובבים חובבים ומערכות AI לשתף פעולה בזמן אמת. מתנדבים אנושיים לאמת הצעות מתועשות, לדגל קריאה בלתי אפשרית ולאשר את אלה המבטיחים - דגמי ה-ML לאחר מכן לחדד את התחזיות שלהם בהתבסס על משוב אנושי זה, יצירת מחזור רוטטטיבי של כתובות היסטוריות זה כבר מאפשר קשקשים של לוחות זמנים פגומים של קשקשים של קשקשים של קשקשים, כמו קשקשים, כמו קשקשים, אשר כבר מאפשר קשקשים של קשקשים של קשקשים של קשקשים של קשקשים, כמו גם קשקשים, כמו קשקשים של קשקשים, כמו קשקשים של קשקשים של קשקשים של קשקשים של קשקשים, רק קשקשים של קשקשים של מיפוי מהיר יותר, לאחר מכן, אז מיפוי מהיר יותר, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, אשר מאפשר מיפוי יעיל יותר, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, כי הם מאפשרים מיפוי יעיל יותר, כי הם כבר מיפוי יעיל של מיפוי של מיפוי של מיפוי זה מאפשר מיפוי של מיפוי מיפוי של מיפוי של מיפוי דיפרזה מיפוי יעיל יותר, לאחר
מסקנה
למידת מכונות לא תפענוח כל שפה אבודה בין לילה למקרים הקשים ביותר – אלה עם שברים זעירים וללא קרובי משפחה – אולי לעולם לא ייכנעו לחלוטין ללא מוצא ארכיאולוגי חדש, אבל ML כבר מספקת בלשנים היסטוריים עם כלים חזקים כדי לבחון רעיונות, למלא פערים, ולחקור חלל מתואם שלא יהיה אפשרי לבני אדם לנהל באופן ידני.