study-guides-and-learning-resources
השימוש ב- Machine Learning בניתוח אוספים גדולים של טקסטים היסטוריים
Table of Contents
Paradigm Shift in Historical Research
במשך מאות שנים, ההיסטוריונים התבססו על קריאה ידנית וסירוב לחלץ משמעות מחומרים ארכיוניים.המהפכה הדיגיטלית שינתה באופן יסודי את הנוף הזה.עם מיליוני דפים של עיתונים היסטוריים, התכתבות אישית, רשומות ממשלתיות, ויצירות ספרותיות הקיימות כיום בצורה דיגיטלית, למידת מכונה (ML) מציעה כלים שיכולים לעבד ולנתח אוספים אלה בקנה מידה ומהירות בלתי אפשרית עבור חוקרים אנושיים בלבד.
אלגוריתמי למידת מכונות יכולים לזהות דפוסים, מערכות יחסים ומגמות ברחבי אורורה עצומה, לחשוף הכל מהאבולוציה של רטוריקה פוליטית לשינוי ברגש הציבורי במהלך ימי מלחמה.על ידי הפעלת משימות כמו סיווג, מקבץ, ומיצוי, ML מאפשר לחוקרים להתמקד בפרשנות והבנה קונטקסטואלית.התוצאה היא גישה עשירה יותר, מונעת יותר נתונים להיסטוריה שמשלים שיטות איכות מסורתיות.
מידע על Data Overload to Data Discovery
אחד האתגרים הגדולים ביותר שהיסטוריונים מתמודדים היום הוא לא מחסור בנתונים, אבל שפע עצום שלו.ארכיון חד-ספרתי יחיד עשוי להכיל עשרות אלפי ספרים או מיליוני מאמרים בעיתון.קריאה אפילו חלק מהחומר הזה היא לא מעשית. למידת מכונה מספקת את הגשר בין טקסט דיגיטלי גולמי לבין תובנה היסטורית מעשית.
(ה) כרך הטקסט ההיסטורי זמין כעת הוא מזועזע:0 (HathiTrust Digital LibraryFLT:1 מחזיק יותר מ 18 מיליון כרכים.FLT:2Chronicling AmericaFLT 3: 3) מציע מעל 20 מיליון דפי עיתונים.FLT:4 EuropeanaFLT:5 מצטבר מעל 58 מיליון פריטים תרבותיים ללא מכונה, לחקור את הנתונים האלה בקנה מידה לא צריך את רמת החישובים של חומרת הדם שלהם, בעוד שמפתחת נתונים דיגיטליים של חומרת מידע זה לא צריך.
טכניקות למידה מכונות הליבה בניתוח טקסט היסטורי
היישום של ML לטקסטים היסטוריים שואב על מספר שיטות מבוססות.FLT:0 [המודלים המובילים של ML ל-ML לטקסטים היסטוריים], כגון Latent Dirichlet Allocation (LDA), מזהה אשכולות של מילים המתועדות במקביל המייצגות נושאים על פני אוסף.טכניקה זו שימשה לעקוב אחר עליית הלאומיות בעיתונים מהמאה ה-19 או את העברת הפרסומים המדעיים לאורך עשרות שנים, בניגוד למסמכים מתמטיים, אשר נמצאו מאוחרים על פני השטח של קבוצות טקסט קולוניאליות, אשר נמצאו על פני השטח של קבוצות טקסט קולוניאליות, אשר נמצאו על פני השטח של טקסטים מתמטיות, אשר נמצאו על פני השטח של טקסטים מתמטיות, אשר נמצאו על פני קבוצות מתמטיות על פני השטח של טקסטים מתמטיות על פני השטח של טקסטים מתמטיות, אשר נמצאו על פני השטח של קבוצות טקסט חד-זמנית, אשר נמצאו על פני השטח של טקסטים מתמטיות, אשר נמצאו על פני קבוצות טקסט חוצות, אשר נמצאו על פני קבוצות טקסט קולוניאליות על פני קבוצות מתמטיות, אשר נמצאו על פני השטח של קבוצות מתמטיות, אשר נמצאו על פני השטח של קבוצות טקסט חד-פנימיות, אשר נמצאו על פני השטח של טקסטים מתמטיות, אשר נמצאו על פני השטח של טקסטים מתמטיות, אשר נמצאו על פני השטח של טקסטים קולוניאליות
(FLT:0) סיווג סיווג Text סיווג FLT:1 מקצה קטגוריות מוגדרות מראש למסמכים, המאפשר סקרים בקנה מידה גדול של תפוקת ספרותית או פוליטית.לדוגמה, היסטוריון עשוי להכשיר מתווך כדי להבחין בין דיווח תעמולה ואובייקטיבי בעיתונים בזמן מלחמה.המחלקה לומדת מדוגמאות מתויגות ולאחר מכן ליישם את אותם כללים למיליונים של מסמכים שלא נלאו.
(FLT:0) פלוסטרינג FLT:1 קבוצות טקסטים דומים ללא תוויות מוגדרות מראש, עוזר לחוקרים לגלות זיקה בלתי צפויה בין יצירות נפרדות לאורך זמן וגיאוגרפיה. היררכי של פיות מהמאה ה-18 עשוי לחשוף כי טענות על מיסוי בבוסטון חלקו תכונות פורמליות יותר עם פאמפיונים בלונדון מאשר עם אלה מפילדלפיה, מאתגרות הנחות על בידוד אינטלקטואלי אזורי.
(ב) ,0) הכרה בישות (NER) ; מיצוי שמות של אנשים, מקומות, ארגונים, תאריכים מן הטקסטים ההיסטוריים, כאשר חלים על התכתבות או רשומות מינהליות, NER יכול לחשוף רשתות חברתיות, דפוסים הגירה, או התפשטות של רעיונות: לדוגמה, עיבוד NER של LT:2FLT: 7 LT5 , 000 , 000 ⁇ , 000 ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
(הופנה מהדף ⁇ ) ⁇ (ה) ⁇ (ה) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
מחקרים: Machine Learning in Action
כמה פרויקטים עיקריים מחקריים ממחישים את כוחו של ML במחקרים היסטוריים.ה-FLT:0Chronicling AmericaFLT:1 פרויקט בספריית הקונגרס משתמש ב-ML כדי לשפר את OCR בעיתונים היסטוריים, תוך מתן אפשרות לנושא וחיפוש מילות מפתח על פני מיליוני דפים באופן דומה, ה-FLT:2ESTC (קטלוג קצר כותרת) של 3.FLT:3 השתמש במקבץ כדי לזהות אלגוריתמים מוקדמים של ספרים, אשר פורסמו, אשר פורסמו, לפני שדווחים, אלגוריתמים, אלגוריתמים, אשר פורסמו, 480,000 ספרים, ומפורטים, ומפורטים, אשר פורסמו, אלגוריתמים, אלגוריתמים, אלגוריתמים, אלגוריתמים, לפני שמבוססים על ידי אלגוריתמים, אלגוריתמים, אלגוריתמים, אלגוריתמים, אלגוריתמים, אלגוריתמים של מהדורות אלה, מהדורות של אלגוריתמים של תועדו על ידי אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים
מחקר ציוני דרך השתמש בניתוח סנטימנט על נאומי הפרלמנט הבריטי בין 1800-2000 כדי לעקוב אחר הכדאיות הרגשית של דיון חקיקה, מציאת שהטון הפך שלילי יותר ומקוטב יותר במהלך תקופות של לחץ כלכלי.החוקרים השתמשו בגרסה של ה-FLT:0Linguistic Inquiry ו- Word (LIWC)FLT:1 המילון מותאם לצרפתית היסטורית, ואז תואמים את ציוני הרגש עם צמיחה, אבטלה, ושיעורי מלחמה, ותוצאות רטוריקה מרובות, אשר התמקדו במגמות כלכליות, ותוצאות הגורמות למיתון.
פרויקט נוסף החל את הדוגמנות לדוקטורט האמריקאי בשנים 1861 עד 2000, ומראה כיצד סדרי עדיפויות המחקר השתנו מנושאים דתיים למדעים החברתיים ולאחר מכן לתחומים STEM.TheFLT:0Quest DissertationsFLT:1 כוללים מעל 5 מיליון עבודת מחקר, ומודלים בנושא גילו כי שיעור התעודה המתייחס לנושאים דתיים צנח מ-34% ב-1890 ל-6% עד שנת 1980, בעודם מתמקד ב-2% מהטכנולוגיות הנדסיות ו-2%.
(ב) לצליל עמוק יותר אל הצד הטכני של שיטות אלה, ראה:0 (הסקירה זו בטבעומנטל 1:1) של איך ML משמש בבני האדם.
להתגבר על המכשולים: איכות נתונים, שפה ופרשנות
בעוד הפוטנציאל הוא עצום, החלת ML לטקסטים היסטוריים היא בעייתית עם קשיים.הבעיה הנפוצה ביותר היא (FLT:0) שגיאות OCR PHFLT:1 (הפרויקטים של ספרות מוקדמת) מייצרת לעתים קרובות טקסט עם שיעור שגיאה של 10-20% בשל הדפסת, גופנים יוצאי דופן, או נזק בעמוד.
החוקרים חייבים גם להתמודד עם (FLT:0) אנרכיסטים (אנ') ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
(FLT:0) בייאסראטפל 1 (FLT:0) הוא עוד דאגה ביקורתית: נתוני הדרכה עבור מודלים רבים של ML נגזרים מן הטקסטים המודרניים, כך אלגוריתמים עשויים לסווג או לא נכון מסמכים היסטוריים המשתמשים בשפה מואשמת גזעית, תפקידי מגדר, או הבחנה מעמדית אחרת.מודל מאומנים על פני עיתונים מהמאה ה-20 עשוי לסמן מערכת יחסים תומכת של נשים, כאשר היא דורשת התייחסות אוטומטית, על ידי אידיאולוגיה.
עוד הטיה עדינה עולה מן הכלל:0;0; אין איזון בין המינים (הרש"י) [הרש"י]: [ה], [ה] [ה]] [ה]]] [הרש"י], [הרש"י], [ה] [הרש"י],] [ה] [ה]] [ה]]]], [ה[[ה[[ה[[ה[[ה[[ה[[ה[[המאה ה']]]]]],]],]],]],]],]],]],]],]],]],]],]],]],]],]],]],]],]], [[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[1924]],]],]],]],]],]],]],]],]],]],]],]],]],]],]],]],]],]],]],]],]],]], [[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה[[ה
שיקולים אתיים בהיסטוריה האלגוריתמית
ישנם גם ממדים אתיים.טקסטים היסטוריים של Digitized מכילים לעתים קרובות מידע אישי על אנשים שאולי לא היו להם ציפיות לפרטיות. ML יכול לזהות מחדש נתונים אנונימיים או לחשוף פרטים מהתכתבות פרטית. החוקרים חייבים ליישם עקרונות הגנת נתונים ולשקול אם הניתוח שלהם עלול לפגוע בקהילות יורדות.לדוגמה, מסדי נתונים גנטיים שנבנו מרשומות מהמאה ה-19 יכולים לחשוף באופן לא חוקי יחסים גנטיים או גירושין שלא גרמו לצאצאים לחיות.
יתר על כן, האלגוריתמים עצמם יכולים להנציח הטיה היסטורית אם לא נבדק בקפידה.לדוגמה, מערכת זיהוי ישות בשם עלולה לא להכיר סופרים נשים אם נתוני האימון מייצגים נשים. במחקר 2018, מערכת NER בשימוש נרחב לא הצליחה לזהות חצי מהסופרים הנשיים בקורפוס של הרומנים מהמאה ה-19, זיהוי נכון של ג'יין אוסטן אבל חסרה איזבלה בירד, מרי וולסטון, ואולפט, היא בעלת ארכיונים היסטוריים אחרים.
שקיפות היא חיונית.פרסום קוד, נתונים ומתודולוגיה מאפשר לחוקרים אחרים לשחזר ולביקורת על ממצאי המחקר:0Digital Humanities QuarterlyofLT:1 מספק פורום עבור דיונים כאלה, עם מאמרים רבים לחקור את השימוש האתי של ML במחקר היסטורי.
צעדים מעשיים ליישום ML בפרויקטים היסטוריים
(ב) להיסטוריונים שבחנו את ML, זרימת עבודה מעשית מתחילה עם מודלים לשוניים:0 data ניקוי FIRLT:1; טקסט צריך להיות תיקון OCR באמצעות כלים כמו Tesseract עם מודלים שפה שהוקדשו היטב עבור גופנים היסטוריים.
(ב) בחרו מסגרת ML מתאימה (בקיצור של אוספים בינוניים (עד 100,000 מסמכים), ספריות פייתון כמו FLT:0 או FLT:1) לעבוד טוב.עבור שירותים גדולים יותר, מבוססי ענן או פלטפורמות דיגיטליות ייעודיות כגון FLT:0Voyant ToolsFLT:1 או FLT:2, polidows 3, יכול בקלות רבה יותר לדגמי אינטרנט:
(הופנה מהדף ⁇ :0) תוצאות בלתי מהימנות של LT:1 (מודל נושא עשוי לייצר נושאים ראוניים שנראים כי הם למעשה חפצים של שגיאות OCR או מילות עצירה נפוצות.בדיקה ידנית של מדגם אקראי של מסמכים בכל אשכול נושא הוא שלב אימות מינימלי של נתונים: יותר אימות קפדני כולל השוואת קטגוריות מקודמות של ML עם קטגוריות של קוד אנושי באמצעות מדדים כמו Cohens: 4Fa).
בחירת הכלים הנכונים עבור קורפוס היסטורי
לא כל הכלים של ML נוצרים שווים לעבודה היסטורית.המילה המאולצת המטעה (כמו Word2Vec או GloVe) מבוססים על גורורה מודרנית ולא יכולה לתפוס שימושים היסטוריים. החוקרים צריכים לשקול להכשיר את הטביעות שלהם על אוספים היסטוריים, כגון FLT:0COHA (Cors of Historical American English) מכיל מעל 400 מיליון מילים מ-184 מ"מאמנים"מרבים" (למשל, לעומת 181, 181) ו"מחדש"מחדשנים"מציירים"מרבים מ"מחדשנים"מרבים מן המכונים "מרבים"משנים"משנים"מחדשים" (VVVergecles) אשר עשויים לשקף את המציאות" (Corgecles) עם ביטויים"מחדשים" (Corgecles of Historical English) עם ביטויים) ו" (Cors of Historical English) עם ביטויים" (Cors of Historical English) עם ביטויים) עם ביטויים) ו" (Cors of Historical English) אשר עשויים לשקף את המציאות ההיסטורית של אנגלית היסטורית של אנגלית היסטורית של אנגלית היסטורית, אשר עשויים לשקף יותר מ-1871) ו" (Cors of Historical English) ו" (Cors of Historical English) ו
באופן דומה, מודלים שפה גדולים (LLMs) כמו GPT ניתן לכוונון עדין בטקסטים היסטוריים, אך לעתים קרובות הם "לבטל" נבואות הסתברותיות אך לא נכונות עובדתיות, מחקר 2023 מצא כי GPT-4, כאשר התבקשו לסכם את ה- 18-Credboxs על חוק הדגימה, המציא פגישות עיר בדיוניות ודיון דמיוני שמעולם לא התרחשו.
העתיד: ניתוח בזמן אמת ואינטגרציה רב-ממדית
[הגבול הבא כולל ניתוח בזמן אמת של טקסטים חדשים דיגיטליים.כפי שארכיונים מוסיפים באופן רציף חומר, צינורות ML יכולים לסווג באופן אוטומטי, לסכם ולחבר טקסטים חדשים ל-S הקיימים, יצירת גרף ידע דינמי של אירועים היסטוריים.TheFLT:0Archives Unleashed FLT:1 פרויקט, למשל, פרוטוקולים אינטרנט בזמן אמת, מיצוי של שם והפקה של רשתות של 3.
(הופנה מהדף [[1924]]]]]] [[1924]]]]]] [[1924]]]]]]]] [[1924]]]]]]]] [[1924]]]]]]]] [[1924]]]]]]]]]]]]]]]] [[1924]]]]]]]]]]]]]]]]]]]] [[1924]]]]]]]]]]]]]]]]]]]], [[1924]]]]]]]]]]]]]]]] ו[[1924]] [[1924]]]]]]]]]]]]]]]]]]]]]], [[1924]]]]]]]]]]]] [[1924]]]]]]]]]]]]]]]]]]]]]] [[1924]]]]]]]]]]]]]] [[1924]] [[1924]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]] [[1924]] [[[[1924]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]]] [[[[1924]]]]]] [[[[1924]]]] [[[[1924]]]]]]]] [[[[1924]]]]]] [[[[1924]]]]]] [[[[1924]]]]]]]] [[[[[[1924]]]] [[[[[[1924]]]]]]]] [[[[[[[[[[1924
בנוסף, Multimodal ML המשלב טקסט עם תמונות (מפות, תמונות, כתבי יד בכתב יד בכתב יד) יחשפו מקורות שקשה לנתח באופן אוטומטי, כגון ספרי גרד או שוליה.TheFLT:0Visual NLPFLT:1 מסגרת שפותחה על ידי IBM Research יכולה לחלץ טקסט ממסמכים כתובים יד, להתאים אותו לתעתיקים או לבצע ניתוח רגשות על ההערות שוליים זה מאפשר לנתח את ההבדל בין קורא פרטי 19 לסקירה של טקסט של טקסט של כתב:
שיתוף פעולה בין Machine Learning ו-Excelship המסורתית
העתיד המבטיח ביותר אינו להחליף היסטוריונים עם אלגוריתמים, אלא בלהעמיק את שיתוף הפעולה. למידת המכונה יכולה להתמודד עם "הרמת הכבדה" של עיבוד נתונים, בעוד שההיסטוריונים מביאים ידע דומיין לשאול שאלות טובות יותר ופרשים תוצאות. תוכניות בוגרות בהיסטוריה הדיגיטלית הן כעת נפוצות, ומחלקות היסטוריות רבות מציעות מעלות משותפות עם מחשב.ה-FLT:0Digital HistoryFLT:1 באוניברסיטת נברסקה, לדוגמה, ניתוח קיסרי, דורש לתארים מתקדמים.
אנו יכולים לצפות לראות יותר קבוצות בינתחומיות מטלבות שאלות היסטוריות גדולות, כגון האבולוציה ארוכת הטווח של הדמוקרטיה, ההשפעה של האקלים על חברות העבר, או התפשטות תנועות דתיות.ה-FLT:0Climatic Research Unit באוניברסיטת מזרח אנליהFLT:1 שותפו עם היסטוריונים ליישם ML למזג אווירי מ -18 ו-19, תמצית הטמפרטורה והמשקעים החל ממאגרי אקלים חזקים אלה, אך לא החלו לשחזר את המשתנים באופן יומיומיים של נתונים רשמיים.
מסקנה: עידן חדש של גילוי היסטורי
למידת מכונה אינה כדור קסם, אבל היא עדשה רבת עוצמה המגלה מבנים ודפוסי בלתי נראים לעין העירומה.הדיגיטליזציה של טקסטים היסטוריים יצרה אוצר של נתונים, ו-ML מספקת את הכלים לחקור אותו באופן אחראי. על ידי שילוב של הקפדה חישובית עם פרשנות הומניסטית, החוקרים יכולים להבין את העבר עם עומק גדול יותר מאי פעם.
(הקריאה נוספת על יישום מעשי של שיטות אלה, ה-FLT:0Directus פלטפורמה 1Felos פלטפורמה מציעה פתרונות CMS ללא ראש שיכולים לשמש כעמוד השדרה לפרויקטים של היסטוריה דיגיטלית, שילוב צינורות ML עם ניהול metadata קשתית. as הטכנולוגיה בוגרת, הגבול בין ההיסטוריון למדעני הנתונים ימשיך לטשטש, פתיחת שדה בין תחומי מתפתח עשיר המבטיח ל-reshperimenterams של מערכות למידה מתקדמות יותר: