הקרן לרישום טקסט בהיסטוריה

ההיסטוריון העובד עם ארכיונים דיגיטליים ניצב בפני פרדוקס של שפע.מיליוני ספרים, עיתונים ומכתבים אישיים זמינים כעת בלחיצה אחת, אך היכולת האנושית לקרוא ולסנתז אותם נותרה סופית. עיבוד שפה טבעית (NLP) מציעה דרך שפע זה.על ידי יישום שיטות חישוביות לנתח טקסטים היסטוריים, החוקרים יכולים לזהות דפוסים, שינויים לשוניים, ובדיקת השערות על פני נתונים מסיביים שלא ניתן לקרוא בחיים בודדים.

עיבוד שפה טבעי הוא ענף של בינה מלאכותית המתמקדת באינטראקציה בין מחשבים לשפה האנושית.המטרה העיקרית שלו היא ללמד מכונות לקרוא, לפרש, להפיק משמעות מטקסט באופן שהוא גם חזק מבחינה סטטיסטית וקשרי מודע. בהקשר של מחקר היסטורי, זה אומר להמיר מסמכים שבריריים, רועשים ומשתנים מאוד - מ כתבי יד מימי הביניים ועד לטלגרם המאה העשרים - נתונים מובנה שניתן להציג אותם וניתן לסווגם.

שיטות היסטוריות מסורתיות מסתמכות רבות על קריאה קרובה: ניתוח מעמיק ופרשני של מספר קטן של מסמכים.גישה זו מייצרת תובנות עשירות, קונטקסטואליות אך סובל מבעיות מדרגיות.ההיסטוריון יכול רק לקרוא כל כך הרבה דפים שמונה־עשרה מציג את הרעיון של ריבוע:0distant קוראות מסוימות FLT:1, מונח פופולרי על ידי חוקר ספרותי מורטטנטי קורא אלפי טקסטים, כמו למשל, לא יכול להחליף את הרטוריקה עמוקה יותר, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, למשל, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, למשל, כך, כדי לפרט, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך שכותבים, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך שכותבים, לדוגמה, כך, כך, כך, לדוגמה, לדוגמה, כך, כך, כך שכותבים, כך, למשל, כך שכותבים, למשל, כך, כך

המונחים: NLP

כדי להבין כיצד NLP עובד על מסמכים היסטוריים, זה עוזר לשבור את צינור עיבוד סטנדרטי.כל צעד הופך טקסט גולמי לתבנית קריא מכונה:

  • (FLT:0) Tokenization:cioFLT:1 פיזור זרם של טקסט למילים בודדות, סימני טיהור, או משפטים.זה נשמע פשוט, אבל טקסטים היסטוריים עם טיהור לא סדיר, טיהור ארכאי, ושימוש באופי "של" הארוך (אשר דומה ל"f") יכולים לזרז את הטורפים המודרניים.
  • (FLT:0 חלק-of-Speech (POS) Tagging:FLT:1 התווית כל מילה עם תפקיד דקדוקי שלה (לא, פועל, אדפור, adverb) חיוני לפירוק משמעות.לדוגמה, המילה "אור" יכולה להיות noun (מקור תאורה) או אדמדן (לא כבד).
  • (FLT:0) לדמימיזציה ו- Stemming:FreaLT:1) הפחתה של מילים לצורת הבסיס או המילון שלהם "ריצה" הופכת "להתחיל"; "טוב" לטקסטים היסטוריים, זה עוזר לאסוף גרסאות של מילה על פני קורפוס.עם זאת, ממאצר מאומן באנגלית המודרנית עשוי להיכשל כדי לזהות צורות ארכאיות כמו "דות" (doth) או "תיקון" (ד) הם לעתים קרובות נדרשים).
  • [01:0] הכרה בסמכות (NERIRLT: 1 ⁇ וסווגן של נון ראוי לקטגוריות מוגדרות מראש כגון שמות אדם, ארגונים, מיקומים, תאריכים וערכים כספיים.זהו אחד הכלים השימושיים ביותר עבור היסטוריונים. חוקר מנתח מאה של תכתובות דיפלומטיות יכול להשתמש ב-NER כדי להפיק כל אזכור של עיר זרה, הון, או מפה, ומרחב אלה לאורך זמן.

יישומי מפתח במחקר היסטורי

היישום של NLP לחומרים היסטוריים מעצב מחדש מספר תחומי חקירה.חוקרים כבר לא מוגבלים לשאול שאלות פשוטות על מה טקסטים אומרים; הם יכולים לשאול שאלות מורכבות על איך השפה מתפקדת לאורך זמן ומרחב.

קריאה ומאקרואנליזה

קריאה בלתי נמנעת מאפשרת לחוקרים לנתח מגמות לאורך מאה של פרסום באחר הצהריים אחד.על ידי חישוב תדירות של מילים ספציפיות או נושאים לאורך זמן, החוקרים יכולים לעקוב אחר העלייה והנפילה של רעיונות.לדוגמה, מעקב אחר השימוש במונחים כגון "ליברטי", "זיכרון", "מפיר" או "rePublic" באוצר המילים מהמאה ה-18 מספק מידה כמותית של כלי שיח ציבוריים כמו LTF:0reas: ® Vieweric Viewer, כלומר, לדוגמה, לדוגמה, לדוגמה, גרסה פשוטה יותר, לדוגמה, לדוגמה, לדוגמה, שימוש בגרסאות מחקר של ויזואליות של ויזואליות של ויזואליות ספרותיות, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, שימושית של טקסט ספרותיות של יוונית פשוטה יותר, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, מראה טקסט ספרותית של ויזואליות של ויזואליות של ויזואליות של ויזואליות של ויזואליות של ויזואליות של יוונית פשוטה יותר, לדוגמה, לדוגמה, לדוגמה, לדוגמה, על ידי גירסאות מחקר על ידי גירסאות מחקר על ידי יוונית פשוטה יותר, שימוש ב- 1- 1- 1- 1

מודל

מודל הנושא הוא טכניקת למידה מכונה לא מבוססת, אשר לסרוק אוסף של מסמכים באופן אוטומטי מגלה אשכולות של מילים המופיעות לעתים קרובות יחד. אלה אשכולות, או "טופים", מייצגים נושאים מאוחרים בתוך הגוף.היסטוריון העובד עם נאומים פרלמנטריים ויקטוריאנית עשוי להשתמש במודלים חשובים כדי למצוא כי נושא אחד קבוצות כגון "טרווי", "מנגמנט", "מסלול" ו" בעוד "מסלול" אחר" אינו מספק מודל חישובי" של נתונים חישובי" (מתאים), "מסוגר" (peranative Models"), "מתאים" (pera"), "מתאים" (pera") ו" (pera") ו" (pera") של מודל" (pera") של מודל מחשבי" (מתאים) של מערכת חישוביים), "מתאים) של כל אחד של מערכת חישוביים" (pera") של ידע, "מסוגל-" (מתאים) של מערכת חישוביים" (מתאים) של מערכת חישוביים, "מתאים אישיים, "מתאים" (peranative Data) של מערכת חישוביים" (peranative) של מערכת חישוביים" (peranative) של מערכת חישוביים" (peranative Model

Stylometry ו- Authorship Attribution

(הסטומטריה משתמשת בניתוח סטטיסטי כדי לכמת סגנון הכתיבה הייחודי של המחבר.על ידי מדידה של תכונות כגון אורך משפט, אוצר מילים עשירות, ואת תדירות המילים הפונקציה (למשל, "ה"ו", "של") החוקרים יכולים להבחין בין סופרים עם דיוק גבוה.זה שימושי במיוחד לפתרון שאלות של סמכות שנויה במחלוקת במסמכים היסטוריים, מן הניירות הפדרליות ועד לרנסנס.

ניתוח וקשת רגשית

ניתוח סימנטציה מנסה למדוד את הטון הרגשי או את הקוטביות של טקסט (חיובי, שלילי, נייטרלי) כאשר החלים על טקסטים היסטוריים, זה דורש קיברון זהה. החל lexicon מודרני רומן מהמאה ה-19 עשוי לייצר תוצאות מטעות כי משמעויות של מילים משתנות.עם זאת, כאשר החוקרים בונים lexicons ספציפיים לתקופה - החל מניסוח עכשווי או לא ממומחים - הם יכולים לעקוב אחר מודל רגשי ארוך של מלחמה, אך לא ניתן לעקוב אחר כך, אך ורק לאחר חודשים של מלחמה רגשית, אך ורק לאחר זמן קצר לאחר מכן, לאחר מכן, לאחר שמעולם לא ניתן לעקוב אחר נרטיבים של מלחמה רגשית, לאחר זמן רב, לאחר שמעולם לא ניתן לעקוב אחר כתב העת, לאחר שמעולם לא ניתן לעקוב אחר כתב אישום, לאחר חודשים של אירועים היסטוריים, אך ורק לאחר מכן, לאחר מכן, לאחר שחוקרים, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, לאחר שחוקרים, לאחר שחוקרים בונים נרטיבים, לאחר שחוקרים, לאחר שחוקרים, לדוגמה, לאחר חודשים של תקופה מסוימת, לאחר שחוקרים, לאחר שמעולם לא ניתן לעקוב אחר נרטיבים, לאחר שחוקרים, לאחר שחוקרים, לדוגמה, לאחר שחוקרים בונים פסקול היסטורי, לדוגמה, לדוגמה

ניתוח רשת של איורים היסטוריים

על ידי הוצאת גופים מקורפוס של אותיות או רשומות דיפלומטיות, החוקרים יכולים לבנות רשתות מורכבות של מערכות יחסים.זה ידוע כניתוח רשת היסטורי.לדוגמה, צינור NLP עשוי לחלץ כל אדם שהוזכר בתכתובתו של ג'ון אדמס.היסטוריון יכול אז למפות מי הוא תואמים עם רוב התדירות, אשר צויין כהשפעה, וכיצד רשתות אלה השתנו במהלך הקריירה שלו.

היסטוריה גיאוגרפית וספאנית

תת-שדה גדל והולך של שמות אתרים היסטוריים הוא FLT:0 (geoparsingssiging and disambiguation of place name from text:0) בשילוב עם מערכות מידע גיאוגרפיות (GIS), גיאופרדינג מאפשר להיסטוריונים למפות את הממדים המרחביים של אירועים היסטוריים ושיחים. לדוגמה, חוקר החוקר לומד את התפשטות המוות השחור יכול להשתמש בגיאורגים על פני רצף היסטורי של רצף של רצף, שנחשב לעתים קרובות לגרסאות של נתונים, אשר נחשבות לגרסאות היסטוריות של דמויות של דמויות של דמויות של דמויות של סימפוניות, אשר נחשבות, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, כגון: "ה, כמו גם לגרסאות קודמות של נתונים של סימפוניות"מדווחות על ידי אותנטיות, "ה,"מדווחות על ידי אותנטיות של "איות" (למשל," (למשל, לדוגמה, לדוגמה," (DI) והיסטוריות על ידי קבוצות ריכוזיות, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, חוקרת על ידי חוקרים, חוקרת על ידי שימוש בגרסאות קודמות של נתונים של נתונים של נתונים של "קודדים על ידי שימוש בגרסאות

להתגבר על האתגרים של נתונים היסטוריים

החלת NLP לפרסומים עכשוויים היא קשה מספיק.הפעלתו ועד כתבי יד בני מאות שנים מציגה קבוצה מסוימת של אתגרים טכניים ופרשיים שיש לטפל בהם כדי להיות בתוקף.התעלמות מהאתגרים האלה עלולה להוביל לתומים מעוררי השראה ולתביעות היסטוריות לא יסולא בפז.

זיהוי תווים אופטיים (OCR) שגיאות

רוב הטקסטים ההיסטוריים הדיגיטליים נוצרים על ידי סריקה של דפים פיזיים וריצה אותם באמצעות תוכנת זיהוי תווים אופטיים (OCR) באופן היסטורי, תוכנת OCR נאבקת עם גופנים ארכאיים (כמו לטווח הארוך), נמוגה דיו, סוג שבור, וחייבת כי יוזמה סמויה של טקסט ליד עמוד השדרה.

המונחים: differentation

לפני הסטנדרט של האיות האנגלי בסוף המאה ה-18, סופרים לעתים קרובות מאוימים מילים באופן אטי או על פי האמנה האזורית "Glorious" עשויים להופיע כ"מוזר", "גלוליוס", "גלובוס", "גלובוס", או "גלובוס" (המילה המודרנית של ה-NLP) תתייחס לגרסאות שונות לחלוטין, כדי לטפל בטכניקות כמו FLT:0regularתואמים את הביטויים: FLT2, או "או-Fieric" (או" (או"ד) לגרסאות מתקדמות יותר, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, אלגוריתמים של אלגוריתמים, לדוגמה, לדוגמה, אלגוריתמים של אלגוריתמים, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, אלגוריתמים של אלגוריתמים, אלגוריתמים של אלגוריתמים אלגוריתמים אלגוריתמים של אלגוריתמים: אלגוריתמים (או אלגוריתמים) של אלגוריתמים, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, אלגוריתמים מודרניים, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, "גרסאות אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים של

משמרת סומנטטית ואנאכרוניזם

מילים אינן ישויות יציבות; משמעותן נעוצה לאורך זמן.המילה "גאה" ב-1830 הייתה עלייה קלילה וחסרת זהירות; "ממונה" התכוונה מלאה ב- 1800; "מהפכה" במקור הייתה אמורה להיות בידיה, החלת רגש מודרני של lexicon לטקסט היסטורי יוביל לשגיאות מפרשים משמעותיות.

פרטיות ונפיחות

בניגוד למאגרי מידע מודרניים, גורורה היסטורית לעיתים קרובות אינה שלמה.רק חלק ממה שנכתב שרד עד היום, ושבריר קטנה עוד יותר כבר דיגיטציה.זה יוצר הטיה ניצולית שיכולה לעוות תוצאות.ניתוח של מגמות ארוכות טווח חייב להסביר את העובדה שהנתונים מהמאה ה-19 הם הרבה יותר בשפע נתונים משש עשרה.

זרמים עבודה ומעשים עבור היסטוריונים

היסטוריונים אינם צריכים להיות מתכנתים מומחים כדי לשלב NLP במחקר שלהם.קשת של כלים קיימת, החל ממשקים גרפיים ברמה גבוהה לספריות תכנות ברמה נמוכה.הבחירה תלויה בנוחות הטכנית של החוקר ואת המורכבות של השאלות המבוקשות.

כלים מבוססי GUI לניתוח מהיר

עבור חוקרים שרוצים להתחיל במהירות ללא קוד כתיבה, כמה פלטפורמות ניתוח טקסט חזקות זמינים.FLT:0Voyant ToolsFLT:1 הוא יישום מבוסס אינטרנט המאפשר למשתמשים להעלות טקסט ומיד ליצור עננים מילה, רשימות תדירות, גרפים של מיקום, ומודלים של ערכת נושא.זה חינם ודורש לא התקנה, מה שהופך אותו אידיאלי לשימוש בכיתה או ניתוח exploratory.

תכנות עם Python ו-R

(ב) [ה] מחקר קפדני יותר, התחדשות, והערכה מותאמים אישית, היסטוריונים פונים יותר ויותר להערות של שפות תסריטים (FLT:0]PythonFLT:1 הוא השפה הדומיננטית עבור NLP, עם ספריות כגון FLT:2Natural Language Toolkit (NLTK)FLT 3, SpaCy, ו Gensim המספקים פונקציות מראש עבור כל מה שקשור לדגם:

בניית קורפוס

הצעד הראשון בכל פרויקט NLP הוא בניית גוף באיכות גבוהה.לצייר טקסטים מארכיונים דיגיטליים אמינים הוא קריטי.

  • [01:0] ⁇ [ה]מקדשים: [ה]ה' [ה']: [ה'] ויקרא:2: ⁇ ⁇ ⁇ ] ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
  • [01:0]10]10: [קרא] ,[2]:2: [ה]: [ה]מקדש] 3 [ה], מאגר נתונים של עיתונים אמריקאים היסטוריים בין 1777 ל-1963, המסופק על ידי ספריית הקונגרס.
  • (ב) [ה]ה] [ה]באלי ב'בא" (Belley OnlineFcioLT:2]: [ה]: [הדור השלישי] מהדורה מלאה של הליכים של בית הדין הפלילי המרכזי בלונדון, המשתרעים על פני 1674 עד 1913.
  • (ב) [ה]העיקרון [ה]: [ה] [ה]] [ה]: [ה] [ה]]]] [ה]]] [ה][דרושה]]]]] [ה]]] [ההההההההההתנדבה של ה']: [ה'] [ה'] [ה']']'[ה'[ה']']']'[ה']']'[ה'[ה'[ה'[ה'[ה'[ה'[ה'[ה'[ה'[ה'[ה'[ה'[ה']'[ה'[ה']']'[ה']']'[ה'[ה'[ה']']'[ה'[ה']'[ה'[ה']']']'[ה'[ה'[ה'[ה']'[ה'[ה']'[ה'[ה'[ה'[ה']'[ה'[ה']'[ה'[ה'[ה'[ה'[ה

לאחר שקורפוס נאסף, יש לנקות אותו מראש ולפתח אותו.זה כולל הסרת ראשים והולכי רגל, סטנדרטיזציה קו הפסקות, המרת ligatures (למשל, "fi" ל "fi"), וליישם כל תיקונים הכרחיים לטקסט.אפילו כמות קטנה של ניקוי יכול לשפר באופן דרמטי את הדיוק של משימות מטה.

כיוונים עתידיים: מודלים שפה גדולים והיסטוריה דיגיטלית

הפיצוץ האחרון של מודלים שפה גדולים (LLMs) - כגון GPT-4, קלוד, ו חלופות קוד פתוח כמו Llama ו Mistral - מייצג שינוי פרדיגמטי לניתוח טקסט.מודלים אלה מסוגלים לסכז, לתרגם, וליצור טקסט באיכות אנושית.עבור היסטוריונים, LLM מציעים אפשרות זוהה של שאילתה ארכיון בשפה הטבעית במקום לכתוב נושא מורכב, לדוגמה "סקרנימוס" זה יכול פשוט להזכיר את כל ה" או "מפרקט" של כל אלה "הפרקים" על ידי" על ידי" (פרקים" (פרקים" (Credit) של חמישים פרקים) ו" (rem) של "מפרקים) של "מפרקים" (rem) על ידי "מפרקט) על ידי "מפרקט) של "מפרקטמפרקטמפרקטמפרקט) של "מפרקים" (a" (a" (exm) על ידי היסטוריונים, לדוגמה, "מפרקים" (exanmatics) באופן טבעי של "מפרקט) של "מפרק "מחדש) של "מפרק "מחדש) של "מחדש) "מחדש) "מחדש) "מחדש) "מפרק "מ

עם זאת, LLMs מציגים סיכונים משמעותיים למחקר היסטורי.הם נוטים ל- (FLT:0haluaproinationFLT:1), כלומר הם יניבו בבטחה מידע כוזב – המצאת ציטוטים, ציטוטים לא מתאימים, או אימות אירועים reducing.הם צריכים להיות מאומן על גירסאות מסיביות, ללא תיקון כי חסר הקשר היסטורי 18 LLM עשוי לכפות מסגרת אידיאולוגית מודרנית על טקסט היסטורי, או ניתוח מוטמעם לא יכול להיות משקף את האפשרות של שיטות מחקר ראשוניות, ולא ניתן לשנות את זהה של המאה הקודמת.

התפקיד של Multimodal Analysis

עתיד ניתוח הטקסט ההיסטורי נע מעבר לטקסט טהור.מסמכים היסטוריים אינם רק מילים; הם אובייקטים פיזיים עם הפריסה, איורים, שוליה, וחייב.FLT:0Multimodal AnalysisFLT:1 משלב NLP עם ראיית מחשב לנתח את הטקסט ואת התמונה בו-זמנית.זה מאפשר לחוקרים ללמוד את הקשר בין טקסט ואיוריו, לנתח את הידות משולבות לאורך כל תיאור הטקסטים של טקסט רגיל או תיאור כללי של טקסט מודרני, באופן אוטומטי, כדי לזהות טקסט רגיל של טקסט רגיל, או לתאר טקסט רגיל של טקסט רגיל, לדוגמה, לדוגמה, לדוגמה, או לתאר טקסט מודרני.

שאלות הומניסטיות, כלים

שילוב של עיבוד שפה טבעית למחקר היסטורי אינו על אוטומטי של ההיסטוריון מתוך עבודה.זה על הרחבת היקף מה שההיסטוריונים יכולים לדעת.פלט חישובי רול אינו ויכוח היסטורי גמור; זוהי פיסת ראיות הדורשת פרשנות ביקורתית.ההיסטוריון חייב לשאול: מדוע נוצר דפוס זה?מה הנתונים נכשלים ללכוד?

על ידי שליטה בכלים אלה, חוקרים יכולים לנווט את הארכיון הדיגיטלי העצום של המאה העשרים ואחת בביטחון.הם יכולים לבחון השערות בקנה מידה, לחשוף דפוסים נסתרים של השפעה, ולשאול שאלות מהדהדות על שפה, תרבות וכוח לאורך זמן.הטרנספורמציה הדיגיטלית של ההיסטוריה אינה איום על המשמעת; זוהי הזדמנות לחדד את השיטות שלנו ולהעמיק את ההבנה שלנו של העבר, ההיסטוריה הדיגיטלית המשכנעת ביותר תמיד תהיה שילוב של ראיות או אלגוריתמיות, אך לא אלגוריתמיות, אלא לא כמו גם אלגוריתמים חישוביים, אלא לא, אלא אלגוריתמים של כלי אלגוריתמים חישוביים, אלא לא אלגוריתמים, אלא לא אלגוריתמים, אלא אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים אנושיים.