Table of Contents
מתוך Inks to Algorithms: How Computational Text Analysis Illuminates the Spread of Literacy
הסיפור של אוריינות אינו רק סיפור על יותר אנשים הלומדים לקרוא ולכתוב.זהו תהליך מורכב, לא אחיד שעוצב על ידי כלכלה, דת, פוליטיקה וטכנולוגיה.במשך מאות שנים, היסטוריונים הסתמך על פרוקסיזות - רשומות רישום בתי ספר, ממציאי בעלות ספרים, וחשבונות אקספונקטוטליים חסרי תקדים - כדי להעריך מתי והיכן החזיקו אוריינות אלה מניבים השקפות יקרות אך מפורות, כיום, חדש של כלים סינתיים, מאפשר לזהות טקסט של טקסט, כלומר, על ידי שינויים מדויקים, על ידי ניתוח מדויק של טקסט, על ידי מלומדים, על ידי ניתוח מדויק, על ידי תיאורים של מלומדים, כלומר, על ידי ניתוח טקסט, על ידי מלומדים, על ידי מלומדים, על ידי שינוי טקסט, על ידי התבוננות בלתי נראים, על ידי התבוננות, על ידי מלומדים, על ידי מלומדים, על ידי ויזואליים, על ידי ויזואליים, על ידי שינוי טקסט, על ידי שינוי טקסט, על ידי התבוננות בלתי-ידי טקסט, על ידי התבוננות בלתי-ידי טקסט, כאשר ואיפה לקח, כאשר ואיפה לקח, על ידי אנליזה היסטורית, על ידי התבוננות בלתי-ידי טקסט, על ידי התבוננות בלתי-ידי ויזואלית, כאשר וכאשר נלקחה, כאשר וכאשר לקח.
מאמר זה מסביר כיצד ניתוח טקסט חישובי עובד, מדוע חשוב להבנת ההיסטוריה של אוריינות, ומה ממצאיו חושפים לגבי תנועת הקריאה והכתיבה מיומנויות לאורך זמן ומרחב.זה גם חוקר את מגבלות השיטה ואת השאלות הקריטיות שהיא מעלה למחקר עתידי.
מה זה Computational Text Analysis?
ניתוח טקסט משלים (CTA) מתייחס לחבילה של טכניקות המשתמשות אלגוריתמים לתהליך, לכמת ולפרש אוספים גדולים של טקסטים כתובים.בניגוד לקריאה קרובה, המתמקדת במסמך יחיד או בגמנט קטן, CTA פועל בקנה מידה, זיהוי דפוסים סטטיסטיים על פני אלפי או מיליוני יצירות.
- (ב) ,0) ניתוח של שקיפות (FLT:1) - ספירת כמה מילים או ביטויים מופיעים לאורך זמן כדי לעקוב אחר השינויים המתמטיים.
- (FLT:0) מודלים מודלים טופוטיים של FLT:1 - טכניקת למידה מכונה שמאגדת מילים לתוך אשכולות (topics) המבוססת על דפוסי קו-אקשן, וחושפת נושאים מאוחרים בקורפוס.
- (ב) ,0) ניתוח של ⁇ (FLT:1) - מדידה של הטון הרגשי של טקסטים כדי למדוד מצב רוח ציבורי או עמדה סמכותית.
- (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (ב) ⁇ :0) ,Geoparsing and Name-entityהכרה ב- 1:1 - מיצוי מקומות, אנשים וארגונים כדי למפות דפוסים מרחביים של שיח.
שיטות אלה תלויות בטקסטים דיגיטליים.במשך שני העשורים האחרונים, בספריות דיגיטליות מסיביות – כגון גוגל ספרים, הספרייה הדיגיטלית של האטימאמין, וארכיון העיתון הבריטי – עשו מאות מיליארדי מילים הזמינות לחוקרים.כאשר הן קשורות לכוח מחשוב, הגורורה הזו הופכת למעבדות ללימוד התפתחות תרבותית.
למה לייטרקידי עוזב את הטריק הדיגיטלי
Literacy הוא לא רק מיומנות; זה תרגול חברתי מוטבע בייצור טקסטים.כפי שיותר אנשים הופכים לליטריים, נפח הכתיבה עולה, שפה משתנה, ואת קהליו מתפזרים.ניתוחים של Computational לוכדים את הטרנספורמציות האלה לפחות שלוש דרכים:
(FLT:0) ראשית, הרחבת אוצר המילים.FLT:1 אוכלוסיות מלומדות לעתים קרובות לאמץ מבנים דקדוקיים פשוטים ואוצר מילים קונקרטי יותר לפני המעבר לכיוון מופשטת. על ידי מעקב אחר תדירות המילים (סעיפים, prepositions) לעומת מילות תוכן (לאונים, פועלים), החוקרים יכולים להסיק שינויים בז'אנר ובקהל.
(FLT:0II, התפלגות ז'אנר: 1 כפי שאוריינות מתפשטת, סוגי טקסט חדשים מופיעים: אלמנאפצים, פאמפיונים, אותיות אישיות, דילמות, ובסופו של דבר עיתונים והרומנים. שיטות הגשה יכולות לסווג מסמכים על ידי ז'אנר באופן אוטומטי, ומאפשר להיסטוריונים לראות מתי והיכן צורות מסוימות הפכו נפוצות.
(FLT:0)Third, diffusion גיאוגרפי.ve.ph.il1) שימוש ב- metadata על מקום הפרסום או המחברות, החוקרים יכולים למפות כיצד חידושים lexical – כגון מילים חדשות או מוסכמות איות – לנסוע לאורך נתיבי מסחר, קווי רכבת או רשתות דואר.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.ד.החוקרים יכולים לעתים קרובות למפות את הדפוסים אלה מתאם אלה מתאם הם לעתים קרובות תואמים עם התרחבות ההתרחבות של חינוך והפצת ספרים והפצת ספרים.
המונחים: Rise of Vernacular Languages
מלטינית לשפת העם
אחת האפליקציות המוקדמות ביותר של CTA להיסטוריה אוריינות מעורבת בעקביות המעבר מלטינית לשפות ונדוניות באירופה. בימי הביניים, הייצור הספרותי נשלט על ידי הלטינים, נגיש רק לכמרים ואליטה דקה.על ידי המאה השש־עשרה, הדפסה אפשרה ייצור המוני של ספרים בגרמניה, צרפתית, אנגלית ואיטלקית, ניתוחים של LT:0 ספרים באנגלית מוקדם יותר מאשר 17 אחוזים של אנגלית, 000, 000, 000, 000, 000 מאוחר יותר, 000.
המונחים: e-racy proxy
החוקרים השתמשו גם בנוסחאות קריאה - מפותחות לחינוך מודרני - בטקסטים היסטוריים.ציון פלש קורא Ease, כאשר החלים על פיפיונים בריטיים מהמאה השמונה-עשרה, מגלה ירידה מתמדת במורכבות כמו מדפסות ממוקדות קוראים נמוכים יותר.טקסטים שנועדו "קוראים קוד זדוניים" השתמשו במשפטים קצרים יותר, פחות סינקלים למילה, ועוד אזכורים קונקרטיים.
מחקרים בנושא ההיסטוריה של Literacy
9teenth-Century Europe: The Urban Literacy בום
המאמר המקורי הזכיר את המחקר הזה, בואו להרחיב אותו עם פרטים חישוביים.שימוש ב-FLT:0)Chronicling AmericacioFLT:1 מסד נתונים של עיתונים (Library of Congress), היסטוריונים בחנו את הפיצוץ של עיתונים מקומיים ברחבי ארצות הברית ובאירופה.ברוסיה, למשל, עיתונים לנפש הכפילו בין 1820 ל-1860.
ניתוח של אותיות לעורך בעיתונים המחוזיים הצרפתיים בין 1830 ל-1870 מצביע על מתאם בין שיעורי אוריינות לבין תדירות של טענות פוליטיות מורכבות.באזורים עם רישום גבוה יותר, מכתבים השתמשו במצב רוח חתרני יותר ונקודות ננקטות מופשטות, מה שמרמז על כך שהקוריינות אפשרו לקוראים לעסוק במושגים מופשטים כמו דמוקרטיה וזכויות.
אנגליה העתיקה: המהפכה המודפסת
הקמפיין הראשון של אוריינות ההמונים בעולם האנגלופוני התרחש באנגליה במאות השש-עשרה וה-17, מונע על ידי הדגשה פרוטסטנטית על קריאה בתנ"ך.ניתוח של ה-FLT:0 English Short TitleקטלוגFLT:1 (ESTC) מראה כי בין 1550 ל-1640, מספר הכותרות המתפרסמות מחדש לעשור גדל על ידי גורם של 10.
מחקר אחד השתמש בדוגמת הנושא על 20,000 דופיות אנגליות מ-1,600 עד00.המודל חשף אשכול נושא "ההוראהי" ייחודי המכיל מילים כמו "קריאה", "ספיל", "קכיזם" ו"ילד" את שיעור הטקסטים בנושא זה הגיע לשיא במהלך 1640 ו-1650 כפרים, תקופה של תהפוכות מהפכניות כאשר הפרלמנט קידמ בין חיילים ופרקטים גיאוגרפיים של פאת אלה, לאחר מכן, החל מערים קולוניאליות, החל מלונדון, לאחר מכן עברו מתחומים קולוניאליות, לאחר מכן, עד מאוחר יותר, עד מאוחר יותר, עד לערים קולוניאליות, עד מאוחר יותר, החל מלונדון.
3.קולוניאליזם ופוסט-קולוני
ניתוח טקסט משלים הוא עכשיו מיושם על התפשטות האוריינות בחברות מקוטינות. חוקרים מאוניברסיטת הלסינקי השתמשו בניתוח N-gram על עיתונים הודיים מהמאה ה-19 בשפה האנגלית ואזורית.הם מצאו כי השימוש במילים באנגלית בעיתונים אוריינות ונדאריים גדל במהירות לאחר 1857, המציין כי שיעור מפרש דו לשוני היה מתפתח.
באפריקה שמדרום לסהרה, טקסטים מהונדסים מיסיונריים מספקים את החומר הכתוב הקדום ביותר בשפות רבות. סטריאוטיפים של Computational (בהשוואה סגנונות סמכותיים) מרמזים כי תרגומים מוקדמים של התנ"ך לתוך Yoruba ו Xhosa פשוט מבנים דקדוקיים ילידים כדי להתאים את רמת הקריאה של ממירים חדשים.זה היו השפעות ארוכות טווח על התפתחותן של שפות אלה שנכתבו.
חידושים מתודולוגיים: כיצד חוקרים מפטרים אותות
N-Gram Analysis
אולי הכלי החישובי הפשוט ביותר הוא ה-N-gram, רצף בולט של מילים n.google Books Viewer פופולרי את היכולת לייסד את תדירות הביטויים במשך מאות שנים.עבור מחקרים אוריינות, n-grams לחשוף את אימוץ מילים חדשות - כגון "telegraph" או "newspaper" - המציין הרחבת רשתות המידע של אנגלית N-grams מ -1 1700–1900 מצאו את הביטוי הזה ב-36 ל- "לכתוב" מוקדם יותר מאשר ל-" מיומנויות כתיבה" מאוחר יותר מאשר "50" לאחר כתיבתוואו," מאוחר יותר, בעוד שמציינות" (יותרות" (יותרות" (יותרות" (יותר מ-800 שנים מאוחר יותר, 000) ו-36 מעלות) ו-800.
מודלים לאורך זמן
בדוגמת אלגוריתמים כמו Latent Dirichlet Allocation (LDA), מקבץ אוצר מילים בנושאים שבני אדם יכולים לפרש. Applied to the FLT:0) אוסף המאה השמונה-עשרה של המאה השמונה- 80 (EC) corpus, הנושא מודל זיהה מעבר ברור מן הכרך הנשלט על ידי נושאים דתיים וקלאסיים על ידי מדע, מסחר, וסיפורה לאחר 1760 זה, עם שינויים מהירים יותר, כאשר הם גילו את מרכזי אוריינות עירוניים, אשר עברו מתחומים פוליטיים, אשר עברו מתחומים תרבותיים, כאשר הם התפתחו מתחומים שונים, כאשר הם עברו מתחומים שונים, כאשר הם עברו מתחומים תרבותיים, כאשר הם התפתחו מתחומים שונים, כאשר הם מתחומים שונים, כאשר הם עברו מתחומים שונים, בהשוואה למקורות אוריינות, כאשר הם מתחומים שונים, כאשר הם מלונדון, בין היתר, כאשר הם עברו מתחומים תרבותיים, כאשר הם התפתחו מתחומים שונים, כאשר הם מתחומים תרבותיים, בין מרכזי אוריינות, בין מרכזי אוריינות, בין אם הם מלונדון, בין מרכזי אוריינות, בין מרכזי אוריינות, לבין מחקרים הקשורים לערים, אשר עברו מלונדון, בין אם הם, לבין אלה, אשר עברו מתחומים תרבותיים, אשר עברו מתחומים תרבותיים, אשר עברו מתחומים שונים,
המונחים: Stylometric Readability metrics
מעבר לתוכן, כלים חישוביים מודדים את "הקריאה" של טקסטים.אינדקס קולמן-ליאו, שתוכנן במקור עבור אנגלית מודרנית, ניתן להתאים טקסטים היסטוריים על ידי התאמה לשינויים באיים. Applied to acorpus של 10,000 הרומנים האמריקאים מ 1770 עד 20, ציוני קריאה ירדו באופן משמעותי לאחר 1840, כאשר תנועת בית הספר המשותף החלה.זה מרמז כי מחברים ממוקדים יותר ויותר עם חינוך מוגבל, מופיעים באותם משפטים פופולריים משנת 1790:
היתרונות של ניתוח Computational עבור ההיסטוריה Literacy
- (ב) ,0) ,ScaleFLT:1: CTA יכול לעבד מיליוני טקסטים בשעות, בלתי אפשרי עבור חוקר יחיד.
- (ב) [ה]: [ה] [ה]]: אמצעים קוונטיים מפחיתים את הסיכון לראיות של צלע הדובדבן לתמוך בנרטיב טרום-הבחנה.
- (FLT:0)ComparabilityFLT:1: ניתן ליישם שיטות דומות בשפות שונות, אזורים ותקופות, המאפשר ניתוח בין-תרבותי.
- (ב) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
- (ב) [15] הדור של היפותאוזיס 1: דפוסים בלתי צפויים בנתונים יכולים להוביל את החוקרים לשאול שאלות חדשות על סיבתיות.
לדוגמה, מודל נושא של עיתונים בשפה הגרמנית בשנים 1848-1850 חשף ירידה חדה באוצר המילים בפרסומים שמרניים, בעוד פרסומים ליברליים הגבירו את שלהם.זה רמז על דיכוי ביטוי בין סופרים שמרניים - אבל מאז השמרנים היו בשלטון, שנראה פרדוקסלי.
אתגרים ומגבלות
דיגיטיזציה Bas
לא כל הטקסטים ההיסטוריים שרדו, ואלה שאינם דיגיטליים אפילו.ארכיונים אירופיים קדמונים רשומות ממשלתיות וספרות קאנונית על פני פֶּתַה כמו כרטיסי מסחר או אותיות אישיות. כתוצאה מכך, ניתוחים חישוביים עשויים להציג פרספקטיבה גברית עילית. Libraries בדרום הגלובלי הם לעתים קרובות תחת ספרותית, מחלחלים את תמונתנו של התפשטות האוריינות עולמית.
איכות OCR
זיהוי האופי האופטי (OCR) לעיתים קרובות נאבק עם גופנים היסטוריים, נמוג דיו, ופריסת לא סדירה. שגיאות יכול להיות גבוה כמו 30% עבור טקסטים מודרניים מוקדמים.אם חוקר לא לנקות את הנתונים, ספירת תדירות הופכת לבלתי אמינה.
שפה מורכבות
שפות עם מורפולוגיה מורכבת (Finnish, Arab, Quechua) מציגות אתגרים לסימון.גם, לחש היסטורי לא היה סטנדרטי; "קריאה" עלולה להופיע כ"rede", "reade", או "reed". החוקרים חייבים להפוך את האיות או להשתמש במודלים ברמת אופי כי הם יקרים יותר חישוביים.
שקיפות
שחיתות אינה גורמת לעליה במילה "חירות" ב 1790 עיתונים אמריקאים עשויים לשקף צמיחה אוריינות - או פשוט המהפכה הצרפתית כנושא.יש למסד את הממצאים ההשתתפות בהקשר היסטורי ושלישייה עם מקורות ארכאוניים.FLT:0) אין תחליף למלגה מסורתית אלא לשלימה.
גדרות סקיל
ניתוח טקסט משלים דורש מיומנויות תכנות (Python, R) ומוכר עם סטטיסטיקות.מחלקות היסטוריה רבות עדיין חסרות הכשרה בתחומים אלה, אם כי מרכזי מדעי הרוח הדיגיטליים גדלים. Open-source פלטפורמות כמו FLT:0reaFLT:1Voyant ToolsFLT:2irFLT 3:2) נמוך יותר את המחסום למתחילים.
שאלות אתיות ואסטרטלוגיות
כמו בכל שיטה דיגיטלית, CTA מעלה שאלות על מה נחשב כראיה.האם תדרי מילה באמת מודדים אוריינות, או רק את האינטרסים של המו"לים? האם מודל נושא חושף כוונה בכתב או רק את מגבלות הז'אנר? השדה עדיין מטלטלטל את הנושאים האלה.אחד הפרקטיקה הטובה ביותר היא לשלב ניתוח חישובי עם קריאה איכותית של טקסטים ייצוגיים - לפעמים נקרא "קריאה נחושה" ו"קריאת "סגורה" לקריאה.
(ב) דאגה נוספת היא הטיה אלגוריתמית.מודלים של נושאים מאומנים על כל הטקסטים זמינים; אם קורפוס הוא 90% ממחבר גברים, הנושאים ישקף חששות זכריים.החוקרים צריכים לשאוף באופן פעיל לכלול את כתיבתן של נשים, ספרות קולוניאלית וקולות שוליים אחרים.
כיוונים עתידיים
ניתוח רב לשוני וצלב-Script Analysis
רוב עבודת CTA הייתה באנגלית.אבל אוריינות התפשטה לעתים קרובות רב לשונית - אנשים קוראים בשתי שפות או יותר.מודלים חדשים כמו רב לשוני אלברט מאפשרים לחוקרים לנתח טקסטים בשפות מרובות בו זמנית, חושף כיצד רעיונות ומילים עברו מעבר לגבולות לשוניים. לדוגמה, עבודה ראשונית על העולם הים התיכון מראה כי באוריינות ערבית, ספרדית וקטלאנית כפיית שנקטו בתחילת ולנסיה, עם ניתוח חישובי המראה lexic ותבניות תקשורת דתיות.
נתונים קטנים ותשתיות
לא כל המחקרים דורשים מיליוני טקסטים "מידע קטן" שיטות חישוביות - החל מכמה מאות מסמכים מחוסנים בקפידה - יכולים לספק תובנות על קהילות ספציפיות.עלייה של מרכזי מדעי הרוח הדיגיטליים באפריקה, אסיה ואמריקה הלטינית פירושה יותר שחקנים מקומיים יכולים לספר את ההיסטוריה האוריינות שלהם באמצעות כלים חישוביים.
Machine Learning and Handwritten Text Recognition
עד לאחרונה, ניתוח טקסט חישובי היה מוגבל לטקסטים מודפסים, אך מאפשר לחוקרים לנתח דיאלים, מכתבים אישיים ורשומות אדמיניסטרטיביות - המסמכים שלעתים קרובות היו העדות הראשונה של אוריינות משותף.
מסקנה
ניתוח טקסט משלים אינו שרביט קסמים, אבל זוהי עדשה רבת עוצמה.על ידי הפיכת מיליארדי מילים לדפוסים קוונטיים, זה מאפשר להיסטוריונים לראות את התפשטות האיטית, הבלתי אחידה של אוריינות כפי שקרה למעשה – לא כעקומה חלקה אלא כסדרה של גלות, מישורים, ועיוותים שעוצבו על ידי מלחמה, דת, סחר ומדיניות.ה הראו כי היערכות מעגלית לפני הרבה אוריינות, כמו גם מיומנויות קריאה, אשר הורחבודות קריטיות, כמו גם שיטות קריאה, כמו גם שיטות קריאה, וכתובות, כמו גם שיטות קריאה, ורחבות, כמו גם שיטות קריאה.
עם זאת, השיעורים החשובים ביותר עשויים להיות על גבולות הראיות.מה ניתוח טקסט חישובי מגלה הוא במידה רבה האוריינות של אלה שיכולים להרשות לעצמם להדפיס ולאחסן טקסטים.השליח באמת – אלה שלא השאירו שום זכר כתוב – נותרו חבויים.אבל על ידי שילוב הכלים החדשים האלה עם עבודה ארכאית מסורתית, החוקרים יכולים להקשיב יותר בזהירות לקולות ששרדו, ולשאול שאלות טובות יותר על אוריינות העבר.
ככל שיותר טקסטים הם דיגיטאליים ואלגוריתמים הופכים ליותר מתוחכם, ההבנה שלנו כיצד קריאה וכתיבה מתפשטת רק להעמיק.עבור עכשיו, התחום עומד על סף מבטיח, שבו הישן והחדש - ה דיו והאלגוריתם - פועלים יחד כדי להאיר את אחד ההתפתחויות ה ⁇ ביותר בהיסטוריה האנושית.