study-guides-and-learning-resources
השימוש באלגוריתמים של למידה מכונת כדי לזהות אי-הסדירות בנתונים היסטוריים
Table of Contents
השימוש ב- Machine Learning Algorithms to Detect Inconsistities in Historical Data
מחקרים היסטוריים תלויים כבר זמן רב בבדיקה זהירה של מקורות ראשוניים – מגיוסים, רשומות מפקד, ארכיון עיתונים, התכתבות דיפלומטית וממצאים חומריים.אבל הארכיונים השמורים ביותר מכילים שגיאות, הרשאות, וניגודים גלויים של נתונים אלה, אשר ביצעו כעת אלגוריתמים היסטוריים חסרי שליטה (מפרקים של אלגוריתמים), אשר אינם מחוסנים, אלא אלגוריתמים היסטוריים, או סימפוניים, אשר אינם מסוגלים לזהות את הפגמים היסטוריים, אך ורק לפני דורות של אידיאולוגיים, אשר אינם מקודמים, אלא אידיאולוגיים, אלא אידיאולוגיים, אשר אינם מקודמים, אשר אינם מקודמים, אשר מובנים, אלא אידיאולוגיים, אשר אינם מקודמים.
הבנה של Machine Learning in Historical Data Analysis
למידת מכונה היא תת-קבוצה של אינטליגנציה מלאכותית המאפשרת מערכות ללמוד מהנתונים מבלי להיות מתוכנת במפורש לכל כלל. בניתוח היסטורי, אלגוריתמי ML אלגוריתמים גדולים ביותר של נתונים מובנים (למשל, שדות מפקדים לשוניים) וטקסט לא מובנה (למשל, רשומות, יומנים, צוואה, רשומות בית משפט) לזהות דפוסים המידרדרים מנורמות הצפויות.
המונחים: Features, Labels, and Training
(ה) כל פרויקט ML מתחיל בהגדרתו של FLT:0 (הכוללים) מאפשר את מספר 1 (למשל, תכונות בלתי ניתנות למדידה של הנתונים) ותכונות היסטוריות, יכולות לכלול שדות תאריך, שמות מקומות, שמות אדם, כמויות מספריות (למשל, גילים, מס), וסימנים לשוניים נעדרים (למשל, תדירות, כתבי יד).
סוגי מכונות למידה של Inonsistencies יכול לתפוס
נתונים היסטוריים לא עקביים לוקחים צורות רבות, ומשפחות אלגוריתמיות שונות מתאימות לבעיות שונות:
- (ב) ניגודים צ'טרונולוגיים: 1FLT דייטים המפרים את תקופות החיים הידועות, תקופות קבועות או רצפי אירועים.
- (ב) ⁇ :0) קדמונים: קדמונים 1 לא מציאותיים (למשל, אדם בן 150), כמויות מס בלתי ניתנות לערעור, או אוכלוסייה פתאומית קופץ.
- (ב) מילים או ביטויים המופיעים לפני כניסתם לשפה, או אזכורים לאירועים שטרם התרחשו.
- (ב) ,0) , מדרשים או ליד מדרשים: 1 (ב) 1 (ב) אותו אדם או אירוע נכנסו מספר פעמים עם שינויים קלים.
- (ב) מדרש (ב) ,ב[[1924]], [[1924]]]]]], [[1924]]]]]], [[1924]]]]]], [[1924]]]]]]]], [[1924]]]]]]]], [[1924]]]]]]]]]], [[1924]]]]]]]]]]
- (ב) סיקור:0) סיקור: FLT:1 Systemic under-representation of groups, אשר ML יכול לזהות באמצעות פערים מפוזרים.
Machine Learning Algorithms in Practice
בחירת האלגוריתם הנכון תלויה בטבע הנתונים ההיסטוריים ובסוג של אי-הסכמה ממוקדת.למטה הם המשפחות הנפוצות ביותר, יחד עם מקרים של שימוש ממצאי.
למידה מבוססת: סיווג ותוקפנות
(ההיסטוריונים ניגשים למצע אמתי – הקלטות שאובחנו באמצעות רשומות ארכיוניות של הצלב – מודלים על-ידי פיקוח יכולים ללמוד לסווג רשומות חדשות כ"לא עקביות" או "לא עקביות" (FLT:0Randomir) ב-900 נקודות תורמות של נתונים היסטוריים (FLT) ו-FLT:2 עצים מקודמים על-FLT 3 פופולריים משום שהם מכילים מספר מיוחד של קטגוריות:
למידה בלתי מבוקרת: קלוסטרינג וזיהוי אנומלי
רוב הנתונים ההיסטוריים חסרים תוויות מאומתות לחלוטין – החוקרים הפולשים מאוד רוצים למצוא לא ידועים (לא מבוססים על שיטות) שיובאו לידי ביטוי בחוקי החברות ב-FLT:0K-meanssublementing FlormentFLT:1 ו-(FLT:2DBSCANFLT) 3, אשר היו רשומים יחדיו רשומות דומות; רשומות שנפלו רחוק מכל סנטימטרים, הן ככל הנראה, לדוגמה, של מחקר אנגלי, על ידי ספירת זיכרון יחידני.
עיבוד שפה טבעי (NLP)
(הטקסט ההיסטורי) הוא מחווה לעקשנות: טכניקות NLP מודרניות מנתחות אוצר המילים הארכאי, ביטויים סכיניים, ושינויים בסגנון הכתיבה לאורך חיי חייו של סופר יחיד, אשר למדו את האתגרים הללו באופן איתן.FLT:0 שם של זיהוי גוף (NER) 10:1 ממג'לס אנשים, מקומות, תאריכים וארגונים, ולאחר מכן חוצה-הבדלים ידוע על ידי ALT5s) כדי לשנות את ההכרה ה-Ternance (Treat) של 2, לאחר מכן, לאחר מכן, לאחר מכן, לדוגמה, 000) של ALT1, 000, 000, 000, 000, 000, 000, 000, 000, 000, 000, לאחר מכן, 000, 000, 000, 000, 000, 000 ידוע, 000, 000, 000, 000, לאחר מכן, 000 ידוע, 000, 000) הוא ידוע, 000, 000, 000, 000, 000, 000 ידוע, לאחר מכן, 000, 000, 000 ידוע, 000 ידוע, לאחר מכן, 000, 000 ידוע, 000, 000, 000, לאחר מכן, 000, 000 ידוע, 000 ידוע, 000, 000, לאחר מכן, 000 ידוע, 000 ידוע, 000 ידוע, 000 ידוע, 000 ידוע, 000 ידוע,
המונחים: history shapeing Variation
אתגר מפתח עבור NLP הוא כי איות סטנדרטית יכול לגרום מודלים סטנדרטיים להתייחס לצורות וריאנטים כמו מילים שונות. ⁇ מילה משנה (Byte-Pair Encoding) עוזר, כמו מילת אימון הטמיעה על פני זמן ספציפי corpora.חלק פרויקטים, כגון FLT:0ford Historyפקולטה לייט:1 LT) העבודה של אנגלית מוקדמת, יצרו מודלים מיוחדים על ידי זיהוי מוקדם של 15%.
יישומים במחקר היסטורי
היכולות התיאורטיות שתוארו לעיל הופצו במספר גדל והולך של חקירות היסטוריות קונקרטיות.התפיסות הבאות ממחישות כיצד זיהוי חוסר עקביות מונע על ידי ML מעצב מחדש מלגה.
קביעת תאריך התנגשות ב-Royal Chronicles
כרוניקה מימי הביניים לעיתים קרובות הקליטה את אותו אירוע עם תאריכים שונים, בשל שגיאות סציפיות, מערכות לוח שנה שונות, או שינויים מכוונים. צוות במכון פלאנק עבור ההיסטוריה של מדעיםFLT:1 בנתה מודל מבוקר מאומן על קורפוס של 50,000 אירועים ממקרי כרוניקה אירופיים (900-1500 לספירה) המודל המשמש כסימוכין עונתיים, ימי האנגלו-אסטרונומיה, ותופעות כרוניות, אשר היו כנראה, כאשר מדוברות, שלוש שנים, כאשר הן ידועות, לעומת זאת, האלגוריתם כרוני, אשר דווח על פני שלוש שנים, אשר דווחודות, שלוש שנים, כאשר הוא מופיע מחוץ לאלגוריתם כרוני, כאשר הוא נחשבודות, כאשר הוא מופיע מחוץ לאלגוריתם כרוני, 3 שנים, אשר דווח על ידי שלושה שבועות, כאשר הוא נחשבודות, 3 שנים, כאשר הוא נחשבודות, 3 שנים, בין התאריכים של דייט כרוניקלוני, כאשר הוא נחשבודות, כאשר הוא נחשבודות, בין התאריכים, בין התאריכים, בין התאריכים, בין התאריכים, בין התאריכים, בין השנים האחרונות, בין השנים האחרונות, בין השנים, בין השנים האחרונות, בין השנים, בין השנים האחרונות, בין השנים, בין השנים, בין השנים, בין השנים, בין השנים האחרונות, בין השנים האחרונות, כאשר הוא נחשבו, בין השנים
זיהוי חסרונות בנתונים Census
מפקדים היסטוריים הם מקורות עשירים למחקר דמוגרפי, אך הם בלתי עקביים לשמצה בשמותיהם של שמות שאינם מאוימים, בגילאים מעוגלים, הכיבושים שנרשמו באופן בלתי עקבי, ומשפחות שמפוזרים על פני דפים.לא ניתן היה לזהות מטענים בלתי ניתנים לערעור, למשל, ה-FLT:0 מערב נתונים HubFLT:1 (הקשר בין נתונים בריטיים מ-41 עד גיל 14) היה כנראה רק ל- 14 מקרים ישנים יותר מאשר אצל הורים.
ניתוח של כתב יד ושפה להשתמש כדי לבדוק את Authenticity
(ב) היומן תמיד גרף ארכיוןים היסטוריים. Machine Learning, במיוחד ראיית מחשב בשילוב עם NLP, מציע כיום כלי אימות חזקים.FLT:0Handwritingזיהוי (HWR)PSK: דגמי 1LT3 מאומנים בתסריטאים מהתקופה של ה-Nexit (זרם שבץ) לאורך קבוצה של מסמכים המיוחסים לאותה ארכיונים סטטיסטיים באופן ספציפי, ניתן להשוות את האותות של ה-Fcactern) ל-S (הפרק של קובץ מסמכים שמאוחר יותר) של קובץ ה-S) ל-S) אשר היה אמור להיות בעל שם הוא סימן של קובץ מסמכים שמאוחר יותר מ- 19(NUMDVDNSDNS) על ידי קובץ ניטארי) על ידי קובץ ניטארי (S) של קובץ של קובץ ניטארי).
Uncovering Biased or In Complete Records
⁇ ⁇ לעתים קרובות לשקף את ההטיות של יוצריהם - לדוגמה, רשומות רשמיות עשויות לתחת נשים, מיעוטים או עניים למידה מכונה יכול לחשוף את הפערים האלה לא על ידי מציאת שגיאות מפורשות, אלא על ידי חשיפת דפוסים של השמה:0Association Rule Minumer) באופן שיטתי של נתונים בלתי חוקיים של נשים חסרות שליטה (למשל, "נקבה" בעלים") + אטומים פחות צפוי, אפילו לחיקוי של חוקי מין מסוימים, לאחר שנעלמוקלטים, לאחר שעדיין לא ניתן היה פחות מ-עשרים, לאחר שעדיין לא ניתן להבחין ב- 19 פולשים, כמו כן, כמו כן, כמו כן, כמו כן, כמו כן, כמו כן, כמו כן, כך, למשל, על ידי חוקי מין מקודמים, למשל, על ידי חוקי מין מקודמים, למשל, לדוגמה, לדוגמה, לדוגמה, לדוגמה, על ידי חוקי מין ממין, על ידי נשים נעדרים, על ידי נשים נעדרים, לדוגמה, על ידי שימוש ב-עשרים, כך, לדוגמה, לדוגמה, כך, כך, לדוגמה, לדוגמה, לדוגמה, לדוגמה, על ידי חוקי חיסון, לדוגמה, לאחר ש"מתקני חיסון, על ידי פולשים מוקדמים יותר מאשר "מחוק כפול, "מתקני מין
אתגרים ושיקולים אתיים
למרות ההבטחה של זיהוי חוסר עקביות מונע של ML, הדרך היא תקועה עם מכשולים.חלק מהם הם טכניים, אחרים אתיים; כולם דורשים ניווט זהיר.
איכות נתונים ומחסור
מודלים של למידת מכונות הם נתונים-hungry. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . מודלים היסטוריים נתונים הם מודלים של נתונים היסטוריים המבוססים על כמה מאות רשומות מאומתיים, בעוד לעתים קרובות גדול, הם עלולים להיות מובחונים לעתים קרובות מעושנים, הם רעילים, הם רעילים, , , , , , הם רעועתקכי הם רועשים, , , , , , , , , , ⁇ ⁇ , ⁇ ⁇ , , , ⁇ ⁇ , , ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇
Bas Amplification
אם הנתונים ההיסטוריים מוטים – למשל, מתחת ייצוג נשים – מודל ML המאומנים על נתונים אלה ילמד שנשים "אנומליות" ועשויות לסמן ערכים נשיים אמיתיים כחוסר עקביות.זה לא פגם של האלגוריתם, אלא השתקפות של הדעות הקדומות המקוריות של המקור, כלומר, החוקרים, בוטחים במודל, עשויים לצנזורה או "תיקון" נתונים חוקיים, ובכך לחיקוי של אותם אסטרטגיות של נתונים דמוגרפיים, כגון בדיקות נתונים, אשר דורשות, אשר נועדו תמיד לאבחון מחדש, כולל אלגוריתמים, כגון אלגוריתמים, כגון אלגוריתמים, בדיקות נתונים דמוגרפיות, כולל אלגוריתמים, אשר נועדו תמיד, כולל אלגוריתמים, כגון אלגוריתמים, בדיקות אלגוריתמים, אשר נועדו לאבחון, כגון אלגוריתמים, כלומר, כלומר, בדיקות נתונים דמוגרפיות, או אלגוריתמים, בדיקות אלגוריתמים, בדיקות אלגוריתמים של אלגוריתמים, כגון אלגוריתמים, אשר נועדו לבדיקות אלגוריתמים, אשר נועדו באופן ידניות, כגון אלגוריתמים, בדיקות אלגוריתמים, כדי לטפל באלגוריתמים, כגון אלגוריתמים, בדיקות אלגוריתמים, כגון אלגוריתמים, כגון אלגוריתמים, אלגוריתמים, אשר נועדו לטפל באלגוריתמים, כגון אלגוריתמים
יכולת ושקיפות
מודלים מורכבים - במיוחד רשתות עצביות - משועבדות כקופסאות שחורות.היסטוריון צריך לדעת (FLT:0 למהר LT:1 תיעוד מסוים היה מוקרן: האם זה התאריך, השם, השפה ללא פירוש, החוקר לא יכול להחליט אם לסמוך על הדגל, הסבירו את הטכניקות "מערכת ההפעלה" המסורתית" (XAI) של נספח (apley Additive Exlanations) ו-"מודל אופציונלי"מחדש" יכול לספק" המקורי של מערכת יחסים עם מודל אופציונלית) באופן ספציפי של מערכת יחסים עם מודל "מתאים במיוחד, בעיקרוידי מערכת יחסים עם מודל לדרגה גבוהה יותר, לדוגמה, לדוגמה, לדוגמה," (מודל אופציונלי, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, לדוגמה, "מערכת לידה סטנדרטית," (מודל אופציונלי," (מודל אופציונלית) של מערכת יחסים עם מערכת יחסים עם מערכת יחסים סטנדרטית," (xconconcongressd-in סטנדרטית) שיכולהסברים, לדוגמה, לדוגמה, לדוגמה, לדוגמה," (מודל לחיקוי) שיכולהסבר ספציפי, לדוגמה, לדוגמה, לדוגמה, לדוגמה," (xacy-ידי מערכת יחסים עם מערכת יחסים עם מערכת יחסים סטנדרטית) שיכולהת-
טיפול מוסרי בנתונים רגישים
רשומות היסטוריות מכילות לעתים קרובות מידע אישי על אנשים שעדיין יש להם צאצאי חיים, או שהם עשויים להיות שייכים לקבוצות מדוכאות (למשל, רישום עבדים, נתונים של מפקד קולוניאלי) באמצעות ML לעמדות דגל בנתונים כאלה, יכולים לחזק באופן בלתי נמנע סטריאוטיפים או לגרום למצוקות, על החוקרים להתייעץ עם קהילות יורדות ולבצע את שיטות העבודה הטובות ביותר עבור ניהול נתונים.
עלויות ומומחיות
מודלים ML מתחכמים דורשים משאבים חישוביים משמעותיים (GPUs, זיכרון, אחסון) ומומחיות מיוחדת כי מחלקות היסטוריה רבות חסרות. Collaborative פרויקטים בין היסטוריונים ומדענים ממוחשבים נפוצים יותר ויותר, אך הם דורשים זמן, מימון והבנה הדדית. Open-source כלים (ראה FLT:0 TranskribusFLT:1 עבור זיהוי כתב יד,LT2: Hogging for the Scale for the Data for the Scale for the Standards for the Index for the Index for the Measuredial Management and the Index for the Index for the Index for the Index for the Index for the Index for the Index for the Index for the DEF5, and the Index for the Disp.
כיוונים עתידיים והשלכות
למידת מכונות אינה כדור כסף לגילוי אי עקביות היסטורי, אבל היא הופכת במהרה לחלק חיוני של ערכת הכלים של ההיסטוריון.כמה מגמות מצביעות על שילוב עמוק עוד יותר בשנים הקרובות.
מודלים רב-ממדיים
מערכות עתידיות משלבות טקסט, תמונה (כתיבה, חותמות מים), ואפילו נתונים מרחביים (GIS לתאם) למסגרת אחת. A Transformer אשר מקודמת במשותף טקסט לטיני של צ'ארטר ודימוי החותם שלו יכול לזהות חותם מזויף המזוהה לדהמה אותנטית - הונאה מימי הביניים נפוצה.
למידה פעילה ואנושית - The-Loop
במקום לקבל באופן פסיבי דגלי מודל, החוקרים מאמצים למידה פעילה שבה המודל שאילתות ההיסטוריון לתוויתים על המקרים הלא בטוחים ביותר.תהליך זה משפר את דיוק המודל תוך שמירה על ההיסטוריון בשליטה.מערכות כמו FLT:0 ProdigyigigigigigigigialFLT:1 עבור NLP מאפשר זרימת עבודה כזו, יישום שלהם נתונים היסטוריים גדל.
בינה מלאכותית אתית באמצעות עיצוב
ככל שהשדה בוגר, היסטוריונים ומדענים מחשבים הם כלי עיצוב משותף אשר מאופים בשיקולים אתיים מההתחלה.זה כולל מודולים שקיפות אשר מכריחים את המודל להפקות הסברים, מגבלות ההוגנות המונעות את העצמת ההטיות ההיסטוריות, ומסגרות הסכמה עבור נתונים רגישים מבחינה תרבותית.
מודלים ליצירת שיקום היסטורי
מעבר לגילוי, AI יכול לעזור ל-FLT:0 â € ¢consistencies על ידי הצעת חלופות סבירות.לדוגמה, מודל יכול להיות מאומן כדי ליצור טווח תאריך חסר סביר עבור כניסה הקהילה פגומים הקהילה.עם זאת, זה מעלה את סט שלו של שאלות אתיות: האם ההיסטוריונים אי פעם "פיל" עבר שאבד?
מסקנה
השימוש באלגוריתמים של למידת מכונות לגילוי אי-הסכמות בנתונים היסטוריים הוא תחום מתקדם במהירות המחזיק פוטנציאל עצום.על ידי חיפוי באופן אוטומטי על סתירות הכרונולוגיות, מספריות, אנכרוניזם טקסטאלי, והטיות שיטתיות, כלים ML מעצימים את ההיסטוריונים לעבוד עם נתונים גדולים יותר מורכבים יותר מאי פעם, חשיפת שגיאות שייקחו את חייהם כדי למצוא באופן ידני את המסגרת של דרישות למידה, לא צריך להיות זהיר יותר, כלומר, על ידי שיטות למידה מתקדמות.