הסעיף של Big Data ו-Cyometrics

Cliometrics - היישום השיטתי של תיאוריה כלכלית ושיטות כמותיות למחקר ההיסטוריה - כבר הסתמכות על נתונים.אבל ההיקף, ההיקף, ההיקף, ההיקף, ההיקף, ההיקף, ההיקף, ההיקף, ההיקף, ההיקף, ההיקף, ההיקף, ההיקף, ההיקף, ההיקף, ההיקף, הנתונים הקשורים לארכיון, יכולים כיום לקבץ מיליוני רשומות של שינוי משמעותי, אך ורק כדי לבחון אתגרי נתונים אלה, אך ורקדות, אך ורק את האפשרויות המדעיות, על פני קבוצות המחקר הגדולות של נתונים של נתונים של נתונים אלה, וכן לבחון את האפשרויות הגדולות של תכונות המחקריות, אך ורקדות, הן, הן, הן, הן על ידי בדיקות נתונים גדולות של נתונים של נתונים ⁇ , וכן את המשתנים, הן, הן, הן, הן, הן, הן, הן, הן, הן, הן, הן, הן, הן, הן, על ידי בדיקות נתונים סטטיסטיים על ידי בדיקות נתונים סטטיסטיים על ידי בדיקות נתונים סטטיסטיים על ידי בדיקות נתונים סטטיסטיים על ידי בדיקות נתונים סטטיסטיים על ידי בדיקות נתונים סטטיסטיים על ידי נתונים סטטיסטיים על ידי בדיקות נתונים סטטיסטיים על ידי נתונים סטטיסטיים על ידי בדיקות נתונים סטטיסטיים על ידי נתונים סטטיסטיים על ידי נתונים סטטיסטיים על ידי נתונים סטטיסטיים על ידי נתונים סטטיסטיים על ידי נתונים סטטיסטיים על ידי

מתוך Ledger Books to Land Records: A brief history of data in Cliometrics

השורשים של cliometrics למתוח בחזרה בשנות החמישים וה-60, כאשר חלוצים כגון דאגלס צפון, רוברט פוגל, וסט סטנלי אנגרמן החלו ליישם טכניקות אקונומטריות לשאלות היסטוריות. מאמצים ראשוניות התמקדו במאגרי נתונים קטנים, שנבנו תכליתיים - לעתים קרובות מוגבל לאזור יחיד או לזמן קצר - בגלל העבודה העצומה הנדרשת כדי לאסוף מידע מספרי ניירני נקי ומטה ממקור זה, כמו כמה תצפיות כלכליות על ידי ערפל היום, נראה כמה תצפיות של נתונים ערפל על ידי מוטציות על ידי מוטציות על ידי מוטציות כלכליות, רקמות על ידי מוטציות, רק על ידי מוטציות, רקמות על ידי מוטציות של מוטציות של נתונים טמפרטורות של מוטציות של מוטציות של טמפרטורות של ערפל על ידי טמפרטורות של כמה פעמים רבות על ידי ערפל, רקמות על ידי מוטציות של נתונים מוטציות של טמפרטורות של פחת של מוטציות של טמפרטורות של פחת של מוטציות של טמפרטורות של פחת של פחת של נתונים על ידי פחת של היום, כי נראה היום, כיפי נתונים על ידי מוטציות של נתונים על ידי מוטציות של מוטציות של מוטציות של מוטציות של מוטציות של מוטציות של מוטציות של מוטציות של מוטציות של מוטציות של מוטציות על ידי

(הופנה מהדף "ההגעה של מחשבים אישיים בשנות ה-80 והאינטרנט בשנות ה-90 הרחיב בהדרגה את כמות הנתונים הנגישים" (החוקרים החלו ליצור מסדי נתונים משותפים, כגון ה-FLT:0.10.1 .1.10.1 ,5C in the National Bureau of Economic Research Datasetsssssssss, 000-FLT 3) או פרויקט הפטנטים של ה-FLT:5C infraolidulating record לפני כן, 7.

מה פירוש "Big Data" להיסטוריונים כלכליים

בהקשר של cliometrics, נתונים גדולים מתייחסים לא רק נפח Sheer אלא גם המגוון והגרנריות של מידע היסטורי.

  • (FLT:0)Volume:FLT:1 , Datasets with Millions or אפילו מיליארדים של תצפיות - למשל, מפקדים decennial שלמים מסוף המאה ה-19 ואילך, או סדרה דיגיטלית מלאה של מחירי דגנים לאורך מאות שנים.
  • (FLT:0Varietymia:FLT:1 נתונים באים כעת בצורות מובנות (טבלאות, גליונות התפשטות) וצורות לא מובנות (newspaper מאמרים, אותיות בכתב יד, מפות, תמונות).
  • (FLT:0)Velocity:FLT:1 בעוד הנתונים ההיסטוריים אינם זורמים בזמן אמת, דיגיטציה וקישור פרויקטים מייצרים נתונים חדשים בקצב מאיץ.פרויקטים שפעם לקח עשרות שנים יכולים להסתיים בחודשים האחרונים.
  • (FLT:0)Veracity:FLT:1 רשומות היסטוריות הם לשמצה מבולגנים - פגועים, בלתי עקביים או מטעים.בדיקה וניקוי נתונים הוא חלק מרכזי מכל מחקר גדול של נתונים.

מקורות אופייניים כוללים מיקרו-נתונים (כגון FLT:0irph1 ,IPUMSIRFLT:2FLT 3 סדרה בינלאומית), רישום הקהילה (למשל, FLT:4FOVAFLT:5 FamilySearchFLT 6FLT 7FLT 7) , מחירים פיננסיים (למשל, LT:4 ו-Discodows) ו-Digital Data (Digital Data) ו-Fregation Books.

אפשרויות: מה Big Data Unlocks for Cliometric Research

ניכוי דרמטי בשגיאה

לעתים קרובות, cliometrics מסורתיים התבססו על דגימות - מדגם 1% של מפקד האוכלוסין, למשל - כי זה היה בלתי אפשרי קוד אוכלוסיות שלמות. בעוד דגימה זהירה יכול להניב תוצאות אמינות, זה בהכרח מציג אי ודאות, במיוחד כאשר לומד אירועים נדירים או קבוצות קטנות. Big Data מאפשר לחוקרים לעבוד עם נתונים מלאים פופולריות.

שאל שאלות חדשות

עם נתונים עשירים יותר, cliometricians יכולים לחקור השערות שנחשבו בעבר בלתי ניתנות להוכחה. האם הזעזועים של מזג האוויר במאה ה-18 משפיעים על הרפורמה המוסדית?האם אנו יכולים לזהות את ההשפעה הסיבתית של רכבות מוקדמות על צמיחת העיר על ידי ניתוח עשרות אלפי קואורדינטים גיאוגרפיים מדויקים? ביג נתונים מאפשר עיצובים-ניסויים-סי-בטווחים, תוקפנות, הפסקתיות ואינטראקטיביות, וגישות שונות של ניסויים, מטווח גבוה, מניסויים, מתחומים של מחקרים קולוניאליים, או דחוסים, או , מתחומים, מתחומים, מתחומים, מתחומים שונים, מתחומים שונים, מתחומים שונים, מתחומים שונים, מתחום התקשורתיים, או מתחומים שונים, או מתחומים שונים, מתחומים שונים, מתחומים שונים, או מתחום התקשורתיים, מתחומים גדולים.

זמן ארוך ו- Panel Dimension

אחת ההתפתחויות המרגשות ביותר היא יצירתן של נתונים היסטוריים מקושרים העוקבים אחרי אנשים, משקי בית או קהילות לאורך עשרות שנים או אפילו מאות שנים. פרויקטים כמו FLT:0 Longitudinal, Intergenerational Family Electronic Microdata (LIFE-M) ProjectFLT:1 או FLT:2 Historical Population Database NHGISFLT:3 מאפשר לחוקרים לעקוב אחר התוצאות הכלכליות של ילדים אלה כמעט ולא יכלו לשרוד.

Cross-Disciplinary Synergies

נתונים גדולים באופן טבעי שואבים יחד כלכלנים, היסטוריונים, דמוגרפים, גיאוגרפים, מדעני מחשב וסטטיסטיקה. פרויקט אחד יכול לשלב נתונים כלכליים (ערכים, מחירים, פלט), נתונים גיאוגרפיים (מפות היסטוריות, איכות אדמה, אקלים), ונתונים חברתיים (דת, אתניות, חינוך) היתוך בין-תחומי זה מעשיר את פרשנות התוצאות ולעתים קרובות מוביל לחדשנות מתודולוגית, לדוגמה, למידה שפותחה לשימוש חוזר על ידי אלגוריתמים היסטוריים.

אתגרים: המלכודות של נתונים היסטוריים

איכות נתונים על פני Millennia

רשומות היסטוריות מעולם לא נוצרו עבור ניתוחים סטטיסטיים מודרניים. רשימות מס משלימות את העניים ביותר; מפקדי האוכלוסין עשו שגיאות ⁇ ; רישומים קהילתיים אינם שלמים בגלל תהפוכות דתיות.גם כאשר רשומות הן ספרותיות, זיהוי אופי אופטי (OCR) מציג שגיאות חדשות. שיעור שגיאה של 1% ב- 10 מיליון-row Dataset אינו כולל 100,000 טעויות, מספיק כדי לבצע תוצאות הטיה אם הן חוקרים שיטתיים, חייב להשקיע בכבדות בנתונים תקפים, לבדוק מקורות תיקון נתונים מדויקים, ולפתח אלגוריתמים של אלגוריתמים של אלגוריתמים של אלגוריתמים לא ניתן לבצע ניתוח נתונים לא יכול להיות בעל ערך.

פרטיות ודאגות מוסריות

למרות שהפרטים ברשומות היסטוריות מתים זמן רב, מידע מסוים – כגון שמות, כתובות ויחסים משפחתיים – עדיין יכול להתפרש על הפרטיות של צאצאים החיים. במדינות רבות, חוקים השולטים בשימוש בנתונים אישיים היסטוריים עדיין מתפתחים.יתר על כן, הדיגיטציה ושחרור ציבורי של רשומות מסוימות (למשל, לוחות זמנים של עבדים או רשימות רישום אינדיאנים) מעוררים נושאים רגישים לגבי ייצוג וניצולים.

גדרות טכניות והתאמה

עיבוד נתונים היסטוריים גדולים דורש מיומנויות מיוחדות: תכנות ב- Python או R, היכרות עם ניהול מסד נתונים (SQL), ולעתים קרובות השימוש במחשוב אשכול או פלטפורמות ענן. מחלקות היסטוריה כלכלית רבות עדיין לא שילבו את הכישורים האלה לתוך תוכניות הליבה שלהם. וכתוצאה מכך, בעיה "שתי תרבויות" יכולה להופיע, שבו חוקרים מיומנים מבחינה טכנית חסרים עומק היסטורי, וחוקרים מנוסים היסטוריים לא יכולים לנצל באופן מלא כלים דיגיטליים.

ניתוח Decontextualized

עם נתונים גדולים, זה מפתה לרוץ רגרסיות על פני מאות משתנים ללא הבנה עמוקה של ההקשר המוסדי. חוקר יכול למצוא כי אזורים עם יותר כבשים בשנת 1500 היו הכנסות גבוהות יותר בשנת 2000 - אבל ללא ידיעת התפקיד של סחר צמר, הגבלות נפוחות, או תקופת קרקע, תוצאה כזו היא כמעט חסרת משמעות. Big Data מגבירה את הסיכון של קורלציה מזעזעת.

גבולות מתודולוגיים: ביצוע עבודת נתונים גדולה ב- Cliometrics

ביקורת והחלטה של אינטימיות

קישור בין אנשים על פני מקורות היסטוריים שונים הוא משימה הליבה.זה עשוי לכלול התאמה של אדם ממפקד לרישום נישואין או רכוש דה. חוקים די-ארוכיניסטיים (שם משותף + שנת הלידה) לעתים קרובות נכשלים כי שמות מאוימים באופן עקבי, גילים היו מעוגלים, ומיקומים שונים. Probilistic קישורים תוכניות - באמצעות מרחקים חיוביים, קידוד טלפוני, והבקיעי ביי - הפכו לדימויים סטנדרטיים, אפילו קישורים שליליים.

הרמוניה לאורך זמן ומרחב

(המידע ההיסטורי משתמש לעתים קרובות במטבעות ארכאיים, יחידות מדידה וגבולות מנהליים.המיר סדרה של מחירי חיטה מהמאה השש-עשרה ועד יחידות מוניטריות מודרניות דורשות מנופחים, טבלאות המרה והבנה של שווקים מקומיים.ג'יאוגרפיים (GIS) מאפשרת לחוקרים למפות גבולות ישנים על קואורדינטות מודרניות, אך גבולות היסטוריים – כגון גבולות המעבר של פרוסיה או גבולות המחוזות הקולוניאליים – לדרוש שחזור היסטורי של 3.

Machine Learning for Data Extraction

מקורות לא מאורגנים - עיתונים, יומני יד, מיצגי ספינה - מומכרים לעיבוד שפה טבעית (NLP) זיהוי שם, מיצוי מערכת יחסים, ומודלים בנושא יכולים להפוך מיליוני דפים של טקסט למשתנים מובנים. לדוגמה, החוקרים השתמשו ב- NLP כדי לחלץ נתונים במחירים מעיתונים היסטוריים, זיהוי אזכורים של מגיפות ברשומות קהילתיות, או לסווג את הנושאים של דיונים פרלמנטריים אלה הם עדיין דיוק והכשרה היסטורית של איכות.

שקיפות עם Big Data

נתונים גדולים אינם פותרים באופן אוטומטי את ההפוגה; למעשה, זה יכול להחמיר את הבעיה על ידי הפיכתה קלה לפנק או למצוא תוצאות "משמעותיות" על ידי מקריות, מחקר cliometric cidible חייב עדיין להסתמך על אסטרטגיות זיהוי זהירות: ניסויים טבעיים, הבדל בהפרעות, בקרה סינתטית, משתנים אינסטרומנטאליים, או עיצובי תוקפנות.

כיוונים עתידיים: היכן ש-Big Data Cliometrics הוא ראשי

מסדי נתונים היסטוריים גלובליים

(ב) מחירים כמו FLT:0) מחירים ופרויקט הכנסה (פרויקטים) 1:1 או ה-FLT:2Maddison Databaseofph 3 כבר כלים סטנדרטיים, אך הם מסתמכים על הערכות לאומיות מצטברות.הגבול הבא הוא נתונים ברמה מיקרו-דרגית המכסים את העולם כולו - המקשרים, למשל, רשומות מס קולוניאליות עם מחירים מקומיים באפריקה, אסיה, ואמריקה, , כמו גם מאגרי מידע כלכלי כזה, ישתנו.

שילוב של נתונים לא קונבנציונליים

מקורות לא טקסטואליים – תמונות היסטוריות, ציורים, ממצאים ארכיאולוגיים ואפילו דנ"א עתיק – נכנסים כעת לתערובת.היסטוריונים כלכליים עשויים לנתח את גודל המטבעות העתיקים כדי להיפר את ההפריה, להשתמש טבעות עץ כדי לשחזר את יכולת האקלים מימי הביניים, או ליישם הכרה פנים בציורים כדי להעריך את גודל הגוף הממוצע (פרוט לתזונה) כשיטות אלה, גבולות הנתונים הגולגולתיים יתרחבו עוד יותר.

חידוש ו מדע פתוח

(החומרים הגדולים של נתונים חייבים להתמודד עם הסתברות מחדש: כאשר מחקר מבוסס על נתונים שנוצרו על ידי 50 מיליון רשומות מקושרות, כיצד חוקרים אחרים יכולים לאמת או להרחיב את התוצאות?השדה עובר קוד פתוח, metadata ברור, וממצאים נתונים ב-Repositories כמו FLT:0ICPSRFRE 1LT:1 או FLT2ZodoenFplication, לפעמים ההגבלות של זכויות יוצרים ו-ExtraudenFREFRE, אשר לעתים קרובות מחזקות.

אימון הדור הבא

תוכניות בוגר בהיסטוריה הכלכלית משלבות יותר ויותר שיטות חישוביות.קורסים במדעי הנתונים, GIS, והדמוגרוגרפיה ההיסטורית נפוצים כיום.סדנאות ובתי ספר קיץ - כגון אלה המאורגנים על ידי FLT:0Economy History Association (ראהים 1) או FLT:2 All-UC Group בהיסטוריה הכלכלית של LT 3 - לעזור לחוקרים באמצע הקריירה לרכוש את הכישורים האלה, כמו גם את היכולת הטכנית יותר, וניתן יהיה לחדורת יותר, בין כלים מתקדמים, בין אם כך, לבין יכולת מחקרית, לבין יכולת מחקר קפדנית יותר, לבין יכולת מחקרית, לבין יכולת מחקרית יותר, יעילה יותר, לבין יכולת מחקרית, יעילה יותר, לבין יכולת מחקרית, בין אם היא יעילה יותר, יעילה יותר, בין אם היא יעילה יותר, לבין יכולת מחקרית יותר, לבין יכולת מחקרית, לבין יכולת מחקרית יותר, בין אם היא יעילה יותר, לבין יכולת מחקר קפדנית יותר, יעילה יותר, לבין יכולת מחקרית יותר, יעילה יותר, בין אם היא יעילה יותר, בין אם היא יעילה יותר, בין אם היא יעילה יותר, בין 2.

מסקנה: הרהור הפוטנציאל תוך הימנעות מהמלכודות

נתונים גדולים כבר שינו מחקר cliometric לטובה.זה איפשר לחוקרים לבחון תיאוריות עם הרבה יותר ראיות, לראות דפוסים בלתי נראים לדורות קודמים, ולחבר היסטוריה כלכלית עם ויכוחים מדעיים חברתיים רחבים יותר.אבל ההתלהבות חייבת להיות ממזגת על ידי הבנה ברורה של האתגרים.איכות נתונים ירודה, ניתוח דיבוקטיבי, ואת עקומת הלמידה הטכנית התלולה יכול לערער אפילו את השאפתנית ביותר.

היסטוריונים כלכליים אשר מאמצים נתונים גדולים תוך שמירה על המסורות של משמעתם יהיו ממוצבים היטב לייצר תובנות שאינן רק חזקות סטטיסטית, אלא גם מבחינה היסטורית משמעות.ההזדמנויות הן אמיתיות, אלא גם באחריותן של שיטות קפדניות, טיפוח שיתוף פעולה בין-תחומי, ושמירה על עין ביקורתית על הוכחה נתונים, התחום יכול להמשיך לשגשג בעידן של רשומות דיגיטליות בשפע.