הבעיה של זיהוי המחבר של טקסט היסטורי אנונימי היא אחת החידות הרציפות ביותר במלגה ספרותית והיסטורית.מסמך כתבי יד מימי הביניים עם דפי כותרת חסרים לחוברת פוליטית המופצות תחת פסאודוניסים, אינספור יצירות לאורך ההיסטוריה שרדו ללא תגמול ברור.פינקומינג הוא לא רק סקרנות אקדמית; הוא צורות בסיסיות כיצד אנו מפרשים מסמך, מבינים את ההקשר שבו הוא נוצר, ועקבות של רעיונות ויזואליים של זמן ניתוח גיאוגרפיה, על ידי שיטות חישוביות וגילוי עצמי, על פני השטח, כלומר, כלומר, על ידי שיטות חישוביות, כלומר, כלומר, כלומר, על פני השטח, על ידי שיטות חישוביות, על ידי שיטות חישוביות קודמות, על פני השטח, על ידי שיטות חישוביות, על ידי ניתוח מדויק יותר ממושכות, על ידי גירוי היסטורי, על ידי שיטות חישוביות, על ידי שיטות חישוביות, על ידי שיטות חישוביות, על ידי שיטות חישוביות, על ידי שיטות חישוביות, על ידי שיטות חישוביות, על פני השטח, על ידי גירוי היסטורי, על ידי ניתוח עצמיות, על ידי ניתוח עצמיות, על ידי גירוי היסטורי, על ידי חשיפה, על ידי שיטות חישוביות, על ידי גירוי, על ידי שיטות חישוביות, על ידי גירוי היסטורי, על ידי

הבעיה של טקסטים היסטוריים אנונימיים

אנונימיות בכתב היסטורי הייתה נפוצה הרבה יותר מאשר היום.רבים עובדים מן העת העתיקה, ימי הביניים, והתקופה המודרנית המוקדמת הופצה ללא שם המחבר בשל חששות לגבי צנזורה, סכנה פוליטית, או חוסר פשוט של מוסכמות ענישה של ענישה בגוונים דתיים, ביטויים פוליטיים, טיפולים מדעיים, ואפילו יצירות ספרותיות הופיעו לעתים קרובות תחת ייסורים או ללא זיהוי בכל האנונימיות שיכולה להיות מגינה על ידי טקסט בסיסי או סופר).

במשך מאות שנים, תגמול על ראיות חיצוניות כגון אותיות, רשומות של פרסום, או אזכורים בעבודות אחרות.אבל כאשר רמזים חיצוניים אלה חסרים או מעורפלים, החוקרים חייבים לפנות פנימה אל הטקסט עצמו.זה המקום שבו הניתוח של תכונות טקסטואליות הופך חיוני.על ידי התייחסות לתיעוד כמערך נתונים של סמנים לשוניים ועצבניים, אנו יכולים להשוות אותו לסופרים ידועים באופן שיטתי, לזהות מקרים רבים ככל הנראה.

מקורות של גניבת זכויות

המחקר השיטתי של סמכות באמצעות תכונות טקסטואלי יש שורשים במאה ה-19, כאשר חוקרים כמו אוגוסטוס דה מורגן הציעו לראשונה באמצעות אורך מילה ממוצע כטביעה אצבע סופרית ייחודית.שדה צבר תנופה משמעותית בשנות ה-60 וה-70 עם העבודה החלופית של סטטיסטיקאים ומלומדים ספרותיים כגון פרדריק רובר ודיוויד וואלאס, אשר מי ליישם שיטות כמותיות ל-FLT:0FedlistsFalthalplesFalplesFalischesFalrated, אשר הוכיחו את המחקר המשתנים לאחר מכן, לאחר מכן, לאחר מכן, לאחר מכן, כך שהפך את המספריים של שיטות חישוביים של שיטות חישוביים של שיטות חישוביות של שיטות חישוביות של שיטות חישוביות של שיטות חישוביות של שיטות חישוביות של מספרדמטיות של מספרדמטיות של מספרד, לאחר מכן, לאחר מכן, מאז ועד ל-R.

[ה]התגוננות המודרנית נחותה על בסיס פשוט: לכל סופר יש דפוס ייחודי, לא מודע של הרגלי לשוניים, אשר עקבי להפליא על פני יצירות שונות.ההרגלים הללו כוללים אוצר מילים מועדף, מבני משפט טיפוסיים, שימוש בטיהור, ואפילו שימוש במילים תפקוד (כגון FLT:0theFLT:1, FLT:2andFLT 3,LT5, 4 של LT5, ⁇ ) מ-F {\displaystyle to belid;

תכונות טקסטיות הליבה לניתוח

תכונות טקסטיות המשמשות ל- Authorship intribution נופלות לקטגוריות רחבות.בעוד שאין תכונה אחת היא סופית, השילוב של תכונות רבות כאלה יוצר פרופיל חזק.הדברים הבאים הם הסוגים הנפוצים ביותר.

תכונות לקס

(ה) ⁇ (ה) ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇ ⁇

תכונות סינתטיות

ניתוח סינטקטי בוחן את מבנה המשפטים – במיוחד את סידור סעיפים, ביטויים וחלקי דיבור. Authors נוטים לתמוך במגוון משפטים מסוים, סעיפים, ובניה דקדוקיים.לדוגמה, כמה סופרים משתמשים באופן קבוע במשפטים מורכבים עם סעיפים מרובים, בעוד אחרים מעדיפים הצהרות קצרות, סטיות, כולל גם את ההפצה של חלקי הדיבור (לא, כרזות), כלומר, בעיקר, פשטות, הן ביטויים פעילים, לעומת פשטות), כלומר, הן מורכבות של ביטויים, הן מורכבות של ביטויים, הן מורכבות של ביטויים, הן מורכבות של ביטויים, הן מורכבות, הן מורכבות, הן מורכבות, הן מורכבות, הן מורכבות, הן מורכבות, הן מורכבות, הן מורכבות, הן מורכבות של ביטויים, הן מורכבות של ביטויים, הן מורכבות, הן מורכבות של ביטויים, הן מורכבות.

תכונות Stylometric

(הופנה מהדף Modernylometry הוא המחקר הכמותי של סגנון הכתיבה של המחבר, המתמקד לעתים קרובות ב- FLT:0functionalמילים FLT:1 (prepositions, מאמרים, צירופים) אשר משמשים באופן לא מודע את העבודה החלופית של רבי מכר ווולאס על הניירות הפדרליסטים הראו גם כי תדירות המילים כגון FLT:2uponFLT 3:,LT4s של ניתוח LT5 {\displaystyle \ LT5} LT5}}, בין השנים האחרונות, בין LT ל-[[1948}}, בין ⁇

תכונות סינתטיות ומסתוריות

מעבר לרמה של מילים ומשפטים, הרשאה בכתב יכולה גם לשקול את התוכן (FLT:0thematic contentFLT:1 של טקסט.זה כולל נושאים חוזרים, מסגרות קונספטואליות, והשימוש במטאפורות ספציפיות או אנלוגיות. בעוד ניתוח סמנטי מאתגר יותר כי זה דורש פרשנות משמעות ולא ספירת התרחשות, התקדמות במודל (למשל, Latent to serve arthritis) בין אם הוא דורש מאופיין בתבניות של יצירת קשר לתבניות, לדוגמה, כגון: לדוגמה, לדוגמה, לדוגמה, כגון:

גישות מודרניות

המהפכה הדיגיטלית הפכה את התגמול של כלי מלאכה בעלי עוצמה בעבודה למדע מונע נתונים.היום, החוקרים מעסיקים מגוון של טכניקות חישוביות שיכולות לעבד כל הגוף ולזהות דפוסים בלתי נראים לעין האנושית.

Machine Learning Classifiers

(הדוגמניות של למידת מכונה משמשות רבות לייחס טקסטים באמצעות הכשרה על דגימות ידועות מכל סופר מועמד.אלגוריסים כגון מכונות וקטור תמיכה (SVMs), יערות אקראיים ורשתות עצביות לומדות את הדפוסים הרב-ארוכים של תכונות טקסטואליות ולאחר מכן לחזות את המחבר הסביר ביותר עבור מסמך אנונימי (SVMs-Fact) כולל מספר 1-NEX (quseact) של מילים), לדוגמה: npsy-Fs-Factation) ו-(NV) של תכונות LT2 (NV)

גישות למידה עמוקות, כגון רשתות עצביות חוזרות ונשנות (RNN) ומודלים המבוססים על שינוי, שיפרו את הדיוק על ידי לכידת תלות לטווח ארוך בטקסט.מודלים אלה יכולים ללמוד לא רק אוצר מילים וסמס אלא גם תבניות שיח ברמה גבוהה יותר.עם זאת, הם דורשים כמויות גדולות של נתוני הכשרה לסופר, אשר לעתים קרובות מגבלה עבור טקסטים היסטוריים שבהם רק קומץ של יצירות שרדו.

שיטות לא מבוססות וצפוי

כאשר נתוני אימון הם נדירים, החוקרים פונים לטכניקות לא מבוססות או סמיות-בסיסיות. אלגוריתמים (למשל, k-means או מקבץ היררכי) יכולים לקבץ טקסטים המבוססים על תכונות טקסטואליות ללא תוויות קודמות, לחשוף קבוצות סמכות פוטנציאליות. Semi-supervised שיטות משלבות קבוצה קטנה של סופרים ידועים עם מאגר גדול יותר של טקסטים לא-מבולבלים לזיכימומים אלה הם פיתחו גישות מרובות לאבחון.

מחקרים לא אפשריים ב- Authorship Attribution

כמה מקרים בעלי פרופיל גבוה ממחישים את העוצמה והמגבלות של ניתוח תכונה טקסטואלי והפכו לאבני מגע בתחום.

המסמכים הפדרליים

סיפור ההצלחה המפורסם ביותר הוא גניבת הניירות הפדרליסטים השנויים במחלוקת.מתוך 85 מאמרים המעודדים את אישור החוקה של ארה"ב, 12 היו שנויים במחלוקת בין אלכסנדר המילטון וג'יימס מדיסון בשנת 1964, רובר ווולאס השתמשו בניתוח תדירות של "הפונקציה" כדי להקצות את כל 12 עד מדיסון עם אמון סטטיסטי גבוה, עבודתם אושרה על ידי מחקרים נוספים באמצעות שיטות מודרניות של מעצבנות.

שייקספיר ושיתוף פעולה

שאלות על המחברת של מחזות המיוחסים לוויליאם שייקספיר יש היסטוריה ארוכה, לעתים קרובות שנויה במחלוקת, בעוד שרוב החוקרים מסכימים כי שייקספיר כתב את הטון המיוחס לו, יש ראיות לשיתוף פעולה עם מחזאים אחרים, כגון ג'ון פלטשר ב-FLT:0Henry VIIIFLT:1 ו-FLT:2 The Two Noble KinmensFLT 3 מודרני, כמו ג'ון פלטשר ב-Perfectactorme, ו-S, לדוגמה, אשר זיהה את המחברים האחרים, כמו גם את המחברים של קריקטורלי, ו-זמנית, כמו גם יחד עם המחברים, ו-זמנית של קריסטומדומים, ו-S, כמו גם הם, כמו גם הם, ו-S, ו-S, ו-S, ו-FLT: 2, ו-S, ו-S, ו-FLT: 2, אשר זיהו את שניהם, ו-Squatoner.

יום שני, מנוס ושירו של רולנד

(הטקסטים מימי הביניים, אשר מועברים לעיתים קרובות באמצעות מספר רב של סופרים, מציגים אתגרים ייחודיים.ה-FLT:0Song of RolandFLT:1, שיר אפי מהמאה ה-11, קיים במספר גרסאות של כתבי יד עם דיאלקטים שונים וגילויים.

אתגרים ומגבלות

למרות הצלחותיה, גניבת סמכות באמצעות תכונות טקסטואליות אינה כדור כסף.יש להכיר באתגרים משמעותיים רבים.

שינוי שפה היסטורי

שפה מתפתחת לאורך זמן, והתכונות הטקסטואליות של סופר מהמאה השש-עשרה עשויות להיות שונות באופן דרמטי מאלה של סופר מהמאה ה-18, גם אם שניהם שייכים לאותה קהילת שפה.שינויים באיות, בדקדוק ובאוצר מילים פירושם כי תכונות המשמשות להשוואה טקסטים מתקופות שונות עשויות להיות מטעות.חוקרים חייבים להגביל השוואות ליצירות מאותה תקופה או לנרמל את הנתונים לחשבון עבור שינויים סנכרוןיים.

תרגום ו-Scribal Interference

כאשר טקסט מתורגם או מועתק על ידי סופרים, תכונות הטקסטואלי של המחבר המקורי הופכות מטושטשות. מתרגמים לכפות אוצר המילים שלהם וסמס, בעוד שסופרים עשויים לשנות איות, טיהור, ואפילו מבנה המשפט.זהו מכשול עיקרי עבור כתבי יד מימי הביניים, שבו עותקים לעתים קרובות שונים באופן משמעותי מהמקור.

קורפוס קטן והבעיה של הייחודיות

סופרים היסטוריים רבים עזבו מאחורי גוף קטן של עבודה, מה שהופך את זה קשה לבנות מודלים סטטיסטיים אמינים.עם רק כמה אלפי מילים להתאמן, הסיכון של overfitting הוא גבוה.בנוסף, טקסט אנונימי עשוי להיות העבודה היחידה שנותרה של המחבר שלה, שבו במקרה זה הוא בלתי אפשרי. החוקרים חייבים לאזן נוקשות סטטיסטית עם הסתברות היסטורית, לעתים קרובות שילוב ניתוח טקסטואלי עם ראיות חיצוניות.

עו"ד דיסגו

כמה מחברים התחפו במתכוון בסגנון שלהם, מחקים סופר אחר או אימוץ טון נייטרלי, ביורוקרטי.זה נפוץ בתעמולה פוליטית, מסמכים הקשורים לריגול, ומזלג'ים.בעוד שיטות מעצבניות יכולות לפעמים להתגבר על חיקוי - כי הרגלים לא מודעים עדיין דולפים דרך - שיעור ההצלחה טיפות בחדות כאשר המסווה הוא מתוחכם.

שיטות עתידיות וטכנולוגיות מתפתחות

תחום הכניעה ממשיך להתקדם במהירות, מונע על ידי שיפורים באינטליגנציה מלאכותית וספרות של ארכיונים היסטוריים.

מודלים שפה גדולים וטכנולוגיות Transformer Networks

מודלים מבוססי Transformer כמו bert ו GPT הראו הבטחה במשימות של כתב יד, אפילו עם טקסטים קצרים יחסית.מודלים אלה לומדים ייצוגים קונטקסטואליים של מילים, לכידת דפוסים סגנוניים מסורתיים שיטות N-gram מסורתיות מתגעגעים. לדוגמה, הופך עדין מתואם יכול לזהות שימוש טיפוסי של כותב של סמנים, שפה או מטאפורה, כמו אלה הופכים להיות יעיל יותר אימונים סטנדרטיים יותר, הם עשויים להפוך כלי סטנדרטיים פחות.

« « « אינטימיות ובינלאומית

טקסטים היסטוריים רבים נכתבים בלטינית, ערבית, סינית או שפות אחרות השונה באופן משמעותי מהתגובות האנגלית. Cross-lingual – השוואת טקסטים הכתובים בשפות שונות על ידי אותו מחבר – הם מהווים בעיה פתוחה.עם זאת, עבודה עדכנית באמצעות תגים בין-חלקיים ותלויים סינטקטיים מראה כי כמה תכונות סטריליסטיות הן עצמאיות בשפה.

שילוב עם ניתוח רשת היסטורי

הרשאה בכתב אינה מתרחשת בוואקום.על ידי שילוב ניתוח טקסטאלי עם ניתוח רשת של התכתובת, פטרונות והיסטוריית הפרסום, החוקרים יכולים לצמצם את סט של סופרים סבירים ולאמת ממצאים חישוביים.לדוגמה, אם אוצר המילים של טקסט קרוב ביותר למחבר X, אבל X ידוע כי הוא נמצא בגלות במהלך הקומפוזיציה של הטקסט, המשחק עשוי להיות מעורר השראה.

מסדי נתונים פתוחים ושיתוף פעולה

מיזמים כמו ה-FLT:0.2016 המכון למלגות טקסטואליות ואלקטרוניקה EditingFLT:1 ו-FLT:2Computational Models of StyleveFLT 3 הם בנינים מחדשים משותפים של טקסטים היסטוריים מלוטשים עם סמכות ידועה.

מסקנה

זיהוי המחבר של טקסטים היסטוריים אנונימיים הוא העבודה של בלש המשלבת את הסבלנות של פילולוג עם הדיוק של מדען נתונים.תכונות טקסטואליות - החל מתדירות המילים הנפוצות למבנה המשפטים והדפוסים של נושאים - לספק חלון לתוך הרגלי הסופרים המתים, אך בסופו של דבר, האתגרים עברו, נראה כי היה בלתי אפשרי לפני דור; יוצרי הספר: LTlist מימי הביניים, אך הם כבר החלו לפתח את המילים האחרונות, אך ורק לאחר מכן, אך ורק לאחר מכן, כך שעדיין לא ניתן היה לצפות כי הם היו מסוגלים להבחין בין היתר, כי הם קיימים, כי הם קיימים, כך שעדיין קיימים, אך ורק לאחר מכן, כך שעדיין קיימים, כך, כך, כי הם היו מסוגלים להבחין בין היתר, כך שעדיין קיימים, כך, כך, כך, כך, כך, כך, כך, כך, כך שעדיין קיימים, כך, כך שעדיין קיימים, כך שעדיין קיימים, כך, כך שעדיין קיימים, כך, כך, כך, כך, כך שעדיין קיימים, כך, כך שעדיין קיימים, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך, כך שנמנעו שלמרות שנמנע