study-guides-and-learning-resources
ההשפעה של למידה עמוקה על אחסון מחדש של Manuscripts היסטוריים פגומים
Table of Contents
הרנסאנס הדיגיטלי של מילים אבודות
כתבי יד היסטוריים הם חלונות בלתי ניתנים להחלפה לציוויליזציה, שפות ורעיונות שעיצבו את העולם שלנו.אבל המסמכים השבירים הללו נמצאים תחת מתקפה מתמדת מעת לעת, סביבה וסכסוכים אנושיים. ped ink, דפי קרועה, נזק למים, עובש ואש הפכו אינספור טקסטים באופן חלקי או בלתי סביר לחלוטין, שיטות שיקום מסורתיות – מעורבים ניקוי ידני, טיפולים כימיים, ועידודי כאבים – הם לעתים קרובות איטיים, מה שיכול להיות מצמצם, אפילו שבועות בודדים, אפילו לא סבירים, או אפילו, או אפילו לא סבירים, אם כן, או אפילו.
בעשור האחרון, למידה עמוקה התפתחה ככלי טרנספורמטיבי בתחום העדין הזה.על ידי הכשרת רשתות עצביות על אוספים עצומים של תסריטים פגומים חלקית, חוקרים יכולים כעת לשפר תמונות מומוגות, לחזות מילים חסרות, ואפילו לשחזר קווים שלמים מן השבריריים הברורים. מספר גדל והולך של מוסדות מורשת תרבותית משלב כעת אלגוריתמים אלה לתוך זרימות העבודה שלהם, המאפשר תגליות שהיו בלתי אפשריות לפני דור זה, חוקר את האופן שבו שיטות למידה עמוקות, שעדיין מעצבות את האתגרים הללו, שעדיין משלבות את האתגרים, שעדיין משלבות את הסיפורים האלה, שעדיין משלבות את האתגרים המשמעותיים את האתגרים, ופעולות אלה, שעדיין משלבות, שעדיין משלבות את הטכניקות חדשות, שעדיין משלבות את הטכניקות הצלחה, שעדיין משלבות את המשתנים, שעדיין משלבות את הטכניקות חדשות, שעדיין משלבות את הטכניקות חדשות, שעדיין משלבות את הטכניקות חדשות, שעדיין משלבות את הטכניקות חדשות, שעדיין משלבות את הטכניקות חדשות, שעדיין משלבות את הטכניקות חדשות, שעדיין משלבות את הטכניקות חדשות, שעדיין משלבות את האלגוריתמים, שעדיין משלבות את האלגוריתמים, שעדיין משלבות את הטכניקות חדשות, שעדיין ממושכות, ש
כיצד פועל למידה עמוקה לשיקום מאנוויס
למידה עמוקה היא תת-קבוצה של למידת מכונה המשתמשת ברשתות עצביות מלאכותיות מרובות- ⁇ מודלים מורכבים.בניגוד לאלגוריתמים המבוססים על הכלל הקודם, מערכות למידה עמוקות לומדות ישירות מהנתונים: בהתחשב מספיק דוגמאות של טקסט פגום מול טקסט משוחזר, הרשת מגלה את התכונות שלה כדי להבדיל את הקצוות, בשבץ, ומבנים טקסטואליים.
כמה אדריכלות משחק תפקידים ספציפיים צינור שיקום.רשתות עצביות מהפכתיות (CNN) מצטיינים במשימות ברמת תמונה כגון הסרת רעש רקע, לחדד דמויות מטושטשות, ולהמלא באזורים חסרים באמצעות תהליך הנקרא תמונה inpainting. Recurrent רשתות עצביות (RNN) והופכים מודלים, לעומת זאת, לטפל בחיזוי - בתנאי משפט חלקי, הם יכולים להסיק את האותיות הסבירות ביותר על רקע התנגשויות לשוניות או חסרות יכולת ליצור קשר.
רשתות אדמירליות יוצרות (גנים) הפכו פופולריות במיוחד לשיקום חזותי. A gan מורכב משתי רשתות מתחרות: גנרטור שיוצר כתמים משוחזרים ומפליטור שמנסה להבחין בין כתמים אלה מתמונות נקיות אמיתיות.הגנרטור משתפר עד שהפלטים שלו כמעט בלתי ניתנים להפרדה מטקסט אמיתי שלא ניתן להתאמה.
טכניקות מפתח ב Deep Learning for שיקום
שיפור תמונה ואינטואיציה
הצעד הראשון ברוב זרימת העבודה לשיקום הוא שיפור איכות הראייה של תמונות בכתב יד דיגיטאליות.מודלים למידה עמוקה מאומנים על זוגות תמונות נקיות ומלאות מלאכותיות כדי ללמוד כיצד להפוך פגמים משותפים.שיטות אלה יכולות להסיר כתמים, להפחית את ההפרעות הצל, ואפילו דחיסות פיזית לא לעשות מעוות טקסט מסוים הוא FLT:0text inpainting FLT, שבו הם לעתים קרובות יוצרות חום של צבעים (ציורים) או פיקסלים קצרים של טקסט).
לדוגמה, רשת (Deep Morphologyalphologyphologyphal1), שפותחה באוניברסיטת ציריך, משתמשת ב-CNN עם מהפכתים מורחבת לעיבוד שדות סלקטיביים גדולים תוך שמירה על פרטים יפים.כאשר נבדקו על כתבי יד הולנדיים מהמאה ה-17, היא הוציאה בהצלחה כתמים מים ודממות דיו, שחזור קטעים שלא ניתן היה לייחס במשך מאות שנים.
זיהוי טקסט ושיקום
ברגע שהדימוי משופר, האתגר הבא הוא לקרוא את הודעת האופי האופטית (OCR) עבור תסריטים היסטוריים הוא קשה לשמצה: לוחות זמנים משתנים, קיצורים בשפע, ונזק לעתים קרובות משאיר רק אותיות חלקית.מערכות OCR מבוססות למידה עמוקה, כגון אלה שנבנו על סיווג זמני חיבור (CTC) או ארכיטקטורת קודקוד מבוסס תשומת לב לעתים קרובות משאיר רק אותיות חלקית.
דוגמה בולטת היא פלטפורמת ה-FLT:0 [Transkribusalph1], המספקת מנוע למידה עמוק לתעתיק מסמך היסטורי, המודלים שלה מאומן על אלפי דפים מידיים ותקופות ספציפיות, המאפשרים למשתמשים להגיע לטון קנס על אוספים שלהם. Transkribus כבר בשימוש כדי לנטר את כל מה שצינורות מהמאה ה -15 ועד לתכתובת ערבית של המאה ה-19, אפילו אם הוא חסר תקדים, או מדגמים היסטוריים, אם הוא אינו יכול היה לפסלים, או מ-GPTRic, או מ-APTOR, אם הוא "מסמך"מסמך מודל זה,"מסמך"מסמך"מסמך"מסמך"מסמך"מסמך"מסמך"מסמך מודל היסטורי"מסמך"מסמך"מסמך"מסמך"מסמך"מסמך מודל זה"מסמך"מסמך"מסמך"מסמך גולגולת"מסמך"מסמך"מסמך מודל זה,"מסמך מודל לשוני"מסמך המאוחר יותר מדגמים"מסמך"מפרקים"מפרקים"מפרקים"מפרקים"מפרקים"מפרקים"מפרקים"מפרקים"מפרקים"
ביקורת ותרגום
כתבי יד פגומים רבים נכתבים בכתבים עתיקים או גרועים - קוויאר B, מתפתלים נוסר זקנים, סוריהק, או תסריטים קריפטוגרפיים. למידה עמוקה יכולה לעזור גם בזיהוי התסריט וגם כאשר קיים קורפוס מקביל, בתרגום זה. מודלים רב-ממדיים שמעבדים תמונה וטקסט במשותף יכולים ללמוד למפות גרפים חזותיים כדי לזהות את קבוצות האופי הידועות, גם כאשר התסריט הוא רק פענוח חלקי, באמצעות גישה בלתי-מת, שלא ניתן לתארועת, לא מזמן, לא מזמן, ולא ניתן היה מסוגל לתאר תיקונים אישיים, ולא ניתן לתארומים, ולא ניתן לתאר בעבר, ולא ניתן לתאר את הגרסאות קודמות, ולא ניתן היה בעבר, ולא ניתן היה בעבר, ולא ניתן היה מסוגל לתאר את הגרסאות אישיות.
יישום מרשים במיוחד הוא פרויקט ההרחבה:0 Mayser ProjectveFLT:1, שהשתמש בשילוב של CNN ומודלים לרצף כדי לפענח קבוצה של אותיות מקודדות מהמאה ה-17 מן האימפריה הרומית הקדושה.המערכת הקריפטוגרפית לא הייתה ידועה עד מודל הלמידה העמוק זיהה דפוסים שתואמים מפתח חלקי שנמצא בארכיון נפרד.
יישומים מעשיים ומחקרי מקרים
ים המלח Scrolls
אולי היישום המפורסם ביותר של למידה עמוקה לשיקום כתבי יד הוא העבודה על ים המלח Scrolls. טקסטים עתיקים ו Aramaic אלה, היכרויות מהמאה השלישית לפני הספירה למאה הראשונה לספירה, התגלה במפרקים.במשך עשרות שנים, חוקרים התאספו ידנית אלפי שברים, אבל רבים היו דוענים מדי או מקודדים לקריאה.
לאחרונה, הפרויקט של אוניברסיטת חיפה שילב למידה עמוקה עם FLT:2Wal unwrappingFLT 3: 3 - טכניקה ששוחזר טקסט מגלגלים או שכבתיים ללא רישום פיזי:2virtual unwrappingFLT 3 - טכניקה אשר משחזר טקסט מגלם או משכבות ללא רישום פיזי של רשת עצבית על סירטוטים של קטע קטן, לא מפוספס, המערכת עדיין יכול לנבאת את אותה גישה סגורה של קודר.
The Herculaneum פפיארי
[המחשבה] פפיוריי, המפחמת על ידי התפרצות הר הגעש ווסביוס ב-79 לסה"נ, הם בין הפרויקטים המאתגרים ביותר לשיקום ההיסטוריה.הגלות כל כך מערימות כי אי-החלל הפיזי הורס אותן במשך עשורים, חוקרים הסתמך על הדמיה רב-ספקטרוםית וקריאה ידנית של תכונות פני השטח.
ימי הביניים אירופאים
(הפרויקטים הקטנים אך בעלי ההשפעה באותה מידה התמקדו בכתבי היד מימי הביניים: The FLT:0eScriptoriumFLT:1 פלטפורמה, שפותחה על ידי המרכז הלאומי הצרפתי למחקר מדעי, משתמשת בלמידה עמוקה כדי לנטרן ו annotate דיגיטלית מסמכים מימי הביניים.Exports שלה ⁇ -recognition מודלים מאומן על אלפי דפים מן המאה ה-9 עד 15, כיסוי לטיני, הישן, הישן, בינוני, ו-Frevener, 000, 000, 000, 000, 000, 000, 000, 000, 000, 000 של טקסט פתוח, 000, 000, 000, 000, 000, 000 של טקסט פתוח, 000, 000 של טקסט ⁇ , 000, 000, 000, 000, 000, 000, 000 של טקסט חדש, 000, 000, 000, 000 של טקסט פתוח, 000 של טקסט ⁇ , 000, 000, 000, 000, 000, 000, 000 לשעבר, 000, 000, 000 לשעבר, 000, 000, 000, 000, 000, 000, 000 של טקסט פתוח, 000, 000, 000, 000, 000, 000, 000 של טקסט ⁇ , 000, 000, 000, 000, 000, 000, 000 ⁇ , 000 ⁇ ,
Mayan Codices ו- Mesoamerican Texts
רק קומץ של קומדיות לפני קולומביאניות מאיאן שרדו, ורבים ניזוקו מאוד.ה-FLT:0 Maya Codex Projects Projects Projectof1 (באוניברסיטת בון) החל ללמוד עמוק כדי לשפר את התמונות של הקודקס מדריד, אחד משלושת המרכיבים האקסטנטיים של מאיאן, על ידי הכשרת גפיים ידועים מקטעים שלמים, הצוות היה מסוגל לשחזר תמונות של דגם דינמי ומאוחר יותר, אשר סייע לשילוב של כתבי יד טבלאות מקוריות.
אתגרים ומגבלות
איכות נתונים וזמינות
מודלים למידה עמוקה הם נתונים-hungry.אימון מערכת שיקום חזקה דורש נתונים גדולים, מתוייגים של כתבי יד שלמים ופגום - נכס כי מוסדות מורשת תרבותית רבים חסרים.הנעה היא זמן רב, ודורש מומחיות במחקרי הפלייאוגרף לעתים קרובות לפנות נתונים סינתטיים (למשל, הוספת רעשים מלאכותיים, או נפיחות סינתטית לתמונות נקיות), אבל אלה עשויים לשחזר סוגים של סימולציה חלקית של תופעות לוואי (למשל, אך לא ניתן לשחזר את הגרסאות מלאות של תופעות לוואי של תופעות לוואי של תופעות לוואי של תופעות לוואי (למשל, אך לא ניתן לשחזר).
טעות
שיקום הוא צינור: תמונה ראשונה ניקוי, ולאחר מכן זיהוי טקסט, אז מודל שפה הקצנה שגיאות במתחם שלב אחד בשלבים הבאים. aקטין הזיות inpainting - מכתב שנראה סביר אך הוא לא נכון מבחינה עובדתית - יכול להוביל את מודל השפה לייצר מילה לא קיימת או שינוי משמעותי אך לא נכון מבחינה היסטורית.
חוסר יכולת ו Bias
רשתות נילי הן קופסאות שחורות ידועות לשמצה.כאשר מודל ממלא במילה נעדרת, לעתים קרובות בלתי אפשרי להסביר בדיוק מדוע הוא בחר את המילה הזו על פני אחרים.עבור היסטוריונים, חוסר שקיפות זה יכול להיות מטריד, שכן כל שחזור חייב להיות מבודק עבור הסתברות היסטורית.בנוסף, אימון נתונים לעתים קרובות מגיע ממסורות ספציפיות שדה, זמין נרחב כתבי יד (למשל, התנ"ך וולגייט, טקסטים שוליים, דקדוקיים, דקדוקיים, דקדוקיים, דקדוקיים, דקדוקיים, דקדוקיים, דקדוקיים, דקדוקיים, שיטות דקדוקיות, דקדוקיות, דקדוקיות, דקדוקיות, דקדוקיות, דקדוקיות, דקדוקיות, דקדוקיות, דקדוקיות, דקדוקיות שונות, דקדוקיות, דקדוקיות, דקדוקיות, דקדוקיות, דקדוקיות, דקדוקיות, שיטות דקדוקיות, דקדוקיות, דקדוקיות, שיטות דקדוקיות, דקדוקיות, אבל דקדוקיות, דקדוקיות, דקדוקיות, דקדוקיות, לעתים קרובות יכול להיות מרשימות דקדוקיות, אבל דקדוקיות, שיטות דקדוקיות דקדוקיות דקדוקיות שונות, דקדוקיות דקדוקיות דקדוק
סודיות ואותנטיות
ככל שלמידה עמוקה הופכת את שיקום קל יותר, שאלות עולות על אותנטיות ועל אופי ה"מקור" כאשר מודל מחלחל למכתב שבור, הוא ששיקום או ניחוש? עבור קונסרבטורים, הקו בין התאוששות ויצירה הוא עדין.חלק מהמוסדות מהססים לפרסם תמונות עמוקות של למידה עמוקה ללא תיקון ברור אילו חלקים הם מתוחכמים.
כיוונים עתידיים
הגבול הבא ללמידה עמוקה בשיחזור כתבי יד הוא בזמן אמת, כלים אינטראקטיביים שמשלבים בצורה חלקה לתוך מעבדות שימור.דמיין קוטרבור מצביע על מצלמה רב-ספקטרום בשקע פגוע; בתוך שניות, מציאות רבודה מראה את הטקסט המורחב ואפילו מספק תמליל זמני, מדגיש מילים ודגלים זהירים לאזורים לא בטוחים.
כיוון מבטיח נוסף הוא ההיתוך של שיקום פיזי ודיגיטלי.רובים המצוידים במיקרו-סוי ובמברשת משובחת משמשים לניקוי ניירות שבריריים, אך הם זקוקים להדרכה בזמן אמת כדי להימנע מדמיעת.לימוד עמוק יכול לנתח תמונות מיקרוסקופיות לזרועות רובוטיות ישירות, הסרת עפר או דבקים תוך הימנעות דיו.סינרגיה זו מבטיחה להאיץ את השימור תוך צמצום השגיאה האנושית.
מודלים של Cross-lingual ו- cross-script גם מחזיקים פוטנציאל.השיקום העתידי AIs עשוי להיות מאומן בעשרות תסריטים - cuneiform, עצמות אורקל סיניות, Mayan Hieroglyphs, קוראיגרפיה בערבית - המאפשרת אדריכלות אחת לטפל בסוגי נזק מגוונים.com לא תאפשר לצוותי שימור ליישם מודלים מאומן על משפחה אחת עם נתונים מינימליים נוספים, תוך שימוש במוסדות עם מודלים מוקדמים של מודלים לדגם:0CDC, אשר ניתן ל-41 של דיוקים של מודלים דומים של דגם זה, כלומר: 0, כלומר, כלומר, כלומר, על גבי מודל של זיכרון של זיכרון של 1Fross:0CDC, לא ניתן ל-41, רק על גבי מודל ל-41 של זיכרון מדויק של זיכרון של מסמכים דומים, על גבי דגם של 1Fross, לא ניתן ל-41 של זיכרון RAM של מסמכים של מסמכים של מסמכים מ-41 של מסמכים דומים, לא ניתן ל-41, על גבי מודל של זיכרון של זיכרון RAM של 1Fross, לא ניתן ל-41 של מסמכים דומים, כדי לספק, לא ניתן ל-41 של מסמכים של זיכרון של זיכרון של זיכרון של זיכרון של זיכרון של 1-41 של מסמכים של זיכרון של זיכרון RAM של מסמכים של
לבסוף, מחקר מתמשך הוא לחקור מודלים ניוניים שלא רק לשחזר טקסט קיים, אלא גם (FLT:0generate plausableשלאות עבור חלקים טקסטואליים אבודים של תפוצה 1 - לא עבור זיוף אלא גם עבור להנחות השערות המלומדות.כאשר בשילוב עם מגבלות היסטוריות קפדניות (תאריךי חיוב, ידוענות, סמנים סגנוניים), מודלים אלה יכולים לעזור לשחזר את קווי המתאר של יצירות שאבדו, כגון כתבי אישום חסרים, אך הם יכולים לספק ביקורת על ידי ציירים.
מסקנה
למידה עמוקה עברה שיקום כתבי יד מאמנות הפעלה גרידא, ידנית למדע פרואקטיבי, מונע נתונים.על ידי כך שאיפשרה את שחזור הטקסט שלא היה ידוע בעבר - בין אם בשל חורבן, פיזי או פחמן - זה כבר עיצב מחדש את ההבנה שלנו של העולמות העתיקים והמימיים. ⁇ ים המלח, herculaneumne papy, ו אינספור codices מימי הביניים כבר נכנעו מחדש של יישום חדש, עדיין נחשבו המקורי, עדיין, אך ורק לאחר מכן, הוא חידה, אך ורק לאחר מכן, הוא עדיין, הוא חידה, אך ורק לאחר מכן, הוא נחשב, הוא עדיין, כי הוא חידק, כי הוא עדיין, כי הוא עדיין נחשב, כי הוא חידה, כי הוא עדיין, כי הוא חידה, כי הוא עדיין, כי הוא עדיין ראוי לציון, כי הוא עדיין, כי הוא עדיין, כי הוא עדיין, כי הוא עדיין, כי הוא היה צריך להיות זהיר, כי הוא עדיין, כי הוא עדיין, כי הוא עדיין, כי הוא עדיין, כי הוא עדיין, כי הוא עדיין, כי הוא היה צריך להיות זהיר, כי הוא היה צריך להיות זהיר, כי הוא עדיין, כי הוא עדיין, כי הוא עדיין, כי הוא עדיין, כי הוא עדיין, כי הוא היה צריך להיות זהיר, כי הוא היה צריך להיות
ככל שהאלגוריתמים גדלים יותר חזקים והנתונים יותר כוללים, אנו יכולים לצפות עתיד שבו לא נותר כל כך יקרא כתב יד פגוע.שילוב של ראיית מחשב, עיבוד שפה טבעית, ורובוטיקה מבטיחה לפתוח ספרייה שקטה של ידע התאושש – טקסטים שיעמיקו את תפיסתנו של ההיסטוריה, הספרות, הדת והמדע. Deep Learning אינם מחליפים את הקומפוארטור או את החילוף החיוורטי; הוא נותן להם כלי רב-מדומים, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, לדוגמה, מודעות תרבותית, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, כלומר, למידה עמוקה יותר, על ידי למידה עמוקה, למידה עמוקה, על ידי למידה עמוקה, על ידי למידה עמוקה, על ידי למידה עמוקה, על ידי למידה עמוקה, על ידי למידה עמוקה, אינה תחליף לכדי, על ידי למידה עמוקה, על ידי למידה עמוקה, על ידי למידה עמוקה, אינה תחליף לכדי, היא, היא אינה תחליף לכדי מהפכה, על ידי למידה עמוקה, על ידי למידה עמוקה, היא אינה תחליף לכדי, היא, על ידי למידה עמוקה, היא, על ידי למידה עמוקה יותר, היא אינה תחליף לכדי מהפכה,