study-guides-and-learning-resources
Makine Öğrenme Algoritmalarının Kullanımı Tarihsel Verilerde Yardımcılıkları tespit etmek
Table of Contents
Makine Öğrenme Algoritmalarının Kullanımı Tarihsel Verilerde Yardımcılıkları tespit etmek
Tarihsel araştırmalar uzun zamandır birincil kaynakların dikkatli bir incelemesine bağlıydı - yanlış yazılmış bir yazı, kayıt kayıtları, gazete arşivleri, diplomatik yazışmalar ve maddi eserler. Ancak en titiz korunmuş arşivler bile hataları içeriyor, omissions ve outright çelişkileri. tek bir sayım düzeltme, yanlış bir şekilde düzeltti, ya da bu kanıtlayıcıların ölçeklerini gözden geçirmeleri için kaynak eleştirileri, tarihsel hataların ve yanlış referansları tespit edebilir.
Tarihsel Veri Analizinde Makine Öğrenmesini Anlamak
Makine öğrenimi, her kural için açık bir şekilde programlanmamış verilerden öğrenilmesine olanak sağlayan bir alt yapay zekanın alt kümesidir. Tarihi analizde, ML algoritmalarının büyük hacminin (örneğin, tabular alanları) ve yapılandırılmamış metin (örneğin, günlük girişler, “normal” normlardan sapmak üzere görünen kalıpları tanımlamak için.
Core Concepts: Özellikler, Etiketler ve Eğitim
Her ML projesi tanımlandırılabilir:0)features[Dönetici:0)[değiştir | kaynağı değiştir][değiştir | kaynağı değiştir][değiştir | kaynağı değiştir][değiştir | kaynağı değiştir][değiştir | kaynağı değiştir][değiştir | kaynağı değiştir][değiştir | kaynağı değiştir][değiştir | kaynağı değiştir]
Inconsistencies Machine Learning Türleri Catch
Inconsistent tarihi veriler birçok form alır ve farklı algoritma aileleri farklı sorunlara uygundur:
- [FONT=0] Kronolojik çelişkiler:[Dönemli yaşamları, regnal dönemleri veya olay sıralarını ihlal eden Tarihler.
- [FONT:0]Numerical outliers: Gerçekçi çağlar (örneğin 150 yaşında bir kişi), imkansız vergi miktarları veya ani nüfus atları.
- [FONT:0]Textual anachronisms: Dile girmeden önce görünen kelimeler veya ifadeler, henüz gerçekleşmemiş olan olaylara atıfta bulunulmamışlardır.
- [FONT:0)Duplicate or near-duplicate records: Aynı kişi veya olay hafif değişikliklerle birden çok kez girdi.
- [FONT:0)Missing veya dolu değerler: Alanlar boş bıraktı ve daha sonra farklı bir el tarafından tamamlandı, muhtemelen yanlış çıkarımla.
- [FONT:0]Biased kapsamı:[Dönetici:[Dönetici:0)[Döneticileri tespit edebilir.
Makine Öğrenme Algoritmaları Uygulamada
Doğru algoritmayı seçmek tarihsel verilerin doğasına ve hedef alınan tutarsızlık türüne bağlıdır. Aşağıda en yaygın aileler, illüstrasyonel kullanım vakaları ile birlikte.
Süpervize Öğrenme: Sınıflama ve Regresyon
Tarihçiler bir zemine eriştiğinde – noter ormanları ve [[Döneticileri [Döneticileri) ile ilgili olarak kullanılan 10 adet veri türü (sabahları, tarihleri) ve önemli puanlar sunarlar.[Döneticileri) Örnek olarak, aşağıdaki özellikleri gösteren bir proje, aşağıdaki tablolar için doğrulanmışlardır.[Döneticileri doğrulayıcılar tarafından doğrulanmışlardır.
Denetimsiz Öğrenme: Clustering ve Anomaly Tespit
Çoğu tarihsel veri kümesi tam doğrulanmış etiketler - çok tutarsızlıklar[DBS][DBS][DBS][DBS)[değiştir | kaynağı değiştir], bir hafta içinde farklı bir şekilde yapılan bir dizi kayıtta, DBSCAN'ı tekrarlamanın bir çalışma olarak kullanılan bir dizi otomatik olarak, bir sonraki aşamaya kadar, bir sonraki aşamaya kadar farklı bir şekilde geri dönüşler için farklı bir şekilde geri dönüşler yapılmıştı.
Doğal Dil İşleme (NLP)
Tarih metinleri, bu zorlukların üstesinden gelmek için yazılmış olan 17.000'den fazla makaleye sahip olan John Schrefert'in, "The Modern NLP teknikleri, bu zorlukların üstesinden gelmek için kullanılan bir uyarıda bulunacaktır" diyor.
Tarihsel Yazının Hazırlanması
NLP için önemli bir meydan okuma, önceden belirlenmiş bir büyüye neden olabilir, örneğin, farklı kelimeler olarak değişken formlara tedavi etmek için standart modeller. Sub-word tokenisation (Byte-Pair Encoding) yardımcı olur, çünkü eğitim kelimesi belirli bir şekilde genişletilebilir.Bazı projeler, örneğin, arşivlemeler, genel modellerin% 15'i üzerinde genel olarak tespit edilen BERT modellerini (örneğin, Erken dönemsel olarak).
Tarihsel Araştırma Uygulamaları
Yukarıda açıklanan teorik özellikler, giderek artan sayıda somut tarihsel soruşturmada kullanılmıştır. Aşağıdaki alt bölümler ML-yerel inkonsistency algılamanın nasıl yeniden şekillendirmekte olduğunu göstermektedir.
Kraliyet Chronicles'taki Çatışma Tarihleri Tanımlama
Ortaçağ kronikleri genellikle farklı tarihlerle aynı olayı kaydetti, çünkü scribal hataları, farklı takvim sistemleri veya mevsimsel değişiklikler olarak kullanılan bir ekip ve astronomik fenomenler (örnekler, bilim Tarihi içinMax Planck Enstitüsü), kronik bir aralıkta 50.000 tarihli bir olay üzerine eğitilmiş bir denetimli model inşa etti (900-1500 CE).
Census Data'daki Diskleri Tanımlamak
Tarihsel nüfus sayımı, demografik araştırma için zengin kaynaklardır, ancak açıkçası tutarsızdır. İsimler kaçırılır, yaşlanmış, işgaller tutarsız olarak kaydedilir ve aileler, ev kayıtlarının denetimsiz kümelemeleri, örneğin, “baba” sadece beş yaşında, “çocuk” kaydının 1841-1911) diğer ucundaki yanlış anlamadığı gözlemlenen dokuzuncu vakayı düzeltti.
Handgraph ve Dil Analizi Kimlik Doğrulamayı Doğrulamak için
Yüzyıllar her zaman tarihsel arşivleri rahatsız etti. Makine öğrenimi, özellikle NLP ile birlikte bilgisayar vizyonu, şimdi sağlam kimlik doğrulama araçları sunuyor.(HWR))[Dönemli)[Dönemli)[Dönemli)[Dönemli) bir yazının ardından, bir yazının yazarı olan bir yazının (örneğin, diğer taraftan) bir yazının (örneğin,) tarafından yazılmış bir yazının (örneğin,) çevirisinin (örneğin,) gerçekleştirilen bir yazının (örneğin,)
Biased veya Incomplete Records
Tarihsel veriler genellikle yaratıcılarının önyargılarını yansıtıyor - örneğin, resmi kayıtlar sistematik olarak kadınlar, azınlıklar veya fakirler Makine öğrenimi, bu boşlukları açık hataları bulmakla kalmıyor, ancak bilinen cinsel miras yasalarının kontrol edilmesiyle karşı karşıya kalabilir.[0]Association kuralı madenciliği) Bazı niteliklerin (örneğin, “fekte edici bir şekilde) yok edilmesi ve “kadın” + “karanlık sahipleri) tarafından yapılan bir şekilde, bilinen cinsiyete özgü miras yasalarının kontrol edilmesinden çok daha az sıklıkta ortaya çıkabilir.
Meydanlar ve Etik Bakışlar
ML-güdümlü tutarsızlık algılama sözüne rağmen, yol engellerle doludur. Bazıları teknik, diğerleri etiktir; hepsi dikkatli bir navigasyon gerektirir.
Data Quality and Scarcity
Makine öğrenme modelleri veri toplayıcısı. Tarihsel veri setleri, çoğu zaman büyük olsa da, modern haberler üzerinde iyi çalışan bir NLP modeli 17. yüzyıla kadar yanlış bir şekilde eğitilebilir. Birkaç yüz doğrulanmış kayıtlarda eğitim gören bir denetimli model, eski korelasyonda yeterince genelleştirilebilir: eski veriler genellikle öğrenme için gerekli olan hacimden yoksundur: modern haberlerde iyi çalışan bir NLP modeli genellikle 17. yüzyıla kadar yatırım yapamaz.
Biaslification
Tarihi veriler önyargılıysa – aslında, birincil kimliklerin ortaya çıkmasının bir yansıması değil, bu verilerin üzerinde eğitilmiş bir ML modeli, kadınların “anomalous” olduğunu ve tarihsel dönemler olarak gerçek kadın girişlerini ifade edebilir. Mitigation stratejileri, kaynağın orijinal önyargılarını yansıtmak için bir motivasyon kaynağı değildir. Risk, araştırmacıların, modeli güvenilir, yasal veya “korunan” geçerli verileri nasıl doğrulanmış olabileceğinin doğrulanmasıdır.
Terzit ve Şeffaflık
Kompleks modeller - özellikle de sinir ağları – siyah kutular olarak çalışır. Bir tarihçinin SHAP (SHapley Katkıları) ve LIME (Yerel Yorumlama) gibi, belirli bir kayıtta bulunan bir belgeye sahip olup olmadığını açıklamaya karar veremez. Örneğin, SHAP (XAI) gibi, özellikle de "tarihsel bir giriş" ile ilgili olarak, "en az sayıdaki "taraf" ile ilgili olarak kabul edilebilir bir şekilde, "tavatan" olarak yönlendirilebilir.
Hassas Datan Etik Kullanımı
Tarihsel kayıtlar, hala yaşayan bireyler hakkında kişisel bilgiler içerir veya ezilen topluluklara danışabilir veya veri yönlendirmeleri için en iyi uygulamaları takip edebilirler (örneğin, köle kayıtları, sömürge sayım verileri). ML'yi bu tür veriye yönelik kurallar hakkında baskılar ve yanlış anlamalar. Araştırmacılar, atalarının kayıtlarına ait bulguların yayınlanması için en iyi uygulamaları takip etmelidirler.
C ⁇ Maliyet ve Uzmanlığı
Eğitim sofistike ML modelleri önemli hesaplama kaynakları gerektirir (GPUs, hafıza, depolama) ve birçok tarih bölümü eksik olan özel uzmanlıklar. tarihçiler ve bilgisayar bilim adamları arasındaki işbirliği projeleri giderek daha yaygındır, ancak zaman, fon ve karşılıklı anlayış gerektirir. Open-source araçları (seeFLT:0) Transkribus).
Future Yol ve Implications
Makine öğrenimi tarihsel tutarsızlık algılama için gümüş bir mermi değil, ancak tarihçinin aracıkit'in vazgeçilmez bir parçası haline geliyor. Önümüzdeki yıllarda daha derin entegrasyon için birkaç trend noktası.
Multimodal Modelleri
Future sistemleri metin bir araya getirecek, resim (yazı, mühürler, su işaretleri), ve hatta uzaysal veriler (GIS koordinatları) tek bir çerçeveye kadar.Bir valanlı cuneiform tabletleri ile bağlantı kurma imajı, ikonografik olmayan bir ayrımı tespit edebilir.
Aktif Öğrenme ve İnsan-in-the-Loop
Bir modelin bayraklarını pasif olarak kabul etmek yerine, araştırmacılar NLP için bu tür iş akışlarını ve uygulamalarının en belirsiz durumlarda büyüyebilmelerini sağlıyor. Bu iteratif süreç, tarihçiyi kontrol altında tutmanın model doğruluğunu geliştirir. Systems likeETHFLT:0)Prodigy).
Tasarım tarafından etik AI
Alan olgunlaştığı gibi tarihçiler ve bilgisayar bilim adamları kültürel olarak hassas veriler için tasarım yapıyor.Cologne Digital Humanities) örneğin, modelin açıklamalarını, tarihsel önyargıları önlemesini engelleyen adil bir yaklaşım geliştirir ve model performansının sosyal gruplar arasında nasıl değiştiğini onaylar.
Tarihi Yeniden Yeniden Yeniden Yeniden Yeniden Yeniden Yeniden Yapılandırma için Generative Models for Historical Reconstruction
Tanımlamanın ötesinde, jeneratif AI zarar görmüş bir parish kaydı için bir dizi yardımcı olabilir; ancak bu, önceki düzeltmeleri öneren geçmiş bir tarihteki "konuşturma" olarak ortaya çıkmaktadır. Örneğin, bir model, herhangi bir jeneratif veri kümesine açık olmayan bir kayıt defteri oluşturmak için asla bir eksik tarih aralığı oluşturmak için eğitilmemelidir ve daha iyi arşivler için en iyi şekilde kullanılır.
Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç
Makine öğrenme algoritmalarının tarihsel verilerdeki tutarsızlıkları tespit etmek, çok daha önce çok karmaşık bir veri setleri olan, bu algoritmaların gücünü otomatik olarak ortaya çıkarmak için, sayısal bir şekilde analiz etmek, metinsel anakronizm ve sistem önyargıları, ML araçları, tarihçilerin daha büyük, daha karmaşık bir veri setleri ile çalışmak için daha fazla karmaşık bir veri setleri, yaşam tarzına sahip olması gereken hataları ortaya çıkarmak için daha iyi bir yöntem olarak kabul eder.