Tarihsel Analiz ve Çalışma Teknikleri
Doğal Dil İşleme Araçları ile Tarihsel Metinleri Analiz Etmek
Table of Contents
Tarihte Text Madeni Vakfı
Dijital arşivlerle çalışan tarihçi, tarihi metinleri analiz etmek için hesaplama yöntemleri ile karşı karşıya kalır ve araştırmacılar artık tek bir tıklamada bulunurlar, ancak bunları okumak ve sentezlemek için insan kapasitesi süresiz kalır. Doğal Dil İşleme (NLP) bu bolluğu kullanarak bir yol sunar.
Doğal Dil İşleme, bilgisayar ve insan dili arasındaki etkileşim üzerine odaklanan yapay zekanın bir şubesidir. birincil hedefi, makineleri okumak, yorum yapmak ve her iki istatistiksel olarak sağlam ve bağlamsal olarak farkında olan bir şekilde elde etmektir. Tarihi araştırma bağlamında, bu kırılgan, gürültülü ve son derece değişken belgeler – ortaçağ el yazmalarından yirminci yüzyıl telgraflarına kadar – metinden alıntılanan ve nicel olarak haberdar olmak için anlam ifade etmektir.
Geleneksel tarihsel yöntemler yoğun bir şekilde okumaya dayanır: küçük bir belge sayısı hakkında derin, yorumlayıcı bir analiz. Bu yaklaşım zengin, bağlamsalleştirilmiş anlayışlar yaratır, ancak ölçeklenebilirlik sorunları ile acı çeker. Tarihçi sadece çok fazla sayfayı analiz eder. NLP, kısa okuma kavramını öğretir; [Dönemli okuma[Dönemli okumalar için][Dönemli bir terim, edebi bilim insanı Franco Moretti.Bir metin çevirisinde binlerce metinden uzak bir şekilde yararlanabilir.
Tarih için NLP Borularının Temelleri
NLP'nin tarihsel belgelerde nasıl çalıştığını anlamak için, standart işleme boru hattını bozmak yardımcı olur. Her adım bir makine hazırlı formata ham metin dönüştürür:
- [FONT:0)Tokenization:[Dönetici:0) Bir metin akışına bireysel kelimelere, cümlelere göre, bu tür hataların işlenmesine izin verir, ancak tarihsel metinleri düzensiz bir şekilde ifade eder ve uzun ‘fek bir karakterin (bu, modern tokenizerlere benzeyen bir “f” karakterine benzemektedir.
- [FONT:0]Part-of-Speech (POS) Tagging: [Dönetici] Her kelimeyi grammatik rolü ile etiketlemek (noun, fiil, ekleyici, adsözcülük gibi) Bu, konu modelleme veya duygu analizi gibi görevlerin kritik bir nedenidir.
- [FONT=0)Lemmatization and Stemming:[Dönetici:0) Modern İngilizce üzerinde eğitilmiş bir lemmatizer veya “düşük” (daha iyi) “el” hale gelir; “daha iyi”, bu, genellikle “iyi” veya “yaratıcılık” gibi arkeolojileri tanımaya yardımcı olur.
- [FONT:0]Named Entity Recognition (NER): ), Yabancı bir bakanın, sermaye şehrini veya antlaşmayı önceden tanımlanmış kategorilere dayanarak, tarihler ve para değerleri gibi sınıflandırmayı ve sınıflandırmayı mümkün kılan bir araştırmacı.
Tarihsel Araştırmada Anahtar Uygulamaları
NLP'nin tarihsel malzemelere uygulanması, birçok araştırma alanını yeniden şekillendirmektir. Araştırmacılar artık hangi metinlerin ne dediğini sormakla sınırlı değildir; şimdi dil fonksiyonlarının zaman ve uzaydaki nasıl işlediği konusunda karmaşık sorular sorabilirler. Aşağıda en belirgin uygulamalar vardır, her biri beton örneklerle.
Okuma ve Makroanaliz
Okuma, akademisyenlerin tek bir öğleden sonra yayınların yüzyıl boyunca eğilimleri analiz etmelerine izin verir. Zaman içinde belirli kelimelerin veya temaların frekansını hesaplayarak, araştırmacılar fikir artışını ve düşlerini takip edebilir. Örneğin, bu tür basit, kamusal-yüzlülüğün kullanımını takip edin, ancak daha sağlam akademik araştırmalar, on sekizinci yüzyıldaki gazetelerin, farklı bir dilsel olarak kullanılan bir metin çevirisine göre farklı bir şekilde ifade edilen standart bir şekilde ifade eder.
Topic Modeling
Topic modelleme, Victorian parlamento konuşmalarıyla çalışan bir tarihçi, “rayın” ve “frin” bir başka grup “kökezleyici” ile ilgili bir konu hakkında bilgi odaklı bir haritayı kullanarak bir konu modellemesini kullanabilir.Bu hesaplama, her bir temayı "mühendis" ve "frin" olarak ifade eden bir konu hakkında bilgi sahibi olmak için bir alan adı ifade eder.
Stylometry ve Authorship Attribution
Stylometry, yazarların özel yazma tarzını ölçmek için istatistiksel analiz kullanır. Tarihsel belgelerde, Federalist Kağıtlar gibi özellikleri ölçmek için özellikle kullanışlıdır (örneğin, “ve”, araştırmacılar, yazarların yüksek doğrulukla ayırt edebilir.[Döneticileri, Rönesans oyunlarına karşı, ünlü bir durumda, stilize eden, stilistlerin işaret ettiği gibi).
Sentiment Analysis and Duygusal Arcs
Sentiment analizi, bir metin duygusal ton veya kutupsallığını ölçmek için çalışır (pozisyon, negatif, tarafsız). Tarihi metinlere uygulanan zaman, bu, uzmanlar tarafından dikkatli bir şekilde yönlendirilir - on dokuzuncu yüzyıl romanını takip etmek muhtemelen yanıltıcı sonuçlar üretecektir. Örneğin, Amerikalı Sivil Savaş sırasındaki özel bir duygu modelinin ortaya çıkmasının bir kısmını, büyük bir kış gösterisini veya daha uzun süre boyunca duygusal yaydığını farkederek - bu büyük bir ahlaki eleştiriyi takip edebilir.
Tarihsel Şekillerin Ağ Analizi
Örneğin, John Adams’ın yazışmalarında bahsedilen her kişiyi ekleyerek, araştırmacıların çoğu zaman etkilendiği, bu ağların kariyerinin seyrini nasıl değiştirdiğini ve bu ağların dinamik bir sosyal haritaya dönüştürdüğüne dair bir bilgi aracının tespit etmesine izin verebilir.
Geoparsing ve Spatial History
Tarihi NLP'nin büyüyen alt alanı, tarihçilerin tarihsel olayların ve uzaysal boyutlarının haritalanmasını sağlar. Örneğin, Siyah Ölüm'ün yayılmasına yönelik bir araştırmacı, tarihî salgınların sıralarına göre jeoparlamaları sürdürebilir.
Tarihsel verilerin meydan okumalarını tartışın
NLP'yi çağdaş haber makalelerine uygulamak yeterince zordur. Yüzyıllarca yazıya uygulayın, sonuçları geçerli olması gereken belirli bir teknik ve yorumlayıcı zorluk kümesini tanıtabilir. Bu zorlukların görmezden gelinmesi, tartışmalı korelasyonlara ve tarihi iddialara yol açabilir.
Optik Karakter Tanımlama (OCR) Hatalar
Çoğu dijital tarihsel metinleri fiziksel sayfaları tarayarak ve onları optik karakter tanıma (OCR) yazılımı aracılığıyla çalıştırarak oluşturulur. Tarihsel olarak, OCR yazılımı arşivsel fontlarla mücadele eder (uzun uzun zamandır) veya “hlhikaye dayalı olarak” olarak da adlandırılır.
Tarihsel Yazının
18. yüzyılın sonlarında İngilizce yazım standardına göre yazarlar genellikle telefona veya bölgesel kongreye göre telaffuz edilirler. “Glorious” (“mutlu”, “glorius” veya “gloriouse birkaç farklı kelime) veya “göstermetik kodlama algoritmaları [Döneticileri) gibi farklı bir şekilde ifade edebilir.
Semantic Shift ve Anachronism
Kelimeler stabil varlıklar değildir; anlamları zamanla sürüklenir. 1830'larda “gay” kelimesi ışıklı ve bakımsızdır; “yaratıcı”, ilk olarak, “gerçekten” bir şekilde, “önetici” olarak adlandırılan ve tam anlamıyla, tarihsel bir metinde ortaya çıkan algoritmaları kullanarak, “daha iyi bir şekilde” anlamlandırılan bir yöntemden “daha iyi bir şekilde, “daha iyi bir şekilde) bir şekilde, “daha iyi bir şekilde, yani, “daha az sayıdaki dilsel değişimden” anlamları kullanarak ortaya koyar.
Data Sparsity ve Fragmentation
Modern veri setlerinin aksine, tarihsel fiziksela genellikle eksiktir. Sadece on dokuzuncu yüzyıldan beri yazılanların bir kısmı, on altıdan daha küçük bir kısmı da sayısallaştırılmış durumda.Bu, eksik verilerden gelen yanlış sonuçları çizim olmadan bu sparsity önyargısını oluşturmak için yeterli olacaktır.
Tarihçiler için Pratik İş Akışları ve Araçları
Tarihçiler NLP'yi araştırmalarına entegre etmek için uzman programcılara ihtiyaç duymazlar. Yüksek seviyeli grafik arayüzlerden düşük seviyeli programlama kütüphanelerine kadar uzanan bir araç spektrumu vardır.Seçim, araştırmacının teknik konforuna ve sorulan soruların karmaşıklığına bağlıdır.
Hızlı Analiz için GUI-Based Tools for Rapid Analysis
Kod yazmadan hızlı bir şekilde başlamak isteyen araştırmacılar için, birkaç sağlam metin analizi platformu mevcuttur.ETHFLT:0)Voyant Tools), kullanıcıların metin yüklemesini ve hemen bulutları üretmelerini sağlayan web tabanlı bir uygulama, frekans listeleri, collok grafikler ve tema modellerini destekler. sınıf kullanımı veya açıklayıcı analiz için ideal hale getirmek. ”
Python ve R ile Programlama
Daha titiz, reproducible ve özelleştirilmiş araştırma için tarihçiler giderek dil senaryosu için dönüyorlar. Python), NLP için baskın dildir, [Döneticileri ile birlikte:2.Doğal Dil Toolkit (NLTKTOR)) ve Gensim, bir analiz için önceden inşa edilen fonksiyonları, tekrarlanabilir bir şekilde analiz için tekrarlama sağlar.
Bir Corpus inşa
Herhangi bir NLP projesinde ilk adım yüksek kaliteli bir korpus inşa etmektir. Güvenilir dijital arşivlerden gelen metinler kritiktir. Major repositories şunları içerir:
- [FONT:0])HathiTrust Digital Library[D:2)[Dönetici:0)[Döneticileri için sayısallaştırılmış kitaplardan büyük bir havuz, tam metin arama ve halka açık alan için indirme)
- [FONT:0]Chronicling America)[Dönetici: [Dönetici Amerikan gazetelerinin 1777'den 1963'e kadar, Kongre Kütüphanesi tarafından sağlanan bir aramalı veritabanı.
- [FONT:0]Eski Bailey Online)[DD:2)[Dönetici Yargı Mahkemesinin Londra'daki yargılamalarının tam olarak aramalı bir baskısı, 1674'ü 1913'e kadar genişletin.
- [FONT:0]Proje Gutenberg)[Dönetici:0] [Dönetici ve arşiv kültürel eserlerine gönüllü bir çaba, büyük ölçüde genel alan metinleri ile sınırlı, genellikle akademik arşivlerin metadata ve kalite kontrolü eksik olsa da.
Bir korpus bir araya geldiğinde, temizlenmeli ve önceden işlenmiş olmalıdır. Bu, metadata başlıkları ve ayaklayıcıları, standartlaştırma çizgi molalarını ortadan kaldırmak, ligatures (e.g., ‘fi’ye ‘yap’ dönüştürmek ve metin için gerekli düzeltmeleri uygulamak gerekir. küçük miktarda temizleme bile dramatik bir şekilde aşağı NLP görevlerinin doğruluğunu artırabilir.
Future: Büyük Dil Modelleri ve Dijital Tarih
Büyük Dil Modelleri (LLMs)'ın son patlaması – GPT-4, Claude ve Mistral gibi açık kaynaklı alternatifler - metin analizi için bir paradigma değişikliğini temsil ediyor. Bu modeller, insan-değerli metin üretebiliyor ve insanlar için kaliteli bir metin üretebiliyor. tarihçiler için LLMs, on yıl boyunca bir arşiv sorgulama imkanı sunuyor.
Ancak, LLM'ler tarihsel araştırma için önemli riskler sunar. Onlar da tarihi bağlamı yoksun bırakan veri kümeleri üzerinde eğitilirler.Bir LLM, tarihsel metinde modern bir ideolojik çerçeveyi, yirmi birinci yüzyıl önyargılarını yansıtan bir özet üretecektir.
Multimodal Analizinin Rolü
Tarihi metin analizinin geleceği, tam metinden daha fazla hareket etmiyor. Tarihsel belgeler sadece kelimeler değil; bir metin ve çizimler ile fiziksel nesnelerdir, resimler, marjinaller ve bağlayıcı.ETHFLT:0)Multimodal analizi), NLP'yi bilgisayar vizyonu ile bir araya getirir ve aynı anda görüntüyü analiz etmek için bir proje.Bu tür bir metin ve çizimler arasındaki ilişkiyi incelemek için, bir kitapla ilgili metin ve bütünleme bilgilerini analiz etmek ve indekslemek için.
Humanistic Questions, C ⁇ Tools
Doğal Dil İşlemenin tarihsel araştırmaya entegrasyonu, tarihçinin bir işin dışına otomatikleştirilmesiyle ilgili değildir. tarihçilerin ne anlama geldiğini genişletmekle ilgilidir. Raw Computing çıktısı bitmiş bir tarihsel tartışma değildir; bu tür bir kanıt parçasıdır: Bu model neden ortaya çıkar?
Bu araçları ustaca, akademisyenler yirmi birinci yüzyılın büyük dijital arşivlerini güvenle dolaşabilir. Kontrolümüzdeki hipotezleri test edebilir, gizli etki modelleri ortaya çıkarabilir ve dil, kültür ve tarih boyunca güçten yoksundur. Tarihteki dijital dönüşüm, yöntemlerimizi düzeltme fırsatı değildir ve geçmişimizi derinleştirecektir.