historical-analysis-and-study-techniques
Tarihsel Metinleri Anlaşmak İçin Bilgisayar Dil Bilimini Kullanmak
Table of Contents
Yüzyıllar boyunca tarihçiler arşivler yoluyla acı çekiyorlar, mektuplar, sayfa tarafından mektup okuyarak, insan deneyiminin anlatısını bir araya getirmek için.Bu manuel yaklaşım tam olarak paha biçilmez bilgiler verdi, şimdi ölçeklendirme dilinin otur. tarihsel metinlere uygulanan, kağıtlar, gazeteler ve sözlükler, ve hükümet kayıtları – talep edilen yeni yöntemler. C ⁇ dilbilimleri, bilgisayar bilimi ve dilbilimi kesişen çizgilerinin kesiştiği şekilde yeniden tanımlanmasına izin veriyor.
C ⁇ Linguistics nedir?
C ⁇ dilbilimi sadece kelimeleri saymak için yazılım yazmakla ilgili değildir. Bu, makinelerin her şeyi telefon ve morfolojiden sözcülere, semantics ve pragmatiklere karşı koymak, kısmi cümle yapısına, cümle anlamlandırmak, anlam ifade etmek ve anlayışa dayalı algoritmaların ve istatistiksel makine öğreniminin bir kombinasyonunu kullanarak, genellikle geniş bir fiziksel bir öğrenmede eğitilmiştir.
Tarihsel metinlerin bağlamında, hesaplama dili bir tür zaman makinesi haline gelir. Diller gelişti: standartlaşmış standartlar, yeni kelimeler ortaya çıkıyor, eskiler arşivsel ve gramer değişimleri haline gelir. Modern İngilizce üzerinde eğitilmiş bir hesaplama modeli, 17. yüzyıl pamphlet ile mücadele edecek. Bu nedenle, araştırmacılar bu araçları adapte etmeli - tarihsel olarak büyüye, özel lexicons geliştirmeli ve geçmiş çağın dil çeşitliliğine uygun modeller.
Tarihsel Metinleri Teknoloji ile Analiz
Text Digitization and OCR
Her hesaplama analizi, analiz için fiziksel veya tarama belgeleri makineye hazırlanabilir metin haline getirmekle başlar. Optik Karakter Tanımlama (OCR) Bu görev için birincil teknolojidir. Erken OCR sistemleri tarihsel yazılarla ilgili olarak yanlış anlaşılmaz bir şekilde, fading ink ve eşitsiz sayfa düzeniyle birlikte, Tesseract ve ABB FineReader gibi, özellikle de tarihsel senaryolara göre gelişmiş görüntü işleme öncesi ve dil modelleri ile bir araya geldiğinde, OCR hata oranları önemli bir engel olarak kalır.
Bir kez dijitalleştirilmiş, metin bir işlem hattına girer: tokenizasyon (sözlere veya jetonlara) normalleşme (standart yazımlar, uzun ‘s) ve işaretleme gibi değişken karakterleri ele alır ( paragraflar için yapısal etiketler, sayfa molaları veya marjinalleştirme).
Corpus İnşaat ve Annotasyon
Tarihi bir korpus basit bir metin çöplüğünden daha fazlasıdır. Zaman dönemi, türü, lehçe ve yazarlık gibi denge faktörleri dikkatlice tedavi edilir.Projeler, Tarih Amerikan İngilizcesi (COHA))Helsinki Corpus of English Texts) gibi, bazen yanlış kelimelerle ilgili bir kelimeyle ilgili olarak, "öğrenmesel olmayan" kelimelerle ilgili olarak, metinleri içerir.
Tarihi Metinler için Anahtar C ⁇ Teknikleri
Frekans Analizi ve Anahtar Kelime Ekstraksiyon
En basit, frekans analizi, İngilizce İç Savaş ile ilgili sık sık sık kelime veya cümlelerin nasıl göründüğünü belirtir. Örneğin, istatistiksel olarak ifade edilen terimler arasında keskin bir artış, “savaş” ve “zenginmy” 17- Yüzyılda İngilizce pamphlets, belirli bir yazarın, türün veya çağın ayırt edici kelimelerini karşılaştırmak için daha sofistike bir anahtar kelimeyle ilişkilendirilebilir.
Topic Modeling
Topic modelleme, bir belge koleksiyonunda geç temaları keşfederken denetimsiz bir makine öğrenme yöntemidir.En yaygın algoritma, Latent Dirichlet Allocation (LDA), her belgeyi bir konu olarak ele alır ve her konu üzerinde bir dağıtım olarak "endüstriyelleştirme" konusu olarak adlandırılır.
Sentiment Analysis Analysis
Cümle analizi, metinleri etiketleyen duygusal kelimeleri ölçmek için kelime frekansının ötesine geçer - olumlu, negatif veya tarafsız. Erken yöntemler, Amerikan Devrimi veya çıkarma hareketi gibi olaylar sırasında kamuoyuna açık fikir verebilir. ancak, duygusal lexicons dikkatli bir adaptasyon gerektirir: “terrible” gibi bir kelime daha tam anlamıyla 18. yüzyılda (günümüzdeki olumsuzluk analizi) daha çok kullanılabilir.
Add Entity Recognition (NER)
NER, hiçbir şeyin doğru olmadığını ve sınıfladığını kabul eder - insanların isimleri, yerler, organizasyonlar, tarihler, vs. - Tarihsel NER özellikle tartışmalıdır, çünkü varlıklar değişken yazımlarda yazılabilir (örneğin, “Shakspere” vs. “Shakespe”), veya uzun süredir desteklenen kurumlardan (örneğin, tarihî gazetelerde eğitilmiş özel NER modelleri, tarihî tablolarda ve biyografik veritabanından bahsedilebilirler, olaylar nereden bahsedilir ve ne zaman.
Stylometry ve Authorship Attribution
Stylometry, stil yazmak için istatistiksel analiz uygular - cümle uzunluğu gibi başarı, kelime frekansı dağıtımları ve işlev-sözlü kullanım (örneğin, “ve” Alexander Hamilton veya James Madison tarafından yazılmış olup olmadığını, temel öğrenme sınıfları için çok yönlü bir teste sahiptir.The key is used to resolve long-ct authorship arguments, such as if certain Federalist Papers were written by Alexander Hamilton or James Madison. methods range from simple chi-squared tests to complex to use that are used to use that are used to deploy the reliable time to use that are used to use the reliable time to use that are written period.
Lexical Change Tespit ve Semantic Shift
Kelimeler zamanla anlam değiştirir. C ⁇ , araştırmacıların bu değişimleri ölçmelerine izin verir. Örneğin, 1900'lerde “göpekkürüm” kelimesi, eşcinsellik ile ilişkili olarak 1970'lerde, bilimsel terimler ve sosyal kategorilerde kullanılan modeller ile ilişkilendirilmiştir.
Vaka Çalışmaları ve Gerçek Dünya Uygulamaları
Demokrasi Dilini Takip Etmek
1750'den 1800'e kadar Amerikan siyasi broşürlerini incelemek için konu modelleme ve duygu analizi kullanılmıştır. Onlar devrimci retoriklüğe karşı dramatik bir değişim buldular, “özgürlük” gibi kelimelerle, genel olarak 1775'ten sonra kutuplaşmış kümelere hareket eden “doğrular” ve “hakkümeme” gibi temel kavramlarla hareket eden “sağlık” gibi önemli rakamlar tespit ettiler.
Eski Yazarlık Yeniden Yapın
Klasik metinler genellikle belirsiz yazarlık ile hayatta kalır. Platon'a verilen eserleri okuyan Scholars, her durumda geleneksel paleografik ve tarihsel eleştirilerini tamamlamak için stilize edilmiş kanıtlar sunmaktadır.
Mapping Historical Emotion
19. Yüzyıl mektuplarının bir korpusu üzerinde analiz, Amerikan Batı'ya gelen mektuplar bir model ortaya çıkıyor: erken mektuplar iyimser, yüksek olumlu duygular puanları ile, ancak ilk sert kıştan sonra, negatiyonel veriler tarihçilerin sadece ne olduğunu anlamalarına yardımcı oluyor, ama nasıl deneyimlendiğini anlamalarına yardımcı oluyor.
C ⁇ Historical Linguistics'de Meydan Okunmalar
Sözcülüğe rağmen, tarihsel metinlere hesaplama dillerini uygulamak zorluklarla doludur.
OCR Hataları ve Noisy Data
Tarihsel OCR genellikle garbled metin üretir: “Uzun” “Iong” (tarihi yazımda eğitilmiş uzun ‘yaşlı’ modeller) ve metin hatları “oid” hale gelir ve metin hatları, aşağılayıcı analiz yoluyla alıntılanabilir, skewing frekansı sayılır ve kafa karıştırıcı NER modellerini kullanarak düzeltme.
Yazma ve Dil Değişimi
Standartlaşmış bir büyü modern bir fenomendir. 19. yüzyıldan önce, İngilizce ortoografi son derece değişkendi: “Shakespeare” “Shagspere” veya “Shaxberd” olarak görünebilir. Lemmatization (sözcülükleri temel formlarına düşürmek) bu tür çeşitleri kanonik bir şekilde haritalamayı gerektirir, geniş lexicons ve esnek dize-dönüşüm algoritmaları talep eden bir süreçtir.
Data Scarcity ve Domain Adaptation
Dijitalleştirilmiş arşivler çok büyük olsa da, genellikle dengesiz olmayan modeller, zaman dönemleri veya metin türleri aşırı temsil edilir, diğerleri (örneğin, özel kadınlar, yerli diller) oluşturmak için makine öğrenimi modelleri çok az değildir.
Belirsizlik ve Yorumlama
Herhangi bir metinin anlamı kısmen bağlamının bir ürünüdür. C ⁇ yöntemleri desenleri tanımlayabilir, ancak bu kalıpları yorumlamak, derin tarihi bilgilere karşı aniden artış sağlayabilir. “epidemik” referanslarda gerçek bir salgın nedeniyle olabilir, ancak aynı zamanda tıbbi terminolojide bir değişiklik yansıtabilir veya yeni bir düzenlemeyi de yansıtabilir.
Future: AI ve Büyük Dil Modelleri
Büyük Dil Modelleri (LLMs) GPT-4, Llama ve BERT gibi son patlama, tarihsel metin analizi için yeni olasılıklar açtı.Daha önceki modellerin aksine, LLM'ler, görevleri yerine getirebilir yakın insan seviyelerinde ).
Ancak, LLM'ler kendi riskleriyle gelir. Gerçekleri ortaya çıkarabilirler, modern önyargıları yansıtabilir ve tarihsel bağlamı sadık tutamayabilirler. Araştırmacılar, orijinal kaynaklara karşı çıktıları doğrulayabilirler. Hybrid approach that together sembolik tarihi bilgileri (e.g., starers, biografik veritabanı) bir sonraki on yıllara hükmetmek muhtemel.
Araştırmacılar için Araçlar ve Kaynaklar
Kendi hesaplama tarihsel analizlerine başlamak isteyenler için, birkaç açık ve ticari araçlar mevcuttur:
- [FONT=0)Voyant Tools:[Dönetici:[Dönetici:0) Programlamayı gerektiren bir web tabanlı metin analizi platformudur.
- [FONT=0]Python Kütüphaneleri: [Dönetici: [Dönetici: · 3] NLTK, spaCy ve scikit- learning tokenization, NER ve sınıflandırma için sağlam fonksiyonlar sağlar. Tarihsel modeller (örneğin, 19. yüzyıl İngilizcesi için 0) Hugging Face ile kullanılabilir.
- [FONT:0)TEI (Text Encoding Initiative): ), XML'deki tarihsel belgeleri işaretlemek için standarttır, projelerde yapısal analiz sağlar.
- [FONT:0]Stanford CoreNLP: Birkaç dil için önceden eğitilmiş boru hatları sunar, tarihsel veriler üzerinde yeniden eğitim almak için seçeneklerle.
- [FONT:0] Historical OCR Platforms: Transkribus ve OCR4all, belirli fontlar ve senaryolar için özel model eğitimi sağlamak.
Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç
C ⁇ dilbilimleri, tarihçilerin daha önce cevaplanmamış sorular sormasına izin veriyor; veri kalitesi, alan adaptasyonu ve araştırma gündeminde yüksek kalan bir dilbilim modelinin analizine izin vererek, insansal araştırma ve hesaplama analizi arasındaki ortaklıkları test etmek, tarihçilerin sadece dilsel değişim hakkında sorular sormasını sağlıyor, tarihsel bir veri derinliğine sahip bir dilbilimcinin derinliğine sahip olmak, bir dilbilimcinin derinleşmesine veya daha sofistike hale getirmek için önemli bir bilgi birikimini talep ediyor.