Kayıp Diller Nedir?

Kayıp bir dil, yaşayan konuşmacılara sahip değildir ve hayatta kalan kayıtların parçalanmış veya tamamen yok olması için bir şeydir. Bazı kayıp diller yok edilir, ancak antikalarda -örneğin, Latince, Roman dillerinin atasıdır, ancak eski formları iyi belgelenir. Diğerleri tamamen bilinmemektedir, hiçbir şekilde tanımlanabilir akrabaları ve Rosetta Stone'un tarihi dilbilimde en zor vakaları temsil etmesi gerekir.

  • [FONT:0]Linear A – Minoan Crete (c. 1800-1450 BCE) senaryosu pek çok girişime rağmen, kısmen de alt dili bilinen herhangi bir aileye ait olmayabilir.
  • [FONT:0]Harappan senaryosu[[Dönetici] [Indus Valley Civilization, c. 2600-00 BCE) - binlerce küçük mühür ve pottery shards üzerinde bulundu, ancak yazının yönü bile tartışıldı.
  • [FONT:0]Proto-Elamite[[Dönetici: 1 ) – şu anda İran'da 3100 civarında kullanılan en eski yazılı sistemlerden biri, daha sonra herhangi bir dille bağlantıya sahip olmayabilir.
  • [FONT:0]Rongorongo[[Dönetici: 1 ) – 13. yüzyıldan sonra ahşap tabletlerde gizemli bir senaryo. kökeni ve anlamı hala sıcak bir şekilde karşılanır.
  • [FONT:0]Meroitic[[Dönetici:0] – Kush Krallığının dili (günümüz Sudan). senaryo telefonda okunabilir, ancak alt dili birkaç kognate ve tam gramer yoktur.

Bu tür dilleri yeniden inşa etmek, 1950'lerde Mycenaean Yunan toplumunun anlayışını ve Homeric epiklerini yüzyıllarca önceden ilan eden bir bürokratik ve ekonomik sistemi ortaya çıkarmaktan çok uzaktır. Örneğin, 1950'lerde Linear B'nin deşifre edilmesi, şu anda boş kalan tüm bölümlerini doldurabilir.

Makine Öğrenmesinin Dili Yeniden Yapınması

Geleneksel tarihsel dilbilimler karşılaştırmalı yönteme dayanıyor: Indo-Avrupa veya Semitic gibi dil aileleri tespit ediyor (bu da ortak bir atayı paylaşan kelimeler) ve sonra zaman zaman zaman içinde meydana gelen ses değişimleri ve morfolojik değişikliklerden yoksundur. Bu yöntem, iyi niyetli bir yaklaşım için güzel çalışır: insan gözlerine görünmez olan düzenli olarak istatistiki aileler, boş zaman fark etmez, telefon işaretlerini öneremez veya mevcut metinler tutarlı olmayan işaretler için çok kısa sürede tavsiye edilir.

Ananında, makine öğrenimi dil yeniden yapılandırmasını bir model tanıma problemi olarak ele alır. Modeller bilinen dillerin büyük bir kısmında eğitilir - onlarca aile ve binlerce yıl boyunca - dilsel değişim eğilimlerini öğrenmek için, simulatif yapı ve gramermatik morfoloji.Mevcut bir dil parçası ile sunulduğunda, model bağımsız olarak kategori veya eksik karakterlerden yoksundur ve her yıl daha iyi bir şekilde büyüyebilmeyi önerir.

Anahtar Teknikleri

Sequence Prediction için Neural Networks

Neural ağları, özellikle de tekrarlayan sinir ağları (RNNs) ve daha yeni dönüştürücü mimariler, dil yeniden inşasında, ilgili dil listelerinden gelen kelimelerle birlikte eğitim edilirler. Örneğin, İtalyan [[0) ile sunulan bir ağ [FLT) Aynı büyüklükteki bir dizinle birlikte, tek bir araya gelen bir araya gelen bir programda bulunan bir araya gelir.

Çok az metinli kayıp diller için, araştırmacılar bazen bir dil yaklaşımı kullanırlar. Örneğin Yunan ve Sanskritçe arasındaki ses yazışmaları üzerinde eğitilmiş bir ağ, daha sonra Phrygian gibi kötü bir şekilde test edilebilir bir dile uygulanabilir, evrensel desenlere dayanan tahminler iç içe geçmiş gibi.Bu yaklaşım, daha önce düşünülemez bir şekilde kabul edilen düzinelerce Phrygian kelimelerini yeniden yapılandırmak için kullanılmıştır.

İstatistiksel Phylogenetik

Evrim biyolojisinden alıntılanan Bayesian istatistik modelleri dil aile ağaçlarını oluşturmak için kullanılır. Bu phylogenies, araştırmacıların nedensel dillerin özelliklerini tahmin etmelerine izin verir. Yöntem, ilgili diller ve konumsal dağıtımları ile karşılaştırmak için işaretleyicileri karşılaştırarak çalışır.Fortsal bir işaretle ilgili olarak belirli bir işaretle ilgili olarak bilinen bir işaretle ilgili olarak, belirli bir işaretle ilgili olarak bilinen bir işaretle ilgili olarak, doğrulanabilir.

Bu teknik özellikle Meroitic senaryosu için etkili olmuştur, kısmi bir telefonda var olan ancak birçok işaret belirsiz kaldı. Nilo-altı dillerinin bir filojeni inşa ederek ve işaret dağıtımlarını karşılaştırarak, araştırmacılar daha önce bilinmeyen birkaç karakter için olası telaffuzları daraltabildiler.

Transfer Öğrenme ve ⁇ Ön Lisans

Transfer öğrenme, büyük miktarda metin verileri üzerinde önceden eğitilmiş modeller kullanır - bazen onlarca dilden - ve sonra kayıp bir dilin küçük mevcut korpusunda iyi niyetli - bu çok önemlidir çünkü çoğu kayıp dil, sadece birkaç yüz veya birkaç bin metin karakterini öğrenmişti.Bir önceki 50+ modern dilde eğitim almış bir modeldi - daha sonra bazı şekillerde değişiklik eğilimi, ya da herhangi bir şekilde öğrenilen bir cümlenin tipik yapısına uygun olarak.

Makine-Learning-Assisted Reconstruction

Linear B ve Minoan-Mycenaean Puzzle

Linear B'nin 1952 yılında Michael Ventris tarafından kabul edilmesi tarihsel dilbilimde bir dönüm noktasıydı. Ventris, Linear B'nin Yunancanın erken bir biçimini kaydettiğini ve ana dilinin ne Yunanca ne de bilinen bir dil olarak kullanıldığını gösterdi.

Son makine öğrenimi, Linear A'ya bir istatistiki ayar görevi olarak yaklaşarak yaklaştı. Araştırmacılar, Linear B ve Linear A'dan gelen işaretler çiftlerine, daha önce yazılmış bir eğitim hedefi olarak Linear A işaretlerini kullanarak, Linear B işareti dizilerini haritalamayı öğrendiler ve bu da telefonsal değerlere olanak sağlıyordu: model daha önce gelen bir düzineden fazla daha önce gelen bir düzineden fazla teknik okumalar için önerilen telefon okumalar.

Mayan Hierofs: Gaps'leri Automating

Mayan senaryosu 20. yüzyılda büyük ölçüde kabul edildi, binlerce fotoğraflı rifatör ve daha sonra akademisyenler tarafından eğitilmiştir. Ancak, birçok yazıt hasar gördü ve bazı rifikasyon blokları artık eksik bir metinde görünmeye devam ediyor. Convolutional sinir ağları (CNN Knorozov ve daha sonra akademisyenler.

2021 yılında araştırmacılar, Mayan hierofic metinlerinin tam bir şekilde doğrulanmasını sağlayan bir dönüştürücü modeli beslediler. Model, eksik roglifler arasındaki bu işbirliği, kasıtlı olarak hasar görmüş metinler üzerinde test edildiğinde,% 80 oranında düzeltmeyi düzeltti, şimdi bu tahminleri ilk geçiş olarak kullandı.

Proto-Indo-Avrupa Kökü Ölçeği

Ulusal Bilimler Akademisi'nin ) tarafından hazırlanan bir dönüm noktası çalışması, hem antik hem de modern olarak üretilen PIE köklerinin% 80'i doğru şekilde tahmin edilen ana akımları, geleneksel yöntemlerle kurulmuş olan PIE köklerinin % 80'i üzerinde bir araya getirdi.Daha önce, her iki antik ve modern plato-Avrupa dili için de tartışılmayan kelimelerle yeniden yapılandırıldı.

Bu başarı, daha önce hiç yeniden inşa edilmemiş olan dil ailelerine benzer yöntemler uygulamak için araştırmacılara ilham verdi. Örneğin, Afroasiat ve Austronesian ailelerine karşı yeni verilere veya karşılaştırmalı kanıtlara karşı test edebilecekleri somut hipotezler sunabilmektedir.

Meydanlar ve Sınırlar

Sözcüğe rağmen, makine öğrenimi, kayıp dil yeniden inşa etmek için bir sihir değildir. Alan bugün hangi ML'nin başarabileceğini sınırlayan birkaç kritik engelle karşı karşıyadır.

Data Scarcity ve Quality

Çoğu kayıp dil sadece birkaç yüz karakter veya kısmi yazıtlarda hayatta kalır. Güçlü bir derin öğrenme modeli tipik olarak binlerce veya hatta milyonlarca veri noktası gerektirir.Bu konuda çalışmak için araştırmacılar, veri augmentasyon teknikleri yerine, yapay olarak genişletilebilir.Ayrıca mevcut veriler transkript, hasar, veya tutarsız sözleşmelere dayanan bozuk olabilir.

Senaryo Benzersizliği ve bir Anchor için gerekli

Harappan senaryosu veya Prototipleme gibi bazı senaryolar, bilinen bir metine sahip değildir ve dışsal bir dil ailesi yoktur - bilinen bir kognate dili veya doğru bir isim olarak okunabilir -ML modeller sadece iç desenleri tespit edebilir: frekanslar, pozisyonsal kısıtlamalar ve eş-kriptler istatistiki. Bu, bir zamanlar logografik veya syllabici olup olmadığı gibi, bir dil analizinin tanımlanması gibi bir şeyi ortaya çıkarabilir.

Yorumlama ve Geçerlilik

Makine öğrenme çıktıları olasılıksal hipotezler, temel olarak belirlenmiş gerçekler değildir. Tarihi ve dilsel bilginin tam vücuduna karşı ML önerilerini doğrulamak için standart bir ölçüm yoktur.Bir model, eğitim verilerinde mevcut olan önyargıları önerebilir -örneğin, Indo-Avrupa desenleri ile ilgili olarak, daha sonra dilsel olmayan bir metinle ilgili olarak çelişen bir şekilde çelişir.Eğer model, yanlış bir dilsel bilgi için gerekli olan bir dilsel olarak farklı bir dilsel olarak görülemez.

Dil Yeniden İnşaının Geleceği

Sonraki on yıl otomatik dil yeniden yapılanmasında önemli ilerlemeler vaat ediyor, makine öğrenimi ve dijital insanlıkta birkaç konvering trendleri tarafından yakıtlandı.

Daha az Shot ve Low-Kaynak Scenarios için denetimsiz Öğrenme

Araştırmacılar aktif olarak 50-100 jeton olarak yazılan metinleri içeren metinleri içeren bir senaryoyu kullanarak, herhangi bir etiketli paralel veriler olmadan dillerin arasında kontrol edilemeyen bir dizi öğrenme algoritmaları geliştiriyorlar.Insfer morphological rules and phonetic yazışmaları at least 50-100 tokens. Un denetimsiz learning is also going: models can now discover phonetic messagess across languages without any label parallel data, by lineing the scripts from ham text.For a script like Rongorongo, where no bilingual text exists, non-roadlinen dağıtımları ve bilinen deşifrelerin ilk test edilebilir hipotezleri sağlayabilir.

Cross-Disciplinary Data Paylaşım

Büyük ölçekli dijitalleştirme projeleri, tam metinleri özgürce yayınlanmaktadır.Alanta'ya göre standartlaştırılmış metadata ve doğrudan makine öğrenimi hatlarına girebilecek bir işarettir.Straar A ve algFLT:2Cuneiform Digital Library Initiative) ile ilişkili olarak, eğitim sinyalini daha zenginleştirecektir.

İnsan-AI Co-creation için Collaborative Platforms for Human-AI Co-creation

Online platformlar, insan kaynaklarına göre tahminleri doğrulayan ve doğrulayan bir şekilde genişleten insan kaynaklarına sahip olan ve insan dışı bir şekilde yapılan baskılara karşı yapılan bir şekilde, insan geri bildirim modellerine dayanan ve bu insan geri bildirimlerine dayanan tahminlerini doğrulayan bir şekilde düzelten insan kaynaklarına izin veriyor.Bu sinerji zaten hasar görmüş tabletlerinin transkriptasyonu için kullanılıyor.

Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç Sonuç

Makine öğrenimi, her kayıp dili bir gecede deşifre etmeyecektir. En zor vakalar - küçük parçalarla ve akrabaları olmayan - yeni bir arkeolojik bulmaksızın tamamen hiçbir zaman tamamen yeni bir arkeolojik bulgu olmadan asla, modelin öğrenme ve model tahminlerini test etmek için, boşlukları doldurmak için, ve insanların elle yönetmesi imkansız olan bir gelecek keşfeder.