Table of Contents
Роль местных библиотек в сохранении истории общества через оцифровку
По всему миру местные библиотеки незаметно стали прифронтовыми хранителями памяти сообщества. От хрупких вековых газет до разрушающихся семейных фотографий эти учреждения обладают богатством оригинальных документов, которые рассказывают истории о кварталах, городах и городах. Тем не менее, физические материалы ухудшаются под тяжестью времени, климата и обращения. В ответ библиотеки ведут тихую революцию: оцифровка общинных газет, ежегодников, писем, карт и муниципальных записей, чтобы сделать их свободно доступными в Интернете. Эти усилия делают больше, чем сохранение прошлого; это демократизирует доступ к истории, расширяет возможности местных исследователей и укрепляет гражданскую идентичность.
Цифровизация превращает хрупкие, желтые страницы в доступные для поиска, общие цифровые файлы. Вместо того, чтобы посещать читальный зал и перелистывать связанные тома, пользователь в любой части мира теперь может вытащить ту же газету с 1885 года на смартфоне или ноутбуке. Масштаб этой работы огромен, но библиотеки находят творческие способы сделать это - через партнерские отношения, волонтерские программы, грантовое финансирование и платформы с открытым исходным кодом. В этой статье рассматривается, как библиотеки решают проблему, какие технологии они используют и что будущее держит для архивов цифрового сообщества.
Растущее значение оцифровки архивов сообщества
Общественные газеты часто называют первым черновиком истории. Они захватывают местные выборы, некрологи, спорт в средней школе, открытия малого бизнеса и повседневную жизнь. Но бумага, на которой они напечатаны, становится кислой и хрупкой, особенно для изданий конца 19-го и начала 20-го века. Библиотеки давно поняли актуальность: если газета не сохранилась, глава местной истории просто исчезает. Цифровизация останавливает часы. Она создает точную цифровую копию, которую можно хранить, резервировать и ссылаться бесконечно, в то время как оригинал может быть удален из частого обращения.
Помимо сохранения, оцифровка решает фундаментальную проблему доступа. Многие газеты сообщества никогда не были широко проиндексированы или микрофильмированы. Исследователи могут знать, что история существует, но не могут найти ее, не пройдя через годы проблем. Цифровой текст, однако, может быть сделан доступным для поиска через оптическое распознавание символов (OCR) , что означает, что пользователь может ввести имя или событие и мгновенно найти каждое соответствующее упоминание на протяжении десятилетий. Эта возможность изменила исследование местной истории, сделав его таким же быстрым, как поиск в Google.
Библиотеки также признают, что оцифрованные коллекции способствуют гордости сообщества. Когда оцифрованная газета 1920 года показывает парад по главной улице, пожилые жители делятся воспоминаниями, молодые поколения узнают о своем городе, а школы могут интегрировать первичные источники в планы уроков. Неосязаемая выгода - чувство места и преемственности - так же ценна, как и само сохранение.
Как библиотеки подходят к процессу цифровизации
Оцифровка газеты или коллекции документов сообщества — это не одно действие, а тщательно спланированный рабочий процесс. Библиотеки должны оценивать свои запасы, определять приоритеты, готовить материалы, сканировать или фотографировать их, создавать описательные метаданные и, наконец, делать цифровые объекты доступными. Каждый шаг имеет свои собственные проблемы и передовой опыт.
Оценка и расстановка приоритетов
Большинство библиотек имеют больше материала, чем они могли бы оцифровать с текущими ресурсами. Итак, первый шаг - оценить, что наиболее подвержено риску и наиболее востребовано. Хрупкие газеты 1800-х годов часто имеют приоритет над более поздними тиражами. Уникальные документы, такие как рукописные книги от местных предприятий или личные дневники ранних поселенцев, также занимают высокие места. Библиотекари могут консультироваться с местными историческими обществами или опросить покровителей, чтобы увидеть, что сообщество ценит больше всего. Этот этап также включает проверку того, были ли предметы уже оцифрованы в другом месте, чтобы избежать дублирования усилий.
Подготовка материалов
Перед сканированием документы часто нуждаются в тщательном лечении. Свободные страницы должны быть организованы хронологически; слезы должны быть отлажены архивной лентой; скобы и бумажные скрепки должны быть удалены, чтобы предотвратить повреждение как оригинала, так и сканера. Для связанных томов, таких как ежегодники или книги, библиотекари решают, следует ли разбивать (если это приемлемо) или использовать специализированный книжный сканер, который может захватывать страницы без сплющивания позвоночника. Персонал также очищает поверхности для удаления пыли и плесени, используя мягкие кисти или микровакуумы, чтобы избежать дальнейшего истирания.
Технологии сканирования и захвата
Библиотеки используют ряд оборудования в зависимости от материала. Для стандартных газетных страниц распространен широкоформатный плоскостный сканер с высоким разрешением (600 dpi или выше). Микрофильм, который многие библиотеки уже держат для сохранения газет, можно сканировать с помощью специализированных микрофильмовых сканеров, которые производят цифровые файлы с гораздо большей эффективностью, чем повторное сканирование оригинальной бумаги. Для деликатных связанных книг или негабаритных карт, накладные книжные сканеры с V-образной колыбелью позволяют безопасно захватывать без наложения веса на привязку. Некоторые библиотеки также используют цифровые камеры на подставках для копирования трехмерных объектов или чрезвычайно хрупких предметов.
Библиотеки обычно создают основной файл в формате TIFF (несжатый, с высоким разрешением) для долговременного сохранения и производный файл в JPEG или PDF для публичного отображения. Главный файл хранится в защищенной цифровой системе сохранения, в то время как производный файл обслуживается через онлайн-платформу. Для газет многие библиотеки теперь используют формат JPEG 2000, потому что он предлагает лучшее сжатие для больших изображений без потери детализации.
Создание метаданных
Оцифрованное изображение бесполезно, если никто не может его найти. Метаданные — описательная информация о предмете — необходимы. Библиотекари создают записи, которые включают название, дату, название публикации, номер страницы, темы (такие как «местное правительство» или «иммиграция») и географическое покрытие. Для газет метаданные часто включают индексацию на уровне колонки и статьи. Многие библиотеки следуют стандартам, таким как Dublin Core или Metadata Object Description Schema (MODS) . Хорошо структурированные метаданные гарантируют, что пользователи могут искать по коллекциям и что цифровые объекты могут быть объединены в более крупные порталы, такие как цифровая публичная библиотека Америки (DPLA) или портал Chronicling America из Библиотеки Конгресса.
Платформы загрузки и доступа
После сканирования и описания цифровые файлы должны быть опубликованы на доступной платформе. Библиотеки имеют много вариантов: некоторые используют системы с открытым исходным кодом, такие как Omeka или Islandora, которые построены специально для цифровых коллекций. Другие используют системы управления контентом, такие как Directus, которые позволяют библиотекам создавать пользовательские цифровые архивы с гибкими схемами метаданных и мощными возможностями поиска. Масштабная оцифровка газет часто опирается на проприетарные платформы от таких поставщиков, как Veridian или Newspapers.com, но многие библиотеки предпочитают открытые решения для поддержания долгосрочного контроля над своими данными. Выбранная платформа должна поддерживать полнотекстовый поиск через OCR, граничный просмотр по дате или названию публикации и четкие заявления о правах.
Ключевые технологии, способствующие современным усилиям по оцифровке
За каждым проектом по оцифровке библиотек стоит набор программных и аппаратных технологий, которые быстро развивались за последнее десятилетие. Понимание этих инструментов помогает объяснить, как библиотеки способны эффективно обрабатывать тысячи страниц.
Оптический знак распознавания (OCR)
Программное обеспечение OCR преобразует изображения текста в редактируемые, доступные для поиска текстовые строки. Для исторических газет с сломанными или богато украшенными шрифтами стандартная OCR часто работает плохо. Поэтому библиотеки используют специализированные исторические OCR-движки, такие как Tesseract с языковыми моделями, обученными на шрифтах 19-го века, или запатентованные инструменты, такие как Abbyy FineReader с повышенной точностью для деградированной микрофильмы. Полученный текст часто несовершенен - запятнанные буквы, неправильный интервал - но все еще позволяет мощный поиск ключевых слов. Некоторые библиотеки дополнительно улучшают вывод OCR путем ручной коррекции с помощью краудсорсинга.
IIIF (Международная структура взаимодействия изображений)
IIIF стала критическим стандартом для обмена изображениями высокого разрешения в Интернете. Он определяет набор API, которые позволяют любому пользователю, отвечающему требованиям IIIF (например, Mirador или Universal Viewer), отображать масштабируемые изображения с любого сервера, соответствующего требованиям IIIF. Для библиотек IIIF означает, что пользователь может открывать оцифрованную газету и масштабировать в крошечное классифицированное объявление без загрузки всего изображения страницы. Он также позволяет сравнивать изображения из разных учреждений бок о бок в одном и том же зрителе. Многие цифровые архивы библиотек теперь используют IIIF, что делает их коллекции более совместимыми и удобными для пользователя.
Краудсорсинговые платформы
Оцифровка производит поток изображений, но транскрипция и улучшение метаданных остаются задачами, требующими большого количества людей. Библиотеки обратились к краудсорсингу, чтобы привлечь добровольцев к исправлению OCR, маркированию людей и мест и расшифровке рукописных документов. Платформы, такие как FromThePage, позволяют библиотекам создавать проекты транскрипции, где добровольцы могут помочь разблокировать содержимое дневников, писем и записей графств. Использование добровольцев не только ускоряет работу, но и создает специальное сообщество сторонников библиотеки. Некоторые библиотеки даже проводят онлайн-мероприятия, где добровольцы соревнуются в расшифровке большинства страниц за час.
Цифровое хранилище сохранения
Цифровые файлы по-своему хрупки — жесткие диски выходят из строя, форматы устаревают, метаданные теряются. Библиотеки должны следовать передовым практикам цифровой сохранности, таким как хранение нескольких копий в географически отдельных местах, использование контрольных сумм для проверки целостности файлов и миграция файлов в более новые форматы по мере изменения технологии. Многие библиотеки используют стандарт Аудит и сертификация надежных цифровых репозиториев (ISO 16363) для создания надежных систем хранения. Облачные службы хранения, такие как Amazon Glacier или Wasabi, все чаще используются для резервного копирования, но основное хранилище часто остается на местных институциональных серверах для безопасности.
Реальные примеры оцифровки библиотечной газеты
Чтобы понять, как эти принципы сочетаются, можно посмотреть на успешные проекты, которые установили ориентиры для этой области.
Хроника Америки (Библиотека Конгресса)
Chronicling America — это долгосрочная программа, спонсируемая Национальным фондом гуманитарных наук и Библиотекой Конгресса. Она обеспечивает свободный доступ к отдельным историческим газетам со всей территории США, охватывающая 1789—1963 годы. Участвующие библиотеки и исторические общества оцифровывают свои газетные холдинги в соответствии со строгими техническими руководящими принципами, и полученные файлы объединяются в центральную базу данных для поиска. По состоянию на 2025 год сайт содержит более 20 миллионов страниц, полностью доступных для поиска и скачивания. Проект стал моделью для усилий по оцифровке на государственном уровне, при этом каждый штат часто проводит свою собственную инициативу, финансируемую NEH. Visit Chronicling America, чтобы исследовать этот обширный ресурс.
Архив британской газеты
В Великобритании Британский архив газет является партнёрством Британской библиотеки с коммерческим издателем Findmypast. Он оцифровал более 40 миллионов страниц региональных и национальных газет, охватывающих 18-20 вв. Коллекция доступна как через веб-сайт Британской библиотеки (бесплатный доступ на сайт), так и по подписке от Findmypast. Этот проект демонстрирует, как государственно-частное партнерство может масштабировать оцифровку за пределы того, что может позволить себе любая единственная библиотека. Британская библиотека предоставляет физические газеты и кураторский опыт, в то время как Findmypast предоставляет инфраструктуру сканирования и хостинга. Исследуйте британский архив газет для ознакомления с британской местной историей.
Государственные и местные инициативы: Коллекция цифровой газеты Калифорнии
Не все крупные проекты являются национальными. Коллекция California Digital Newspaper Collection (CDNC), размещенная в Калифорнийском университете в Риверсайде, обеспечивает свободный доступ к газетам из ранней истории штата. Она включает в себя такие названия, как San Francisco Call (1863–1913) и Los Angeles Herald (1873–1938). CDNC использует программное обеспечение с открытым исходным кодом, построенное на расширяемой текстовой структуре (ETF) и предоставляет как HTML, так и PDF-виды. Она также включает в себя функцию временной шкалы, которая позволяет пользователям визуализировать историю публикации каждого названия. CDNC является ярким примером того, как университетская библиотека может сотрудничать с публичными библиотеками, историческими обществами и даже независимыми общественными группами для создания всеобъемлющего архива государственного уровня. Посетить Калифорнийскую цифровую коллекцию газет.
Проблемы, с которыми сталкиваются библиотеки в проектах по оцифровке
Несмотря на успехи, усилия по оцифровке библиотек сталкиваются с постоянными проблемами, которые могут замедлить прогресс или ограничить объем коллекций.
Финансирование и устойчивость
Оцифровка дорогая. Оборудование, программное обеспечение и время персонала, необходимое для сканирования одной страницы, часто стоят от 0,50 до 2,00 долларов, в зависимости от состояния оригинала и необходимых метаданных. Для запуска газеты на 10 000 страниц, что быстро складывается. Многие библиотеки полагаются на краткосрочные гранты от таких организаций, как Национальный фонд гуманитарных наук, Институт музейных и библиотечных услуг или местные фонды. Но как только грант заканчивается, кто платит за текущее хранение, обслуживание серверов и цифровую сохранность? Некоторые учреждения приняли многоуровневые модели доступа - бесплатный доступ для базового просмотра, небольшая плата за загрузку с высоким разрешением - но это может противоречить миссии открытого доступа. Другие ищут постоянную институциональную поддержку путем интеграции оцифрованных коллекций в основной бюджет библиотеки.
Авторские права и интеллектуальная собственность
Даже для газет, изданных более века назад, вопросы авторского права могут быть удивительно сложными. В то время как большинство газет до 1928 года находятся в общественном достоянии в Соединенных Штатах, более поздние выпуски могут быть все еще защищены, особенно если газета принадлежала корпорации, которая все еще может существовать. В некоторых газетах есть пункты, которые присваивают авторское право отдельным авторам (например, обозревателям), а не издателю. Библиотеки должны проводить тщательный анализ прав перед размещением оцифрованной газеты в Интернете. Некоторые прибегают к размещению только метаданных и предварительных просмотров в авторском праве в печатном материале, ссылаясь на физический оригинал в читальном зале. Отсутствие четкого руководства по авторскому праву для газет сообщества является основным препятствием для полномасштабной оцифровки.
Стандарты метаданных и совместимость
Различные библиотеки используют различные схемы метаданных, контролируемые словари и соглашения об именах. Газетная статья о «пожаре на Орчард-стрит» может быть помечена как «Огонь — Нью-Йорк» в одной коллекции и «Орчард-стрит» в другой. Когда эти коллекции объединяются в национальный портал, отсутствие согласованных метаданных затрудняет поиск. Организации, такие как Цифровая публичная библиотека Америки, работают над гармонизацией метаданных через проглатывание руководящих принципов, но местным библиотекам часто не хватает персонала или опыта, чтобы сопоставить свои записи со стандартом DPLA. Сохранение согласованных метаданных с течением времени является постоянной проблемой.
Технический масштаб и инфраструктура
Управление цифровым архивом требует администрирования сервера, управления базами данных и исправления безопасности — задачи, которые могут быть выполнены одним библиотекарем со многими другими обязанностями. Облачные сервисы, такие как Internet Archive's Archive.org или Digital Commonwealth в Массачусетсе предлагают выход, позволяя библиотекам загружать свои файлы на общую платформу с готовым пользовательским интерфейсом. Но эти платформы не всегда дают библиотекам полный контроль над метаданными или политиками сохранения. Для библиотек, которые хотят построить свою собственную платформу, кривая обучения для программного обеспечения, такого как Omeka или Islandora, может быть крутой.
Преимущества цифрового доступа для сообществ и исследований
Усилия по оцифровке материалов сообщества приносят дивиденды далеко за пределами стен библиотеки. Наиболее очевидным преимуществом является сохранение, но эффект мультипликатора существенен.
Расширение прав и возможностей генеалогов и историков
Генеалоги в значительной степени полагаются на местные газеты для некрологов, объявлений о браке и юридических уведомлений. Перед оцифровкой исследователю, возможно, придется отправиться в городскую библиотеку, а затем провести дни, прокручивая микрофильмы. С оцифрованной и проиндексированной OCR коллекцией те же исследования можно провести из дома за считанные минуты. Эта демократизация уровней доступа игровое поле: потомок, живущий за сотни миль, может исследовать те же записи, что и кто-то, все еще живущий в сообществе. Многие библиотеки сообщают о резком увеличении удаленных справочных запросов после запуска цифровой коллекции газет.
Усиление образования К-12
Первичные источники — оригинальные документы из прошлого — являются мощными инструментами обучения. Учитель в местной школе может попросить студентов сравнить, как национальное событие, такое как высадка на Луну, было сообщено в местной газете по сравнению с New York Times. Они могут изучать рекламу, чтобы понять экономические тенденции, или читать письма редактору для оценки общественного мнения по спорным вопросам. Оцифрованные коллекции делают эти уроки возможными, не требуя поездки на полевые занятия. Некоторые библиотеки создают планы уроков или «первичные наборы источников», согласованные с государственными стандартами, чтобы непосредственно поддерживать использование класса.
Построение гражданской вовлеченности и идентичности
Когда люди видят свою собственную историю - основание города, празднование столетия, историю местного солдата - представленную авторитетом в цифровом архиве, это подтверждает значимость их сообщества. Библиотеки часто сотрудничают с историческими обществами, чтобы провести дни сканирования сообщества, где жители могут принести семейные фотографии и документы, которые будут оцифрованы и добавлены в коллекцию. Эти события способствуют чувству собственности и гордости. В некоторых случаях оцифрованные коллекции стали основой для пешеходных экскурсий, приложений дополненной реальности или мобильных экспонатов, которые выводят историю на улицы.
Поддержка местной журналистики
Оцифровка исторических газет также служит для сегодняшних журналистов. Репортеры, освещающие историю, могут быстро искать в архиве контекст — что произошло в последний раз, когда наводнение обрушилось на город, или как дебаты по поводу местного парка разыгрывались в 1910 году. Эта связь между прошлым и настоящим обогащает текущие репортажи и помогает журналистам избегать повторения мифов или полузапомнившихся фактов. Некоторые библиотеки теперь предлагают специализированные поисковые порталы для журналистов, что облегчает фильтрацию по диапазону дат и публикации.
Будущие тенденции и возможности
Появляющиеся технологии и меняющиеся ожидания сообщества будут определять, как будет выглядеть следующее десятилетие цифровых архивов.
Машинное обучение и автоматизированные метаданные
Одним из наиболее перспективных разработок является использование машинного обучения для автоматического создания метаданных. Экспериментальные проекты использовали распознавание изображений для идентификации рекламы, фотографий или иллюстраторов на странице газеты. Обработка естественного языка (NLP) может извлекать названные объекты - людей, места, организации - и связывать их с внешними базами данных, такими как Викиданные. Эта автоматизация может резко сократить труд, необходимый для создания богатых метаданных. Однако библиотеки должны быть осторожны в отношении алгоритмического смещения: модель, обученная в основных газетах, может неправильно идентифицировать контент из публикаций этнических или меньшинств. Человеческий обзор останется необходимым для точности.
Архивы, принадлежащие сообществу и учредителям
Вместо того, чтобы библиотеки были единственными хранителями оцифровки, наблюдается растущее движение к общественным архивам. Такие инструменты, как Wikidata и Wikimedia Commons, позволяют жителям вносить свои собственные цифровые файлы и метаданные непосредственно на глобальную платформу. Библиотеки могут проводить семинары о том, как загружать контент и как правильно лицензировать его (например, в рамках Creative Commons). Этот подход не только распространяет рабочую нагрузку, но и гарантирует, что в него включены маргинальные или недопредставленные голоса. Например, местный художественный коллектив может оцифровать зины 1970-х годов и добавить их в запись, заполняя пробелы, которые может пропустить коллекция библиотеки.
Интеграция со связанными открытыми данными
Библиотеки все чаще преобразуют свои метаданные в связанные открытые данные (LOD), которые соединяются с другими наборами данных в Интернете. Оцифрованная газетная статья о выборах 1928 года может быть связана с досье на полномочия Библиотеки Конгресса для кандидата, с географическими координатами для места голосования и с исторической базой данных о погоде, чтобы увидеть, влияет ли дождь на явку избирателей. Эта сеть соединений превращает изолированные оцифрованные страницы в богатую сеть знаний. Например, платформа Europeana объединяет миллионы предметов из европейских библиотек и предлагает связанный доступ к данным разработчикам и исследователям.
Долгосрочные модели устойчивости
Самая большая проблема на горизонте - устойчивость. Библиотеки, которые запустили цифровые коллекции в начале 2000-х годов, теперь сталкиваются с миграцией платформ, просроченной поддержкой программного обеспечения и ростом затрат на облачное хранение. Некоторые начали взимать скромную плату за коммерческое использование файлов с высоким разрешением, в то время как другие сформировали консорциумы для совместного использования инфраструктурных затрат. Цифровая публичная библиотека Америки «Национальная цифровая инициатива» исследует модель, в которой набор распределенных библиотек «хаб» принимает цифровые коллекции из небольших учреждений и обеспечивает долгосрочное сохранение и доступ по общей стоимости. Если такие модели преуспеют, они могут решить проблему устойчивости для сотен небольших библиотек по всей стране. Узнайте больше о цифровой публичной библиотеке Америки для новых общенациональных подходов.
Заключение
Местные библиотеки неустанно работают над оцифровкой газет и документов сообщества, превращая хрупкие бумаги в прочные, доступные цифровые активы. Благодаря продуманному планированию, тщательному использованию технологий и творческим партнерствам они открывают местную историю для глобальной аудитории. Преимущества - для исследований, образования, идентичности сообщества и журналистики - огромны. Тем не менее, проблемы в финансировании, авторском праве, метаданных и устойчивости остаются. По мере развития машинного обучения и моделей участия следующая волна оцифровки обещает быть еще более инклюзивной и взаимосвязанной. Для тех, кто заботится о историях, которые определяют место, поддержка усилий оцифровки вашей местной библиотеки - это инвестиции в прошлое, которые платят дивиденды в будущем.