Для тех кому интересна веб архивация, свежий релиз моего хобби инструмента metawarc для глубокого анализа WARC архивов используемых в Интернет Архиве и многочисленных национальных и частных веб-архивных инициативах. Инструмент позволяет индексировать веб-архивы для глубокого анализа и задач data science, а также извлекать метаданные из документов, изображений, видеофайлов и иных имеющих метаданные внутри файлов.
В версию 2.0 добавлена возможность проигрывать веб-архивы через библиотеку pywb и исправлены многие ошибки.
Инструмент может быть полезен для всех кто интересуется цифровым сохранением и OSINT, поскольку эти метаданные полезны при анализе слепков веб-сайтов.
Внутри работа с данными идет с использованием DuckDB с хранением метаданных в файлах Parquet. DuckDB выступает как универсальный инструмент запросов для аналитических задач, дедубликации и тд.
#opensourc #webarchives #digitalpreservation
В версию 2.0 добавлена возможность проигрывать веб-архивы через библиотеку pywb и исправлены многие ошибки.
Инструмент может быть полезен для всех кто интересуется цифровым сохранением и OSINT, поскольку эти метаданные полезны при анализе слепков веб-сайтов.
Внутри работа с данными идет с использованием DuckDB с хранением метаданных в файлах Parquet. DuckDB выступает как универсальный инструмент запросов для аналитических задач, дедубликации и тд.
#opensourc #webarchives #digitalpreservation
GitHub
GitHub - datacoon/metawarc: metawarc: a command-line tool for metadata extraction from files from WARC (Web ARChive)
metawarc: a command-line tool for metadata extraction from files from WARC (Web ARChive) - datacoon/metawarc
👍3✍2🔥2