Forwarded from Гуманитарии в цифре
«Цифровая среда»: Иван Бегтин расскажет об инструментах для работы с данными в гуманитарных науках
22 января состоится первое в этом году заседание «Цифровой среды» – научно-методического семинара Института цифровых гуманитарных исследований (DHRI) СФУ о Digital Humanities.
Один из самых интересных практиков Open Data, директор АНО «Информационная культура», создатель международного проекта Dateno и автор популярного телеграм-канала Иван Бегтин выступит с докладом «Дата-инженерия в цифровой гуманитаристике».
🔜 Присоединяйтесь к онлайн-семинару ровно через неделю.
Дата: 22 января
Начало: 14.00 (мск)/ 18.00 (крск)
🔗 Зарегистрироваться и добавить в календарь: здесь
#цифроваясреда #смотреть #слушать #данные #opendata
22 января состоится первое в этом году заседание «Цифровой среды» – научно-методического семинара Института цифровых гуманитарных исследований (DHRI) СФУ о Digital Humanities.
Один из самых интересных практиков Open Data, директор АНО «Информационная культура», создатель международного проекта Dateno и автор популярного телеграм-канала Иван Бегтин выступит с докладом «Дата-инженерия в цифровой гуманитаристике».
Дата: 22 января
Начало: 14.00 (мск)/ 18.00 (крск)
🔗 Зарегистрироваться и добавить в календарь: здесь
#цифроваясреда #смотреть #слушать #данные #opendata
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥8👍3
💡 Чем интересен Dateno?
Это поисковик по открытым данным, который собирает не только метаданные о датасетах и API, но и ссылки на связанные ресурсы, часть из которых даже архивирует. Это позволяет не только искать данные, но и анализировать, как они публикуются и в каких форматах.
📊 Немного цифр:
На июль 2025 года в Dateno собрано 5 961 849 наборов данных из порталов открытых данных. Это примерно 27% от всех датасетов, слоёв карт и временных рядов, которые агрегируются из разных каталогов и геопорталов.
👀 Что внутри этих датасетов?
У одних нет вообще никаких файлов, у других — сотни вложений. Поэтому корректнее считать не сами датасеты, а количество ресурсов (файлов и ссылок). Их в базе уже 6,7 млн — примерно 1.1 ресурса на один датасет.
📥 Форматы ресурсов:
CSV — 1 008 646 (15%)
XLSX — 525 329 (7.8%)
XML — 522 501 (7.8%)
JSON — 509 668 (7.6%)
ZIP — 496 709 (7.4%)
PDF — 487 189 (7.3%)
HTML — 475 377 (7.1%)
WMS — 320 159 (4.8%)
NC — 233 229 (3.5%)
XLS — 185 855 (2.8%)
WCS — 141 472 (2.1%)
KML — 122 781 (1.8%)
DOCX — 115 723 (1.7%)
📌 CSV — безусловный лидер. Также популярны XLSX, XML, JSON, старый добрый XLS. Геоформаты вроде WMS, WCS, KML встречаются реже, но их роль растёт.
📄 Почему столько PDF, DOCX и HTML?
Часто вместо машиночитаемых данных публикуют отчёты или ссылки на внешние сайты. Иногда приходится буквально вытаскивать данные из PDF-документов.
🤖 А что с форматами для data science?
Формат Parquet, популярный в дата-инженерии и аналитике, встречается крайне редко — всего 1652 файла (меньше 0.025% всех ресурсов!). Печально, но открытые данные пока ещё далеки от удобства для дата-сайентистов.
Хочется верить, что это изменится.
#данные #opendata #dateno #datascience #dataengineering
Это поисковик по открытым данным, который собирает не только метаданные о датасетах и API, но и ссылки на связанные ресурсы, часть из которых даже архивирует. Это позволяет не только искать данные, но и анализировать, как они публикуются и в каких форматах.
📊 Немного цифр:
На июль 2025 года в Dateno собрано 5 961 849 наборов данных из порталов открытых данных. Это примерно 27% от всех датасетов, слоёв карт и временных рядов, которые агрегируются из разных каталогов и геопорталов.
👀 Что внутри этих датасетов?
У одних нет вообще никаких файлов, у других — сотни вложений. Поэтому корректнее считать не сами датасеты, а количество ресурсов (файлов и ссылок). Их в базе уже 6,7 млн — примерно 1.1 ресурса на один датасет.
📥 Форматы ресурсов:
CSV — 1 008 646 (15%)
XLSX — 525 329 (7.8%)
XML — 522 501 (7.8%)
JSON — 509 668 (7.6%)
ZIP — 496 709 (7.4%)
PDF — 487 189 (7.3%)
HTML — 475 377 (7.1%)
WMS — 320 159 (4.8%)
NC — 233 229 (3.5%)
XLS — 185 855 (2.8%)
WCS — 141 472 (2.1%)
KML — 122 781 (1.8%)
DOCX — 115 723 (1.7%)
📌 CSV — безусловный лидер. Также популярны XLSX, XML, JSON, старый добрый XLS. Геоформаты вроде WMS, WCS, KML встречаются реже, но их роль растёт.
📄 Почему столько PDF, DOCX и HTML?
Часто вместо машиночитаемых данных публикуют отчёты или ссылки на внешние сайты. Иногда приходится буквально вытаскивать данные из PDF-документов.
🤖 А что с форматами для data science?
Формат Parquet, популярный в дата-инженерии и аналитике, встречается крайне редко — всего 1652 файла (меньше 0.025% всех ресурсов!). Печально, но открытые данные пока ещё далеки от удобства для дата-сайентистов.
Хочется верить, что это изменится.
#данные #opendata #dateno #datascience #dataengineering
Dateno
Dateno - datasets search engine
A next-generation data search service provides fast, comprehensive access to open datasets worldwide, with powerful filters and an API-first architecture for seamless integration.
🔥7✍5
Forwarded from Цифровой архив госфинансов и госуправления
Из коллекции Цифрового архива: «Государственный бюджет СССР и бюджеты союзных республик 1950, 1955, 1960–1965 гг. Статистический сборник», Москва, 1966 г.
Во второй половине XX века бюджетная система СССР приобрела свой окончательный вид. Она объединила в себе бюджеты всех уровней государственного управления. Так, государственный бюджет СССР включал в себя собственно союзный бюджет, которым распоряжалось союзное правительство, и бюджеты союзных республик, которыми распоряжались республиканские правительства. Бюджеты союзных республик в свою очередь делились на бюджет республики и на местные бюджеты отдельных областей, краев и автономий. В свою очередь, они делились на региональный бюджет и бюджеты отдельных городов и районов.
Такая структура получила свое отражение и в статистических справочниках Министерства финансов СССР, которые выпускал отдел финансово-экономической статистики Бюджетного управления. Справочники выходили в свет последовательно и имели единую структуру. Это не только сделало их надежными источниками информации о доходах и расходах бюджета СССР за столь продолжительный период, но и упростило преобразование числовых данных в современные машиночитаемые наборы данных.
В Цифровом архиве представлены такие справочники за период 1950–1985 годов, и таблицы двух из них полностью преобразованы в формат CSV и доступны для скачивания.
Рассмотрим, например, справочник, содержащий данные за 1950, 1955, 1960–1965 годы. Показатели в нем отражают фактические доходы и расходы государственного бюджета СССР и республиканских бюджетов. Эти сведения детализированы до уровня направлений расходов и доходов.
Первый раздел — «Государственный бюджет СССР» — дает общий обзор доходов и расходов союзного бюджета, которые распределены по основным разделам и показаны в абсолютном и процентном выражении. Здесь приведены также суммы разных видов доходов по союзному бюджету и бюджетам республик и расходы по различным направлениям в городах, рабочих поселках и сельской местности.
Основная часть второго раздела — «Государственные бюджеты союзных республик» — состоит из 15 комплектов таблиц (по одному на каждую республику), в каждый из которых входят:
• Доходы республики (в млн. рублей).
• Расходы республики (в млн. рублей) и продолжение таблицы с группировкой по основным видам затрат.
• Структура расходов в процентах и аналогичная группировка по видам затрат.
• Распределение расходов по видам местных бюджетов.
Кроме того, во втором разделе опубликованы росписи основных видов затрат для различных социально-культурных мероприятий, а также данные бюджетов АССР.
Аналогичные по структуре и наполнению справочники есть для следующих периодов:
• 1966–1970 гг.
• 1971–1975 гг.
• 1976–1980 гг.
• 1981–1985 гг.
При этом данные для 1950–1970 годов уже полностью преобразованы в формат CSV. Команда Цифрового архива продолжает преобразование таблиц из этих справочников в машиночитаемый формат.
Справочники можно скачать на сайте Цифрового архива:
• Годы 1950, 1955, 1960–1965
• Годы 1960, 1965, 1966–1970
• Годы 1966–1970, 1971–1975
• Годы 1971–1975, 1976– 1980
• Годы 1976–1980, 1981–1985
В ближайших публикациях покажем несколько датасетов, подготовленных на основе таких справочников.
#бюджет #СССР #ЦАГГ #данные #доходы #расходы #статистика
Во второй половине XX века бюджетная система СССР приобрела свой окончательный вид. Она объединила в себе бюджеты всех уровней государственного управления. Так, государственный бюджет СССР включал в себя собственно союзный бюджет, которым распоряжалось союзное правительство, и бюджеты союзных республик, которыми распоряжались республиканские правительства. Бюджеты союзных республик в свою очередь делились на бюджет республики и на местные бюджеты отдельных областей, краев и автономий. В свою очередь, они делились на региональный бюджет и бюджеты отдельных городов и районов.
Такая структура получила свое отражение и в статистических справочниках Министерства финансов СССР, которые выпускал отдел финансово-экономической статистики Бюджетного управления. Справочники выходили в свет последовательно и имели единую структуру. Это не только сделало их надежными источниками информации о доходах и расходах бюджета СССР за столь продолжительный период, но и упростило преобразование числовых данных в современные машиночитаемые наборы данных.
В Цифровом архиве представлены такие справочники за период 1950–1985 годов, и таблицы двух из них полностью преобразованы в формат CSV и доступны для скачивания.
Рассмотрим, например, справочник, содержащий данные за 1950, 1955, 1960–1965 годы. Показатели в нем отражают фактические доходы и расходы государственного бюджета СССР и республиканских бюджетов. Эти сведения детализированы до уровня направлений расходов и доходов.
Первый раздел — «Государственный бюджет СССР» — дает общий обзор доходов и расходов союзного бюджета, которые распределены по основным разделам и показаны в абсолютном и процентном выражении. Здесь приведены также суммы разных видов доходов по союзному бюджету и бюджетам республик и расходы по различным направлениям в городах, рабочих поселках и сельской местности.
Основная часть второго раздела — «Государственные бюджеты союзных республик» — состоит из 15 комплектов таблиц (по одному на каждую республику), в каждый из которых входят:
• Доходы республики (в млн. рублей).
• Расходы республики (в млн. рублей) и продолжение таблицы с группировкой по основным видам затрат.
• Структура расходов в процентах и аналогичная группировка по видам затрат.
• Распределение расходов по видам местных бюджетов.
Кроме того, во втором разделе опубликованы росписи основных видов затрат для различных социально-культурных мероприятий, а также данные бюджетов АССР.
Аналогичные по структуре и наполнению справочники есть для следующих периодов:
• 1966–1970 гг.
• 1971–1975 гг.
• 1976–1980 гг.
• 1981–1985 гг.
При этом данные для 1950–1970 годов уже полностью преобразованы в формат CSV. Команда Цифрового архива продолжает преобразование таблиц из этих справочников в машиночитаемый формат.
Справочники можно скачать на сайте Цифрового архива:
• Годы 1950, 1955, 1960–1965
• Годы 1960, 1965, 1966–1970
• Годы 1966–1970, 1971–1975
• Годы 1971–1975, 1976– 1980
• Годы 1976–1980, 1981–1985
В ближайших публикациях покажем несколько датасетов, подготовленных на основе таких справочников.
#бюджет #СССР #ЦАГГ #данные #доходы #расходы #статистика
👍14❤🔥1