В рубрике как это устроено у них свежие порталы открытых данных африканских стран
Того - https://opendata.gouv.tg
Работает на базе ПО uData, французского open source проекта. Содержит более 1500 наборов данных. Преимущественно в формате CSV и много геоданных
Ливия - https://opendata.gia.gov.ly/
Работает на базе открытого ПО CKAN. Включает 129 наборов данных. В основном это файлы Excel, некоторые статпоказатели также публикуют в CSV и JSON
#opendata #datasets #data #libya #togo #africa
Того - https://opendata.gouv.tg
Работает на базе ПО uData, французского open source проекта. Содержит более 1500 наборов данных. Преимущественно в формате CSV и много геоданных
Ливия - https://opendata.gia.gov.ly/
Работает на базе открытого ПО CKAN. Включает 129 наборов данных. В основном это файлы Excel, некоторые статпоказатели также публикуют в CSV и JSON
#opendata #datasets #data #libya #togo #africa
✍3🔥3👍2❤1😁1
Forwarded from Цифровой архив госфинансов и госуправления
Из коллекции Цифрового архива: «Государственный бюджет СССР и бюджеты союзных республик 1950, 1955, 1960–1965 гг. Статистический сборник», Москва, 1966 г.
Во второй половине XX века бюджетная система СССР приобрела свой окончательный вид. Она объединила в себе бюджеты всех уровней государственного управления. Так, государственный бюджет СССР включал в себя собственно союзный бюджет, которым распоряжалось союзное правительство, и бюджеты союзных республик, которыми распоряжались республиканские правительства. Бюджеты союзных республик в свою очередь делились на бюджет республики и на местные бюджеты отдельных областей, краев и автономий. В свою очередь, они делились на региональный бюджет и бюджеты отдельных городов и районов.
Такая структура получила свое отражение и в статистических справочниках Министерства финансов СССР, которые выпускал отдел финансово-экономической статистики Бюджетного управления. Справочники выходили в свет последовательно и имели единую структуру. Это не только сделало их надежными источниками информации о доходах и расходах бюджета СССР за столь продолжительный период, но и упростило преобразование числовых данных в современные машиночитаемые наборы данных.
В Цифровом архиве представлены такие справочники за период 1950–1985 годов, и таблицы двух из них полностью преобразованы в формат CSV и доступны для скачивания.
Рассмотрим, например, справочник, содержащий данные за 1950, 1955, 1960–1965 годы. Показатели в нем отражают фактические доходы и расходы государственного бюджета СССР и республиканских бюджетов. Эти сведения детализированы до уровня направлений расходов и доходов.
Первый раздел — «Государственный бюджет СССР» — дает общий обзор доходов и расходов союзного бюджета, которые распределены по основным разделам и показаны в абсолютном и процентном выражении. Здесь приведены также суммы разных видов доходов по союзному бюджету и бюджетам республик и расходы по различным направлениям в городах, рабочих поселках и сельской местности.
Основная часть второго раздела — «Государственные бюджеты союзных республик» — состоит из 15 комплектов таблиц (по одному на каждую республику), в каждый из которых входят:
• Доходы республики (в млн. рублей).
• Расходы республики (в млн. рублей) и продолжение таблицы с группировкой по основным видам затрат.
• Структура расходов в процентах и аналогичная группировка по видам затрат.
• Распределение расходов по видам местных бюджетов.
Кроме того, во втором разделе опубликованы росписи основных видов затрат для различных социально-культурных мероприятий, а также данные бюджетов АССР.
Аналогичные по структуре и наполнению справочники есть для следующих периодов:
• 1966–1970 гг.
• 1971–1975 гг.
• 1976–1980 гг.
• 1981–1985 гг.
При этом данные для 1950–1970 годов уже полностью преобразованы в формат CSV. Команда Цифрового архива продолжает преобразование таблиц из этих справочников в машиночитаемый формат.
Справочники можно скачать на сайте Цифрового архива:
• Годы 1950, 1955, 1960–1965
• Годы 1960, 1965, 1966–1970
• Годы 1966–1970, 1971–1975
• Годы 1971–1975, 1976– 1980
• Годы 1976–1980, 1981–1985
В ближайших публикациях покажем несколько датасетов, подготовленных на основе таких справочников.
#бюджет #СССР #ЦАГГ #данные #доходы #расходы #статистика
Во второй половине XX века бюджетная система СССР приобрела свой окончательный вид. Она объединила в себе бюджеты всех уровней государственного управления. Так, государственный бюджет СССР включал в себя собственно союзный бюджет, которым распоряжалось союзное правительство, и бюджеты союзных республик, которыми распоряжались республиканские правительства. Бюджеты союзных республик в свою очередь делились на бюджет республики и на местные бюджеты отдельных областей, краев и автономий. В свою очередь, они делились на региональный бюджет и бюджеты отдельных городов и районов.
Такая структура получила свое отражение и в статистических справочниках Министерства финансов СССР, которые выпускал отдел финансово-экономической статистики Бюджетного управления. Справочники выходили в свет последовательно и имели единую структуру. Это не только сделало их надежными источниками информации о доходах и расходах бюджета СССР за столь продолжительный период, но и упростило преобразование числовых данных в современные машиночитаемые наборы данных.
В Цифровом архиве представлены такие справочники за период 1950–1985 годов, и таблицы двух из них полностью преобразованы в формат CSV и доступны для скачивания.
Рассмотрим, например, справочник, содержащий данные за 1950, 1955, 1960–1965 годы. Показатели в нем отражают фактические доходы и расходы государственного бюджета СССР и республиканских бюджетов. Эти сведения детализированы до уровня направлений расходов и доходов.
Первый раздел — «Государственный бюджет СССР» — дает общий обзор доходов и расходов союзного бюджета, которые распределены по основным разделам и показаны в абсолютном и процентном выражении. Здесь приведены также суммы разных видов доходов по союзному бюджету и бюджетам республик и расходы по различным направлениям в городах, рабочих поселках и сельской местности.
Основная часть второго раздела — «Государственные бюджеты союзных республик» — состоит из 15 комплектов таблиц (по одному на каждую республику), в каждый из которых входят:
• Доходы республики (в млн. рублей).
• Расходы республики (в млн. рублей) и продолжение таблицы с группировкой по основным видам затрат.
• Структура расходов в процентах и аналогичная группировка по видам затрат.
• Распределение расходов по видам местных бюджетов.
Кроме того, во втором разделе опубликованы росписи основных видов затрат для различных социально-культурных мероприятий, а также данные бюджетов АССР.
Аналогичные по структуре и наполнению справочники есть для следующих периодов:
• 1966–1970 гг.
• 1971–1975 гг.
• 1976–1980 гг.
• 1981–1985 гг.
При этом данные для 1950–1970 годов уже полностью преобразованы в формат CSV. Команда Цифрового архива продолжает преобразование таблиц из этих справочников в машиночитаемый формат.
Справочники можно скачать на сайте Цифрового архива:
• Годы 1950, 1955, 1960–1965
• Годы 1960, 1965, 1966–1970
• Годы 1966–1970, 1971–1975
• Годы 1971–1975, 1976– 1980
• Годы 1976–1980, 1981–1985
В ближайших публикациях покажем несколько датасетов, подготовленных на основе таких справочников.
#бюджет #СССР #ЦАГГ #данные #доходы #расходы #статистика
👍14❤🔥1
Ещё немного рассуждений вслух про то как публикуются данные в мире сейчас:
1. Порталов открытых данных становится больше преимущественно за счет национальных порталов развивающихся стран и муниципальных каталогов данных.
2. В Евросоюзе больше муниципальных порталов именно открытых данных, в США больше порталов геоданных на базе ArcGIS Hub иногда совмещенных с порталами открытых данных.
3. Более всего и чаще всего на порталах данных публикуют официальную статистику, геоданные и данные финансовой отчетности (бюджеты, расходы по проектам, контракты и тд.)
4. Практически все университеты где есть наука имеют свои порталы раскрытия данных или разделы на порталах публикации научных результатов. Иногда таких порталов несколько и аналогичная ситуация со всеми живыми научными центрами. Много таких порталов раскрытия результатов появляется в университетах развивающихся стран
5. Россия уникальная 3-мя факторами. 1) Порталов открытых данных становится не больше, а меньше. 2) Почти все публикуемое государством - это мелкие административные данные. Бесполезные в работе. 3) Публикация научных данных скорее редкость чем активный тренд. Большая часть данных российских ученых публикуется напрямую на международных платформах, а не на ресурсах исследовательских центров и университетов.
6. Многие каталоги данных в мире остаются за геоблокировками: Россия, Китай, Вьетнам как наиболее заметные примеры.
7. Все больше блокировок краулеров, преимущественно через Cloudflare и другие CDN. Это ограничивает к ним доступ и для поиска, и для применения ИИ агентов.
8. Очень много локальных игроков создающих геоинформационные системы, но почти всегда на бэкэнде у них используется ArcGIS Server или Geoserver или один из более древних open-source движков.
#thoughts #data #datacatalogs
1. Порталов открытых данных становится больше преимущественно за счет национальных порталов развивающихся стран и муниципальных каталогов данных.
2. В Евросоюзе больше муниципальных порталов именно открытых данных, в США больше порталов геоданных на базе ArcGIS Hub иногда совмещенных с порталами открытых данных.
3. Более всего и чаще всего на порталах данных публикуют официальную статистику, геоданные и данные финансовой отчетности (бюджеты, расходы по проектам, контракты и тд.)
4. Практически все университеты где есть наука имеют свои порталы раскрытия данных или разделы на порталах публикации научных результатов. Иногда таких порталов несколько и аналогичная ситуация со всеми живыми научными центрами. Много таких порталов раскрытия результатов появляется в университетах развивающихся стран
5. Россия уникальная 3-мя факторами. 1) Порталов открытых данных становится не больше, а меньше. 2) Почти все публикуемое государством - это мелкие административные данные. Бесполезные в работе. 3) Публикация научных данных скорее редкость чем активный тренд. Большая часть данных российских ученых публикуется напрямую на международных платформах, а не на ресурсах исследовательских центров и университетов.
6. Многие каталоги данных в мире остаются за геоблокировками: Россия, Китай, Вьетнам как наиболее заметные примеры.
7. Все больше блокировок краулеров, преимущественно через Cloudflare и другие CDN. Это ограничивает к ним доступ и для поиска, и для применения ИИ агентов.
8. Очень много локальных игроков создающих геоинформационные системы, но почти всегда на бэкэнде у них используется ArcGIS Server или Geoserver или один из более древних open-source движков.
#thoughts #data #datacatalogs
✍4👍3🤔1
OECD AIS Report визуализация данных о морских перевозках от ОЭСР.
Плюсы:
- наглядная визуализация на карте и в графиках
- детализация данных до портов и перевозимых продуктов по типам
- относительно небольшой лаг в 3 месяца (в августе данные на май 2026г.)
Минусы:
- нет нормально доступных данных, только экспорт выборок в Excel
- не все страны есть, к примеру есть данные по России и нет данных по США
- все таки 3 месяца это большой лаг, для оперативного анализа
Что хорошо, можно легко автоматизировать выгрузку данных даже если там только Excel и тд. Недокументированное API тоже есть.
#opendata #datasets #oecd
Плюсы:
- наглядная визуализация на карте и в графиках
- детализация данных до портов и перевозимых продуктов по типам
- относительно небольшой лаг в 3 месяца (в августе данные на май 2026г.)
Минусы:
- нет нормально доступных данных, только экспорт выборок в Excel
- не все страны есть, к примеру есть данные по России и нет данных по США
- все таки 3 месяца это большой лаг, для оперативного анализа
Что хорошо, можно легко автоматизировать выгрузку данных даже если там только Excel и тд. Недокументированное API тоже есть.
#opendata #datasets #oecd
🔥4✍3❤1⚡1👍1
Многие пишут про ox-alpha "скрытую" модель на OpenRouter где не указано кто её создатель, но можно моделью бесплатно воспользоваться. Много разных есть догадок о том кто за ней стоит и кто бы это не был - это неплохой, но, явно, очень дорогой маркетинг. Сейчас все бросились её тестировать и писать о ней, а потом все начнут писать о том кто же за ней когда создатель всплывёт наружу.
И напишут потому что модель вполне себе качественно работает как минимум на задачах кодирования, анализа и работы с данными. По субъективным ощущениям не хуже GLM-5.3, а может и даже лучше.
#ai #datatools
И напишут потому что модель вполне себе качественно работает как минимум на задачах кодирования, анализа и работы с данными. По субъективным ощущениям не хуже GLM-5.3, а может и даже лучше.
#ai #datatools
✍7👍4🤔2❤1👏1
В рубрике как это устроено у них портал открытых данных Монголии opendata.gov.mn. Всего 57 организаций, 7890 наборов данных и 21856 файлов на 25 августа 2026 г. Раньше их портал работал на базе движка CKAN, теперь там какой-то собственный движок, так что автоматически быстро не проверить объёмы данных и содержимое по типам и тд. Практически все данные это статистика и административные реестры (перечни предприятий, организаций и тд.). Форматы CSV, JSON, XLSX. Нет общедоступного API и в целом выглядит как каталог данных для начальства, потому что уж очень сильно статистика выпячена на главной, явно чтобы показать масштабы и востребованность.
Я бы на такой каталог данных не стал бы ориентироваться на эталонный, но как пример национального портала открытых данных в Азии он вполне нагляден.
#opendata #data #datasets #datacatalogs #mongolia
Я бы на такой каталог данных не стал бы ориентироваться на эталонный, но как пример национального портала открытых данных в Азии он вполне нагляден.
#opendata #data #datasets #datacatalogs #mongolia
✍3❤2🤔1
Я тут затеял большое обновление реестра каталогов данных Dateno с помощью фронтирных LLM, преимущественно через Cursor, но не только. Главные ощутимые изменения в применении именно последних моделей в том что они гораздо лучше понимают контекст и предыдущий накопленный опыт в правилах и гайдах и в том что они гораздо лучше вносят исправления сразу во множество файлов.
Для понимания как устроен реестр каталогов данных, в нем содержится уже более 22 тысяч YAML файлов распределенных по каталогам в иерархии ISO3166 и по типам каталогов данных (opendata, geo, indicators и тд.).
Каждый YAML файл я могу отредактировать вручную, а могу скормить ИИ агенту с промптом вроде "Update metadata for record /data/entities/..." или чуть более сложным при необходимости. ИИ агент пройдет по всем ключевым атрибутам, поищет в интернете, сравнит с другими записями и внесет изменения.
Предыдущее поколение моделей, условный Opus 4.5 или GLM-5.2 хорошо умеют обновлять отдельные записи и начинают хуже работать когда надо обновить гораздо больше. Текущие флагманские модели могут проанализировать и исправить до нескольких сотен записей. Какой-нибудь промпт вроде "Review records at data/entities/IT and fix them" где более 350 записей с каталогами данных Италии отрабатывается за 15 минут.
При этом видно что модель уже гораздо лучше понимает логику поиска и актуализации информации, ищет альтернативные хосты и названия если сайт умер, проверяет точки подключения к API и так далее. Гораздо меньше надо объяснять в самом промпте если заранее заданы правила.
Собственно благодаря этому сейчас я могу обновить вообще все метаданные реестра и добавить, наконец-то, многое отложенное. Собственно поэтому меньше чем за 3 недели реестр вырос уже с 14 до 22 тысяч каталогов данных плюс обновление метаданных почти всех записей.
К слову это можно повторить с помощью бесплатных или недорогих китайских моделей, но заняло бы это больше времени при относительно небольшой экономии средств.
Кстати, в решаемой мной задаче поиска каталогов данных больше расходов идет не на подписку на ИИ агенты/ассистенты, а на подписку на сопутствующие сервисы. Например, поиск каталогов данных резко улучшается когда используешь Censys, это, конечно, чистой воды кибербезовский инструмент, но в задачах обнаружения веб-ресурсов он очень эффективен. Но при их системе оплаты внесенные средства сжигаются очень быстро. Хотя и он дешевле чем использовать какой-нибудь BuiltWith.
Общая стоимость решения такова что расходы на ИИ агенты в нем не основные, а обогащение данных становится значительно эффективнее.
#thoughts #ai #datacatalogs
Для понимания как устроен реестр каталогов данных, в нем содержится уже более 22 тысяч YAML файлов распределенных по каталогам в иерархии ISO3166 и по типам каталогов данных (opendata, geo, indicators и тд.).
Каждый YAML файл я могу отредактировать вручную, а могу скормить ИИ агенту с промптом вроде "Update metadata for record /data/entities/..." или чуть более сложным при необходимости. ИИ агент пройдет по всем ключевым атрибутам, поищет в интернете, сравнит с другими записями и внесет изменения.
Предыдущее поколение моделей, условный Opus 4.5 или GLM-5.2 хорошо умеют обновлять отдельные записи и начинают хуже работать когда надо обновить гораздо больше. Текущие флагманские модели могут проанализировать и исправить до нескольких сотен записей. Какой-нибудь промпт вроде "Review records at data/entities/IT and fix them" где более 350 записей с каталогами данных Италии отрабатывается за 15 минут.
При этом видно что модель уже гораздо лучше понимает логику поиска и актуализации информации, ищет альтернативные хосты и названия если сайт умер, проверяет точки подключения к API и так далее. Гораздо меньше надо объяснять в самом промпте если заранее заданы правила.
Собственно благодаря этому сейчас я могу обновить вообще все метаданные реестра и добавить, наконец-то, многое отложенное. Собственно поэтому меньше чем за 3 недели реестр вырос уже с 14 до 22 тысяч каталогов данных плюс обновление метаданных почти всех записей.
К слову это можно повторить с помощью бесплатных или недорогих китайских моделей, но заняло бы это больше времени при относительно небольшой экономии средств.
Кстати, в решаемой мной задаче поиска каталогов данных больше расходов идет не на подписку на ИИ агенты/ассистенты, а на подписку на сопутствующие сервисы. Например, поиск каталогов данных резко улучшается когда используешь Censys, это, конечно, чистой воды кибербезовский инструмент, но в задачах обнаружения веб-ресурсов он очень эффективен. Но при их системе оплаты внесенные средства сжигаются очень быстро. Хотя и он дешевле чем использовать какой-нибудь BuiltWith.
Общая стоимость решения такова что расходы на ИИ агенты в нем не основные, а обогащение данных становится значительно эффективнее.
#thoughts #ai #datacatalogs
Dateno
Dateno Registry and Dataset Search Engine
A next-generation data search service provides fast, comprehensive access to open datasets worldwide, with powerful filters and an API-first architecture for seamless integration.
👍7✍1🤔1
Хотите больших, очень больших, очень-очень больших данных? 2 петабайта архив за 2024 год проекта End of Term Web Archive по архивации деятельности правительства США. Делают они его в партнерстве с Internet Archive, которые обеспечивают техническую часть организации архивации. А сами данные хранятся на AWS в рамках спонсорского гранта от Amazon. Просмотреть сохраненные сайты можно на сайте GovArchive.us
#webarchives #data #datasets #USA
#webarchives #data #datasets #USA
End of Term Web Archive
Datasets
The End of Term Web Archive is a collaborative initiative that collects, preserves, and makes accessible United States Government websites at the end of presidential administrations.
❤🔥8👍5🔥3🤔2❤1✍1
В рубрике как это устроено у них официальный портал открытых данных Азербайджана opendata.az
Включает 836 наборов данных от 25 организаций. Почти все наборы данных статистические, почти нет геоданных. Работает на базе PortalJS с движком CKAN на бэкэнде.
Так и хочется сказать что даже у Азербайджана есть официальный портал открытых данных, а у Армении нет (c)
#opendata #datasets #datacatalogs
Включает 836 наборов данных от 25 организаций. Почти все наборы данных статистические, почти нет геоданных. Работает на базе PortalJS с движком CKAN на бэкэнде.
Так и хочется сказать что даже у Азербайджана есть официальный портал открытых данных, а у Армении нет (c)
#opendata #datasets #datacatalogs
👍3✍1🤣1
В рубрике как это устроено у них портал открытых геномных данных JGI DataPortal департамента энергетики США. Включает данные и метаданные с геномной информацией. Общий объём более 13ПБ, поддерживается Университетом Калифорнии.
Это специализированный портал научных данных, один из многих общедоступных порталов с геномной информацией, заточенный под исследователей в этой области.
Включает возможность выгрузки данных через систему Globus, получение метаданных через API и т.д.
#opendata #USA #genomic #datasets
Это специализированный портал научных данных, один из многих общедоступных порталов с геномной информацией, заточенный под исследователей в этой области.
Включает возможность выгрузки данных через систему Globus, получение метаданных через API и т.д.
#opendata #USA #genomic #datasets
👍4✍1
Кстати пример портала с именно с дата продуктами - это Source Cooperative портал нового поколения с акцентом на данные машинного обучения и геоданные. Там много данных большого объёма, в сотни гигабайт, преимущественно в форматах Parquet.
При этому внутри он устроен достаточно просто, это файловый навигатор по S3 хранилищу и описание в виде Markdown файла README.md которое и отображает как карточка продукта. Описание может быть как очень коротким так и весьма подробным со схемами данных, примерами кода, областями покрытия. Все отдано на откуп куратору дата продукта, а, поскольку курируют они сами, то и описано чаще хорошо чем плохо.
Главный минус такого подхода в том что доступ к данным не универсален. Каждый продукт имеет свою структуру файлов, свои примеры кода и тд. Чтобы подключиться к ним надо прочитать документацию, разобраться и тд.
Главный плюс в том что там хранятся данные большого объема, некоторые коллекции геоданных достигают сотен терабайт и в том что документацию всё равно читать надо.
Мне их каталог более всего напоминает бывший Quilt Data, а теперь Quilt.Bio которые тоже делали платформу для больших научных дата продуктов и тоже поверх S3 и с акцентом на документацию.
Тут важно, конечно, то что Source Cooperative - это инициатива Radiant Earth, НКО в области геоданных и их дата продукты ориентированы на некоммерческое использование и сама их платформа для публикации данных бесплатна. Поэтому их подход к дата продуктам скорее можно описать как то что они пытаются перенести практики создания коммерческих дата продуктов в некоммерческий сектор, пытаясь привести открытые данные в современный и более удобоваримый формат.
#opendata #datacatalogs #datasets #geodata
При этому внутри он устроен достаточно просто, это файловый навигатор по S3 хранилищу и описание в виде Markdown файла README.md которое и отображает как карточка продукта. Описание может быть как очень коротким так и весьма подробным со схемами данных, примерами кода, областями покрытия. Все отдано на откуп куратору дата продукта, а, поскольку курируют они сами, то и описано чаще хорошо чем плохо.
Главный минус такого подхода в том что доступ к данным не универсален. Каждый продукт имеет свою структуру файлов, свои примеры кода и тд. Чтобы подключиться к ним надо прочитать документацию, разобраться и тд.
Главный плюс в том что там хранятся данные большого объема, некоторые коллекции геоданных достигают сотен терабайт и в том что документацию всё равно читать надо.
Мне их каталог более всего напоминает бывший Quilt Data, а теперь Quilt.Bio которые тоже делали платформу для больших научных дата продуктов и тоже поверх S3 и с акцентом на документацию.
Тут важно, конечно, то что Source Cooperative - это инициатива Radiant Earth, НКО в области геоданных и их дата продукты ориентированы на некоммерческое использование и сама их платформа для публикации данных бесплатна. Поэтому их подход к дата продуктам скорее можно описать как то что они пытаются перенести практики создания коммерческих дата продуктов в некоммерческий сектор, пытаясь привести открытые данные в современный и более удобоваримый формат.
#opendata #datacatalogs #datasets #geodata
👍4
В рубрике закрытых открытых данных в России портал открытых данных города Твери opendata.tver.ru недоступен и теперь перенаправляет на сайт администрации города www.tver.ru в последний раз сайт наблюдался в Интернет архиве в октябре 2024 года.
Портал данных города Перми opendata.gorodperm.ru содержит всего два набора данных "Режим работы" и "Телефонный справочник", бессмысленные для любой работы.
Портал данных Иркутска opendata.admirk.ru содержит лишь один набор данных "Структура аппарата администрации города Иркутска".
Это к вопросу о том почему многочисленные российские "порталы открытых данных" регионов и муниципалитетов бессмысленно добавлять в поисковые индексы или реестры каталогов данных. Они пустые или бессмысленные или уже не существуют.
#opendata #russia #datacatalogs
Портал данных города Перми opendata.gorodperm.ru содержит всего два набора данных "Режим работы" и "Телефонный справочник", бессмысленные для любой работы.
Портал данных Иркутска opendata.admirk.ru содержит лишь один набор данных "Структура аппарата администрации города Иркутска".
Это к вопросу о том почему многочисленные российские "порталы открытых данных" регионов и муниципалитетов бессмысленно добавлять в поисковые индексы или реестры каталогов данных. Они пустые или бессмысленные или уже не существуют.
#opendata #russia #datacatalogs
web.archive.org
Портал открытых данных администрации города Твери
Портал Администрации города Твери
😢4✍1
В рубрике как это устроено у них AIKosh индийский государственный портал данных для ИИ. Включает 15200+ наборов данных, пакет aikosh для Python для работы с порталом, оценку качества каждого набора данных, четкие условия использования (в основном CC-BY-NC-SA) и так далее.
Доступ к данным дают только после регистрации. Также предоставляют инфраструктуру для работы с данными в разделе Notebook и так далее.
#opendata #ai #india #datacatalogs #datasets
Доступ к данным дают только после регистрации. Также предоставляют инфраструктуру для работы с данными в разделе Notebook и так далее.
#opendata #ai #india #datacatalogs #datasets
🔥3✍1
Ещё одно наблюдение, то что с развитием ИИ агентов появилось множество порталов показывающих национальную и международную статистику наглядно, вот, например, такой по Монголии data.mn. Они все используют официальную статистику с сайтов нац. стат. служб и из баз данных межгосударственных структур. И вот таких порталов я видел уже штук 7 за неделю и несколько глобальных, охватывающих все страны.
В чем их особенности:
- как правило это one-man-project, делаются они одним человеком с помощью Claude / Cursor / Copilot / ChatGPT и далее по списку
- большая часть делается просто для портфолио, без бизнес модели. Исключения в тех что пытаются "засрать поисковую выдачу" с акцентом на SEO. В их бизнес модель я не верю.
- всегда акцент на визуализации, то что национальные статслужбы не умеют
- но про пользователей их создатели понимают редко, частотные (часто обновляемые) показатели у них есть редко.
Когда-то много таких проектов делала команда DataWheel (DataUSA, DataSaudi и др.), но там был явно не один человек, больше акцент на визуализации и работа всегда под клиентов.
Вот эти новые проекты пока до их уровня не дотягивают, но это скорее вопрос понимания природы данных и пользователей у их создателей, чем техническая невозможность.
#opendata #datasets #datacatalogs #datavis #statistics
В чем их особенности:
- как правило это one-man-project, делаются они одним человеком с помощью Claude / Cursor / Copilot / ChatGPT и далее по списку
- большая часть делается просто для портфолио, без бизнес модели. Исключения в тех что пытаются "засрать поисковую выдачу" с акцентом на SEO. В их бизнес модель я не верю.
- всегда акцент на визуализации, то что национальные статслужбы не умеют
- но про пользователей их создатели понимают редко, частотные (часто обновляемые) показатели у них есть редко.
Когда-то много таких проектов делала команда DataWheel (DataUSA, DataSaudi и др.), но там был явно не один человек, больше акцент на визуализации и работа всегда под клиентов.
Вот эти новые проекты пока до их уровня не дотягивают, но это скорее вопрос понимания природы данных и пользователей у их создателей, чем техническая невозможность.
#opendata #datasets #datacatalogs #datavis #statistics
3❤4🔥3✍1
Полезные ссылки про данные, технологии и не только:
- Amazon (AWS) покупает DuckLabs собственно команду создателей DuckDB. За команду можно только порадоваться, продукт у них невероятно крутой для всех кто занимается дата аналитикой и дата инженерией. Обещают что DuckDB останется с открыты кодом
- ox-alpha оказался GLM-5.3 об этом уже много где пишут, ну что сказать Z.ai молодцы, так порекламировали свою модель. Интересно во сколько эта реклама обошлась? Модель, кстати, хорошая, примерно как GPT-5.6 Luna
#dataengineering #aiagents
- Amazon (AWS) покупает DuckLabs собственно команду создателей DuckDB. За команду можно только порадоваться, продукт у них невероятно крутой для всех кто занимается дата аналитикой и дата инженерией. Обещают что DuckDB останется с открыты кодом
- ox-alpha оказался GLM-5.3 об этом уже много где пишут, ну что сказать Z.ai молодцы, так порекламировали свою модель. Интересно во сколько эта реклама обошлась? Модель, кстати, хорошая, примерно как GPT-5.6 Luna
#dataengineering #aiagents
DuckDB
DuckLabs to Join AWS, Projects to Remain Open Source
DuckLabs will join Amazon Web Services (AWS), which is expected to be effective in early September. The projects will remain open-source under the MIT license.
👍4⚡2🔥2✍1
Научные данные России: с чего начинать
Земля, океан, климат
ЕСИМО — http://esimo.ru
Тема: океан, метеорология, гидрология.
Ценность: единая государственная система Росгидромета об обстановке в Мировом океане — официальный контур морских и гидрометеоданных, а не институтский архив.
Всемирный центр данных по метеорологии (Обнинск) — http://meteo.ru/mcd/ewdcmet.html
Тема: метеорология.
Ценность: российский узел сети World Data Centres: сбор и распространение метеоданных внутри страны и в международном обмене (ВНИИГМИ–МЦД).
Всемирный центр радиационных данных (WRDC) — http://wrdc.mgo.rssi.ru/
Тема: климат, солнечная радиация.
Ценность: один из шести мировых центров программы GAW ВМО; архив актинометрических наблюдений ГГО им. Воейкова.
Всемирный центр данных по солнечно-земной физике (Москва) — http://www.wdcb.ru/stp/index.en.html
Тема: геофизика, космос.
Ценность: архив наблюдений солнечно-земной физики Геофизического центра РАН.
Геомагнитный центр ГЦ РАН — https://geomag.gcras.ru/
Тема: геомагнетизм.
Ценность: данные обсерваторий INTERMAGNET по России и ближнему зарубежью, плюс спутниковые продукты (система MAGNUS).
Астрономия и физика
Центр астрономических данных ИНАСАН — https://www.inasan.ru/en/divisions/dpss/cad/
Тема: астрономия.
Ценность: с 1980 года российский филиал CDS Strasbourg; каталоги звёзд, переменных и двойных систем для отечественной астрономии.
SPECTR-W3 — http://spectr-w3.snz.ru/index.phtml
Тема: атомная спектроскопия, физика плазмы.
Ценность: одна из крупнейших баз по спектрам атомов и высокозарядных ионов (РФЯЦ–ВНИИТФ): уровни, линии, вероятности переходов, сечения.
Биоразнообразие и коллекции
Российский GBIF IPT — http://gbif.ru:8080/ipt/
Тема: биоразнообразие.
Ценность: национальный узел публикации occurrence-данных в GBIF (ИМПБ РАН / ИПМ им. Келдыша).
«Ноев ковчег», МГУ — https://depo.msu.ru/ipt/
Тема: живые системы, биоматериалы.
Ценность: депозитарий МГУ — от молекул до организмов; наборы публикуются в GBIF.
IPT ЗИН РАН и БИН РАН — https://ipt.zin.ru
Тема: зоология и ботаника.
Ценность: данные крупнейших академических коллекций — Зоологического и Ботанического институтов РАН.
IPT Института океанологии им. Ширшова — https://gbif.ocean.ru/ipt/
Тема: морская биология.
Ценность: встречи, плотность и биомасса видов с экспедиций ИО РАН.
Молекулярная биология (российские базы мирового уровня)
CSDB — https://csdb.glycoscience.ru/database/
Тема: гликомика.
Ценность: курируемая база природных углеводных структур с таксономией, литературой и ЯМР (ИОХ РАН).
GTRD — https://gtrd.biouml.org/
Тема: регуляция транскрипции.
Ценность: сайты связывания транскрипционных факторов по ChIP-seq для человека и мыши.
HOCOMOCO — https://hocomoco11.autosome.org/
Тема: геномика, мотивы ДНК.
Ценность: модели связывания 680 человеческих и 453 мышиных транскрипционных факторов (PWM по ChIP-seq из GTRD).
VDJdb — https://vdjdb.com/
Тема: иммунология, TCR.
Ценность: курируемая база Т-клеточных рецепторов с известной антигенной специфичностью (ИБХ РАН).
EpiFactors — https://epifactors.autosome.org/
Тема: эпигенетика.
Ценность: белки и комплексы эпигенетической регуляции плюс экспрессия в клетках, раковых линиях и тканях (МФТИ).
Медицина и ML
MosMedData — https://mosmed.ai/datasets
Тема: медицинская визуализация.
Ценность: открытые КТ-наборы (в т.ч. COVID-19) Центра диагностики и телемедицины ДЗМ — готовые датасеты для обучения моделей.
Medical Data Hub — https://medicaldatahub.ru/datasets/
Тема: медицинские датасеты для ML.
Ценность: каталог медицинских наборов под машинное обучение.
Гуманитаристика, соцнауки, вузы
Dataverse Пушкинского Дома — https://dataverse.pushdom.ru
Тема: русская литература и фольклор.
Ценность: открытые исследовательские данные ИРЛИ РАН с DOI.
Репозиторий психологических данных — https://ruspsydata.figshare.com
Тема: психология.
Ценность: данные и инструменты исследований МГППУ.
DSpace СПбГУ — https://dspace.spbu.ru
Тема: университетский репозиторий.
Ценность: публикации, диссертации и датасеты сообщества СПбГУ (есть API DSpace 7).
#opendata #datasets #russia #researchdata
Земля, океан, климат
ЕСИМО — http://esimo.ru
Тема: океан, метеорология, гидрология.
Ценность: единая государственная система Росгидромета об обстановке в Мировом океане — официальный контур морских и гидрометеоданных, а не институтский архив.
Всемирный центр данных по метеорологии (Обнинск) — http://meteo.ru/mcd/ewdcmet.html
Тема: метеорология.
Ценность: российский узел сети World Data Centres: сбор и распространение метеоданных внутри страны и в международном обмене (ВНИИГМИ–МЦД).
Всемирный центр радиационных данных (WRDC) — http://wrdc.mgo.rssi.ru/
Тема: климат, солнечная радиация.
Ценность: один из шести мировых центров программы GAW ВМО; архив актинометрических наблюдений ГГО им. Воейкова.
Всемирный центр данных по солнечно-земной физике (Москва) — http://www.wdcb.ru/stp/index.en.html
Тема: геофизика, космос.
Ценность: архив наблюдений солнечно-земной физики Геофизического центра РАН.
Геомагнитный центр ГЦ РАН — https://geomag.gcras.ru/
Тема: геомагнетизм.
Ценность: данные обсерваторий INTERMAGNET по России и ближнему зарубежью, плюс спутниковые продукты (система MAGNUS).
Астрономия и физика
Центр астрономических данных ИНАСАН — https://www.inasan.ru/en/divisions/dpss/cad/
Тема: астрономия.
Ценность: с 1980 года российский филиал CDS Strasbourg; каталоги звёзд, переменных и двойных систем для отечественной астрономии.
SPECTR-W3 — http://spectr-w3.snz.ru/index.phtml
Тема: атомная спектроскопия, физика плазмы.
Ценность: одна из крупнейших баз по спектрам атомов и высокозарядных ионов (РФЯЦ–ВНИИТФ): уровни, линии, вероятности переходов, сечения.
Биоразнообразие и коллекции
Российский GBIF IPT — http://gbif.ru:8080/ipt/
Тема: биоразнообразие.
Ценность: национальный узел публикации occurrence-данных в GBIF (ИМПБ РАН / ИПМ им. Келдыша).
«Ноев ковчег», МГУ — https://depo.msu.ru/ipt/
Тема: живые системы, биоматериалы.
Ценность: депозитарий МГУ — от молекул до организмов; наборы публикуются в GBIF.
IPT ЗИН РАН и БИН РАН — https://ipt.zin.ru
Тема: зоология и ботаника.
Ценность: данные крупнейших академических коллекций — Зоологического и Ботанического институтов РАН.
IPT Института океанологии им. Ширшова — https://gbif.ocean.ru/ipt/
Тема: морская биология.
Ценность: встречи, плотность и биомасса видов с экспедиций ИО РАН.
Молекулярная биология (российские базы мирового уровня)
CSDB — https://csdb.glycoscience.ru/database/
Тема: гликомика.
Ценность: курируемая база природных углеводных структур с таксономией, литературой и ЯМР (ИОХ РАН).
GTRD — https://gtrd.biouml.org/
Тема: регуляция транскрипции.
Ценность: сайты связывания транскрипционных факторов по ChIP-seq для человека и мыши.
HOCOMOCO — https://hocomoco11.autosome.org/
Тема: геномика, мотивы ДНК.
Ценность: модели связывания 680 человеческих и 453 мышиных транскрипционных факторов (PWM по ChIP-seq из GTRD).
VDJdb — https://vdjdb.com/
Тема: иммунология, TCR.
Ценность: курируемая база Т-клеточных рецепторов с известной антигенной специфичностью (ИБХ РАН).
EpiFactors — https://epifactors.autosome.org/
Тема: эпигенетика.
Ценность: белки и комплексы эпигенетической регуляции плюс экспрессия в клетках, раковых линиях и тканях (МФТИ).
Медицина и ML
MosMedData — https://mosmed.ai/datasets
Тема: медицинская визуализация.
Ценность: открытые КТ-наборы (в т.ч. COVID-19) Центра диагностики и телемедицины ДЗМ — готовые датасеты для обучения моделей.
Medical Data Hub — https://medicaldatahub.ru/datasets/
Тема: медицинские датасеты для ML.
Ценность: каталог медицинских наборов под машинное обучение.
Гуманитаристика, соцнауки, вузы
Dataverse Пушкинского Дома — https://dataverse.pushdom.ru
Тема: русская литература и фольклор.
Ценность: открытые исследовательские данные ИРЛИ РАН с DOI.
Репозиторий психологических данных — https://ruspsydata.figshare.com
Тема: психология.
Ценность: данные и инструменты исследований МГППУ.
DSpace СПбГУ — https://dspace.spbu.ru
Тема: университетский репозиторий.
Ценность: публикации, диссертации и датасеты сообщества СПбГУ (есть API DSpace 7).
#opendata #datasets #russia #researchdata
🔥8👏5✍3❤2❤🔥1
Forwarded from Национальный цифровой архив
В России стартовали дебаты кандидатов в депутаты Государственной думы IX созыва. Эфир для проведения предвыборных дебатов предоставили пять федеральных государственных телеканалов: «Россия 1», «Россия 24», Первый канал, «ТВ Центр», Общественное телевидение России (ОТР) — и три радиостанции: «Радио России», «Маяк» и «Вести ФМ».
В случае с выборами 2018, 2021 и 2024 годов федеральные телеканалы не стали выкладывать записи дебатов на своих официальных ресурсах. Тех записей нет ни на порталах типа "Смотрим", ни на сайтах телекомпаний, ни на их каналах в сервисах Rutube, VK, Telegram. По опыту прошлых лет также отмечалось стремление правообладателей блокировать распространение записей дебатов в Интернете, в основном, на любительских YouTube-каналах и в сообществах Вконтакте, посвящённых фиксации истории телевизионной рекламы и заставок. Так, в марте 2024 года в рамках аналогичного поста в канале, по относительно горячим следам так и не удалось обнаружить записей семи эфиров.
Если архивация основных радиостанций налажена достаточно давно и основательно (в Telegram есть канал-бот https://t.me/RadioBot, позволяющий прослушать любой час эфира, начиная с 2018 года), то с телеэфиром всё несколько сложнее. Есть ресурс https://www.ontvtime.ru , где для некоторых телеканалов можно "отмотать эфир" на пару недель назад, теоретически можно использовать его для подстраховки. Но лучшим решением было бы записать трансляции теледебатов с эфира и организовать раздачу всего пакета на торрент-трекерах.
Телевизионная часть дебатов стартует 31 августа, полное расписание известно:
Первый канал
31 августа 7:05-7:45
1 сентября 7:05-7:45
2 сентября 7:05-7:45
3 сентября 7:05-7:45
4 сентября 7:05-7:45
7 сентября 7:05-7:45
8 сентября 7:05-7:45
9 сентября 7:05-7:45
10 сентября 7:05-7:45
11 сентября 7:05-7:45
Россия 1
1 сентября 23:30-0:45
2 сентября 23:30-0:45
3 сентября 23:30-0:45
8 сентября 23:30-0:45
9 сентября 23:30-0:45
Россия 24
1 сентября 19:00-20:00
2 сентября 19:00-20:00
3 сентября 19:00-20:00
8 сентября 19:00-20:00
9 сентября 19:00-20:00
10 сентября 19:00-20:00
ТВ Центр
1 сентября 17:00-17:50
2 сентября 17:00-17:50
7 сентября 17:00-17:50
8 сентября 17:00-17:50
9 сентября 17:00-17:50
10 сентября 17:00-17:50
ОТР
31 августа 10:00-11:00
2 сентября 10:00-11:00
4 сентября 10:00-11:00
7 сентября 10:00-11:00
9 сентября 10:00-11:00
11 сентября 10:00-11:00
Мы просим помощи в записи федеральных телебатов. Присылайте ссылки сразу в чат @ruarxivechat.
#archives #elections #helpneeded
В случае с выборами 2018, 2021 и 2024 годов федеральные телеканалы не стали выкладывать записи дебатов на своих официальных ресурсах. Тех записей нет ни на порталах типа "Смотрим", ни на сайтах телекомпаний, ни на их каналах в сервисах Rutube, VK, Telegram. По опыту прошлых лет также отмечалось стремление правообладателей блокировать распространение записей дебатов в Интернете, в основном, на любительских YouTube-каналах и в сообществах Вконтакте, посвящённых фиксации истории телевизионной рекламы и заставок. Так, в марте 2024 года в рамках аналогичного поста в канале, по относительно горячим следам так и не удалось обнаружить записей семи эфиров.
Если архивация основных радиостанций налажена достаточно давно и основательно (в Telegram есть канал-бот https://t.me/RadioBot, позволяющий прослушать любой час эфира, начиная с 2018 года), то с телеэфиром всё несколько сложнее. Есть ресурс https://www.ontvtime.ru , где для некоторых телеканалов можно "отмотать эфир" на пару недель назад, теоретически можно использовать его для подстраховки. Но лучшим решением было бы записать трансляции теледебатов с эфира и организовать раздачу всего пакета на торрент-трекерах.
Телевизионная часть дебатов стартует 31 августа, полное расписание известно:
Первый канал
31 августа 7:05-7:45
1 сентября 7:05-7:45
2 сентября 7:05-7:45
3 сентября 7:05-7:45
4 сентября 7:05-7:45
7 сентября 7:05-7:45
8 сентября 7:05-7:45
9 сентября 7:05-7:45
10 сентября 7:05-7:45
11 сентября 7:05-7:45
Россия 1
1 сентября 23:30-0:45
2 сентября 23:30-0:45
3 сентября 23:30-0:45
8 сентября 23:30-0:45
9 сентября 23:30-0:45
Россия 24
1 сентября 19:00-20:00
2 сентября 19:00-20:00
3 сентября 19:00-20:00
8 сентября 19:00-20:00
9 сентября 19:00-20:00
10 сентября 19:00-20:00
ТВ Центр
1 сентября 17:00-17:50
2 сентября 17:00-17:50
7 сентября 17:00-17:50
8 сентября 17:00-17:50
9 сентября 17:00-17:50
10 сентября 17:00-17:50
ОТР
31 августа 10:00-11:00
2 сентября 10:00-11:00
4 сентября 10:00-11:00
7 сентября 10:00-11:00
9 сентября 10:00-11:00
11 сентября 10:00-11:00
Мы просим помощи в записи федеральных телебатов. Присылайте ссылки сразу в чат @ruarxivechat.
#archives #elections #helpneeded
Telegram
Национальный цифровой архив in Обсуждаем цифровую архивацию
В России стартовали президентские выборы. Эфир для проведения предвыборных дебатов предоставили пять федеральных государственных телеканалов: «Россия 1», «Россия 24», Первый канал, «ТВ Центр», Общественное телевидение России (ОТР) — и три радиостанции: «Радио…
👍2❤1🔥1😁1🗿1
Очередное обновление реестра каталогов данных Dateno, теперь достигнута планка в 25 тысяч каталогов данных большая часть которых - это порталы геоданных и геопорталы, далее репозитории научных данных и далее уже порталы открытых данных.
Основные обновления касались добавления огромного числа репозиториев научных данных и порталов научных данных, сложность с ними всегда была в том что часто это институциональные репозитории в которых могут быть, а могут и не быть наборы данных. И вот отсев вторых от первых и требовал много времени. Теперь он завершился и в реестре в общей сложности 6299 каталога научных данных в том числе по неохваченным ранее развивающимся странам.
Тут я напомню что число каталогов данных в разбивке по типу ПО, типу каталога, странам и тд. - это не показатель объёмов набора данных, это показатель системности того как в стране с данными работают. Обычно это коррелирует с числом датасетов, но это не 100% корреляция.
Например, по России есть 291 каталог с данными, почти как в Швеции где их 303. А более всего их в США, Германии и Франции, что тоже логично.
В целом там прямые корреляции с вхождением стран в G7 / ОСЭР / G20. Что тоже логично.
#opendata #datacatalogs #data
Основные обновления касались добавления огромного числа репозиториев научных данных и порталов научных данных, сложность с ними всегда была в том что часто это институциональные репозитории в которых могут быть, а могут и не быть наборы данных. И вот отсев вторых от первых и требовал много времени. Теперь он завершился и в реестре в общей сложности 6299 каталога научных данных в том числе по неохваченным ранее развивающимся странам.
Тут я напомню что число каталогов данных в разбивке по типу ПО, типу каталога, странам и тд. - это не показатель объёмов набора данных, это показатель системности того как в стране с данными работают. Обычно это коррелирует с числом датасетов, но это не 100% корреляция.
Например, по России есть 291 каталог с данными, почти как в Швеции где их 303. А более всего их в США, Германии и Франции, что тоже логично.
В целом там прямые корреляции с вхождением стран в G7 / ОСЭР / G20. Что тоже логично.
#opendata #datacatalogs #data
GitHub
GitHub - datenoio/dataportals-registry: Registry of data portals, catalogs, data repositories including data catalogs dataset and…
Registry of data portals, catalogs, data repositories including data catalogs dataset and catalog description standard - datenoio/dataportals-registry
👍2✍1