Ivan Begtin
9.12K subscribers
2.7K photos
5 videos
116 files
5.55K links
I write about Open Data, Data Engineering, Government, Privacy, Digital Preservation and etc.

CTO&Founder of Dateno https://dateno.io

Telegram @ibegtin
Facebook - https://facebook.com/ibegtin
Email ivan@begtin.tech

Ads/promotion agent: @k0shk
Download Telegram
Полезное чтение про данные, технологии и не только:
- How AI is breaking the British state статья в The Economist о том что граждане в Великобритании начали массово использовать ИИ агенты для подачи жалоб и аппеляций, так что скоро суды будут перегружены если не уже. И о том что эта ситуация грозит повториться во всех богатых демократиях где у граждан есть многие права и теперь ИИ заменяет юристов которые подавали такие жалобы. Статья за пэйволом, вот тут можно почитать ее краткое изложение
- Reimagining Development Data каталог каталогов (data inventory) наиболее значимых баз по тематике международного развития. Полезно для тех кто интересуется темой и мне для пополнения реестра каталогов данных Dateno
- The Prediction Revolution книга от Grace Huckins о том как ИИ дает возможности предсказывать то что ранее предсказывать было невозможно.

#ai #opendata
🔥84💯1
Сжатие файлов в общем случае и сжатие данных в частном очень частая тема когда вопрос касается их хранения и обработки. Сколько раз приходится сталкиваться с тем что использование тех или иных цифровых материалов усложнено, или отсутствием такового сжатия, или его недостаточным применением. Применение сжатие, как и использование специальных форматов распространения данных это ещё и одна из характеристик дата продуктов когда данные большого объёма не только их хранение, но и передача имеют существенное значение.

1. Наиболее актуальная практика сжатия файлов с данными сейчас - это применение Zstandard (расширение .zst). Большая часть современных инструментов обработки данных и их анализа, умеют с ними работать. К примеру, они естественным образом читаются с помощью DuckDB, Polars или Pandas. Да и другие инструменты работающие с дата фреймами их поддерживают.
2. Но большая часть - это далеко не все, к примеру, табличные редакторы вроде Excel или BI системы сжатые файлы не поддерживают, за исключением разве что Parquet, который, впрочем, тоже поддерживают не все.
3. Parquet - это другой важный формат распространения данных, он не только поддерживает разные кодеки сжатия данных, но и даёт лучшее сжатие за счет применения компрессии к колонкам. Распространять данные в виде Parquet файлов с внутренним сжатием - это хорошая практика и один из признаков что те кто данные распространяют ориентируются на профессиональную аудиторию и сами с данными работать умеют.
4. Один из худших форматов для распространения данных - это большие XML дампы, которые даже если сжатые требуют специальных усилий чтобы не считывать весь файл в оперативную память. К примеру, Фонд Викимедия (Википедия и тд.) распространяет дампы википедий в виде больших сжатых XML и для обработки их нужны SAX парсеры. Впрочем там уже есть экосистема инструментов которая эту проблема успешно решает.
5. Есть множество старых дата продуктов в которых до сих пор используются сжатие GZip, Bzip2 и тд. по принципу сохранения совместимости и потому что "тут так сложилось". Тем не менее это могут быть хорошие дата продукты
6. Но самый распространный формат распространения данных - это, конечно, ZIP файлы. Например, нарезая данные из базы данных на сотни ZIP файлов в которых сотни/тысячи XML или CSV файлов и, иногда, заодно и документация и сопроводительные материалы. Внутри они могут быть очень по разному устроены.
7. В разное время появлялись стандарты описания пакетов с данными. BagIt, Frictionless Data Package, DataCrate, Research Objects, ReproZip. У них у всех есть свои ограничения и свое применение. Главный недостаток - неадаптированность к облачному хранению, невозможность работать с частью пакета данных не скачивая его контейнер целиком.
8. Некоторые большие наборы данных/базы данных/дата продукты их владельцы распространяют вообще через такие инструменты как rsync (open-source ПО для синхронизации данных между серверами) и тогда сжатие обеспечивается на этапе передачи данных даже если оригинальные файлы не сжаты. Особенно часто такое бывает в астрофизике, сейсмологии, биоинформатике и тд. Естественных науках где есть организации предоставляющие профессиональные data services по синхронизации больших баз данных.


#opendata #compression #data #thoughts
👍10🔥5🌚2🤔1
В рубрике как это устроено у них Национальный портал открытых данных Пакистана nodp.gov.pk. Называется громко, а по факту это портал со статистикой, причем не для выгрузки, а в виде дашбордов в Superset выставленных онлайн. Данные из дашбордов можно, конечно, скачать в CSV или XLS, но это не отменяет того что это портал с дашбордами и название де-факто не соответствует содержанию. Зато хорошо иллюстрирует мои рассуждения про дата продукты и про то что ими является и что нет. Вот тут дата продуктов не то чтобы нет, нет даже намека на них. Для развивающихся стран это частая история когда делают портал с небольшим числом статистических показателей и называют его порталом открытых данных.

#opendata #statistics #pakistan #datacatalogs
👍5🔥51
В мире есть всего 3 страны в которых нет ни одного портала данных - это Северная Корея, Сент-Китс и Невис и Гренада. Это не значит что никаких данных о них нет, есть данные межгосударственных структур которые собирают данные по всем странам, но вот конкретно в этих случаях сами страны публикуют информацию очень скудно. В этом списке мог бы быть Туркменистан, но там есть хотя бы портал показателей устойчивого развития sdg.stat.gov.tm в остальном же тоже все очень скудно.

У 43 стран нет национальных каталогов статистических индикаторов. Не сайтов статслужб с публикациями в PDF/Excel, а именно каталогов с индикаторами/временными рядами. Большая часть этих стран - это малые страны Карибского моря, Океании и другие беднейшие страны. Что характерно почти у всех стран Африки есть порталы статпоказателей в рамках проекта Африканского банка развития.

У 82 стран нет национальных порталов открытых данных, из европейских стран это только Андорра, Сан Марино и Беларусь. У большей части стран Океании и Африки также нет национальных порталов открытых данных. В ряде стран вроде Пакистана то что официально так называется де-факто этим не является.

Всё это цифры на основе последнего релиза dataportals-registry реестра каталогов данных Dateno. Там был добавлено 92 новых каталога данных и обновлены метаданные существующих. Например, национальные порталы открытых данных в этом году появились у таких стран как:
- Бутан - data.gov.bt
- Иордания - opendata.gov.jo
- Камбоджа - data.mef.gov.kh
- Лихтенштейн - opendata.li
- Монако - data.gouvernement.mc
- Оман opendata.gov.om

#opendata #datacatalogs #data
175❤‍🔥1
В продолжение про обновление реестра каталогов данных Dateno, поделюсь ещё наблюдением то что модели внутри Cursor'а и выполнение задач агентами стало, в некоторых задачах, сравнимо с внешними аналитическими ИИ агентами вроде Manus'а. Например, в рамках ведения этого реестра самая сложная часть - это поиск новых каталогов данных. В какой-то момент все "низковисвящие фрукты" сорваны и надо целенаправленно искать новые каталоги данных чтобы их добавлять. А можно было отправить задачу в тот же Manus или другие размышляющие ИИ агенты с deep research и wide research в стиле "Найди мне дата каталоги по такой-то стране/такой-то тематике" и далее найденное уже добавлять в реестр.

Сейчас ИИ агенты для кодинга справляются с этой задачей если не лучше, то сравнимо. Поиск отсутствующих дата порталов по странам и по предметным областям приводит к формированию краткого отчета в котором практически всегда есть упущенные ранее каталоги данных.

Это хорошее открытие, позволяющее из интерфейса того же Cursor'а искать новые каталоги данных и меньше использовать внешние сервисы, у которых меньше контекста. Скорее всего благодаря этому я довольно скоро существенно обновлю реестр каталогов данных по многим странам.

#opendata #datacatalogs
👍5🤩1💯1
Как я и писал ранее удалось сильно улучшить обнаружение каталогов данных и вышла новая версия реестра каталогов данных. В нее вошло:
- плюс 1748 новых каталогов данных, это более 12% от общего числа, иначе говоря очень много. Среди добавленных каталогов много геопорталов, инсталляций CKAN в Индонезии и Таиланде, китайских порталов научных данных, порталов данных по биоразнообразию, порталов микроданных переписей и так далее.
- 12 новых типов программных продуктов на которых делаются каталоги данных: oportal, piveau, knoema, redatam, datafair и другие
- исправления и улучшения в метаданных существующих описания каталогов данных

Из явных находок:
- картографический сервис ewmapa в Польше на базе которого есть сайты для всех муниципалитетов
- шведская специфика, почти все порталы открытых данных на базе их местного продукта EntryScape
- китайские научные порталы данных почти все работают на базе Instdb, ПО Китайской Академии Наук, их много прибавилось
- NextGIS Web массово используется по всему миру, много инсталляций за пределами РФ добавилось в реестр
- оказывается data.europa.eu создан на базе open source каталога данных Piveau, я все это время думал что там своя разработка

И еще немного цифр:
- 5,906 всех каталогов данных в Европе - это 36.3% от общего числа
- 4,619 всех каталогов данных в США - это 28.4% от общего числа

В Европе страна с наибольшим числом каталогов данных Франция - 801
В США более всего каталогов данных находится в Калифорнии - 481

Подробнее в CHANGELOG, код и данные в репозитории

#opendata #datacatalogs
42👍1💯1
Я регулярно пишу про кризис в сообществе открытых данных из-за развития LLM. Главный источник кризиса в том что у открытых данных да и вообще у любых доступных данных появились компании которые умеют профессионально их монетизировать, хотя инфраструктура проектов с данными создается волонтерами, поддерживается на гранты и так далее.

Вот тут свежий документ-письмо сообщества DPG - Best Practices for Preventing AI Exploitation of Open Content and Open Data DPGs.

Иначе говоря на повестке сообщества не в том как больше открыть данные, а как разделить потребителей на коммерческих и некоммерческих. Там список технических, юридических и управленческих мер по ограничению ботов скрейперов, указанию лицензий использования, условий использования и так далее.

Важный документ отражающий общие настроения которые можно изложить как "мы работаем бесплатно, а на нас зарабатывают миллиарды долларов".

Отдельный вопрос в том что это кризис открытости в целом, не только данных, но и кода, свободно распространяемых текстов и так далее.

#opendata #ai
97💔4👍2🥰1👏1💋1
В продолжение моих рассуждений про дата-продукты и их отличие от наборов данных. Пример публикации таких дата продуктов в академической среде это портал Портал исследовательских данных Шотландии researchdata.scot. Там всего 133 базы данных и это не данные опубликованные исследователями в рамках научных работ, а базы данных доступные исследователям, преимущественно по запросу.

Там немного другая структура описания этих дата продуктов и оно включает:
Summary - сводная информация
Documentation -
документация и описание
Coverage -
область покрытия географическая и временная
Provenance -
происхождение, источник и тип данных
Access and governance -
доступ и управление, как получить доступ к данным, условия, владелец и контакты
Enrichment and linkage -
связанные наборы данных, инструменты для работы, как их интегрировать с другими
Synthetic data -
синтетические данные
Data dictionary
- справочники и словари ассоциированные с этими данными

Тут надо оговориться что это речь про исследовательские дата продукты, а не про коммерческие/корпоративные. Поэтому эта структура и подача даже слегка консервативна, но вполне логична и куда более ложится в логику дата продуктов.

Для сравнения можно посмотреть на дата продукты для финансового сектора в Nasdaq Data Link data.nasdaq.com

Кроме всего прочего там ключевыми характеристиками являются:
- частота обновления данных и частота их доставки
- период задержки

А также множество инструментов доставки и, в виду, особенностей потребления данных акцент на API.

#opendata #data #dataproducts #datacatalogs
4🔥21
В рубрике как это устроено у них свежие порталы открытых данных африканских стран

Того - https://opendata.gouv.tg
Работает на базе ПО uData, французского open source проекта. Содержит более 1500 наборов данных. Преимущественно в формате CSV и много геоданных

Ливия - https://opendata.gia.gov.ly/
Работает на базе открытого ПО CKAN. Включает 129 наборов данных. В основном это файлы Excel, некоторые статпоказатели также публикуют в CSV и JSON

#opendata #datasets #data #libya #togo #africa
3🔥3👍21😁1
OECD AIS Report визуализация данных о морских перевозках от ОЭСР.

Плюсы:
- наглядная визуализация на карте и в графиках
- детализация данных до портов и перевозимых продуктов по типам
- относительно небольшой лаг в 3 месяца (в августе данные на май 2026г.)

Минусы:
- нет нормально доступных данных, только экспорт выборок в Excel
- не все страны есть, к примеру есть данные по России и нет данных по США
- все таки 3 месяца это большой лаг, для оперативного анализа

Что хорошо, можно легко автоматизировать выгрузку данных даже если там только Excel и тд. Недокументированное API тоже есть.

#opendata #datasets #oecd
🔥4311👍1
В рубрике как это устроено у них портал открытых данных Монголии opendata.gov.mn. Всего 57 организаций, 7890 наборов данных и 21856 файлов на 25 августа 2026 г. Раньше их портал работал на базе движка CKAN, теперь там какой-то собственный движок, так что автоматически быстро не проверить объёмы данных и содержимое по типам и тд. Практически все данные это статистика и административные реестры (перечни предприятий, организаций и тд.). Форматы CSV, JSON, XLSX. Нет общедоступного API и в целом выглядит как каталог данных для начальства, потому что уж очень сильно статистика выпячена на главной, явно чтобы показать масштабы и востребованность.

Я бы на такой каталог данных не стал бы ориентироваться на эталонный, но как пример национального портала открытых данных в Азии он вполне нагляден.

#opendata #data #datasets #datacatalogs #mongolia
42🤔1
В рубрике как это устроено у них официальный портал открытых данных Азербайджана opendata.az

Включает 836 наборов данных от 25 организаций. Почти все наборы данных статистические, почти нет геоданных. Работает на базе PortalJS с движком CKAN на бэкэнде.

Так и хочется сказать что даже у Азербайджана есть официальный портал открытых данных, а у Армении нет (c)

#opendata #datasets #datacatalogs
👍31🤣1
В рубрике как это устроено у них портал открытых геномных данных JGI DataPortal департамента энергетики США. Включает данные и метаданные с геномной информацией. Общий объём более 13ПБ, поддерживается Университетом Калифорнии.

Это специализированный портал научных данных, один из многих общедоступных порталов с геномной информацией, заточенный под исследователей в этой области.

Включает возможность выгрузки данных через систему Globus, получение метаданных через API и т.д.

#opendata #USA #genomic #datasets
👍41
Кстати пример портала с именно с дата продуктами - это Source Cooperative портал нового поколения с акцентом на данные машинного обучения и геоданные. Там много данных большого объёма, в сотни гигабайт, преимущественно в форматах Parquet.

При этому внутри он устроен достаточно просто, это файловый навигатор по S3 хранилищу и описание в виде Markdown файла README.md которое и отображает как карточка продукта. Описание может быть как очень коротким так и весьма подробным со схемами данных, примерами кода, областями покрытия. Все отдано на откуп куратору дата продукта, а, поскольку курируют они сами, то и описано чаще хорошо чем плохо.

Главный минус такого подхода в том что доступ к данным не универсален. Каждый продукт имеет свою структуру файлов, свои примеры кода и тд. Чтобы подключиться к ним надо прочитать документацию, разобраться и тд.

Главный плюс в том что там хранятся данные большого объема, некоторые коллекции геоданных достигают сотен терабайт и в том что документацию всё равно читать надо.

Мне их каталог более всего напоминает бывший Quilt Data, а теперь Quilt.Bio которые тоже делали платформу для больших научных дата продуктов и тоже поверх S3 и с акцентом на документацию.

Тут важно, конечно, то что Source Cooperative - это инициатива Radiant Earth, НКО в области геоданных и их дата продукты ориентированы на некоммерческое использование и сама их платформа для публикации данных бесплатна. Поэтому их подход к дата продуктам скорее можно описать как то что они пытаются перенести практики создания коммерческих дата продуктов в некоммерческий сектор, пытаясь привести открытые данные в современный и более удобоваримый формат.

#opendata #datacatalogs #datasets #geodata
👍4
В рубрике закрытых открытых данных в России портал открытых данных города Твери opendata.tver.ru недоступен и теперь перенаправляет на сайт администрации города www.tver.ru в последний раз сайт наблюдался в Интернет архиве в октябре 2024 года.

Портал данных города Перми opendata.gorodperm.ru содержит всего два набора данных "Режим работы" и "Телефонный справочник", бессмысленные для любой работы.

Портал данных Иркутска opendata.admirk.ru содержит лишь один набор данных "Структура аппарата администрации города Иркутска".

Это к вопросу о том почему многочисленные российские "порталы открытых данных" регионов и муниципалитетов бессмысленно добавлять в поисковые индексы или реестры каталогов данных. Они пустые или бессмысленные или уже не существуют.

#opendata #russia #datacatalogs
😢41
В рубрике как это устроено у них AIKosh индийский государственный портал данных для ИИ. Включает 15200+ наборов данных, пакет aikosh для Python для работы с порталом, оценку качества каждого набора данных, четкие условия использования (в основном CC-BY-NC-SA) и так далее.

Доступ к данным дают только после регистрации. Также предоставляют инфраструктуру для работы с данными в разделе Notebook и так далее.

#opendata #ai #india #datacatalogs #datasets
🔥31🏆1
Ещё одно наблюдение, то что с развитием ИИ агентов появилось множество порталов показывающих национальную и международную статистику наглядно, вот, например, такой по Монголии data.mn. Они все используют официальную статистику с сайтов нац. стат. служб и из баз данных межгосударственных структур. И вот таких порталов я видел уже штук 7 за неделю и несколько глобальных, охватывающих все страны.

В чем их особенности:
- как правило это one-man-project, делаются они одним человеком с помощью Claude / Cursor / Copilot / ChatGPT и далее по списку
- большая часть делается просто для портфолио, без бизнес модели. Исключения в тех что пытаются "засрать поисковую выдачу" с акцентом на SEO. В их бизнес модель я не верю.
- всегда акцент на визуализации, то что национальные статслужбы не умеют
- но про пользователей их создатели понимают редко, частотные (часто обновляемые) показатели у них есть редко.

Когда-то много таких проектов делала команда DataWheel (DataUSA, DataSaudi и др.), но там был явно не один человек, больше акцент на визуализации и работа всегда под клиентов.

Вот эти новые проекты пока до их уровня не дотягивают, но это скорее вопрос понимания природы данных и пользователей у их создателей, чем техническая невозможность.

#opendata #datasets #datacatalogs #datavis #statistics
34🔥31
Научные данные России: с чего начинать

Земля, океан, климат

ЕСИМО
 — http://esimo.ru
 Тема: океан, метеорология, гидрология.
 Ценность: единая государственная система Росгидромета об обстановке в Мировом океане — официальный контур морских и гидрометеоданных, а не институтский архив.

Всемирный центр данных по метеорологии (Обнинск) — http://meteo.ru/mcd/ewdcmet.html
 Тема: метеорология.
 Ценность: российский узел сети World Data Centres: сбор и распространение метеоданных внутри страны и в международном обмене (ВНИИГМИ–МЦД).

Всемирный центр радиационных данных (WRDC) — http://wrdc.mgo.rssi.ru/
 Тема: климат, солнечная радиация.
 Ценность: один из шести мировых центров программы GAW ВМО; архив актинометрических наблюдений ГГО им. Воейкова.

Всемирный центр данных по солнечно-земной физике (Москва) — http://www.wdcb.ru/stp/index.en.html
 Тема: геофизика, космос.
 Ценность: архив наблюдений солнечно-земной физики Геофизического центра РАН.

Геомагнитный центр ГЦ РАН — https://geomag.gcras.ru/
 Тема: геомагнетизм.
 Ценность: данные обсерваторий INTERMAGNET по России и ближнему зарубежью, плюс спутниковые продукты (система MAGNUS).

Астрономия и физика

Центр астрономических данных ИНАСАН — https://www.inasan.ru/en/divisions/dpss/cad/
 Тема: астрономия.
 Ценность: с 1980 года российский филиал CDS Strasbourg; каталоги звёзд, переменных и двойных систем для отечественной астрономии.

SPECTR-W3 — http://spectr-w3.snz.ru/index.phtml
 Тема: атомная спектроскопия, физика плазмы.
 Ценность: одна из крупнейших баз по спектрам атомов и высокозарядных ионов (РФЯЦ–ВНИИТФ): уровни, линии, вероятности переходов, сечения.

Биоразнообразие и коллекции

Российский GBIF IPT — http://gbif.ru:8080/ipt/
 Тема: биоразнообразие.
 Ценность: национальный узел публикации occurrence-данных в GBIF (ИМПБ РАН / ИПМ им. Келдыша).

«Ноев ковчег», МГУ — https://depo.msu.ru/ipt/
 Тема: живые системы, биоматериалы.
 Ценность: депозитарий МГУ — от молекул до организмов; наборы публикуются в GBIF.

IPT ЗИН РАН и БИН РАН — https://ipt.zin.ru
 Тема: зоология и ботаника.
 Ценность: данные крупнейших академических коллекций — Зоологического и Ботанического институтов РАН.

IPT Института океанологии им. Ширшова — https://gbif.ocean.ru/ipt/
 Тема: морская биология.
 Ценность: встречи, плотность и биомасса видов с экспедиций ИО РАН.

Молекулярная биология (российские базы мирового уровня)

CSDB — https://csdb.glycoscience.ru/database/
 Тема: гликомика.
 Ценность: курируемая база природных углеводных структур с таксономией, литературой и ЯМР (ИОХ РАН).

GTRD — https://gtrd.biouml.org/
 Тема: регуляция транскрипции.
 Ценность: сайты связывания транскрипционных факторов по ChIP-seq для человека и мыши.

HOCOMOCO — https://hocomoco11.autosome.org/
 Тема: геномика, мотивы ДНК.
 Ценность: модели связывания 680 человеческих и 453 мышиных транскрипционных факторов (PWM по ChIP-seq из GTRD).

VDJdb — https://vdjdb.com/
 Тема: иммунология, TCR.
 Ценность: курируемая база Т-клеточных рецепторов с известной антигенной специфичностью (ИБХ РАН).

EpiFactors — https://epifactors.autosome.org/
 Тема: эпигенетика.
 Ценность: белки и комплексы эпигенетической регуляции плюс экспрессия в клетках, раковых линиях и тканях (МФТИ).

Медицина и ML

MosMedData — https://mosmed.ai/datasets
 Тема: медицинская визуализация.
 Ценность: открытые КТ-наборы (в т.ч. COVID-19) Центра диагностики и телемедицины ДЗМ — готовые датасеты для обучения моделей.

Medical Data Hub — https://medicaldatahub.ru/datasets/
 Тема: медицинские датасеты для ML.
 Ценность: каталог медицинских наборов под машинное обучение.

Гуманитаристика, соцнауки, вузы

Dataverse Пушкинского Дома — https://dataverse.pushdom.ru
 Тема: русская литература и фольклор.
 Ценность: открытые исследовательские данные ИРЛИ РАН с DOI.

Репозиторий психологических данных — https://ruspsydata.figshare.com
 Тема: психология.
 Ценность: данные и инструменты исследований МГППУ.

DSpace СПбГУ — https://dspace.spbu.ru
 Тема: университетский репозиторий.
 Ценность: публикации, диссертации и датасеты сообщества СПбГУ (есть API DSpace 7).

#opendata #datasets #russia #researchdata
🔥10👏642❤‍🔥1
Очередное обновление реестра каталогов данных Dateno, теперь достигнута планка в 25 тысяч каталогов данных большая часть которых - это порталы геоданных и геопорталы, далее репозитории научных данных и далее уже порталы открытых данных.

Основные обновления касались добавления огромного числа репозиториев научных данных и порталов научных данных, сложность с ними всегда была в том что часто это институциональные репозитории в которых могут быть, а могут и не быть наборы данных. И вот отсев вторых от первых и требовал много времени. Теперь он завершился и в реестре в общей сложности 6299 каталога научных данных в том числе по неохваченным ранее развивающимся странам.

Тут я напомню что число каталогов данных в разбивке по типу ПО, типу каталога, странам и тд. - это не показатель объёмов набора данных, это показатель системности того как в стране с данными работают. Обычно это коррелирует с числом датасетов, но это не 100% корреляция.

Например, по России есть 291 каталог с данными, почти как в Швеции где их 303. А более всего их в США, Германии и Франции, что тоже логично.

В целом там прямые корреляции с вхождением стран в G7 / ОСЭР / G20. Что тоже логично.

#opendata #datacatalogs #data
👍51
Я сегодня доделал очередной большой апдейт реестра каталогов данных Dateno, там теперь 29 816 каталогов данных. Это уже больше чем вдвое того что было месяц назад - 14 436.

Подавляющее число новых каталогов данных за этот месяц и в последней сборке тоже - это геопорталы, научные репозитории данных и порталы статистики и индикаторов.

Причем теперь уже с весьма широким охватом региональных и муниципальных источников данных.

На эту тему у меня, как всегда, накопилось множество наблюдений, часть которых стоит записать.

Геоданные:
1. Геопорталов в мире сильно больше чем порталов открытых данных. Они бывают более данные-ориентированные вроде Geonetwork или Geonode, бывают более про API - ArcGIS Server, а бывает большое разнообразие интерфейсов где если и есть API то недокументированное.
2. Количественно геоданных в мире более всего, качественно (по объему) только если учитывать спутниковые снимки.
3. Esri - это абсолютная доминанта внедрений геопроектов в мире, повсеместно, либо ArcGIS Server, либо ArcGIS Hub. Open source стек вроде Geoserver и др. встречается существенно реже.
4. Много региональных/локальных геовендоров с внедрениями в 5-6 муниципалитетах. Наверное во всех странах высокого и среднего достатка такие есть.

Статистика:
5. Стандартизация в статистике сразу заканчивается после национальных агентств и международных структур. За их пределами нет не то что SDMX, но и облегченных вроде JSON Stat (за редким исключением).
6. SDMX оказался очень тяжелым при внедрении стандартом, есть всего 3 активно внедряемых серверных продукта и много вопросов с тем можно ли их внедрять без найма консультантов.
7. Вся самая интересная статистика и индикаторы за пределами национальных статслужб, там крайне редко есть еженедельные или ежесуточные показатели. Сбор интересного статистического дашборда - это всегда трудоемкая задача по поиску данных, и чаще они не на порталах данных

#opendata #datacatalogs #datasets #thoughts
👍321🔥1