И чтобы не потерять мысль, в продолжение предыдущих размышлений про дата продукты.
Существующие каталоги данных хотя и движутся в направлении описания дата продуктов, но, по своей сути, до сих пор являются именно каталогами данных/датасетов. Единицами измерения там являются наборы данных и приложенные к ним ресурсы (файлы и ссылки). Они ориентированны на массовую одноразовую публикацию и, если посмотреть на существующие наиболее известные порталы открытых данных то там обновляется регулярно, в лучшем случае, 5% опубликованного, а в худшем не обновляются данные совсем.
Пользователи там вторичны, документация если не минимальна, но ограничена и примеры использования присутствуют довольно редко.
Подчеркну что так не всегда, но значительно чаще чем хотелось бы. Каталоги именно дата продуктов характерны скорее для коммерческих данных предоставляемых большими датасетами или API и для данных ориентированных на узко профессиональное использование, например, геномных данных и иных данных в биоинформатике.
К каталогам дата продуктов ближе каталоги данных на базе Huwise (бывший OpenDataSoft) и значительно дальше каталоги датасетов на базе CKAN, DKAN, GeoNode, Geonetwork и так далее.
В моём понимании каталоги дата продуктов содержат гораздо меньше учетных единиц которыми дата продукты и являются и которые могут иметь множество форм доступа: API, срезы файлов, прямой доступ к СУБД через SQL, возможность получения в виде массовой выгрузки и так далее.
Эти доступы могут быть как полностью открытыми, так и доступными после авторизации, аккредитации, по запросу. Могут быть бесплатными, могут содержать тарификацию. Могут включать ограничения на объёмы скачиваемых данных и разные формы доступа для разных категорий пользователей/тарифов.
Дата продуктов довольно много и они весьма вариативны. Многие государственные реестры ведутся как дата продукты, их создатели хорошо понимают пользователей и дают API и файлы данных, документируют их в меру своего понимания. Коммерческие API к данным ещё более распространены и гораздо чаще включаются удобную документацию для разработчиков. Можно ли их все привести к одной спецификации? Есть стандарт ODPS который, может быть, приближается к этому, но он ИМХО не универсален.
Но главные ограничения в том что в отличие от публикации файлов в режиме "опубликуй и забудь", продуктовый подход требует изменения процессов и наличия кураторов данных, а это гораздо сложнее, это требует усилий от владельца данных. Поэтому дата продукты гораздо чаще присутствуют там где есть монетизация данных и гораздо меньше там где её нет.
#data #dataproducts #thoughts
Существующие каталоги данных хотя и движутся в направлении описания дата продуктов, но, по своей сути, до сих пор являются именно каталогами данных/датасетов. Единицами измерения там являются наборы данных и приложенные к ним ресурсы (файлы и ссылки). Они ориентированны на массовую одноразовую публикацию и, если посмотреть на существующие наиболее известные порталы открытых данных то там обновляется регулярно, в лучшем случае, 5% опубликованного, а в худшем не обновляются данные совсем.
Пользователи там вторичны, документация если не минимальна, но ограничена и примеры использования присутствуют довольно редко.
Подчеркну что так не всегда, но значительно чаще чем хотелось бы. Каталоги именно дата продуктов характерны скорее для коммерческих данных предоставляемых большими датасетами или API и для данных ориентированных на узко профессиональное использование, например, геномных данных и иных данных в биоинформатике.
К каталогам дата продуктов ближе каталоги данных на базе Huwise (бывший OpenDataSoft) и значительно дальше каталоги датасетов на базе CKAN, DKAN, GeoNode, Geonetwork и так далее.
В моём понимании каталоги дата продуктов содержат гораздо меньше учетных единиц которыми дата продукты и являются и которые могут иметь множество форм доступа: API, срезы файлов, прямой доступ к СУБД через SQL, возможность получения в виде массовой выгрузки и так далее.
Эти доступы могут быть как полностью открытыми, так и доступными после авторизации, аккредитации, по запросу. Могут быть бесплатными, могут содержать тарификацию. Могут включать ограничения на объёмы скачиваемых данных и разные формы доступа для разных категорий пользователей/тарифов.
Дата продуктов довольно много и они весьма вариативны. Многие государственные реестры ведутся как дата продукты, их создатели хорошо понимают пользователей и дают API и файлы данных, документируют их в меру своего понимания. Коммерческие API к данным ещё более распространены и гораздо чаще включаются удобную документацию для разработчиков. Можно ли их все привести к одной спецификации? Есть стандарт ODPS который, может быть, приближается к этому, но он ИМХО не универсален.
Но главные ограничения в том что в отличие от публикации файлов в режиме "опубликуй и забудь", продуктовый подход требует изменения процессов и наличия кураторов данных, а это гораздо сложнее, это требует усилий от владельца данных. Поэтому дата продукты гораздо чаще присутствуют там где есть монетизация данных и гораздо меньше там где её нет.
#data #dataproducts #thoughts
Telegram
Ivan Begtin
Я тут на днях читаю внутреннюю лекцию про дата продукты и задумался о том как наилучшим образом описать отличие дата продукта от просто опубликованных данных, API и так далее. Какое ключевое отличие отличающее именно дата продукты?
В итоге пришел к выводу…
В итоге пришел к выводу…
🔥7⚡5✍3
Я как-то уже писал что практически ушел из большей части соцсетей и главная причина в том что так или иначе они превратились в потоки спама, нерелевантного контента, "заманух" в виде лент для бесконечного скроллинга и так далее. Это касается и российских VK, OK и международных Facebook'а, X, Instagram'а и тд. Есть ощущение что они все сильно испортились за последние годы. И чуть ли не единственная оставшаяся с адекватным профессиональным контентом - это LinkedIn. У нее есть та особенность что в ленту тебе подмешивается то о чем ты пишешь. Например, пишу я про data engineering и в suggested постах почти всё про дата инженерию. Пишу про открытый код и вижу посты про открытый код. А недавно я туда же закинул свои размышления про PDF формат, то же о чем писал тут и теперь почти все посты которые suggested подмешаны в ленту посвящены разным аспектам работы с PDF. Логика их рекомендационного сервиса вполне поддается объяснениям и хорошо что она такая, а не как у Facebook'а через подмешивание бесконечного числа нерелевантного контента.
Другое размышление вслух в том как влияет на поток спама публичная активность. Например, у меня есть ненулевое число открытых репозиториев кода и это дает возможность измерения активности. Есть целый подвид ИТ спамеров которые пишут массовые рассылки используя именно ее.
Например:
- мы запустили новый продукт и видим что у Вас в интересах есть похожие на него. Сходите посмотрите на мой
- мы организуем конкурс/хакатон в Вашем регионе, не хотите ли в нем поучаствовать?
- я работаю в бигтехе и я ищу кого-то кто работал бы за меня кому я буду пересылать свои задачи (не такими словами, но смысл очевиден из писем)
Еще одна проблема в Github'е в спаме в issues и в PR, причем вычищать его оттуда и репортить проще не становится. В этом смысле Github вообще плохо приспособлен к репортам спама и злонамеренных действий. Хуже чем можно было бы ожидать во всяком случае.
Все это о том что социальная жизнь в сети и потребление контента и публичная активность не то чтобы упрощаются, и из-за платформ соцсетей, и спамеров. Поэтому лично я сейчас до 70% то что я читаю делаю это через подписки на рассылки и заранее составленные и обновляемые списки чтения.
#thoughts
Другое размышление вслух в том как влияет на поток спама публичная активность. Например, у меня есть ненулевое число открытых репозиториев кода и это дает возможность измерения активности. Есть целый подвид ИТ спамеров которые пишут массовые рассылки используя именно ее.
Например:
- мы запустили новый продукт и видим что у Вас в интересах есть похожие на него. Сходите посмотрите на мой
- мы организуем конкурс/хакатон в Вашем регионе, не хотите ли в нем поучаствовать?
- я работаю в бигтехе и я ищу кого-то кто работал бы за меня кому я буду пересылать свои задачи (не такими словами, но смысл очевиден из писем)
Еще одна проблема в Github'е в спаме в issues и в PR, причем вычищать его оттуда и репортить проще не становится. В этом смысле Github вообще плохо приспособлен к репортам спама и злонамеренных действий. Хуже чем можно было бы ожидать во всяком случае.
Все это о том что социальная жизнь в сети и потребление контента и публичная активность не то чтобы упрощаются, и из-за платформ соцсетей, и спамеров. Поэтому лично я сейчас до 70% то что я читаю делаю это через подписки на рассылки и заранее составленные и обновляемые списки чтения.
#thoughts
👍20❤5🔥3💯1
Новая версия 1.7.0 утилиты undatum для обработки данных с командной строки включая поддержку форматов данных с вложенными структурами такие как JSONL (NDJSON), Parquet, Avro и более 140 других.
Ключевые изменения:
- появился текстовый интерфейс TUI для интерактивной работы с данными. Вызывается как undatum tui <название файла>
- появился веб интерфейс для для просмотра данных. Пока незавершенный, в экспериментальном режиме. Вызывается как undatum web <название файла>
- убраны опции запросов к данным через язык MistQL, вместо него можно использовать синтаксис SQL от DuckDB
- большая синхронизация с опциями и функциями библиотеки iterabledata, в первую очередь в части развертывания вложенных структур, например, для обращения к данным как capital_city.lat где lat - это вложенное поле в структуре capital_city
- множество изменений поменьше
#opensource #datatools #data #dataengineering
Ключевые изменения:
- появился текстовый интерфейс TUI для интерактивной работы с данными. Вызывается как undatum tui <название файла>
- появился веб интерфейс для для просмотра данных. Пока незавершенный, в экспериментальном режиме. Вызывается как undatum web <название файла>
- убраны опции запросов к данным через язык MistQL, вместо него можно использовать синтаксис SQL от DuckDB
- большая синхронизация с опциями и функциями библиотеки iterabledata, в первую очередь в части развертывания вложенных структур, например, для обращения к данным как capital_city.lat где lat - это вложенное поле в структуре capital_city
- множество изменений поменьше
#opensource #datatools #data #dataengineering
🔥8✍4👍4👏1
Полезное чтение про данные, технологии и не только:
- How AI is breaking the British state статья в The Economist о том что граждане в Великобритании начали массово использовать ИИ агенты для подачи жалоб и аппеляций, так что скоро суды будут перегружены если не уже. И о том что эта ситуация грозит повториться во всех богатых демократиях где у граждан есть многие права и теперь ИИ заменяет юристов которые подавали такие жалобы. Статья за пэйволом, вот тут можно почитать ее краткое изложение
- Reimagining Development Data каталог каталогов (data inventory) наиболее значимых баз по тематике международного развития. Полезно для тех кто интересуется темой и мне для пополнения реестра каталогов данных Dateno
- The Prediction Revolution книга от Grace Huckins о том как ИИ дает возможности предсказывать то что ранее предсказывать было невозможно.
#ai #opendata
- How AI is breaking the British state статья в The Economist о том что граждане в Великобритании начали массово использовать ИИ агенты для подачи жалоб и аппеляций, так что скоро суды будут перегружены если не уже. И о том что эта ситуация грозит повториться во всех богатых демократиях где у граждан есть многие права и теперь ИИ заменяет юристов которые подавали такие жалобы. Статья за пэйволом, вот тут можно почитать ее краткое изложение
- Reimagining Development Data каталог каталогов (data inventory) наиболее значимых баз по тематике международного развития. Полезно для тех кто интересуется темой и мне для пополнения реестра каталогов данных Dateno
- The Prediction Revolution книга от Grace Huckins о том как ИИ дает возможности предсказывать то что ранее предсказывать было невозможно.
#ai #opendata
The Economist
How AI is breaking the British state
Equipped with models and agents, citizens could bring government to a halt
🔥8✍4💯1
Сжатие файлов в общем случае и сжатие данных в частном очень частая тема когда вопрос касается их хранения и обработки. Сколько раз приходится сталкиваться с тем что использование тех или иных цифровых материалов усложнено, или отсутствием такового сжатия, или его недостаточным применением. Применение сжатие, как и использование специальных форматов распространения данных это ещё и одна из характеристик дата продуктов когда данные большого объёма не только их хранение, но и передача имеют существенное значение.
1. Наиболее актуальная практика сжатия файлов с данными сейчас - это применение Zstandard (расширение .zst). Большая часть современных инструментов обработки данных и их анализа, умеют с ними работать. К примеру, они естественным образом читаются с помощью DuckDB, Polars или Pandas. Да и другие инструменты работающие с дата фреймами их поддерживают.
2. Но большая часть - это далеко не все, к примеру, табличные редакторы вроде Excel или BI системы сжатые файлы не поддерживают, за исключением разве что Parquet, который, впрочем, тоже поддерживают не все.
3. Parquet - это другой важный формат распространения данных, он не только поддерживает разные кодеки сжатия данных, но и даёт лучшее сжатие за счет применения компрессии к колонкам. Распространять данные в виде Parquet файлов с внутренним сжатием - это хорошая практика и один из признаков что те кто данные распространяют ориентируются на профессиональную аудиторию и сами с данными работать умеют.
4. Один из худших форматов для распространения данных - это большие XML дампы, которые даже если сжатые требуют специальных усилий чтобы не считывать весь файл в оперативную память. К примеру, Фонд Викимедия (Википедия и тд.) распространяет дампы википедий в виде больших сжатых XML и для обработки их нужны SAX парсеры. Впрочем там уже есть экосистема инструментов которая эту проблема успешно решает.
5. Есть множество старых дата продуктов в которых до сих пор используются сжатие GZip, Bzip2 и тд. по принципу сохранения совместимости и потому что "тут так сложилось". Тем не менее это могут быть хорошие дата продукты
6. Но самый распространный формат распространения данных - это, конечно, ZIP файлы. Например, нарезая данные из базы данных на сотни ZIP файлов в которых сотни/тысячи XML или CSV файлов и, иногда, заодно и документация и сопроводительные материалы. Внутри они могут быть очень по разному устроены.
7. В разное время появлялись стандарты описания пакетов с данными. BagIt, Frictionless Data Package, DataCrate, Research Objects, ReproZip. У них у всех есть свои ограничения и свое применение. Главный недостаток - неадаптированность к облачному хранению, невозможность работать с частью пакета данных не скачивая его контейнер целиком.
8. Некоторые большие наборы данных/базы данных/дата продукты их владельцы распространяют вообще через такие инструменты как rsync (open-source ПО для синхронизации данных между серверами) и тогда сжатие обеспечивается на этапе передачи данных даже если оригинальные файлы не сжаты. Особенно часто такое бывает в астрофизике, сейсмологии, биоинформатике и тд. Естественных науках где есть организации предоставляющие профессиональные data services по синхронизации больших баз данных.
#opendata #compression #data #thoughts
1. Наиболее актуальная практика сжатия файлов с данными сейчас - это применение Zstandard (расширение .zst). Большая часть современных инструментов обработки данных и их анализа, умеют с ними работать. К примеру, они естественным образом читаются с помощью DuckDB, Polars или Pandas. Да и другие инструменты работающие с дата фреймами их поддерживают.
2. Но большая часть - это далеко не все, к примеру, табличные редакторы вроде Excel или BI системы сжатые файлы не поддерживают, за исключением разве что Parquet, который, впрочем, тоже поддерживают не все.
3. Parquet - это другой важный формат распространения данных, он не только поддерживает разные кодеки сжатия данных, но и даёт лучшее сжатие за счет применения компрессии к колонкам. Распространять данные в виде Parquet файлов с внутренним сжатием - это хорошая практика и один из признаков что те кто данные распространяют ориентируются на профессиональную аудиторию и сами с данными работать умеют.
4. Один из худших форматов для распространения данных - это большие XML дампы, которые даже если сжатые требуют специальных усилий чтобы не считывать весь файл в оперативную память. К примеру, Фонд Викимедия (Википедия и тд.) распространяет дампы википедий в виде больших сжатых XML и для обработки их нужны SAX парсеры. Впрочем там уже есть экосистема инструментов которая эту проблема успешно решает.
5. Есть множество старых дата продуктов в которых до сих пор используются сжатие GZip, Bzip2 и тд. по принципу сохранения совместимости и потому что "тут так сложилось". Тем не менее это могут быть хорошие дата продукты
6. Но самый распространный формат распространения данных - это, конечно, ZIP файлы. Например, нарезая данные из базы данных на сотни ZIP файлов в которых сотни/тысячи XML или CSV файлов и, иногда, заодно и документация и сопроводительные материалы. Внутри они могут быть очень по разному устроены.
7. В разное время появлялись стандарты описания пакетов с данными. BagIt, Frictionless Data Package, DataCrate, Research Objects, ReproZip. У них у всех есть свои ограничения и свое применение. Главный недостаток - неадаптированность к облачному хранению, невозможность работать с частью пакета данных не скачивая его контейнер целиком.
8. Некоторые большие наборы данных/базы данных/дата продукты их владельцы распространяют вообще через такие инструменты как rsync (open-source ПО для синхронизации данных между серверами) и тогда сжатие обеспечивается на этапе передачи данных даже если оригинальные файлы не сжаты. Особенно часто такое бывает в астрофизике, сейсмологии, биоинформатике и тд. Естественных науках где есть организации предоставляющие профессиональные data services по синхронизации больших баз данных.
#opendata #compression #data #thoughts
👍10🔥5🌚2🤔1
В Reuters статья о том что Госдепартамент США потребовал у стран определиться в какой из глобальных ИИ инициатив они участвуют - в Pax Silica или WAICO. Я чуть менее месяца назад писал об этом же, что эти две инициативы словно создают новых двух полярный мир и единственная страна которая сейчас пытается усидеть на двух стульях - это Казахстан, но думаю что тут США надавят. Интересно уже даже появится ли на фоне этого своеобразное движение цифрового неприсоединения, участники которого будут де-факто отказываться от участия в обеих этих инициативах? В любом случае чем дальше тем больше вокруг ИИ будет завязано геополитики и страсти накаляться по мере применения основанных на них инструментов в военных целях, кибербезопасности, террористами и так далее.
#ai #geopolitics #usa #china
#ai #geopolitics #usa #china
Telegram
Ivan Begtin
Pax Silica vs WAICO
Читаю про WAICO свежесозданный альянс по кооперации 29 стран по поводу ИИ где участвует и Россия все страны Центрально Азии кроме Туркменистана, и многие другие развивающиеся страны Глобального Юга. Ведущая роль там безусловно у Китая…
Читаю про WAICO свежесозданный альянс по кооперации 29 стран по поводу ИИ где участвует и Россия все страны Центрально Азии кроме Туркменистана, и многие другие развивающиеся страны Глобального Юга. Ведущая роль там безусловно у Китая…
👍5🕊5🗿4🤣2
В рубрике как это устроено у них Национальный портал открытых данных Пакистана nodp.gov.pk. Называется громко, а по факту это портал со статистикой, причем не для выгрузки, а в виде дашбордов в Superset выставленных онлайн. Данные из дашбордов можно, конечно, скачать в CSV или XLS, но это не отменяет того что это портал с дашбордами и название де-факто не соответствует содержанию. Зато хорошо иллюстрирует мои рассуждения про дата продукты и про то что ими является и что нет. Вот тут дата продуктов не то чтобы нет, нет даже намека на них. Для развивающихся стран это частая история когда делают портал с небольшим числом статистических показателей и называют его порталом открытых данных.
#opendata #statistics #pakistan #datacatalogs
#opendata #statistics #pakistan #datacatalogs
👍5🔥5✍1
В мире есть всего 3 страны в которых нет ни одного портала данных - это Северная Корея, Сент-Китс и Невис и Гренада. Это не значит что никаких данных о них нет, есть данные межгосударственных структур которые собирают данные по всем странам, но вот конкретно в этих случаях сами страны публикуют информацию очень скудно. В этом списке мог бы быть Туркменистан, но там есть хотя бы портал показателей устойчивого развития sdg.stat.gov.tm в остальном же тоже все очень скудно.
У 43 стран нет национальных каталогов статистических индикаторов. Не сайтов статслужб с публикациями в PDF/Excel, а именно каталогов с индикаторами/временными рядами. Большая часть этих стран - это малые страны Карибского моря, Океании и другие беднейшие страны. Что характерно почти у всех стран Африки есть порталы статпоказателей в рамках проекта Африканского банка развития.
У 82 стран нет национальных порталов открытых данных, из европейских стран это только Андорра, Сан Марино и Беларусь. У большей части стран Океании и Африки также нет национальных порталов открытых данных. В ряде стран вроде Пакистана то что официально так называется де-факто этим не является.
Всё это цифры на основе последнего релиза dataportals-registry реестра каталогов данных Dateno. Там был добавлено 92 новых каталога данных и обновлены метаданные существующих. Например, национальные порталы открытых данных в этом году появились у таких стран как:
- Бутан - data.gov.bt
- Иордания - opendata.gov.jo
- Камбоджа - data.mef.gov.kh
- Лихтенштейн - opendata.li
- Монако - data.gouvernement.mc
- Оман opendata.gov.om
#opendata #datacatalogs #data
У 43 стран нет национальных каталогов статистических индикаторов. Не сайтов статслужб с публикациями в PDF/Excel, а именно каталогов с индикаторами/временными рядами. Большая часть этих стран - это малые страны Карибского моря, Океании и другие беднейшие страны. Что характерно почти у всех стран Африки есть порталы статпоказателей в рамках проекта Африканского банка развития.
У 82 стран нет национальных порталов открытых данных, из европейских стран это только Андорра, Сан Марино и Беларусь. У большей части стран Океании и Африки также нет национальных порталов открытых данных. В ряде стран вроде Пакистана то что официально так называется де-факто этим не является.
Всё это цифры на основе последнего релиза dataportals-registry реестра каталогов данных Dateno. Там был добавлено 92 новых каталога данных и обновлены метаданные существующих. Например, национальные порталы открытых данных в этом году появились у таких стран как:
- Бутан - data.gov.bt
- Иордания - opendata.gov.jo
- Камбоджа - data.mef.gov.kh
- Лихтенштейн - opendata.li
- Монако - data.gouvernement.mc
- Оман opendata.gov.om
#opendata #datacatalogs #data
GitHub
GitHub - datenoio/dataportals-registry: Registry of data portals, catalogs, data repositories including data catalogs dataset and…
Registry of data portals, catalogs, data repositories including data catalogs dataset and catalog description standard - datenoio/dataportals-registry
1✍7❤5❤🔥1
В продолжение про обновление реестра каталогов данных Dateno, поделюсь ещё наблюдением то что модели внутри Cursor'а и выполнение задач агентами стало, в некоторых задачах, сравнимо с внешними аналитическими ИИ агентами вроде Manus'а. Например, в рамках ведения этого реестра самая сложная часть - это поиск новых каталогов данных. В какой-то момент все "низковисвящие фрукты" сорваны и надо целенаправленно искать новые каталоги данных чтобы их добавлять. А можно было отправить задачу в тот же Manus или другие размышляющие ИИ агенты с deep research и wide research в стиле "Найди мне дата каталоги по такой-то стране/такой-то тематике" и далее найденное уже добавлять в реестр.
Сейчас ИИ агенты для кодинга справляются с этой задачей если не лучше, то сравнимо. Поиск отсутствующих дата порталов по странам и по предметным областям приводит к формированию краткого отчета в котором практически всегда есть упущенные ранее каталоги данных.
Это хорошее открытие, позволяющее из интерфейса того же Cursor'а искать новые каталоги данных и меньше использовать внешние сервисы, у которых меньше контекста. Скорее всего благодаря этому я довольно скоро существенно обновлю реестр каталогов данных по многим странам.
#opendata #datacatalogs
Сейчас ИИ агенты для кодинга справляются с этой задачей если не лучше, то сравнимо. Поиск отсутствующих дата порталов по странам и по предметным областям приводит к формированию краткого отчета в котором практически всегда есть упущенные ранее каталоги данных.
Это хорошее открытие, позволяющее из интерфейса того же Cursor'а искать новые каталоги данных и меньше использовать внешние сервисы, у которых меньше контекста. Скорее всего благодаря этому я довольно скоро существенно обновлю реестр каталогов данных по многим странам.
#opendata #datacatalogs
👍5🤩1💯1
Новый бенчмарк DataBench LLM для аналитичекской работы с данными от Hex. Вот тут они подробно рассказывают про то как он работает. Ожидаемо хорошие результаты у Fable 5, и самые дорогие, конечно же, по стоимости. Сравнивают, в основном, модели из США от OpenAI и Anthropic. Из китайских там только Kimi 2.7, хотя уже вышла Kimi K3, хотелось бы посмотреть сравнение с ней, и с GLM-5.3
#data #aiagents
#data #aiagents
👍4✍2🔥2🏆2❤1
Как я и писал ранее удалось сильно улучшить обнаружение каталогов данных и вышла новая версия реестра каталогов данных. В нее вошло:
- плюс 1748 новых каталогов данных, это более 12% от общего числа, иначе говоря очень много. Среди добавленных каталогов много геопорталов, инсталляций CKAN в Индонезии и Таиланде, китайских порталов научных данных, порталов данных по биоразнообразию, порталов микроданных переписей и так далее.
- 12 новых типов программных продуктов на которых делаются каталоги данных: oportal, piveau, knoema, redatam, datafair и другие
- исправления и улучшения в метаданных существующих описания каталогов данных
Из явных находок:
- картографический сервис ewmapa в Польше на базе которого есть сайты для всех муниципалитетов
- шведская специфика, почти все порталы открытых данных на базе их местного продукта EntryScape
- китайские научные порталы данных почти все работают на базе Instdb, ПО Китайской Академии Наук, их много прибавилось
- NextGIS Web массово используется по всему миру, много инсталляций за пределами РФ добавилось в реестр
- оказывается data.europa.eu создан на базе open source каталога данных Piveau, я все это время думал что там своя разработка
И еще немного цифр:
- 5,906 всех каталогов данных в Европе - это 36.3% от общего числа
- 4,619 всех каталогов данных в США - это 28.4% от общего числа
В Европе страна с наибольшим числом каталогов данных Франция - 801
В США более всего каталогов данных находится в Калифорнии - 481
Подробнее в CHANGELOG, код и данные в репозитории
#opendata #datacatalogs
- плюс 1748 новых каталогов данных, это более 12% от общего числа, иначе говоря очень много. Среди добавленных каталогов много геопорталов, инсталляций CKAN в Индонезии и Таиланде, китайских порталов научных данных, порталов данных по биоразнообразию, порталов микроданных переписей и так далее.
- 12 новых типов программных продуктов на которых делаются каталоги данных: oportal, piveau, knoema, redatam, datafair и другие
- исправления и улучшения в метаданных существующих описания каталогов данных
Из явных находок:
- картографический сервис ewmapa в Польше на базе которого есть сайты для всех муниципалитетов
- шведская специфика, почти все порталы открытых данных на базе их местного продукта EntryScape
- китайские научные порталы данных почти все работают на базе Instdb, ПО Китайской Академии Наук, их много прибавилось
- NextGIS Web массово используется по всему миру, много инсталляций за пределами РФ добавилось в реестр
- оказывается data.europa.eu создан на базе open source каталога данных Piveau, я все это время думал что там своя разработка
И еще немного цифр:
- 5,906 всех каталогов данных в Европе - это 36.3% от общего числа
- 4,619 всех каталогов данных в США - это 28.4% от общего числа
В Европе страна с наибольшим числом каталогов данных Франция - 801
В США более всего каталогов данных находится в Калифорнии - 481
Подробнее в CHANGELOG, код и данные в репозитории
#opendata #datacatalogs
Telegram
Ivan Begtin
В продолжение про обновление реестра каталогов данных Dateno, поделюсь ещё наблюдением то что модели внутри Cursor'а и выполнение задач агентами стало, в некоторых задачах, сравнимо с внешними аналитическими ИИ агентами вроде Manus'а. Например, в рамках ведения…
✍4❤2👍1💯1
Полезные ссылки про данные, технологии и не только:
- ClickBench playground рассказ о том как устроен сервис запросов к более чем сотне разных баз данных используемых в бенчмарке ClickBench. И сам бенчмарк очень интересный как сравнение многих СУБД, и игровая площадка полезная
- A Preview of DuckDB v2.0 изменения в DuckDB, то что войдет в версию 2.0. Ключевое это новый парсер SQL, новый формат хранения, серверный вариант, ускорение запросов и еще много всего.
- fx кодирующий агент ориентированный на исследования и встраивание
- Cursor Origin хостинг кода от Cursor'а. Очень логичный шаг, странно что только они из кодирующих агентов такое начали. Думаю что остальные подтянутся. Альтернативы Github'у - это хорошо. А вот складывать все яйца в одну корзину лучше не надо.
#opensource #ai #databases
- ClickBench playground рассказ о том как устроен сервис запросов к более чем сотне разных баз данных используемых в бенчмарке ClickBench. И сам бенчмарк очень интересный как сравнение многих СУБД, и игровая площадка полезная
- A Preview of DuckDB v2.0 изменения в DuckDB, то что войдет в версию 2.0. Ключевое это новый парсер SQL, новый формат хранения, серверный вариант, ускорение запросов и еще много всего.
- fx кодирующий агент ориентированный на исследования и встраивание
- Cursor Origin хостинг кода от Cursor'а. Очень логичный шаг, странно что только они из кодирующих агентов такое начали. Думаю что остальные подтянутся. Альтернативы Github'у - это хорошо. А вот складывать все яйца в одну корзину лучше не надо.
#opensource #ai #databases
ClickHouse
I created a playground for 110 database systems | ClickHouse
You can choose any of these hundred database systems and run queries. You can create tables and databases, insert data, drop tables, etc. Every database comes with a preloaded dataset of 100 million records, so you can test example queries. It has not onl
🔥5✍3👍2🎉1💯1
Много, очень много документации лишней не бывает. Я собрался и актуализировал документацию по разным инструментам. Без ИИ ассистентов делать такое почти невозможно, ибо заставить себя документировать сложно. А документация нужна и для людей и для ИИ агентов которые ее используют.
Итак вот тут документация на разные открытые инструменты о которых я тут часто писал:
- internacia-db - база данных в виде дата продукта по странам и межгосударственным организациям
- iterabledata - универсальная библиотека для Python для унифицированного чтения из 100+ видов дата файлов
- undatum - инструмент командной строки, швейцарский нож для работы с данными причем не только с табличными, а такими как JSONL, Parquet и тд. Поддерживает более 140 форматов файлов и помогает анализировать, конвертировать и преобразовывать файлы с данными
- newsworker - утилита и библиотека по извлечению RSS, Atom и JSON новостных лент из HTML с сайтов где нет своих новостных лент в структурированном виде
- filerepack - утилита переупаковки файлов без потерь содержания и фунциональности. Умеет пересжимать слабо сжатые файлы, сжимать файлы внутри контейнеров, сжимать сами контейнеры, поддерживает изображения, файлы архивов, файлы с данными и так далее.
- qddate - библиотека для Python для быстрой идентификации и парсинга дат
- metacrafter - инструмент автоматической идентификации семантических типов данных в файлах с данными и СУБД. Умеет экспортировать результаты для загрузки в дата каталоги
- metawarc - утилита для индексации и работы с WARC файлами современными методами. Преобразует данные WARC в файлы Parquet и умеет извлекать метаданные вложенных в WARC файлов
- apibackuper - утилита извлечения и архивации данных извлекаемых из API. Изначально делалась для задач архивации, реально применяется для всех задач автоматизации извлечения данных из API
- datacrafter - очень простой NoSQL ETL инструмент использующий наработки iterabledata и и ориентированный на работу с JSONL и подобными данными
У меня скорее хобби поддерживать эти инструменты, ну и многие интегрированы в продукты и проекты которые без открытого кода. Хорошо что поддержание их стало очень простым благодаря применению кодирующих ИИ агентов.
А документация поможет тем кто хотел бы узнать больше о том как они работают и для чего применимы.
#opensource #datatools #dataengineering
Итак вот тут документация на разные открытые инструменты о которых я тут часто писал:
- internacia-db - база данных в виде дата продукта по странам и межгосударственным организациям
- iterabledata - универсальная библиотека для Python для унифицированного чтения из 100+ видов дата файлов
- undatum - инструмент командной строки, швейцарский нож для работы с данными причем не только с табличными, а такими как JSONL, Parquet и тд. Поддерживает более 140 форматов файлов и помогает анализировать, конвертировать и преобразовывать файлы с данными
- newsworker - утилита и библиотека по извлечению RSS, Atom и JSON новостных лент из HTML с сайтов где нет своих новостных лент в структурированном виде
- filerepack - утилита переупаковки файлов без потерь содержания и фунциональности. Умеет пересжимать слабо сжатые файлы, сжимать файлы внутри контейнеров, сжимать сами контейнеры, поддерживает изображения, файлы архивов, файлы с данными и так далее.
- qddate - библиотека для Python для быстрой идентификации и парсинга дат
- metacrafter - инструмент автоматической идентификации семантических типов данных в файлах с данными и СУБД. Умеет экспортировать результаты для загрузки в дата каталоги
- metawarc - утилита для индексации и работы с WARC файлами современными методами. Преобразует данные WARC в файлы Parquet и умеет извлекать метаданные вложенных в WARC файлов
- apibackuper - утилита извлечения и архивации данных извлекаемых из API. Изначально делалась для задач архивации, реально применяется для всех задач автоматизации извлечения данных из API
- datacrafter - очень простой NoSQL ETL инструмент использующий наработки iterabledata и и ориентированный на работу с JSONL и подобными данными
У меня скорее хобби поддерживать эти инструменты, ну и многие интегрированы в продукты и проекты которые без открытого кода. Хорошо что поддержание их стало очень простым благодаря применению кодирующих ИИ агентов.
А документация поможет тем кто хотел бы узнать больше о том как они работают и для чего применимы.
#opensource #datatools #dataengineering
🔥8👍5✍2🥰1🎉1
Forwarded from 4CIO: чат свободного сообщества (_)
Перестаньте угадывать, куда движется цифра — спросите тех, кто её рулит.
Школы МГИМО и МФТИ — это объединение двух совершенно разных миров: сухой технологической экспертизы Физтеха и масштабного бизнес-мышления МГИМО.
Если вы переросли линейный менеджмент и хотите вести за собой цифровые проекты, этот вечер — ваша персональная разведка.
Зачем вам приходить 26 августа:
* Жёсткий «профтест» спикеров. Вы лично увидите тех, кто ведет дисциплины — от директоров по цифровой трансформации крупного бизнеса до IT-практиков Физтеха. Поймёте за 15 минут, дают ли они свежую фактуру или читают по бумажке.
* Калибровка своего кейса. Сможете прямо в кулуарах спросить академических руководителей: *«У меня такой-то опыт и такие задачи. Окупится ли мне эта программа?»*
* Оценка будущего окружения. На MBA половину ценности формируют однокурсники. Посмотрите на тех, кто будет сидеть с вами за одной партой — это действующие мидл- и топ-менеджеры не младше 25 лет.
* Понимание реальных результатов. Выпускники программы не просто получают два диплома — они забирают связи и пересобирают свои карьерные треки в ритейле, финтехе и госсекторе.
Приходите задать неудобные вопросы, оценить уровень экспертов и понять, стоит ли эта инвестиция вашего времени.
Когда: 26 августа (среда), 19:00
Где: Москва, Климентовский пер., д. 1, стр. 1 (актовый зал)
👉 [Зарегистрироваться на встречу](https://forms.yandex.ru/u/6a664f28493639bf35c66bbe)
*Вход бесплатный, но требуется предварительная регистрация.*
Подробная программа и спикеры — на [digital.mgimo.ru](https://digital.mgimo.ru)
Подробности: https://digital.mgimo.ru
*минимальный возраст слушателей - 25 лет
Школы МГИМО и МФТИ — это объединение двух совершенно разных миров: сухой технологической экспертизы Физтеха и масштабного бизнес-мышления МГИМО.
Если вы переросли линейный менеджмент и хотите вести за собой цифровые проекты, этот вечер — ваша персональная разведка.
Зачем вам приходить 26 августа:
* Жёсткий «профтест» спикеров. Вы лично увидите тех, кто ведет дисциплины — от директоров по цифровой трансформации крупного бизнеса до IT-практиков Физтеха. Поймёте за 15 минут, дают ли они свежую фактуру или читают по бумажке.
* Калибровка своего кейса. Сможете прямо в кулуарах спросить академических руководителей: *«У меня такой-то опыт и такие задачи. Окупится ли мне эта программа?»*
* Оценка будущего окружения. На MBA половину ценности формируют однокурсники. Посмотрите на тех, кто будет сидеть с вами за одной партой — это действующие мидл- и топ-менеджеры не младше 25 лет.
* Понимание реальных результатов. Выпускники программы не просто получают два диплома — они забирают связи и пересобирают свои карьерные треки в ритейле, финтехе и госсекторе.
Приходите задать неудобные вопросы, оценить уровень экспертов и понять, стоит ли эта инвестиция вашего времени.
Когда: 26 августа (среда), 19:00
Где: Москва, Климентовский пер., д. 1, стр. 1 (актовый зал)
👉 [Зарегистрироваться на встречу](https://forms.yandex.ru/u/6a664f28493639bf35c66bbe)
*Вход бесплатный, но требуется предварительная регистрация.*
Подробная программа и спикеры — на [digital.mgimo.ru](https://digital.mgimo.ru)
Подробности: https://digital.mgimo.ru
*минимальный возраст слушателей - 25 лет
🐳2✍1🤔1🌚1
Дата_продукт_—_больше,_чем_данные.pdf
1.2 MB
Завтра я читаю внутреннюю лекцию про дата продукты, к которой набросал вот такую презентацию. Понятно что презентация просто иллюстрация к речи, но основные смыслы в ней есть. Покидайте в меня критики / замечаний / комментариев по содержанию. Что так и что не так
#questions #data #dataengineering
#questions #data #dataengineering
1👍7❤4🍾2🔥1
Я регулярно пишу про кризис в сообществе открытых данных из-за развития LLM. Главный источник кризиса в том что у открытых данных да и вообще у любых доступных данных появились компании которые умеют профессионально их монетизировать, хотя инфраструктура проектов с данными создается волонтерами, поддерживается на гранты и так далее.
Вот тут свежий документ-письмо сообщества DPG - Best Practices for Preventing AI Exploitation of Open Content and Open Data DPGs.
Иначе говоря на повестке сообщества не в том как больше открыть данные, а как разделить потребителей на коммерческих и некоммерческих. Там список технических, юридических и управленческих мер по ограничению ботов скрейперов, указанию лицензий использования, условий использования и так далее.
Важный документ отражающий общие настроения которые можно изложить как "мы работаем бесплатно, а на нас зарабатывают миллиарды долларов".
Отдельный вопрос в том что это кризис открытости в целом, не только данных, но и кода, свободно распространяемых текстов и так далее.
#opendata #ai
Вот тут свежий документ-письмо сообщества DPG - Best Practices for Preventing AI Exploitation of Open Content and Open Data DPGs.
Иначе говоря на повестке сообщества не в том как больше открыть данные, а как разделить потребителей на коммерческих и некоммерческих. Там список технических, юридических и управленческих мер по ограничению ботов скрейперов, указанию лицензий использования, условий использования и так далее.
Важный документ отражающий общие настроения которые можно изложить как "мы работаем бесплатно, а на нас зарабатывают миллиарды долларов".
Отдельный вопрос в том что это кризис открытости в целом, не только данных, но и кода, свободно распространяемых текстов и так далее.
#opendata #ai
✍9⚡7💔4👍2🥰1👏1💋1
Все регулярнее читаю тексты которые можно описать как "Открытому коду конец" иногда прямо так и называющиеся. Не буду предсказывать за весь открытый код, но кое что можно сформулировать. Многие код перестанут открывать и что-то закроют потому что пропали две ключевых причины почему многие компании/корпорации код выкладывали:
1) Получить бесплатных контрибьютеров в продукт
2) Получить бесплатный анализ безопасности и выявления ошибок
Теперь контрибьюторами будут ИИ агенты и они же будут делать проверки безопасности. Так зачем открывать код? Не, есть и другие причины вроде построения сообщества, прозрачности деятельности, идеологии и тд. Но они имеют меньшее влияние.
#opensource #thoughts
1) Получить бесплатных контрибьютеров в продукт
2) Получить бесплатный анализ безопасности и выявления ошибок
Теперь контрибьюторами будут ИИ агенты и они же будут делать проверки безопасности. Так зачем открывать код? Не, есть и другие причины вроде построения сообщества, прозрачности деятельности, идеологии и тд. Но они имеют меньшее влияние.
#opensource #thoughts
💯11🤔5😢4✍2💔2❤1
О том как в Китае работают с данными, текст комиссии Конгресса США. Общий смысл текста в том что у властей Китая есть чему поучиться, а по содержанию там речь про системы обмена/продажи данных в Китае в виде data exchanges и много подробностей, например, то что Минфин Китая рассматривает базы данных (data assets) как объекты учета.
#data #china
#data #china
www.uscc.gov
The People's Republic of Data
How China Is Turning Data into Capital
❤🔥3⚡2🔥2✍1
В продолжение моих рассуждений про дата-продукты и их отличие от наборов данных. Пример публикации таких дата продуктов в академической среде это портал Портал исследовательских данных Шотландии researchdata.scot. Там всего 133 базы данных и это не данные опубликованные исследователями в рамках научных работ, а базы данных доступные исследователям, преимущественно по запросу.
Там немного другая структура описания этих дата продуктов и оно включает:
Summary - сводная информация
Documentation - документация и описание
Coverage - область покрытия географическая и временная
Provenance - происхождение, источник и тип данных
Access and governance - доступ и управление, как получить доступ к данным, условия, владелец и контакты
Enrichment and linkage - связанные наборы данных, инструменты для работы, как их интегрировать с другими
Synthetic data - синтетические данные
Data dictionary - справочники и словари ассоциированные с этими данными
Тут надо оговориться что это речь про исследовательские дата продукты, а не про коммерческие/корпоративные. Поэтому эта структура и подача даже слегка консервативна, но вполне логична и куда более ложится в логику дата продуктов.
Для сравнения можно посмотреть на дата продукты для финансового сектора в Nasdaq Data Link data.nasdaq.com
Кроме всего прочего там ключевыми характеристиками являются:
- частота обновления данных и частота их доставки
- период задержки
А также множество инструментов доставки и, в виду, особенностей потребления данных акцент на API.
#opendata #data #dataproducts #datacatalogs
Там немного другая структура описания этих дата продуктов и оно включает:
Summary - сводная информация
Documentation - документация и описание
Coverage - область покрытия географическая и временная
Provenance - происхождение, источник и тип данных
Access and governance - доступ и управление, как получить доступ к данным, условия, владелец и контакты
Enrichment and linkage - связанные наборы данных, инструменты для работы, как их интегрировать с другими
Synthetic data - синтетические данные
Data dictionary - справочники и словари ассоциированные с этими данными
Тут надо оговориться что это речь про исследовательские дата продукты, а не про коммерческие/корпоративные. Поэтому эта структура и подача даже слегка консервативна, но вполне логична и куда более ложится в логику дата продуктов.
Для сравнения можно посмотреть на дата продукты для финансового сектора в Nasdaq Data Link data.nasdaq.com
Кроме всего прочего там ключевыми характеристиками являются:
- частота обновления данных и частота их доставки
- период задержки
А также множество инструментов доставки и, в виду, особенностей потребления данных акцент на API.
#opendata #data #dataproducts #datacatalogs
❤4🔥2✍1
Рассеянные мысли вслух:
1. Почему создание своей платформы для кода логичный ход для Cursor и почему этого стоит ждать и от других игроков. Потому что де-факто у Microsoft монополия в виде GIthub'а и в какой-то момент плотность работы ИИ агентов с платформой достигнет того уровня что MS начнут взимать с компаний разработчиков кодирующих ИИ ассистентов плату за быстрый доступ (странно если ещё не взимают, может я пропустил что-то).
2. Последние ИИ инструменты уже лучше меня умеют в обнаружение каталогов данных. Это сложный был скилл который я подумывал описать и передать кому-то в команде или найти под это отдельного человека. Но сейчас с помощью последних ИИ агентов gpt-5.6-sol, fable-5 и grok-4.6 меня можно заменить. Они реально умеют находить лучше чем я, и если я знаю несколько больше про глубину поиска и анализа, то по ширине охвата и скорости уже не могу сравниться. Что это значит? Что я сам могу делать эту работу значительно лучше и что принципиально меня теперь можно заменить. Не роботом, но аналитиком + ИИ ассистентом.
3. Водяные знаки генерируемые Anthropic'ом - это не только потенциальный инструмент отслеживания их компьютерной генерации, но цифровая маркировка позволяющая отслеживать конкретный цифровой объект (текст) и создавшего его пользователя. Это не просто механизм соблюдения требований регулятора, но и, потенциально, инструмент отслеживания.
#thoughts #aiagents
1. Почему создание своей платформы для кода логичный ход для Cursor и почему этого стоит ждать и от других игроков. Потому что де-факто у Microsoft монополия в виде GIthub'а и в какой-то момент плотность работы ИИ агентов с платформой достигнет того уровня что MS начнут взимать с компаний разработчиков кодирующих ИИ ассистентов плату за быстрый доступ (странно если ещё не взимают, может я пропустил что-то).
2. Последние ИИ инструменты уже лучше меня умеют в обнаружение каталогов данных. Это сложный был скилл который я подумывал описать и передать кому-то в команде или найти под это отдельного человека. Но сейчас с помощью последних ИИ агентов gpt-5.6-sol, fable-5 и grok-4.6 меня можно заменить. Они реально умеют находить лучше чем я, и если я знаю несколько больше про глубину поиска и анализа, то по ширине охвата и скорости уже не могу сравниться. Что это значит? Что я сам могу делать эту работу значительно лучше и что принципиально меня теперь можно заменить. Не роботом, но аналитиком + ИИ ассистентом.
3. Водяные знаки генерируемые Anthropic'ом - это не только потенциальный инструмент отслеживания их компьютерной генерации, но цифровая маркировка позволяющая отслеживать конкретный цифровой объект (текст) и создавшего его пользователя. Это не просто механизм соблюдения требований регулятора, но и, потенциально, инструмент отслеживания.
#thoughts #aiagents
👍10✍2❤2