В рубрике интересных и малоизвестных проектов:
- PyDI малоизвестный широкой публике инструмент интеграции данных через LLM. Делается в Университете Маннхейма. Много полезного чтобы посмотреть как реализуют задачи schema matching, сопоставления структур данных для интеграции
- Web Data Commons коллекция огромного объёма (ну ладно, не огромного, просто не маленьких) наборов данных веб разметки объектов извлеченных из Common Crawl. Если проще - результаты извлечения объектов Schema.org из дампов Common Crawl. Уже год не добавляют нового, но и имеющееся весьма полезно
- DuckDB eurostat расширение для DuckDB для работы с данными Евростата. Я смотрю на это и думаю, ну почему, ну почему это сделал не я😱. Идея отличная, может сделать расширение поиска данных в Dateno через DuckDB? Но у нас нет SDK для C++, но можно и без SDK. Я вот не писал на C++ уже лет 30, только читал, патчил, собирал, но не вел полноценной разработки. Но самому такое делать и не надо, конечно. Надо привлечь кого-то к этому прекрасному делу.
- DOOMQL реализация игры DOOM на SQL в базе CedarDB. Для всех кто любит DOOM. В основе аналогичная реализация игры для DuckDB, на неё там приведены ссылки.
#opensource #data #datasets #dataengineering
- PyDI малоизвестный широкой публике инструмент интеграции данных через LLM. Делается в Университете Маннхейма. Много полезного чтобы посмотреть как реализуют задачи schema matching, сопоставления структур данных для интеграции
- Web Data Commons коллекция огромного объёма (ну ладно, не огромного, просто не маленьких) наборов данных веб разметки объектов извлеченных из Common Crawl. Если проще - результаты извлечения объектов Schema.org из дампов Common Crawl. Уже год не добавляют нового, но и имеющееся весьма полезно
- DuckDB eurostat расширение для DuckDB для работы с данными Евростата. Я смотрю на это и думаю, ну почему, ну почему это сделал не я😱. Идея отличная, может сделать расширение поиска данных в Dateno через DuckDB? Но у нас нет SDK для C++, но можно и без SDK. Я вот не писал на C++ уже лет 30, только читал, патчил, собирал, но не вел полноценной разработки. Но самому такое делать и не надо, конечно. Надо привлечь кого-то к этому прекрасному делу.
- DOOMQL реализация игры DOOM на SQL в базе CedarDB. Для всех кто любит DOOM. В основе аналогичная реализация игры для DuckDB, на неё там приведены ссылки.
#opensource #data #datasets #dataengineering
GitHub
GitHub - wbsg-uni-mannheim/PyDI: The PyDI framework provides methods for end-to-end data integration. The framework covers all…
The PyDI framework provides methods for end-to-end data integration. The framework covers all steps of the integration process, including schema matching, data translation, entity matching, and dat...
👍8
Полезные ссылки про данные, технологии и не только:
- Village SQL форк MySQL с возможностью написания расширений и несколькими готовыми расширениями для криптографических функций, генерации UUID и, конечно же, функций для промптинга LLM. Код под GPL2, команда с большим опытом разработки СУБД. Для тех чья жизнь связана с MySQL может быть полезной альтернативой
- Where Data Engineering Is Heading in 2026 - 5+ Trends автор рассуждает о трендах дата инженерии, я бы выделил ту мысль что скоро в вакансиях перестанут упоминать применение ИИ ассистентов как обязательное требование потому что оно будет подразумеваться.
- Polyglot програмная библиотека для Rust для парсинга SQL. Нужный инструмент для самых разнообразных задач. Пока выглядит как наиболее продвинутый из всех мне известных.
- What the fastest-growing tools reveal about how software is being built в блоге Github о том что AI теперь всегда синонимичен Python, о том что Typescript напирает популярность, а Javascript теряет и ряд других интересностей из анализов трендов на Github'е
- Monty облегченная версия интерпретатора Python'а написанная на Rust. Главное - безопасная работа и минимизированная скорость запуска. Зачем? Для экономии ресурсов при запуске в изолированных контейнерах ИИ агентов. Делают ребята из Pydantic. Выглядит как важный и нужный продукт, заодно у них есть сравнение с альтернативами.
#tools #datatools #opensource #dataengineering
- Village SQL форк MySQL с возможностью написания расширений и несколькими готовыми расширениями для криптографических функций, генерации UUID и, конечно же, функций для промптинга LLM. Код под GPL2, команда с большим опытом разработки СУБД. Для тех чья жизнь связана с MySQL может быть полезной альтернативой
- Where Data Engineering Is Heading in 2026 - 5+ Trends автор рассуждает о трендах дата инженерии, я бы выделил ту мысль что скоро в вакансиях перестанут упоминать применение ИИ ассистентов как обязательное требование потому что оно будет подразумеваться.
- Polyglot програмная библиотека для Rust для парсинга SQL. Нужный инструмент для самых разнообразных задач. Пока выглядит как наиболее продвинутый из всех мне известных.
- What the fastest-growing tools reveal about how software is being built в блоге Github о том что AI теперь всегда синонимичен Python, о том что Typescript напирает популярность, а Javascript теряет и ряд других интересностей из анализов трендов на Github'е
- Monty облегченная версия интерпретатора Python'а написанная на Rust. Главное - безопасная работа и минимизированная скорость запуска. Зачем? Для экономии ресурсов при запуске в изолированных контейнерах ИИ агентов. Делают ребята из Pydantic. Выглядит как важный и нужный продукт, заодно у них есть сравнение с альтернативами.
#tools #datatools #opensource #dataengineering
GitHub
GitHub - villagesql/villagesql-server: VillageSQL - a drop-in replacement for MySQL with extensions
VillageSQL - a drop-in replacement for MySQL with extensions - villagesql/villagesql-server
🔥5🤔1
Zvec свежая замена Sqlite в задачах векторного поиска и RAG. Выложено Alibaba под лицензией Apache 2.0. В моем понимании это прямая альтернатива LanceDB, но LanceDB пока выглядит интереснее.
#opensource #datatools #dataengineering
#opensource #datatools #dataengineering
🔥5👍3
Подборка ссылок про данные, технологии и не только:
- Jack Dorsey’s Block to Lay Off 40% of Its Workforce in AI Remake Джек Дорси, создатель Твиттера, а теперь стартапа Block уволил 4000 человек, это 40% команды, с начала года. Что важно, оставшаяся команда плотно работает с ИИ инструментами и то что акции компании только выросли. Да, в ИТ отрасли и в создании ИТ продуктов будут сокращения, это неизбежность и большие возможности для AI-first компаний и большой кризис для всех кто думает что это пройдет мимо них.
- Geopolitical Union книга о том как Евросоюз перешел к реальным шагам в части цифрового/технологического суверенитета, автор Ben Farrand много лет пишет на эту тему. Не видел пока этой книги в открытом доступе, но скорее всего будет любопытной для улучшения понимания причин и стратегического тренда
- GeoAI for Humanitarian Action собственно про спасение людей с помощью ИИ в самом буквальном смысле, руководство по применению ИИ при гуманитарных кризисах связанных со стихией, катастрофами. По большей части речь про анализ спутниковых снимков с помощью ИИ.
- 2028 the Great Data Reckoning автор рассуждает о том что вендоры инструментов работы с данными идут к кризису 2028 года. О том что дата инженерам надо переосмыслять принципы своей работы.
#readings #dataengineering #ai #humanitarian
- Jack Dorsey’s Block to Lay Off 40% of Its Workforce in AI Remake Джек Дорси, создатель Твиттера, а теперь стартапа Block уволил 4000 человек, это 40% команды, с начала года. Что важно, оставшаяся команда плотно работает с ИИ инструментами и то что акции компании только выросли. Да, в ИТ отрасли и в создании ИТ продуктов будут сокращения, это неизбежность и большие возможности для AI-first компаний и большой кризис для всех кто думает что это пройдет мимо них.
- Geopolitical Union книга о том как Евросоюз перешел к реальным шагам в части цифрового/технологического суверенитета, автор Ben Farrand много лет пишет на эту тему. Не видел пока этой книги в открытом доступе, но скорее всего будет любопытной для улучшения понимания причин и стратегического тренда
- GeoAI for Humanitarian Action собственно про спасение людей с помощью ИИ в самом буквальном смысле, руководство по применению ИИ при гуманитарных кризисах связанных со стихией, катастрофами. По большей части речь про анализ спутниковых снимков с помощью ИИ.
- 2028 the Great Data Reckoning автор рассуждает о том что вендоры инструментов работы с данными идут к кризису 2028 года. О том что дата инженерам надо переосмыслять принципы своей работы.
#readings #dataengineering #ai #humanitarian
The Wall Street Journal
Jack Dorsey’s Block to Lay Off 40% of Its Workforce in AI Remake
The company said the plan would cost it $450 million to $500 million in expenses and severance.
❤🔥4❤1
Новая версия DuckDB 1.5 обещают поддержку типа GEOMETRY для геоданных, обновленную утилиту командной строки, подключение к ODBC, обновление спецификации DuckLake и больше поддержки озер данных и множество других изменений.
#opensource #datatools #duckdb #dataengineering
#opensource #datatools #duckdb #dataengineering
🔥6❤5
Great Data Products ещё один взгляд на открытые данные от основателей source.coop, платформы для публикации данных большого объёма, преимущественно геоданных. Автор делает экскурс в историю открытости данных, с акцентом на данные для исследователей публикуемые в США, с отсылками к первым большим изменениям в регулировании к 2003 году. Но при этом автор говорит о неопределенности слова "open" и предлагает ввести понятие "great" и акцент не на открытых датасетах, а на дата продуктах. Разница в том что дата продукты документированы, сопровождаются, имеют измеримую стоимость создания и поддержания и понятную стоимость для потребителей.
Это очень похоже на концепцию 3-й волны открытых данных (publish with the purpose) и акценте на понимании пользователей и ценности данных для пользователей.
Собственно он приводит в пример Scoop.coop, CommonCrawl, Open Supply Hub и другие специализированные НКО созданные вокруг дата продуктов и экосистемы вокруг дата продуктов.
Ко всему автор ведет и любопытный подкаст с одноименным названием.
И вдогонку к этому тексту пример проекта в виде дата продукта базы штормовых событий на основе данных NOAA с API и специализированным веб интерфейсом для их отображения.
Сама идея дата продуктов не нова, я склоняюсь что за ней однозначное будущее как переход к ценностному отношению к данным - неважно, открытым, регламентированным, для внутреннего использования.
#opendata #dataengineering #dataproducts #data
Это очень похоже на концепцию 3-й волны открытых данных (publish with the purpose) и акценте на понимании пользователей и ценности данных для пользователей.
Собственно он приводит в пример Scoop.coop, CommonCrawl, Open Supply Hub и другие специализированные НКО созданные вокруг дата продуктов и экосистемы вокруг дата продуктов.
Ко всему автор ведет и любопытный подкаст с одноименным названием.
И вдогонку к этому тексту пример проекта в виде дата продукта базы штормовых событий на основе данных NOAA с API и специализированным веб интерфейсом для их отображения.
Сама идея дата продуктов не нова, я склоняюсь что за ней однозначное будущее как переход к ценностному отношению к данным - неважно, открытым, регламентированным, для внутреннего использования.
#opendata #dataengineering #dataproducts #data
👍5🔥3❤1
Еще немного размышлений вслух про дата продукты и открытые данные. Я поизучал спецификацию ODPS (Open Data Product Specification) в её последней редакции версии 4.1. Её, кстати, правильно читать не как спецификацию про открытые дата продукты, а как открытую спецификацию на дата продукты. Это, конечно, неплохой документ и чуть ли не единственный описывающий данные именно к продукт и спецификация сама по себе имеет ценность не только для технического описания, но и как шаблона для внутреннего описания дата продуктов. Условно хороший документ спецификации для API к доступу к данным на этапе проектирования (скорее продуктового чем технического).
Но, при этом, со своими ограничениями:
1. Малая экосистема. У дата продукта может быть более одного интерфейса, это могут быть данные доступные через REST API, в формате для массовой выгрузки (bulk download), в формате специализированного API (WFC и OGC совместимые). Хотя в спецификации это всё предусмотрено, но каждый из этих интерфейсов, но нехватает инструментов тестирования этих множественных интерфейсов на основе спецификации.
2. Интеграция с ИИ агентами. Наличие ссылок на документацию - это важно, и, ИМХО, важно не просто наличие human-readable документации, но и документации для ИИ агента (в виде markdown похоже) для автоматизированного доступа к дата продукту.
Как я понимаю в части работы с общедоступными данными у ODPS есть реализация внутри X-Road, но при этом общедоступно действующих примеров нет и нет примеров её использования наиболее продвинутыми создателями открытых дата продуктов в госсекторе, к примеру, государственные API во Франции не описываются через ODPS хотя их описание и документация наиболее близки именно к описанию дата продуктов.
В принципе лично меня это смущает более всего, я знаю довольно много дата продуктов которые могли бы быть описаны с помощью ODPS, но не описываются по какой-то причине. Я подозреваю по той что за спецификацией не стоит кто-то достаточно крупный кто внедрил бы это в свой достаточно популярный каталог дата продуктов. К примеру достаточно крупных агрегатор сервисов API (но им спецификация не вполне подходит) или дата маркетплейс (таких крупных не так много). Кто-то вроде бывшего Quandl'а мог бы использовать подобную спецификацию.
#thoughts #data #specifications #dataengineering
Но, при этом, со своими ограничениями:
1. Малая экосистема. У дата продукта может быть более одного интерфейса, это могут быть данные доступные через REST API, в формате для массовой выгрузки (bulk download), в формате специализированного API (WFC и OGC совместимые). Хотя в спецификации это всё предусмотрено, но каждый из этих интерфейсов, но нехватает инструментов тестирования этих множественных интерфейсов на основе спецификации.
2. Интеграция с ИИ агентами. Наличие ссылок на документацию - это важно, и, ИМХО, важно не просто наличие human-readable документации, но и документации для ИИ агента (в виде markdown похоже) для автоматизированного доступа к дата продукту.
Как я понимаю в части работы с общедоступными данными у ODPS есть реализация внутри X-Road, но при этом общедоступно действующих примеров нет и нет примеров её использования наиболее продвинутыми создателями открытых дата продуктов в госсекторе, к примеру, государственные API во Франции не описываются через ODPS хотя их описание и документация наиболее близки именно к описанию дата продуктов.
В принципе лично меня это смущает более всего, я знаю довольно много дата продуктов которые могли бы быть описаны с помощью ODPS, но не описываются по какой-то причине. Я подозреваю по той что за спецификацией не стоит кто-то достаточно крупный кто внедрил бы это в свой достаточно популярный каталог дата продуктов. К примеру достаточно крупных агрегатор сервисов API (но им спецификация не вполне подходит) или дата маркетплейс (таких крупных не так много). Кто-то вроде бывшего Quandl'а мог бы использовать подобную спецификацию.
#thoughts #data #specifications #dataengineering
opendataproducts.org
Open Data Products Standards Family | Linux Foundation
AI Agent First standards for describing, cataloging, connecting, and interpreting data products.
🔥5👍3
Полезные ссылки про данные, технологии и не только:
- Arckit набор команд для ИИ и фреймворк для проектирования архитектуры корпоративных информационных систем. Выглядит очень даже неплохо, надо поизучать. Интегрируется с разными ИИ агентами, включает много гайдов и примеров
- DuckLake v1.0 вышел production-ready DuckLake, однозначно надо пробовать и уже есть задачи на которых можно это делать. В общем-то озеро данных на Parquet файлах и SQL поверх - это выглядит как все более хорошая идея для много чего
- DuckDB 1.5.2 а заодно обновился движок DuckDB, теперь еще производительнее и с поддержкой новой онлайн оболочки и лучшей поддержки геоданных (тип GEOMETRY в расширении Iceberg)
- Dagster Pricing Update is Beyond Nuts пользователь на Reddit жалуется о том что Dagster резко подняли цену на их облачный сервис. Большинство реагируют в стиле, "ставьте же себе версию с открытым кодом", но в целом я могу сказать что полагаться на чужие внешние сервисы для обработки своих данных надо с большой осторожностью. Open source продукты тут в большем фаворе
#opensource #data #datatools #dataengineering
- Arckit набор команд для ИИ и фреймворк для проектирования архитектуры корпоративных информационных систем. Выглядит очень даже неплохо, надо поизучать. Интегрируется с разными ИИ агентами, включает много гайдов и примеров
- DuckLake v1.0 вышел production-ready DuckLake, однозначно надо пробовать и уже есть задачи на которых можно это делать. В общем-то озеро данных на Parquet файлах и SQL поверх - это выглядит как все более хорошая идея для много чего
- DuckDB 1.5.2 а заодно обновился движок DuckDB, теперь еще производительнее и с поддержкой новой онлайн оболочки и лучшей поддержки геоданных (тип GEOMETRY в расширении Iceberg)
- Dagster Pricing Update is Beyond Nuts пользователь на Reddit жалуется о том что Dagster резко подняли цену на их облачный сервис. Большинство реагируют в стиле, "ставьте же себе версию с открытым кодом", но в целом я могу сказать что полагаться на чужие внешние сервисы для обработки своих данных надо с большой осторожностью. Open source продукты тут в большем фаворе
#opensource #data #datatools #dataengineering
ArcKit
ArcKit - The Enterprise Architecture Governance Harness
Official ArcKit site: an AI harness and enterprise architecture kit for traceable governance artifacts, UK Government workflows, and community compliance overlays.
👍4🔥2
Новая внедрямая база данных SlothDB умеющая читать разного рода дата файлы вроде parquet, csv, json, avro и о которой автор пишет что она быстрее DuckDB.
Что интересно - похоже на зрелый и проработанный проект, не знаю насчет скорости, но точно с очень небольшим футпринтом что особенно критично для умных устройств, мини инсталляций и тд.
Насчет бенчмарков, тут хочется увидеть независимые оценки.
В любом случае появление алттернативы DuckDB которая была бы лучшее/быстрее/мощнее - это хорошо.
Малый футпринт еще важен для применения в веб интерфейсах, поскольку размер кода для WebAssembly существенно меньше (по обещаниям автора).
#opensource #datatools #dataengineering
Что интересно - похоже на зрелый и проработанный проект, не знаю насчет скорости, но точно с очень небольшим футпринтом что особенно критично для умных устройств, мини инсталляций и тд.
Насчет бенчмарков, тут хочется увидеть независимые оценки.
В любом случае появление алттернативы DuckDB которая была бы лучшее/быстрее/мощнее - это хорошо.
Малый футпринт еще важен для применения в веб интерфейсах, поскольку размер кода для WebAssembly существенно меньше (по обещаниям автора).
#opensource #datatools #dataengineering
👍9❤3
Flowfile визуальный ETL инструмент внутри которого Polars и который создает код для Polars в процессе. Лицензия MIT, выглядит довольно неплохо, хотя и не охватывает большого числа возможностей других ETL.
Лично я к визуальным ETL инструментам отношусь предвзято, но как инструмент low-code моделирования может быть интересным.
#opensource #dataengineering #data #datatools
Лично я к визуальным ETL инструментам отношусь предвзято, но как инструмент low-code моделирования может быть интересным.
#opensource #dataengineering #data #datatools
🔥9👍5❤🔥3🕊2
Data Landscape интерактивная визуализированная база знаний по стандартам работы с данными. Разделенные на группы рекомендуемых, ситуативных, интересных и не рекомендуемых.
Не буду утверждать что я со всеми классификациями согласен и считаю эту базу знаний полной, но она точно полезна.
Как минимум полезна в разговорах о том что использовать, а что не надо.
Открытый код, MIT лицензия.
#opensource #dataengineering
Не буду утверждать что я со всеми классификациями согласен и считаю эту базу знаний полной, но она точно полезна.
Как минимум полезна в разговорах о том что использовать, а что не надо.
Открытый код, MIT лицензия.
#opensource #dataengineering
❤🔥7👍5🔥4✍1
Выступление Hannes Mühleisen на AI Council о DuckDB Quack (серверном протоколе для DuckDB) https://www.youtube.com/watch?v=L_lttD-d1wc
Интересно тем что он целенаправленно сравнивает DuckDB с PostgreSQL (отмечу что не с Clickhouse) и всячески их противопоставляет отчего возникает резонный вопрос можно ли действительно DuckDB теперь рассматривать как полноценную замену PostgreSQL ? Если да, то это потенциальное обновление множества технологических стеков. Как минимум даже серверная версия DuckDB гораздо легче в развертывании.
Видео длинное, но докладчик интересный. Тем кто интересуется развитием и применением СУБД для аналитики будет полезно.
#datatools #dataengineering #opensource
Интересно тем что он целенаправленно сравнивает DuckDB с PostgreSQL (отмечу что не с Clickhouse) и всячески их противопоставляет отчего возникает резонный вопрос можно ли действительно DuckDB теперь рассматривать как полноценную замену PostgreSQL ? Если да, то это потенциальное обновление множества технологических стеков. Как минимум даже серверная версия DuckDB гораздо легче в развертывании.
Видео длинное, но докладчик интересный. Тем кто интересуется развитием и применением СУБД для аналитики будет полезно.
#datatools #dataengineering #opensource
YouTube
DuckDB-Quack announcement at AI Council
Slides: https://blobs.duckdb.org/slides/hannes-muehleisen-quack-ai-council-2026.pdf
🤔10✍4
Для тех кто любит работать с данными, я недавно залил обновления в два репозитория:
- iterabledata библиотека для Python для чтения условно любых файлов и баз данных в итеративном режиме в том числе в потоковом режиме с экономией памяти
- undatum утилита для командной строки для манипуляции условно любыми дата файлами, их конверсии, чтении данных, анализу и документированию. Внутри используется как раз библиотека iterabledata
В чем особенность этих релизов.
В iterabledata исправлена возможность записи в форматы Avro, Orc и Lance. Не самые большие изменения, но повышающие удобство работы с библиотекой.
А утилита undatum была радикально обновлена с переводом большей части функций на работу через iterabledata и отказа от части внутреннего кода. Теперь работает преобразование файлов всех форматов которые поддерживает iterabledata - это более 100 форматов.
Сами инструменты были вдохновлены утилитами xsv и qsv и были написаны для того чтобы можно было удобным образом работать с изначально с JSONl/NDJSON файлами сжатыми любым способом, а далее с форматами вроде Parquet, ORC и остальные.
Вообще у меня не так много времени остается на программирование в последнее время, это скорее как хобби, но хобби полезное.
#opensource #datatools #dataengineering
- iterabledata библиотека для Python для чтения условно любых файлов и баз данных в итеративном режиме в том числе в потоковом режиме с экономией памяти
- undatum утилита для командной строки для манипуляции условно любыми дата файлами, их конверсии, чтении данных, анализу и документированию. Внутри используется как раз библиотека iterabledata
В чем особенность этих релизов.
В iterabledata исправлена возможность записи в форматы Avro, Orc и Lance. Не самые большие изменения, но повышающие удобство работы с библиотекой.
А утилита undatum была радикально обновлена с переводом большей части функций на работу через iterabledata и отказа от части внутреннего кода. Теперь работает преобразование файлов всех форматов которые поддерживает iterabledata - это более 100 форматов.
Сами инструменты были вдохновлены утилитами xsv и qsv и были написаны для того чтобы можно было удобным образом работать с изначально с JSONl/NDJSON файлами сжатыми любым способом, а далее с форматами вроде Parquet, ORC и остальные.
Вообще у меня не так много времени остается на программирование в последнее время, это скорее как хобби, но хобби полезное.
#opensource #datatools #dataengineering
1🔥14👍11✍4
Я тут задумался над одной из главных проблем большей части проектов/порталов с открытыми данными. Они очень редко существуют в понятиях дата продуктов (продуктов данных). Хотя, по своей сути, являются их подвидом. Должны бы являться, в каком-то идеальном мире.
В реальности оказывается что только лучшие из порталов вроде французского имеют приближение к этому.
Гораздо ближе к дата продуктам коммерческие порталы с данными, отдельные госпроекты где доступность данных - это одна из форма доступа к ним и коммерческие дата продукты.
Поэтому важный тезис в том что продукт данных (дата продукт) можно превратить в семантические слои, ну или расширить в это направление, а данные на типовом портале открытых данных нельзя. Там почти полный отрыв от контекста, задач, пользователей, метрик и коммуникации с владельцем данных, если он вообще есть.
Все это к тому что преобразование порталов открытых данных в AI-готовые продукты ограничено тем что дата продуктов на них мало, метаданные не адаптированы для работы ИИ агентов и, в целом, требуются отдельные и существенные усилия чтобы строить на них семантические слои.
Картинка для привлечения внимания, честно переведена с помощью LLM, а тут первоисточник
#opendata #ai #thoughts #dataengineering #datacatalogs
В реальности оказывается что только лучшие из порталов вроде французского имеют приближение к этому.
Гораздо ближе к дата продуктам коммерческие порталы с данными, отдельные госпроекты где доступность данных - это одна из форма доступа к ним и коммерческие дата продукты.
Поэтому важный тезис в том что продукт данных (дата продукт) можно превратить в семантические слои, ну или расширить в это направление, а данные на типовом портале открытых данных нельзя. Там почти полный отрыв от контекста, задач, пользователей, метрик и коммуникации с владельцем данных, если он вообще есть.
Все это к тому что преобразование порталов открытых данных в AI-готовые продукты ограничено тем что дата продуктов на них мало, метаданные не адаптированы для работы ИИ агентов и, в целом, требуются отдельные и существенные усилия чтобы строить на них семантические слои.
Картинка для привлечения внимания, честно переведена с помощью LLM, а тут первоисточник
#opendata #ai #thoughts #dataengineering #datacatalogs
💯5🔥4✍3🤔1😢1
Я тут выложил свежие версии инструментов с открытым кодом для работы с данными iterabledata библиотеки для построчного чтения и записи данных из более чем 140 форматов файлов данных и undatum инструмент швейцарский нож для работы с данными в командной строке которые использует iterabledata для чтения, обработки и преобразования.
В iterabledata добавлено:
- поддержка множества новых форматов геоданных, научных данных и тд. таких как (
- поддержка чтения данных из озер данных и где-то записи таких как Apache Poimon и DuckLake
- поддержка записи данных в DeltaLake и Iceberg
- много изменений для повышения производительности чтения и записи Parquet файлов
- исправление множества ошибок и мелкие правки
В undatum добавлено:
- новая команда repack позволяет переупаковать дата файлы для большего сжатия. Если это формат parquet/orc/avro то использует внутренний кодек, если это файл сжатый Gzip, Bzip2 и тд. то пересжимает его. Нужно, в основном, для ситуаций когда надо пересжать слабо сжатые дата файлы вроде Parquet
- добавлена команда db dump по экспорту таблицы из базы данных сразу в Parquet/CSV/JSONL
- добавлена опция —low-memory для ряда команд для работы с файлами большого размера без чрезмерного использования RAM
- исправлен/модернизирован код генерации API на основе дата файла
- добавление использования DuckDB во многие команды, там где это возможно, для ускорения их работы
- множество мелких изменений и исправлений
#opensource #datatools #dataengineering
В iterabledata добавлено:
- поддержка множества новых форматов геоданных, научных данных и тд. таких как (
fgdb/gdb), MapInfo MIF, Esri ASCII Grid (asc), ArcInfo E00, LAS LiDAR, BAG bathymetry, CZML, XYZ, CIF, PDB, MATLAB MAT, SEG-Y, GRIB2, miniSEED- поддержка чтения данных из озер данных и где-то записи таких как Apache Poimon и DuckLake
- поддержка записи данных в DeltaLake и Iceberg
- много изменений для повышения производительности чтения и записи Parquet файлов
- исправление множества ошибок и мелкие правки
В undatum добавлено:
- новая команда repack позволяет переупаковать дата файлы для большего сжатия. Если это формат parquet/orc/avro то использует внутренний кодек, если это файл сжатый Gzip, Bzip2 и тд. то пересжимает его. Нужно, в основном, для ситуаций когда надо пересжать слабо сжатые дата файлы вроде Parquet
- добавлена команда db dump по экспорту таблицы из базы данных сразу в Parquet/CSV/JSONL
- добавлена опция —low-memory для ряда команд для работы с файлами большого размера без чрезмерного использования RAM
- исправлен/модернизирован код генерации API на основе дата файла
- добавление использования DuckDB во многие команды, там где это возможно, для ускорения их работы
- множество мелких изменений и исправлений
#opensource #datatools #dataengineering
GitHub
GitHub - datenoio/iterabledata: Iterable Data is a Python library for reading and writing data files row by row in a consistent…
Iterable Data is a Python library for reading and writing data files row by row in a consistent, iterator-based interface. It provides a unified API for working with various data formats (CSV, JSON...
✍7❤3👍3
Новая версия 1.7.0 утилиты undatum для обработки данных с командной строки включая поддержку форматов данных с вложенными структурами такие как JSONL (NDJSON), Parquet, Avro и более 140 других.
Ключевые изменения:
- появился текстовый интерфейс TUI для интерактивной работы с данными. Вызывается как undatum tui <название файла>
- появился веб интерфейс для для просмотра данных. Пока незавершенный, в экспериментальном режиме. Вызывается как undatum web <название файла>
- убраны опции запросов к данным через язык MistQL, вместо него можно использовать синтаксис SQL от DuckDB
- большая синхронизация с опциями и функциями библиотеки iterabledata, в первую очередь в части развертывания вложенных структур, например, для обращения к данным как capital_city.lat где lat - это вложенное поле в структуре capital_city
- множество изменений поменьше
#opensource #datatools #data #dataengineering
Ключевые изменения:
- появился текстовый интерфейс TUI для интерактивной работы с данными. Вызывается как undatum tui <название файла>
- появился веб интерфейс для для просмотра данных. Пока незавершенный, в экспериментальном режиме. Вызывается как undatum web <название файла>
- убраны опции запросов к данным через язык MistQL, вместо него можно использовать синтаксис SQL от DuckDB
- большая синхронизация с опциями и функциями библиотеки iterabledata, в первую очередь в части развертывания вложенных структур, например, для обращения к данным как capital_city.lat где lat - это вложенное поле в структуре capital_city
- множество изменений поменьше
#opensource #datatools #data #dataengineering
🔥8✍4👍4👏1
Много, очень много документации лишней не бывает. Я собрался и актуализировал документацию по разным инструментам. Без ИИ ассистентов делать такое почти невозможно, ибо заставить себя документировать сложно. А документация нужна и для людей и для ИИ агентов которые ее используют.
Итак вот тут документация на разные открытые инструменты о которых я тут часто писал:
- internacia-db - база данных в виде дата продукта по странам и межгосударственным организациям
- iterabledata - универсальная библиотека для Python для унифицированного чтения из 100+ видов дата файлов
- undatum - инструмент командной строки, швейцарский нож для работы с данными причем не только с табличными, а такими как JSONL, Parquet и тд. Поддерживает более 140 форматов файлов и помогает анализировать, конвертировать и преобразовывать файлы с данными
- newsworker - утилита и библиотека по извлечению RSS, Atom и JSON новостных лент из HTML с сайтов где нет своих новостных лент в структурированном виде
- filerepack - утилита переупаковки файлов без потерь содержания и фунциональности. Умеет пересжимать слабо сжатые файлы, сжимать файлы внутри контейнеров, сжимать сами контейнеры, поддерживает изображения, файлы архивов, файлы с данными и так далее.
- qddate - библиотека для Python для быстрой идентификации и парсинга дат
- metacrafter - инструмент автоматической идентификации семантических типов данных в файлах с данными и СУБД. Умеет экспортировать результаты для загрузки в дата каталоги
- metawarc - утилита для индексации и работы с WARC файлами современными методами. Преобразует данные WARC в файлы Parquet и умеет извлекать метаданные вложенных в WARC файлов
- apibackuper - утилита извлечения и архивации данных извлекаемых из API. Изначально делалась для задач архивации, реально применяется для всех задач автоматизации извлечения данных из API
- datacrafter - очень простой NoSQL ETL инструмент использующий наработки iterabledata и и ориентированный на работу с JSONL и подобными данными
У меня скорее хобби поддерживать эти инструменты, ну и многие интегрированы в продукты и проекты которые без открытого кода. Хорошо что поддержание их стало очень простым благодаря применению кодирующих ИИ агентов.
А документация поможет тем кто хотел бы узнать больше о том как они работают и для чего применимы.
#opensource #datatools #dataengineering
Итак вот тут документация на разные открытые инструменты о которых я тут часто писал:
- internacia-db - база данных в виде дата продукта по странам и межгосударственным организациям
- iterabledata - универсальная библиотека для Python для унифицированного чтения из 100+ видов дата файлов
- undatum - инструмент командной строки, швейцарский нож для работы с данными причем не только с табличными, а такими как JSONL, Parquet и тд. Поддерживает более 140 форматов файлов и помогает анализировать, конвертировать и преобразовывать файлы с данными
- newsworker - утилита и библиотека по извлечению RSS, Atom и JSON новостных лент из HTML с сайтов где нет своих новостных лент в структурированном виде
- filerepack - утилита переупаковки файлов без потерь содержания и фунциональности. Умеет пересжимать слабо сжатые файлы, сжимать файлы внутри контейнеров, сжимать сами контейнеры, поддерживает изображения, файлы архивов, файлы с данными и так далее.
- qddate - библиотека для Python для быстрой идентификации и парсинга дат
- metacrafter - инструмент автоматической идентификации семантических типов данных в файлах с данными и СУБД. Умеет экспортировать результаты для загрузки в дата каталоги
- metawarc - утилита для индексации и работы с WARC файлами современными методами. Преобразует данные WARC в файлы Parquet и умеет извлекать метаданные вложенных в WARC файлов
- apibackuper - утилита извлечения и архивации данных извлекаемых из API. Изначально делалась для задач архивации, реально применяется для всех задач автоматизации извлечения данных из API
- datacrafter - очень простой NoSQL ETL инструмент использующий наработки iterabledata и и ориентированный на работу с JSONL и подобными данными
У меня скорее хобби поддерживать эти инструменты, ну и многие интегрированы в продукты и проекты которые без открытого кода. Хорошо что поддержание их стало очень простым благодаря применению кодирующих ИИ агентов.
А документация поможет тем кто хотел бы узнать больше о том как они работают и для чего применимы.
#opensource #datatools #dataengineering
🔥8👍5✍2🥰1🎉1
Дата_продукт_—_больше,_чем_данные.pdf
1.2 MB
Завтра я читаю внутреннюю лекцию про дата продукты, к которой набросал вот такую презентацию. Понятно что презентация просто иллюстрация к речи, но основные смыслы в ней есть. Покидайте в меня критики / замечаний / комментариев по содержанию. Что так и что не так
#questions #data #dataengineering
#questions #data #dataengineering
1👍7❤4🍾2🔥1
Полезные ссылки про данные, технологии и не только:
- Amazon (AWS) покупает DuckLabs собственно команду создателей DuckDB. За команду можно только порадоваться, продукт у них невероятно крутой для всех кто занимается дата аналитикой и дата инженерией. Обещают что DuckDB останется с открыты кодом
- ox-alpha оказался GLM-5.3 об этом уже много где пишут, ну что сказать Z.ai молодцы, так порекламировали свою модель. Интересно во сколько эта реклама обошлась? Модель, кстати, хорошая, примерно как GPT-5.6 Luna
#dataengineering #aiagents
- Amazon (AWS) покупает DuckLabs собственно команду создателей DuckDB. За команду можно только порадоваться, продукт у них невероятно крутой для всех кто занимается дата аналитикой и дата инженерией. Обещают что DuckDB останется с открыты кодом
- ox-alpha оказался GLM-5.3 об этом уже много где пишут, ну что сказать Z.ai молодцы, так порекламировали свою модель. Интересно во сколько эта реклама обошлась? Модель, кстати, хорошая, примерно как GPT-5.6 Luna
#dataengineering #aiagents
DuckDB
DuckLabs to Join AWS, Projects to Remain Open Source
DuckLabs will join Amazon Web Services (AWS), which is expected to be effective in early September. The projects will remain open-source under the MIT license.
👍5⚡2✍2🔥2
Полезные ссылки про данные, технологии и не только:
- Search минималистичный браузер на базе WebKit для MacOS. Всего 3MB футпринт и почти мгновенный запуск.
- Why SQL won интервью с создателем DuckDB о том почему SQL побеждает (победил?) альтернативные подходы к хранению и доступу к данным.
- Open Code Review от команды Alibaba для автоматического ревью кода по правилам и с помощью ИИ агентов. Большая пользовательская база, плагины для множества сред и
- В Китае расширили ограничения на выезд на семьи топовых ИИ спецов даже не знаю как это комментировать. Вот если, к примеру, в России это еще не внедрели значит ли это что в России полноценной ИИ индустрии нет и топовых спецов в мировом понимании не осталось? А если остались то где их реестр? Можно уже анекдоты придумывать на тему "если ты такой умный то почему тебе еще выезд не запретили?"
#opensource #ai #sql #dataengineering
- Search минималистичный браузер на базе WebKit для MacOS. Всего 3MB футпринт и почти мгновенный запуск.
- Why SQL won интервью с создателем DuckDB о том почему SQL побеждает (победил?) альтернативные подходы к хранению и доступу к данным.
- Open Code Review от команды Alibaba для автоматического ревью кода по правилам и с помощью ИИ агентов. Большая пользовательская база, плагины для множества сред и
- В Китае расширили ограничения на выезд на семьи топовых ИИ спецов даже не знаю как это комментировать. Вот если, к примеру, в России это еще не внедрели значит ли это что в России полноценной ИИ индустрии нет и топовых спецов в мировом понимании не осталось? А если остались то где их реестр? Можно уже анекдоты придумывать на тему "если ты такой умный то почему тебе еще выезд не запретили?"
#opensource #ai #sql #dataengineering
GitHub
GitHub - driceroland/Search: A small, fast WebKit browser for macOS, by Office Commun.
A small, fast WebKit browser for macOS, by Office Commun. - driceroland/Search
👍5