Множество обновлений в internacia-db дата-продукте с метаданными по всем странам и страновым блокам таким как ЕС, СНГ, НАТО, ЕАЭС, структурам ООН и тысячи других.
Я как-то рассказывал что изучение межгосударственных образований - это мое очень давнее и немного странное хобби, у которого есть практическое применение, в случаях когда надо делать разметку по странам и в случаях когда надо иметь возможность делать аналитику по международным блокам - где они пересекаются, как можно их сравнить и так далее.
В последних нескольких релизах добавлено:
- несколько новых международных блоков таких как Pax Silica, WAICO, WANO, ARABSAT, CDRI, BLASMBL
- обновлены метаданные множества блоков, нескольких сотен. Что-то вручную, что-то с помощью LLM. Много добавлений provenance, подтверждений источников сведений.
- добавлен механизм контроля качества карточек блоков и стран и исправлены многие пробелы в карточках, например, отсутствия перечней стран участников и нормализованные названия стран. Механизм правил такой же как и в реестре Dateno, в виде отдельной команды анализа по набору YAML правил и выдачей результата в виде перечня ошибок в структурированном виде.
- и множество мелких изменений, подробности в CHANGELOG файле
Напомню, что результатом является дата продукт и все в итоге собирается в файлы данных в форматах Parquet, JSONL, YAML и базу данных DuckDB. А сам проект является частью поисковика по датасетам Dateno и используется там для разметки датасетов по странам.
#opendata #datasets #data #opensource
Я как-то рассказывал что изучение межгосударственных образований - это мое очень давнее и немного странное хобби, у которого есть практическое применение, в случаях когда надо делать разметку по странам и в случаях когда надо иметь возможность делать аналитику по международным блокам - где они пересекаются, как можно их сравнить и так далее.
В последних нескольких релизах добавлено:
- несколько новых международных блоков таких как Pax Silica, WAICO, WANO, ARABSAT, CDRI, BLASMBL
- обновлены метаданные множества блоков, нескольких сотен. Что-то вручную, что-то с помощью LLM. Много добавлений provenance, подтверждений источников сведений.
- добавлен механизм контроля качества карточек блоков и стран и исправлены многие пробелы в карточках, например, отсутствия перечней стран участников и нормализованные названия стран. Механизм правил такой же как и в реестре Dateno, в виде отдельной команды анализа по набору YAML правил и выдачей результата в виде перечня ошибок в структурированном виде.
- и множество мелких изменений, подробности в CHANGELOG файле
Напомню, что результатом является дата продукт и все в итоге собирается в файлы данных в форматах Parquet, JSONL, YAML и базу данных DuckDB. А сам проект является частью поисковика по датасетам Dateno и используется там для разметки датасетов по странам.
#opendata #datasets #data #opensource
GitHub
GitHub - datenoio/internacia-db: Public registry of the intergovernmental organizations, country groups and countries. Available…
Public registry of the intergovernmental organizations, country groups and countries. Available as JSONl, Parquet, YAML and DuckDB database datasets - datenoio/internacia-db
👍3🔥3✍2
Подборка ссылок про данные, технологии и не только:
- Ontology Playground opensource веб приложение от Microsoft для визуального исследования онтологий. Выглядит очень хорошо, поддерживает импорт и экспорт RDF/OWL. Делает работу с онтологиями куда более доступной. Интересно откуда такой возвращающийся из небытия интерес к онтологиям? Подозреваю что природа этого в росте интереса подключения ИИ агентов к осмысленному восприятию связей между сущностями. В этом смысле ИИ агенты могут быть не только потребителями, но и инструментами упрощения построения онтологий.
- How We Built Our Knowledge Base о том как Cerebras строят внутреннюю базу знаний. Технических подробностей не очень много, а смысловых и логических немало. Можно обратить внимание на том что базу знаний они строят с прицелом на ускорение онбординга, что логично
- Qwen 3.8 новая модель от Alibaba с 2.4T параметров, позиционируется как сравнимая с Fable 5. Пока не открытая, подписка через QwenCloud начинается с $6. Интересны сравнения с Kimi K3 и ждем открытия модели, конечно
- I burned all my tokens researching how to save tokens автор описывает оркестрацию более слабых моделей как субагентов более продвинутыми на примере исследования темы экономии токенов. И тема интересная, и подход полезно описан.
#opensource #ai #readings #knowledge
- Ontology Playground opensource веб приложение от Microsoft для визуального исследования онтологий. Выглядит очень хорошо, поддерживает импорт и экспорт RDF/OWL. Делает работу с онтологиями куда более доступной. Интересно откуда такой возвращающийся из небытия интерес к онтологиям? Подозреваю что природа этого в росте интереса подключения ИИ агентов к осмысленному восприятию связей между сущностями. В этом смысле ИИ агенты могут быть не только потребителями, но и инструментами упрощения построения онтологий.
- How We Built Our Knowledge Base о том как Cerebras строят внутреннюю базу знаний. Технических подробностей не очень много, а смысловых и логических немало. Можно обратить внимание на том что базу знаний они строят с прицелом на ускорение онбординга, что логично
- Qwen 3.8 новая модель от Alibaba с 2.4T параметров, позиционируется как сравнимая с Fable 5. Пока не открытая, подписка через QwenCloud начинается с $6. Интересны сравнения с Kimi K3 и ждем открытия модели, конечно
- I burned all my tokens researching how to save tokens автор описывает оркестрацию более слабых моделей как субагентов более продвинутыми на примере исследования темы экономии токенов. И тема интересная, и подход полезно описан.
#opensource #ai #readings #knowledge
GitHub
GitHub - microsoft/Ontology-Playground: Free, open-source web app for learning about ontologies and Microsoft Fabric IQ. Explore…
Free, open-source web app for learning about ontologies and Microsoft Fabric IQ. Explore a catalogue of pre-built ontologies, design your own visually, export as RDF/XML, and share interactive diag...
👍7
Я тут выложил свежие версии инструментов с открытым кодом для работы с данными iterabledata библиотеки для построчного чтения и записи данных из более чем 140 форматов файлов данных и undatum инструмент швейцарский нож для работы с данными в командной строке которые использует iterabledata для чтения, обработки и преобразования.
В iterabledata добавлено:
- поддержка множества новых форматов геоданных, научных данных и тд. таких как (
- поддержка чтения данных из озер данных и где-то записи таких как Apache Poimon и DuckLake
- поддержка записи данных в DeltaLake и Iceberg
- много изменений для повышения производительности чтения и записи Parquet файлов
- исправление множества ошибок и мелкие правки
В undatum добавлено:
- новая команда repack позволяет переупаковать дата файлы для большего сжатия. Если это формат parquet/orc/avro то использует внутренний кодек, если это файл сжатый Gzip, Bzip2 и тд. то пересжимает его. Нужно, в основном, для ситуаций когда надо пересжать слабо сжатые дата файлы вроде Parquet
- добавлена команда db dump по экспорту таблицы из базы данных сразу в Parquet/CSV/JSONL
- добавлена опция —low-memory для ряда команд для работы с файлами большого размера без чрезмерного использования RAM
- исправлен/модернизирован код генерации API на основе дата файла
- добавление использования DuckDB во многие команды, там где это возможно, для ускорения их работы
- множество мелких изменений и исправлений
#opensource #datatools #dataengineering
В iterabledata добавлено:
- поддержка множества новых форматов геоданных, научных данных и тд. таких как (
fgdb/gdb), MapInfo MIF, Esri ASCII Grid (asc), ArcInfo E00, LAS LiDAR, BAG bathymetry, CZML, XYZ, CIF, PDB, MATLAB MAT, SEG-Y, GRIB2, miniSEED- поддержка чтения данных из озер данных и где-то записи таких как Apache Poimon и DuckLake
- поддержка записи данных в DeltaLake и Iceberg
- много изменений для повышения производительности чтения и записи Parquet файлов
- исправление множества ошибок и мелкие правки
В undatum добавлено:
- новая команда repack позволяет переупаковать дата файлы для большего сжатия. Если это формат parquet/orc/avro то использует внутренний кодек, если это файл сжатый Gzip, Bzip2 и тд. то пересжимает его. Нужно, в основном, для ситуаций когда надо пересжать слабо сжатые дата файлы вроде Parquet
- добавлена команда db dump по экспорту таблицы из базы данных сразу в Parquet/CSV/JSONL
- добавлена опция —low-memory для ряда команд для работы с файлами большого размера без чрезмерного использования RAM
- исправлен/модернизирован код генерации API на основе дата файла
- добавление использования DuckDB во многие команды, там где это возможно, для ускорения их работы
- множество мелких изменений и исправлений
#opensource #datatools #dataengineering
GitHub
GitHub - datenoio/iterabledata: Iterable Data is a Python library for reading and writing data files row by row in a consistent…
Iterable Data is a Python library for reading and writing data files row by row in a consistent, iterator-based interface. It provides a unified API for working with various data formats (CSV, JSON...
✍6👍2❤1
Одно из наблюдаемых мной явлений - это как AI и Data стали почти синонимами и как взлетают по популярности новые инструменты работы с данными и как медленно умирают инструменты периферийные к трендам.
К примеру, OpenRefine довольно старый проект по чистке данных, возможно лучший из тех что открытым кодом уже с марта 2026 года перестал выпускать новые релизы. Разработка в репозитории ведется, но явно гораздо медленнее чем раньше и ничего радикально нового там не появляется.
Проект изначально был устроен так что работа с данными в нем ведется полностью в памяти и после определенных объемов он не справляется. При этом он позволяет вручную или с помощью синтаксисов Python или GREL (специальный язык для манипуляции данными) править данные в строках и колонках сохраняя полную историю изменений с возможностью их отката.
В его текущем движке ускорить его невозможно как и невозможно просто поддержать реально большие наборы данных. В результате области применения остаются только для данных относительно небольшого размера. Поэтому его так часто используют журналисты и он активно используется в разного рода проектах цифровой гуманитаристики. Причем альтернатив ему реально очень мало, в каком-то смысле совсем нет, если нужен интерфейс не программный, а пользовательский.
Интересно выживет ли он вообще? Не бросит ли его команда в какой-то момент?
Я как-то рассуждал тут вслух о том что если делать подобный инструмент современными методами, то движок внутри должен быть на базе DuckDB или Polars. Практически все операции можно делать SQL запросами, а вместо кода на GREL можно использовать text-to-SQL формы запросов совмещая инструмент очистки данных с data exploration.
#opensource #opendata #datatools
К примеру, OpenRefine довольно старый проект по чистке данных, возможно лучший из тех что открытым кодом уже с марта 2026 года перестал выпускать новые релизы. Разработка в репозитории ведется, но явно гораздо медленнее чем раньше и ничего радикально нового там не появляется.
Проект изначально был устроен так что работа с данными в нем ведется полностью в памяти и после определенных объемов он не справляется. При этом он позволяет вручную или с помощью синтаксисов Python или GREL (специальный язык для манипуляции данными) править данные в строках и колонках сохраняя полную историю изменений с возможностью их отката.
В его текущем движке ускорить его невозможно как и невозможно просто поддержать реально большие наборы данных. В результате области применения остаются только для данных относительно небольшого размера. Поэтому его так часто используют журналисты и он активно используется в разного рода проектах цифровой гуманитаристики. Причем альтернатив ему реально очень мало, в каком-то смысле совсем нет, если нужен интерфейс не программный, а пользовательский.
Интересно выживет ли он вообще? Не бросит ли его команда в какой-то момент?
Я как-то рассуждал тут вслух о том что если делать подобный инструмент современными методами, то движок внутри должен быть на базе DuckDB или Polars. Практически все операции можно делать SQL запросами, а вместо кода на GREL можно использовать text-to-SQL формы запросов совмещая инструмент очистки данных с data exploration.
#opensource #opendata #datatools
👍3❤1😢1