Полезные ссылки про данные, технологии и не только:
- Digital Government Outlook 2026 обзор ОЭСР по странам ОЭСР и странам которые они мониторят о их прогрессе в части цифровой инфраструктуры. Там много разного по развитым странам, из того что стоило бы отметить так это нулевые оценки Турции по Data accessibility и крайне низкие по открытости данных в целом, общая оценка 0.06. Чему я не удивлен, потому что в Турции на редкость много порталов открытых данных отдельных регионов и отсутствует национальная инициатива. Причем очень странно почему поскольку её есть из чего собирать. По другим странам тоже много интересного, полезно почитать всем кто изучает цифровизацию гос-ва.
- Clear свежий язык разработки и спецификаций одновременно созданный специально для работы ИИ агентов. Плюсы - он простой, минусы - примерно те же, он простой. В копилку языков ориентированных на работу с LLM больше чем на людей
- Lore система контроля версий нового поколения с акцентом на хранение бинарных файлов, а не просто текстового кода. Создано внутри Epic Games и надо полагать с акцентом на их задачи, работы не только с кодом, но и большими объемами бинарных ресурсов внутри игр
- Cursor Origin преданонсированный сервис от Cursor'а в виде Git'а для агентов. Звучит как заявка на конкуренцию с Github'ом, так что любопытно, хотя и не может быть просто
#ai #opensource #government #digital
- Digital Government Outlook 2026 обзор ОЭСР по странам ОЭСР и странам которые они мониторят о их прогрессе в части цифровой инфраструктуры. Там много разного по развитым странам, из того что стоило бы отметить так это нулевые оценки Турции по Data accessibility и крайне низкие по открытости данных в целом, общая оценка 0.06. Чему я не удивлен, потому что в Турции на редкость много порталов открытых данных отдельных регионов и отсутствует национальная инициатива. Причем очень странно почему поскольку её есть из чего собирать. По другим странам тоже много интересного, полезно почитать всем кто изучает цифровизацию гос-ва.
- Clear свежий язык разработки и спецификаций одновременно созданный специально для работы ИИ агентов. Плюсы - он простой, минусы - примерно те же, он простой. В копилку языков ориентированных на работу с LLM больше чем на людей
- Lore система контроля версий нового поколения с акцентом на хранение бинарных файлов, а не просто текстового кода. Создано внутри Epic Games и надо полагать с акцентом на их задачи, работы не только с кодом, но и большими объемами бинарных ресурсов внутри игр
- Cursor Origin преданонсированный сервис от Cursor'а в виде Git'а для агентов. Звучит как заявка на конкуренцию с Github'ом, так что любопытно, хотя и не может быть просто
#ai #opensource #government #digital
OECD
Digital Government Outlook 2026
Governments today face a growing disconnect between rising expectations for speed, adaptability and responsiveness, and institutional systems that have not kept pace. Digital technologies and data are no longer optional enablers; they have become core infrastructure…
👍3✍2❤1
ORD (Open Reaction Database) открытая база реакций состоящая из более 500 наборов данных и сотен тысяч реакций описанных в структурированной форме.
У проекта открытый код и открытые данные на Github.
Из необычного данные публикуются в форматах Parquet и сжатом Protobuf (.pb.gz).
Основным источником является база патентов США, а кроме того там используется некоторое число открытых датасетов к которым привязаны реакции. Внутри используется CML (Chemical Markup Language) язык разметки для химических реакций.
Применений может быть множество, например, в автоматизации моделирования создания новых веществ, поиска новых реакций и так далее. Иначе говоря так и просится для специализированных ИИ задач.
#opendata #opensource #chemistry
У проекта открытый код и открытые данные на Github.
Из необычного данные публикуются в форматах Parquet и сжатом Protobuf (.pb.gz).
Основным источником является база патентов США, а кроме того там используется некоторое число открытых датасетов к которым привязаны реакции. Внутри используется CML (Chemical Markup Language) язык разметки для химических реакций.
Применений может быть множество, например, в автоматизации моделирования создания новых веществ, поиска новых реакций и так далее. Иначе говоря так и просится для специализированных ИИ задач.
#opendata #opensource #chemistry
👍8🔥4✍3
NVIDIA выложили в открытый доступ BioNeMo Agent Toolkit инструментарий для работы специалистов-биоинформатиков с ИИ агентами. Это не LLM модель, не программный продукт, а коллекция большого числа файлов навыков (SKILL.md), документации и примеров кода оптимизированное под Claude, Codex и Nemotron и инфраструктуру сервисов NVIDIA. Все под лицензиями Apache 2.0 и CC-BY-4.0
По сути это не то чтобы радикально новый, но всё же новый подход к документированию API и сервисов. Каждый файл SKILL.md сопровождается документацией к эндпоинтам API и примерами использования с дополнительными описаниями как с ними работать.
Общаясь со спецами по биоинформатике я уже не первый раз слышу что они используют специализированные ИИ инструменты, но ощущают что от всех них откажутся в сторону general LLM, учитывая как те развиваются. Пример с NVIDIA тоже показателен. Не разработка отдельного закрытого продукта, многие из которых есть на рынке, а встраивание в собственную экосистему и экосистему Anthropic и OpenAI
#opensource #ai #biotech
По сути это не то чтобы радикально новый, но всё же новый подход к документированию API и сервисов. Каждый файл SKILL.md сопровождается документацией к эндпоинтам API и примерами использования с дополнительными описаниями как с ними работать.
Общаясь со спецами по биоинформатике я уже не первый раз слышу что они используют специализированные ИИ инструменты, но ощущают что от всех них откажутся в сторону general LLM, учитывая как те развиваются. Пример с NVIDIA тоже показателен. Не разработка отдельного закрытого продукта, многие из которых есть на рынке, а встраивание в собственную экосистему и экосистему Anthropic и OpenAI
#opensource #ai #biotech
👍7❤1🔥1
Для тех кто любит работать с данными, я недавно залил обновления в два репозитория:
- iterabledata библиотека для Python для чтения условно любых файлов и баз данных в итеративном режиме в том числе в потоковом режиме с экономией памяти
- undatum утилита для командной строки для манипуляции условно любыми дата файлами, их конверсии, чтении данных, анализу и документированию. Внутри используется как раз библиотека iterabledata
В чем особенность этих релизов.
В iterabledata исправлена возможность записи в форматы Avro, Orc и Lance. Не самые большие изменения, но повышающие удобство работы с библиотекой.
А утилита undatum была радикально обновлена с переводом большей части функций на работу через iterabledata и отказа от части внутреннего кода. Теперь работает преобразование файлов всех форматов которые поддерживает iterabledata - это более 100 форматов.
Сами инструменты были вдохновлены утилитами xsv и qsv и были написаны для того чтобы можно было удобным образом работать с изначально с JSONl/NDJSON файлами сжатыми любым способом, а далее с форматами вроде Parquet, ORC и остальные.
Вообще у меня не так много времени остается на программирование в последнее время, это скорее как хобби, но хобби полезное.
#opensource #datatools #dataengineering
- iterabledata библиотека для Python для чтения условно любых файлов и баз данных в итеративном режиме в том числе в потоковом режиме с экономией памяти
- undatum утилита для командной строки для манипуляции условно любыми дата файлами, их конверсии, чтении данных, анализу и документированию. Внутри используется как раз библиотека iterabledata
В чем особенность этих релизов.
В iterabledata исправлена возможность записи в форматы Avro, Orc и Lance. Не самые большие изменения, но повышающие удобство работы с библиотекой.
А утилита undatum была радикально обновлена с переводом большей части функций на работу через iterabledata и отказа от части внутреннего кода. Теперь работает преобразование файлов всех форматов которые поддерживает iterabledata - это более 100 форматов.
Сами инструменты были вдохновлены утилитами xsv и qsv и были написаны для того чтобы можно было удобным образом работать с изначально с JSONl/NDJSON файлами сжатыми любым способом, а далее с форматами вроде Parquet, ORC и остальные.
Вообще у меня не так много времени остается на программирование в последнее время, это скорее как хобби, но хобби полезное.
#opensource #datatools #dataengineering
1🔥14👍11✍4
Подборка полезных ссылок про данные, технологии и не только:
- Onyxia платформа от французского института статистики INSEE для организации работы команды data science. Помогает разворачивать разные открытые продукты под задачи: тетрадки Jupyter, R Studio и многие другие с акцентом на статистические данные и не только. Предназначена для обучения студентов в первую очередь
- miller аналог AWK для CSV файлов, позволяет их удобно форматировать с командной строки.
- tad настольный редактор для табличных файлов, в первую очередь это файлы CSV и Parquet, но также поддерживает и базы sqlite и duckdb. Из минусов - не обновлялся около года
- uPlot одна из наиболее быстрых и легковесных библиотек визуализации больших объемов данных временных рядов.
#opensource #datatools
- Onyxia платформа от французского института статистики INSEE для организации работы команды data science. Помогает разворачивать разные открытые продукты под задачи: тетрадки Jupyter, R Studio и многие другие с акцентом на статистические данные и не только. Предназначена для обучения студентов в первую очередь
- miller аналог AWK для CSV файлов, позволяет их удобно форматировать с командной строки.
- tad настольный редактор для табличных файлов, в первую очередь это файлы CSV и Parquet, но также поддерживает и базы sqlite и duckdb. Из минусов - не обновлялся около года
- uPlot одна из наиболее быстрых и легковесных библиотек визуализации больших объемов данных временных рядов.
#opensource #datatools
GitHub
GitHub - InseeFrLab/onyxia: 🔬 Data science environment for k8s
🔬 Data science environment for k8s. Contribute to InseeFrLab/onyxia development by creating an account on GitHub.
🔥4✍3👍3
Ещё немного про утилиту с открытым кодом для работы с данными undatum которую я когда-то разработал и потихоньку развиваю. Это не коммерческий продукт, а скорее вспомогательный инструмент когда надо что-то поделать с данными в командной строке и эти данные не просто плоские CSV файлы, а что-то посложнее.
Я приводил в пример ее использование для преобразования файлов, а вот дополнительные примеры того как ее можно применять.
Быстрое API на основе файла с данными
Предположим есть файл CSV, JSONl, Parquet или еще какой-то и его содержанию надо быстро дать доступ кому-то внешнему, но передавать файл/файлы целиком нельзя по какой-либо причине.
Очень простая и быстрая команда
Автоматически проанализирует файл и запустит веб-сервер с доступом к данным через REST API и возможностью фильтрации по его полям. Из плюсов - минимум усилий. Из минусов - в нем нет сейчас какой-то сложной программной логике поиска по полям и тд., только полный или частичный мэтчинг.
В итоге получается неидеальное, зато очень быстро развертываемое API которое можно выставлять внешним пользователям.
Быстрое документирование дата файлов
Когда есть некий файл с данными к нему нет дополнительной информации, а очень надо быстро в нем разобраться, то генератор Markdown документации
В самом простом виде выглядит как
выводит на экран итоговый Markdown текст
Более продвинутый
Создает документацию в формате JSON с Markdown блоками перечисленными списком и на русском языке.
Загрузка данных в NoSQL/SQL базы данных
Команда ingest изначально делалась для продвинутого импорта данных в MongoDB и Elasticsearch и идея в том чтобы на вход получить файл и строку подключения в базе данных после чего загрузить содержимое в выбранную таблицу/коллекцию/индекс
Пример команды
В чем важная особенность undatum от специализированных инструментов которые умеют это же? В поддержке любых сжатых файлов .xz, .gz, .zst, .lz4, .bz2 и так далее. Потому что хранить данные в чистом NDJSON или CSV - это прямо таки очень неэффективно. Особенно когда это много слепков коллекции из MongoDB или индекса Elasticsearch.
#opensource #datatools #data
Я приводил в пример ее использование для преобразования файлов, а вот дополнительные примеры того как ее можно применять.
Быстрое API на основе файла с данными
Предположим есть файл CSV, JSONl, Parquet или еще какой-то и его содержанию надо быстро дать доступ кому-то внешнему, но передавать файл/файлы целиком нельзя по какой-либо причине.
Очень простая и быстрая команда
undatum api run data.jsonl
Автоматически проанализирует файл и запустит веб-сервер с доступом к данным через REST API и возможностью фильтрации по его полям. Из плюсов - минимум усилий. Из минусов - в нем нет сейчас какой-то сложной программной логике поиска по полям и тд., только полный или частичный мэтчинг.
В итоге получается неидеальное, зато очень быстро развертываемое API которое можно выставлять внешним пользователям.
Быстрое документирование дата файлов
Когда есть некий файл с данными к нему нет дополнительной информации, а очень надо быстро в нем разобраться, то генератор Markdown документации
В самом простом виде выглядит как
undatum ai doc data.csv
выводит на экран итоговый Markdown текст
Более продвинутый
undatum ai doc —blocks general,schema,quality,examples,codebook —format json —language Russian data.csv
Создает документацию в формате JSON с Markdown блоками перечисленными списком и на русском языке.
Загрузка данных в NoSQL/SQL базы данных
Команда ingest изначально делалась для продвинутого импорта данных в MongoDB и Elasticsearch и идея в том чтобы на вход получить файл и строку подключения в базе данных после чего загрузить содержимое в выбранную таблицу/коллекцию/индекс
Пример команды
undatum ingest data.jsonl https://elasticsearch:9200 myindex myindex --dbtype elasticsearch --api-key YOUR_API_KEY --doc-id id
В чем важная особенность undatum от специализированных инструментов которые умеют это же? В поддержке любых сжатых файлов .xz, .gz, .zst, .lz4, .bz2 и так далее. Потому что хранить данные в чистом NDJSON или CSV - это прямо таки очень неэффективно. Особенно когда это много слепков коллекции из MongoDB или индекса Elasticsearch.
#opensource #datatools #data
GitHub
GitHub - datacoon/undatum: undatum: a command-line tool for data processing. Brings CSV simplicity to NDJSON, BSON, XML and other…
undatum: a command-line tool for data processing. Brings CSV simplicity to NDJSON, BSON, XML and other data files - datacoon/undatum
👍12✍2🔥2
OmniRoute локальный маршрутизатор запросов к ИИ провайдерам умеющий работать с большим их количеством, сейчас это 231 провайдер в том числе с теми которые дают бесплатные квоты. Позиционируется как инструмент сильной оптимизации потребления токенов, позволяет сократить их благодаря сжатию RTK + Caveman.
Что характерно даже поддерживают одного из российских провайдеров - gigachat (можно увидеть в общем списке), но собственно и только. Того же Яндекс'а к примеру тут нет почему-то.
Плюс обещают прозрачную интеграцию с 1proxy и возможность обхода блокировок из стран которым некоторые AI провайдеры не дают доступа (Россия, Иран, Куба, Китай и тд.).
На чем зарабатывают непонятно, думаю что монетизацию включат позже и привяжут как раз к сервисам прокси или экономии токенов.
Выглядит как очень полезный инструмент еще и из-за встроенной аналитики потребления, так что надо пробовать на практике. Если все работает как обещано - ценное дополнение к техническому стеку.
#opensource #ai #tools
Что характерно даже поддерживают одного из российских провайдеров - gigachat (можно увидеть в общем списке), но собственно и только. Того же Яндекс'а к примеру тут нет почему-то.
Плюс обещают прозрачную интеграцию с 1proxy и возможность обхода блокировок из стран которым некоторые AI провайдеры не дают доступа (Россия, Иран, Куба, Китай и тд.).
На чем зарабатывают непонятно, думаю что монетизацию включат позже и привяжут как раз к сервисам прокси или экономии токенов.
Выглядит как очень полезный инструмент еще и из-за встроенной аналитики потребления, так что надо пробовать на практике. Если все работает как обещано - ценное дополнение к техническому стеку.
#opensource #ai #tools
✍5👍3⚡2
В качестве регулярных напоминаний коллекция библиотек и инструментов с открытым кодом к которым я приложил свою руку и которые могут быть полезны многим работающим с данными:
- qddate библиотека для Python быстрого парсинга дат написанных на множестве языков и во множестве форматов. Не такой широкий охват форматов как у dateutil, но гораздо более высокая скорость парсинга.
- newsworker библиотека и инструмент на Python для извлечения новостей из веб страниц. Например, когда надо подписаться на сайт через RSS, а RSS ленты нет. Понимает множество форматов дат используя qddate и динамически идентифицирует новостные блоки.
- russiannames база данных и парсер Python для разного рода написания ФИО принятых в российской практике. В базе десятки тысяч имен и отчеств и сотни тысяч фамилий
- undatum утилита командной строки для работы с датасетами в форматах CSV, JSONl, Parquet и сотне других форматах. Умеет преобразовывать данные и проводить с ними различные операции. Эдакий швейцарский нож для работы с данными с командной строки
- metawarc утилита по извлечению метаданных из файлов веб-архивов (WARC). Умеет извлекать метаданные из офисных файлов, PDF, изображений и тд.
- plainrussian сервис проверки простоты текстов на русском языке используя формулы читабельности адаптированные под русский язык. Код самого сервиса и формул для расчета
- iterabledata библиотека для Python для чтения и записи практически всех существующих форматов файлов с данными. Используется в утилите undatum
- internacia-db дата продукт в виде датасета по всем странам и макрорегионам во множестве форматов и покрытием всего мира и многими метаданными по каждой территории
#opensource #datatools #tools
- qddate библиотека для Python быстрого парсинга дат написанных на множестве языков и во множестве форматов. Не такой широкий охват форматов как у dateutil, но гораздо более высокая скорость парсинга.
- newsworker библиотека и инструмент на Python для извлечения новостей из веб страниц. Например, когда надо подписаться на сайт через RSS, а RSS ленты нет. Понимает множество форматов дат используя qddate и динамически идентифицирует новостные блоки.
- russiannames база данных и парсер Python для разного рода написания ФИО принятых в российской практике. В базе десятки тысяч имен и отчеств и сотни тысяч фамилий
- undatum утилита командной строки для работы с датасетами в форматах CSV, JSONl, Parquet и сотне других форматах. Умеет преобразовывать данные и проводить с ними различные операции. Эдакий швейцарский нож для работы с данными с командной строки
- metawarc утилита по извлечению метаданных из файлов веб-архивов (WARC). Умеет извлекать метаданные из офисных файлов, PDF, изображений и тд.
- plainrussian сервис проверки простоты текстов на русском языке используя формулы читабельности адаптированные под русский язык. Код самого сервиса и формул для расчета
- iterabledata библиотека для Python для чтения и записи практически всех существующих форматов файлов с данными. Используется в утилите undatum
- internacia-db дата продукт в виде датасета по всем странам и макрорегионам во множестве форматов и покрытием всего мира и многими метаданными по каждой территории
#opensource #datatools #tools
GitHub
GitHub - ivbeg/qddate: Quick and dirty date parsing Python library to parse HTML dates really fast
Quick and dirty date parsing Python library to parse HTML dates really fast - ivbeg/qddate
👍13🔥6✍4❤4
newsworker-missing-features-audit.pdf
286.1 KB
Помните я писал подход к разработке через режим
где прежде чем приступаешь к изменениям в коде запускаешь неоднократный анализ имеющегося.
Я регулярно тестирую новые LLM модели и агентские сервисы на разных репозиториях запросами именно на их полноты и подготовки роадмапов. Эдакий внешний ревью архитектуры, кода и перспектив продукта.
Примеры такого анализа на коммерческих репозиториях показать я не могу, а вот почему бы не показать пример анализа открытого кода. Все та же библиотека и инструмент newsworker о которой я ранее писал и которая умеет преобразовывать страницы без RSS/Atom в RSS/Atom и другие новостные ленты.
В этом примере я запросил у агента Z.ai и модель GLM-5.2 провести аудит репозитория и составить перечень нехватающих функций и роадмап по их внедрению.
Результат более чем удовлетворительный. Не идеальный, но таким он и не может быть, но экономящий время и через несколько корректировочных вводных позволяющий превратить этот открытый продукт в более удобный инструмент.
Причем разные инструменты и LLM дают разные результаты. Хороший итоговый анализ является сводным и дополненным личными архитектурными комментариями видения продукта.
Ну и конечно не могу не добавить что все что касается открытых репозиториев - это отличный полигон для тестирования применения кодирующих ИИ.
#opensource #ai #coding
set the goal → analyze + analyze + analyze → review → design → plan → execute → (repeat tests till conditions met) → verify
где прежде чем приступаешь к изменениям в коде запускаешь неоднократный анализ имеющегося.
Я регулярно тестирую новые LLM модели и агентские сервисы на разных репозиториях запросами именно на их полноты и подготовки роадмапов. Эдакий внешний ревью архитектуры, кода и перспектив продукта.
Примеры такого анализа на коммерческих репозиториях показать я не могу, а вот почему бы не показать пример анализа открытого кода. Все та же библиотека и инструмент newsworker о которой я ранее писал и которая умеет преобразовывать страницы без RSS/Atom в RSS/Atom и другие новостные ленты.
В этом примере я запросил у агента Z.ai и модель GLM-5.2 провести аудит репозитория и составить перечень нехватающих функций и роадмап по их внедрению.
Результат более чем удовлетворительный. Не идеальный, но таким он и не может быть, но экономящий время и через несколько корректировочных вводных позволяющий превратить этот открытый продукт в более удобный инструмент.
Причем разные инструменты и LLM дают разные результаты. Хороший итоговый анализ является сводным и дополненным личными архитектурными комментариями видения продукта.
Ну и конечно не могу не добавить что все что касается открытых репозиториев - это отличный полигон для тестирования применения кодирующих ИИ.
#opensource #ai #coding
👍7✍4⚡2❤1💊1
В продолжение моих размышлений про чтение новостей и инструменты для этого, я на этих выходных чуть потратил времени и сделал в библиотеке newsworker очень давнюю идею шаблонов извлечения новостей.
Оригинальная идея инструмента была в том что алгоритм идентифицировал новостные блоки и даты динамически, каждый раз прогоняя веб страницу через кластеризацию и идентификацию дат по сотням шаблонам. Это хотя и ускорено, но все таки не самый оптимальный способ извлечения контента.
Идея была в том чтобы по итогам анализа страницы создавать псевдокод/конфиг и потом уже по нему извлекать контент. В общем-то ничего сверх сложного, но и. не настолько просто чтобы можно было сделать быстро. Сейчас, с помощью ИИ агентов для разработки все сильно ускорилось.
Так что в последней версии newsworker появилось две команды analyze и extract где первая создает спецификацию, а вторая по спецификации извлекает новости.
Второе важное изменение - это команда serve запускающая инструмент в серверном режиме, можно по эндпоинту передавать ссылку на веб страницу и получать RSS/Atom ленту на выходе. Тем самым можно интегрировать с любой RSS читалкой и развернуть этот сервер у себя локально или где-то в сети. Сервер по умолчанию работает через спецификации поэтому потребление CPU и памяти в нем минимизировано.
Все это не делает пока что инструмент для конечных пользователей, нужны технические навыки чтобы его развернуть. Но в целом я чувствую некую завершенность того что хотелось сделать еще лет 15 назад, и сейчас удалось доделать за пару дней и применять с пользой. Как минимум мне лично это облегчит чтение новостей из многих источников.
#opensource
Оригинальная идея инструмента была в том что алгоритм идентифицировал новостные блоки и даты динамически, каждый раз прогоняя веб страницу через кластеризацию и идентификацию дат по сотням шаблонам. Это хотя и ускорено, но все таки не самый оптимальный способ извлечения контента.
Идея была в том чтобы по итогам анализа страницы создавать псевдокод/конфиг и потом уже по нему извлекать контент. В общем-то ничего сверх сложного, но и. не настолько просто чтобы можно было сделать быстро. Сейчас, с помощью ИИ агентов для разработки все сильно ускорилось.
Так что в последней версии newsworker появилось две команды analyze и extract где первая создает спецификацию, а вторая по спецификации извлекает новости.
Второе важное изменение - это команда serve запускающая инструмент в серверном режиме, можно по эндпоинту передавать ссылку на веб страницу и получать RSS/Atom ленту на выходе. Тем самым можно интегрировать с любой RSS читалкой и развернуть этот сервер у себя локально или где-то в сети. Сервер по умолчанию работает через спецификации поэтому потребление CPU и памяти в нем минимизировано.
Все это не делает пока что инструмент для конечных пользователей, нужны технические навыки чтобы его развернуть. Но в целом я чувствую некую завершенность того что хотелось сделать еще лет 15 назад, и сейчас удалось доделать за пару дней и применять с пользой. Как минимум мне лично это облегчит чтение новостей из многих источников.
#opensource
👍8✍5🔥3⚡1
datannur свежее ПО каталога данных с открытым кодом под MIT лицензией. На самом деле является каталогом метаданных и работает через сканирование локальных папок с дата файлами на диске на основе которых создаются их профили, извлекаются колонки/переменные, считается статистика и так далее. И даже есть ассистент отвечающий на вопросы про эти метаданные/данные.
Проект любопытный, но ИМХО автор совсем не понимает своих предполагаемых пользователей и переусложняет то что надо, наоборот, упрощать.
Тем не менее хорошие идеи там тоже есть и посмотрим куда автор свой проект будет развивать.
#opensource #opendata #datacatalogs
Проект любопытный, но ИМХО автор совсем не понимает своих предполагаемых пользователей и переусложняет то что надо, наоборот, упрощать.
Тем не менее хорошие идеи там тоже есть и посмотрим куда автор свой проект будет развивать.
#opensource #opendata #datacatalogs
👍2🤔1
Allemannsdata коллекция MCP сервисов для 24 API/сервисов открытых норвежских данных. Хотелось бы сказать что сделано норвежским правительством/министерством цифры, но нет, это инициатива одного разработчика.
Дело полезное, но еще лучше когда будет официальное чтобы точно быть уверенными что будет стабильно работать.
А вообще вот вам пример потестить навыки, берете открытое госAPI или большой датасет и делаете над ним открытый MCP сервис. Почему нет?
#opensource #API #AI
Дело полезное, но еще лучше когда будет официальное чтобы точно быть уверенными что будет стабильно работать.
А вообще вот вам пример потестить навыки, берете открытое госAPI или большой датасет и делаете над ним открытый MCP сервис. Почему нет?
#opensource #API #AI
👍4
Govviz UK government performance проект по визуализации эффективности работы Правительства Великобритании. Выглядит как красивый дашборд с большим числом графиков, внутри сбор данных из десятка источников и их наглядная визуализация
Все с открытым кодом и ничто не мешает по аналогии сделать визуализацию для какой-то другой страны с не самыми большими усилиями.
Сам проект весь на клаудекоденный, заточенный под использование с помощью ИИ, имеет MCP сервис, множество описаний процессов и так далее.
Я бы на него смотрел как на новую форму подачи официальной статистики, довольно интересную форму.
#opensource #opendata #statistics
Все с открытым кодом и ничто не мешает по аналогии сделать визуализацию для какой-то другой страны с не самыми большими усилиями.
Сам проект весь на клаудекоденный, заточенный под использование с помощью ИИ, имеет MCP сервис, множество описаний процессов и так далее.
Я бы на него смотрел как на новую форму подачи официальной статистики, довольно интересную форму.
#opensource #opendata #statistics
👍10✍1🔥1😁1🤔1
Flint язык для построения диаграмм от команды Microsoft Research заточенный под использование ИИ агентами. Продукт включает визуализацию 30+ видов графиков с помощью разных графических библиотек, MCP сервер для интеграции с ИИ агентами.
Выглядит как полезный инструмент под MIT лицензией.
#opensource #dataviz
Выглядит как полезный инструмент под MIT лицензией.
#opensource #dataviz
👍11✍6🔥5🤔1
Magic Extractor open source инструмент для извлечения содержимого из большого числа разных форматов образов дисков, архивов и иных цифровых контейнеров. Автор пошел по пути охвата как можно большего числа форматов и сам инструмент явным образом написан под Windows и идентификацию файлов в непонятных форматах.
Применение явно преимущественно для задач цифровой форенсики, что нужно не только исследователям/дознавателям, но и цифровым архивистам которые работают с унаследованными бинарниками. Тем более что многие из поддерживаемых архивных форматов - это именно что исторические архиваторы, не самые популярные.
Немного пересекается с тем что я делаю по iterabledata, например, в части работы с файлами почтовых клиентов. Но лишь немного потому как подходы разные, Magic Extractor работает на извлечение, а iterabledata на последовательное чтение.
Вообще я лично очень люблю тему форенсики еще с детства, когда приходилось возиться с огромным числом незнакомых форматов файлов для вскрытия защиты игр, save файлов и тд. Практическую пользу для себя вижу пока небольшую, но всегда приятно вспомнить старое когда анализ бинарных файлов я осваивал ещё до полноценного программирования.
Кстати, большая часть сигнатур для подобных инструментов идут из проектов вроде TrID который активно используется именно в задачах цифровой архивации вроде PRONOM.
#opensource #tools
Применение явно преимущественно для задач цифровой форенсики, что нужно не только исследователям/дознавателям, но и цифровым архивистам которые работают с унаследованными бинарниками. Тем более что многие из поддерживаемых архивных форматов - это именно что исторические архиваторы, не самые популярные.
Немного пересекается с тем что я делаю по iterabledata, например, в части работы с файлами почтовых клиентов. Но лишь немного потому как подходы разные, Magic Extractor работает на извлечение, а iterabledata на последовательное чтение.
Вообще я лично очень люблю тему форенсики еще с детства, когда приходилось возиться с огромным числом незнакомых форматов файлов для вскрытия защиты игр, save файлов и тд. Практическую пользу для себя вижу пока небольшую, но всегда приятно вспомнить старое когда анализ бинарных файлов я осваивал ещё до полноценного программирования.
Кстати, большая часть сигнатур для подобных инструментов идут из проектов вроде TrID который активно используется именно в задачах цифровой архивации вроде PRONOM.
#opensource #tools
GitHub
GitHub - xchwarze/magic-extractor: Universal Windows extraction tool that detects unknown files and routes them to the right bundled…
Universal Windows extraction tool that detects unknown files and routes them to the right bundled extractor. - xchwarze/magic-extractor
❤5✍2🔥1
Множество обновлений в internacia-db дата-продукте с метаданными по всем странам и страновым блокам таким как ЕС, СНГ, НАТО, ЕАЭС, структурам ООН и тысячи других.
Я как-то рассказывал что изучение межгосударственных образований - это мое очень давнее и немного странное хобби, у которого есть практическое применение, в случаях когда надо делать разметку по странам и в случаях когда надо иметь возможность делать аналитику по международным блокам - где они пересекаются, как можно их сравнить и так далее.
В последних нескольких релизах добавлено:
- несколько новых международных блоков таких как Pax Silica, WAICO, WANO, ARABSAT, CDRI, BLASMBL
- обновлены метаданные множества блоков, нескольких сотен. Что-то вручную, что-то с помощью LLM. Много добавлений provenance, подтверждений источников сведений.
- добавлен механизм контроля качества карточек блоков и стран и исправлены многие пробелы в карточках, например, отсутствия перечней стран участников и нормализованные названия стран. Механизм правил такой же как и в реестре Dateno, в виде отдельной команды анализа по набору YAML правил и выдачей результата в виде перечня ошибок в структурированном виде.
- и множество мелких изменений, подробности в CHANGELOG файле
Напомню, что результатом является дата продукт и все в итоге собирается в файлы данных в форматах Parquet, JSONL, YAML и базу данных DuckDB. А сам проект является частью поисковика по датасетам Dateno и используется там для разметки датасетов по странам.
#opendata #datasets #data #opensource
Я как-то рассказывал что изучение межгосударственных образований - это мое очень давнее и немного странное хобби, у которого есть практическое применение, в случаях когда надо делать разметку по странам и в случаях когда надо иметь возможность делать аналитику по международным блокам - где они пересекаются, как можно их сравнить и так далее.
В последних нескольких релизах добавлено:
- несколько новых международных блоков таких как Pax Silica, WAICO, WANO, ARABSAT, CDRI, BLASMBL
- обновлены метаданные множества блоков, нескольких сотен. Что-то вручную, что-то с помощью LLM. Много добавлений provenance, подтверждений источников сведений.
- добавлен механизм контроля качества карточек блоков и стран и исправлены многие пробелы в карточках, например, отсутствия перечней стран участников и нормализованные названия стран. Механизм правил такой же как и в реестре Dateno, в виде отдельной команды анализа по набору YAML правил и выдачей результата в виде перечня ошибок в структурированном виде.
- и множество мелких изменений, подробности в CHANGELOG файле
Напомню, что результатом является дата продукт и все в итоге собирается в файлы данных в форматах Parquet, JSONL, YAML и базу данных DuckDB. А сам проект является частью поисковика по датасетам Dateno и используется там для разметки датасетов по странам.
#opendata #datasets #data #opensource
GitHub
GitHub - datenoio/internacia-db: Public registry of the intergovernmental organizations, country groups and countries. Available…
Public registry of the intergovernmental organizations, country groups and countries. Available as JSONl, Parquet, YAML and DuckDB database datasets - datenoio/internacia-db
👍3🔥3✍2
Подборка ссылок про данные, технологии и не только:
- Ontology Playground opensource веб приложение от Microsoft для визуального исследования онтологий. Выглядит очень хорошо, поддерживает импорт и экспорт RDF/OWL. Делает работу с онтологиями куда более доступной. Интересно откуда такой возвращающийся из небытия интерес к онтологиям? Подозреваю что природа этого в росте интереса подключения ИИ агентов к осмысленному восприятию связей между сущностями. В этом смысле ИИ агенты могут быть не только потребителями, но и инструментами упрощения построения онтологий.
- How We Built Our Knowledge Base о том как Cerebras строят внутреннюю базу знаний. Технических подробностей не очень много, а смысловых и логических немало. Можно обратить внимание на том что базу знаний они строят с прицелом на ускорение онбординга, что логично
- Qwen 3.8 новая модель от Alibaba с 2.4T параметров, позиционируется как сравнимая с Fable 5. Пока не открытая, подписка через QwenCloud начинается с $6. Интересны сравнения с Kimi K3 и ждем открытия модели, конечно
- I burned all my tokens researching how to save tokens автор описывает оркестрацию более слабых моделей как субагентов более продвинутыми на примере исследования темы экономии токенов. И тема интересная, и подход полезно описан.
#opensource #ai #readings #knowledge
- Ontology Playground opensource веб приложение от Microsoft для визуального исследования онтологий. Выглядит очень хорошо, поддерживает импорт и экспорт RDF/OWL. Делает работу с онтологиями куда более доступной. Интересно откуда такой возвращающийся из небытия интерес к онтологиям? Подозреваю что природа этого в росте интереса подключения ИИ агентов к осмысленному восприятию связей между сущностями. В этом смысле ИИ агенты могут быть не только потребителями, но и инструментами упрощения построения онтологий.
- How We Built Our Knowledge Base о том как Cerebras строят внутреннюю базу знаний. Технических подробностей не очень много, а смысловых и логических немало. Можно обратить внимание на том что базу знаний они строят с прицелом на ускорение онбординга, что логично
- Qwen 3.8 новая модель от Alibaba с 2.4T параметров, позиционируется как сравнимая с Fable 5. Пока не открытая, подписка через QwenCloud начинается с $6. Интересны сравнения с Kimi K3 и ждем открытия модели, конечно
- I burned all my tokens researching how to save tokens автор описывает оркестрацию более слабых моделей как субагентов более продвинутыми на примере исследования темы экономии токенов. И тема интересная, и подход полезно описан.
#opensource #ai #readings #knowledge
GitHub
GitHub - microsoft/Ontology-Playground: Free, open-source web app for learning about ontologies and Microsoft Fabric IQ. Explore…
Free, open-source web app for learning about ontologies and Microsoft Fabric IQ. Explore a catalogue of pre-built ontologies, design your own visually, export as RDF/XML, and share interactive diag...
👍7
Я тут выложил свежие версии инструментов с открытым кодом для работы с данными iterabledata библиотеки для построчного чтения и записи данных из более чем 140 форматов файлов данных и undatum инструмент швейцарский нож для работы с данными в командной строке которые использует iterabledata для чтения, обработки и преобразования.
В iterabledata добавлено:
- поддержка множества новых форматов геоданных, научных данных и тд. таких как (
- поддержка чтения данных из озер данных и где-то записи таких как Apache Poimon и DuckLake
- поддержка записи данных в DeltaLake и Iceberg
- много изменений для повышения производительности чтения и записи Parquet файлов
- исправление множества ошибок и мелкие правки
В undatum добавлено:
- новая команда repack позволяет переупаковать дата файлы для большего сжатия. Если это формат parquet/orc/avro то использует внутренний кодек, если это файл сжатый Gzip, Bzip2 и тд. то пересжимает его. Нужно, в основном, для ситуаций когда надо пересжать слабо сжатые дата файлы вроде Parquet
- добавлена команда db dump по экспорту таблицы из базы данных сразу в Parquet/CSV/JSONL
- добавлена опция —low-memory для ряда команд для работы с файлами большого размера без чрезмерного использования RAM
- исправлен/модернизирован код генерации API на основе дата файла
- добавление использования DuckDB во многие команды, там где это возможно, для ускорения их работы
- множество мелких изменений и исправлений
#opensource #datatools #dataengineering
В iterabledata добавлено:
- поддержка множества новых форматов геоданных, научных данных и тд. таких как (
fgdb/gdb), MapInfo MIF, Esri ASCII Grid (asc), ArcInfo E00, LAS LiDAR, BAG bathymetry, CZML, XYZ, CIF, PDB, MATLAB MAT, SEG-Y, GRIB2, miniSEED- поддержка чтения данных из озер данных и где-то записи таких как Apache Poimon и DuckLake
- поддержка записи данных в DeltaLake и Iceberg
- много изменений для повышения производительности чтения и записи Parquet файлов
- исправление множества ошибок и мелкие правки
В undatum добавлено:
- новая команда repack позволяет переупаковать дата файлы для большего сжатия. Если это формат parquet/orc/avro то использует внутренний кодек, если это файл сжатый Gzip, Bzip2 и тд. то пересжимает его. Нужно, в основном, для ситуаций когда надо пересжать слабо сжатые дата файлы вроде Parquet
- добавлена команда db dump по экспорту таблицы из базы данных сразу в Parquet/CSV/JSONL
- добавлена опция —low-memory для ряда команд для работы с файлами большого размера без чрезмерного использования RAM
- исправлен/модернизирован код генерации API на основе дата файла
- добавление использования DuckDB во многие команды, там где это возможно, для ускорения их работы
- множество мелких изменений и исправлений
#opensource #datatools #dataengineering
GitHub
GitHub - datenoio/iterabledata: Iterable Data is a Python library for reading and writing data files row by row in a consistent…
Iterable Data is a Python library for reading and writing data files row by row in a consistent, iterator-based interface. It provides a unified API for working with various data formats (CSV, JSON...
✍6❤2👍2
Одно из наблюдаемых мной явлений - это как AI и Data стали почти синонимами и как взлетают по популярности новые инструменты работы с данными и как медленно умирают инструменты периферийные к трендам.
К примеру, OpenRefine довольно старый проект по чистке данных, возможно лучший из тех что открытым кодом уже с марта 2026 года перестал выпускать новые релизы. Разработка в репозитории ведется, но явно гораздо медленнее чем раньше и ничего радикально нового там не появляется.
Проект изначально был устроен так что работа с данными в нем ведется полностью в памяти и после определенных объемов он не справляется. При этом он позволяет вручную или с помощью синтаксисов Python или GREL (специальный язык для манипуляции данными) править данные в строках и колонках сохраняя полную историю изменений с возможностью их отката.
В его текущем движке ускорить его невозможно как и невозможно просто поддержать реально большие наборы данных. В результате области применения остаются только для данных относительно небольшого размера. Поэтому его так часто используют журналисты и он активно используется в разного рода проектах цифровой гуманитаристики. Причем альтернатив ему реально очень мало, в каком-то смысле совсем нет, если нужен интерфейс не программный, а пользовательский.
Интересно выживет ли он вообще? Не бросит ли его команда в какой-то момент?
Я как-то рассуждал тут вслух о том что если делать подобный инструмент современными методами, то движок внутри должен быть на базе DuckDB или Polars. Практически все операции можно делать SQL запросами, а вместо кода на GREL можно использовать text-to-SQL формы запросов совмещая инструмент очистки данных с data exploration.
#opensource #opendata #datatools
К примеру, OpenRefine довольно старый проект по чистке данных, возможно лучший из тех что открытым кодом уже с марта 2026 года перестал выпускать новые релизы. Разработка в репозитории ведется, но явно гораздо медленнее чем раньше и ничего радикально нового там не появляется.
Проект изначально был устроен так что работа с данными в нем ведется полностью в памяти и после определенных объемов он не справляется. При этом он позволяет вручную или с помощью синтаксисов Python или GREL (специальный язык для манипуляции данными) править данные в строках и колонках сохраняя полную историю изменений с возможностью их отката.
В его текущем движке ускорить его невозможно как и невозможно просто поддержать реально большие наборы данных. В результате области применения остаются только для данных относительно небольшого размера. Поэтому его так часто используют журналисты и он активно используется в разного рода проектах цифровой гуманитаристики. Причем альтернатив ему реально очень мало, в каком-то смысле совсем нет, если нужен интерфейс не программный, а пользовательский.
Интересно выживет ли он вообще? Не бросит ли его команда в какой-то момент?
Я как-то рассуждал тут вслух о том что если делать подобный инструмент современными методами, то движок внутри должен быть на базе DuckDB или Polars. Практически все операции можно делать SQL запросами, а вместо кода на GREL можно использовать text-to-SQL формы запросов совмещая инструмент очистки данных с data exploration.
#opensource #opendata #datatools
👍6😢4❤3
Полезные ссылки про данные, технологии и не только:
- Celeris-1 свежая LLM от одноименного стартапа, обещают уровень почти как GPT 5 и гораздо более быстрые ответы. Несколько нестандартное позиционирование, не дешевле токены, не лучше ответы, а именно лучше response time. По моему это не ключевое в LLM, но кто знает.
- Agent swarms and the new model economics текст от команды Cursor который можно свести к выводу что продвинутая модель управляющая командой из непродвинутых моделей дает сравнимый результат при многократно меньших расходах. Полезное знание для тех кто ранее с этим не сталкивался
- Chat2DB визуальный клиент с открытым кодом более чем 30+ СУБД. Выглядит неплохо и похоже что автор его разработал с помощью LLM в короткие сроки. Еще одна демонстрация как современное созданное с помощью ИИ агентов ПО может быстро потеснить существующее.
#opensource #ai #datatools
- Celeris-1 свежая LLM от одноименного стартапа, обещают уровень почти как GPT 5 и гораздо более быстрые ответы. Несколько нестандартное позиционирование, не дешевле токены, не лучше ответы, а именно лучше response time. По моему это не ключевое в LLM, но кто знает.
- Agent swarms and the new model economics текст от команды Cursor который можно свести к выводу что продвинутая модель управляющая командой из непродвинутых моделей дает сравнимый результат при многократно меньших расходах. Полезное знание для тех кто ранее с этим не сталкивался
- Chat2DB визуальный клиент с открытым кодом более чем 30+ СУБД. Выглядит неплохо и похоже что автор его разработал с помощью LLM в короткие сроки. Еще одна демонстрация как современное созданное с помощью ИИ агентов ПО может быстро потеснить существующее.
#opensource #ai #datatools
Celeris
How We Benchmark Celeris-1
Learn how Celeris Labs evaluates Celeris-1 using transparent benchmarking methods and real-world performance testing.
❤6🔥5