Ivan Begtin
9.09K subscribers
2.73K photos
5 videos
116 files
5.61K links
I write about Open Data, Data Engineering, Government, Privacy, Digital Preservation and etc.

CTO&Founder of Dateno https://dateno.io

Telegram @ibegtin
Facebook - https://facebook.com/ibegtin
Email ivan@begtin.tech

Ads/promotion agent: @k0shk
Download Telegram
Распределение геопорталов по популярности по странам

Одна картинка лучше тысячи слов ()

Больше всего в мире геопорталов на базе ArcGIS Server и ArcGIS Hub, но если смотреть по конкретным странам то картина меняется и в большинстве стран лидируют собственные вендоры ГИС систем, в некоторых странах SaaS платформы охватывает все [или почти все] муниципальные образования.

Заодно это о том что существующие поисковики вроде GeoSeer или Spatineo охватывающие только OGC и ArcGIS эндпоинты полной картины не дают потому что большая часть геокаталогов и геопорталов не поддерживают, и то, и то. В лучшем случае они покрывают 50% всех геоданных. Dateno пока тоже охватывает далеко не всё, но есть к чему стремиться.

#opendata #geodata #datasets #datacatalogs #dateno
🔥3✍1❤1👍1
С 1-го по 5-е октября я буду в Астане, если Вы там будете в эти дни и хотите со мной пересечься и поговорить про данные в Казахстане (и в других странах) и не только, напишите плз заранее, вполне можно запланировать пересечься.
В рубрике закрытых российских данных

Указ Президента Российской Федерации от 28.09.2026 № 686 "Об утверждении перечня информации в сфере топливно-энергетического комплекса, доступ к которой ограничен, и порядке ее использования"

Ограничивает доступ к следующим сведениям:
- информации об экспорте товаров, включая их наименования, количество, цену, продавцов и покупателей;
- информации о продавцах и покупателях товаров, а также иных лицах, участвующих в экспорте товаров или обеспечивающих его, включая перевозчиков, экспедиторов и страховщиков;
- порядок осуществления взаиморасчетов по контрактам на поставку товаров;
- информацию о транспорте, задействованном в перевозках товаров;
- данным о направлениях поставок, маршрутах перевозки, местах передачи, отгрузки и других операций с товаром, включая наименования морских терминалов, на которых осуществляются операции и (или) технологическое накопление товаров, а также информацию о географических координатах складов и складских площадок;
- информацию о дате и времени начала и окончания операций с вывозимыми товарами;
- информацию таможенной статистики об экспорте товаров юрлицом;
- сведениям об объемах производства и переработки российских НПЗ;
- данные об объемах реализации товаров и заключенных сделок по продаже выработанного предприятием бензина и дизеля.

P.S. Большая часть этих сведений и так, вроде как, общедоступными не были, а теперь и то что оставалось в открытом доступе, видимо, исчезнет.

#closeddata #russia
😢4😐2👏1🤔1
В рубрике как это устроено у них во многих странах данные большого объёма публикуют официально через файловые обменники или хранилища файлов. Самый классический способ, особенно для научных данных и давно написанных систем - это FTP сервера, но используют не только их. Например, часто большие датасеты доступны через сервера на базе Nextcloud. Наглядный пример, data.geo.sg.ch каталог геоданных кантона St. Gallen в Швейцарии. В общей сложности более 157GB доступны через открытый Nextcloud сервер в виде большого числа ZIP архивов с файлами внутри.

Можно сказать что один из наиболее простых способов публикации файлов большого объёма, но практически без каких-либо метаданных, что существенный минус.

#opendata #geodata #switzerland
✍4
Ещё в качестве мыслей вслух, по ощущениям практически неизбежно крупные ИИ игроки начнут создавать у себя, рано или поздно, публичную дата инфраструктуру к наиболее востребованным ресурсам, в первую очередь, но не исключительно, открытым.

Потому что очень многие запросы к ИИ агентам приводят к тому что те "долбятся в открытые ворота", создают существенно более избыточное число запросов и сталкиваются с ограничениями, как по rate-limit, так и полной блокировке за WAF. Причём проблема нарастает, явно и однозначно, довольно стремительно. В блоге Интернет архива уже есть текст об этом, по моим наблюдениям, похожая ситуация с Википедией и вскоре будет с Common Crawl.

Но в Common Crawl ИИшный бигтех уже влили немало финансирования, другим повезло поменьше.

Я, кстати, пока недостаточно хорошо понимаю взаимоотношения ИИ игроков и Microsoft/Github, потому что все они создают нарастающую нагрузку на их инфраструктуру. Возможно порядками нарастающую. Платят ли Github'у за ускоренный доступ/отсутствие блокировок или ещё нет?

При этом есть базы данных которые легко склонировать, например, Википедию и маршрутизировать обращения туда, а вот склонировать тот же Интернет архив уже очень и очень сложно (а Github просто невозможно).

К примеру, когда я поручаю ИИ агенту собрать данные по общине/общинам в Армении, он стучится именно в Википедию по умолчанию. Не в Data Commons от Google, и не в DBPedia и уж точно не в, да не упомянуть лишний раз это, в какой-нибудь Рувики.

Зато обращений к базам ООН уже много и будет нарастать, они будут закрываться через Cloudflare и другие WAF, те же данные статистики ООН или Всемирного банка в зоне того же риска, сильно нарастающей нагрузки.

#thoughts #opendata #aiagents
👍5💯5✍3❤1
Полезные ссылки про данные, технологии и не только:
- Search минималистичный браузер на базе WebKit для MacOS. Всего 3MB футпринт и почти мгновенный запуск.
- Why SQL won интервью с создателем DuckDB о том почему SQL побеждает (победил?) альтернативные подходы к хранению и доступу к данным.
- Open Code Review от команды Alibaba для автоматического ревью кода по правилам и с помощью ИИ агентов. Большая пользовательская база, плагины для множества сред и
- В Китае расширили ограничения на выезд на семьи топовых ИИ спецов даже не знаю как это комментировать. Вот если, к примеру, в России это еще не внедрели значит ли это что в России полноценной ИИ индустрии нет и топовых спецов в мировом понимании не осталось? А если остались то где их реестр? Можно уже анекдоты придумывать на тему "если ты такой умный то почему тебе еще выезд не запретили?"

#opensource #ai #sql #dataengineering
👍6
Давно хочу написать о том что доступность данных - это явление которое познаётся в сравнении и чем ты больше знаешь о том что происходит в других странах тем лучше понимаешь ситуацию в конкретно выбранной.

Например, в России давняя проблема с доступностью муниципальных данных. Многие, включая меня, сетуют на их качество, на отсутствие данных о постоянно меняющихся границах муниципалитетов, на отсутствие и недостоверность статистики, на сложности в поиске альтернативных источников сведений и поиске способов качество данных улучшить или хотя бы сделать более-менее приемлимым.

Есть страны где лучше, а есть, и много, где сильно хуже. Когда начинаешь искать данные по общинам и городам Армении то обнаруживаешь что:
- сайты многих городов не открываются не из Армении
- у многих общин сайты отсутствуют и есть сомнения что они когда-либо существовали
- данные, когда они есть, находятся на сайте Армстата и отдельных ведомств почти всегда в PDF формате, хорошо ещё что не в виде сканов
- чаще всего внутри PDFов данные не по всем, а по группе общих и городов внутри одного региона
- чаще всего эти данные охватывают только один период/год
- по многим интересным срезам данных мало, собирать их непросто, а какие-то индикаторы вообще не собрать

Иначе говоря ситуация с муниципальными данными не то чтобы сильно хуже чем в России, но очень далека от не то что идеальной, но и вообще комфортной для работы. С региональными данными, конечно, ситуация обстоит лучше, но и её идеализировать нельзя.

Когда я разговариваю с людьми работающими с данными в других странах, почти никто не говорит что у них всё хорошо.

Говоришь с исследователями в Германии, они упоминают что вроде бы данные есть, но вообще запросить данные сложно потому что есть закон требующий данные публиковать, но нет закона требующего данные предоставлять. Запросить их можно, а судиться если тебе их не дали нельзя.

Говоришь с исследователями из Канады, они рассказывают что у них только одна из компаний предоставляет данные по энергопотреблению и другим показателям энергетики в их сетях в почти реальном времени, а все остальные только месячные показатели и их это печалит.

Говоришь с исследователями из США и они жалуются на огромную фрагментацию данных потому что в каждом штате и почти в каждом графстве свои информационные системы, данные слишком часто только на этом уровне и требуется, или много ресурсов на их сбор, или много денег на подписку на коммерческие базы данных где они агрегированы.

Где-то очень хорошие порталы с данными о бюджетах и контрактах, где-то (чаще) полное их отсутствие в какой-либо форме.

Когда какие-то данные в России закрывают, надо понимать что во многих странах они вообще никогда доступны не были.

У открытости и у закрытости тех или иных сведений могут быть разные причины. Какие-то связаны с войнами, какие-то с торговыми противостояниями, какие-то с бизнес лоббированием, какие-то инвестиционной политикой, где-то во главе угла права человека, где-то развитие ИИ стартапов и так далее.

Лучшие и худшие практики могут одновременно присутствовать даже в самых продвинутых и в самых неожиданных юрисдикциях. Но, в целом, есть явная корреляция доступности данных с тем насколько цифра проникла в госуправление и доступность чувствительных данных в странах где власть не боится неудобных вопросов. Это когда доступность информации усиливает гражданина и дает возможность выбора - места жительства, другой правящей партии, влияния на улучшение качества жизни.

Отчасти поэтому в чистых диктатурах полезных данных значительно меньше и информационное неравенство куда хуже устроено. Тем не менее у открытости могут быть разные опоры и аппелировать стоит ко всем из них.

#opendata #thoughts
👍12✍3💯3
В рубрике как это устроено у них портал статистики начального и среднего образования Нигерии. Охватывает всю страну, имеет детализацию до муниципалитетов (в Нигерии они называются Local Government Area, LGA) и включают показатели по числу школ, учеников, учеников на класс, учеников на учителя, долю учеников по полу, данные в разрезах общественных и частных школ и тд.

Чего нет - так это показателей успеваемости, и данные только за 2024/2025 год, этот публичный портал совсем свежий.

Внутри все работает на базе DuckDB WASM + есть недокументированное API, а на веб интерфейсе только экспорт в PDF. Вообще технологический стек там довольно продвинутый.

Такие информационные системы называются Education Management Information System (EMIS), они есть в большинстве стран, где-то на национальном, где-то на региональном уровнях. У многих из них есть публичные контуры с общедоступной статистикой, где-то даже доходящей до конкретной школы, но и муниципальная статистика имеет ценность.

Тут можно задаться вопросом, "А почему в Нигерии такая статистика общедоступна, а в моей [XXX] стране нет?". И на этот вопрос лично у меня нет хорошего ответа.

#opendata #education #statistics #nigeria
1👍8✍2😢2😁1
Датасет Цифрового архива: «Мелкая промышленность во всей промышленности СССР (по производствам)» по данным Всесоюзной переписи 1929 года

Всесоюзная перепись мелкой промышленности состоялась в 1929 году. Учету подлежали предприятия, не достигшие установленного для крупной промышленности ценза: 16 рабочих при наличии двигателя или 30 рабочих без двигателя. Учитывались предприятия как в городах, так и в сельской местности. Как пишет М.С. Подгаецкий, руководитель секции переписи мелкой промышленности Центрального управления народнохозяйственного учета, в условиях индустриализации приоритетное развитие получили производственные гиганты. На предприятия мелкой промышленности возлагалась задача производства широкого спектра товаров народного потребления — до тех пор, пока в этой сфере не были созданы крупные механизированные заводы и фабрики. Поэтому изучение численности и социально-экономической структуры мелкой промышленности имело большое значение для народного хозяйства в целом.

Согласно датасету, составленному на основе таблицы 3 «Мелкая промышленность во всей промышленности СССР (по производствам)» из первого выпуска результатов переписи, наибольшее число предприятий мелкой промышленности приходилось на кожевенно-меховое производство — 573 133 предприятия, что составило 88,1% от общего числа предприятий этой отрасли. Некоторые виды производств в СССР были представлены исключительно предприятиями мелкой промышленности: обработка гончарной посуды — 45 843 предприятия, шерстоковровое производство — 69 914 предприятий, шитье полушубков и тулупов — 54 859.

Подробно ознакомиться со структурой мелкой промышленности в СССР на рубеже 1920-х — 1930-х годов можно в датасете на сайте Цифрового архива.

#датасет #промышленность #СССР #перепись #история #ЦАГГ
❤9👍2
ИИ сервис Manus обновился до версии 2.0, первое большое обновление после того как я его вернули назад в Китай после продажи в Meta и требования китайского пр-ва вернуть его назад. Из заметных значимых изменений:
- новое приложение Manus Studio которое теперь значительно интегрировано с локальным компьютером, позволяет управлять почтой, приложениями и еще много чем
- гораздо больший акцент на разработке ПО и создании документов/мультимедиа/презентаций. Можно подключать теперь Manus к локальным репозиториям
- возможность подключать внешние LLM
- пропала или глубоко скрыта опция проводить широкие исследования в сети (wide research)

С одной стороны виден прогресс, а с другой, вот лично я регулярно пользовался именно возможностями для wide research. Впрочем, возможно, что эти же возможности остались просто теперь являются частью нормального процесса работы и не вынесены отдельно.

Вообще же ответить на вопрос каким ИИ инструментом пользоваться, сложно дать однозначный ответ. Лично я использую сейчас Cursor, ChatGPT, Kimi, ZCode, Manus, Open Designer и ещё ряд других, причем очень часто не по прямому их назначению. Например, инструменты для разработки часто оказываются удобными для аналитики и написания/исправления документов и даже рисования графиков.

#ai #tools
👍8
🤖 Где искать датасеты для ИИ в России: обзор каталогов

Подборка российских каталогов данных для машинного обучения - от государственных реестров до исследовательских коллекций. Сохраняйте, пригодится 👇

🏛 Реестр наборов данных и моделей ИИ - registry.cit.gov.ru/datasets Официальный государственный реестр: датасеты и модели ИИ с описательными метаданными. Первый пункт, если нужны данные с госучастием.

🏙 Moscow AI Datasets - ai.mos.ru/datasets Анонимизированные данные Москвы для обучения моделей: мобильность населения, путевые листы ЖКХ, заявки на нестационарную торговлю.
Каталог открытый, есть сэмплы для скачивания.

🔬 Yandex Research Datasets - research.yandex.com/datasets Исследовательские датасеты Яндекса: бенчмарки для графового ML (GraphLand, гетерофильные графы), табличный ML с временным дрейфом (TabReD), данные для ранжирования. Золото для исследователей.

🎬 MSU Datasets Collection - videoprocessing.ai/datasets Коллекция лаборатории графики и медиа МГУ: базы качества видео с субъективными оценками (SAVAM, MSU CVQAD), артефакты JPEG AI, стерео-датасеты. Стандарт де-факто для бенчмарков видеокодеков.

🫁 MosMedData - mosmed.ai/datasets Аксиальные КТ-снимки грудной клетки (в том числе COVID-19), большинство случаев - с сериями срезов. Один из самых известных медицинских датасетов из России.

🏥 Medical Data Hub - medicaldatahub.ru/datasets Каталог медицинских данных для ML - дополнение к MosMed для тех, кто строит модели в медицине.

🔎 Бонус-трек - не совсем ML, но полезно:
▫️ OpenUrbanData (openurbandata.ru) - поисковик по источникам данных для городских исследований
▫️ DetCorpus (detcorpus.ru) - корпус русской детективной литературы для NLP-экспериментов
▫️ RusPsyData (ruspsydata.figshare.com) - данные и инструменты психологических исследований

#opendata #russia #ai #ml #datasets #datacatalogs
❤5👍4✍2🔥1
🌐 Национальные каталоги данных для машинного обучения

Пока все смотрят на Hugging Face, государства строят собственные платформы с датасетами для ИИ. Собрал самые значимые - все они есть в нашем реестре dataportals-registry (43 000+ каталогов данных со всего мира).

🇰🇷 Южная Корея - AI Hub
aihub.or.kr
Крупнейшая государственная платформа ИИ-данных: тысячи датасетов на корейском языке - речь, текст, компьютерное зрение. Оператор - агентство NIA при министерстве науки и ИКТ.

🇮🇳 Индия - AIKosh
aikosh.indiaai.gov.in
Репозиторий миссии IndiaAI (министерство электроники и IT): более 12 000 наборов данных, моделей и кейсов для разработки ИИ.

🇪🇺 Евросоюз - AI-on-Demand
catalogue.aiodp.eu
Единый каталог ИИ-активов Европы в рамках платформы AI4Europe: датасеты, библиотеки, инструменты и контейнеры.

🇺🇸 США - NAIRR Pilot
nairrpilot.org
Пилот Национального ресурса ИИ-исследований под руководством NSF: проверенные датасеты, предобученные модели и инструменты для исследований и образования.

🇯🇵 Япония - NICT AI Data Testbed
ai-data.nict.go.jp
Каталог национального института NICT: речь и язык, био- и нейроданные, атмосфера, космическая погода, кибербезопасность.

🇨🇳 Китай - BAAI Data Platform
data.baai.ac.cn
Платформа Пекинской академии ИИ с большими корпусами для обучения LLM. Рядом - целая экосистема: OpenDataLab, Tianchi, ModelScope.

🇷🇺 Россия - Реестр наборов данных и моделей ИИ
registry.cit.gov.ru/datasets
Публичный реестр датасетов для машинного обучения и моделей ИИ от ФГАУ «Цифровые индустриальные технологии».

Общее у всех: открытый доступ, государственная поддержка и ставка на данные для обучения моделей, а не просто «открытые данные для отчётности».

Полный список ML-каталогов (сегодня их 91) - в открытом реестре:
github.com/datenoio/dataportals-registry


#opendata #ai #ml #datacatalogs #datasets
✍5👍4❤2
Полезные ссылки про данные, технологии и не только:
- Diving Through Data at OpenAI: How a Data Agent Navigates 70,000 Datasets видео с конференции Rows&Columns о том как устроен внутренний ИИ агент к данным более чем 70 тысяч наборов данных и более 600 петабайт обрабатываемых ежесуточно
- Microsoft, Google back Apache Ossie to make enterprise data and AI platforms more interoperable время новых стандартов для обмена данными, впрочем Ossie не то чтобы сильно новый, но похоже что активно внедрямый
- I Quit OpenAI Because Its Culture Is Broken (очередной) чувак ушел из OpenAI и рассказывает о том что AI бигтехам надо больше внимания уделять безопасности. Похоже что рассуждения в этом жанре нас ждут ещё не один раз
- Introducing Web Search API via AI Gateway Cloudflare сделали универсальное API для веб поиска через сервисы Ceramic.ai, Exa, и Linkup. Вообще к Cloudflare стоит присмотреться к их текущим и грядущим продуктам, они явно играют создание универсальной инфрасируктуры для ИИ инструментов и агентов и имеют хорошие шансы занять большие и малые ниши в этой области.

#opensource #ai #data #search
✍2⚡1
Буквально вчера я вернулся из Астаны после участия в конференции AI&Digital Bridge. Конференция интересная, много новых знакомств и встреч с теми кого давно не видел. В том числе поучаствовал в панели про Телеком данные и их востребованность бизнесом, государством и обществом.

Я там участвовал от Open Data Armenia в ныне не такой уж частой для себя роли представителя общественного интереса.

Что хорошо, данные в Казахстане есть, их немало. Это касается в первую очередь не телеком данных, а геоданных, данных ряда государственных реестров и даже некоторых данных научных учреждений. Очень хорошо что в Казахстане прогресс в доступности данных есть и есть надежда что он будет ещё больше к следующему Digital Bridge.

А вот с данными телекома ключевая сложность в их чувствительности. Телеком операторы, не только в Казахстане, но и во многих странах предоставляют коммерческие аналитические и дата- продукты для потребителей этих данных, но гораздо реже и меньше эти данные доступны для исследователей, в задачах улучшения качества жизни.

Например, в Германии национальная статслужба DEStatis публикует данные Teralytics сопоставляющие официальные данные статистики и данные мобильных операторов.

В Эстонии доступна статистика по туризму на основе данных мобильных операторов.

В Финляндии на основе данных мобильных операторов исследователи собирают аггрегированные данные и пишут научные работы.

Для многих задач эти данные обладают высокой ценностью и в том числе той которую нельзя так просто измерить в денежном эквиваленте.

Я привожу в пример страны ЕС потому что здесь присутствует явная госполитика повышения доступности этих данных. Не обязательно в форме открытых продуктов, очень часто они стоят денег, но сам факт наличия возможности хотя бы узнать их стоимость и аттрибутивный состав уже начало открытости к этим и многим другим чувствительным данным.

Хочется надеяться что и в Казахстане будет явное движение в том чтобы телеком данные были доступны самым разным категориям пользователей.

#opendata #datasets #data #kazakhstan
👍6✍2
Разные мысли вслух и не только:
1. Модель MiniMax M3 и их среда разработки почти дотягивает до GLM-5.3 от Z.ai. По бенчмаркам GLM-5.3 точно лучше, но по цене M3 в 4 раза выгоднее. На практике они близки друг к другу и использовать MiniMax Code себя оправдыввает на множестве задач "простого кодирования". Для vibe-кодеров оно точно не годится, а для тех кто работает с открытым кодом и фокусируется на приведении кода/репозиториев в порядок вполне годится.
2. Учитывая как существенно падают затраты на создание структурированных данных из неструктурированных есть ощущение что довольно скоро будет бум самопальных каталогов данных. Они уже всё чаще появляются, но пока массовости явления нет, а есть ощущение что оно появится как возвращающийся тренд "посмотрите они [государство] бесполезны, а я знаю как сделать правильно, вот смотрите портал данных [моей страны/моего региона/моего города]". Чаще, конечно, сейчас такое про альтернативы официальным порталам статистики, но ими все не ограничится.
3. Главная беда контентных проектов написанных на 100% с помощью ИИ в отсутствии ответа на вопрос "не хуйню ли я делаю?" "А зачем?". Для многих у кого были идеи в загашники, но реализация которых требовала собрать команду разработчиков и потратиться всерьез, теперь вайбкодят нейрослоповые проекты и, по прежнему, не имеют ответа на этот вопрос. Главная проблема такого в нейрослопа в том что ценности в этом немного, а стоимость воспроизведения даже ниже чем у классических проектов. У меня в загашнике есть немало идей вплоть до написанных ТЗ на подобные проекты, но пока ни один из них фильтр разумного ответа на самый главный вопрос не прошли.
4. Чем больше я изучаю того как устроены каталоги данных по всему миру тем больше соблазн написать самый лучший/эффективный/технологичный свой движок для каталога данных тем более что у меня такой опыт уже был несколько раз в жизни. Очень стараюсь не попасться в эту ловушку, потому что движков каталогов данных десятки, по настоящему хороших может и немного, но для хороших и рынка то особо нет.

#thoughts #ai #coding #opendata
👍8❤4
Разные мысли вслух и не только:
1. Насколько же стали распространены геоблокировки по сайтам. К примеру, пытаюсь открыть opendata.tashkent.uz из 4-х юрисдикций: Германия, Финляндия, Армения, Россия и везде запрет к доступу. Похоже блокируют все сети кроме узбекских. Очень похожая ситуация с доступностью сайтов в Иране, Китае, Вьетнаме, а с недавних пор и в России. Формально домен есть, де-факто сайт есть, но доступ получить все сложнее.
2. То что украинские БПЛА разбомбили ЦОД Яндекса поднимает сразу два важных вопроса:
а) Есть ли рейтинг российских ЦОДов по БПЛА защищенности или по удаленности от мест боевых действий?
б) Есть ли у Яндекса риск национализации перехода операционного управления государству как это было с владельцами критической инфраструктуры в других рынках?

3. Оказывается у СНГ есть геопортал cisgeo.info и его запустили в декабре 2025 г. Не то чтобы там много полезного, если честно. Внутри тот же движок что у nspd.gov.ru, вендора его я не знаю, но знаю что у них там внутри какой-та своя реализация OGC сервисов с кастрированной поддержкой функций таких как GetCapabilities.

4. В Узбекистане есть портал с метеоданными data.meteo.uz которому нехватает каталога данных, но есть API. И ещё в том же Узбекистане есть нац портал мониторинга качества воздуха, весьма приличный eko-nazorat.uz и тоже с API. В той же Армении не все так хорошо с метеоданными.

#opendata #geoportals #datacatalogs #thoughts
👍2✍1❤1🤔1
Я почти год назад писал про инструмент с открытым кодом filerepack для пересжатия файлов. Это такой мой очень давний пэт проект, порожденный изначально необходимостью регулярно пересжимать какие-то файлы потому что базовые инструменты слишком часто делали их чрезмерно большими их можно было пересжать в 1.5-2 раза без потери функционала, то есть без необходимости распаковки перед тем как использовать. Живой пример - это все файлы в современных форматах MS Office OOXML - .docx, .xlsx, .pptx и все из этого семейства. Во первых все версии MS Office сжимают ZIP контейнер, которыми эти форматы являются, довольно плохо и просто распаковать файл и запаковать с максимальным сжатием уже давало результат. Во вторых большая часть изображений в этих файлах поддаются эффективному сжатию без потерь и могут уменьшиться в диапазоне 10-75% и итоговый файл уменьшится весьма существенно.

Как бы то ни было этот инструмент я делал давно и в нем было одно существенное ограничение - это то что старые форматы файлов MS Office (.doc, .xls, .ppt и др.) такому пересжатию не поддавались. Причина в том что они и ряд других форматов файлов придуманных Microsoft имели в своей основе Compound File Binary Format к которому есть очень ограниченное число открытых реализаций и большая их часть только на просмотр двоичных потоков внутри и не более того.

При этом у меня в архивах файлов в этих старых форматах MS Office накопилось немало, всегда хотелось их пересжать. И тут я подумал, а почему бы не попробовать и скормил подробное ТЗ в Claude Code с помощью которого в итоге собрал версию которая умеет пересжимать теперь еще и эти файлы. Это было непросто, для пересжатия используется анализатор OLE файлов в виде Python кода и пересборщих в виде кода на Rust поскольку только в Rust'е есть реализация кроссплатформенной библиотеки записи Compound файлов.

В итоге filerepack начиная с последней версии 0.4.0 умеет пересжимать основные старые форматы MS Office .ppt, .xls, .doc и это самое большое и самое сложное изменение в инструменте с момента его создания. Остальные правки по мелочи - поддержка большего числа форматов использующих ZIP как контейнер, поддержка большего числа файлов с данными и тд. Подробнее есть в документации включая примеры, руководства и так далее.

Отвечая на важный вопрос "А зачем?" который очень важно задавать и другим и, обязательно, себе. Казалось бы цена хранения файлов снижается и нет нужды лишний раз заморачиваться еще и сжатием контента. Это и так и не так.

Во первых многие файлы хранятся в облачных файловых хранилищах которые могут менять условия и стоимость хранения и с легкостью забиваются однотипными/похожими файлами и в этом случае лучше положить туда пересжатую версию этого файла и сэкономить на лишних расходах.

Во вторых многие личные архивы хранятся в криптоконтейнерах. Например, я лично ничего из личной чувствительной информации не храню просто на дисках и складываю файлы в криптоконтейнеры ограниченного размера. У этого есть ряд плюсов для параноиков, но есть и минус, там нет динамического увеличения размера по мере наполнения файлами. Место надо предвыделить и если еще и этот криптоконтейнер где содержимое часто меняется и его надо бэкапить то чем меньше он тем лучше. Тут то вопрос про сжатие файлов становится актуальным, но так чтобы без потери функциональности.

Есть и множество других кейсов использования, а это мои личные.

Поддержка файлов в старых форматах MS Office всё еще экспериментальна, если надумаете ее попробовать и столкнетесь с ошибками, пишите мне, лучше всего в issues на Github. Там же можно писать если какие-то популярные форматы есть и еще не поддерживаются или их рекомпрессия работает с ошибками.

Вообще же не могу вспомнить периода жизни когда я что-то не архивировал. Начиная с первых жестких дисков на 10МБ, дискетами на 360КБ. Все моё детство состояло из попыток что-то куда-то сжать чтобы не удалять потому что места всегда нехватало. Насколько проще стало все сейчас, но всегда найдется чем занять любые объемы хранения, так что сжимать файлы всегда актуально;)

#opensource #compression #data
👍10⚡4❤3✍3😁3🤔1
В рубрике как это устроено у них SEGITTUR официальный портал статистики туризма в Испании. Предоставляет множество показателей в разрезе регионов страны, стран происхождения туристов, пассажиров в аэропортах и так далее. Данные помесячные со средней задержкой в 1.5-2 месяца, на 9 октября по основным показателям данные доступны за июнь-август. Можно увидеть что более всего туристов приезжает из Португалии и Франции, но многое ещё и от региона зависит. Внутри всё работает на PowerBI отображение статистики встроено серией дашбордов, а для тех кто хочет напрямую поработать с данными есть API. Испания не единственная страна с доступной статистикой по туризму, но одна из немногих кто предоставляет аналитику ещё и на данных сотовых операторов (а это же данные телекома). Ну и муниципальные показатели по городам тоже доступны. Полезно для самых разных задач, например, если хотите поехать куда-то где туристов поменьше (или наоборот, побольше).

#opendata #datasets #spain #tourism #statistics
✍2🔥2❤‍🔥1
Мне таки удалось достучаться до команды проекта экосистемы CKAN'а и они взяли из реестра каталогов данных Dateno данные по недостающим у них каталогам на базе CKAN и сразу увеличили число охватываемых ими каталогов с 700 до 1400. Это тоже не предел, они не проверяют геоблокировки, а очень многие каталоги заблокированы за пределами своих стран, но тем не менее уже прогресс.

В чем существенные отличия их системы от реестра каталогов. Они делают акцент на мониторинге API CKAN'а на предмет версий и расширений и проверяют насколько эти порталы закрыты последними патчами. Иначе говоря мониторят свою промысловую базу тех кто разворачивает CKAN чтобы предупреждать если их инсталляции не обновлялись и могут быть взломаны из-за отсутствия патчей безопасности, к примеру.

CKAN, действительно, большая экосистема, хотя и далеко не единственная в мире порталов открытых данных.

#opendata #datacatalogs #ckan
👍13🔥3✍2👏1