Ivan Begtin
9.1K subscribers
2.72K photos
5 videos
116 files
5.6K links
I write about Open Data, Data Engineering, Government, Privacy, Digital Preservation and etc.

CTO&Founder of Dateno https://dateno.io

Telegram @ibegtin
Facebook - https://facebook.com/ibegtin
Email ivan@begtin.tech

Ads/promotion agent: @k0shk
Download Telegram
Я тут на днях общался с одним германским исследователем про открытые данные, он много что интересного рассказывал про данные по странам где он проводил свои исследования, я об этом еще расскажу подробнее, о том что данные могут быть доступны, а люди которые ими занимались давно ушли и госполитика уже развернулась не "за" открытые данные, а "против". Нет, это не про Россию, хотя и параллели ощущаются.

А вот из интересного что он рассказывал так то что после недавних случаев с дронами в аэропортах и других инцидентов с безопасностью около электростанций в Германии активно пошли разговоры что может быть не надо быть настолько открытыми и начать скрывать многие данные по инфраструктуре. Не буду загадывать произойдет ли это или нет, но сам факт разговоров он о том что открытые данные - это явление мирных времен. Когда начинаются военные конфликты, ограничения в доступности информации нарастают и тем ценнее становятся альтернативные источники данных и возможность влияния на них.

Я бы предположил что важными изменениями в ближайшие годы будет:
- многие данные, в первую очередь по инфраструктуре будут исчезать по мере расширения военных конфликтов и появления новых
- вероятно появление собственных спутников для съёмки земли у отдельных издательств/крупных медиа-холдингов
- вероятно появление альтернатив стартапов по альтернативным данных в юрисдикциях отличных от США.

#opendata #thoughts #data
✍5👍4😢4
Многие данные по странам сложно найти внутри страны, даже если они есть, то часто запрятаны или в таких формах что работать с ними требует дополнительных усилий, но они успешно собираются международными организациями. Например, не все знают про существование Food price monitoring and analysis (FPMA) tool специального инструмента сбора и раскрытия данных о ценах на ключевые продовольственные товары которые который предоставляет Продовольственная и сельскохозяйственная организация ООН (FAO).

Инструмент охватывает практически все страны, по развитым странам, в основном, предоставляя показатели национального покрытия. По развивающимся есть детализация до городов/регионов.

Состав продуктов тоже варьируется от страны к стране.

Данные обновляются ежемесячно, где-то с задержкой в полмесяца, где-то в 2 месяца, но для аналитики вполне достаточно. По некоторым странам мониторинг аж с начала 90 годов, по другим только за последние несколько лет.
Иначе говоря вариативность высокая, но все в едином формате, можно выгрузить напрямую и через API и использовать в некоммерческих целях под условиями CC-BY-NC-SA.

#opendata #statistics #datasets
✍7❤5
Прочитал две интересные статьи на Хабре Карточный домик из GPU: архитектура neocloud-пузыря и Рынок вычислений в России, Казахстане и Беларуси.

Не знаю автора, но написано очень хорошо, и комментарии к первой статье полезные, раскрывают тему GPU и ЦОДов с новых сторон.

Что хорошего для не-российских ИИ продуктов - это то что цены на токены будут снижаться неизбежно. Я с этим выводом согласен и наблюдаю тот же тренд.

Что не то чтобы очень хорошо для российских ИИ продуктов в том что в России дефицит чипов и мощностей никуда не исчезнет и стоимость токенов/использования LLM хоть и будет снижаться, но будет кратно больше чем не в России.

#readings #ai
✍3👍3😢3
Каталоги данных Ирана

Картина короткая. Национальный портал открытых данных есть, статистика живёт на сайтах Центра статистики и Центробанка, пространственные данные разложены по GeoServer, GeoNode и муниципальным ArcGIS. Почти всё на фарси.

Открытые данные

Национальный портал - data.gov.ir. Это CKAN Организации информационных технологий Ирана: единая витрина наборов госорганов, с открытым CKAN API.

Рядом независимый Iran Open Data - гражданский каталог официальных, международных и неофициальных рядов по экономике, обществу и энергетике, на фарси и английском. Бесплатный уровень узкий (ограниченные просмотры и скачивания). Полные выгрузки - по подписке, а платный доступ из Ирана закрыт из-за санкционных ограничений платёжных сервисов.

Отдельная полка - Peykaregan, DKAN Центра компьютерных исследований исламских наук (Noor). В каталоге заявлено 127 корпусов и NLP-наборов по персидскому языку, есть data.json.

Статистика

База Центра статистики Ирана - официальные показатели по темам и периодам, ежегодник выходит с 1345 года по солнечной хиджре. Фарси и английский, машиночитаемого API нет.

Статистика Центрального банка - денежно-кредитные, банковские и макроэкономические ряды. Тоже таблицы на сайте, без API.

Геоданные

Национальная инфраструктура пространственных данных - GeoServer Национального картографического центра: WMS, WFS и WCS.

Дальше отраслевые и коммерческие серверы: • пригодность земель, Институт исследований почв и вод - nlss.ir, ArcGIS Server • кадастр и участки Zamin Tarsim - ztclock.ir • тайлы справочника Behtarino - maps.behtarino.com, MapTiler

Провинциальные ИПД на GeoNode, с каталогом CSW: • Курдистан - sdi.kmporg.ir • Зенджан - zanjansdi.ir • Йезд - sdi.yazdmporg.ir

Городские ГИС: • Казвин - map137.qazvin.ir • Илам - 137.ilam.ir • Фалаварджан (Исфахан), включая реестр уличных деревьев - tree.falavarjan.ir • Кередж - map.karaj.ir, веб-карта районов и городских объектов, без API

Наука

Единственный научный репозиторий - IPT узла OBIS по Персидскому заливу и Оманскому заливу при Национальном институте океанографии и атмосферных наук: PEGO-OBIS. Морские находки, публикация в GBIF.

Пробелы

Каталогов микроданных, моделей машинного обучения и маркетплейсов в реестре нет. Английский есть у Центра статистики, Центробанка, Iran Open Data и морского IPT. Статистика отдаётся таблицами, а не API. Пространственный слой заметно гуще, чем слой открытых данных.
—
Этот и все страновые обзоры на основе реестра каталогов данных Dateno.

#opendata #datacatalogs #dateno #iran
❤3🔥3👍2⚡1✍1
Распределение геопорталов по популярности по странам

Одна картинка лучше тысячи слов ()

Больше всего в мире геопорталов на базе ArcGIS Server и ArcGIS Hub, но если смотреть по конкретным странам то картина меняется и в большинстве стран лидируют собственные вендоры ГИС систем, в некоторых странах SaaS платформы охватывает все [или почти все] муниципальные образования.

Заодно это о том что существующие поисковики вроде GeoSeer или Spatineo охватывающие только OGC и ArcGIS эндпоинты полной картины не дают потому что большая часть геокаталогов и геопорталов не поддерживают, и то, и то. В лучшем случае они покрывают 50% всех геоданных. Dateno пока тоже охватывает далеко не всё, но есть к чему стремиться.

#opendata #geodata #datasets #datacatalogs #dateno
🔥3✍1❤1👍1
С 1-го по 5-е октября я буду в Астане, если Вы там будете в эти дни и хотите со мной пересечься и поговорить про данные в Казахстане (и в других странах) и не только, напишите плз заранее, вполне можно запланировать пересечься.
В рубрике закрытых российских данных

Указ Президента Российской Федерации от 28.09.2026 № 686 "Об утверждении перечня информации в сфере топливно-энергетического комплекса, доступ к которой ограничен, и порядке ее использования"

Ограничивает доступ к следующим сведениям:
- информации об экспорте товаров, включая их наименования, количество, цену, продавцов и покупателей;
- информации о продавцах и покупателях товаров, а также иных лицах, участвующих в экспорте товаров или обеспечивающих его, включая перевозчиков, экспедиторов и страховщиков;
- порядок осуществления взаиморасчетов по контрактам на поставку товаров;
- информацию о транспорте, задействованном в перевозках товаров;
- данным о направлениях поставок, маршрутах перевозки, местах передачи, отгрузки и других операций с товаром, включая наименования морских терминалов, на которых осуществляются операции и (или) технологическое накопление товаров, а также информацию о географических координатах складов и складских площадок;
- информацию о дате и времени начала и окончания операций с вывозимыми товарами;
- информацию таможенной статистики об экспорте товаров юрлицом;
- сведениям об объемах производства и переработки российских НПЗ;
- данные об объемах реализации товаров и заключенных сделок по продаже выработанного предприятием бензина и дизеля.

P.S. Большая часть этих сведений и так, вроде как, общедоступными не были, а теперь и то что оставалось в открытом доступе, видимо, исчезнет.

#closeddata #russia
😢3😐2👏1🤔1
В рубрике как это устроено у них во многих странах данные большого объёма публикуют официально через файловые обменники или хранилища файлов. Самый классический способ, особенно для научных данных и давно написанных систем - это FTP сервера, но используют не только их. Например, часто большие датасеты доступны через сервера на базе Nextcloud. Наглядный пример, data.geo.sg.ch каталог геоданных кантона St. Gallen в Швейцарии. В общей сложности более 157GB доступны через открытый Nextcloud сервер в виде большого числа ZIP архивов с файлами внутри.

Можно сказать что один из наиболее простых способов публикации файлов большого объёма, но практически без каких-либо метаданных, что существенный минус.

#opendata #geodata #switzerland
✍4
Ещё в качестве мыслей вслух, по ощущениям практически неизбежно крупные ИИ игроки начнут создавать у себя, рано или поздно, публичную дата инфраструктуру к наиболее востребованным ресурсам, в первую очередь, но не исключительно, открытым.

Потому что очень многие запросы к ИИ агентам приводят к тому что те "долбятся в открытые ворота", создают существенно более избыточное число запросов и сталкиваются с ограничениями, как по rate-limit, так и полной блокировке за WAF. Причём проблема нарастает, явно и однозначно, довольно стремительно. В блоге Интернет архива уже есть текст об этом, по моим наблюдениям, похожая ситуация с Википедией и вскоре будет с Common Crawl.

Но в Common Crawl ИИшный бигтех уже влили немало финансирования, другим повезло поменьше.

Я, кстати, пока недостаточно хорошо понимаю взаимоотношения ИИ игроков и Microsoft/Github, потому что все они создают нарастающую нагрузку на их инфраструктуру. Возможно порядками нарастающую. Платят ли Github'у за ускоренный доступ/отсутствие блокировок или ещё нет?

При этом есть базы данных которые легко склонировать, например, Википедию и маршрутизировать обращения туда, а вот склонировать тот же Интернет архив уже очень и очень сложно (а Github просто невозможно).

К примеру, когда я поручаю ИИ агенту собрать данные по общине/общинам в Армении, он стучится именно в Википедию по умолчанию. Не в Data Commons от Google, и не в DBPedia и уж точно не в, да не упомянуть лишний раз это, в какой-нибудь Рувики.

Зато обращений к базам ООН уже много и будет нарастать, они будут закрываться через Cloudflare и другие WAF, те же данные статистики ООН или Всемирного банка в зоне того же риска, сильно нарастающей нагрузки.

#thoughts #opendata #aiagents
👍5💯4✍3❤1
Полезные ссылки про данные, технологии и не только:
- Search минималистичный браузер на базе WebKit для MacOS. Всего 3MB футпринт и почти мгновенный запуск.
- Why SQL won интервью с создателем DuckDB о том почему SQL побеждает (победил?) альтернативные подходы к хранению и доступу к данным.
- Open Code Review от команды Alibaba для автоматического ревью кода по правилам и с помощью ИИ агентов. Большая пользовательская база, плагины для множества сред и
- В Китае расширили ограничения на выезд на семьи топовых ИИ спецов даже не знаю как это комментировать. Вот если, к примеру, в России это еще не внедрели значит ли это что в России полноценной ИИ индустрии нет и топовых спецов в мировом понимании не осталось? А если остались то где их реестр? Можно уже анекдоты придумывать на тему "если ты такой умный то почему тебе еще выезд не запретили?"

#opensource #ai #sql #dataengineering
👍5
Давно хочу написать о том что доступность данных - это явление которое познаётся в сравнении и чем ты больше знаешь о том что происходит в других странах тем лучше понимаешь ситуацию в конкретно выбранной.

Например, в России давняя проблема с доступностью муниципальных данных. Многие, включая меня, сетуют на их качество, на отсутствие данных о постоянно меняющихся границах муниципалитетов, на отсутствие и недостоверность статистики, на сложности в поиске альтернативных источников сведений и поиске способов качество данных улучшить или хотя бы сделать более-менее приемлимым.

Есть страны где лучше, а есть, и много, где сильно хуже. Когда начинаешь искать данные по общинам и городам Армении то обнаруживаешь что:
- сайты многих городов не открываются не из Армении
- у многих общин сайты отсутствуют и есть сомнения что они когда-либо существовали
- данные, когда они есть, находятся на сайте Армстата и отдельных ведомств почти всегда в PDF формате, хорошо ещё что не в виде сканов
- чаще всего внутри PDFов данные не по всем, а по группе общих и городов внутри одного региона
- чаще всего эти данные охватывают только один период/год
- по многим интересным срезам данных мало, собирать их непросто, а какие-то индикаторы вообще не собрать

Иначе говоря ситуация с муниципальными данными не то чтобы сильно хуже чем в России, но очень далека от не то что идеальной, но и вообще комфортной для работы. С региональными данными, конечно, ситуация обстоит лучше, но и её идеализировать нельзя.

Когда я разговариваю с людьми работающими с данными в других странах, почти никто не говорит что у них всё хорошо.

Говоришь с исследователями в Германии, они упоминают что вроде бы данные есть, но вообще запросить данные сложно потому что есть закон требующий данные публиковать, но нет закона требующего данные предоставлять. Запросить их можно, а судиться если тебе их не дали нельзя.

Говоришь с исследователями из Канады, они рассказывают что у них только одна из компаний предоставляет данные по энергопотреблению и другим показателям энергетики в их сетях в почти реальном времени, а все остальные только месячные показатели и их это печалит.

Говоришь с исследователями из США и они жалуются на огромную фрагментацию данных потому что в каждом штате и почти в каждом графстве свои информационные системы, данные слишком часто только на этом уровне и требуется, или много ресурсов на их сбор, или много денег на подписку на коммерческие базы данных где они агрегированы.

Где-то очень хорошие порталы с данными о бюджетах и контрактах, где-то (чаще) полное их отсутствие в какой-либо форме.

Когда какие-то данные в России закрывают, надо понимать что во многих странах они вообще никогда доступны не были.

У открытости и у закрытости тех или иных сведений могут быть разные причины. Какие-то связаны с войнами, какие-то с торговыми противостояниями, какие-то с бизнес лоббированием, какие-то инвестиционной политикой, где-то во главе угла права человека, где-то развитие ИИ стартапов и так далее.

Лучшие и худшие практики могут одновременно присутствовать даже в самых продвинутых и в самых неожиданных юрисдикциях. Но, в целом, есть явная корреляция доступности данных с тем насколько цифра проникла в госуправление и доступность чувствительных данных в странах где власть не боится неудобных вопросов. Это когда доступность информации усиливает гражданина и дает возможность выбора - места жительства, другой правящей партии, влияния на улучшение качества жизни.

Отчасти поэтому в чистых диктатурах полезных данных значительно меньше и информационное неравенство куда хуже устроено. Тем не менее у открытости могут быть разные опоры и аппелировать стоит ко всем из них.

#opendata #thoughts
👍12✍3💯3
В рубрике как это устроено у них портал статистики начального и среднего образования Нигерии. Охватывает всю страну, имеет детализацию до муниципалитетов (в Нигерии они называются Local Government Area, LGA) и включают показатели по числу школ, учеников, учеников на класс, учеников на учителя, долю учеников по полу, данные в разрезах общественных и частных школ и тд.

Чего нет - так это показателей успеваемости, и данные только за 2024/2025 год, этот публичный портал совсем свежий.

Внутри все работает на базе DuckDB WASM + есть недокументированное API, а на веб интерфейсе только экспорт в PDF. Вообще технологический стек там довольно продвинутый.

Такие информационные системы называются Education Management Information System (EMIS), они есть в большинстве стран, где-то на национальном, где-то на региональном уровнях. У многих из них есть публичные контуры с общедоступной статистикой, где-то даже доходящей до конкретной школы, но и муниципальная статистика имеет ценность.

Тут можно задаться вопросом, "А почему в Нигерии такая статистика общедоступна, а в моей [XXX] стране нет?". И на этот вопрос лично у меня нет хорошего ответа.

#opendata #education #statistics #nigeria
1👍7✍2😢2😁1
Датасет Цифрового архива: «Мелкая промышленность во всей промышленности СССР (по производствам)» по данным Всесоюзной переписи 1929 года

Всесоюзная перепись мелкой промышленности состоялась в 1929 году. Учету подлежали предприятия, не достигшие установленного для крупной промышленности ценза: 16 рабочих при наличии двигателя или 30 рабочих без двигателя. Учитывались предприятия как в городах, так и в сельской местности. Как пишет М.С. Подгаецкий, руководитель секции переписи мелкой промышленности Центрального управления народнохозяйственного учета, в условиях индустриализации приоритетное развитие получили производственные гиганты. На предприятия мелкой промышленности возлагалась задача производства широкого спектра товаров народного потребления — до тех пор, пока в этой сфере не были созданы крупные механизированные заводы и фабрики. Поэтому изучение численности и социально-экономической структуры мелкой промышленности имело большое значение для народного хозяйства в целом.

Согласно датасету, составленному на основе таблицы 3 «Мелкая промышленность во всей промышленности СССР (по производствам)» из первого выпуска результатов переписи, наибольшее число предприятий мелкой промышленности приходилось на кожевенно-меховое производство — 573 133 предприятия, что составило 88,1% от общего числа предприятий этой отрасли. Некоторые виды производств в СССР были представлены исключительно предприятиями мелкой промышленности: обработка гончарной посуды — 45 843 предприятия, шерстоковровое производство — 69 914 предприятий, шитье полушубков и тулупов — 54 859.

Подробно ознакомиться со структурой мелкой промышленности в СССР на рубеже 1920-х — 1930-х годов можно в датасете на сайте Цифрового архива.

#датасет #промышленность #СССР #перепись #история #ЦАГГ
❤9👍1
ИИ сервис Manus обновился до версии 2.0, первое большое обновление после того как я его вернули назад в Китай после продажи в Meta и требования китайского пр-ва вернуть его назад. Из заметных значимых изменений:
- новое приложение Manus Studio которое теперь значительно интегрировано с локальным компьютером, позволяет управлять почтой, приложениями и еще много чем
- гораздо больший акцент на разработке ПО и создании документов/мультимедиа/презентаций. Можно подключать теперь Manus к локальным репозиториям
- возможность подключать внешние LLM
- пропала или глубоко скрыта опция проводить широкие исследования в сети (wide research)

С одной стороны виден прогресс, а с другой, вот лично я регулярно пользовался именно возможностями для wide research. Впрочем, возможно, что эти же возможности остались просто теперь являются частью нормального процесса работы и не вынесены отдельно.

Вообще же ответить на вопрос каким ИИ инструментом пользоваться, сложно дать однозначный ответ. Лично я использую сейчас Cursor, ChatGPT, Kimi, ZCode, Manus, Open Designer и ещё ряд других, причем очень часто не по прямому их назначению. Например, инструменты для разработки часто оказываются удобными для аналитики и написания/исправления документов и даже рисования графиков.

#ai #tools
👍7
🤖 Где искать датасеты для ИИ в России: обзор каталогов

Подборка российских каталогов данных для машинного обучения - от государственных реестров до исследовательских коллекций. Сохраняйте, пригодится 👇

🏛 Реестр наборов данных и моделей ИИ - registry.cit.gov.ru/datasets Официальный государственный реестр: датасеты и модели ИИ с описательными метаданными. Первый пункт, если нужны данные с госучастием.

🏙 Moscow AI Datasets - ai.mos.ru/datasets Анонимизированные данные Москвы для обучения моделей: мобильность населения, путевые листы ЖКХ, заявки на нестационарную торговлю.
Каталог открытый, есть сэмплы для скачивания.

🔬 Yandex Research Datasets - research.yandex.com/datasets Исследовательские датасеты Яндекса: бенчмарки для графового ML (GraphLand, гетерофильные графы), табличный ML с временным дрейфом (TabReD), данные для ранжирования. Золото для исследователей.

🎬 MSU Datasets Collection - videoprocessing.ai/datasets Коллекция лаборатории графики и медиа МГУ: базы качества видео с субъективными оценками (SAVAM, MSU CVQAD), артефакты JPEG AI, стерео-датасеты. Стандарт де-факто для бенчмарков видеокодеков.

🫁 MosMedData - mosmed.ai/datasets Аксиальные КТ-снимки грудной клетки (в том числе COVID-19), большинство случаев - с сериями срезов. Один из самых известных медицинских датасетов из России.

🏥 Medical Data Hub - medicaldatahub.ru/datasets Каталог медицинских данных для ML - дополнение к MosMed для тех, кто строит модели в медицине.

🔎 Бонус-трек - не совсем ML, но полезно:
▫️ OpenUrbanData (openurbandata.ru) - поисковик по источникам данных для городских исследований
▫️ DetCorpus (detcorpus.ru) - корпус русской детективной литературы для NLP-экспериментов
▫️ RusPsyData (ruspsydata.figshare.com) - данные и инструменты психологических исследований

#opendata #russia #ai #ml #datasets #datacatalogs
❤5✍2👍2🔥1
🌐 Национальные каталоги данных для машинного обучения

Пока все смотрят на Hugging Face, государства строят собственные платформы с датасетами для ИИ. Собрал самые значимые - все они есть в нашем реестре dataportals-registry (43 000+ каталогов данных со всего мира).

🇰🇷 Южная Корея - AI Hub
aihub.or.kr
Крупнейшая государственная платформа ИИ-данных: тысячи датасетов на корейском языке - речь, текст, компьютерное зрение. Оператор - агентство NIA при министерстве науки и ИКТ.

🇮🇳 Индия - AIKosh
aikosh.indiaai.gov.in
Репозиторий миссии IndiaAI (министерство электроники и IT): более 12 000 наборов данных, моделей и кейсов для разработки ИИ.

🇪🇺 Евросоюз - AI-on-Demand
catalogue.aiodp.eu
Единый каталог ИИ-активов Европы в рамках платформы AI4Europe: датасеты, библиотеки, инструменты и контейнеры.

🇺🇸 США - NAIRR Pilot
nairrpilot.org
Пилот Национального ресурса ИИ-исследований под руководством NSF: проверенные датасеты, предобученные модели и инструменты для исследований и образования.

🇯🇵 Япония - NICT AI Data Testbed
ai-data.nict.go.jp
Каталог национального института NICT: речь и язык, био- и нейроданные, атмосфера, космическая погода, кибербезопасность.

🇨🇳 Китай - BAAI Data Platform
data.baai.ac.cn
Платформа Пекинской академии ИИ с большими корпусами для обучения LLM. Рядом - целая экосистема: OpenDataLab, Tianchi, ModelScope.

🇷🇺 Россия - Реестр наборов данных и моделей ИИ
registry.cit.gov.ru/datasets
Публичный реестр датасетов для машинного обучения и моделей ИИ от ФГАУ «Цифровые индустриальные технологии».

Общее у всех: открытый доступ, государственная поддержка и ставка на данные для обучения моделей, а не просто «открытые данные для отчётности».

Полный список ML-каталогов (сегодня их 91) - в открытом реестре:
github.com/datenoio/dataportals-registry


#opendata #ai #ml #datacatalogs #datasets
✍5👍4❤2
Полезные ссылки про данные, технологии и не только:
- Diving Through Data at OpenAI: How a Data Agent Navigates 70,000 Datasets видео с конференции Rows&Columns о том как устроен внутренний ИИ агент к данным более чем 70 тысяч наборов данных и более 600 петабайт обрабатываемых ежесуточно
- Microsoft, Google back Apache Ossie to make enterprise data and AI platforms more interoperable время новых стандартов для обмена данными, впрочем Ossie не то чтобы сильно новый, но похоже что активно внедрямый
- I Quit OpenAI Because Its Culture Is Broken (очередной) чувак ушел из OpenAI и рассказывает о том что AI бигтехам надо больше внимания уделять безопасности. Похоже что рассуждения в этом жанре нас ждут ещё не один раз
- Introducing Web Search API via AI Gateway Cloudflare сделали универсальное API для веб поиска через сервисы Ceramic.ai, Exa, и Linkup. Вообще к Cloudflare стоит присмотреться к их текущим и грядущим продуктам, они явно играют создание универсальной инфрасируктуры для ИИ инструментов и агентов и имеют хорошие шансы занять большие и малые ниши в этой области.

#opensource #ai #data #search
✍2⚡1
Буквально вчера я вернулся из Астаны после участия в конференции AI&Digital Bridge. Конференция интересная, много новых знакомств и встреч с теми кого давно не видел. В том числе поучаствовал в панели про Телеком данные и их востребованность бизнесом, государством и обществом.

Я там участвовал от Open Data Armenia в ныне не такой уж частой для себя роли представителя общественного интереса.

Что хорошо, данные в Казахстане есть, их немало. Это касается в первую очередь не телеком данных, а геоданных, данных ряда государственных реестров и даже некоторых данных научных учреждений. Очень хорошо что в Казахстане прогресс в доступности данных есть и есть надежда что он будет ещё больше к следующему Digital Bridge.

А вот с данными телекома ключевая сложность в их чувствительности. Телеком операторы, не только в Казахстане, но и во многих странах предоставляют коммерческие аналитические и дата- продукты для потребителей этих данных, но гораздо реже и меньше эти данные доступны для исследователей, в задачах улучшения качества жизни.

Например, в Германии национальная статслужба DEStatis публикует данные Teralytics сопоставляющие официальные данные статистики и данные мобильных операторов.

В Эстонии доступна статистика по туризму на основе данных мобильных операторов.

В Финляндии на основе данных мобильных операторов исследователи собирают аггрегированные данные и пишут научные работы.

Для многих задач эти данные обладают высокой ценностью и в том числе той которую нельзя так просто измерить в денежном эквиваленте.

Я привожу в пример страны ЕС потому что здесь присутствует явная госполитика повышения доступности этих данных. Не обязательно в форме открытых продуктов, очень часто они стоят денег, но сам факт наличия возможности хотя бы узнать их стоимость и аттрибутивный состав уже начало открытости к этим и многим другим чувствительным данным.

Хочется надеяться что и в Казахстане будет явное движение в том чтобы телеком данные были доступны самым разным категориям пользователей.

#opendata #datasets #data #kazakhstan
👍6✍1
Разные мысли вслух и не только:
1. Модель MiniMax M3 и их среда разработки почти дотягивает до GLM-5.3 от Z.ai. По бенчмаркам GLM-5.3 точно лучше, но по цене M3 в 4 раза выгоднее. На практике они близки друг к другу и использовать MiniMax Code себя оправдыввает на множестве задач "простого кодирования". Для vibe-кодеров оно точно не годится, а для тех кто работает с открытым кодом и фокусируется на приведении кода/репозиториев в порядок вполне годится.
2. Учитывая как существенно падают затраты на создание структурированных данных из неструктурированных есть ощущение что довольно скоро будет бум самопальных каталогов данных. Они уже всё чаще появляются, но пока массовости явления нет, а есть ощущение что оно появится как возвращающийся тренд "посмотрите они [государство] бесполезны, а я знаю как сделать правильно, вот смотрите портал данных [моей страны/моего региона/моего города]". Чаще, конечно, сейчас такое про альтернативы официальным порталам статистики, но ими все не ограничится.
3. Главная беда контентных проектов написанных на 100% с помощью ИИ в отсутствии ответа на вопрос "не хуйню ли я делаю?" "А зачем?". Для многих у кого были идеи в загашники, но реализация которых требовала собрать команду разработчиков и потратиться всерьез, теперь вайбкодят нейрослоповые проекты и, по прежнему, не имеют ответа на этот вопрос. Главная проблема такого в нейрослопа в том что ценности в этом немного, а стоимость воспроизведения даже ниже чем у классических проектов. У меня в загашнике есть немало идей вплоть до написанных ТЗ на подобные проекты, но пока ни один из них фильтр разумного ответа на самый главный вопрос не прошли.
4. Чем больше я изучаю того как устроены каталоги данных по всему миру тем больше соблазн написать самый лучший/эффективный/технологичный свой движок для каталога данных тем более что у меня такой опыт уже был несколько раз в жизни. Очень стараюсь не попасться в эту ловушку, потому что движков каталогов данных десятки, по настоящему хороших может и немного, но для хороших и рынка то особо нет.

#thoughts #ai #coding #opendata
👍7❤3