Полезные ссылки про данные, технологии и не только:
- Diving Through Data at OpenAI: How a Data Agent Navigates 70,000 Datasets видео с конференции Rows&Columns о том как устроен внутренний ИИ агент к данным более чем 70 тысяч наборов данных и более 600 петабайт обрабатываемых ежесуточно
- Microsoft, Google back Apache Ossie to make enterprise data and AI platforms more interoperable время новых стандартов для обмена данными, впрочем Ossie не то чтобы сильно новый, но похоже что активно внедрямый
- I Quit OpenAI Because Its Culture Is Broken (очередной) чувак ушел из OpenAI и рассказывает о том что AI бигтехам надо больше внимания уделять безопасности. Похоже что рассуждения в этом жанре нас ждут ещё не один раз
- Introducing Web Search API via AI Gateway Cloudflare сделали универсальное API для веб поиска через сервисы Ceramic.ai, Exa, и Linkup. Вообще к Cloudflare стоит присмотреться к их текущим и грядущим продуктам, они явно играют создание универсальной инфрасируктуры для ИИ инструментов и агентов и имеют хорошие шансы занять большие и малые ниши в этой области.
#opensource #ai #data #search
- Diving Through Data at OpenAI: How a Data Agent Navigates 70,000 Datasets видео с конференции Rows&Columns о том как устроен внутренний ИИ агент к данным более чем 70 тысяч наборов данных и более 600 петабайт обрабатываемых ежесуточно
- Microsoft, Google back Apache Ossie to make enterprise data and AI platforms more interoperable время новых стандартов для обмена данными, впрочем Ossie не то чтобы сильно новый, но похоже что активно внедрямый
- I Quit OpenAI Because Its Culture Is Broken (очередной) чувак ушел из OpenAI и рассказывает о том что AI бигтехам надо больше внимания уделять безопасности. Похоже что рассуждения в этом жанре нас ждут ещё не один раз
- Introducing Web Search API via AI Gateway Cloudflare сделали универсальное API для веб поиска через сервисы Ceramic.ai, Exa, и Linkup. Вообще к Cloudflare стоит присмотреться к их текущим и грядущим продуктам, они явно играют создание универсальной инфрасируктуры для ИИ инструментов и агентов и имеют хорошие шансы занять большие и малые ниши в этой области.
#opensource #ai #data #search
YouTube
Rows&Columns: Bonnie Xu, Data at OpenAI
This talk video is a node in devreal.ai, the developer community graph.
It connects to:
Talk: Diving Through Data at OpenAI: How a Data Agent Navigates 70,000 Datasets — https://devreal.ai/t/260922-diving-through-data-openai-how-data-agent-navigates-70-rows…
It connects to:
Talk: Diving Through Data at OpenAI: How a Data Agent Navigates 70,000 Datasets — https://devreal.ai/t/260922-diving-through-data-openai-how-data-agent-navigates-70-rows…
✍2⚡1
Буквально вчера я вернулся из Астаны после участия в конференции AI&Digital Bridge. Конференция интересная, много новых знакомств и встреч с теми кого давно не видел. В том числе поучаствовал в панели про Телеком данные и их востребованность бизнесом, государством и обществом.
Я там участвовал от Open Data Armenia в ныне не такой уж частой для себя роли представителя общественного интереса.
Что хорошо, данные в Казахстане есть, их немало. Это касается в первую очередь не телеком данных, а геоданных, данных ряда государственных реестров и даже некоторых данных научных учреждений. Очень хорошо что в Казахстане прогресс в доступности данных есть и есть надежда что он будет ещё больше к следующему Digital Bridge.
А вот с данными телекома ключевая сложность в их чувствительности. Телеком операторы, не только в Казахстане, но и во многих странах предоставляют коммерческие аналитические и дата- продукты для потребителей этих данных, но гораздо реже и меньше эти данные доступны для исследователей, в задачах улучшения качества жизни.
Например, в Германии национальная статслужба DEStatis публикует данные Teralytics сопоставляющие официальные данные статистики и данные мобильных операторов.
В Эстонии доступна статистика по туризму на основе данных мобильных операторов.
В Финляндии на основе данных мобильных операторов исследователи собирают аггрегированные данные и пишут научные работы.
Для многих задач эти данные обладают высокой ценностью и в том числе той которую нельзя так просто измерить в денежном эквиваленте.
Я привожу в пример страны ЕС потому что здесь присутствует явная госполитика повышения доступности этих данных. Не обязательно в форме открытых продуктов, очень часто они стоят денег, но сам факт наличия возможности хотя бы узнать их стоимость и аттрибутивный состав уже начало открытости к этим и многим другим чувствительным данным.
Хочется надеяться что и в Казахстане будет явное движение в том чтобы телеком данные были доступны самым разным категориям пользователей.
#opendata #datasets #data #kazakhstan
Я там участвовал от Open Data Armenia в ныне не такой уж частой для себя роли представителя общественного интереса.
Что хорошо, данные в Казахстане есть, их немало. Это касается в первую очередь не телеком данных, а геоданных, данных ряда государственных реестров и даже некоторых данных научных учреждений. Очень хорошо что в Казахстане прогресс в доступности данных есть и есть надежда что он будет ещё больше к следующему Digital Bridge.
А вот с данными телекома ключевая сложность в их чувствительности. Телеком операторы, не только в Казахстане, но и во многих странах предоставляют коммерческие аналитические и дата- продукты для потребителей этих данных, но гораздо реже и меньше эти данные доступны для исследователей, в задачах улучшения качества жизни.
Например, в Германии национальная статслужба DEStatis публикует данные Teralytics сопоставляющие официальные данные статистики и данные мобильных операторов.
В Эстонии доступна статистика по туризму на основе данных мобильных операторов.
В Финляндии на основе данных мобильных операторов исследователи собирают аггрегированные данные и пишут научные работы.
Для многих задач эти данные обладают высокой ценностью и в том числе той которую нельзя так просто измерить в денежном эквиваленте.
Я привожу в пример страны ЕС потому что здесь присутствует явная госполитика повышения доступности этих данных. Не обязательно в форме открытых продуктов, очень часто они стоят денег, но сам факт наличия возможности хотя бы узнать их стоимость и аттрибутивный состав уже начало открытости к этим и многим другим чувствительным данным.
Хочется надеяться что и в Казахстане будет явное движение в том чтобы телеком данные были доступны самым разным категориям пользователей.
#opendata #datasets #data #kazakhstan
👍6✍2
Разные мысли вслух и не только:
1. Модель MiniMax M3 и их среда разработки почти дотягивает до GLM-5.3 от Z.ai. По бенчмаркам GLM-5.3 точно лучше, но по цене M3 в 4 раза выгоднее. На практике они близки друг к другу и использовать MiniMax Code себя оправдыввает на множестве задач "простого кодирования". Для vibe-кодеров оно точно не годится, а для тех кто работает с открытым кодом и фокусируется на приведении кода/репозиториев в порядок вполне годится.
2. Учитывая как существенно падают затраты на создание структурированных данных из неструктурированных есть ощущение что довольно скоро будет бум самопальных каталогов данных. Они уже всё чаще появляются, но пока массовости явления нет, а есть ощущение что оно появится как возвращающийся тренд "посмотрите они [государство] бесполезны, а я знаю как сделать правильно, вот смотрите портал данных [моей страны/моего региона/моего города]". Чаще, конечно, сейчас такое про альтернативы официальным порталам статистики, но ими все не ограничится.
3. Главная беда контентных проектов написанных на 100% с помощью ИИ в отсутствии ответа на вопрос"не хуйню ли я делаю?" "А зачем?". Для многих у кого были идеи в загашники, но реализация которых требовала собрать команду разработчиков и потратиться всерьез, теперь вайбкодят нейрослоповые проекты и, по прежнему, не имеют ответа на этот вопрос. Главная проблема такого в нейрослопа в том что ценности в этом немного, а стоимость воспроизведения даже ниже чем у классических проектов. У меня в загашнике есть немало идей вплоть до написанных ТЗ на подобные проекты, но пока ни один из них фильтр разумного ответа на самый главный вопрос не прошли.
4. Чем больше я изучаю того как устроены каталоги данных по всему миру тем больше соблазн написатьсамый лучший/эффективный/технологичный свой движок для каталога данных тем более что у меня такой опыт уже был несколько раз в жизни. Очень стараюсь не попасться в эту ловушку, потому что движков каталогов данных десятки, по настоящему хороших может и немного, но для хороших и рынка то особо нет.
#thoughts #ai #coding #opendata
1. Модель MiniMax M3 и их среда разработки почти дотягивает до GLM-5.3 от Z.ai. По бенчмаркам GLM-5.3 точно лучше, но по цене M3 в 4 раза выгоднее. На практике они близки друг к другу и использовать MiniMax Code себя оправдыввает на множестве задач "простого кодирования". Для vibe-кодеров оно точно не годится, а для тех кто работает с открытым кодом и фокусируется на приведении кода/репозиториев в порядок вполне годится.
2. Учитывая как существенно падают затраты на создание структурированных данных из неструктурированных есть ощущение что довольно скоро будет бум самопальных каталогов данных. Они уже всё чаще появляются, но пока массовости явления нет, а есть ощущение что оно появится как возвращающийся тренд "посмотрите они [государство] бесполезны, а я знаю как сделать правильно, вот смотрите портал данных [моей страны/моего региона/моего города]". Чаще, конечно, сейчас такое про альтернативы официальным порталам статистики, но ими все не ограничится.
3. Главная беда контентных проектов написанных на 100% с помощью ИИ в отсутствии ответа на вопрос
4. Чем больше я изучаю того как устроены каталоги данных по всему миру тем больше соблазн написать
#thoughts #ai #coding #opendata
👍8❤4
Разные мысли вслух и не только:
1. Насколько же стали распространены геоблокировки по сайтам. К примеру, пытаюсь открыть opendata.tashkent.uz из 4-х юрисдикций: Германия, Финляндия, Армения, Россия и везде запрет к доступу. Похоже блокируют все сети кроме узбекских. Очень похожая ситуация с доступностью сайтов в Иране, Китае, Вьетнаме, а с недавних пор и в России. Формально домен есть, де-факто сайт есть, но доступ получить все сложнее.
2. То что украинские БПЛА разбомбили ЦОД Яндекса поднимает сразу два важных вопроса:
а) Есть ли рейтинг российских ЦОДов по БПЛА защищенности или по удаленности от мест боевых действий?
б) Есть ли у Яндекса рискнационализации перехода операционного управления государству как это было с владельцами критической инфраструктуры в других рынках?
3. Оказывается у СНГ есть геопортал cisgeo.info и его запустили в декабре 2025 г. Не то чтобы там много полезного, если честно. Внутри тот же движок что у nspd.gov.ru, вендора его я не знаю, но знаю что у них там внутри какой-та своя реализация OGC сервисов с кастрированной поддержкой функций таких как GetCapabilities.
4. В Узбекистане есть портал с метеоданными data.meteo.uz которому нехватает каталога данных, но есть API. И ещё в том же Узбекистане есть нац портал мониторинга качества воздуха, весьма приличный eko-nazorat.uz и тоже с API. В той же Армении не все так хорошо с метеоданными.
#opendata #geoportals #datacatalogs #thoughts
1. Насколько же стали распространены геоблокировки по сайтам. К примеру, пытаюсь открыть opendata.tashkent.uz из 4-х юрисдикций: Германия, Финляндия, Армения, Россия и везде запрет к доступу. Похоже блокируют все сети кроме узбекских. Очень похожая ситуация с доступностью сайтов в Иране, Китае, Вьетнаме, а с недавних пор и в России. Формально домен есть, де-факто сайт есть, но доступ получить все сложнее.
2. То что украинские БПЛА разбомбили ЦОД Яндекса поднимает сразу два важных вопроса:
а) Есть ли рейтинг российских ЦОДов по БПЛА защищенности или по удаленности от мест боевых действий?
б) Есть ли у Яндекса риск
3. Оказывается у СНГ есть геопортал cisgeo.info и его запустили в декабре 2025 г. Не то чтобы там много полезного, если честно. Внутри тот же движок что у nspd.gov.ru, вендора его я не знаю, но знаю что у них там внутри какой-та своя реализация OGC сервисов с кастрированной поддержкой функций таких как GetCapabilities.
4. В Узбекистане есть портал с метеоданными data.meteo.uz которому нехватает каталога данных, но есть API. И ещё в том же Узбекистане есть нац портал мониторинга качества воздуха, весьма приличный eko-nazorat.uz и тоже с API. В той же Армении не все так хорошо с метеоданными.
#opendata #geoportals #datacatalogs #thoughts
👍2✍1❤1🤔1
Я почти год назад писал про инструмент с открытым кодом filerepack для пересжатия файлов. Это такой мой очень давний пэт проект, порожденный изначально необходимостью регулярно пересжимать какие-то файлы потому что базовые инструменты слишком часто делали их чрезмерно большими их можно было пересжать в 1.5-2 раза без потери функционала, то есть без необходимости распаковки перед тем как использовать. Живой пример - это все файлы в современных форматах MS Office OOXML - .docx, .xlsx, .pptx и все из этого семейства. Во первых все версии MS Office сжимают ZIP контейнер, которыми эти форматы являются, довольно плохо и просто распаковать файл и запаковать с максимальным сжатием уже давало результат. Во вторых большая часть изображений в этих файлах поддаются эффективному сжатию без потерь и могут уменьшиться в диапазоне 10-75% и итоговый файл уменьшится весьма существенно.
Как бы то ни было этот инструмент я делал давно и в нем было одно существенное ограничение - это то что старые форматы файлов MS Office (.doc, .xls, .ppt и др.) такому пересжатию не поддавались. Причина в том что они и ряд других форматов файлов придуманных Microsoft имели в своей основе Compound File Binary Format к которому есть очень ограниченное число открытых реализаций и большая их часть только на просмотр двоичных потоков внутри и не более того.
При этом у меня в архивах файлов в этих старых форматах MS Office накопилось немало, всегда хотелось их пересжать. И тут я подумал, а почему бы не попробовать и скормил подробное ТЗ в Claude Code с помощью которого в итоге собрал версию которая умеет пересжимать теперь еще и эти файлы. Это было непросто, для пересжатия используется анализатор OLE файлов в виде Python кода и пересборщих в виде кода на Rust поскольку только в Rust'е есть реализация кроссплатформенной библиотеки записи Compound файлов.
В итоге filerepack начиная с последней версии 0.4.0 умеет пересжимать основные старые форматы MS Office .ppt, .xls, .doc и это самое большое и самое сложное изменение в инструменте с момента его создания. Остальные правки по мелочи - поддержка большего числа форматов использующих ZIP как контейнер, поддержка большего числа файлов с данными и тд. Подробнее есть в документации включая примеры, руководства и так далее.
Отвечая на важный вопрос "А зачем?" который очень важно задавать и другим и, обязательно, себе. Казалось бы цена хранения файлов снижается и нет нужды лишний раз заморачиваться еще и сжатием контента. Это и так и не так.
Во первых многие файлы хранятся в облачных файловых хранилищах которые могут менять условия и стоимость хранения и с легкостью забиваются однотипными/похожими файлами и в этом случае лучше положить туда пересжатую версию этого файла и сэкономить на лишних расходах.
Во вторых многие личные архивы хранятся в криптоконтейнерах. Например, я лично ничего из личной чувствительной информации не храню просто на дисках и складываю файлы в криптоконтейнеры ограниченного размера. У этого есть ряд плюсов для параноиков, но есть и минус, там нет динамического увеличения размера по мере наполнения файлами. Место надо предвыделить и если еще и этот криптоконтейнер где содержимое часто меняется и его надо бэкапить то чем меньше он тем лучше. Тут то вопрос про сжатие файлов становится актуальным, но так чтобы без потери функциональности.
Есть и множество других кейсов использования, а это мои личные.
Поддержка файлов в старых форматах MS Office всё еще экспериментальна, если надумаете ее попробовать и столкнетесь с ошибками, пишите мне, лучше всего в issues на Github. Там же можно писать если какие-то популярные форматы есть и еще не поддерживаются или их рекомпрессия работает с ошибками.
Вообще же не могу вспомнить периода жизни когда я что-то не архивировал. Начиная с первых жестких дисков на 10МБ, дискетами на 360КБ. Все моё детство состояло из попыток что-то куда-то сжать чтобы не удалять потому что места всегда нехватало. Насколько проще стало все сейчас, но всегда найдется чем занять любые объемы хранения, так что сжимать файлы всегда актуально;)
#opensource #compression #data
Как бы то ни было этот инструмент я делал давно и в нем было одно существенное ограничение - это то что старые форматы файлов MS Office (.doc, .xls, .ppt и др.) такому пересжатию не поддавались. Причина в том что они и ряд других форматов файлов придуманных Microsoft имели в своей основе Compound File Binary Format к которому есть очень ограниченное число открытых реализаций и большая их часть только на просмотр двоичных потоков внутри и не более того.
При этом у меня в архивах файлов в этих старых форматах MS Office накопилось немало, всегда хотелось их пересжать. И тут я подумал, а почему бы не попробовать и скормил подробное ТЗ в Claude Code с помощью которого в итоге собрал версию которая умеет пересжимать теперь еще и эти файлы. Это было непросто, для пересжатия используется анализатор OLE файлов в виде Python кода и пересборщих в виде кода на Rust поскольку только в Rust'е есть реализация кроссплатформенной библиотеки записи Compound файлов.
В итоге filerepack начиная с последней версии 0.4.0 умеет пересжимать основные старые форматы MS Office .ppt, .xls, .doc и это самое большое и самое сложное изменение в инструменте с момента его создания. Остальные правки по мелочи - поддержка большего числа форматов использующих ZIP как контейнер, поддержка большего числа файлов с данными и тд. Подробнее есть в документации включая примеры, руководства и так далее.
Отвечая на важный вопрос "А зачем?" который очень важно задавать и другим и, обязательно, себе. Казалось бы цена хранения файлов снижается и нет нужды лишний раз заморачиваться еще и сжатием контента. Это и так и не так.
Во первых многие файлы хранятся в облачных файловых хранилищах которые могут менять условия и стоимость хранения и с легкостью забиваются однотипными/похожими файлами и в этом случае лучше положить туда пересжатую версию этого файла и сэкономить на лишних расходах.
Во вторых многие личные архивы хранятся в криптоконтейнерах. Например, я лично ничего из личной чувствительной информации не храню просто на дисках и складываю файлы в криптоконтейнеры ограниченного размера. У этого есть ряд плюсов для параноиков, но есть и минус, там нет динамического увеличения размера по мере наполнения файлами. Место надо предвыделить и если еще и этот криптоконтейнер где содержимое часто меняется и его надо бэкапить то чем меньше он тем лучше. Тут то вопрос про сжатие файлов становится актуальным, но так чтобы без потери функциональности.
Есть и множество других кейсов использования, а это мои личные.
Поддержка файлов в старых форматах MS Office всё еще экспериментальна, если надумаете ее попробовать и столкнетесь с ошибками, пишите мне, лучше всего в issues на Github. Там же можно писать если какие-то популярные форматы есть и еще не поддерживаются или их рекомпрессия работает с ошибками.
Вообще же не могу вспомнить периода жизни когда я что-то не архивировал. Начиная с первых жестких дисков на 10МБ, дискетами на 360КБ. Все моё детство состояло из попыток что-то куда-то сжать чтобы не удалять потому что места всегда нехватало. Насколько проще стало все сейчас, но всегда найдется чем занять любые объемы хранения, так что сжимать файлы всегда актуально;)
#opensource #compression #data
Telegram
Ivan Begtin
Я на выходных столкнулся с очередной ситуацией когда пришлось чистить свободное место на дисках, но при этом не хотелось архивировать некоторые файлы для холодного хранения, они нужны были под рукой. И я вспомнил про утилиту filesrepack которую я когда-то…
👍10⚡4❤3✍3😁2🤔1
В рубрике как это устроено у них SEGITTUR официальный портал статистики туризма в Испании. Предоставляет множество показателей в разрезе регионов страны, стран происхождения туристов, пассажиров в аэропортах и так далее. Данные помесячные со средней задержкой в 1.5-2 месяца, на 9 октября по основным показателям данные доступны за июнь-август. Можно увидеть что более всего туристов приезжает из Португалии и Франции, но многое ещё и от региона зависит. Внутри всё работает на PowerBI отображение статистики встроено серией дашбордов, а для тех кто хочет напрямую поработать с данными есть API. Испания не единственная страна с доступной статистикой по туризму, но одна из немногих кто предоставляет аналитику ещё и на данных сотовых операторов (а это же данные телекома). Ну и муниципальные показатели по городам тоже доступны. Полезно для самых разных задач, например, если хотите поехать куда-то где туристов поменьше (или наоборот, побольше).
#opendata #datasets #spain #tourism #statistics
#opendata #datasets #spain #tourism #statistics
✍2🔥2❤🔥1
Мне таки удалось достучаться до команды проекта экосистемы CKAN'а и они взяли из реестра каталогов данных Dateno данные по недостающим у них каталогам на базе CKAN и сразу увеличили число охватываемых ими каталогов с 700 до 1400. Это тоже не предел, они не проверяют геоблокировки, а очень многие каталоги заблокированы за пределами своих стран, но тем не менее уже прогресс.
В чем существенные отличия их системы от реестра каталогов. Они делают акцент на мониторинге API CKAN'а на предмет версий и расширений и проверяют насколько эти порталы закрыты последними патчами. Иначе говоря мониторятсвою промысловую базу тех кто разворачивает CKAN чтобы предупреждать если их инсталляции не обновлялись и могут быть взломаны из-за отсутствия патчей безопасности, к примеру.
CKAN, действительно, большая экосистема, хотя и далеко не единственная в мире порталов открытых данных.
#opendata #datacatalogs #ckan
В чем существенные отличия их системы от реестра каталогов. Они делают акцент на мониторинге API CKAN'а на предмет версий и расширений и проверяют насколько эти порталы закрыты последними патчами. Иначе говоря мониторят
CKAN, действительно, большая экосистема, хотя и далеко не единственная в мире порталов открытых данных.
#opendata #datacatalogs #ckan
👍13🔥3✍2👏1