Ivan Begtin
9.15K subscribers
2.68K photos
5 videos
115 files
5.51K links
I write about Open Data, Data Engineering, Government, Privacy, Digital Preservation and etc.

CTO&Founder of Dateno https://dateno.io

Telegram @ibegtin
Facebook - https://facebook.com/ibegtin
Email ivan@begtin.tech

Ads/promotion agent: @k0shk
Download Telegram
Я все забываю написать что у меня "висит" давняя задача по сбору метаданных из НЭБа (Национальная электронная библиотека) rusneb.ru

Там, с одной стороны, почти 5.5 миллионов материалов только тех что в свободном доступе и 51 миллион где только описания, а с другой стороны нет открытого API или массовой выгрузки (bulk download), а для многих гуманитарных/окологуманитарных проектов нужны метаданные оттуда.

Как вы понимаете написать сейчас парсер с помощью ИИ несложно, сложно и требует времени на то чтобы собрать все имеющиеся там метаданные в сохранить их.

Поэтому нужен не просто парсер НЭБа, а кто-то кто с его помощью сможет все метаданные по всем публикациям собрать и сохранить в сжатый/сжатые JSON lines файлы и передать их.

Хорошо если есть волонтер под такое, а если кто-то готов, но за деньги, то напишите мне о том сколько денег и сколько времени нужно - если ценник не безумный я их найду.

Что необходимо собрать: все метаданные с карточки описания каждой публикации включая автора, название, описание, дату и место публикации, тематики, каждый атрибут блока "Детальная информация", запись MARC21, ссылку на PDF файл.

Сами файлы выкачивать не нужно!

Систематизировать атрибуты метаданных и сделать также файл Parquet с ними будет большим плюсом.

Итоговый датасет будет открытым, выложу его на одном из порталов открытых данных.

#opencall #datasets
🔥11👍7❤‍🔥51🤝1
Свежий документ Data Systems at a Crossroads: Official Statistics for a New Era
от авторов из PARIS21 (The Partnership in Statistics for Development in the 21st Century).

Документ о том что национальные статистические службы в мире находятся в кризисе, а ещё вернее в нескольких кризисах:
- Кризис доверия и легитимности. Растёт политизация данных, а «факты» всё чаще проигрывают «чувствам» в публичной дискуссии.
- Финансовый и институциональный. Статистические службы недофинансируются, а их бюджеты несут всё большую нагрузку по сбору новых показателей (SDG, климат, цифровая экономика).
- Кадровый разрыв. Между хорошо оснащёнными НСО, которые уже экспериментируют с ML и NLP, и бюро, где данные до сих пор собираются на бумаге и обрабатываются в Excel, - пропасть.

Вывод там довольно простой, есть развилка в виде:
- продолжения медленного развития "как есть"
- глубокой трансформации статистических служб

Документ ценный краткостью и актуальностью и очень близок к моим собственным размышлениям. Статистические службы наиболее близки по смыслу к "дата-службам", они могли бы (должны бы?) производить оперативную качественную аналитику и поставлять данные, но за десятилетия-столетия своего существования обросли столь объемными фактическими и когнитивными ограничениями что в редких случаях выступают в этой роли.

При это цикл их развития очень медленный в сравнении со всем что творится с данными, а теперь и с ИИ в коммерческом секторе. К официальной статистике обращаются когда нет достойных альтернатив, но она почти всегда отстает в актуальности, полноте и соответствию ожиданиям рынка.

Например, Росстат можно сравнить с Почтой России. Вроде как монументальное явление, а WB и Ozon уже существенно почту потеснили. Монумент еще не рухнул, но вызывает очень много вопросов. Так и с Росстатом, вроде он есть и имеет полномочия, а реальной экспериментальной аналитикой и статистикой в РФ занимаются подведы Пр-ва и фед. органов исп. власти.

Росстат лишь как пример близкий, в похожих кризисах находятся статслужбы очень многих стран. Как они изменяться? Вот в этом документе есть некоторые размышления с примерами.

#statistics #readings
6👍54
Osiris open source продукт позиционируемый как альтернатива Palantir.

Включает отображение данных из множества слоев - конфликты, новости, уличные камеры, землетрясения и многое другое.

Я бы сказал что проект скорее "смазливый" чем какой-то другой. Очень подходящий для показа красивых картинок начальству или на каких-то экранах на выставках и очень далекий от практического применения. С развитием ИИ интерфейсы делать стало дешевле чем собрать и правильным образом интегрировать данные. А тут подключены не самые нужные данные, а те что хорошо подсвечены и доступны.

Тем не менее польза и от этого есть.

Код
под MIT, визуализация с помощью MapLibre

#opensource #analytics
🤔7❤‍🔥5🔥5🤨2
Радует что в ответ на мой запрос про парсинг НЭБа сразу несколько откликов, ожидаемо какого-то простого решения нет и парсинг займет некоторое осмысленное время, однако сама задача привела меня к мысли о том какими сейчас могут быть конкурсы и хакатоны про открытые данные.

Идея в том что трансформировать идею дататонов (datathons) хакатонов где создаются открытые данные к созданию данных высокой ценности. В ЕС и ряде развитых стран они называются high value datasets и являются частью госполитики, но слишком часто эти данные изначально существуют в неструктурированном виде. В лучшем случае в Excel, в худшем случае в бумажном архиве картинками. Самый частый случай - это множество PDF документов со сканами или текстами или HTML страниц.

Это могут быть базы законов, файлы ведомственной статистики, прогнозы погоды и метеонаблюдений картинками, тематические годовые доклады/отчеты и так далее. Иначе говоря - это не из API надо извлечь JSON'ки и склеить их или не самый простой HTML распарсить, а часто надо над этим повозиться.

Раньше это делать было непросто потому что подготовка качественных данных - это всегда было дорого из-за больших трудозатрат в анализе первичных данных и потом в их парсинге. Поэтому дататоны не были особо популярны. А вот с появлением ИИ агентов и кодирующих ассистентов такие задачи стали проще, настолько проще что можно к этому вернуться.

И мои мысли таковы что можно делать такие конкурсы на регулярной основе. Собрать призовой фонд в $2-3 тысячи в любой нац. валюте реалистично. Задач тоже множество. Например, по России - это уже упомянутые мной базы законов, госдокладов, статистики в PDF'ах, книг и тд. В Армении все еще хуже - большая часть интересных данных в виде PDF и реже файлах MS Word и Excel.

У меня есть списки из десятков таких подборок, те же госдоклады в РФ часто содержат то чего нет в официальной статистике Росстата, а таких госдокладов немало. У Минприроды, у ВИМС, у Роспотребнадзора и ещё много чего.

Поскольку хороших датасетов от государства сейчас дождаться сложно, то можно и, похоже, нужно возвращаться к их созданию из общедоступных сведений.

Как оценивать результаты на таком конкурсе? По объёмам (документов и записей), по сложности решаемой задачи (преобразовать Excel файлики просто, преобразовать изображения сложно), по востребованности, по качеству результата (качество содержания и качество метаданных).

Вот такие мысли вслух. Свободно делюсь идеей потому что если кто-то ещё будет делать подобное и как общественное благо, то будет только лучше.

#opendata #thoughts
👍12🔥953❤‍🔥2
Я вот тут столкнулся с тем что сам осваивал все что касается программирования ИИ агентами и применения ИИ в целом самостоятельно и на практике в основном, но регулярно в окружении есть люди которым нужно быстрое погружение, а материалов как раз про быстрое погружение у меня на руках нет.

Посоветуйте:
1. Что можно порекомендовать почитать про развитие ИИ в последние годы в сжатом виде для людей старшего возраста которые не имеют о теме ИИ глубокого представления, но обладают хорошим техническим образованием и бэкграундом. Понятно что практические материалы устаревают (обновляются) чуть ли не ежемесячно, и на смену RAG пришло уже много всего другого, как пример. Но наверняка есть хороший материал/книга/бесплатный курс быстрого погружения.

2. Какие курсы дают реальное быстрое погружение в Cursor, Antigravity, Claude Code и другие ИИ агенты для кодирования с нуля под задачи программирования и анализа данных. Курсов много, большая часть очень сомнительного качества. Что есть наиболее полезного сейчас? Критерий качества для меня - это "я на эти курсы готов отправить всех разработчиков", но никак не "я этот курс сделал, он отличный".

#questions #ai
155👍4🤔21
Еще одна свежая спецификация Website Spec на сей раз для создания современных сайтов. Казалось бы ничего радикально нового - списки обязательных и рекомендуемых стандартов и лучших практик, начиная от наличия важных атрибутов таких как кодировка и doctype у html и продолжая множеством других практик, стандартов и так далее. Важное отличие от любых других чеклистов в том что эта спецификация для LLM и ИИ агентов. Имеются описания для SKILLS, llms.txt, MCP и многое другое.

Разумно там буквально все, что-то реализуется при разработке кода, что на серверном уровне.

Автор явно думал над тем что делал и спецификация выглядит разумно-расширяемой.

Полезно для всех кто проектирует и разрабатывает сайты с помощью ИИ, разрабатывает дизайн и актуализирует существующие сайты.

#specifications #tools
👍75
По поводу блокировок в России Pypi, репозитория библиотек кода для Python и заявлений Роскомнадзора по поводу того что "это не они", все довольно просто. Pypi как и тысячи других сервисов в мире используют CDN, в данном случае сервис Fastly. Вот его Роскомнадзор уже несколько раз блокировал в предыдущих блокировках других ресурсов. Сейчас, я подозреваю, в очередной раз блокировали что-то еще использующее Fastly и затронули Pypi "случайно". Что РКН не оправдывает и не оправдывало никогда.

Проблема в том что таких инцидентов будет больше. Из-за наплыва ИИ агентов все больше онлайн ресурсов используют CDN'ы, просто из-за роста трафика, из-за задач блокировки ИИ агентов и краулеров, из-за роста нагрузки на инфраструктуру.

#thoughts #comments #russia
👍16🕊7💯3
Подборка ссылок про данные, технологии и не только:
- Redistricting Data Hub портал открытых данных о перераспределении округов, включает много данных по разным штатам США. В чистом виде общественно-политический проект множества партнерских избирательных организаций. Интересен технологичностью и четким фокусом
- OpenData набор проектов построения объектных и векторных хранилищ. Назвались очень странно OpenData, все таки, про другое. Делают что-то интересное, но непонятное потому что с названием не коррелирует.
- Headroom комплексный инструмент сжатия контекста для кодирующих ИИ агентов, помогает оптимизировать токены и скорость разработки. Обещают сжатие использования токенов в 60-95%
- AI Engineering from Scratch вводный курс для ИИ инженеров, 503 урока в 20 фазах. С открытым кодом

#opendata #opensource #ai #tools
7👍1
В рубрике закрытых открытых данных в России Минтранс РФ уже полгода как не публикует статистический бюллетень "Транспорт России". Последний бюллетень размещался у них на сайте 11 декабря 2025 года и за 9 месяцев 2025 года, а до этого 8 сентября, а до этого 9 июня, а до этого 14 марта.

То есть бюллетень публиковался примерно через 2.5 месяца после прошлого отчетного периода и в 2026 году до 15 марта должен был быть опубликован бюллетень за 2025 год, а до середины июня (в течении 10 дней от сегодня) ожидался бы бюллетень за первый квартал 2026 года.

Но бюллетеня за 2025 год нет, почему непонятно, анонсов на сайте Минтранса РФ я лично тоже не видел.

Записываем этот случай в очередной пример закрытия официальной статистики в РФ.

#opendata #closeddata #russia
6😢61❤‍🔥1
Полезные ссылки про данные, технологии и не только:
- coreutils Microsoft выпустили набор unix подобных инструментов для Windows. Хочется сказать не поздно ли? Ибо альтернативы были, тут главное достоинство в том что это родные утилиты от производителя, но со своими ограничениями. Полезно для всех кто использует W10/W11 и любит командную строку
- Pluto система тетрадок на базе языка Julia. Примеры на сайте не открываются, сложно посмотреть пока в действии, но само по себе интересно, хотя и врядли серьезно потеснит Python
- ingestr новая версия утилиты быстрой загрузки данных в огромное число источников из большого числа источников. Пишут что в версии 1 существенное ускорение по сравнению с другими инструментами и версией 0. Надо пробовать.

#opensource #data #tools
👍511
Свежий ИИ инструмент от Google под названием Google AI Edge Eloquent позволяет расшифровывать речь в текст и сразу этот текст улучшать. Из особенностей, он работает в режиме local-first, вся расшифровка происходит на устройстве пользователя с помощью одной из двух локально установленных LLM, это Gemma 4 2b или Gemma 4 12b. Вторая существенно требовательнее к объёмам хранения и оперативной памяти, но дает существенно лучший результат в моих тестах версии для MacOS. Что необычно - это что продукт выпускается вначале не для экосистемы Google, а для продуктов Apple, и то что он локальный, отвязанный от многочисленных сервисов Google. Впрочем у Google есть похожие продукты вроде близкого по смыслу Google AI Edge Gallery чем-то напоминающим LM Studio для тех кому не нужно сложностей.

В любом случае этот продукт интересный, попробовать его для расшифровки голоса в текст стоит. И он бесплатен, что тоже немаловажно.

#google #ai #voice #voicetotext
❤‍🔥10👍43
Интересный доклад Corporate Transparency от US GAO посвященной прозрачности сведений о конечных владельцах компаний в США. На странице краткое изложение и там же ссылка на подробный текст, полезный всем кто изучает то как устроена прозрачность бизнеса в мире. Если вкратце то GAO рекомендуют обязать компании раскрывать сведения о владельцах что сейчас предусмотрено далеко не всегда.

Все кто сталкивался с открытием бизнеса в США знают что концентрация сложностей там возникает не в момент регистрации компании, а при открытии счета в банке где необходимо проходить due diligence. Похожая ситуация с странах ЕС и еще много в каких развитых странах.

А GAO в своем отчете пишут что в этой ситуации компании которые регистрируются, но не открывают счетов выпадают из под мониторинга и сведения о их владельцах недоступны и они могут использоваться для финансовых преступлений.

Я, правда, не настолько хорошо знаю устройство схем работы с такими компаниями у которых нет счетов в банках и которые не должны проходить due diligence, интересно тогда как они ведут деятельность? Но специалисты, уверен, знают лучше.

В любом случае доклад интересный для понимания как устроена прозрачность бизнеса в США, из известных цифр - там зарегистрировано порядка 50 миллионов того что в РФ называют юр лицами. К ним есть разные требования по прозрачности и они неплохо описаны.

#readings #transparency #usa
52🤔2
Европейский пакет по технологическому суверенитету European Technological Sovereignty Package.

Включает 4 инициативы:
- The Chips Act 2.0 - усиление экосистемы полупроводников
- The Cloud and AI Development Act (CADA) - снижение зависимости от иностранных облачных и ИИ провайдеров
- The EU Open Source Strategy - общее снижение зависимостей в технологическом секторе
- A Strategic Roadmap for Digitalisation and AI in Energy - стратегическая дорожная карта для цифровизации и ИИ в энергетике

Почитать будет полезно все эти документы, мне лично были особенно интересны стратегия по открытому коду и CADA. У Евросоюза есть хорошие шансы сделать много что интересного несмотря на огромную бюрократию и множество ограничений. А открытый код еще и повторно использовать можно.

#opensource #eu #regulation #readings
3👍2🤔21
В Великобритании национальный портал открытых данных data.gov.uk переименовали в National Data Library (Национальная библиотека данных) и рассказали о том почему и как они это делают.

Признаюсь я смотрю на это с большим скепсисом, у меня есть ощущение что интенции может быть и хорошие, а реализация так себе.

Ключевой двигатель изменений нац порталов открытых данных в том что в какой-то момент многие из них превратились в помойки. Идея open by default без методической поддержки привела к большому числу бессмысленных маленьких наборов данных не востребованных и не нужных 99% пользователей. Преодолевают эту проблему очень по разному:
- в Евросоюзе - фокусируются на данных особой ценности выводимых в отдельную категорию
- в США - откровенно забивают на портал data.gov, он давно наполняется, но качественно не меняется. Поэтому параллельно создают много разной открытой инфраструктуры для геоданных, научных данных и тд.
- в Индонезии - кратно увеличивают число опубликованных открытых данных публикуя на них чуть ли не каждый файл созданный госорганами. Сейчас там больше 580 тысяч файлов на data.go.id

И вот в Великобритании это решили делать через curated datasets, не особо понимая своих реальных и потенциальных пользователей и не обеспечивая технологической основы.

С одной стороны удивительно, а с другой не очень. Как хороший пример, data.gov.uk я пока приводить не могу.

#opendata #uk #thoughts
👍52🤔2
В качестве небольшого оффтопа на фоне только что прошедших выборов в Армении, расскажу о том почему не нужно читать советские газеты по утрам российскую прессу на эту тему и в особенности про проблемы армянской экономики из-за российских ограничений.

Особенность экономики Армении о которой не все знают в том что цифры статистики Армстата отражают её с большими искажениями. Важная особенность Армении в том что её физический экспорт продукции, завязан на экспорт из России и импорт в Россию, но далеко не критически. Можно посмотреть исторические данные за 2024 год чтобы в этом убедиться.

Важнее то что в Армении существенная часть работодателей и формирование ВВП завязано на международный ИТ сектор, компании которые почти не заметны на ИТ рынке внутри, но имеющие глобальное присутствие. У них почти у всех кроме юр лиц в самой Армении, есть фронтирующие юр лица в США или Гонконге или Сингапуре от которых они ведут деятельность, но почти всех их сотрудники находятся в Армении, в Армении их R&D подразделения и так далее. Большое число людей тратящих доходы внутри страны.

Кроме того если хорошенько посмотреть на реальную картину импорта/экспорта Армении по его структуре, то можно обнаружить насколько он изменился с 2021 года. В частности, несколько лет Армения была де-факто транзитным хабом для торговли российским золотом, платиной, алмазами и серебром и даже как-то удивительно что российские власти ограничивали импорт армянской минеральной воды, а экспорт золота из России что-то не
ограничивали;) (на самом деле - не удивительно).

Поэтому повторюсь, не читайте СМИ. Все, на самом деле, не так как в реальности (c).

#thoughts #armenia
652🤝2
В рубрике интересных каталогов открытых данных коллекция датасетов в проекте Mozilla Data Collective. Включает множество датасетов по самым разным темам, но основная тема - это языковое разнообразие и каталог включает множество наборов данных именно по языкам, включая редкие или не самые популярные. Например, датасеты по армянскому языку

Из плюсов:
- датасетов много и они полезны
- большая часть под свободными лицензиями или почти свободными вроде CC-ND/CC-NC
- Mozilla устоявшаяся структура, есть ощущение что каталог не сиюминутен

Из минусов:
- доступ требует регистрации и это не открытые данные, для выгрузки или доступа через API даже при свободных лицензиях надо согласится вручную со всеми условиями (не только лицензиями)
- сам каталог является самостоятельной поделкой, не стандартизированный поэтому многие функции вроде фильтрации сделаны так себе, непродуманно
- то что там называется API - это API на выкачку файлов, а не на доступ к данным через API.

В целом не вижу чем он удобнее чем тот же Hugging Face, в работе с датасетами для ИИ, но помнить о нем немаловажно

#opendata #datasets #datacatalogs
1👍6❤‍🔥2
Data.gov: Implementation and Perspectives on Its Functions на сайте Конгресса США обзор истории портала Data.gov и перспектив его развития. Документ в форме отчета Конгресса, написан очень бюрократизированным языком, читать его непросто, хотя и интересно.

А заодно полезно для понимания проблем с которыми сталкиваются при разработке порталов открытых данных. Data.gov в довольно запущенном состоянии уже давно, как и ряд других национальных порталов открытых данных.

#opendata #usa #data #datacatalogs
3👍3
692 номера, 69 лет и один перерыв на войну. В Цифровом архиве госфинансов и госуправления собраны все выпуски журнала «Плановое хозяйство» — главного печатного органа Госплана СССР

Издание ведёт отсчёт от «Бюллетеней Госплана» (1922–1923), сохранив сквозную нумерацию и в 1924 году обретя постоянное название. На его страницах печатались не только планы и балансы, но и ключевые экономические дискуссии:

• в 1927 году здесь вышли «Критические заметки о плане развития народного хозяйства» Н.Д. Кондратьева, где были обозначены системные изъяны планирования;

• в 1928–1929 годах разворачивались споры о том, сохранятся ли цены при «законченном социализме»;

• в 1930-м вышел специальный номер о «вредительстве», открывавшийся статьёй Г.М. Кржижановского с примечательной фразой о теплотехнике К.В. Кирше: тот «заблаговременно умер до своей вероятной измены».

В послевоенный период журнал оставался главной профессиональной трибуной: в 1973 году он стал первым отраслевым изданием, удостоенным Ордена Трудового Красного Знамени (тираж достигал 52 тыс. экз.), а в 1973-м и 1988–1989 годах на его страницах обсуждались методы оптимального планирования и противозатратное хозяйствование.

В подборку вошли 692 номера в формате PDF — от «Бюллетеней Госплана» до последнего выпуска 1991 года, когда издание было переименовано в «Экономист». Ознакомиться и скачать можно на сайте Цифрового архива.

#ЦАГГ #история #госуправление #экономика #подборка
🔥1694