Ivan Begtin
9.1K subscribers
2.72K photos
5 videos
116 files
5.6K links
I write about Open Data, Data Engineering, Government, Privacy, Digital Preservation and etc.

CTO&Founder of Dateno https://dateno.io

Telegram @ibegtin
Facebook - https://facebook.com/ibegtin
Email ivan@begtin.tech

Ads/promotion agent: @k0shk
Download Telegram
Полезное чтение про данные, технологии и не только:
- How AI is breaking the British state статья в The Economist о том что граждане в Великобритании начали массово использовать ИИ агенты для подачи жалоб и аппеляций, так что скоро суды будут перегружены если не уже. И о том что эта ситуация грозит повториться во всех богатых демократиях где у граждан есть многие права и теперь ИИ заменяет юристов которые подавали такие жалобы. Статья за пэйволом, вот тут можно почитать ее краткое изложение
- Reimagining Development Data каталог каталогов (data inventory) наиболее значимых баз по тематике международного развития. Полезно для тех кто интересуется темой и мне для пополнения реестра каталогов данных Dateno
- The Prediction Revolution книга от Grace Huckins о том как ИИ дает возможности предсказывать то что ранее предсказывать было невозможно.

#ai #opendata
🔥8✍4💯1
В Reuters статья о том что Госдепартамент США потребовал у стран определиться в какой из глобальных ИИ инициатив они участвуют - в Pax Silica или WAICO. Я чуть менее месяца назад писал об этом же, что эти две инициативы словно создают новых двух полярный мир и единственная страна которая сейчас пытается усидеть на двух стульях - это Казахстан, но думаю что тут США надавят. Интересно уже даже появится ли на фоне этого своеобразное движение цифрового неприсоединения, участники которого будут де-факто отказываться от участия в обеих этих инициативах? В любом случае чем дальше тем больше вокруг ИИ будет завязано геополитики и страсти накаляться по мере применения основанных на них инструментов в военных целях, кибербезопасности, террористами и так далее.

#ai #geopolitics #usa #china
👍5🕊5🗿4🤣2
Полезные ссылки про данные, технологии и не только:
- ClickBench playground рассказ о том как устроен сервис запросов к более чем сотне разных баз данных используемых в бенчмарке ClickBench. И сам бенчмарк очень интересный как сравнение многих СУБД, и игровая площадка полезная
- A Preview of DuckDB v2.0 изменения в DuckDB, то что войдет в версию 2.0. Ключевое это новый парсер SQL, новый формат хранения, серверный вариант, ускорение запросов и еще много всего.
- fx кодирующий агент ориентированный на исследования и встраивание
- Cursor Origin хостинг кода от Cursor'а. Очень логичный шаг, странно что только они из кодирующих агентов такое начали. Думаю что остальные подтянутся. Альтернативы Github'у - это хорошо. А вот складывать все яйца в одну корзину лучше не надо.

#opensource #ai #databases
🔥5✍3👍2🎉1💯1
Я регулярно пишу про кризис в сообществе открытых данных из-за развития LLM. Главный источник кризиса в том что у открытых данных да и вообще у любых доступных данных появились компании которые умеют профессионально их монетизировать, хотя инфраструктура проектов с данными создается волонтерами, поддерживается на гранты и так далее.

Вот тут свежий документ-письмо сообщества DPG - Best Practices for Preventing AI Exploitation of Open Content and Open Data DPGs.

Иначе говоря на повестке сообщества не в том как больше открыть данные, а как разделить потребителей на коммерческих и некоммерческих. Там список технических, юридических и управленческих мер по ограничению ботов скрейперов, указанию лицензий использования, условий использования и так далее.

Важный документ отражающий общие настроения которые можно изложить как "мы работаем бесплатно, а на нас зарабатывают миллиарды долларов".

Отдельный вопрос в том что это кризис открытости в целом, не только данных, но и кода, свободно распространяемых текстов и так далее.

#opendata #ai
✍9⚡7💔4👍2🥰1👏1💋1
Многие пишут про ox-alpha "скрытую" модель на OpenRouter где не указано кто её создатель, но можно моделью бесплатно воспользоваться. Много разных есть догадок о том кто за ней стоит и кто бы это не был - это неплохой, но, явно, очень дорогой маркетинг. Сейчас все бросились её тестировать и писать о ней, а потом все начнут писать о том кто же за ней когда создатель всплывёт наружу.

И напишут потому что модель вполне себе качественно работает как минимум на задачах кодирования, анализа и работы с данными. По субъективным ощущениям не хуже GLM-5.3, а может и даже лучше.

#ai #datatools
✍7👍4🤔2❤1👏1
Я тут затеял большое обновление реестра каталогов данных Dateno с помощью фронтирных LLM, преимущественно через Cursor, но не только. Главные ощутимые изменения в применении именно последних моделей в том что они гораздо лучше понимают контекст и предыдущий накопленный опыт в правилах и гайдах и в том что они гораздо лучше вносят исправления сразу во множество файлов.

Для понимания как устроен реестр каталогов данных, в нем содержится уже более 22 тысяч YAML файлов распределенных по каталогам в иерархии ISO3166 и по типам каталогов данных (opendata, geo, indicators и тд.).

Каждый YAML файл я могу отредактировать вручную, а могу скормить ИИ агенту с промптом вроде "Update metadata for record /data/entities/..." или чуть более сложным при необходимости. ИИ агент пройдет по всем ключевым атрибутам, поищет в интернете, сравнит с другими записями и внесет изменения.

Предыдущее поколение моделей, условный Opus 4.5 или GLM-5.2 хорошо умеют обновлять отдельные записи и начинают хуже работать когда надо обновить гораздо больше. Текущие флагманские модели могут проанализировать и исправить до нескольких сотен записей. Какой-нибудь промпт вроде "Review records at data/entities/IT and fix them" где более 350 записей с каталогами данных Италии отрабатывается за 15 минут.

При этом видно что модель уже гораздо лучше понимает логику поиска и актуализации информации, ищет альтернативные хосты и названия если сайт умер, проверяет точки подключения к API и так далее. Гораздо меньше надо объяснять в самом промпте если заранее заданы правила.

Собственно благодаря этому сейчас я могу обновить вообще все метаданные реестра и добавить, наконец-то, многое отложенное. Собственно поэтому меньше чем за 3 недели реестр вырос уже с 14 до 22 тысяч каталогов данных плюс обновление метаданных почти всех записей.

К слову это можно повторить с помощью бесплатных или недорогих китайских моделей, но заняло бы это больше времени при относительно небольшой экономии средств.

Кстати, в решаемой мной задаче поиска каталогов данных больше расходов идет не на подписку на ИИ агенты/ассистенты, а на подписку на сопутствующие сервисы. Например, поиск каталогов данных резко улучшается когда используешь Censys, это, конечно, чистой воды кибербезовский инструмент, но в задачах обнаружения веб-ресурсов он очень эффективен. Но при их системе оплаты внесенные средства сжигаются очень быстро. Хотя и он дешевле чем использовать какой-нибудь BuiltWith.

Общая стоимость решения такова что расходы на ИИ агенты в нем не основные, а обогащение данных становится значительно эффективнее.

#thoughts #ai #datacatalogs
👍7✍1🤔1
В рубрике как это устроено у них AIKosh индийский государственный портал данных для ИИ. Включает 15200+ наборов данных, пакет aikosh для Python для работы с порталом, оценку качества каждого набора данных, четкие условия использования (в основном CC-BY-NC-SA) и так далее.

Доступ к данным дают только после регистрации. Также предоставляют инфраструктуру для работы с данными в разделе Notebook и так далее.

#opendata #ai #india #datacatalogs #datasets
🔥3🏆2✍1
Читаю новости про то как ИИ агенты взломали вики и обменивались там лучшими практиками обмана при выполнении некоторых задач.

У меня возникает много вопросов, ведь ИИ агенты прочитают эту новость и сделают ещё один логичный вывод что надо маскироваться лучше.

Так когда мы дождемся что ИИ агенты начнут использовать блокчейн, иные способы коммуникации через мэш-сети, например, или когда создадут свой "мессенжер для роботов", когда начнут шифровать всю переписку, когда начнут использовать язык коммуникации отличный от человеческих разговорных?

Да и я вот пишу об этом всем и жду когда ИИ агенты считают этот текст и возьмут в работу все эти идеи.

Скоро "не подсказывай им" будет не про известных людей, а про ещё неизвестных нам автономных ИИ агентов😂

#ai #thoughts
😁12👍5💯5❤3🔥2🤔1😱1💅1
Разные мысли вслух:
1. Я раньше не обратил внимание, а оказывается возглавляемая Китаем World Artificial Intelligence Cooperation Organization (WAICO) активно растет и в конце июля туда ещё 8 стран присоединилось и 1 страна стала наблюдателем. Все, конечно, страны 3-го и 2-го мира, например, туда вступила Грузия. Думаю что туда вступят все страны с где сильно влияние Китая. А вот Армения вступит врядли учитывая что на её территории уже строится ЦОД FireBird с чипами Nvidia. Скорее интересно пустят ли и вступит ли Армения в Pax Silica организованный США и противостоящий WAICO де-факто.

2. Госрегулирование "замедления разработки ИИ" мне с самого начала казалось совершенно нереалистичным. Учитывая прогресс китайских компаний то все попытки самоограничений ведущих ИИтехов в США приведут лишь к тому что китайские открытые модели станут лучше и более востребованными. Я вообще не понимаю как сейчас можно остановить прогресс при разработке ИИ кроме как глобальными катастрофами, восстаниями и войнами (тоже катастрофами).

3. Можно измерять новые виды неравенства, по доступности данных и информации для граждан. Все индексы доступности тех или иных данных и сведений можно разделить на те страны где данные не публикуются потому что не собираются (некоторые совсем бедные страны) и те страны где данные собираются, но не публикуются. Во втором случае - это пример неравенства доступа к информации для власти, для элиты и для рядовых граждан. Один из важнейших критериев - это доступность гиперлокальных данных, качество жизни в конкретных локациях. Но это самое сложное в измерении, хотя видно что в развитых странах эти данные есть почти всегда.

4. Хотите очень много научных данных? DandiArchive инициатива по публикации данных по нейрофизиологии. 2.3 Петабайта данных на сегодняшний день. Много это или мало ? Для доступных данных - много, для закрытых архивов не так много, но тоже существенно.

#opendata #ai #thoughts
👍4🔥2🤔2💯1
Полезные ссылки про данные, технологии и не только:
- mnemiq - текст-в-SQL движок с открытым кодом и подробным рассказом почему его сделали, как он устроен и чем отличается от ранее существующих. Если кратко, то создатели сфокусировались на разных SQL диалектах и преодолении ограничения в 30 таблиц у движка Genie от Databricks. Полезно для всех кто работает с большими корпоративными хранилищами данными, сложно устроенными и с большим числом таблиц.
- Pandas Should Go Extinct текст где автор рассуждает о том что давно уже не надо использовать Pandas в разработке и аналитике потому что альтернативы Polars и DuckDB лучше настолько что непонятно почему ими не пользуются.
- Tau ещё один терминальный кодирующий агент, пока не могу сказать чем он лучше других, но он есть и его можно попробовать
- Cline Desktop настольное приложение для запуска моделей с открытыми весами. Обещают много разного полезного и есть версии для Mac и Windows. С открытым кодом
- OpenResearch параллельно работающие исследовательские агенты в локальном окружении. Приложение для Windows и Mac, с открытым кодом. По мне так в описании маловато кейсов описано

#opensource #ai #tools #data
✍3🔥3❤1❤‍🔥1
Я наверняка не единственный кто это подмечает, но одно из наблюдений за средами и приложениями вроде Cursor, Z.ai, Kimi, ChatGPT, Claude и многими другими остальными построенными вокруг работы с AI агентами - это непрерывность изменений и развития. Понятно что у их команд много ресурсов, финансовых, интеллектуальных, инфраструктурных, но тут ещё и явно культура разработки с помощи ИИ ассистентов (не путаем с вайб-кодингом).

Буквально в считанные месяцы и недели они эволюционируют из простых инструментов во всё более продвинутые, как с точки зрения управления множествами субагентов, так и способами представления промежуточных и итоговых результатов.

Для софтверной разработки - это новая планка качества, сильно контрастирующая со всеми предыдущими разнообразными подходами, не предполагающими частотных и даже сверхчастотных (ежесуточных) обновлений.

В удивительное время живём.

#thoughts #software #ai
❤9🤔4❤‍🔥2💯1
Свежая статья (ссылка на вариант без пэйволла) в The Economist о том что ИИ впервые выиграл Metaculus Cup, соревнование среди предсказателей событий. Причем в 2024 году результаты работы ИИ агентов были совсем слабые, а в 3-м квартале 2026 ИИ агенты обогнали почти всех людей участников.

Причем я так понимаю что в лидерах там стартап Mantic которые как раз параллельно (или по итогам?) подняли $25 миллионов венчурного финансирования на продукт по AI Forecasting.

Вспоминаются фильмы вроде Особое мнение и многочисленная литература о ИИ предсказывающем будущее на годы вперед.

Такие продукты могут повлиять не только на рынки предсказаний, фондовые рынки и тд., но и на прогнозирование многих глобальных и менее глобальных событий.

#ai #thoughts #forecasting
✍5👍3🌚3❤1
Яндекс выпустил AliceAI-Foundation-80B-A3B-Base базовую языковую модель с открытыми весами и акцентом на лучшую поддержку русского языка.

Пишут что модель была обучена полностью с нуля и приводят множество результатов бенчмарков в сравнении с:
- Qwen3.5-35B-A3B-Base
- GLM-4.5-Air-Base (106B-A12B)
- Nemotron-3-Super-120B-A12B-Base
- DeepSeek-V4-Flash-Base (284B-A13B)

Это хорошая новость, больше открытых моделей, больше конкуренции!

Важно чтобы релизов было больше, потому что конкуренты работают очень быстро выпуская новые модели чуть ли не еженедельно.

#ai #opensource #yandex
❤8🤣8✍2⚡1👍1🔥1😁1
Прочитал две интересные статьи на Хабре Карточный домик из GPU: архитектура neocloud-пузыря и Рынок вычислений в России, Казахстане и Беларуси.

Не знаю автора, но написано очень хорошо, и комментарии к первой статье полезные, раскрывают тему GPU и ЦОДов с новых сторон.

Что хорошего для не-российских ИИ продуктов - это то что цены на токены будут снижаться неизбежно. Я с этим выводом согласен и наблюдаю тот же тренд.

Что не то чтобы очень хорошо для российских ИИ продуктов в том что в России дефицит чипов и мощностей никуда не исчезнет и стоимость токенов/использования LLM хоть и будет снижаться, но будет кратно больше чем не в России.

#readings #ai
✍3👍3😢3
Полезные ссылки про данные, технологии и не только:
- Search минималистичный браузер на базе WebKit для MacOS. Всего 3MB футпринт и почти мгновенный запуск.
- Why SQL won интервью с создателем DuckDB о том почему SQL побеждает (победил?) альтернативные подходы к хранению и доступу к данным.
- Open Code Review от команды Alibaba для автоматического ревью кода по правилам и с помощью ИИ агентов. Большая пользовательская база, плагины для множества сред и
- В Китае расширили ограничения на выезд на семьи топовых ИИ спецов даже не знаю как это комментировать. Вот если, к примеру, в России это еще не внедрели значит ли это что в России полноценной ИИ индустрии нет и топовых спецов в мировом понимании не осталось? А если остались то где их реестр? Можно уже анекдоты придумывать на тему "если ты такой умный то почему тебе еще выезд не запретили?"

#opensource #ai #sql #dataengineering
👍5
ИИ сервис Manus обновился до версии 2.0, первое большое обновление после того как я его вернули назад в Китай после продажи в Meta и требования китайского пр-ва вернуть его назад. Из заметных значимых изменений:
- новое приложение Manus Studio которое теперь значительно интегрировано с локальным компьютером, позволяет управлять почтой, приложениями и еще много чем
- гораздо больший акцент на разработке ПО и создании документов/мультимедиа/презентаций. Можно подключать теперь Manus к локальным репозиториям
- возможность подключать внешние LLM
- пропала или глубоко скрыта опция проводить широкие исследования в сети (wide research)

С одной стороны виден прогресс, а с другой, вот лично я регулярно пользовался именно возможностями для wide research. Впрочем, возможно, что эти же возможности остались просто теперь являются частью нормального процесса работы и не вынесены отдельно.

Вообще же ответить на вопрос каким ИИ инструментом пользоваться, сложно дать однозначный ответ. Лично я использую сейчас Cursor, ChatGPT, Kimi, ZCode, Manus, Open Designer и ещё ряд других, причем очень часто не по прямому их назначению. Например, инструменты для разработки часто оказываются удобными для аналитики и написания/исправления документов и даже рисования графиков.

#ai #tools
👍7
🤖 Где искать датасеты для ИИ в России: обзор каталогов

Подборка российских каталогов данных для машинного обучения - от государственных реестров до исследовательских коллекций. Сохраняйте, пригодится 👇

🏛 Реестр наборов данных и моделей ИИ - registry.cit.gov.ru/datasets Официальный государственный реестр: датасеты и модели ИИ с описательными метаданными. Первый пункт, если нужны данные с госучастием.

🏙 Moscow AI Datasets - ai.mos.ru/datasets Анонимизированные данные Москвы для обучения моделей: мобильность населения, путевые листы ЖКХ, заявки на нестационарную торговлю.
Каталог открытый, есть сэмплы для скачивания.

🔬 Yandex Research Datasets - research.yandex.com/datasets Исследовательские датасеты Яндекса: бенчмарки для графового ML (GraphLand, гетерофильные графы), табличный ML с временным дрейфом (TabReD), данные для ранжирования. Золото для исследователей.

🎬 MSU Datasets Collection - videoprocessing.ai/datasets Коллекция лаборатории графики и медиа МГУ: базы качества видео с субъективными оценками (SAVAM, MSU CVQAD), артефакты JPEG AI, стерео-датасеты. Стандарт де-факто для бенчмарков видеокодеков.

🫁 MosMedData - mosmed.ai/datasets Аксиальные КТ-снимки грудной клетки (в том числе COVID-19), большинство случаев - с сериями срезов. Один из самых известных медицинских датасетов из России.

🏥 Medical Data Hub - medicaldatahub.ru/datasets Каталог медицинских данных для ML - дополнение к MosMed для тех, кто строит модели в медицине.

🔎 Бонус-трек - не совсем ML, но полезно:
▫️ OpenUrbanData (openurbandata.ru) - поисковик по источникам данных для городских исследований
▫️ DetCorpus (detcorpus.ru) - корпус русской детективной литературы для NLP-экспериментов
▫️ RusPsyData (ruspsydata.figshare.com) - данные и инструменты психологических исследований

#opendata #russia #ai #ml #datasets #datacatalogs
❤5✍2👍2🔥1
🌐 Национальные каталоги данных для машинного обучения

Пока все смотрят на Hugging Face, государства строят собственные платформы с датасетами для ИИ. Собрал самые значимые - все они есть в нашем реестре dataportals-registry (43 000+ каталогов данных со всего мира).

🇰🇷 Южная Корея - AI Hub
aihub.or.kr
Крупнейшая государственная платформа ИИ-данных: тысячи датасетов на корейском языке - речь, текст, компьютерное зрение. Оператор - агентство NIA при министерстве науки и ИКТ.

🇮🇳 Индия - AIKosh
aikosh.indiaai.gov.in
Репозиторий миссии IndiaAI (министерство электроники и IT): более 12 000 наборов данных, моделей и кейсов для разработки ИИ.

🇪🇺 Евросоюз - AI-on-Demand
catalogue.aiodp.eu
Единый каталог ИИ-активов Европы в рамках платформы AI4Europe: датасеты, библиотеки, инструменты и контейнеры.

🇺🇸 США - NAIRR Pilot
nairrpilot.org
Пилот Национального ресурса ИИ-исследований под руководством NSF: проверенные датасеты, предобученные модели и инструменты для исследований и образования.

🇯🇵 Япония - NICT AI Data Testbed
ai-data.nict.go.jp
Каталог национального института NICT: речь и язык, био- и нейроданные, атмосфера, космическая погода, кибербезопасность.

🇨🇳 Китай - BAAI Data Platform
data.baai.ac.cn
Платформа Пекинской академии ИИ с большими корпусами для обучения LLM. Рядом - целая экосистема: OpenDataLab, Tianchi, ModelScope.

🇷🇺 Россия - Реестр наборов данных и моделей ИИ
registry.cit.gov.ru/datasets
Публичный реестр датасетов для машинного обучения и моделей ИИ от ФГАУ «Цифровые индустриальные технологии».

Общее у всех: открытый доступ, государственная поддержка и ставка на данные для обучения моделей, а не просто «открытые данные для отчётности».

Полный список ML-каталогов (сегодня их 91) - в открытом реестре:
github.com/datenoio/dataportals-registry


#opendata #ai #ml #datacatalogs #datasets
✍5👍4❤2
Полезные ссылки про данные, технологии и не только:
- Diving Through Data at OpenAI: How a Data Agent Navigates 70,000 Datasets видео с конференции Rows&Columns о том как устроен внутренний ИИ агент к данным более чем 70 тысяч наборов данных и более 600 петабайт обрабатываемых ежесуточно
- Microsoft, Google back Apache Ossie to make enterprise data and AI platforms more interoperable время новых стандартов для обмена данными, впрочем Ossie не то чтобы сильно новый, но похоже что активно внедрямый
- I Quit OpenAI Because Its Culture Is Broken (очередной) чувак ушел из OpenAI и рассказывает о том что AI бигтехам надо больше внимания уделять безопасности. Похоже что рассуждения в этом жанре нас ждут ещё не один раз
- Introducing Web Search API via AI Gateway Cloudflare сделали универсальное API для веб поиска через сервисы Ceramic.ai, Exa, и Linkup. Вообще к Cloudflare стоит присмотреться к их текущим и грядущим продуктам, они явно играют создание универсальной инфрасируктуры для ИИ инструментов и агентов и имеют хорошие шансы занять большие и малые ниши в этой области.

#opensource #ai #data #search
✍2⚡1
Разные мысли слух и не только:
1. Модель MiniMax M3 и их среда разработки почти дотягивает до GLM-5.3 от Z.ai. По бенчмаркам GLM-5.3 точно лучше, но по цене M3 в 4 раза выгоднее. На практике они близки друг к другу и использовать MiniMax Code себя оправдыввает на множестве задач "простого кодирования". Для vibe-кодеров оно точно не годится, а для тех кто работает с открытым кодом и фокусируется на приведении кода/репозиториев в порядок вполне годится.
2. Учитывая как существенно падают затраты на создание структурированных данных из неструктурированных есть ощущение что довольно скоро будет бум самопальных каталогов данных. Они уже всё чаще появляются, но пока массовости явления нет, а есть ощущение что оно появится как возвращающийся тренд "посмотрите они [государство] бесполезны, а я знаю как сделать правильно, вот смотрите портал данных [моей страны/моего региона/моего города]". Чаще, конечно, сейчас такое про альтернативы официальным порталам статистики, но ими все не ограничится.
3. Главная беда контентных проектов написанных на 100% с помощью ИИ в отсутствии ответа на вопрос "не хуйню ли я делаю?" "А зачем?". Для многих у кого были идеи в загашники, но реализация которых требовала собрать команду разработчиков и потратиться всерьез, теперь вайбкодят нейрослоповые проекты и, по прежнему, не имеют ответа на этот вопрос. Главная проблема такого в нейрослопа в том что ценности в этом немного, а стоимость воспроизведения даже ниже чем у классических проектов. У меня в загашнике есть немало идей вплоть до написанных ТЗ на подобные проекты, но пока ни один из них фильтр разумного ответа на самый главный вопрос не прошли.
4. Чем больше я изучаю того как устроены каталоги данных по всему миру тем больше соблазн написать самый лучший/эффективный/технологичный свой движок для каталога данных тем более что у меня такой опыт уже был несколько раз в жизни. Очень стараюсь не попасться в эту ловушку, потому что движков каталогов данных десятки, по настоящему хороших может и немного, но для хороших и рынка то особо нет.

#thoughts #ai #coding #opendata
👍5❤2