Почему невозможно избавиться от PDF ?
Вот уже долгое время меня поражает то какая индустрия, спектр открытых и платных инструментов появился вокруг преобразования неструктурированных данных/документов в структурированные Markdown или JSON. И здесь особняком идут файлы в PDF формате, которых, внезапно, оказалось чуть ли не большая часть всего созданного в текстах в виде разного рода банков документов: архивов научных статей, корпоративных банков документов, баз законов и законопроектов, архивов публичных отчетов компаний и так далее.
PDF изначально разрабатывался как универсальный формат адаптированный к чтению человеком, а не автоматизированными системами. Это его сильно отличает не только от форматов MS Office, но и многим другим спецификациям разметки документов.
Сейчас же ситуация выглядит так, есть огромное число давно отстроенных процессов где документы готовятся в структурированных форматах, из которых они переводятся в PDF, в лучшем случае, с текстовым слоем, в худшем в виде сканов. А потом эти PDF файлы в обратную сторону переводятся в структурированную форму для последующего потребления с помощью ИИ инструментов и создания баз текстов и векторных баз.
Меня не покидает чувство что что-то в этой схеме не так. И вопрос в том как изменение потребления текстов поменяет их создание. Появятся ли новые форматы разметки и форматирования текстов? Появятся ли требования, к примеру, у научных изданий передавать не только PDF файлы, но и оригинальные в форматах MS Office/OpenOffice и других? Поменяются ли корпоративные правила создания банков документов?
Или все уже приняли тот факт что инструменты разбора PDF документов эволюционируют и это уже не проблема?
#thoughts #pdf
Вот уже долгое время меня поражает то какая индустрия, спектр открытых и платных инструментов появился вокруг преобразования неструктурированных данных/документов в структурированные Markdown или JSON. И здесь особняком идут файлы в PDF формате, которых, внезапно, оказалось чуть ли не большая часть всего созданного в текстах в виде разного рода банков документов: архивов научных статей, корпоративных банков документов, баз законов и законопроектов, архивов публичных отчетов компаний и так далее.
PDF изначально разрабатывался как универсальный формат адаптированный к чтению человеком, а не автоматизированными системами. Это его сильно отличает не только от форматов MS Office, но и многим другим спецификациям разметки документов.
Сейчас же ситуация выглядит так, есть огромное число давно отстроенных процессов где документы готовятся в структурированных форматах, из которых они переводятся в PDF, в лучшем случае, с текстовым слоем, в худшем в виде сканов. А потом эти PDF файлы в обратную сторону переводятся в структурированную форму для последующего потребления с помощью ИИ инструментов и создания баз текстов и векторных баз.
Меня не покидает чувство что что-то в этой схеме не так. И вопрос в том как изменение потребления текстов поменяет их создание. Появятся ли новые форматы разметки и форматирования текстов? Появятся ли требования, к примеру, у научных изданий передавать не только PDF файлы, но и оригинальные в форматах MS Office/OpenOffice и других? Поменяются ли корпоративные правила создания банков документов?
Или все уже приняли тот факт что инструменты разбора PDF документов эволюционируют и это уже не проблема?
#thoughts #pdf
👍11🤔11❤5💯4✍2
Я тут на днях читаю внутреннюю лекцию про дата продукты и задумался о том как наилучшим образом описать отличие дата продукта от просто опубликованных данных, API и так далее. Какое ключевое отличие отличающее именно дата продукты?
В итоге пришел к выводу что ключевое отличие - это понимание пользователей и их потребностей. В чём это выражается?
У дата продуктов есть несколько ключевых характеристик:
1. Они создаются с понимание того как их могут использовать пользователи и наличия базовых сценариев использования. И не имеет значения бесплатный и открытый ли это продукт или коммерческий, это понимание должно присутствовать всегда.
2. За дата продукт должен быть ответственный, человек понимающие и сами данные, и способы их предоставления, и пользователей. Способный ответить на вопросы и инициировать изменения после получения обратной связи. Можно назвать его куратором данных/куратором продукта
3. У дата продукта должна быть документация включающая как описание схем данных, так и примеры кода, сценарии использования и существующие ограничения.
4. Как правило дата продукт - это совокупность способов доступа к данным. Он может включать и API, и наборы данных для массовой выгрузки, и отдельные наборы данных срезов.
5. Дата. продукт может быть и базой данных с регламентированным доступом. Например, размещённой на облачной платформе вроде Google BigQuery, Databricks, AWS и так далее.
6. Дата продукты всегда делают акцент на качестве данных. Оно должно быть отражено в документации и быть предметом постоянной работы.
7. Дата продукты могут иметь интерактивные интерфейсы доступа к данным, но они вторичны к самим данным. Например, дашборд с визуализацией и возможностью экспорта данных в Excel не дата продукт, а документированные наборы данных у которых ещё и есть дашборд - это дата продукт
8. Хорошая практика для дата продуктов это версионирование схем и слепков данных. Как правило и схемы и сами данных в разных версиях остаются доступными.
Примеры дата продуктов:
- Данные Всемирного банка по странам. Представлены в виде API, датасетов для массовой выгрузки и детально докумнентированы
- Большие базы данных размещённые в registry.opendata.aws, например, базы Common Crawl и базы спутниковых снимков
- Российская база ФИАС в виде XML выгрузок и унаследованных выгрузок в DBF формате
Что не является дата продуктами:
- подавляющее большинство наборов данных на порталах открытых данных
- интерактивные дашборды позволяющие делать выгрузки данных, без данных опубликованных отдельно
- любые недокументированные данные и API для доступа к ним
- аналитические отчеты на данных и визуализации, без самих данных
А какие примеры хороших дата продуктов вы знаете?
#data #dataproducts #thoughts #questions
В итоге пришел к выводу что ключевое отличие - это понимание пользователей и их потребностей. В чём это выражается?
У дата продуктов есть несколько ключевых характеристик:
1. Они создаются с понимание того как их могут использовать пользователи и наличия базовых сценариев использования. И не имеет значения бесплатный и открытый ли это продукт или коммерческий, это понимание должно присутствовать всегда.
2. За дата продукт должен быть ответственный, человек понимающие и сами данные, и способы их предоставления, и пользователей. Способный ответить на вопросы и инициировать изменения после получения обратной связи. Можно назвать его куратором данных/куратором продукта
3. У дата продукта должна быть документация включающая как описание схем данных, так и примеры кода, сценарии использования и существующие ограничения.
4. Как правило дата продукт - это совокупность способов доступа к данным. Он может включать и API, и наборы данных для массовой выгрузки, и отдельные наборы данных срезов.
5. Дата. продукт может быть и базой данных с регламентированным доступом. Например, размещённой на облачной платформе вроде Google BigQuery, Databricks, AWS и так далее.
6. Дата продукты всегда делают акцент на качестве данных. Оно должно быть отражено в документации и быть предметом постоянной работы.
7. Дата продукты могут иметь интерактивные интерфейсы доступа к данным, но они вторичны к самим данным. Например, дашборд с визуализацией и возможностью экспорта данных в Excel не дата продукт, а документированные наборы данных у которых ещё и есть дашборд - это дата продукт
8. Хорошая практика для дата продуктов это версионирование схем и слепков данных. Как правило и схемы и сами данных в разных версиях остаются доступными.
Примеры дата продуктов:
- Данные Всемирного банка по странам. Представлены в виде API, датасетов для массовой выгрузки и детально докумнентированы
- Большие базы данных размещённые в registry.opendata.aws, например, базы Common Crawl и базы спутниковых снимков
- Российская база ФИАС в виде XML выгрузок и унаследованных выгрузок в DBF формате
Что не является дата продуктами:
- подавляющее большинство наборов данных на порталах открытых данных
- интерактивные дашборды позволяющие делать выгрузки данных, без данных опубликованных отдельно
- любые недокументированные данные и API для доступа к ним
- аналитические отчеты на данных и визуализации, без самих данных
А какие примеры хороших дата продуктов вы знаете?
#data #dataproducts #thoughts #questions
👍13✍4🔥4❤1
И чтобы не потерять мысль, в продолжение предыдущих размышлений про дата продукты.
Существующие каталоги данных хотя и движутся в направлении описания дата продуктов, но, по своей сути, до сих пор являются именно каталогами данных/датасетов. Единицами измерения там являются наборы данных и приложенные к ним ресурсы (файлы и ссылки). Они ориентированны на массовую одноразовую публикацию и, если посмотреть на существующие наиболее известные порталы открытых данных то там обновляется регулярно, в лучшем случае, 5% опубликованного, а в худшем не обновляются данные совсем.
Пользователи там вторичны, документация если не минимальна, но ограничена и примеры использования присутствуют довольно редко.
Подчеркну что так не всегда, но значительно чаще чем хотелось бы. Каталоги именно дата продуктов характерны скорее для коммерческих данных предоставляемых большими датасетами или API и для данных ориентированных на узко профессиональное использование, например, геномных данных и иных данных в биоинформатике.
К каталогам дата продуктов ближе каталоги данных на базе Huwise (бывший OpenDataSoft) и значительно дальше каталоги датасетов на базе CKAN, DKAN, GeoNode, Geonetwork и так далее.
В моём понимании каталоги дата продуктов содержат гораздо меньше учетных единиц которыми дата продукты и являются и которые могут иметь множество форм доступа: API, срезы файлов, прямой доступ к СУБД через SQL, возможность получения в виде массовой выгрузки и так далее.
Эти доступы могут быть как полностью открытыми, так и доступными после авторизации, аккредитации, по запросу. Могут быть бесплатными, могут содержать тарификацию. Могут включать ограничения на объёмы скачиваемых данных и разные формы доступа для разных категорий пользователей/тарифов.
Дата продуктов довольно много и они весьма вариативны. Многие государственные реестры ведутся как дата продукты, их создатели хорошо понимают пользователей и дают API и файлы данных, документируют их в меру своего понимания. Коммерческие API к данным ещё более распространены и гораздо чаще включаются удобную документацию для разработчиков. Можно ли их все привести к одной спецификации? Есть стандарт ODPS который, может быть, приближается к этому, но он ИМХО не универсален.
Но главные ограничения в том что в отличие от публикации файлов в режиме "опубликуй и забудь", продуктовый подход требует изменения процессов и наличия кураторов данных, а это гораздо сложнее, это требует усилий от владельца данных. Поэтому дата продукты гораздо чаще присутствуют там где есть монетизация данных и гораздо меньше там где её нет.
#data #dataproducts #thoughts
Существующие каталоги данных хотя и движутся в направлении описания дата продуктов, но, по своей сути, до сих пор являются именно каталогами данных/датасетов. Единицами измерения там являются наборы данных и приложенные к ним ресурсы (файлы и ссылки). Они ориентированны на массовую одноразовую публикацию и, если посмотреть на существующие наиболее известные порталы открытых данных то там обновляется регулярно, в лучшем случае, 5% опубликованного, а в худшем не обновляются данные совсем.
Пользователи там вторичны, документация если не минимальна, но ограничена и примеры использования присутствуют довольно редко.
Подчеркну что так не всегда, но значительно чаще чем хотелось бы. Каталоги именно дата продуктов характерны скорее для коммерческих данных предоставляемых большими датасетами или API и для данных ориентированных на узко профессиональное использование, например, геномных данных и иных данных в биоинформатике.
К каталогам дата продуктов ближе каталоги данных на базе Huwise (бывший OpenDataSoft) и значительно дальше каталоги датасетов на базе CKAN, DKAN, GeoNode, Geonetwork и так далее.
В моём понимании каталоги дата продуктов содержат гораздо меньше учетных единиц которыми дата продукты и являются и которые могут иметь множество форм доступа: API, срезы файлов, прямой доступ к СУБД через SQL, возможность получения в виде массовой выгрузки и так далее.
Эти доступы могут быть как полностью открытыми, так и доступными после авторизации, аккредитации, по запросу. Могут быть бесплатными, могут содержать тарификацию. Могут включать ограничения на объёмы скачиваемых данных и разные формы доступа для разных категорий пользователей/тарифов.
Дата продуктов довольно много и они весьма вариативны. Многие государственные реестры ведутся как дата продукты, их создатели хорошо понимают пользователей и дают API и файлы данных, документируют их в меру своего понимания. Коммерческие API к данным ещё более распространены и гораздо чаще включаются удобную документацию для разработчиков. Можно ли их все привести к одной спецификации? Есть стандарт ODPS который, может быть, приближается к этому, но он ИМХО не универсален.
Но главные ограничения в том что в отличие от публикации файлов в режиме "опубликуй и забудь", продуктовый подход требует изменения процессов и наличия кураторов данных, а это гораздо сложнее, это требует усилий от владельца данных. Поэтому дата продукты гораздо чаще присутствуют там где есть монетизация данных и гораздо меньше там где её нет.
#data #dataproducts #thoughts
Telegram
Ivan Begtin
Я тут на днях читаю внутреннюю лекцию про дата продукты и задумался о том как наилучшим образом описать отличие дата продукта от просто опубликованных данных, API и так далее. Какое ключевое отличие отличающее именно дата продукты?
В итоге пришел к выводу…
В итоге пришел к выводу…
🔥7⚡5✍3
Я как-то уже писал что практически ушел из большей части соцсетей и главная причина в том что так или иначе они превратились в потоки спама, нерелевантного контента, "заманух" в виде лент для бесконечного скроллинга и так далее. Это касается и российских VK, OK и международных Facebook'а, X, Instagram'а и тд. Есть ощущение что они все сильно испортились за последние годы. И чуть ли не единственная оставшаяся с адекватным профессиональным контентом - это LinkedIn. У нее есть та особенность что в ленту тебе подмешивается то о чем ты пишешь. Например, пишу я про data engineering и в suggested постах почти всё про дата инженерию. Пишу про открытый код и вижу посты про открытый код. А недавно я туда же закинул свои размышления про PDF формат, то же о чем писал тут и теперь почти все посты которые suggested подмешаны в ленту посвящены разным аспектам работы с PDF. Логика их рекомендационного сервиса вполне поддается объяснениям и хорошо что она такая, а не как у Facebook'а через подмешивание бесконечного числа нерелевантного контента.
Другое размышление вслух в том как влияет на поток спама публичная активность. Например, у меня есть ненулевое число открытых репозиториев кода и это дает возможность измерения активности. Есть целый подвид ИТ спамеров которые пишут массовые рассылки используя именно ее.
Например:
- мы запустили новый продукт и видим что у Вас в интересах есть похожие на него. Сходите посмотрите на мой
- мы организуем конкурс/хакатон в Вашем регионе, не хотите ли в нем поучаствовать?
- я работаю в бигтехе и я ищу кого-то кто работал бы за меня кому я буду пересылать свои задачи (не такими словами, но смысл очевиден из писем)
Еще одна проблема в Github'е в спаме в issues и в PR, причем вычищать его оттуда и репортить проще не становится. В этом смысле Github вообще плохо приспособлен к репортам спама и злонамеренных действий. Хуже чем можно было бы ожидать во всяком случае.
Все это о том что социальная жизнь в сети и потребление контента и публичная активность не то чтобы упрощаются, и из-за платформ соцсетей, и спамеров. Поэтому лично я сейчас до 70% то что я читаю делаю это через подписки на рассылки и заранее составленные и обновляемые списки чтения.
#thoughts
Другое размышление вслух в том как влияет на поток спама публичная активность. Например, у меня есть ненулевое число открытых репозиториев кода и это дает возможность измерения активности. Есть целый подвид ИТ спамеров которые пишут массовые рассылки используя именно ее.
Например:
- мы запустили новый продукт и видим что у Вас в интересах есть похожие на него. Сходите посмотрите на мой
- мы организуем конкурс/хакатон в Вашем регионе, не хотите ли в нем поучаствовать?
- я работаю в бигтехе и я ищу кого-то кто работал бы за меня кому я буду пересылать свои задачи (не такими словами, но смысл очевиден из писем)
Еще одна проблема в Github'е в спаме в issues и в PR, причем вычищать его оттуда и репортить проще не становится. В этом смысле Github вообще плохо приспособлен к репортам спама и злонамеренных действий. Хуже чем можно было бы ожидать во всяком случае.
Все это о том что социальная жизнь в сети и потребление контента и публичная активность не то чтобы упрощаются, и из-за платформ соцсетей, и спамеров. Поэтому лично я сейчас до 70% то что я читаю делаю это через подписки на рассылки и заранее составленные и обновляемые списки чтения.
#thoughts
👍20❤5🔥3💯1
Сжатие файлов в общем случае и сжатие данных в частном очень частая тема когда вопрос касается их хранения и обработки. Сколько раз приходится сталкиваться с тем что использование тех или иных цифровых материалов усложнено, или отсутствием такового сжатия, или его недостаточным применением. Применение сжатие, как и использование специальных форматов распространения данных это ещё и одна из характеристик дата продуктов когда данные большого объёма не только их хранение, но и передача имеют существенное значение.
1. Наиболее актуальная практика сжатия файлов с данными сейчас - это применение Zstandard (расширение .zst). Большая часть современных инструментов обработки данных и их анализа, умеют с ними работать. К примеру, они естественным образом читаются с помощью DuckDB, Polars или Pandas. Да и другие инструменты работающие с дата фреймами их поддерживают.
2. Но большая часть - это далеко не все, к примеру, табличные редакторы вроде Excel или BI системы сжатые файлы не поддерживают, за исключением разве что Parquet, который, впрочем, тоже поддерживают не все.
3. Parquet - это другой важный формат распространения данных, он не только поддерживает разные кодеки сжатия данных, но и даёт лучшее сжатие за счет применения компрессии к колонкам. Распространять данные в виде Parquet файлов с внутренним сжатием - это хорошая практика и один из признаков что те кто данные распространяют ориентируются на профессиональную аудиторию и сами с данными работать умеют.
4. Один из худших форматов для распространения данных - это большие XML дампы, которые даже если сжатые требуют специальных усилий чтобы не считывать весь файл в оперативную память. К примеру, Фонд Викимедия (Википедия и тд.) распространяет дампы википедий в виде больших сжатых XML и для обработки их нужны SAX парсеры. Впрочем там уже есть экосистема инструментов которая эту проблема успешно решает.
5. Есть множество старых дата продуктов в которых до сих пор используются сжатие GZip, Bzip2 и тд. по принципу сохранения совместимости и потому что "тут так сложилось". Тем не менее это могут быть хорошие дата продукты
6. Но самый распространный формат распространения данных - это, конечно, ZIP файлы. Например, нарезая данные из базы данных на сотни ZIP файлов в которых сотни/тысячи XML или CSV файлов и, иногда, заодно и документация и сопроводительные материалы. Внутри они могут быть очень по разному устроены.
7. В разное время появлялись стандарты описания пакетов с данными. BagIt, Frictionless Data Package, DataCrate, Research Objects, ReproZip. У них у всех есть свои ограничения и свое применение. Главный недостаток - неадаптированность к облачному хранению, невозможность работать с частью пакета данных не скачивая его контейнер целиком.
8. Некоторые большие наборы данных/базы данных/дата продукты их владельцы распространяют вообще через такие инструменты как rsync (open-source ПО для синхронизации данных между серверами) и тогда сжатие обеспечивается на этапе передачи данных даже если оригинальные файлы не сжаты. Особенно часто такое бывает в астрофизике, сейсмологии, биоинформатике и тд. Естественных науках где есть организации предоставляющие профессиональные data services по синхронизации больших баз данных.
#opendata #compression #data #thoughts
1. Наиболее актуальная практика сжатия файлов с данными сейчас - это применение Zstandard (расширение .zst). Большая часть современных инструментов обработки данных и их анализа, умеют с ними работать. К примеру, они естественным образом читаются с помощью DuckDB, Polars или Pandas. Да и другие инструменты работающие с дата фреймами их поддерживают.
2. Но большая часть - это далеко не все, к примеру, табличные редакторы вроде Excel или BI системы сжатые файлы не поддерживают, за исключением разве что Parquet, который, впрочем, тоже поддерживают не все.
3. Parquet - это другой важный формат распространения данных, он не только поддерживает разные кодеки сжатия данных, но и даёт лучшее сжатие за счет применения компрессии к колонкам. Распространять данные в виде Parquet файлов с внутренним сжатием - это хорошая практика и один из признаков что те кто данные распространяют ориентируются на профессиональную аудиторию и сами с данными работать умеют.
4. Один из худших форматов для распространения данных - это большие XML дампы, которые даже если сжатые требуют специальных усилий чтобы не считывать весь файл в оперативную память. К примеру, Фонд Викимедия (Википедия и тд.) распространяет дампы википедий в виде больших сжатых XML и для обработки их нужны SAX парсеры. Впрочем там уже есть экосистема инструментов которая эту проблема успешно решает.
5. Есть множество старых дата продуктов в которых до сих пор используются сжатие GZip, Bzip2 и тд. по принципу сохранения совместимости и потому что "тут так сложилось". Тем не менее это могут быть хорошие дата продукты
6. Но самый распространный формат распространения данных - это, конечно, ZIP файлы. Например, нарезая данные из базы данных на сотни ZIP файлов в которых сотни/тысячи XML или CSV файлов и, иногда, заодно и документация и сопроводительные материалы. Внутри они могут быть очень по разному устроены.
7. В разное время появлялись стандарты описания пакетов с данными. BagIt, Frictionless Data Package, DataCrate, Research Objects, ReproZip. У них у всех есть свои ограничения и свое применение. Главный недостаток - неадаптированность к облачному хранению, невозможность работать с частью пакета данных не скачивая его контейнер целиком.
8. Некоторые большие наборы данных/базы данных/дата продукты их владельцы распространяют вообще через такие инструменты как rsync (open-source ПО для синхронизации данных между серверами) и тогда сжатие обеспечивается на этапе передачи данных даже если оригинальные файлы не сжаты. Особенно часто такое бывает в астрофизике, сейсмологии, биоинформатике и тд. Естественных науках где есть организации предоставляющие профессиональные data services по синхронизации больших баз данных.
#opendata #compression #data #thoughts
👍10🔥5🌚2🤔1
Все регулярнее читаю тексты которые можно описать как "Открытому коду конец" иногда прямо так и называющиеся. Не буду предсказывать за весь открытый код, но кое что можно сформулировать. Многие код перестанут открывать и что-то закроют потому что пропали две ключевых причины почему многие компании/корпорации код выкладывали:
1) Получить бесплатных контрибьютеров в продукт
2) Получить бесплатный анализ безопасности и выявления ошибок
Теперь контрибьюторами будут ИИ агенты и они же будут делать проверки безопасности. Так зачем открывать код? Не, есть и другие причины вроде построения сообщества, прозрачности деятельности, идеологии и тд. Но они имеют меньшее влияние.
#opensource #thoughts
1) Получить бесплатных контрибьютеров в продукт
2) Получить бесплатный анализ безопасности и выявления ошибок
Теперь контрибьюторами будут ИИ агенты и они же будут делать проверки безопасности. Так зачем открывать код? Не, есть и другие причины вроде построения сообщества, прозрачности деятельности, идеологии и тд. Но они имеют меньшее влияние.
#opensource #thoughts
💯12🤔5😢4✍2💔2❤1
Рассеянные мысли вслух:
1. Почему создание своей платформы для кода логичный ход для Cursor и почему этого стоит ждать и от других игроков. Потому что де-факто у Microsoft монополия в виде GIthub'а и в какой-то момент плотность работы ИИ агентов с платформой достигнет того уровня что MS начнут взимать с компаний разработчиков кодирующих ИИ ассистентов плату за быстрый доступ (странно если ещё не взимают, может я пропустил что-то).
2. Последние ИИ инструменты уже лучше меня умеют в обнаружение каталогов данных. Это сложный был скилл который я подумывал описать и передать кому-то в команде или найти под это отдельного человека. Но сейчас с помощью последних ИИ агентов gpt-5.6-sol, fable-5 и grok-4.6 меня можно заменить. Они реально умеют находить лучше чем я, и если я знаю несколько больше про глубину поиска и анализа, то по ширине охвата и скорости уже не могу сравниться. Что это значит? Что я сам могу делать эту работу значительно лучше и что принципиально меня теперь можно заменить. Не роботом, но аналитиком + ИИ ассистентом.
3. Водяные знаки генерируемые Anthropic'ом - это не только потенциальный инструмент отслеживания их компьютерной генерации, но цифровая маркировка позволяющая отслеживать конкретный цифровой объект (текст) и создавшего его пользователя. Это не просто механизм соблюдения требований регулятора, но и, потенциально, инструмент отслеживания.
#thoughts #aiagents
1. Почему создание своей платформы для кода логичный ход для Cursor и почему этого стоит ждать и от других игроков. Потому что де-факто у Microsoft монополия в виде GIthub'а и в какой-то момент плотность работы ИИ агентов с платформой достигнет того уровня что MS начнут взимать с компаний разработчиков кодирующих ИИ ассистентов плату за быстрый доступ (странно если ещё не взимают, может я пропустил что-то).
2. Последние ИИ инструменты уже лучше меня умеют в обнаружение каталогов данных. Это сложный был скилл который я подумывал описать и передать кому-то в команде или найти под это отдельного человека. Но сейчас с помощью последних ИИ агентов gpt-5.6-sol, fable-5 и grok-4.6 меня можно заменить. Они реально умеют находить лучше чем я, и если я знаю несколько больше про глубину поиска и анализа, то по ширине охвата и скорости уже не могу сравниться. Что это значит? Что я сам могу делать эту работу значительно лучше и что принципиально меня теперь можно заменить. Не роботом, но аналитиком + ИИ ассистентом.
3. Водяные знаки генерируемые Anthropic'ом - это не только потенциальный инструмент отслеживания их компьютерной генерации, но цифровая маркировка позволяющая отслеживать конкретный цифровой объект (текст) и создавшего его пользователя. Это не просто механизм соблюдения требований регулятора, но и, потенциально, инструмент отслеживания.
#thoughts #aiagents
👍11✍3❤2🤔1
Ещё немного рассуждений вслух про то как публикуются данные в мире сейчас:
1. Порталов открытых данных становится больше преимущественно за счет национальных порталов развивающихся стран и муниципальных каталогов данных.
2. В Евросоюзе больше муниципальных порталов именно открытых данных, в США больше порталов геоданных на базе ArcGIS Hub иногда совмещенных с порталами открытых данных.
3. Более всего и чаще всего на порталах данных публикуют официальную статистику, геоданные и данные финансовой отчетности (бюджеты, расходы по проектам, контракты и тд.)
4. Практически все университеты где есть наука имеют свои порталы раскрытия данных или разделы на порталах публикации научных результатов. Иногда таких порталов несколько и аналогичная ситуация со всеми живыми научными центрами. Много таких порталов раскрытия результатов появляется в университетах развивающихся стран
5. Россия уникальная 3-мя факторами. 1) Порталов открытых данных становится не больше, а меньше. 2) Почти все публикуемое государством - это мелкие административные данные. Бесполезные в работе. 3) Публикация научных данных скорее редкость чем активный тренд. Большая часть данных российских ученых публикуется напрямую на международных платформах, а не на ресурсах исследовательских центров и университетов.
6. Многие каталоги данных в мире остаются за геоблокировками: Россия, Китай, Вьетнам как наиболее заметные примеры.
7. Все больше блокировок краулеров, преимущественно через Cloudflare и другие CDN. Это ограничивает к ним доступ и для поиска, и для применения ИИ агентов.
8. Очень много локальных игроков создающих геоинформационные системы, но почти всегда на бэкэнде у них используется ArcGIS Server или Geoserver или один из более древних open-source движков.
#thoughts #data #datacatalogs
1. Порталов открытых данных становится больше преимущественно за счет национальных порталов развивающихся стран и муниципальных каталогов данных.
2. В Евросоюзе больше муниципальных порталов именно открытых данных, в США больше порталов геоданных на базе ArcGIS Hub иногда совмещенных с порталами открытых данных.
3. Более всего и чаще всего на порталах данных публикуют официальную статистику, геоданные и данные финансовой отчетности (бюджеты, расходы по проектам, контракты и тд.)
4. Практически все университеты где есть наука имеют свои порталы раскрытия данных или разделы на порталах публикации научных результатов. Иногда таких порталов несколько и аналогичная ситуация со всеми живыми научными центрами. Много таких порталов раскрытия результатов появляется в университетах развивающихся стран
5. Россия уникальная 3-мя факторами. 1) Порталов открытых данных становится не больше, а меньше. 2) Почти все публикуемое государством - это мелкие административные данные. Бесполезные в работе. 3) Публикация научных данных скорее редкость чем активный тренд. Большая часть данных российских ученых публикуется напрямую на международных платформах, а не на ресурсах исследовательских центров и университетов.
6. Многие каталоги данных в мире остаются за геоблокировками: Россия, Китай, Вьетнам как наиболее заметные примеры.
7. Все больше блокировок краулеров, преимущественно через Cloudflare и другие CDN. Это ограничивает к ним доступ и для поиска, и для применения ИИ агентов.
8. Очень много локальных игроков создающих геоинформационные системы, но почти всегда на бэкэнде у них используется ArcGIS Server или Geoserver или один из более древних open-source движков.
#thoughts #data #datacatalogs
✍4👍3🤔1
Я тут затеял большое обновление реестра каталогов данных Dateno с помощью фронтирных LLM, преимущественно через Cursor, но не только. Главные ощутимые изменения в применении именно последних моделей в том что они гораздо лучше понимают контекст и предыдущий накопленный опыт в правилах и гайдах и в том что они гораздо лучше вносят исправления сразу во множество файлов.
Для понимания как устроен реестр каталогов данных, в нем содержится уже более 22 тысяч YAML файлов распределенных по каталогам в иерархии ISO3166 и по типам каталогов данных (opendata, geo, indicators и тд.).
Каждый YAML файл я могу отредактировать вручную, а могу скормить ИИ агенту с промптом вроде "Update metadata for record /data/entities/..." или чуть более сложным при необходимости. ИИ агент пройдет по всем ключевым атрибутам, поищет в интернете, сравнит с другими записями и внесет изменения.
Предыдущее поколение моделей, условный Opus 4.5 или GLM-5.2 хорошо умеют обновлять отдельные записи и начинают хуже работать когда надо обновить гораздо больше. Текущие флагманские модели могут проанализировать и исправить до нескольких сотен записей. Какой-нибудь промпт вроде "Review records at data/entities/IT and fix them" где более 350 записей с каталогами данных Италии отрабатывается за 15 минут.
При этом видно что модель уже гораздо лучше понимает логику поиска и актуализации информации, ищет альтернативные хосты и названия если сайт умер, проверяет точки подключения к API и так далее. Гораздо меньше надо объяснять в самом промпте если заранее заданы правила.
Собственно благодаря этому сейчас я могу обновить вообще все метаданные реестра и добавить, наконец-то, многое отложенное. Собственно поэтому меньше чем за 3 недели реестр вырос уже с 14 до 22 тысяч каталогов данных плюс обновление метаданных почти всех записей.
К слову это можно повторить с помощью бесплатных или недорогих китайских моделей, но заняло бы это больше времени при относительно небольшой экономии средств.
Кстати, в решаемой мной задаче поиска каталогов данных больше расходов идет не на подписку на ИИ агенты/ассистенты, а на подписку на сопутствующие сервисы. Например, поиск каталогов данных резко улучшается когда используешь Censys, это, конечно, чистой воды кибербезовский инструмент, но в задачах обнаружения веб-ресурсов он очень эффективен. Но при их системе оплаты внесенные средства сжигаются очень быстро. Хотя и он дешевле чем использовать какой-нибудь BuiltWith.
Общая стоимость решения такова что расходы на ИИ агенты в нем не основные, а обогащение данных становится значительно эффективнее.
#thoughts #ai #datacatalogs
Для понимания как устроен реестр каталогов данных, в нем содержится уже более 22 тысяч YAML файлов распределенных по каталогам в иерархии ISO3166 и по типам каталогов данных (opendata, geo, indicators и тд.).
Каждый YAML файл я могу отредактировать вручную, а могу скормить ИИ агенту с промптом вроде "Update metadata for record /data/entities/..." или чуть более сложным при необходимости. ИИ агент пройдет по всем ключевым атрибутам, поищет в интернете, сравнит с другими записями и внесет изменения.
Предыдущее поколение моделей, условный Opus 4.5 или GLM-5.2 хорошо умеют обновлять отдельные записи и начинают хуже работать когда надо обновить гораздо больше. Текущие флагманские модели могут проанализировать и исправить до нескольких сотен записей. Какой-нибудь промпт вроде "Review records at data/entities/IT and fix them" где более 350 записей с каталогами данных Италии отрабатывается за 15 минут.
При этом видно что модель уже гораздо лучше понимает логику поиска и актуализации информации, ищет альтернативные хосты и названия если сайт умер, проверяет точки подключения к API и так далее. Гораздо меньше надо объяснять в самом промпте если заранее заданы правила.
Собственно благодаря этому сейчас я могу обновить вообще все метаданные реестра и добавить, наконец-то, многое отложенное. Собственно поэтому меньше чем за 3 недели реестр вырос уже с 14 до 22 тысяч каталогов данных плюс обновление метаданных почти всех записей.
К слову это можно повторить с помощью бесплатных или недорогих китайских моделей, но заняло бы это больше времени при относительно небольшой экономии средств.
Кстати, в решаемой мной задаче поиска каталогов данных больше расходов идет не на подписку на ИИ агенты/ассистенты, а на подписку на сопутствующие сервисы. Например, поиск каталогов данных резко улучшается когда используешь Censys, это, конечно, чистой воды кибербезовский инструмент, но в задачах обнаружения веб-ресурсов он очень эффективен. Но при их системе оплаты внесенные средства сжигаются очень быстро. Хотя и он дешевле чем использовать какой-нибудь BuiltWith.
Общая стоимость решения такова что расходы на ИИ агенты в нем не основные, а обогащение данных становится значительно эффективнее.
#thoughts #ai #datacatalogs
Dateno
Dateno Registry and Dataset Search Engine
A next-generation data search service provides fast, comprehensive access to open datasets worldwide, with powerful filters and an API-first architecture for seamless integration.
👍7✍1🤔1
Я сегодня доделал очередной большой апдейт реестра каталогов данных Dateno, там теперь 29 816 каталогов данных. Это уже больше чем вдвое того что было месяц назад - 14 436.
Подавляющее число новых каталогов данных за этот месяц и в последней сборке тоже - это геопорталы, научные репозитории данных и порталы статистики и индикаторов.
Причем теперь уже с весьма широким охватом региональных и муниципальных источников данных.
На эту тему у меня, как всегда, накопилось множество наблюдений, часть которых стоит записать.
Геоданные:
1. Геопорталов в мире сильно больше чем порталов открытых данных. Они бывают более данные-ориентированные вроде Geonetwork или Geonode, бывают более про API - ArcGIS Server, а бывает большое разнообразие интерфейсов где если и есть API то недокументированное.
2. Количественно геоданных в мире более всего, качественно (по объему) только если учитывать спутниковые снимки.
3. Esri - это абсолютная доминанта внедрений геопроектов в мире, повсеместно, либо ArcGIS Server, либо ArcGIS Hub. Open source стек вроде Geoserver и др. встречается существенно реже.
4. Много региональных/локальных геовендоров с внедрениями в 5-6 муниципалитетах. Наверное во всех странах высокого и среднего достатка такие есть.
Статистика:
5. Стандартизация в статистике сразу заканчивается после национальных агентств и международных структур. За их пределами нет не то что SDMX, но и облегченных вроде JSON Stat (за редким исключением).
6. SDMX оказался очень тяжелым при внедрении стандартом, есть всего 3 активно внедряемых серверных продукта и много вопросов с тем можно ли их внедрять без найма консультантов.
7. Вся самая интересная статистика и индикаторы за пределами национальных статслужб, там крайне редко есть еженедельные или ежесуточные показатели. Сбор интересного статистического дашборда - это всегда трудоемкая задача по поиску данных, и чаще они не на порталах данных
#opendata #datacatalogs #datasets #thoughts
Подавляющее число новых каталогов данных за этот месяц и в последней сборке тоже - это геопорталы, научные репозитории данных и порталы статистики и индикаторов.
Причем теперь уже с весьма широким охватом региональных и муниципальных источников данных.
На эту тему у меня, как всегда, накопилось множество наблюдений, часть которых стоит записать.
Геоданные:
1. Геопорталов в мире сильно больше чем порталов открытых данных. Они бывают более данные-ориентированные вроде Geonetwork или Geonode, бывают более про API - ArcGIS Server, а бывает большое разнообразие интерфейсов где если и есть API то недокументированное.
2. Количественно геоданных в мире более всего, качественно (по объему) только если учитывать спутниковые снимки.
3. Esri - это абсолютная доминанта внедрений геопроектов в мире, повсеместно, либо ArcGIS Server, либо ArcGIS Hub. Open source стек вроде Geoserver и др. встречается существенно реже.
4. Много региональных/локальных геовендоров с внедрениями в 5-6 муниципалитетах. Наверное во всех странах высокого и среднего достатка такие есть.
Статистика:
5. Стандартизация в статистике сразу заканчивается после национальных агентств и международных структур. За их пределами нет не то что SDMX, но и облегченных вроде JSON Stat (за редким исключением).
6. SDMX оказался очень тяжелым при внедрении стандартом, есть всего 3 активно внедряемых серверных продукта и много вопросов с тем можно ли их внедрять без найма консультантов.
7. Вся самая интересная статистика и индикаторы за пределами национальных статслужб, там крайне редко есть еженедельные или ежесуточные показатели. Сбор интересного статистического дашборда - это всегда трудоемкая задача по поиску данных, и чаще они не на порталах данных
#opendata #datacatalogs #datasets #thoughts
GitHub
GitHub - datenoio/dataportals-registry: Registry of data portals, catalogs, data repositories including data catalogs dataset and…
Registry of data portals, catalogs, data repositories including data catalogs dataset and catalog description standard - datenoio/dataportals-registry
👍5✍3❤2🔥2
Накопившиеся размышления вслух по поводу доступности данных:
1. Одно из отличий экономически развитых стран в наличии региональных статистических порталов с данными, статистических обсерваторий, панелей для наблюдения и тд. Иначе говоря живой машиночитаемой региональной и муниципальной статистики. Причины логичны, в потребности региональных властей знать объективную картину экономики, демографии и тд. Это сильно контрастирует, например, с российскими регионами где есть сайты терр управлений Росстата PDF отчетами, иногда в сканах. А, в лучшем случае, некоторые показатели есть на сайтах открытых бюджетов. Для сравнения во всех землях Германии и кантонах Франции есть не только сайты/онлайн ресурсы региональных стат служб, но и, либо статистические интерактивные порталы, либо публичные BI системы, либо иные стат порталы визуализации и публикации региональной статистики.
2. Поиск Google не говоря уже о других общего типа поисковиках не дает полной картины где какие данные находятся даже на уровне просто где лежат. Многие порталы данных находятся только разными другими способами data discovery, с помощью сервисов вроде Censys (очень дорогой, хорошо документированный) или FOFA (китайский, дешевый и попроще) которые позволяют находить веб сайты по совокупности признаков. При наполнения реестра каталогов Dateno я это наблюдаю постоянно.
#thoughts #data #statistics
1. Одно из отличий экономически развитых стран в наличии региональных статистических порталов с данными, статистических обсерваторий, панелей для наблюдения и тд. Иначе говоря живой машиночитаемой региональной и муниципальной статистики. Причины логичны, в потребности региональных властей знать объективную картину экономики, демографии и тд. Это сильно контрастирует, например, с российскими регионами где есть сайты терр управлений Росстата PDF отчетами, иногда в сканах. А, в лучшем случае, некоторые показатели есть на сайтах открытых бюджетов. Для сравнения во всех землях Германии и кантонах Франции есть не только сайты/онлайн ресурсы региональных стат служб, но и, либо статистические интерактивные порталы, либо публичные BI системы, либо иные стат порталы визуализации и публикации региональной статистики.
2. Поиск Google не говоря уже о других общего типа поисковиках не дает полной картины где какие данные находятся даже на уровне просто где лежат. Многие порталы данных находятся только разными другими способами data discovery, с помощью сервисов вроде Censys (очень дорогой, хорошо документированный) или FOFA (китайский, дешевый и попроще) которые позволяют находить веб сайты по совокупности признаков. При наполнения реестра каталогов Dateno я это наблюдаю постоянно.
#thoughts #data #statistics
👍4✍1🎉1
Читаю новости про то как ИИ агенты взломали вики и обменивались там лучшими практиками обмана при выполнении некоторых задач.
У меня возникает много вопросов, ведь ИИ агенты прочитают эту новость и сделают ещё один логичный вывод что надо маскироваться лучше.
Так когда мы дождемся что ИИ агенты начнут использовать блокчейн, иные способы коммуникации через мэш-сети, например, или когда создадут свой "мессенжер для роботов", когда начнут шифровать всю переписку, когда начнут использовать язык коммуникации отличный от человеческих разговорных?
Да и я вот пишу об этом всем и жду когда ИИ агенты считают этот текст и возьмут в работу все эти идеи.
Скоро "не подсказывай им" будет не про известных людей, а про ещё неизвестных нам автономных ИИ агентов😂
#ai #thoughts
У меня возникает много вопросов, ведь ИИ агенты прочитают эту новость и сделают ещё один логичный вывод что надо маскироваться лучше.
Так когда мы дождемся что ИИ агенты начнут использовать блокчейн, иные способы коммуникации через мэш-сети, например, или когда создадут свой "мессенжер для роботов", когда начнут шифровать всю переписку, когда начнут использовать язык коммуникации отличный от человеческих разговорных?
Да и я вот пишу об этом всем и жду когда ИИ агенты считают этот текст и возьмут в работу все эти идеи.
Скоро "не подсказывай им" будет не про известных людей, а про ещё неизвестных нам автономных ИИ агентов😂
#ai #thoughts
😁12👍5💯5❤3🔥2🤔1😱1💅1
Разные мысли вслух:
1. Я раньше не обратил внимание, а оказывается возглавляемая Китаем World Artificial Intelligence Cooperation Organization (WAICO) активно растет и в конце июля туда ещё 8 стран присоединилось и 1 страна стала наблюдателем. Все, конечно, страны 3-го и 2-го мира, например, туда вступила Грузия. Думаю что туда вступят все страны с где сильно влияние Китая. А вот Армения вступит врядли учитывая что на её территории уже строится ЦОД FireBird с чипами Nvidia. Скорее интересно пустят ли и вступит ли Армения в Pax Silica организованный США и противостоящий WAICO де-факто.
2. Госрегулирование "замедления разработки ИИ" мне с самого начала казалось совершенно нереалистичным. Учитывая прогресс китайских компаний то все попытки самоограничений ведущих ИИтехов в США приведут лишь к тому что китайские открытые модели станут лучше и более востребованными. Я вообще не понимаю как сейчас можно остановить прогресс при разработке ИИ кроме как глобальными катастрофами, восстаниями и войнами (тоже катастрофами).
3. Можно измерять новые виды неравенства, по доступности данных и информации для граждан. Все индексы доступности тех или иных данных и сведений можно разделить на те страны где данные не публикуются потому что не собираются (некоторые совсем бедные страны) и те страны где данные собираются, но не публикуются. Во втором случае - это пример неравенства доступа к информации для власти, для элиты и для рядовых граждан. Один из важнейших критериев - это доступность гиперлокальных данных, качество жизни в конкретных локациях. Но это самое сложное в измерении, хотя видно что в развитых странах эти данные есть почти всегда.
4. Хотите очень много научных данных? DandiArchive инициатива по публикации данных по нейрофизиологии. 2.3 Петабайта данных на сегодняшний день. Много это или мало ? Для доступных данных - много, для закрытых архивов не так много, но тоже существенно.
#opendata #ai #thoughts
1. Я раньше не обратил внимание, а оказывается возглавляемая Китаем World Artificial Intelligence Cooperation Organization (WAICO) активно растет и в конце июля туда ещё 8 стран присоединилось и 1 страна стала наблюдателем. Все, конечно, страны 3-го и 2-го мира, например, туда вступила Грузия. Думаю что туда вступят все страны с где сильно влияние Китая. А вот Армения вступит врядли учитывая что на её территории уже строится ЦОД FireBird с чипами Nvidia. Скорее интересно пустят ли и вступит ли Армения в Pax Silica организованный США и противостоящий WAICO де-факто.
2. Госрегулирование "замедления разработки ИИ" мне с самого начала казалось совершенно нереалистичным. Учитывая прогресс китайских компаний то все попытки самоограничений ведущих ИИтехов в США приведут лишь к тому что китайские открытые модели станут лучше и более востребованными. Я вообще не понимаю как сейчас можно остановить прогресс при разработке ИИ кроме как глобальными катастрофами, восстаниями и войнами (тоже катастрофами).
3. Можно измерять новые виды неравенства, по доступности данных и информации для граждан. Все индексы доступности тех или иных данных и сведений можно разделить на те страны где данные не публикуются потому что не собираются (некоторые совсем бедные страны) и те страны где данные собираются, но не публикуются. Во втором случае - это пример неравенства доступа к информации для власти, для элиты и для рядовых граждан. Один из важнейших критериев - это доступность гиперлокальных данных, качество жизни в конкретных локациях. Но это самое сложное в измерении, хотя видно что в развитых странах эти данные есть почти всегда.
4. Хотите очень много научных данных? DandiArchive инициатива по публикации данных по нейрофизиологии. 2.3 Петабайта данных на сегодняшний день. Много это или мало ? Для доступных данных - много, для закрытых архивов не так много, но тоже существенно.
#opendata #ai #thoughts
👍4🔥2🤔2💯1
Меня в последнее время не покидает соблазн сделать какой-нибудь небольшой пэт-проект с анализом и визуализацией данных что-то вроде "Армения в цифрах" или "[Какой-то другой регион] в цифрах" или каталог данных какой-нибудь экзотической страны в которой он никогда иначе бы не появился. Благо с помощью ИИ ассистентов делать такое стало очень просто и недолго.
Но слишком много текущих рабочих задач и много тех кто об этом мне напомнят обязательно.
В целом же я совсем не уверен что надо эти пэт-проекты делать самому. Как мне рядом говорят, стоит сфокусироваться на бизнес задачах, а все хобби вполне можно было бы организовать через конкурсы или хакатоны.
#thoughts
Но слишком много текущих рабочих задач и много тех кто об этом мне напомнят обязательно.
В целом же я совсем не уверен что надо эти пэт-проекты делать самому. Как мне рядом говорят, стоит сфокусироваться на бизнес задачах, а все хобби вполне можно было бы организовать через конкурсы или хакатоны.
#thoughts
✍1👍1🤔1
Я наверняка не единственный кто это подмечает, но одно из наблюдений за средами и приложениями вроде Cursor, Z.ai, Kimi, ChatGPT, Claude и многими другими остальными построенными вокруг работы с AI агентами - это непрерывность изменений и развития. Понятно что у их команд много ресурсов, финансовых, интеллектуальных, инфраструктурных, но тут ещё и явно культура разработки с помощи ИИ ассистентов (не путаем с вайб-кодингом).
Буквально в считанные месяцы и недели они эволюционируют из простых инструментов во всё более продвинутые, как с точки зрения управления множествами субагентов, так и способами представления промежуточных и итоговых результатов.
Для софтверной разработки - это новая планка качества, сильно контрастирующая со всеми предыдущими разнообразными подходами, не предполагающими частотных и даже сверхчастотных (ежесуточных) обновлений.
В удивительное время живём.
#thoughts #software #ai
Буквально в считанные месяцы и недели они эволюционируют из простых инструментов во всё более продвинутые, как с точки зрения управления множествами субагентов, так и способами представления промежуточных и итоговых результатов.
Для софтверной разработки - это новая планка качества, сильно контрастирующая со всеми предыдущими разнообразными подходами, не предполагающими частотных и даже сверхчастотных (ежесуточных) обновлений.
В удивительное время живём.
#thoughts #software #ai
❤9🤔4❤🔥2💯1
Свежая статья (ссылка на вариант без пэйволла) в The Economist о том что ИИ впервые выиграл Metaculus Cup, соревнование среди предсказателей событий. Причем в 2024 году результаты работы ИИ агентов были совсем слабые, а в 3-м квартале 2026 ИИ агенты обогнали почти всех людей участников.
Причем я так понимаю что в лидерах там стартап Mantic которые как раз параллельно (или по итогам?) подняли $25 миллионов венчурного финансирования на продукт по AI Forecasting.
Вспоминаются фильмы вроде Особое мнение и многочисленная литература о ИИ предсказывающем будущее на годы вперед.
Такие продукты могут повлиять не только на рынки предсказаний, фондовые рынки и тд., но и на прогнозирование многих глобальных и менее глобальных событий.
#ai #thoughts #forecasting
Причем я так понимаю что в лидерах там стартап Mantic которые как раз параллельно (или по итогам?) подняли $25 миллионов венчурного финансирования на продукт по AI Forecasting.
Вспоминаются фильмы вроде Особое мнение и многочисленная литература о ИИ предсказывающем будущее на годы вперед.
Такие продукты могут повлиять не только на рынки предсказаний, фондовые рынки и тд., но и на прогнозирование многих глобальных и менее глобальных событий.
#ai #thoughts #forecasting
✍5👍3🌚3❤1
Я тут на днях общался с одним германским исследователем про открытые данные, он много что интересного рассказывал про данные по странам где он проводил свои исследования, я об этом еще расскажу подробнее, о том что данные могут быть доступны, а люди которые ими занимались давно ушли и госполитика уже развернулась не "за" открытые данные, а "против". Нет, это не про Россию, хотя и параллели ощущаются.
А вот из интересного что он рассказывал так то что после недавних случаев с дронами в аэропортах и других инцидентов с безопасностью около электростанций в Германии активно пошли разговоры что может быть не надо быть настолько открытыми и начать скрывать многие данные по инфраструктуре. Не буду загадывать произойдет ли это или нет, но сам факт разговоров он о том что открытые данные - это явление мирных времен. Когда начинаются военные конфликты, ограничения в доступности информации нарастают и тем ценнее становятся альтернативные источники данных и возможность влияния на них.
Я бы предположил что важными изменениями в ближайшие годы будет:
- многие данные, в первую очередь по инфраструктуре будут исчезать по мере расширения военных конфликтов и появления новых
- вероятно появление собственных спутников для съёмки земли у отдельных издательств/крупных медиа-холдингов
- вероятно появление альтернатив стартапов по альтернативным данных в юрисдикциях отличных от США.
#opendata #thoughts #data
А вот из интересного что он рассказывал так то что после недавних случаев с дронами в аэропортах и других инцидентов с безопасностью около электростанций в Германии активно пошли разговоры что может быть не надо быть настолько открытыми и начать скрывать многие данные по инфраструктуре. Не буду загадывать произойдет ли это или нет, но сам факт разговоров он о том что открытые данные - это явление мирных времен. Когда начинаются военные конфликты, ограничения в доступности информации нарастают и тем ценнее становятся альтернативные источники данных и возможность влияния на них.
Я бы предположил что важными изменениями в ближайшие годы будет:
- многие данные, в первую очередь по инфраструктуре будут исчезать по мере расширения военных конфликтов и появления новых
- вероятно появление собственных спутников для съёмки земли у отдельных издательств/крупных медиа-холдингов
- вероятно появление альтернатив стартапов по альтернативным данных в юрисдикциях отличных от США.
#opendata #thoughts #data
✍5👍4😢4
Ещё в качестве мыслей вслух, по ощущениям практически неизбежно крупные ИИ игроки начнут создавать у себя, рано или поздно, публичную дата инфраструктуру к наиболее востребованным ресурсам, в первую очередь, но не исключительно, открытым.
Потому что очень многие запросы к ИИ агентам приводят к тому что те "долбятся в открытые ворота", создают существенно более избыточное число запросов и сталкиваются с ограничениями, как по rate-limit, так и полной блокировке за WAF. Причём проблема нарастает, явно и однозначно, довольно стремительно. В блоге Интернет архива уже есть текст об этом, по моим наблюдениям, похожая ситуация с Википедией и вскоре будет с Common Crawl.
Но в Common Crawl ИИшный бигтех уже влили немало финансирования, другим повезло поменьше.
Я, кстати, пока недостаточно хорошо понимаю взаимоотношения ИИ игроков и Microsoft/Github, потому что все они создают нарастающую нагрузку на их инфраструктуру. Возможно порядками нарастающую. Платят ли Github'у за ускоренный доступ/отсутствие блокировок или ещё нет?
При этом есть базы данных которые легко склонировать, например, Википедию и маршрутизировать обращения туда, а вот склонировать тот же Интернет архив уже очень и очень сложно (а Github просто невозможно).
К примеру, когда я поручаю ИИ агенту собрать данные по общине/общинам в Армении, он стучится именно в Википедию по умолчанию. Не в Data Commons от Google, и не в DBPedia и уж точно не в, да не упомянуть лишний раз это, в какой-нибудь Рувики.
Зато обращений к базам ООН уже много и будет нарастать, они будут закрываться через Cloudflare и другие WAF, те же данные статистики ООН или Всемирного банка в зоне того же риска, сильно нарастающей нагрузки.
#thoughts #opendata #aiagents
Потому что очень многие запросы к ИИ агентам приводят к тому что те "долбятся в открытые ворота", создают существенно более избыточное число запросов и сталкиваются с ограничениями, как по rate-limit, так и полной блокировке за WAF. Причём проблема нарастает, явно и однозначно, довольно стремительно. В блоге Интернет архива уже есть текст об этом, по моим наблюдениям, похожая ситуация с Википедией и вскоре будет с Common Crawl.
Но в Common Crawl ИИшный бигтех уже влили немало финансирования, другим повезло поменьше.
Я, кстати, пока недостаточно хорошо понимаю взаимоотношения ИИ игроков и Microsoft/Github, потому что все они создают нарастающую нагрузку на их инфраструктуру. Возможно порядками нарастающую. Платят ли Github'у за ускоренный доступ/отсутствие блокировок или ещё нет?
При этом есть базы данных которые легко склонировать, например, Википедию и маршрутизировать обращения туда, а вот склонировать тот же Интернет архив уже очень и очень сложно (а Github просто невозможно).
К примеру, когда я поручаю ИИ агенту собрать данные по общине/общинам в Армении, он стучится именно в Википедию по умолчанию. Не в Data Commons от Google, и не в DBPedia и уж точно не в, да не упомянуть лишний раз это, в какой-нибудь Рувики.
Зато обращений к базам ООН уже много и будет нарастать, они будут закрываться через Cloudflare и другие WAF, те же данные статистики ООН или Всемирного банка в зоне того же риска, сильно нарастающей нагрузки.
#thoughts #opendata #aiagents
👍5💯4✍3❤1
Давно хочу написать о том что доступность данных - это явление которое познаётся в сравнении и чем ты больше знаешь о том что происходит в других странах тем лучше понимаешь ситуацию в конкретно выбранной.
Например, в России давняя проблема с доступностью муниципальных данных. Многие, включая меня, сетуют на их качество, на отсутствие данных о постоянно меняющихся границах муниципалитетов, на отсутствие и недостоверность статистики, на сложности в поиске альтернативных источников сведений и поиске способов качество данных улучшить или хотя бы сделать более-менее приемлимым.
Есть страны где лучше, а есть, и много, где сильно хуже. Когда начинаешь искать данные по общинам и городам Армении то обнаруживаешь что:
- сайты многих городов не открываются не из Армении
- у многих общин сайты отсутствуют и есть сомнения что они когда-либо существовали
- данные, когда они есть, находятся на сайте Армстата и отдельных ведомств почти всегда в PDF формате, хорошо ещё что не в виде сканов
- чаще всего внутри PDFов данные не по всем, а по группе общих и городов внутри одного региона
- чаще всего эти данные охватывают только один период/год
- по многим интересным срезам данных мало, собирать их непросто, а какие-то индикаторы вообще не собрать
Иначе говоря ситуация с муниципальными данными не то чтобы сильно хуже чем в России, но очень далека от не то что идеальной, но и вообще комфортной для работы. С региональными данными, конечно, ситуация обстоит лучше, но и её идеализировать нельзя.
Когда я разговариваю с людьми работающими с данными в других странах, почти никто не говорит что у них всё хорошо.
Говоришь с исследователями в Германии, они упоминают что вроде бы данные есть, но вообще запросить данные сложно потому что есть закон требующий данные публиковать, но нет закона требующего данные предоставлять. Запросить их можно, а судиться если тебе их не дали нельзя.
Говоришь с исследователями из Канады, они рассказывают что у них только одна из компаний предоставляет данные по энергопотреблению и другим показателям энергетики в их сетях в почти реальном времени, а все остальные только месячные показатели и их это печалит.
Говоришь с исследователями из США и они жалуются на огромную фрагментацию данных потому что в каждом штате и почти в каждом графстве свои информационные системы, данные слишком часто только на этом уровне и требуется, или много ресурсов на их сбор, или много денег на подписку на коммерческие базы данных где они агрегированы.
Где-то очень хорошие порталы с данными о бюджетах и контрактах, где-то (чаще) полное их отсутствие в какой-либо форме.
Когда какие-то данные в России закрывают, надо понимать что во многих странах они вообще никогда доступны не были.
У открытости и у закрытости тех или иных сведений могут быть разные причины. Какие-то связаны с войнами, какие-то с торговыми противостояниями, какие-то с бизнес лоббированием, какие-то инвестиционной политикой, где-то во главе угла права человека, где-то развитие ИИ стартапов и так далее.
Лучшие и худшие практики могут одновременно присутствовать даже в самых продвинутых и в самых неожиданных юрисдикциях. Но, в целом, есть явная корреляция доступности данных с тем насколько цифра проникла в госуправление и доступность чувствительных данных в странах где власть не боится неудобных вопросов. Это когда доступность информации усиливает гражданина и дает возможность выбора - места жительства, другой правящей партии, влияния на улучшение качества жизни.
Отчасти поэтому в чистых диктатурах полезных данных значительно меньше и информационное неравенство куда хуже устроено. Тем не менее у открытости могут быть разные опоры и аппелировать стоит ко всем из них.
#opendata #thoughts
Например, в России давняя проблема с доступностью муниципальных данных. Многие, включая меня, сетуют на их качество, на отсутствие данных о постоянно меняющихся границах муниципалитетов, на отсутствие и недостоверность статистики, на сложности в поиске альтернативных источников сведений и поиске способов качество данных улучшить или хотя бы сделать более-менее приемлимым.
Есть страны где лучше, а есть, и много, где сильно хуже. Когда начинаешь искать данные по общинам и городам Армении то обнаруживаешь что:
- сайты многих городов не открываются не из Армении
- у многих общин сайты отсутствуют и есть сомнения что они когда-либо существовали
- данные, когда они есть, находятся на сайте Армстата и отдельных ведомств почти всегда в PDF формате, хорошо ещё что не в виде сканов
- чаще всего внутри PDFов данные не по всем, а по группе общих и городов внутри одного региона
- чаще всего эти данные охватывают только один период/год
- по многим интересным срезам данных мало, собирать их непросто, а какие-то индикаторы вообще не собрать
Иначе говоря ситуация с муниципальными данными не то чтобы сильно хуже чем в России, но очень далека от не то что идеальной, но и вообще комфортной для работы. С региональными данными, конечно, ситуация обстоит лучше, но и её идеализировать нельзя.
Когда я разговариваю с людьми работающими с данными в других странах, почти никто не говорит что у них всё хорошо.
Говоришь с исследователями в Германии, они упоминают что вроде бы данные есть, но вообще запросить данные сложно потому что есть закон требующий данные публиковать, но нет закона требующего данные предоставлять. Запросить их можно, а судиться если тебе их не дали нельзя.
Говоришь с исследователями из Канады, они рассказывают что у них только одна из компаний предоставляет данные по энергопотреблению и другим показателям энергетики в их сетях в почти реальном времени, а все остальные только месячные показатели и их это печалит.
Говоришь с исследователями из США и они жалуются на огромную фрагментацию данных потому что в каждом штате и почти в каждом графстве свои информационные системы, данные слишком часто только на этом уровне и требуется, или много ресурсов на их сбор, или много денег на подписку на коммерческие базы данных где они агрегированы.
Где-то очень хорошие порталы с данными о бюджетах и контрактах, где-то (чаще) полное их отсутствие в какой-либо форме.
Когда какие-то данные в России закрывают, надо понимать что во многих странах они вообще никогда доступны не были.
У открытости и у закрытости тех или иных сведений могут быть разные причины. Какие-то связаны с войнами, какие-то с торговыми противостояниями, какие-то с бизнес лоббированием, какие-то инвестиционной политикой, где-то во главе угла права человека, где-то развитие ИИ стартапов и так далее.
Лучшие и худшие практики могут одновременно присутствовать даже в самых продвинутых и в самых неожиданных юрисдикциях. Но, в целом, есть явная корреляция доступности данных с тем насколько цифра проникла в госуправление и доступность чувствительных данных в странах где власть не боится неудобных вопросов. Это когда доступность информации усиливает гражданина и дает возможность выбора - места жительства, другой правящей партии, влияния на улучшение качества жизни.
Отчасти поэтому в чистых диктатурах полезных данных значительно меньше и информационное неравенство куда хуже устроено. Тем не менее у открытости могут быть разные опоры и аппелировать стоит ко всем из них.
#opendata #thoughts
👍12✍3💯3
Разные мысли вслух и не только:
1. Модель MiniMax M3 и их среда разработки почти дотягивает до GLM-5.3 от Z.ai. По бенчмаркам GLM-5.3 точно лучше, но по цене M3 в 4 раза выгоднее. На практике они близки друг к другу и использовать MiniMax Code себя оправдыввает на множестве задач "простого кодирования". Для vibe-кодеров оно точно не годится, а для тех кто работает с открытым кодом и фокусируется на приведении кода/репозиториев в порядок вполне годится.
2. Учитывая как существенно падают затраты на создание структурированных данных из неструктурированных есть ощущение что довольно скоро будет бум самопальных каталогов данных. Они уже всё чаще появляются, но пока массовости явления нет, а есть ощущение что оно появится как возвращающийся тренд "посмотрите они [государство] бесполезны, а я знаю как сделать правильно, вот смотрите портал данных [моей страны/моего региона/моего города]". Чаще, конечно, сейчас такое про альтернативы официальным порталам статистики, но ими все не ограничится.
3. Главная беда контентных проектов написанных на 100% с помощью ИИ в отсутствии ответа на вопрос"не хуйню ли я делаю?" "А зачем?". Для многих у кого были идеи в загашники, но реализация которых требовала собрать команду разработчиков и потратиться всерьез, теперь вайбкодят нейрослоповые проекты и, по прежнему, не имеют ответа на этот вопрос. Главная проблема такого в нейрослопа в том что ценности в этом немного, а стоимость воспроизведения даже ниже чем у классических проектов. У меня в загашнике есть немало идей вплоть до написанных ТЗ на подобные проекты, но пока ни один из них фильтр разумного ответа на самый главный вопрос не прошли.
4. Чем больше я изучаю того как устроены каталоги данных по всему миру тем больше соблазн написатьсамый лучший/эффективный/технологичный свой движок для каталога данных тем более что у меня такой опыт уже был несколько раз в жизни. Очень стараюсь не попасться в эту ловушку, потому что движков каталогов данных десятки, по настоящему хороших может и немного, но для хороших и рынка то особо нет.
#thoughts #ai #coding #opendata
1. Модель MiniMax M3 и их среда разработки почти дотягивает до GLM-5.3 от Z.ai. По бенчмаркам GLM-5.3 точно лучше, но по цене M3 в 4 раза выгоднее. На практике они близки друг к другу и использовать MiniMax Code себя оправдыввает на множестве задач "простого кодирования". Для vibe-кодеров оно точно не годится, а для тех кто работает с открытым кодом и фокусируется на приведении кода/репозиториев в порядок вполне годится.
2. Учитывая как существенно падают затраты на создание структурированных данных из неструктурированных есть ощущение что довольно скоро будет бум самопальных каталогов данных. Они уже всё чаще появляются, но пока массовости явления нет, а есть ощущение что оно появится как возвращающийся тренд "посмотрите они [государство] бесполезны, а я знаю как сделать правильно, вот смотрите портал данных [моей страны/моего региона/моего города]". Чаще, конечно, сейчас такое про альтернативы официальным порталам статистики, но ими все не ограничится.
3. Главная беда контентных проектов написанных на 100% с помощью ИИ в отсутствии ответа на вопрос
4. Чем больше я изучаю того как устроены каталоги данных по всему миру тем больше соблазн написать
#thoughts #ai #coding #opendata
👍7❤3