Ivan Begtin
9.16K subscribers
2.68K photos
5 videos
115 files
5.51K links
I write about Open Data, Data Engineering, Government, Privacy, Digital Preservation and etc.

CTO&Founder of Dateno https://dateno.io

Telegram @ibegtin
Facebook - https://facebook.com/ibegtin
Email ivan@begtin.tech

Ads/promotion agent: @k0shk
Download Telegram
Давно хочу написать про пуризм в определениях и бесконечные терминологические споры. Значительное число споров вокруг данных и многое в ИТ связано в тем что терминология это то чем очень любят манипулировать пиарщики и маркетологи придавая продвигаемым продуктам свойства схожие с продуктами обладающие ценностными характеристиками, но при этом де-факто ими не обладающие.

Самое популярное искажение вокруг открытого кода. Открытый код - это общедоступный исходный код публикуемый под свободными лицензиями такими как MIT, Apache, BSD и им подобные. Слово открытый, в данном случае, говорит не о том что код можно посмотреть, а о том что он может свободно использоваться в том числе в коммерческих целях.

Но для многих компаний открытость кода - это маркетинговая манипуляция. Они придумывают термины вроде open core, двойное лицензирование и так далее. Всё это делает их продукты не открытым кодом, а кодом доступным онлайн, но лицензии несвободны. Или же есть случаи когда код декларируется как открытый и под свободной лицензией, но доступ к нему можно получить только по запросу. Это тоже не открытый код, чтобы там не говорили те кто пишет что он таков.

С открытыми данными такая же ситуация. Они доступны не по запросу, не после регистрации, не имеют ограничения на коммерческое использование. Принципы открытых данных для того и разрабатывались чтобы создать юридически значимую процедуру публикации данных для их повторного использования. Ожидаемо многие эксплуатируют термин для того чтобы притворяться что они относятся к открытости, сами данные не публикуя. Данные не под свободными лицензиями открытыми не являются, данные доступные по запросу также, их называют данными с регламентированным доступом. Open Data Institute называет их данными в Public Access или Group Based Access. Это нормально если кто-то не хочет давать данные как открытые, но не надо никого обманывать и называть открытыми данными то что таким не является.

Термин большие данные вообще является маркетинговым, он был придуман для продажи инструментов для работы с данными которые достаточно велики чтобы с ними было неудобно работать на десктопе. Его применение довольно широко, определение весьма условно и сейчас, в 2026 году, им пользуются, в основном, те кто не имеет отношения к дата инженерии, data science и тд. В профессиональном обиходе его уже нет, используют его те кто, или оторван от рынка данных, или пытаются напихнуть buzzword'ов в свою речь. Разговоры в стиле мы используем большие данные быстро выдают непрофессионала.

В России часто придумывание новых терминов происходит как оборонительная тактика при защите бюджета. Упоминая одни термины можно оказаться в ситуации что они относятся к сфере которая уже регламентирована или к теме у которой есть владелец и при придумывании новых госпрограмм и госпроектов немало усилий придумщики тратян на то чтобы избежать использования одних терминов и использовать новые.

А с какими терминологическими искажениями вы сталкиваетесь? Что с ними делаете?

#opendata #opensource #thoughts #questions
👍15🔥3👏2💯2❤‍🔥11
У меня тут внезапный вопрос не про открытые данные, а про их восприятие. Мы регулярно проводим всякие конкурсы и хакатоны и заморочались тем что не можем подобрать правильную символику открытости данных. Понятно что есть символика организаций которые тему продвигают, а вот визуальной символики которую можно было бы превратить, например, в статуэтку придумать не получается.

Может у сообщества есть идеи? Поделитесь ими в чате @begtinchat

#questions
👍5
Кстати, вот назрел вопрос, сколько сейчас платят фуллтайм спецам по скрейпингу? Так чтобы человек умел разбирать не только HTML, но и DOC, DOCX, PDF и Excel файлы и складывать их дата файлы (CSV, Parquet) или сразу в СУБД и регулярно данные обновлять. Задачи такие очень частые и обычно решается ad-hoc и с использованием ИИ ассистентов.

Но тут есть задача побольше в том чтобы скрейпить и обработать данные статистического ведомства некоторой страны, а там не один парсер понадобится, а 20? 30? 40? много в общем.

Итого:
- много разноформатных данных
- высокая гетерогенность (нельзя написать один универсальный парсер)
- многое в неструктурированном и полуструктурированном виде

Кто как решает такие задачи и за сколько денег?

#questions
🔥4
Ведомости пишут что Более 50% библиотечных фондов может быть изъято при буквальной трактовке законов из за закона об иноагентах и из-за признания многих организаций как нежелательных.

Пора ли начинать архивировать такую литературу или исходим из того что она не исчезает, а только недоступна в России? Но в других странах, не-российских онлайн библиотеках и в пиратских библиотеках эта литература останется?

Практически все эти книги находятся под авторским правом и их распространение почти наверняка нарушит копирайты и многие архивные проекты будут не готовы хранить такие материалы именно по причине нарушения авторского права и рисков блокировки в России.

#questions #digitalpreservation
😱12🕊5👍3🙏1
Я вот тут столкнулся с тем что сам осваивал все что касается программирования ИИ агентами и применения ИИ в целом самостоятельно и на практике в основном, но регулярно в окружении есть люди которым нужно быстрое погружение, а материалов как раз про быстрое погружение у меня на руках нет.

Посоветуйте:
1. Что можно порекомендовать почитать про развитие ИИ в последние годы в сжатом виде для людей старшего возраста которые не имеют о теме ИИ глубокого представления, но обладают хорошим техническим образованием и бэкграундом. Понятно что практические материалы устаревают (обновляются) чуть ли не ежемесячно, и на смену RAG пришло уже много всего другого, как пример. Но наверняка есть хороший материал/книга/бесплатный курс быстрого погружения.

2. Какие курсы дают реальное быстрое погружение в Cursor, Antigravity, Claude Code и другие ИИ агенты для кодирования с нуля под задачи программирования и анализа данных. Курсов много, большая часть очень сомнительного качества. Что есть наиболее полезного сейчас? Критерий качества для меня - это "я на эти курсы готов отправить всех разработчиков", но никак не "я этот курс сделал, он отличный".

#questions #ai
155👍4🤔21