Инжиниринг Данных
23.8K subscribers
2.22K photos
63 videos
194 files
3.31K links
Делюсь новостями из мира аналитики и карьерными советами.

15 лет в Аналитике и Инжиниринге Данных, 10 лет в MAANG

🛠️ dataengineer.ru | 🏄‍♂️ Surfalytics.com

№5017813306

Реклама:
https://almond-rule-130.notion.site/1199f595f76a8030ba1be1e607c9a8ce
Download Telegram
За последнее время мне удалось пообщаться со многими компаниями Enterprise-уровня, и у всех одна и та же проблема — криво внедренный Databricks.

Что значит криво? Значит неудобно и неинтуитивно.

Почему так? Потому что «а кто ж его знает, как надо».

Добавим сюда, что Databricks в такие конторы внедряется подрядчиками, которые ездят по ушам VP-уровню и другому персоналу, который уже мастер спорта по митингам и презентациям, но у которого есть сложности с технической составляющей организации, в которой они работают годами.

Вот и получается: хотели как лучше, а получилось как всегда.

Зато таких картин нет в историях со Snowflake.

Что бы там ни говорили про цены, производительность и другие особенности платформ, я ни разу не видел косячного внедрения Snowflake.

Ну, максимум ценник выше, чем должен быть, но люди работают, пишут запросы, и вопросов, как получить доступ к данным, не возникает.

У всех всё понятно: dbt, Airflow, GitHub. Всё работает как и должно, легко найти специалиста, легко подключить Claude Code.

А как у вас дела?

PS фото с paddle board, скоро будет экспедиция на 5 дней, тренируюсь.
25
Добавил секцию блога к сайту. Начнем с базы, что такое спутник 🛰🛰

https://blog.playeronespace.com/p/what-is-a-satellite
Please open Telegram to view this post
VIEW IN TELEGRAM
🌚54
Отличный аргумент, что AI не заменит нас!

А вы умеете кушать готовить?👀
Please open Telegram to view this post
VIEW IN TELEGRAM
💯31🌚25🤷2
Собрал материал про AI workloads и видео карты на спутниках https://blog.playeronespace.com/p/brains-in-orbit-a-complete-guide

Решил, что IoT спутниковая сеть это очень банально. Узнал про LEO PNT - gps на низкой орбите с точностью до см. Очень круто и дорого. А вот Edge AI интересный кейс и можно начать с небольшого, если просто сфокусироваться на сам спутник, который будет делать расчеты на борту.
6
В cвой личный slack добавил себе Notion бота из Notion Calendar, который собирает все встречи и присылает мне список на завтра и время во сколько вставать (за 15 минут до 1й встречи). Notion Calendar позволяет собрать все календари вместе, а если календарь закрыт, я вручную дублирую событие в личный календарь.

Видно, что день прям busy, но это у меня такие обычные вторник, среда, четверг.

Зато, в понедельник тихо, все еще отходят от выходных, а в пятницу все уже готовятся к выходным. Поэтому я уже воспринимаю вторник-четверг как данность, мне хоть в 3 раза больше митингов, справимся🎮

Сейчас столько классных штук, которые экономят время:
• можно собрать все slackи в одном месте и агент будет все писать, что произошло
• можно все почты подключить к агенту, тоже будет у вас summary.

Но я пока по старинке! А как вы себе упростили рабочий процесс?

PS reschedule конфликты - для слабаков🍪🍪
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥173
Послушал подкаст Data Engineering Central - там разговор с Джейкобом Мэтсоном, Developer Advocate из MotherDuck (это облачная версия DuckDB).


1. Индустрия устала от сложности
После лет оверинжиниринга (Spark, Kafka, огромные кластеры) - маятник качнулся обратно. Всё больше задач решается на одной машине. DuckDB - яркий пример: просто, быстро, без инфраструктуры.

2. AI не убьёт дата-инженеров - наоборот
Казалось бы, если AI генерирует SQL - зачем инженеры? Но тезис обратный: AI будет генерировать больше запросов, значит нужно больше людей, которые следят за качеством данных и моделями. Роль дата-инженера вырастет, а не исчезнет.

3. Data Modeling снова в моде

Когда AI пишет запросы, он опирается на структуру данных. Если модель данных плохая - AI будет давать мусорные ответы. Хорошая модель данных становится критически важной. По сегодняшнему опыту, AI очень хорошо помогает в моделировании. Ведь моделирование - это набор правил, которым следуют разработчики. Если мы создадим правила для AI, добавим необходимый контекст, то получится очень эффективно.

4. DuckDB vs Spark
Spark всё ещё нужен для реально больших данных. Но огромная часть "больших" задач на практике - это просто неоптимизированные маленькие задачи. DuckDB справляется с ними в разы проще и дешевле.

Вывод: Простота побеждает. AI не заменяет инженеров, а меняет их фокус - от написания SQL к проектированию данных и контролю качества.
❤‍🔥62🫡4🍌1🦄1
Сегодня проводил собес по system design DE. У Кандидата было резюме на 10 страниц текста! Сами понимаете серьезный кандидат. Я приложил задачку и результат.

Чувак не в теме особо про dbt, Snowflake и тп. Прям как из нашего отечественного дата инжиниринга, но нет, он был из Индии и уже много лет работает дата инженером. Как я понял весь его опыт был про Spark Jobs на Hadoop. И в основном на этапе data ingestions.

Нужно ли знать dbt и Snowflake всем? Нет не нужно. Но это, как бы, самое популярное на рынке и для общего развития неплохо бы знать в общих чертах, как и duckdb, и тп. Это называется grow mindset. Сейчас вообще можно ничего не знать, но работу делать. А если вы еще и понимаете, что делаете, то тогда работа приносит удовольствие.

Идеально, когда вы понимаете и знаете, а ваша команда не знает и не понимает, как и ваш менеджер😁

PS я еще провожу собеседование на CTO и инженера по спутникам.

Идея простоя, засунуть побольше AI и других вещей в спутник и отправить в космос, сложность, что пустой спутник отправить в космос стоит годовых инвестиций. И цены только растут.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
💯186😭3🙊1
Сегодня был еще один собес. На входе 5 лет опыта.

Задачка такая же - платформа на AWS.

Кандидат прыгал с Postgres на Snowflake и Databricks. Про dbt не слышал, Airflow мельком.

5 лет это реальный опыт. То есть можно работать годами и ничего не знать, а можно за 6 месяцев качнуться на Surfalytics или самому, построить несколько типовых решений и уже будете знать больше чем 90% кандидатов с 5-10 лет опыта.

Причина вся та же, люди ленятся учиться и развиваться. Они думаю, что на работе им достаточно навыков и их потом возьмут на другую работу. В свободное время они гуляют и кайфуют. И это хорошо!

Но лучше гулять и кайфовать в рабочее время🎃 Но для этого надо бы сначала качнуться как следуют, чтобы потом на “чиле, на раслабоне”🛌
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥68💯34🤷871
Почему ваша команда дата-инженеров всегда выглядит несчастной и выгоревшей:
1. Они тратят большую часть времени на переработку плохо спроектированных таблиц в SQL
2. На них кричат, когда ломается чужой код
3. Никто не пишет тесты, но все ожидают, что они будут отлаживать сбои
4. Дежурство — это кошмар
5. Качество данных не ценится так, как функции с очевидным ROI
6. Сколько бы времени они ни тратили на сокращение облачных расходов — этого всегда мало
7. Им редко удаётся заниматься инновационной работой
8. Они — одна из наименее публично признаваемых инженерных команд (привет, Безопасность)
9. Это крайне сложная роль для замещения = долгое время с открытыми вакансиями
10. У них маленький бюджет для огромной и дорогостоящей проблемы
11. Они чаще всего первыми получают обвинения и последними — похвалу
12. Количество сервисных тикетов никогда не уменьшается
13. Плохое моделирование данных делает их жизнь радикально сложнее
14. «Больших побед» для празднования значительно меньше
15. Им не хватает контроля для внедрения лучших практик управления данными
16. Управление данными никогда не в приоритете… пока внезапно не становится им
17. Их редко привлекают, когда стартует новый крупный дата-проект…
18. …но в итоге именно им приходится разгребать весь беспорядок
19. Их редко уведомляют об изменениях в upstream-системах, вызывающих сбои пайплайнов
20. Никаких контрактов с поставщиками данных!
💯87🙈13❤‍🔥3🐳2
Наш любимый dbt стал еще лучше - встречайте dbt core v2

• dbt Core v2.0 — это новая open-source (Apache 2.0) основа, которая теперь написана на Rust вместо Python. По сути, dbt Labs взяли движок Fusion (который они разрабатывали отдельно), открыли его исходники и сделали новым фундаментом dbt Core. Сейчас в альфе.

Fusion vs Core v2 — в чём разница?
• dbt Core v2 — open-source Rust-движок, быстрый парсинг, новые артефакты. Это база.
• dbt Fusion — надстройка над Core v2 с пониманием SQL, column-level lineage, богатым dev-опытом в VS Code. Это расширенная версия.

Грубо говоря: Core v2 = фундамент, Fusion = фундамент + суперспособности.

Что нового в Core v2:
Скорость — парсинг до 30x быстрее, чем в старом dbt Core на Python. Компиляция всего проекта в 2x быстрее. Это ощущается сразу.
📐 Строгая языковая спецификация — теперь нельзя случайно написать ⁠desciptin вместо ⁠description и не заметить. Чёткая схема языка = меньше глупых ошибок, стабильный интерфейс для интеграций.
📦 Parquet-артефакты — вместо огромных JSON-файлов. Можно напрямую запрашивать через DuckDB или любой AI-агент. Намного быстрее и удобнее для больших проектов.
📚 Новый локальный docs-опыт — полностью переработан, работает на новых артефактах, масштабируется на проекты любого размера.
🦀 Весь Rust-код теперь в репозитории dbt-core — то, что раньше было в dbt-fusion под лицензией ELv2, теперь открыто под Apache 2.0.

Нужно ли мигрировать?
Пока v2 в альфе. dbt Labs выпустили инструменты для миграции (⁠dbt-autofix), которые помогут подготовить проект. Python-версии dbt Core никуда не делись — они остаются доступными.


Я пока мигрировать не собираюсь. Проблем в старых версиях нет. В dbt core вообще проблем нет, поэтому никто не хочет покупать платную версию.
❤‍🔥40🐳119
В наше время самый кайф это попасть в зону, где нет сети. Следующие 5 дней буду плавать на paddle board в тихом океане и ничего делать🏄‍♂️
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥1053🦄2