Инжиниринг Данных
23.8K subscribers
2.24K photos
63 videos
194 files
3.33K links
Делюсь новостями из мира аналитики и карьерными советами.

15 лет в Аналитике и Инжиниринге Данных, 10 лет в MAANG

🛠️ dataengineer.ru | 🏄‍♂️ Surfalytics.com

№5017813306

Реклама:
https://almond-rule-130.notion.site/1199f595f76a8030ba1be1e607c9a8ce
Download Telegram
Интересная локальная модель Gemma4-12B-Coder для Python, работает без интернета. Нужно 4.5 Gb VRAM.

Если вдруг вопрос про RAM vs VRAM:
RAM — рабочий стол обычного офисного работника (CPU)
VRAM — рабочий стол дизайнера с огромным монитором (GPU)


Пишите много на Python или изучаете его? Отличный вариант использовать бесплатного помощника, если компьютер позволяет
❤‍🔥10🌚3
👀Кто такой по-настоящему крутой дата-инженер сегодня?

Профессия дата-инженера сильно изменилась. Еще недавно основной фокус был на надежных пайплайнах, ETL-процессах и стабильной доставке данных.

Но сейчас везде обсуждают LLM: инструменты меняются на лету, бизнес требует внедрения больших языковых моделей, и команды пока ищут устойчивые подходы к тому, как использовать их в реальных системах.

Сегодня рынок ждет от нас гораздо большего.

— Как встроить LLM в пайплайны без лишней сложности?
— Как устроены базы данных под капотом?
— Почему ломается Data Quality, когда объемы вырастают в сто раз?
— Как выстроить MLOps, чтобы модели жили долго и не деградировали?

Над этими вопросами сейчас ломают голову и мидлы, и сеньоры. И чтобы находить изящные решения, нужна хорошая архитектурная насмотренность.

Быстрее всего она появляется там, где можно вживую разобрать чужие подходы и обсудить их с коллегами из других компаний. Именно такие люди соберутся на SmartData уже этой осенью.

Среди тем программы — практический опыт команд, которые внедряют LLM в свои решения.

📆 23–24 сентября, Москва (офлайн) + онлайн.

Подробности и билеты — на сайте конференции.

⚡️С промокодом ROCKYOURDATA персональные билеты дешевле.
❤‍🔥7🙈71🤷1
Я получил новый MacBook и зарядил Claude Code скачать локальные модели на попробовать.
❤‍🔥21🙈5🫡31
Сегодня заценил новый skill от Claude. Как обычно Airflow Dag упал с ошибкой. Обычно я копирую ошибку в Claude Code и прошу его починить.

Но сегодня товарищ попробовал попросить Claude bot, и он сразу нашел проблему, владельца dag, source code изменения и тп. И сразу сделал PR.

Раньше мы такое делали как мини проект - запускали lambda, чтобы она все это делала и писала ответ и создавала PR. А теперь все из коробки.
❤‍🔥25😭9🐳52
Давно не слышал про хороший open source BI Metabase.

https://www.metabase.com/blog/security-update
❤‍🔥5🐳1
Рост зарплат DE в Канаде, да и в мире. Раньше в Канаде средняя вилка была 140-160к, а теперь уже почти все вакансии до 200к (в год gross). И это за старшего инженера.

В США будет конечно выше и уже в usd.

Как дела с зарплатами в РФ и Европе?
12🙉8🫡4❤‍🔥2💯2🤷1
В Lakehouse можно сколько угодно ускорять compute, но если S3 не успевает отдавать данные, вся платформа упрётся в storage.

18 августа на Data Meetup VK Tech будет хороший практический кейс Авито именно про это.

Их аналитическая платформа работает на Trino и Vertica поверх Hive-каталогов, данные хранятся в S3 на HDD. Один S3 кластер упёрся в предел масштабирования и 20 ГБайт/с на чтение.

Тогда команда взяла три кластера S3, стала распределять объекты каждой таблицы по хешу пути и использовала уже существующие HAProxy-сайдкары на compute-нодах как stateless-шардирующий прокси. В результате пиковую скорость чтения увеличили с 20 до 60 ГБайт/с без отдельного proxy layer.

Дмитрий Листвин из Авито расскажет, как они писали расширение HAProxy на Lua, реализовали ListObjects и DeleteObjects, какие проблемы получили при решардинге и как теперь эксплуатируют это решение.

Ещё будет доклад Павла Кутакова из VK Tech про архитектуру VK Data Platform гиперконвергентной дата-платформы на Kubernetes: управление СУБД и сервисами, отказоустойчивость, сеть, безопасность и наблюдаемость.

После докладов инженеры RWB и VK Tech разберут кейс подготовки сегментов для таргетинга на Trino и DataFusion. Затем обсудят Kubernetes, self-service-аналитику, подготовку платформ под AI-агентов и то, как AI меняет разработку дата-платформ.

После технической части — приятные напитки, пицца и можно будет обсудить всё это уже без слайдов.

18 августа, сбор в 17:30
Москва, БЦ «Скайлайт»
Онлайн тоже будет.

Регистрация 👉
https://vk.cc/d0fvdV?erid=2VtzqxS4LDR
❤‍🔥63🫡3🙉3💯1😭1🙊1
Lakehouse для аналитиков и инженеров данных

Приглашаем изучить популярный подход построения хранилищ данных Data Lakehouse c разделенным Compute и Storage на основе Iceberg и Trino. 

В программе курса:
• Современная архитектура аналитических систем от DWH и Data Lake до Lakehouse с разделением Compute и Storage на базе Apache Iceberg и Trino
• Iceberg: управление файлами, снимками, каталогами, схемами изменений и очисткой. 
• Практическое использование Iceberg Catalog, работа с кластером Trino (на Kubernetes), подключение данных на S3 и выполнение SQL/ Python-запросов.
• Работа с Iceberg+Trinо на больших масштабах: сложные запросы к датасету TPC-DS (2.8 млрд строк), интеграция с DBT, Apache Airflow, оценка производительность систем. 
• Построение пайплайнов, инструменты  для корректной поддержки, обновления и масштабирования Lakehouse-инфраструктуры на уровне предприятия. 

Кто мы: R&D-центр Devhands, наш канал.

Автор курса — Алексей Белозерский, CDO в inSales (Сбер 2B), ex: VK Tech, М.Видео, Эльдорадо

🗓 Старт курса: 27 августа

Изучить программу и записаться можно здесь.

Ждём вас!

Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzquZf5с8
3❤‍🔥1
Говорят навык кодить руками уже умирает. Писать код самому это уже недостаток. Понимать код, архитектуру и знать фундаментальные вещи это другое, которое необходимо. И теперь как-то надо это понимать и знать без hands-on опыта.

Молодежь, держись ☕️
Please open Telegram to view this post
VIEW IN TELEGRAM
😭56💯24🐳7🙈5🤷‍♀2🤷1
Наверно посмотрели на SpaceX, OpenAI, Anthropic и решили, что надо побольше капитализацию.

А еще databricks купил Electric - агенты рулят!
🌚7🫡4❤‍🔥2🙈2
🚀🚀🚀
📅 Сегодня в 19:00 по МСК будет вебинар про то, как агентный AI начинает менять привычный подход к BI и меняет бизнес-аналитику.

🎙 Спикеры: ребята из AI4BI.

Вебинар будет здесь (в канале) в онлайне

🔍 Описание:
Поговорим о том, как меняется сама работа с аналитикой: от ручных SQL-запросов и привычных дашбордов - к агентам, которые могут самостоятельно работать с данными, находить аномалии и помогать получать ответы быстрее.

Что разберем:

🔸 почему self-service BI не решил многие проблемы аналитики и куда сейчас движется Agentic BI

🔸 Open Source vs Enterprise: Vanna, DB-GPT, Superset - в сравнении с DataLens и Power BI

🔸 как может выглядеть агентный слой поверх Apache Superset + Trino + ClickHouse в закрытом контуре

🔸 реальный кейс внедрения в ритейле на 1500+ пользователей - логистика, склады, транспорт

🔸 экономика внедрения и окупаемость такого подхода на реальном кейсе

Думаю, особенно интересно будет тем, кто работает с BI, аналитическими платформами и AI-агентами или просто хочет понять, куда сейчас движется аналитика.

︎ Сегодня, 19:00 по Москве

Ссылки на ресурсы ребят:

🔗 Сайт → https://ai4bi.raftds.ru/
🔗 Канал → https://t.me/ai_archnadzor

🚀🚀🚀

#datalearn #Вебинар
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥12🌚3🐳1😭1
Live stream finished (1 hour)
Оказывается GitHub переживает тяжелые времена. Я сам замечаю как мои простые jobs на расписание работают через раз.

Получается для critical pipelines GitHub все хуже.

А как у вас?
💯17
Недавно был интересный случай. Моя компания Rock Your Data попала в небольшой тендер на разработку хранилища данных.

Моим оппонентом была небольшая консалтинговая компания, которая решила предложить стартапу внедрить Microsoft Fabric + Power BI. Это была их фатальная ошибка.

А я предложил Snowflake + dbt (внутри Snowflake), Metabase BI (6$ за место в месяц) и оставить оркестрацию внутри Snowflake.

А самое главное — сказал, что сразу буду использовать Claude Code и сделаю для них фреймворк, где разработка будет на Claude, а их единственный аналитик-джун станет дата-инженером.

На картинке — изначальный план агентства.

Агентство, конечно, лукавило, когда говорило, что сделает им всё за небольшие деньги на Microsoft Fabric.

Решения Microsoft — для Enterprise-компаний, когда у вас есть несколько команд по 10 человек и вы можете позволить себе ничего не делать месяцами (создавать видимость работы).
💯23🌚10❤‍🔥5
В новой статье Headed for the Exit: the Great Engineering Leader Career Break, автор делится наблюдениям про высокие инженерные должности.

CTO, VP of Engineering, Head of Engineering — люди, которые ещё вчера были на вершине карьеры — сейчас пачками уходят с позиций. Без нового места. Просто уходят.
The Pragmatic Engineer опросил почти 20 таких руководителей. Вот что они говорят:
Почему уходят:
1️⃣ Работа стала невыносимой — фаундеры с «AI-психозом» сами пишут код и сливают 60к строк в продакшн, ожидая магии. А разбираться с последствиями — CTO
2️⃣ Equity сгорает — сложные структуры инвесторских предпочтений делают даже 2% акций бесполезными. Зачем терпеть, если выхлопа не будет?
3️⃣ Без AI-опыта ты уже устарел — рынок хочет тех, кто уже трансформировал компанию под AI. Сидишь в «медленной» компании — отстаёшь
4️⃣ Команды сжались — один fullstack-инженер с AI делает работу пяти. VPE просто не нужен при команде из 4 человек
5️⃣ Fractional CTO выгоднее — зачем один работодатель, если можно работать с пятью параллельно?
6️⃣ AI-стартапы платят рядовым инженерам больше, чем обычные стартапы платят своим CTO. Математика не в пользу руководства
7️⃣ Выгорание — давление со всех сторон, нереалистичные ожидания, и ощущение что ты Дон Кихот


Роль инжиниринг менеджера в 2020 и в 2026 сейчас очень разные, и многие не хотят работать в таких условиях. Я полагаю сейчас вырастает новый тип руководителей, которым легче вариться в таких условиях.

Особенно хорошо написано про деньги - AI направления = больше денег у IC, чем у C уровня не AI. А еще лучше несколько fraction ролей (part time).

А как у вас ощущения?
🙈4🙊4🤷1