Инжиниринг Данных
23.8K subscribers
2.24K photos
63 videos
194 files
3.32K links
Делюсь новостями из мира аналитики и карьерными советами.

15 лет в Аналитике и Инжиниринге Данных, 10 лет в MAANG

🛠️ dataengineer.ru | 🏄‍♂️ Surfalytics.com

№5017813306

Реклама:
https://almond-rule-130.notion.site/1199f595f76a8030ba1be1e607c9a8ce
Download Telegram
Вход в аналитику сейчас требует большего, чем несколько лет назад. AI закрывает часть рутины, но не снимает с аналитика ответственность за корректность выводов. Писать код недостаточно, если нет понимания устройства данных и умения проверять результат: бизнесу нужен не скрипт, а обоснованный вывод.

Своим видением обстановки поделился Саша Исаков, в своем посте он начал делиться базой, которая нужна прямо сейчас, чтобы вкатиться в аналитику:

🔹 SQL: проверить, корректен ли код, может только тот, кто знает, как он устроен внутри.
🔹 Статистика: аргумент в спорах с заказчиками, особенно когда те приходят с готовыми выводами от Claude и ждут немедленного «катим тест».
🔹 Реальный проект: от сбора данных, борьбы с дубликатами и тестов гипотез до финальных метрик и защиты выводов.

Эти темы всё чаще мелькают у опытных практиков, чтобы помочь новичкам в период, когда инструменты обновляются быстрее, чем накапливается реальный опыт. В конечном счёте именно фундамент определяет, как далеко получится пройти в профессии.
❤‍🔥9🌚4🙊4🤷2
Если смотреть на актуальный стек в Data-инженерии и ML, требования к специалистам уже давно вышли за рамки одной только работы с данными или алгоритмами. Сейчас наравне с PyTorch и SQL в продуктовой разработке требуют знать Airflow, Kafka, Docker, FastAPI и разбираться в MLOps-инфраструктуре.

Для тех, кто планирует системно закрыть хард-скиллы или сменить направление, есть новость. Сейчас у НИЯУ МИФИ идет прием документов на онлайн-магистратуру «Специалист по работе с данными и применению ИИ», созданную в партнерстве с Яндекс Практикумом.

Программу разделили на 4 профильных трека:

-CV-инженер — компьютерное зрение от базовой обработки до трансформеров: PyTorch, OpenCV, Hugging Face, Transformers, FastAPI.
-NLP-инженер — обработка текста и работа с LLM: NLTK, TF-IDF, RNN, PyTorch.
-Data-инженер — пайплайны и хранилища: SQL, PostgreSQL, MongoDB, Vertica, Hadoop, Kafka, Python.
- ML-инженер — разработка и внедрение моделей машинного обучения: MLflow, DVC, Airflow, Optuna, Docker, FastAPI, Yandex Cloud.

Там же разбирают продуктовые кейсы компаний, в том числе юнитов Яндекса (Лавка, Еда, Go, Реклама, Облако). В общем, все подвязано на практике, поэтому без портфолио проектов точно не останетесь.

Формат программы полностью дистанционный, при этом ее статус очный — с отсрочкой и студенческими льготами. Выдается два диплома: магистерский от НИЯУ МИФИ и о профпереподготовке от Яндекс Практикума.

Поступление тоже проходит онлайн. Кампания в самом разгаре, так что смело залетайте. Ознакомиться с подробностями можете по ссылке.
🌚6❤‍🔥5
Как работать с данными так, чтобы не терять клиентов

Данных о клиентах у крупных компаний не просто много, а очень много. Следующий уровень: связать все эти данные между собой и использовать в бизнес-процессах.

Ситуация: клиент решил расстаться с банком. Банк думает, что тот недоволен обслуживанием как физическое лицо, а на самом деле — у клиента есть своя компания, и он расстроен тем, как финансовая организация решала вопрос с неработающим эквайрингом. Парадокс: банк знает о клиенте практически все, но ни один сотрудник не видит ситуацию целиком и не понимает, в чем истинная причина ухода.

Сегодня в 18.00 компания HFLabs проведет вебинар и расскажет, как бизнесу не попадать в такие ситуации.

На вебинаре обсудят:
— как собрать в одном профиле данные, события и связи между людьми и компаниями;
— зачем хранить граф связей и какие задачи он помогает решать;
— как повысить LTV за счет лучшего понимания клиента и своевременных действий;  
— как перейти от накопления данных к их использованию в бизнес-процессах; 
— как сделать данные о клиентах понятными для LLM. 

Кому будет полезно
Всем, кто хочет лучше понимать своих клиентов: руководителям CX-департаментов, розничных и корпоративных блоков в крупных компаниях, директорам по маркетингу.

🕕 Вебинар пройдет сегодня (6 августа) в 18:00. Зарегистрируйтесь, чтобы получить ссылку на подключение.
🌚2
Интересная локальная модель Gemma4-12B-Coder для Python, работает без интернета. Нужно 4.5 Gb VRAM.

Если вдруг вопрос про RAM vs VRAM:
RAM — рабочий стол обычного офисного работника (CPU)
VRAM — рабочий стол дизайнера с огромным монитором (GPU)


Пишите много на Python или изучаете его? Отличный вариант использовать бесплатного помощника, если компьютер позволяет
❤‍🔥10🌚3
👀Кто такой по-настоящему крутой дата-инженер сегодня?

Профессия дата-инженера сильно изменилась. Еще недавно основной фокус был на надежных пайплайнах, ETL-процессах и стабильной доставке данных.

Но сейчас везде обсуждают LLM: инструменты меняются на лету, бизнес требует внедрения больших языковых моделей, и команды пока ищут устойчивые подходы к тому, как использовать их в реальных системах.

Сегодня рынок ждет от нас гораздо большего.

— Как встроить LLM в пайплайны без лишней сложности?
— Как устроены базы данных под капотом?
— Почему ломается Data Quality, когда объемы вырастают в сто раз?
— Как выстроить MLOps, чтобы модели жили долго и не деградировали?

Над этими вопросами сейчас ломают голову и мидлы, и сеньоры. И чтобы находить изящные решения, нужна хорошая архитектурная насмотренность.

Быстрее всего она появляется там, где можно вживую разобрать чужие подходы и обсудить их с коллегами из других компаний. Именно такие люди соберутся на SmartData уже этой осенью.

Среди тем программы — практический опыт команд, которые внедряют LLM в свои решения.

📆 23–24 сентября, Москва (офлайн) + онлайн.

Подробности и билеты — на сайте конференции.

⚡️С промокодом ROCKYOURDATA персональные билеты дешевле.
❤‍🔥7🙈71🤷1
Я получил новый MacBook и зарядил Claude Code скачать локальные модели на попробовать.
❤‍🔥21🙈5🫡31
Сегодня заценил новый skill от Claude. Как обычно Airflow Dag упал с ошибкой. Обычно я копирую ошибку в Claude Code и прошу его починить.

Но сегодня товарищ попробовал попросить Claude bot, и он сразу нашел проблему, владельца dag, source code изменения и тп. И сразу сделал PR.

Раньше мы такое делали как мини проект - запускали lambda, чтобы она все это делала и писала ответ и создавала PR. А теперь все из коробки.
❤‍🔥25😭9🐳52
Давно не слышал про хороший open source BI Metabase.

https://www.metabase.com/blog/security-update
❤‍🔥5🐳1
Рост зарплат DE в Канаде, да и в мире. Раньше в Канаде средняя вилка была 140-160к, а теперь уже почти все вакансии до 200к (в год gross). И это за старшего инженера.

В США будет конечно выше и уже в usd.

Как дела с зарплатами в РФ и Европе?
12🙉7🫡3❤‍🔥2💯2🤷1
В Lakehouse можно сколько угодно ускорять compute, но если S3 не успевает отдавать данные, вся платформа упрётся в storage.

18 августа на Data Meetup VK Tech будет хороший практический кейс Авито именно про это.

Их аналитическая платформа работает на Trino и Vertica поверх Hive-каталогов, данные хранятся в S3 на HDD. Один S3 кластер упёрся в предел масштабирования и 20 ГБайт/с на чтение.

Тогда команда взяла три кластера S3, стала распределять объекты каждой таблицы по хешу пути и использовала уже существующие HAProxy-сайдкары на compute-нодах как stateless-шардирующий прокси. В результате пиковую скорость чтения увеличили с 20 до 60 ГБайт/с без отдельного proxy layer.

Дмитрий Листвин из Авито расскажет, как они писали расширение HAProxy на Lua, реализовали ListObjects и DeleteObjects, какие проблемы получили при решардинге и как теперь эксплуатируют это решение.

Ещё будет доклад Павла Кутакова из VK Tech про архитектуру VK Data Platform гиперконвергентной дата-платформы на Kubernetes: управление СУБД и сервисами, отказоустойчивость, сеть, безопасность и наблюдаемость.

После докладов инженеры RWB и VK Tech разберут кейс подготовки сегментов для таргетинга на Trino и DataFusion. Затем обсудят Kubernetes, self-service-аналитику, подготовку платформ под AI-агентов и то, как AI меняет разработку дата-платформ.

После технической части — приятные напитки, пицца и можно будет обсудить всё это уже без слайдов.

18 августа, сбор в 17:30
Москва, БЦ «Скайлайт»
Онлайн тоже будет.

Регистрация 👉
https://vk.cc/d0fvdV?erid=2VtzqxS4LDR
❤‍🔥63🫡3🙉3💯1😭1🙊1
Lakehouse для аналитиков и инженеров данных

Приглашаем изучить популярный подход построения хранилищ данных Data Lakehouse c разделенным Compute и Storage на основе Iceberg и Trino. 

В программе курса:
• Современная архитектура аналитических систем от DWH и Data Lake до Lakehouse с разделением Compute и Storage на базе Apache Iceberg и Trino
• Iceberg: управление файлами, снимками, каталогами, схемами изменений и очисткой. 
• Практическое использование Iceberg Catalog, работа с кластером Trino (на Kubernetes), подключение данных на S3 и выполнение SQL/ Python-запросов.
• Работа с Iceberg+Trinо на больших масштабах: сложные запросы к датасету TPC-DS (2.8 млрд строк), интеграция с DBT, Apache Airflow, оценка производительность систем. 
• Построение пайплайнов, инструменты  для корректной поддержки, обновления и масштабирования Lakehouse-инфраструктуры на уровне предприятия. 

Кто мы: R&D-центр Devhands, наш канал.

Автор курса — Алексей Белозерский, CDO в inSales (Сбер 2B), ex: VK Tech, М.Видео, Эльдорадо

🗓 Старт курса: 27 августа

Изучить программу и записаться можно здесь.

Ждём вас!

Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzquZf5с8
3❤‍🔥1
Говорят навык кодить руками уже умирает. Писать код самому это уже недостаток. Понимать код, архитектуру и знать фундаментальные вещи это другое, которое необходимо. И теперь как-то надо это понимать и знать без hands-on опыта.

Молодежь, держись ☕️
Please open Telegram to view this post
VIEW IN TELEGRAM
😭56💯23🐳7🙈5🤷‍♀2🤷1
Наверно посмотрели на SpaceX, OpenAI, Anthropic и решили, что надо побольше капитализацию.

А еще databricks купил Electric - агенты рулят!
🌚7🫡4❤‍🔥2🙈2
🚀🚀🚀
📅 Сегодня в 19:00 по МСК будет вебинар про то, как агентный AI начинает менять привычный подход к BI и меняет бизнес-аналитику.

🎙 Спикеры: ребята из AI4BI.

Вебинар будет здесь (в канале) в онлайне

🔍 Описание:
Поговорим о том, как меняется сама работа с аналитикой: от ручных SQL-запросов и привычных дашбордов - к агентам, которые могут самостоятельно работать с данными, находить аномалии и помогать получать ответы быстрее.

Что разберем:

🔸 почему self-service BI не решил многие проблемы аналитики и куда сейчас движется Agentic BI

🔸 Open Source vs Enterprise: Vanna, DB-GPT, Superset - в сравнении с DataLens и Power BI

🔸 как может выглядеть агентный слой поверх Apache Superset + Trino + ClickHouse в закрытом контуре

🔸 реальный кейс внедрения в ритейле на 1500+ пользователей - логистика, склады, транспорт

🔸 экономика внедрения и окупаемость такого подхода на реальном кейсе

Думаю, особенно интересно будет тем, кто работает с BI, аналитическими платформами и AI-агентами или просто хочет понять, куда сейчас движется аналитика.

︎ Сегодня, 19:00 по Москве

Ссылки на ресурсы ребят:

🔗 Сайт → https://ai4bi.raftds.ru/
🔗 Канал → https://t.me/ai_archnadzor

🚀🚀🚀

#datalearn #Вебинар
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥11🌚3🐳1😭1
Live stream finished (1 hour)
Оказывается GitHub переживает тяжелые времена. Я сам замечаю как мои простые jobs на расписание работают через раз.

Получается для critical pipelines GitHub все хуже.

А как у вас?
💯5