Вход в аналитику сейчас требует большего, чем несколько лет назад. AI закрывает часть рутины, но не снимает с аналитика ответственность за корректность выводов. Писать код недостаточно, если нет понимания устройства данных и умения проверять результат: бизнесу нужен не скрипт, а обоснованный вывод.
Своим видением обстановки поделился Саша Исаков, в своем посте он начал делиться базой, которая нужна прямо сейчас, чтобы вкатиться в аналитику:
🔹 SQL: проверить, корректен ли код, может только тот, кто знает, как он устроен внутри.
🔹 Статистика: аргумент в спорах с заказчиками, особенно когда те приходят с готовыми выводами от Claude и ждут немедленного «катим тест».
🔹 Реальный проект: от сбора данных, борьбы с дубликатами и тестов гипотез до финальных метрик и защиты выводов.
Эти темы всё чаще мелькают у опытных практиков, чтобы помочь новичкам в период, когда инструменты обновляются быстрее, чем накапливается реальный опыт. В конечном счёте именно фундамент определяет, как далеко получится пройти в профессии.
Своим видением обстановки поделился Саша Исаков, в своем посте он начал делиться базой, которая нужна прямо сейчас, чтобы вкатиться в аналитику:
🔹 SQL: проверить, корректен ли код, может только тот, кто знает, как он устроен внутри.
🔹 Статистика: аргумент в спорах с заказчиками, особенно когда те приходят с готовыми выводами от Claude и ждут немедленного «катим тест».
🔹 Реальный проект: от сбора данных, борьбы с дубликатами и тестов гипотез до финальных метрик и защиты выводов.
Эти темы всё чаще мелькают у опытных практиков, чтобы помочь новичкам в период, когда инструменты обновляются быстрее, чем накапливается реальный опыт. В конечном счёте именно фундамент определяет, как далеко получится пройти в профессии.
Telegram
asisakov
Пять базированных вещей для тех, кто вкатывается в аналитику
Часть 1
Недавно разбирал резюме кандидатов на вакансию и в который раз заметил одни и те же шаблоны. Открываешь резюме, и там написаны все ключевые слова, супер проекты, несколько лет опыта в виде…
Часть 1
Недавно разбирал резюме кандидатов на вакансию и в который раз заметил одни и те же шаблоны. Открываешь резюме, и там написаны все ключевые слова, супер проекты, несколько лет опыта в виде…
❤🔥9🌚4🙊4🤷2
Если смотреть на актуальный стек в Data-инженерии и ML, требования к специалистам уже давно вышли за рамки одной только работы с данными или алгоритмами. Сейчас наравне с PyTorch и SQL в продуктовой разработке требуют знать Airflow, Kafka, Docker, FastAPI и разбираться в MLOps-инфраструктуре.
Для тех, кто планирует системно закрыть хард-скиллы или сменить направление, есть новость. Сейчас у НИЯУ МИФИ идет прием документов на онлайн-магистратуру «Специалист по работе с данными и применению ИИ», созданную в партнерстве с Яндекс Практикумом.
Программу разделили на 4 профильных трека:
-CV-инженер — компьютерное зрение от базовой обработки до трансформеров: PyTorch, OpenCV, Hugging Face, Transformers, FastAPI.
-NLP-инженер — обработка текста и работа с LLM: NLTK, TF-IDF, RNN, PyTorch.
-Data-инженер — пайплайны и хранилища: SQL, PostgreSQL, MongoDB, Vertica, Hadoop, Kafka, Python.
- ML-инженер — разработка и внедрение моделей машинного обучения: MLflow, DVC, Airflow, Optuna, Docker, FastAPI, Yandex Cloud.
Там же разбирают продуктовые кейсы компаний, в том числе юнитов Яндекса (Лавка, Еда, Go, Реклама, Облако). В общем, все подвязано на практике, поэтому без портфолио проектов точно не останетесь.
Формат программы полностью дистанционный, при этом ее статус очный — с отсрочкой и студенческими льготами. Выдается два диплома: магистерский от НИЯУ МИФИ и о профпереподготовке от Яндекс Практикума.
Поступление тоже проходит онлайн. Кампания в самом разгаре, так что смело залетайте. Ознакомиться с подробностями можете по ссылке.
Для тех, кто планирует системно закрыть хард-скиллы или сменить направление, есть новость. Сейчас у НИЯУ МИФИ идет прием документов на онлайн-магистратуру «Специалист по работе с данными и применению ИИ», созданную в партнерстве с Яндекс Практикумом.
Программу разделили на 4 профильных трека:
-CV-инженер — компьютерное зрение от базовой обработки до трансформеров: PyTorch, OpenCV, Hugging Face, Transformers, FastAPI.
-NLP-инженер — обработка текста и работа с LLM: NLTK, TF-IDF, RNN, PyTorch.
-Data-инженер — пайплайны и хранилища: SQL, PostgreSQL, MongoDB, Vertica, Hadoop, Kafka, Python.
- ML-инженер — разработка и внедрение моделей машинного обучения: MLflow, DVC, Airflow, Optuna, Docker, FastAPI, Yandex Cloud.
Там же разбирают продуктовые кейсы компаний, в том числе юнитов Яндекса (Лавка, Еда, Go, Реклама, Облако). В общем, все подвязано на практике, поэтому без портфолио проектов точно не останетесь.
Формат программы полностью дистанционный, при этом ее статус очный — с отсрочкой и студенческими льготами. Выдается два диплома: магистерский от НИЯУ МИФИ и о профпереподготовке от Яндекс Практикума.
Поступление тоже проходит онлайн. Кампания в самом разгаре, так что смело залетайте. Ознакомиться с подробностями можете по ссылке.
🌚6❤🔥5
Как работать с данными так, чтобы не терять клиентов
Данных о клиентах у крупных компаний не просто много, а очень много. Следующий уровень: связать все эти данные между собой и использовать в бизнес-процессах.
Ситуация: клиент решил расстаться с банком. Банк думает, что тот недоволен обслуживанием как физическое лицо, а на самом деле — у клиента есть своя компания, и он расстроен тем, как финансовая организация решала вопрос с неработающим эквайрингом. Парадокс: банк знает о клиенте практически все, но ни один сотрудник не видит ситуацию целиком и не понимает, в чем истинная причина ухода.
Сегодня в 18.00 компания HFLabs проведет вебинар и расскажет, как бизнесу не попадать в такие ситуации.
На вебинаре обсудят:
— как собрать в одном профиле данные, события и связи между людьми и компаниями;
— зачем хранить граф связей и какие задачи он помогает решать;
— как повысить LTV за счет лучшего понимания клиента и своевременных действий;
— как перейти от накопления данных к их использованию в бизнес-процессах;
— как сделать данные о клиентах понятными для LLM.
Кому будет полезно
Всем, кто хочет лучше понимать своих клиентов: руководителям CX-департаментов, розничных и корпоративных блоков в крупных компаниях, директорам по маркетингу.
🕕 Вебинар пройдет сегодня (6 августа) в 18:00. Зарегистрируйтесь, чтобы получить ссылку на подключение.
Данных о клиентах у крупных компаний не просто много, а очень много. Следующий уровень: связать все эти данные между собой и использовать в бизнес-процессах.
Ситуация: клиент решил расстаться с банком. Банк думает, что тот недоволен обслуживанием как физическое лицо, а на самом деле — у клиента есть своя компания, и он расстроен тем, как финансовая организация решала вопрос с неработающим эквайрингом. Парадокс: банк знает о клиенте практически все, но ни один сотрудник не видит ситуацию целиком и не понимает, в чем истинная причина ухода.
Сегодня в 18.00 компания HFLabs проведет вебинар и расскажет, как бизнесу не попадать в такие ситуации.
На вебинаре обсудят:
— как собрать в одном профиле данные, события и связи между людьми и компаниями;
— зачем хранить граф связей и какие задачи он помогает решать;
— как повысить LTV за счет лучшего понимания клиента и своевременных действий;
— как перейти от накопления данных к их использованию в бизнес-процессах;
— как сделать данные о клиентах понятными для LLM.
Кому будет полезно
Всем, кто хочет лучше понимать своих клиентов: руководителям CX-департаментов, розничных и корпоративных блоков в крупных компаниях, директорам по маркетингу.
🕕 Вебинар пройдет сегодня (6 августа) в 18:00. Зарегистрируйтесь, чтобы получить ссылку на подключение.
🌚2
Интересная локальная модель Gemma4-12B-Coder для Python, работает без интернета. Нужно 4.5 Gb VRAM.
Если вдруг вопрос про RAM vs VRAM:
Пишите много на Python или изучаете его? Отличный вариант использовать бесплатного помощника, если компьютер позволяет
Если вдруг вопрос про RAM vs VRAM:
RAM — рабочий стол обычного офисного работника (CPU)
VRAM — рабочий стол дизайнера с огромным монитором (GPU)
Пишите много на Python или изучаете его? Отличный вариант использовать бесплатного помощника, если компьютер позволяет
❤🔥10🌚3
👀Кто такой по-настоящему крутой дата-инженер сегодня?
Профессия дата-инженера сильно изменилась. Еще недавно основной фокус был на надежных пайплайнах, ETL-процессах и стабильной доставке данных.
Но сейчас везде обсуждают LLM: инструменты меняются на лету, бизнес требует внедрения больших языковых моделей, и команды пока ищут устойчивые подходы к тому, как использовать их в реальных системах.
Сегодня рынок ждет от нас гораздо большего.
— Как встроить LLM в пайплайны без лишней сложности?
— Как устроены базы данных под капотом?
— Почему ломается Data Quality, когда объемы вырастают в сто раз?
— Как выстроить MLOps, чтобы модели жили долго и не деградировали?
Над этими вопросами сейчас ломают голову и мидлы, и сеньоры. И чтобы находить изящные решения, нужна хорошая архитектурная насмотренность.
Быстрее всего она появляется там, где можно вживую разобрать чужие подходы и обсудить их с коллегами из других компаний. Именно такие люди соберутся на SmartData уже этой осенью.
Среди тем программы — практический опыт команд, которые внедряют LLM в свои решения.
📆 23–24 сентября, Москва (офлайн) + онлайн.
Подробности и билеты — на сайте конференции.
⚡️С промокодом
Профессия дата-инженера сильно изменилась. Еще недавно основной фокус был на надежных пайплайнах, ETL-процессах и стабильной доставке данных.
Но сейчас везде обсуждают LLM: инструменты меняются на лету, бизнес требует внедрения больших языковых моделей, и команды пока ищут устойчивые подходы к тому, как использовать их в реальных системах.
Сегодня рынок ждет от нас гораздо большего.
— Как встроить LLM в пайплайны без лишней сложности?
— Как устроены базы данных под капотом?
— Почему ломается Data Quality, когда объемы вырастают в сто раз?
— Как выстроить MLOps, чтобы модели жили долго и не деградировали?
Над этими вопросами сейчас ломают голову и мидлы, и сеньоры. И чтобы находить изящные решения, нужна хорошая архитектурная насмотренность.
Быстрее всего она появляется там, где можно вживую разобрать чужие подходы и обсудить их с коллегами из других компаний. Именно такие люди соберутся на SmartData уже этой осенью.
Среди тем программы — практический опыт команд, которые внедряют LLM в свои решения.
📆 23–24 сентября, Москва (офлайн) + онлайн.
Подробности и билеты — на сайте конференции.
⚡️С промокодом
ROCKYOURDATA персональные билеты дешевле.❤🔥7🙈7⚡1🤷1
Я получил новый MacBook и зарядил Claude Code скачать локальные модели на попробовать.
❤🔥21🙈5🫡3⚡1
Сегодня заценил новый skill от Claude. Как обычно Airflow Dag упал с ошибкой. Обычно я копирую ошибку в Claude Code и прошу его починить.
Но сегодня товарищ попробовал попросить Claude bot, и он сразу нашел проблему, владельца dag, source code изменения и тп. И сразу сделал PR.
Раньше мы такое делали как мини проект - запускали lambda, чтобы она все это делала и писала ответ и создавала PR. А теперь все из коробки.
Но сегодня товарищ попробовал попросить Claude bot, и он сразу нашел проблему, владельца dag, source code изменения и тп. И сразу сделал PR.
Раньше мы такое делали как мини проект - запускали lambda, чтобы она все это делала и писала ответ и создавала PR. А теперь все из коробки.
❤🔥25😭9🐳5⚡2
В Lakehouse можно сколько угодно ускорять compute, но если S3 не успевает отдавать данные, вся платформа упрётся в storage.
18 августа на Data Meetup VK Tech будет хороший практический кейс Авито именно про это.
Их аналитическая платформа работает на Trino и Vertica поверх Hive-каталогов, данные хранятся в S3 на HDD. Один S3 кластер упёрся в предел масштабирования и 20 ГБайт/с на чтение.
Тогда команда взяла три кластера S3, стала распределять объекты каждой таблицы по хешу пути и использовала уже существующие HAProxy-сайдкары на compute-нодах как stateless-шардирующий прокси. В результате пиковую скорость чтения увеличили с 20 до 60 ГБайт/с без отдельного proxy layer.
Дмитрий Листвин из Авито расскажет, как они писали расширение HAProxy на Lua, реализовали ListObjects и DeleteObjects, какие проблемы получили при решардинге и как теперь эксплуатируют это решение.
Ещё будет доклад Павла Кутакова из VK Tech про архитектуру VK Data Platform гиперконвергентной дата-платформы на Kubernetes: управление СУБД и сервисами, отказоустойчивость, сеть, безопасность и наблюдаемость.
После докладов инженеры RWB и VK Tech разберут кейс подготовки сегментов для таргетинга на Trino и DataFusion. Затем обсудят Kubernetes, self-service-аналитику, подготовку платформ под AI-агентов и то, как AI меняет разработку дата-платформ.
После технической части — приятные напитки, пицца и можно будет обсудить всё это уже без слайдов.
18 августа, сбор в 17:30
Москва, БЦ «Скайлайт»
Онлайн тоже будет.
Регистрация 👉
https://vk.cc/d0fvdV?erid=2VtzqxS4LDR
18 августа на Data Meetup VK Tech будет хороший практический кейс Авито именно про это.
Их аналитическая платформа работает на Trino и Vertica поверх Hive-каталогов, данные хранятся в S3 на HDD. Один S3 кластер упёрся в предел масштабирования и 20 ГБайт/с на чтение.
Тогда команда взяла три кластера S3, стала распределять объекты каждой таблицы по хешу пути и использовала уже существующие HAProxy-сайдкары на compute-нодах как stateless-шардирующий прокси. В результате пиковую скорость чтения увеличили с 20 до 60 ГБайт/с без отдельного proxy layer.
Дмитрий Листвин из Авито расскажет, как они писали расширение HAProxy на Lua, реализовали ListObjects и DeleteObjects, какие проблемы получили при решардинге и как теперь эксплуатируют это решение.
Ещё будет доклад Павла Кутакова из VK Tech про архитектуру VK Data Platform гиперконвергентной дата-платформы на Kubernetes: управление СУБД и сервисами, отказоустойчивость, сеть, безопасность и наблюдаемость.
После докладов инженеры RWB и VK Tech разберут кейс подготовки сегментов для таргетинга на Trino и DataFusion. Затем обсудят Kubernetes, self-service-аналитику, подготовку платформ под AI-агентов и то, как AI меняет разработку дата-платформ.
После технической части — приятные напитки, пицца и можно будет обсудить всё это уже без слайдов.
18 августа, сбор в 17:30
Москва, БЦ «Скайлайт»
Онлайн тоже будет.
Регистрация 👉
https://vk.cc/d0fvdV?erid=2VtzqxS4LDR
❤🔥6⚡3🫡3🙉3💯1😭1🙊1
Lakehouse для аналитиков и инженеров данных
Приглашаем изучить популярный подход построения хранилищ данных Data Lakehouse c разделенным Compute и Storage на основе Iceberg и Trino.
В программе курса:
• Современная архитектура аналитических систем от DWH и Data Lake до Lakehouse с разделением Compute и Storage на базе Apache Iceberg и Trino.
• Iceberg: управление файлами, снимками, каталогами, схемами изменений и очисткой.
• Практическое использование Iceberg Catalog, работа с кластером Trino (на Kubernetes), подключение данных на S3 и выполнение SQL/ Python-запросов.
• Работа с Iceberg+Trinо на больших масштабах: сложные запросы к датасету TPC-DS (2.8 млрд строк), интеграция с DBT, Apache Airflow, оценка производительность систем.
• Построение пайплайнов, инструменты для корректной поддержки, обновления и масштабирования Lakehouse-инфраструктуры на уровне предприятия.
Кто мы: R&D-центр Devhands, наш канал.
Автор курса — Алексей Белозерский, CDO в inSales (Сбер 2B), ex: VK Tech, М.Видео, Эльдорадо
🗓 Старт курса: 27 августа
Изучить программу и записаться можно здесь.
Ждём вас!
Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzquZf5с8
Приглашаем изучить популярный подход построения хранилищ данных Data Lakehouse c разделенным Compute и Storage на основе Iceberg и Trino.
В программе курса:
• Современная архитектура аналитических систем от DWH и Data Lake до Lakehouse с разделением Compute и Storage на базе Apache Iceberg и Trino.
• Iceberg: управление файлами, снимками, каталогами, схемами изменений и очисткой.
• Практическое использование Iceberg Catalog, работа с кластером Trino (на Kubernetes), подключение данных на S3 и выполнение SQL/ Python-запросов.
• Работа с Iceberg+Trinо на больших масштабах: сложные запросы к датасету TPC-DS (2.8 млрд строк), интеграция с DBT, Apache Airflow, оценка производительность систем.
• Построение пайплайнов, инструменты для корректной поддержки, обновления и масштабирования Lakehouse-инфраструктуры на уровне предприятия.
Кто мы: R&D-центр Devhands, наш канал.
Автор курса — Алексей Белозерский, CDO в inSales (Сбер 2B), ex: VK Tech, М.Видео, Эльдорадо
🗓 Старт курса: 27 августа
Изучить программу и записаться можно здесь.
Ждём вас!
Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzquZf5с8
⚡3❤🔥1
Говорят навык кодить руками уже умирает. Писать код самому это уже недостаток. Понимать код, архитектуру и знать фундаментальные вещи это другое, которое необходимо. И теперь как-то надо это понимать и знать без hands-on опыта.
Молодежь, держись☕️
Молодежь, держись
Please open Telegram to view this post
VIEW IN TELEGRAM
😭56💯24🐳7🙈5🤷♀2🤷1
Наверно посмотрели на SpaceX, OpenAI, Anthropic и решили, что надо побольше капитализацию.
А еще databricks купил Electric - агенты рулят!
А еще databricks купил Electric - агенты рулят!
🌚7🫡4❤🔥2🙈2
📅 Сегодня в 19:00 по МСК будет вебинар про то, как агентный AI начинает менять привычный подход к BI и меняет бизнес-аналитику.
🎙 Спикеры: ребята из AI4BI.
Вебинар будет здесь (в канале) в онлайне
🔍 Описание:
Поговорим о том, как меняется сама работа с аналитикой: от ручных SQL-запросов и привычных дашбордов - к агентам, которые могут самостоятельно работать с данными, находить аномалии и помогать получать ответы быстрее.
Что разберем:
🔸 почему self-service BI не решил многие проблемы аналитики и куда сейчас движется Agentic BI
🔸 Open Source vs Enterprise: Vanna, DB-GPT, Superset - в сравнении с DataLens и Power BI
🔸 как может выглядеть агентный слой поверх Apache Superset + Trino + ClickHouse в закрытом контуре
🔸 реальный кейс внедрения в ритейле на 1500+ пользователей - логистика, склады, транспорт
🔸 экономика внедрения и окупаемость такого подхода на реальном кейсе
Думаю, особенно интересно будет тем, кто работает с BI, аналитическими платформами и AI-агентами или просто хочет понять, куда сейчас движется аналитика.
◼︎ Сегодня, 19:00 по Москве
Ссылки на ресурсы ребят:
🔗 Сайт → https://ai4bi.raftds.ru/
🔗 Канал → https://t.me/ai_archnadzor
#datalearn #Вебинар
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegram
Эй ай надзор
🔎 Ваш экспертный взгляд на архитектуру AI-решений. Разбираем кейсы, делимся лучшими практиками.
Автор – практикующий AI-архитектор.
Для консультаций/аудита: @parallelnominded
Key-words: AI-архитектура, MLOps, аудит AI, AI-консалтинг, проектирование AI
Автор – практикующий AI-архитектор.
Для консультаций/аудита: @parallelnominded
Key-words: AI-архитектура, MLOps, аудит AI, AI-консалтинг, проектирование AI
❤🔥11🌚3🐳1😭1