Подготовка по специальности
Собеседование Data Engineer:
вопросы и ответы.
Data Engineering-интервью проверяет весь путь данных: получение, преобразование, хранение, оркестрацию и эксплуатацию. Сильный ответ связывает выбор технологии с объёмом, задержкой, стоимостью, восстановлением после сбоя и качеством результата.
Потренировать ответы вслухНе пытайтесь выучить все ответы: интервьюеры проверяют понимание, а не память. Разберите темы ниже, прорешайте типичные вопросы вслух и свяжите каждый ответ с примером из собственного опыта.
01 · Процесс
Как обычно проходит интервью
После скрининга обычно идут SQL и Python, вопросы по хранилищам и распределённой обработке, затем системный дизайн пайплайна. Практическая часть может включать SQL-задачу, код преобразования или разбор сбоя DAG в Airflow.
02 · Темы
Что нужно знать перед интервью
Пайплайны и оркестрация
- ETL и ELT
- Airflow: DAG, retries, backfill
- идемпотентные загрузки
- контроль качества и lineage
Хранилища и моделирование
- DWH, data lake и lakehouse
- звезда и снежинка
- партиционирование
- SCD и инкрементальные загрузки
Распределённая обработка
- Spark: partition, shuffle и skew
- Kafka: partition и consumer group
- batch против streaming
- гарантии доставки и дедупликация
03 · Вопросы
Реальные вопросы с разбором ответов
Пометка у вопроса — как часто он встречается на реальных интервью: почти всегда часто иногда
ETL преобразует до загрузки, ELT — после загрузки средствами целевого хранилища. Сравните контроль данных, вычислительную мощность DWH, стоимость хранения, повторяемость преобразований и требования к чувствительным данным.
Читать полный разбор Потренировать этот ответИдите от типичных фильтров и объёма партиции. Ключ должен давать pruning, не создавать миллионы мелких файлов и не концентрировать запись в одной горячей партиции. Дата удобна не всегда — нужен профиль запросов.
Читать полный разбор Потренировать этот ответ03. Что означает exactly-once в дата-пайплайне?
почти всегдаЭто наблюдаемый результат без повторного эффекта, а не магическая доставка пакета ровно один раз. Обычно он достигается идемпотентной записью, транзакциями или дедупликацией по стабильному ключу и checkpoint.
Читать полный разбор Потренировать этот ответ04. Как смоделировать витрину продаж: звезда или снежинка?
частоЗвезда проще и быстрее для аналитических запросов, снежинка сильнее нормализует измерения. Обсудите grain факта, измерения, историю атрибутов и реальные BI-запросы, а не выбирайте схему по названию.
Потренировать этот ответ05. Что такое shuffle в Spark и почему он дорогой?
почти всегдаПерераспределение данных между executors требует сети, сериализации и диска. Его вызывают join, groupBy и repartition. Сокращают объём до shuffle, используют broadcast для малой стороны и борются со skew.
Потренировать этот ответ06. Как сделать Airflow DAG безопасным для повторного запуска?
почти всегдаЗадачи должны быть идемпотентными: писать в детерминированную партицию, использовать merge/upsert или атомарную замену, не опираться на текущее время. Проговорите retries, backfill и очистку частичного результата.
Потренировать этот ответ07. Какие проверки качества данных нужны в production-пайплайне?
почти всегдаСвежесть, полнота, уникальность, допустимые значения, referential integrity и сверка объёмов. Для каждой проверки определите порог, владельца, реакцию и возможность остановить публикацию плохой витрины.
Потренировать этот ответ08. Что такое Slowly Changing Dimensions?
частоType 1 перезаписывает значение без истории, Type 2 добавляет версию со сроком действия. Выбор зависит от того, нужно ли восстанавливать состояние измерения на дату факта.
Потренировать этот ответ09. Когда нужен streaming, а когда достаточно batch?
почти всегдаНачните с допустимой задержки и бизнес-ценности. Streaming повышает сложность состояния, порядка, повторов и эксплуатации; если SLA измеряется часами, batch часто дешевле и надёжнее.
Потренировать этот ответ10. Расскажите о сбое дата-пайплайна и восстановлении данных.
почти всегдаОпишите обнаружение, границы повреждения, остановку публикации, повторную загрузку или backfill, проверку результата и меры профилактики. Важно показать воспроизводимость и контроль качества, а не только быстрый restart.
Потренировать этот ответ04 · Практика
SQL и дизайн пайплайна
Практика обычно сочетает SQL с архитектурным кейсом: принять события, очистить, сохранить историю и построить витрину с заданным SLA. Уточняйте объём, задержку, схему, повторы, поздние события, backfill и требования к качеству.
Не начинайте с перечня технологий. Сначала сформулируйте контракт данных и failure model, затем выберите хранилище, обработчик и оркестратор под эти условия.
Общая подготовка — резюме, техника, звук и демонстрация экрана — разобрана в чек-листе подготовки к онлайн-собеседованию. Как осознанно использовать AI-подсказки во время звонка — в гайде «Как использовать AI на собеседовании».
05 · FAQ
Частые вопросы
Что важнее для Data Engineer: SQL или Python?
SQL проверяют почти всегда и часто глубже. Python нужен для трансформаций, интеграций и автоматизации. На сильных позициях ожидают оба инструмента плюс понимание распределённых систем.
Нужно ли знать Spark для первой позиции?
Не для каждой вакансии, но нужно понимать партиции, shuffle и причины перекоса данных. Для junior иногда достаточно SQL, Python, Airflow и одной СУБД; требования конкретной вакансии важнее общего списка.
Чем Data Engineer отличается от аналитика данных на интервью?
Data Engineer отвечает за надёжную доставку, хранение и обработку данных, поэтому больше вопросов про пайплайны и эксплуатацию. Аналитик сосредоточен на SQL, метриках, экспериментах и интерпретации результата.
Тренировка перед интервью
Репетируйте ответы вслух с Mira
Mira слышит вопрос и подсказывает опору для ответа прямо во время звонка. 30 минут бесплатно каждый месяц, банковская карта не нужна.
Mira