Подготовка по специальности

Собеседование Data Scientist:
вопросы и ответы.

На собеседовании Data Scientist проверяют весь цикл рассуждения: от постановки и качества данных до валидации, метрик и объяснения результата бизнесу. Формула модели сама по себе не заменяет ответ о выборке, утечке, стоимости ошибки и ограничениях внедрения.

Обновлено 19 августа 2026 г.10 вопросов с разбором
Потренировать ответы вслух
Data ScientistПрофессии и разделы
Короткий ответ

Не пытайтесь выучить все ответы: интервьюеры проверяют понимание, а не память. Разберите темы ниже, прорешайте типичные вопросы вслух и свяжите каждый ответ с примером из собственного опыта.

01 · Процесс

Как обычно проходит интервью

Часто процесс сочетает SQL или Python-задачу, теоретический блок по статистике и ML, а также продуктовый кейс. Интервьюер может дать таблицу с подозрительной метрикой, попросить выбрать разбиение или объяснить, почему сильная offline-модель не улучшила продукт.

02 · Темы

Что нужно знать перед интервью

Статистика и валидация

  • bias и variance
  • train/validation/test
  • cross-validation
  • доверительные интервалы и эксперименты

Модели и признаки

  • целевые метрики
  • feature engineering
  • дисбаланс классов
  • интерпретируемость

Данные и внедрение

  • data leakage
  • временные разбиения
  • качество данных
  • offline и online результат

03 · Вопросы

Реальные вопросы с разбором ответов

Пометка у вопроса — как часто он встречается на реальных интервью: почти всегда часто иногда

Bias — систематическая ошибка из-за слишком простой модели или признаков, variance — чувствительность к конкретной выборке. Диагностируйте train/validation-кривые, а не предлагайте «сложнее модель» по умолчанию.

Читать полный разбор Потренировать этот ответ

Разбиение отражает будущий сценарий применения: для времени — прошлое в train, будущее в test; для связанных объектов — group split. Выберите метрику, изолируйте финальный test и не подбирайте решение на нём многократно.

Читать полный разбор Потренировать этот ответ

Leakage — признак или трансформация содержит информацию, недоступную в момент предсказания. Проверьте момент доступности, split до fit препроцессинга, агрегаты по времени и признаки, зависящие от target.

Читать полный разбор Потренировать этот ответ

04. Как выбрать метрику для несбалансированной классификации?

почти всегда

Accuracy часто бесполезна. Свяжите precision, recall, PR-AUC, ROC-AUC или cost matrix с ценой FP/FN, порогом решения и мощностью ручной обработки.

Потренировать этот ответ

05. Как работать с пропусками и выбросами?

часто

Сначала поймите механизм и смысл: пропуск может быть сигналом или ошибкой процесса. Все правила fit-ятся только на train, а выбросы проверяются вместе с владельцем данных, не удаляются автоматически.

Потренировать этот ответ

06. Как построить baseline для ML-задачи?

почти всегда

Baseline может быть бизнес-правилом, простым статистическим прогнозом или линейной моделью. Он фиксирует полезность сложного решения и помогает обнаружить ошибку в пайплайне раньше оптимизации.

Потренировать этот ответ

07. Чем offline-метрика отличается от онлайн-эффекта?

часто

Offline измеряет качество на исторических данных, online — изменение реального поведения и системы. Расхождение возникает из-за дрейфа, feedback loop, задержек, UX и неверной прокси-метрики.

Потренировать этот ответ

08. Как объяснить модель бизнесу?

часто

Переведите метрику в цену ошибки и сценарий, покажите ограничение применимости и понятные факторы. Интерпретируемость не означает причинность; не обещайте точность за пределами проверенной выборки.

Потренировать этот ответ

09. Как подготовить данные с временной зависимостью?

часто

Соблюдайте хронологию, задайте point-in-time срез для признаков и проверьте задержку появления данных. Случайный split может создать утечку будущего в прошлое.

Потренировать этот ответ

10. Расскажите о модели, которую вы не стали внедрять.

почти всегда

Покажите критерии решения: качество против baseline, стоимость ошибок, доступность признаков, latency, поддержка или отсутствие продукта. Умение остановить невыгодное решение — сильный сигнал зрелости.

Потренировать этот ответ

04 · Практика

Практический кейс Data Scientist

Если дают задачу предсказания оттока, начните с момента предсказания, горизонта и действия после него. Затем уточните target, доступность признаков, цену ложных срабатываний и baseline — модель без действия не является решением проблемы.

Опишите временное разбиение, метрику и первый простой подход, после чего обсудите онлайн-проверку. Отдельно назовите риски: leakage, изменение поведения после вмешательства и ошибки в сборе событий.

Отвечайте из своего опыта. Подсказки, шпаргалки и AI-инструменты работают только как подсказка для собственной мысли: выдуманный опыт раскрывается первым же уточняющим вопросом.

Общая подготовка — резюме, техника, звук и демонстрация экрана — разобрана в чек-листе подготовки к онлайн-собеседованию. Как осознанно использовать AI-подсказки во время звонка — в гайде «Как использовать AI на собеседовании».

05 · FAQ

Частые вопросы

Нужны ли Data Scientist алгоритмы и структуры данных?

Базовые алгоритмы, сложность и чистый Python часто проверяют наряду с ML. Глубина зависит от компании, но умение написать и объяснить обработку данных полезно почти везде.

Чем Data Scientist отличается от ML Engineer?

Data Scientist чаще отвечает за постановку, анализ, эксперименты и качество модели; ML Engineer — за надёжное обучение и serving в production. В маленьких командах обязанности могут совмещаться.

Как показать опыт без production-модели?

Подготовьте воспроизводимый учебный или pet-проект: описание постановки, честное разбиение, baseline, метрики, ограничения и решение о внедрении. Не выдавайте учебный результат за эффект на бизнес.

Тренировка перед интервью

Репетируйте ответы вслух с Mira

Mira слышит вопрос и показывает подсказку для ответа прямо во время звонка. 30 минут бесплатно каждый месяц, банковская карта не нужна.

Начать тренировку