Вопрос на собеседовании · Data Scientist
Что такое bias и variance и как найти баланс?
Короткий ответ, ключевые тезисы и ошибки, которых стоит избежать на интервью.
Bias — систематическая ошибка модели: слишком простая гипотеза или слабые признаки не улавливают закономерность даже на train. Variance — чувствительность к конкретной обучающей выборке: модель показывает отличный train-результат, но плохо переносится на новые данные. Это полезная модель диагностики, а не повод выбирать сложный алгоритм по умолчанию.
Смотрят на train и validation-кривые, качество baseline и объём данных. Высокий bias уменьшают улучшением признаков, модели или постановки; высокий variance — регуляризацией, упрощением, большим объёмом данных или честной валидацией. Изменение подтверждают на отложенном test после выбора подхода.
01 · Структура ответа
Что важно сказать интервьюеру
Начните с определения, затем объясните механизм и закончите примером из практики. Для полного ответа раскройте эти тезисы:
02 · Пример
Как объяснить на практике
Линейная модель прогноза спроса одинаково слаба на train и validation — сначала проверяют постановку и добавляют сезонные признаки. Глубокое дерево почти идеально на train, но падает на validation — ограничивают глубину и проверяют временное разбиение.
Не заучивайте формулировку дословно. Свяжите принцип с задачей из собственного проекта — интервьюер почти наверняка попросит уточнить детали реализации и компромиссы.
03 · Ошибки
Чего избегать в ответе
04 · Углубление
Что могут спросить следом
- Как регуляризация влияет на bias?
- Что показывают learning curves?
- Когда нужен ensemble?
Практика ответа
Ответьте вслух, а не про себя
Откроем тренировку сразу на этом вопросе. Выберите грейд, сформулируйте ответ и сравните его с подсказкой.
Mira