Подготовка к собеседованию
Data Scientist: вопросы и ответы на собеседовании
Подборка вопросов по вероятности, моделям машинного обучения, валидации и экспериментам.
Математика и статистика
3 вопросовЧто такое переобучение?junior
Модель запоминает особенности обучающей выборки и плохо обобщает на новые данные. Помогают регуляризация, больше данных, упрощение модели и корректная кросс-валидация.
Почему корреляция не означает причинность?junior
Две величины могут изменяться вместе из-за скрытого фактора, обратного влияния или случайности. Причинный вывод требует дизайна эксперимента или дополнительных предположений.
Что такое bias и variance?middle
Bias — систематическая ошибка слишком простой модели, variance — чувствительность к конкретной выборке. Баланс между ними определяет обобщающую способность модели.
Машинное обучение
4 вопросовЧем L1 отличается от L2-регуляризации?middle
L1 добавляет сумму модулей весов и может занулять часть признаков. L2 штрафует квадраты весов и обычно равномерно уменьшает их величины.
Как бороться с дисбалансом классов?middle
Смотрят precision, recall, F1 и PR-AUC вместо одной accuracy, настраивают порог, веса классов и sampling. Важно сохранять реалистичное распределение в валидации.
Когда использовать precision, а когда recall?junior
Precision важен, если ложное срабатывание дорого, recall — если опасен пропуск положительного случая. Выбор зависит от стоимости ошибок и обычно дополняется анализом порога.
Зачем масштабировать признаки?junior
Масштабирование выравнивает вклад признаков для методов, основанных на расстояниях или градиенте. Для деревьев решений оно обычно не требуется.
Оценка моделей
3 вопросовПочему нельзя подбирать модель по test set?junior
Test set нужен для финальной независимой оценки. Если многократно смотреть на него при выборе признаков и гиперпараметров, он начинает участвовать в обучении и завышает ожидания.
Что проверять перед запуском модели?senior
Качество на срезах, устойчивость к drift, задержку и стоимость инференса, мониторинг входов и предсказаний, fallback и план переобучения. Метрики должны быть связаны с бизнес-эффектом.
Как разделять временные данные?middle
Нельзя перемешивать будущее с прошлым, если модель работает во времени. Используют time-based split или walk-forward validation, сохраняя порядок наблюдений.
Как использовать этот список
Сначала ответьте своими словами, затем раскройте пояснение. Отдельно подготовьте примеры из проектов: на собеседовании важно не только знать определение, но и объяснить, где вы применяли подход на практике.
Посмотреть другие профессии →