Все профессии

Подготовка к собеседованию

Data Scientist: вопросы и ответы на собеседовании

Подборка вопросов по вероятности, моделям машинного обучения, валидации и экспериментам.

Математика и статистика

3 вопросов
Что такое переобучение?junior

Модель запоминает особенности обучающей выборки и плохо обобщает на новые данные. Помогают регуляризация, больше данных, упрощение модели и корректная кросс-валидация.

Почему корреляция не означает причинность?junior

Две величины могут изменяться вместе из-за скрытого фактора, обратного влияния или случайности. Причинный вывод требует дизайна эксперимента или дополнительных предположений.

Что такое bias и variance?middle

Bias — систематическая ошибка слишком простой модели, variance — чувствительность к конкретной выборке. Баланс между ними определяет обобщающую способность модели.

Машинное обучение

4 вопросов
Чем L1 отличается от L2-регуляризации?middle

L1 добавляет сумму модулей весов и может занулять часть признаков. L2 штрафует квадраты весов и обычно равномерно уменьшает их величины.

Как бороться с дисбалансом классов?middle

Смотрят precision, recall, F1 и PR-AUC вместо одной accuracy, настраивают порог, веса классов и sampling. Важно сохранять реалистичное распределение в валидации.

Когда использовать precision, а когда recall?junior

Precision важен, если ложное срабатывание дорого, recall — если опасен пропуск положительного случая. Выбор зависит от стоимости ошибок и обычно дополняется анализом порога.

Зачем масштабировать признаки?junior

Масштабирование выравнивает вклад признаков для методов, основанных на расстояниях или градиенте. Для деревьев решений оно обычно не требуется.

Оценка моделей

3 вопросов
Почему нельзя подбирать модель по test set?junior

Test set нужен для финальной независимой оценки. Если многократно смотреть на него при выборе признаков и гиперпараметров, он начинает участвовать в обучении и завышает ожидания.

Что проверять перед запуском модели?senior

Качество на срезах, устойчивость к drift, задержку и стоимость инференса, мониторинг входов и предсказаний, fallback и план переобучения. Метрики должны быть связаны с бизнес-эффектом.

Как разделять временные данные?middle

Нельзя перемешивать будущее с прошлым, если модель работает во времени. Используют time-based split или walk-forward validation, сохраняя порядок наблюдений.

Как использовать этот список

Сначала ответьте своими словами, затем раскройте пояснение. Отдельно подготовьте примеры из проектов: на собеседовании важно не только знать определение, но и объяснить, где вы применяли подход на практике.

Посмотреть другие профессии →