Слив протокола на Data Science Яндекс
Слив протокола на Data Science Яндекс
В Яндексе есть несколько видов аналитиков, один из них Data Scientist, который должен разбирать не только в аналитическом стеке (АВ тесты, метрики, дашборды), но и в МЛ стеке. А
наши выпускники
не только сейчас активно проходят собесы, но и уже давно закрепились в штате и проводят собесы. Поэтому сегодня обсудим протокол проведения собесов на эту специальность.
1)
Как и обычно, каждая секция начинается со вступления - перетягивать не нужно, просто представиться, уточнить, все ли слышно, все ли видно
~
2 минуты
.
2)
Разумеется, каждая секция включает в себя знакомство с кандидатом:
a) Обычно спрашивают про работу (если опыта нет - учебу)
- что больше всего нравится / не нравится? (например, в работе / какие задачи / алгоритмы ML / курсы)
- какие проблемы возникали - как решались?
- что полезного удалось сделать? (для себя / мира)
б) Если область близка - задается короткий вопрос на понимание:
- как решали такой-то бизнес-кейс?
- как модифицировать решение, чтобы оно умело еще то-то?
- чем обосновывается выбранное решение? оценивалась ли эффективность? как?
3)
Задача на ML-алгоритмический кругозор кандидата + скорость размышлений
~
25 мин
Таймлайны примерно такие:
a) Формулирование задачи ~5 мин (тут от аналитика ждут обычно то, какие цели оптимизируем (удобство пользователей, удобство магазинов, выручка маркетплейса), какие данные и источники можно использовать, какие сложности со сбором/качеством/доступностью данных).
б) Верхнеуровневый подход к решению ~ 5 мин (описать схему решения с обоснованием, посмотреть в сторону альтернативных вариантов).
в) Формулы и детали ~ 5 мин (проверяют, насколько кандидат понимает матчасть и детали ML - обычно просят словами описать целевую функцию и возможные альтернативы (часто маркер: logloss), как именно будем оптимизировать (градиентный спуск, что означает “взять производную”), как боремся с переобучением (регуляризация и другие приёмы), затем просим объяснить механику выбранного метода (градиентный бустинг/бэкпроп/линейная регрессия и т.п.), а если ML слабый - уходим в базу вроде регрессии, k-means или PCA).
г) АБ-эксперименты, статзначимость ~ 5 мин (тут часто говорят про базовые принципы и кругозор (оценка качества решения от оффлайна до пользовательских исследований), аккуратно подводят к A/B (если сам не назвал — объясняется принцип), обсуждается как принимать решение по эксперименту (почему нельзя “по первым моментам”, нужны статистические оценки), какие бывают тесты (вплоть до Манна–Уитни) и как оценивать риск ошибки/строить доверительные интервалы (если успеваем).
4)
Мат-скиллы
~ 20 мин:
а) Обычно тут хотят посмотреть, как кандидат соображает + рассуждает, оценить его навыки работы с вероятностью, статистикой, комбинаторикой на практике. (Несложные задачи. Кроме чисто теоретических задач, могут предложить задачи на численный подсчет какой-нибудь вероятности)
5)
Заключение и вопросы от кандидата
- остаток времени.
Теперь давайте посмотрим на задачи:
Из пункта 3:
Продумать решение для бустинга товаров:
с высокими ставками
с высоким рейтингом
из хороших магазинов
Из пункта 4:
Есть два кубика (красный и синий) и банк, в котором на старте лежит 0 рублей.
Перед началом каждого раунда можно выбрать: или забрать банк и уйти (выигрыш будет равен сумме в банке), или кинуть кубики.
Если бросаем кубики, то: если на синем кубике выпадает 1, банк обнуляется и игра заканчивается (т.е. выигрыш равен нулю). Если на синем кубике не 1, то в банк добавляется количество рублей, равное сумме чисел на двух кубиках.
Необходимо придумать стратегию максимизации выигрыша.
Вообще сейчас идет тренд на гибридных специалистов, которые разбираются сразу в нескольких областей. Всему виной активное внедрение ИИ, оптимизации бюджетов внутри компании. Так, например, на аналитика уже недостаточно быть чисто аналитиком - нужно разбираться в МЛ. Аналогично для МЛ недостаточно просто знать классические алгоритмы и писать fit-predict, нужно копаться в архитектуре, выступать в роли а
Откликнуться в Telegram →
⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.