Что спрашивают про трансформеры на собесах в 2026 году
Что спрашивают про трансформеры на собесах в 2026 году
Собрал вопросы по горячим следам: с собесов
наших студентов
, чтобы вы знали к чему готовиться.
1. Предобработка: BPE и тд
Эти вопросы чаще летят в ML Ops или в ML SWE, но и чистым моделистам тоже могут прилететь. Суть реализовать какой-нибудь пайплайн обработки данных. Самый частый гость токенизация через BPE.
BPE красивый и интуитивный алгоритм, но реализация требует возни со словарями, списками и краевыми случаями.
2. Классика: написать self-attention на NumPy
Удивительно, но задача «напишите ванильный self-attention» до сих пор жива. Причём в том же виде, что и пару лет назад. И, что ещё удивительнее, многие кандидаты с ней не справляются.
Но суть не в том, чтобы просто написать код. Это только повод для дискуссии. Дальше начинаются детали:
• зачем вообще нормировать QK на корень из размерности?
• как сделать softmax стабильным численно?
• как посчитать Q, K, V одной матричной операцией?
3. Сэмплинг
Greedy Decoding - это для дебага. В продакшне используют вероятностные методы, и интервьюеры это знают. Поэтому сейчас часто спрашивают про стратегии сэмплинга.
Самый популярный вариант: top-p. Хорошие примеры реализации можно найти на разных ресурсах (например, ComfyAI, там вообще кладезь). Кстати, полезно уверенно владеть матричными фреймворками: Torch, NumPy, JAX. Чтобы если попросят реализовать что-то нестандартное (типа min-p), не растеряться.
4. Inference Loop
Здесь проверяют, как вы взаимодействуете с архитектурой модели на уровне тензоров. На вход: тензоры, на выход — тензоры. Но есть нюансы: надо хранить кэш, логиты, ещё что-то.
Это требует детального понимания того, как трансформер работает внутри. Полезно порешать похожие задачи на специализированных платформах (например, NeetCode). Там есть задачи и про GPT.
5. ML Debugging
Самый свежий формат. Вам дают ноутбук с кодом нейросети или пайплайном и просят найти баги. Всё.
Я встречал такой формат в зарубежных бигтехах. Дали код GPT2, где было сломано буквально всё: модель выдавала NaN на второй итерации. Надо было поправить и добиться адекватного падения лосса. Другой кейс — модель выдавала разные ответы на одни и те же входы. Надо было найти все источники недетерминированности.
Еще больше вопрос в нашем открытом банке собесов и тестовых заданий: смотрите на
сайте
.
Подписаться:
@zadachi_ds
Откликнуться в Telegram →
⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.