Привет! Недавно мы уже говорили с вами о замечательном месте — AIRI. Давайте освежим в памяти, что это такое и…

Другое 17.05.2026 · 👁 5 010 просмотров
Привет! Недавно мы уже говорили с вами о замечательном месте — AIRI. Давайте освежим в памяти, что это такое и как туда отбираются. AIRI — топовый институт искусственного интеллекта, который занимается исследованиями в самых разных областях: медицина, биоинформатика, оптимизация, эффективное обучение (Triton kernels, speculative decoding и т. д.), LLM, NLP, CV. На мой взгляд, это, возможно, сильнейший научный центр по ИИ в СНГ. Например, на прошедший ICLR в Бразилии ребята отправили около 31 статьи — знатоки в комментариях, поправьте меня, если ошибаюсь. Все эти факты, конечно, привлекают ресерчеров. Я считаю, что именно в AI Research всё ещё очень много неизведанного и интересного — того, за счёт чего хочется постоянно развиваться. Так почему бы не попробовать туда попасть? Вообще, AIRI в большей степени нацелен на уже более-менее состоявшихся в академическом плане ресерчеров. Там много кандидатов наук или хотя бы магистров, аспирантов, но я решил испытать свои силы, будучи на 4-м курсе бакалавриата. Как проходил отбор? Не-технические скрининги я опущу. Технический скрининг Я созвонился с уважаемым учёным — Василием Коноваловым, известным ресерчером из DeepPavlov, МФТИ, а ныне AIRI. Меня спрашивали про эффективное обучение: как бороться с длинными контекстами и правильно распределять нагрузку. Я предложил стандартный вариант шардирования и на коленке придумал бить каждый контекст на батчи. Как я понял уже после собеседования, от меня хотели услышать про Chunked Prefill / Continuous Batching. Далее мы поговорили про методы генерации текста: beam search, top-k. Потом меня неочевидно спросили про nucleus sampling, которым я, конечно, всегда пользовался на работе, но теоретически не знал, как он устроен. Позже меня очень верхнеуровнево спросили про отличие DPO от PPO — с этим я справился. Техническое собеседование Тут было уже сложнее: собеседовал меня Алексей Скрынник — топовый RL-ресерчер. Началось всё с базы: отличие Off-Policy от On-Policy. Я показал разницу на примере Q-Learning и SARSA, но немного замешкался, когда говорил про epsilon-greedy. Забыл, что фактически этот exploration есть в обоих алгоритмах: отличие лишь в том, что в Off-Policy мы берём максимум, а в On-Policy-вариации сэмплируем из (s, a)). Далее меня спросили, как повысить exploration у LLM при генерации роллаутов в GRPO/PPO. Я ответил, что, как вариант, можно делать сэмплирование с температурой, а также добавлять энтропию в rewards. В целом такой ответ мне засчитали. Потом я рассказал весь алгоритм PPO, его связь с TRPO и зачем в PPO нужен clipping. Тут Алексей меня немного опередил, потому что я не совсем чётко сформулировал ответ, хотя по сути клиппинг нужен, чтобы градиент не тёк за пределами заданных значений. Это мне зачли как большой плюс, потому что с ходу тяжело рассказать всё вплоть до того, как выглядит градиент. Спасибо Паше Темирчеву и курсу RL в ШАД :) Фидбек — Middle- В фидбеке довольно странно написали, что я не особо хорошо пишу код, хотя про это мы говорили только в контексте того, пользовался ли я verl . Отметили, что рассуждения у меня на высоком уровне, но для более высокого грейда нужны статьи на main track конференций — пока у меня только воркшопы. Приглашение в команду было, но пока этот момент у меня под вопросом. Я всегда советую пробовать что-то новое и копать вглубь, а не в ширину. Всем удачи на вашем пути и на собеседованиях. Хороших выходных и до скорых встреч! @zadachi_ds
Откликнуться в Telegram →

⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.

🇮🇱 Не нашли подходящую зарплату? В Израиле платят от $3000 Без языка и опыта · жильё и легализация под ключ · официально Смотреть вакансии →