Заглянула одним глазком на Data Fest в офисе Яндекса

📍 Москва 🌍 Россия Другое 24.05.2026 · 👁 2 150 просмотров
Заглянула одним глазком на Data Fest в офисе Яндекса 😺 Не Москвой единой... в Белграде не очень много мероприятий такого рода (точно не столько, чтобы было по 2-3 в месяц, как у меня в сентябре прошлого года, или приходилось бы выбирать между пересекающимися), но я рада, что научилась находить то, что есть 😂 А ещё — забавный факт — я раньше не была в местном офисе 📱 (хотя раза 3 приезжала, ещё работая там). Фокус у сегодняшнего мероприятия однозначно на ML, а не на аналитике, поэтому многие доклады мне практически не понятны, но я к этому была морально готова, и расскажу хотя бы про первый: «Как безопасно выкатывать новые версии продуктовых AI-агентов через систему автометрик» 🤖 По факту вышло не буквально про это, но тоже интересно: ➡️ Спикер был из команды международного поиска Яндекса, они сейчас пытаются естественным образом совместить стандартную выдачу и ИИ-ответ. Как и раньше, основная цель — найти наиболее вероятное намерение (интент) пользователя при запросе, и ответить «хорошо» не с точки зрения какого-то абстрактного бенчмарка, а именно в плане решения задачи. Исследование запросов в Гугл пару лет назад показало, что чуть ли не половина запросов связаны с изучением товаров перед покупкой или непосредственно желанием что-то купить. Но если вы спросите у ChatGPT что-то вроде «хочу купить айфон в Белграде», она выдаст общую инфу о том, какие бывают айфоны и авторизованные реселлеры, по сути отправив нас в ТЦ 🤓 Как-то не современно, когда в Яндексе уже буквально на выдаче есть кнопки для cравнения цен и заказа в пару кликов... ➡️ Одна из центральных мыслей доклада: никакой магии, LLM, как и раньше, генерирует токен за токеном. Но в эпоху агентов финальный успех зависит не только от качества модели, но и от промпта с тулами ➡️ Теперь к основной тематике: как вообще определить, что AI-агент в продукте достоин того, чтобы выкатиться в прод? Решают всё те же три кита качества поиска: 🐋 насколько ответ полезен для решения задачи пользователя, 🐋 подтверждается ли ответ извлечёнными документами, 🐋 насколько самим этим источникам можно доверять? ➡️ А если говорить о сравнении версий, то A/B-тестирование, конечно, представлено, но статзначимость не равносильна важности изменения (метрика может значимо просесть на долю процента, и это не блокер, но на значимость всё же смотрят, чтобы отличить реальный сигнал от шума) . ➡️ Кроме того, используются автоматические метрики (наличие уточняющих вопросов, качество показанных медиа и форматирования текста) и технические (количество токенов, доля пустых ответов и так далее) ➡️ И, наконец, моё любимое — разметки релевантности ответов и следования сценариям. Утверждается, что они сейчас не только попарные (хотя LLM-судьи могут плохо калибровать оценки в разных версиях, и условно 4/5 будет значить разное ) и не только человеческие — используется LLM-as-a-judge 📈 В общем, Яндекс как всегда радует тем, что и успевает за технологическими трендами (или даже их задаёт), но при этом приятно, что общие идеи того, как улучшают Поиск, всё те же. Продолжаю наблюдение 👀 @analytess 👩
Откликнуться в Telegram →

⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.

🇮🇱 Не нашли подходящую зарплату? В Израиле платят от $3000 Без языка и опыта · жильё и легализация под ключ · официально Смотреть вакансии →