Заглянула одним глазком на Data Fest в офисе Яндекса
Заглянула одним глазком на Data Fest в офисе Яндекса
😺
Не Москвой единой... в Белграде не очень много мероприятий такого рода (точно не столько, чтобы было по 2-3 в месяц, как у меня в сентябре прошлого года, или приходилось бы выбирать между пересекающимися), но я рада, что научилась находить то, что есть
😂
А ещё — забавный факт — я раньше не была в местном офисе
📱
(хотя раза 3 приезжала, ещё работая там).
Фокус у сегодняшнего мероприятия однозначно на ML, а не на аналитике, поэтому многие доклады мне практически не понятны, но я к этому была морально готова, и расскажу хотя бы про первый:
«Как безопасно выкатывать новые версии продуктовых AI-агентов через систему автометрик»
🤖
По факту вышло не буквально про это, но тоже интересно:
➡️
Спикер был из команды международного поиска Яндекса, они сейчас пытаются естественным образом совместить стандартную выдачу и ИИ-ответ. Как и раньше, основная цель — найти наиболее вероятное намерение (интент) пользователя при запросе, и ответить «хорошо» не с точки зрения какого-то абстрактного бенчмарка, а именно в плане решения задачи.
Исследование запросов в Гугл пару лет назад показало, что чуть ли не половина запросов связаны с изучением товаров перед покупкой или непосредственно желанием что-то купить. Но если вы спросите у ChatGPT что-то вроде «хочу купить айфон в Белграде», она выдаст общую инфу о том, какие бывают айфоны и авторизованные реселлеры, по сути отправив нас в ТЦ
🤓
Как-то не современно, когда в Яндексе уже буквально на выдаче есть кнопки для cравнения цен и заказа в пару кликов...
➡️
Одна из центральных мыслей доклада:
никакой магии, LLM, как и раньше, генерирует токен за токеном. Но в эпоху агентов финальный успех зависит не только от качества модели, но и от промпта с тулами
➡️
Теперь к основной тематике: как вообще определить, что AI-агент в продукте достоин того, чтобы выкатиться в прод?
Решают всё те же три кита качества поиска:
🐋
насколько ответ полезен для решения задачи пользователя,
🐋
подтверждается ли ответ извлечёнными документами,
🐋
насколько самим этим источникам можно доверять?
➡️
А если говорить о сравнении версий, то A/B-тестирование, конечно, представлено, но статзначимость не равносильна важности изменения
(метрика может значимо просесть на долю процента, и это не блокер, но на значимость всё же смотрят, чтобы отличить реальный сигнал от шума)
.
➡️
Кроме того, используются автоматические метрики
(наличие уточняющих вопросов, качество показанных медиа и форматирования текста)
и технические
(количество токенов, доля пустых ответов и так далее)
➡️
И, наконец, моё любимое — разметки релевантности ответов и следования сценариям. Утверждается, что они сейчас не только попарные
(хотя LLM-судьи могут плохо калибровать оценки в разных версиях, и условно 4/5 будет значить разное
)
и не только человеческие — используется
LLM-as-a-judge
📈
В общем, Яндекс как всегда радует тем, что и успевает за технологическими трендами (или даже их задаёт), но при этом приятно, что общие идеи того, как улучшают Поиск, всё те же.
Продолжаю наблюдение
👀
@analytess
👩
Откликнуться в Telegram →
⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.