Я провёл 100 раундов слепых тестов, чтобы выбрать модели для своих агентов. Не по бенчмаркам, а на своих реаль…
Я провёл 100 раундов слепых тестов, чтобы выбрать модели для своих агентов. Не по бенчмаркам, а на своих реальных задачах.
Получилось 10 моделей на 6 задачах для 20 агентов.
Смысл в том, что «лучшая модель» вообще не существует.
Это я понял спустя недею тестов.
Есть лучшая модель под конкретный шаг конвейера, и это как правило разные модели.
Почему слепые тесты, а не бенчмарки?
Публичные бенчмарки меряют не то, что делают мои агенты. Модель может блестяще решать олимпиадные задачи и при этом хуже переписывать раздел резюме под ATS. Поэтому я брал настоящие задачи, прогонял через разные модели, закрывал названия и оценивал результат вслепую.
Иначе неизбежно тянет поставить оценку повыше той модели, в которую ты уже поверил.
Что в итоге где стоит?
🔹
Анализ рынка, позиционирование, стратегия, портфолио, питч дек.
Claude Opus 5. Самая дорогая часть стека, но здесь важна не скорость, а качество решения. На этом же маршруте живой диалог: 8 классов конфиденциальности против 4 у ближайшего конкурента.
🔹
Адаптация резюме и каверов
. Claude Sonnet 5. Когда есть четкие правила и последовательность, соннет - лучшая и недорогая модель.
🔹
Скоринг и гейты.
Тут интереснее всего. Рекомендую GLM-5.2: он в 5-10 раз дешевле при сопоставимом качестве на этой задаче по сравнению с сонет. Рядом протестированы DeepSeek V4 Pro, который дешевле в 28 раз, и Gemini 3.7 Flash, отработавший чисто 3 раунда из 4. Дипски показал себя очень хорошо (пилотирую на одном клиенте), Gemini - не очень. Claude Haiku 4.5 на этом этапе провалил gap-tier, хотя в других сценариях модель отличная.
🔹
Сбор аналитики на основе воронки поиска + задачи по рассписанию.
DeepSeek Flash, самый дешёвый вариант из всех, асинхронный батч работает нормально. Kimi-k3 пока не готов: обрезает ответы (да она и избыточная для таких задач).
🔹
Сейчас актино тестирую GLM-5.3
- недавно появился API на OpenRouter (подписка уже оформлена).
🔹
Отдельно тестировал локальный Qwen 3.6 latest и нашумевший ox Alpha.
Локальные модели проверяю не ради экономии, а ради вопроса, куда уходят данные клиента. Скорость и стоимость - шикарные, но Qwen 3.6 очень много врет в адаптации резюме, а вот Альфа как раз оказалась лучше Опуса (кандидат на попадание в основной стек).
Проверка фактов вообще не доверена языковой модели.
Сверка цифр, дат и тайтлов между резюме, LinkedIn и портфолио сделана детерминированным кодом.
Нельзя поручать проверку той же системе, которая генерирует: она уверенно подтвердит собственную ошибку.
Вывод, который я вынес по итогу.
Платите за дорогую модель только там, где нужно суждение.
Всё, что похоже на обработку потока — скоринг, батчи, черновики — уводите на дешёвые модели, разница в 10-28 раз реальна и качество на этих задачах не проседает.
А главная работа не в выборе модели, а в маршрутизации между ними.
Все спорят, какая лучше. В проде выигрывает тот, кто правильно распределил задачи.
Раз в месяц прогоняю тесты заново. Модели обновляются быстрее, чем успевает устояться любое мнение о них.
Все подрбности тут -
https://www.idagent.pro/
А вы под свои задачи как выбираете модель — по бенчмаркам или тестируете на своём?
😉
Откликнуться в Telegram →
⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.