Я провёл 100 раундов слепых тестов, чтобы выбрать модели для своих агентов. Не по бенчмаркам, а на своих реаль…

Другое 25.08.2026 · 👁 659 просмотров
Я провёл 100 раундов слепых тестов, чтобы выбрать модели для своих агентов. Не по бенчмаркам, а на своих реальных задачах. Получилось 10 моделей на 6 задачах для 20 агентов. Смысл в том, что «лучшая модель» вообще не существует. Это я понял спустя недею тестов. Есть лучшая модель под конкретный шаг конвейера, и это как правило разные модели. Почему слепые тесты, а не бенчмарки? Публичные бенчмарки меряют не то, что делают мои агенты. Модель может блестяще решать олимпиадные задачи и при этом хуже переписывать раздел резюме под ATS. Поэтому я брал настоящие задачи, прогонял через разные модели, закрывал названия и оценивал результат вслепую. Иначе неизбежно тянет поставить оценку повыше той модели, в которую ты уже поверил. Что в итоге где стоит? 🔹 Анализ рынка, позиционирование, стратегия, портфолио, питч дек. Claude Opus 5. Самая дорогая часть стека, но здесь важна не скорость, а качество решения. На этом же маршруте живой диалог: 8 классов конфиденциальности против 4 у ближайшего конкурента. 🔹 Адаптация резюме и каверов . Claude Sonnet 5. Когда есть четкие правила и последовательность, соннет - лучшая и недорогая модель. 🔹 Скоринг и гейты. Тут интереснее всего. Рекомендую GLM-5.2: он в 5-10 раз дешевле при сопоставимом качестве на этой задаче по сравнению с сонет. Рядом протестированы DeepSeek V4 Pro, который дешевле в 28 раз, и Gemini 3.7 Flash, отработавший чисто 3 раунда из 4. Дипски показал себя очень хорошо (пилотирую на одном клиенте), Gemini - не очень. Claude Haiku 4.5 на этом этапе провалил gap-tier, хотя в других сценариях модель отличная. 🔹 Сбор аналитики на основе воронки поиска + задачи по рассписанию. DeepSeek Flash, самый дешёвый вариант из всех, асинхронный батч работает нормально. Kimi-k3 пока не готов: обрезает ответы (да она и избыточная для таких задач). 🔹 Сейчас актино тестирую GLM-5.3 - недавно появился API на OpenRouter (подписка уже оформлена). 🔹 Отдельно тестировал локальный Qwen 3.6 latest и нашумевший ox Alpha. Локальные модели проверяю не ради экономии, а ради вопроса, куда уходят данные клиента. Скорость и стоимость - шикарные, но Qwen 3.6 очень много врет в адаптации резюме, а вот Альфа как раз оказалась лучше Опуса (кандидат на попадание в основной стек). Проверка фактов вообще не доверена языковой модели. Сверка цифр, дат и тайтлов между резюме, LinkedIn и портфолио сделана детерминированным кодом. Нельзя поручать проверку той же системе, которая генерирует: она уверенно подтвердит собственную ошибку. Вывод, который я вынес по итогу. Платите за дорогую модель только там, где нужно суждение. Всё, что похоже на обработку потока — скоринг, батчи, черновики — уводите на дешёвые модели, разница в 10-28 раз реальна и качество на этих задачах не проседает. А главная работа не в выборе модели, а в маршрутизации между ними. Все спорят, какая лучше. В проде выигрывает тот, кто правильно распределил задачи. Раз в месяц прогоняю тесты заново. Модели обновляются быстрее, чем успевает устояться любое мнение о них. Все подрбности тут - https://www.idagent.pro/ А вы под свои задачи как выбираете модель — по бенчмаркам или тестируете на своём? 😉
Откликнуться в Telegram →

⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.

🇮🇱 Не нашли подходящую зарплату? В Израиле платят от $3000 Без языка и опыта · жильё и легализация под ключ · официально Смотреть вакансии →