Как я полностью пересобрал свой стек ИИ-агентов для поиска работы. Часть 2. Модели.
Как я полностью пересобрал свой стек ИИ-агентов для поиска работы. Часть 2. Модели.
С момента запуска моего продукта ID Agent в апреле, весь мой стек держался на 2 моделях: Claude Opus и Sonnet. Качество меня устраивало. Первое время. Когда клинетов стало много, то вылезли первые проблемы.
Вот 3 основные.
1️⃣
Первая, цена и количество токенов
. У каждого клиента агент каждый день собирал сотни новых вакансий, под каждую адаптировалось резюме и сообщения рекрутерам. Гонять весь этот объём через флагманскую модель быстро становится дорого. Моей подписки Claude за 200 долларов просто не хватало уже на всех клиентов и на все процессы.
2️⃣
Вторая, зависимость от одного провайдера.
Недельные лимиты, сбои в работе Сlaude, глюки модели, и встаёт вся работа. Так себе история, если я это продаю, как сервис.
3️⃣
Третью я заметил позже остальных.
Одна и та же модель писала код и сама же его проверяла. Собственные ошибки модель видит плохо. Это как разработчик, который пишет код и сам делает ревью - никто не будет свидетельствовать против себя. С моделями такая же история. Это база для любой разраотки, но я это понял не сразу.
Вообщем, класть все яйца в одну корзину, даже самую дорогу, была так себе идея.
Что я сделал дальше?
Я собрал свой бенчмарк на реальных задачах продукта.
Туда вошли поиск и оценка вакансий под стратегию клиента, адаптация резюме без выдуманных фактов, аутрич-сообщения рекрутёрам, поиск контактов в рекрутинговых агентствах и ревью кода.
Через него прошли 25 моделей (через API ключ на OpenRouter), от самых дешёвых до самых дорогих: все семейство Claude, все модели GPT, включая gpt-oss-20b, все модели GLM, DeepSeek V4 Flash и V4 Pro, Google Gemini 2.5 Flash Lite, 3.7 Flash и Pro, Kimi K3, Grok 4.6 и Nemotron 3 Ultra.
Даже скачал и протестировал локально
Qwen 3.6 на 36B MoE, Qwen 3.8 27B и GLM 4.7 Flash.
Первый вывод:
на конкретной задаче дорогая модель спокойно проигрывает дешёвой. Флагман ещё и любит «улучшить» то, что трогать было нельзя.
Второй вывод меня удивил.
Иногда настройки важнее самой модели. На ревью кода одна и та же модель без режима размышления пропустила 7 заложенных багов из 15. С минимальным размышлением пропустила 2.
Что в итоге и как распределены роли сейчас?
🔸
Claude Opus 5.5, стратег
. Анализ рынка, мастер-резюме, профиль LinkedIn, самопрезентация. Ошибка здесь стоит дороже всего, а объём небольшой.
🔸
GLM 5.3, инженер.
Онбординг новых клиентов и новый дашборд.
🔸
GLM 5.3 Flash, рабочая лошадка.
Ищет вакансии, адаптирует резюме, готовит аутрич, находит контакты в рекрутинговых агентствах вместе с email и пишет посты о поиске работы. Это основной объём, поэтому здесь всё решает цена одной задачи.
🔸
GOT Sol 5.6 Max и GPT Astra 6, независимые аудиторы. Ревьюят каждое изменение в коде и регулярно проводят аудит. Это модели другого провайдера, в написании кода они не участвуют.
🔸
GPT-4.1 и GPT-5.6 Luna, AI-чат для клиента. Разбирают вакансии и резюме. Luna, кстати, отлично пишет сопроводительные письма на русском.
Логика простая.
Задачи разнесены между разными провайдерами, чтобы сбой одного не останавливал всё.
И код никогда не проверяет та же модель, которая его писала.
В следующем посте расскажу,
как я их ловил и почему теперь каждое изменение проходит через двух независимых ревьюеров и автотесты.
Stay tuned
😉
Откликнуться в Telegram →
⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.