Как я полностью пересобрал свой стек ИИ-агентов для поиска работы. Часть 2. Модели.

IT и разработка 30.09.2026 · 👁 597 просмотров
Как я полностью пересобрал свой стек ИИ-агентов для поиска работы. Часть 2. Модели. С момента запуска моего продукта ID Agent в апреле, весь мой стек держался на 2 моделях: Claude Opus и Sonnet. Качество меня устраивало. Первое время. Когда клинетов стало много, то вылезли первые проблемы. Вот 3 основные. 1️⃣ Первая, цена и количество токенов . У каждого клиента агент каждый день собирал сотни новых вакансий, под каждую адаптировалось резюме и сообщения рекрутерам. Гонять весь этот объём через флагманскую модель быстро становится дорого. Моей подписки Claude за 200 долларов просто не хватало уже на всех клиентов и на все процессы. 2️⃣ Вторая, зависимость от одного провайдера. Недельные лимиты, сбои в работе Сlaude, глюки модели, и встаёт вся работа. Так себе история, если я это продаю, как сервис. 3️⃣ Третью я заметил позже остальных. Одна и та же модель писала код и сама же его проверяла. Собственные ошибки модель видит плохо. Это как разработчик, который пишет код и сам делает ревью - никто не будет свидетельствовать против себя. С моделями такая же история. Это база для любой разраотки, но я это понял не сразу. Вообщем, класть все яйца в одну корзину, даже самую дорогу, была так себе идея. Что я сделал дальше? Я собрал свой бенчмарк на реальных задачах продукта. Туда вошли поиск и оценка вакансий под стратегию клиента, адаптация резюме без выдуманных фактов, аутрич-сообщения рекрутёрам, поиск контактов в рекрутинговых агентствах и ревью кода. Через него прошли 25 моделей (через API ключ на OpenRouter), от самых дешёвых до самых дорогих: все семейство Claude, все модели GPT, включая gpt-oss-20b, все модели GLM, DeepSeek V4 Flash и V4 Pro, Google Gemini 2.5 Flash Lite, 3.7 Flash и Pro, Kimi K3, Grok 4.6 и Nemotron 3 Ultra. Даже скачал и протестировал локально Qwen 3.6 на 36B MoE, Qwen 3.8 27B и GLM 4.7 Flash. Первый вывод: на конкретной задаче дорогая модель спокойно проигрывает дешёвой. Флагман ещё и любит «улучшить» то, что трогать было нельзя. Второй вывод меня удивил. Иногда настройки важнее самой модели. На ревью кода одна и та же модель без режима размышления пропустила 7 заложенных багов из 15. С минимальным размышлением пропустила 2. Что в итоге и как распределены роли сейчас? 🔸 Claude Opus 5.5, стратег . Анализ рынка, мастер-резюме, профиль LinkedIn, самопрезентация. Ошибка здесь стоит дороже всего, а объём небольшой. 🔸 GLM 5.3, инженер. Онбординг новых клиентов и новый дашборд. 🔸 GLM 5.3 Flash, рабочая лошадка. Ищет вакансии, адаптирует резюме, готовит аутрич, находит контакты в рекрутинговых агентствах вместе с email и пишет посты о поиске работы. Это основной объём, поэтому здесь всё решает цена одной задачи. 🔸 GOT Sol 5.6 Max и GPT Astra 6, независимые аудиторы. Ревьюят каждое изменение в коде и регулярно проводят аудит. Это модели другого провайдера, в написании кода они не участвуют. 🔸 GPT-4.1 и GPT-5.6 Luna, AI-чат для клиента. Разбирают вакансии и резюме. Luna, кстати, отлично пишет сопроводительные письма на русском. Логика простая. Задачи разнесены между разными провайдерами, чтобы сбой одного не останавливал всё. И код никогда не проверяет та же модель, которая его писала. В следующем посте расскажу, как я их ловил и почему теперь каждое изменение проходит через двух независимых ревьюеров и автотесты. Stay tuned 😉
Откликнуться в Telegram →

⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.

🇮🇱 Не нашли подходящую зарплату? В Израиле платят от $3000 Без языка и опыта · жильё и легализация под ключ · официально Смотреть вакансии →