Я прогнал 19 моделей по своим тактическим задачам. Самая дорогая проиграла дешёвой: 90,2 против 98,2 балла. Я …
Я прогнал 19 моделей по своим тактическим задачам. Самая дорогая проиграла дешёвой: 90,2 против 98,2 балла. Я долго не верил и пошёл разбираться, на чём именно она теряла.
Каждые 2 недели выходят новые LLM, которые я
тестирую для своего стека ID Agent
- поиск вакансий, адаптация резюме, подготовка к собесам и прочее. Причем все делается для разных рынков - от России и Грузии до Канады и Франции. У меня есть свой бенчмарк и несколько десятков кейсов через которые я прогоняю каждую модель.
Сначала как я считаю?
Задачи взял свои реальные: адаптировать резюме под вакансию, оценить вакансию, написать письмо рекрутёру. Оценка ставится на основе поиска выдуманных факто, отсутствия ИИ слопа, структуры, покрытия ключевыми словами.
Кого гонял?
🔸
От
Anthropic
: Sonnet 5 как baseline на полном стеке из 14 задач, Opus, Haiku 4.5 и новая Fable 5.1.
🔸
От
Z.AI
линейка GLM: 5.2, 5.3 и локальный 4.7-flash через Ollama.
🔸
DeepSeek
V4 во Flash и Pro.
🔸
3
Gemini
: 2.5 Flash Lite, 3.7 Flash и Pro.
🔸
Плюс
через
OpenRouter
Kimi-K3, Grok-4.6, GPT-5.6 в версиях Luna и Sol, Nemotron-3-Ultra.
🔸
И
локальные
: qwen3.6 на 36B MoE, qwen3.8-27b и gpt-oss-20b. Купил новый макбу, так что оператика позволяла.
😉
2 побочных наблюдения, раз уж речь зашла
.
Лучший результат из всех показала Fable 5.1: средний балл 98,8 и ни одного провала.
И была загадочная модель stealth/ox-alpha, вокруг которой много шума. В итоге она оказалась GLM-5.3-Flash. Ещё проверял GLM-5.2 - она тоже хороша для своиз задач.
Теперь к главному. Opus терял ровно на том, что делает его сильным.
3 случая “числа, не выводимые из входных данных”. 2 срабатывания анти-фабрикации. 4 раза он сгладил неудобный пробел в опыте кандидата вместо того, чтобы назвать его прямо.
Это не глупость. Это попытка сделать ответ лучше. Умная модель видит шероховатость и хочет её починить: досчитать среднее, подобрать формулировку помягче, дополнить контекст. И в этом кроется засада.
Именно поэтому я разделил работу своих агентов на 2 контура.
Тактика это то, что повторяется сотнями раз в неделю, имеет жёсткий формат и проверяется кодом. Скоринг вакансий, адаптация резюме, письма, парсинг. Здесь не нужен ум, нужны просто руки.
Стратегия поиска работы это то, что делается один раз и определяет всё остальное на месяцы. Анализ рынков и ролей, разбор противоречий в данных клиента, архитектурные решения. Здесь нет контракта, который проверит код, и результат всегда проверяет человек (я + клиент).
Правило вышло простое. Можно закрыть результат настроенным гейтом - задача тактическая. Проверить может только человек - стратегическая.
Где дорогая модель незаменима, пример этой недели.
Поиск вакансий у клиента шёл полтора часа вместо двадцати минут. Причина была в одной строке: у него не оказалось сжатой выжимки стратегии, полные 220 КБ поехали в каждую партию, оверхед стал больше бюджета токенов, и система сделала 457 партий вместо девяти. Такое не ловится гейтом. Нужно связать жалобу, логи, формулу и отсутствующий файл в одну картину.
Вывод. Модель выбирается не по ее крутости, а по типу задачи
. Держать одну на всё означает переплачивать в тактике и недобирать в стратегии одновременно.
Откликнуться в Telegram →
⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.