Я прогнал 19 моделей по своим тактическим задачам. Самая дорогая проиграла дешёвой: 90,2 против 98,2 балла. Я …

Другое 03.09.2026 · 👁 781 просмотров
Я прогнал 19 моделей по своим тактическим задачам. Самая дорогая проиграла дешёвой: 90,2 против 98,2 балла. Я долго не верил и пошёл разбираться, на чём именно она теряла. Каждые 2 недели выходят новые LLM, которые я тестирую для своего стека ID Agent - поиск вакансий, адаптация резюме, подготовка к собесам и прочее. Причем все делается для разных рынков - от России и Грузии до Канады и Франции. У меня есть свой бенчмарк и несколько десятков кейсов через которые я прогоняю каждую модель. Сначала как я считаю? Задачи взял свои реальные: адаптировать резюме под вакансию, оценить вакансию, написать письмо рекрутёру. Оценка ставится на основе поиска выдуманных факто, отсутствия ИИ слопа, структуры, покрытия ключевыми словами. Кого гонял? 🔸 От Anthropic : Sonnet 5 как baseline на полном стеке из 14 задач, Opus, Haiku 4.5 и новая Fable 5.1. 🔸 От Z.AI линейка GLM: 5.2, 5.3 и локальный 4.7-flash через Ollama. 🔸 DeepSeek V4 во Flash и Pro. 🔸 3 Gemini : 2.5 Flash Lite, 3.7 Flash и Pro. 🔸 Плюс через OpenRouter Kimi-K3, Grok-4.6, GPT-5.6 в версиях Luna и Sol, Nemotron-3-Ultra. 🔸 И локальные : qwen3.6 на 36B MoE, qwen3.8-27b и gpt-oss-20b. Купил новый макбу, так что оператика позволяла. 😉 2 побочных наблюдения, раз уж речь зашла . Лучший результат из всех показала Fable 5.1: средний балл 98,8 и ни одного провала. И была загадочная модель stealth/ox-alpha, вокруг которой много шума. В итоге она оказалась GLM-5.3-Flash. Ещё проверял GLM-5.2 - она тоже хороша для своиз задач. Теперь к главному. Opus терял ровно на том, что делает его сильным. 3 случая “числа, не выводимые из входных данных”. 2 срабатывания анти-фабрикации. 4 раза он сгладил неудобный пробел в опыте кандидата вместо того, чтобы назвать его прямо. Это не глупость. Это попытка сделать ответ лучше. Умная модель видит шероховатость и хочет её починить: досчитать среднее, подобрать формулировку помягче, дополнить контекст. И в этом кроется засада. Именно поэтому я разделил работу своих агентов на 2 контура. Тактика это то, что повторяется сотнями раз в неделю, имеет жёсткий формат и проверяется кодом. Скоринг вакансий, адаптация резюме, письма, парсинг. Здесь не нужен ум, нужны просто руки. Стратегия поиска работы это то, что делается один раз и определяет всё остальное на месяцы. Анализ рынков и ролей, разбор противоречий в данных клиента, архитектурные решения. Здесь нет контракта, который проверит код, и результат всегда проверяет человек (я + клиент). Правило вышло простое. Можно закрыть результат настроенным гейтом - задача тактическая. Проверить может только человек - стратегическая. Где дорогая модель незаменима, пример этой недели. Поиск вакансий у клиента шёл полтора часа вместо двадцати минут. Причина была в одной строке: у него не оказалось сжатой выжимки стратегии, полные 220 КБ поехали в каждую партию, оверхед стал больше бюджета токенов, и система сделала 457 партий вместо девяти. Такое не ловится гейтом. Нужно связать жалобу, логи, формулу и отсутствующий файл в одну картину. Вывод. Модель выбирается не по ее крутости, а по типу задачи . Держать одну на всё означает переплачивать в тактике и недобирать в стратегии одновременно.
Откликнуться в Telegram →

⚠️ Никогда не платите «за оформление» или «гарантию трудоустройства» — это признак мошенников. Работа ТРУ не несёт ответственности за содержание вакансии.

🇮🇱 Не нашли подходящую зарплату? В Израиле платят от $3000 Без языка и опыта · жильё и легализация под ключ · официально Смотреть вакансии →