Самая частая и самая дорогая ошибка это гонять флагман на всём подряд. Разберём, как выбирать осознанно.
Правило одной фразы
Флагман нужен там, где надо удержать много связей одновременно. Всё остальное это работа для младшей модели.
Если задачу можно описать как «возьми это и преврати в то», флагман не нужен. Если задачу нельзя решить, не поняв, как устроена система целиком, нужен.
Где Opus оправдан
- разбор незнакомого репозитория, когда надо понять архитектуру
- рефакторинг, который затрагивает несколько файлов согласованно
- отладка гонок и плавающих багов
- проектирование, где надо взвесить компромиссы
- длинный агентный сценарий, где модель сама решает следующий шаг
Где Opus это переплата
- разбор логов и трассировок
- переписывание и вычитка текста
- генерация однотипного кода по образцу
- классификация входящих сообщений
- конвертация форматов, парсинг, приведение данных
- простые вопросы по документации
Здесь младшая модель отработает не хуже, а счёт будет в разы меньше.
Хитрость с двумя моделями
Работающий приём: пусть флагман думает, а младшая модель делает.
Сначала Opus разбирает задачу и выдаёт план. Дальше по этому плану механику выполняет Sonnet или gpt-5.6-luna. Вы платите за дорогое мышление один раз, а не на каждом шаге.
У нас нет тира Haiku. Самая дешёвая модель это gpt-5.6-luna, но учтите: это другое семейство. Формат запросов совместимый, а поведение и промпты могут отличаться, так что проверьте на своей задаче.
Особенно заметно на пакетной обработке: разметить подход один раз, применить к тысяче элементов дёшево.
Про вход и выход
Ещё одна вещь, которую упускают. Выход дороже входа в разы у любой модели.
Значит длинный контекст в промпте почти всегда дешевле, чем длинный ответ. Не бойтесь давать контекст, бойтесь просить многословный ответ.
Как проверить на своих числах
Абстрактные рассуждения плохо переводятся в рубли. На сайте есть калькулятор: выбираете модель, ставите объёмы, видите сумму. Посчитайте один и тот же сценарий на разных моделях, разница обычно убеждает лучше любых аргументов.
Коротко
Флагман для связывания контекста, младшая модель для преобразований. Думать дорого, делать дёшево, поэтому разводите эти две функции по разным моделям.