Фича на модели выглядит бесплатной, пока не откроешь счёт за месяц. Разберём, из чего на самом деле складывается расход на пользователя и где чаще всего теряют маржу.
Из чего складывается цена одного запроса
Базовая формула простая: стоимость запроса равно цена входных токенов на их число плюс цена выходных токенов на их число. Выходные токены у любого провайдера стоят в несколько раз дороже входных, поэтому длина ответа модели влияет на счёт сильнее, чем длина промпта.
Если фича генерирует развёрнутый текст: письма, описания, код с комментариями, основной расход придётся именно на генерацию, а не на то, что вы отправили модели для контекста.
Пользователь это не один запрос
Ошибка, которую делают почти все на старте: считают себестоимость по одному вызову API и умножают на число пользователей. В реальности один пользователь за сессию делает несколько вызовов, и это меняет картину.
Диалог с моделью растёт с каждой репликой: пятый вопрос в чате тащит в контекст всю историю переписки, и оплачивается уже не один короткий вопрос, а всё накопленное. Агентный сценарий, где модель сама планирует шаги, может сделать десяток вызовов на одну пользовательскую задачу.
Значит правильная единица расчёта, не запрос, а сессия или задача целиком. Посчитайте, сколько вызовов в среднем требует одно действие пользователя, и умножайте себестоимость на это число, а не на единицу.
Что реально убивает маржу
Три вещи чаще всего пробивают юнит-экономику насквозь.
Тяжёлые пользователи. Распределение использования почти всегда скошено: небольшая доля аккаунтов генерирует основной объём токенов. Если цена фичи плоская, эти пользователи убыточны, а остальные субсидируют их через общую цену подписки.
Повторные попытки. Модель ошиблась, приложение перезапросило, потом ещё раз. Каждая попытка оплачена по полной цене, а бизнес-метрика этого не видит, видит только успешный финальный результат.
Растущий контекст в длинных сессиях. Чат-бот поддержки, который держит всю историю разговора, платит за неё на каждом следующем сообщении. Без обрезки или суммирования истории цена одной длинной сессии может в разы превысить цену короткой.
Как посчитать себестоимость фичи
Соберите три числа за представительный период: средний расход токенов на одно действие пользователя, среднее число действий на пользователя в месяц, долю неуспешных вызовов, которые пришлось повторить.
Дальше формула: себестоимость на пользователя в месяц равно среднее число действий, умноженное на среднюю стоимость действия, умноженное на поправку на повторы, обычно множитель от 1.1 до 1.3, если у фичи есть автоматические ретраи.
Смотрите на перцентили, а не только на среднее значение. Медианный пользователь может стоить копейки, а девяносто пятый перцентиль, в разы больше. Цена по среднему часто маскирует убыточность у самой активной части аудитории.
Как поставить цену, чтобы не уйти в минус
Плоская цена за подписку работает, если разброс использования между пользователями небольшой. Если разброс большой, разумнее закладывать лимит в тариф: до какого-то числа запросов в месяц по фиксированной цене, дальше доплата или переход на тариф выше.
Второй рабочий приём, закладывать в цену не текущую стоимость модели, а стоимость с запасом на будущее подорожание или на переход на более качественную модель. Маржа, посчитанная впритык к сегодняшней цене API, исчезает при первом же изменении тарифов у провайдера.
Как не проспать рост расходов
Считать юнит-экономику один раз при запуске недостаточно. Нужен постоянный взгляд на то, откуда берётся расход: какая фича, какой пользователь, какая модель.
В Claudexia статистика идёт по каждому ключу API отдельно, так что можно раздать ключи по фичам или по клиентским сегментам и увидеть, кто из них съедает бюджет. Суб-организации с отдельными лимитами удобны, когда команда растёт и продуктов становится несколько: у каждого свой бюджет и свой порог предупреждения, а не общий котёл, за который никто не отвечает лично.
Коротко
Себестоимость LLM-фичи не равна цене одного вызова API. Считайте по сессии, а не по запросу, смотрите на перцентили вместе со средним, и закладывайте запас в цену на случай подорожания модели. Разбивка расхода по ключам и по фичам превращает гадание в цифры.