Перейти к содержимому
Команда ClaudexiaДЕНЬГИ

Юнит-экономика LLM-фичи: сколько стоит один пользователь и что убивает маржу

Формула себестоимости запроса простая, но реальный расход на пользователя определяют другие вещи: длина диалога, повторные вызовы, тяжёлые пользователи. Как посчитать и не уйти в минус.

Фича на модели выглядит бесплатной, пока не откроешь счёт за месяц. Разберём, из чего на самом деле складывается расход на пользователя и где чаще всего теряют маржу.

Из чего складывается цена одного запроса

Базовая формула простая: стоимость запроса равно цена входных токенов на их число плюс цена выходных токенов на их число. Выходные токены у любого провайдера стоят в несколько раз дороже входных, поэтому длина ответа модели влияет на счёт сильнее, чем длина промпта.

Если фича генерирует развёрнутый текст: письма, описания, код с комментариями, основной расход придётся именно на генерацию, а не на то, что вы отправили модели для контекста.

Пользователь это не один запрос

Ошибка, которую делают почти все на старте: считают себестоимость по одному вызову API и умножают на число пользователей. В реальности один пользователь за сессию делает несколько вызовов, и это меняет картину.

Диалог с моделью растёт с каждой репликой: пятый вопрос в чате тащит в контекст всю историю переписки, и оплачивается уже не один короткий вопрос, а всё накопленное. Агентный сценарий, где модель сама планирует шаги, может сделать десяток вызовов на одну пользовательскую задачу.

Значит правильная единица расчёта, не запрос, а сессия или задача целиком. Посчитайте, сколько вызовов в среднем требует одно действие пользователя, и умножайте себестоимость на это число, а не на единицу.

Что реально убивает маржу

Три вещи чаще всего пробивают юнит-экономику насквозь.

Тяжёлые пользователи. Распределение использования почти всегда скошено: небольшая доля аккаунтов генерирует основной объём токенов. Если цена фичи плоская, эти пользователи убыточны, а остальные субсидируют их через общую цену подписки.

Повторные попытки. Модель ошиблась, приложение перезапросило, потом ещё раз. Каждая попытка оплачена по полной цене, а бизнес-метрика этого не видит, видит только успешный финальный результат.

Растущий контекст в длинных сессиях. Чат-бот поддержки, который держит всю историю разговора, платит за неё на каждом следующем сообщении. Без обрезки или суммирования истории цена одной длинной сессии может в разы превысить цену короткой.

Как посчитать себестоимость фичи

Соберите три числа за представительный период: средний расход токенов на одно действие пользователя, среднее число действий на пользователя в месяц, долю неуспешных вызовов, которые пришлось повторить.

Дальше формула: себестоимость на пользователя в месяц равно среднее число действий, умноженное на среднюю стоимость действия, умноженное на поправку на повторы, обычно множитель от 1.1 до 1.3, если у фичи есть автоматические ретраи.

Смотрите на перцентили, а не только на среднее значение. Медианный пользователь может стоить копейки, а девяносто пятый перцентиль, в разы больше. Цена по среднему часто маскирует убыточность у самой активной части аудитории.

Как поставить цену, чтобы не уйти в минус

Плоская цена за подписку работает, если разброс использования между пользователями небольшой. Если разброс большой, разумнее закладывать лимит в тариф: до какого-то числа запросов в месяц по фиксированной цене, дальше доплата или переход на тариф выше.

Второй рабочий приём, закладывать в цену не текущую стоимость модели, а стоимость с запасом на будущее подорожание или на переход на более качественную модель. Маржа, посчитанная впритык к сегодняшней цене API, исчезает при первом же изменении тарифов у провайдера.

Как не проспать рост расходов

Считать юнит-экономику один раз при запуске недостаточно. Нужен постоянный взгляд на то, откуда берётся расход: какая фича, какой пользователь, какая модель.

В Claudexia статистика идёт по каждому ключу API отдельно, так что можно раздать ключи по фичам или по клиентским сегментам и увидеть, кто из них съедает бюджет. Суб-организации с отдельными лимитами удобны, когда команда растёт и продуктов становится несколько: у каждого свой бюджет и свой порог предупреждения, а не общий котёл, за который никто не отвечает лично.

Коротко

Себестоимость LLM-фичи не равна цене одного вызова API. Считайте по сессии, а не по запросу, смотрите на перцентили вместе со средним, и закладывайте запас в цену на случай подорожания модели. Разбивка расхода по ключам и по фичам превращает гадание в цифры.