Перейти к содержимому
Команда ClaudexiaМОДЕЛИ

Claude Opus 4.6 и 4.7: зачем держать старые ревизии в лайнапе

Opus 4.6 и 4.7 всё ещё доступны через Claudexia. Кто пинится на конкретную ревизию, зачем это нужно для воспроизводимости и как вызвать каждую.

Пока Opus 5 занимает место флагмана, а Opus 4.8 держит роль отката, две более ранние ревизии, 4.6 и 4.7, продолжают работать в лайнапе Claudexia без изменений. Модели никуда не спешат отключать: часть трафика на них завязана осознанно.

Зачем вообще держать старые ревизии

Причина простая: часть пайплайнов написана и провалидирована на конкретной ревизии, и любое обновление модели под капотом это потенциальная регрессия. Если промпт, схема инструментов и парсинг ответа настроены под поведение Opus 4.6, замена на более новую ревизию без тестов, это не апгрейд, а эксперимент на проде.

Claudexia не заставляет мигрировать. Обе ревизии доступны по своим id ровно так же, как флагман.

Кто пинится на конкретную ревизию и почему

  • Команды с зафиксированными eval-датасетами. Если у вас есть golden-набор кейсов и метрика pass rate, привязанная к конкретной ревизии, смена модели ломает сравнимость чисел во времени. Пин фиксирует базу для сравнения.
  • Регуляторные и аудиторские требования. В некоторых процессах нужно документально зафиксировать, какая именно версия модели обрабатывала конкретный запрос, особенно если результат попадает в отчётность или юридически значимый документ.
  • Долгоживущие агентные сценарии. Если агент выстроен вокруг конкретного стиля рассуждений и формата ответа, незаметная смена ревизии на лету может изменить поведение посреди сценария, который занимает часы или дни.
  • Постепенный rollout. Часть трафика намеренно держат на старой ревизии как контрольную группу, пока новая обкатывается на остальном трафике.

Разница между 4.6 и 4.7

Anthropic не публикует построчный список изменений между второстепенными ревизиями Opus, поэтому конкретные пункты разницы в поведении лучше проверять на своих кейсах, а не на чужих обещаниях. Практический подход: если у вас уже есть eval-датасет, прогоните его на обеих ревизиях и сравните числа, это надёжнее любого текста в блоге, включая этот.

Как вызвать конкретную ревизию

Меняется только model, остальное так же, как у любой модели на Claudexia:

curl https://api.claudexia.tech/v1/messages \
  -H "x-api-key: sk_cdx_..." \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-opus-4.6",
    "max_tokens": 1024,
    "messages": [{"role": "user", "content": "Прогони кейс из golden-датасета"}]
  }'

Тот же вызов на ревизию 4.7:

from openai import OpenAI

client = OpenAI(api_key="sk_cdx_...", base_url="https://api.claudexia.tech/v1")

resp = client.chat.completions.create(
    model="claude-opus-4.7",
    messages=[{"role": "user", "content": "Прогони кейс из golden-датасета"}],
)
print(resp.choices[0].message.content)

Оба id живут на одном эндпоинте, оба формата API работают одинаково, ключ один.

Риски долгого пиннинга

Пин снимает риск незаметной регрессии сегодня, но добавляет риск другого рода: рано или поздно любая ревизия может уйти в статус устаревшей у самого Anthropic. Если вы жёстко зашили id модели в код, держите отдельную задачу на регулярную проверку статуса ревизии и план миграции, чтобы не узнать об отключении по ошибкам в проде.

Цена не зависит от ревизии

Через Claudexia 4.6, 4.7, 4.8 и 5 стоят одинаково: 0.4 доллара за миллион входных токенов и 0.4 за миллион выходных. Пин на старую ревизию не экономит и не переплачивает, разница только в поведении и стабильности, а не в счёте. Сравнить сумму под свою нагрузку можно калькулятором на сайте, а расход по ключам разложен в дашборде отдельно.

Коротко

Opus 4.6 и 4.7 держим в строю ради тех, кому важна воспроизводимость: зафиксированные evals, аудит, долгие агентные сценарии, постепенный rollout. Разницу в поведении между ревизиями проверяйте на своих кейсах. Цена у всех ревизий Opus одинаковая, так что пин, это решение про стабильность, а не про экономию.