Сравнение по рабочим сценариям
| Семейство | Где начать тест | Что измерить |
|---|---|---|
| Claude | Агентный кодинг, разбор требований, ревью | Число найденных реальных проблем и качество плана |
| GPT | Универсальные инженерные и продуктовые потоки | Формат JSON, инструменты, скорость итераций |
| Gemini | Задачи с длинным контекстом и мультимодальными входами | Потерю фактов в длинном материале |
| DeepSeek | Большие потоки, чувствительные к расходам | Точность на граничных случаях |
| Qwen | Код, классификация, эксперименты с открытой экосистемой | Совместимость с вашим стеком и русский язык |
| GLM | Альтернативный кандидат для текстовых и кодовых задач | Повторяемость ответа на фиксированном наборе |
В текущем каталоге есть gemini-3.1-pro, gemini-3.7-flash, gemini-3.8-flash, deepseek-v4-pro, deepseek-v4-flash, deepseek-v4.1-flash, qwen3.8-flash, qwen3.8-max, glm-5.2, glm-5.3 и glm-5.3-flash. Доступность модели меняется, поэтому интеграция должна читать доступные IDs, а не держать список в коде годами.
Нормальный способ выбрать
Соберите тест из своих данных без персональных сведений: 10-20 закрытых тикетов, несколько завершённых pull request и образцы сообщений клиентов. Для каждого ответа заранее определите проверку. Поддержка получает точный ответ или передаёт диалог человеку, ревью показывает воспроизводимый риск, извлечение возвращает валидный JSON.
Затем назначьте маршрут. Например, быстрый кандидат обрабатывает входящий поток, а сложный запрос уходит к Claude или GPT после правила эскалации. Это понятнее, чем заставлять один флагман обслуживать всё подряд.
FAQ
Можно ли менять семейство без нового ключа?
Да. Один ключ Claudexia работает с моделями, которые доступны вашему аккаунту. Проверьте конкретный ID в каталоге перед переключением.
Что важнее, модель или промпт?
Оба фактора влияют на результат. Сначала зафиксируйте формат входа и проверку ответа, затем сравнивайте модели на одинаковых условиях.