Какие модели сравнить
Не называйте модель лучшей без своей выборки. Соберите несколько закрытых PR с известными дефектами, уберите секреты и запустите один и тот же prompt.
| Сценарий | Кандидаты из текущего каталога | Критерий выбора |
|---|---|---|
| Обычный diff | claude-sonnet-5, gpt-6-sol | Доля полезных замечаний и время ответа |
| Авторизация и миграции | claude-opus-5-5, gpt-6-astra | Находит ли бот риск с шагом воспроизведения |
| Быстрый предварительный фильтр | deepseek-v4-flash, gemini-3.7-flash | Стабильный формат и низкая доля шума |
| Второе мнение | Другая модель из разрешённого списка | Совпадение по подтверждённым находкам |
IDs проверены в live catalog Claudexia 4 октября 2026 года. Таблица задаёт план эксперимента. Она не содержит независимого рейтинга и не обещает одинаковую точность на чужом коде.
Архитектура review pipeline
| Шаг | Вход | Результат | Защита |
|---|---|---|---|
| Триггер | Pull request и SHA | Одно событие на commit | Идемпотентный ключ |
| Сбор контекста | Diff, контракты, тесты, правила | Ограниченный пакет | Исключение секретов и дампов |
| AI-проход | Prompt и ID модели | Кандидаты на находки | Запрет общих советов |
| Проверка | Линтер, typecheck, тесты | Подтверждённые риски | Не публиковать без доказательства |
| Публикация | Черновик или комментарий | Обратная связь по строке | Решение человека |
Безопасный процесс для CI
- Workflow получает SHA и строит diff относительно базовой ветки.
- Фильтр исключает
.env, ключи, production-дампы и большие бинарные файлы. - Сборщик добавляет изменённые интерфейсы, тесты и локальные правила проекта.
- Модель должна вернуть JSON с файлом, строкой, последствием и шагом проверки.
- CI запускает затронутые тесты, линтер и typecheck.
- Публикатор оставляет draft, если находка не подтверждена командой.
- Владелец PR решает, нужен ли фикс. Бот не мержит ветку и не меняет код без отдельной команды.
В prompt полезно запретить фразы «можно улучшить» и «стоит рассмотреть». Каждая находка должна отвечать на три вопроса: какой сценарий ломается, почему это следует из diff и как повторить проблему. Такой формат легче проверить человеку.
Секрет хранится в secret CI и подставляется только в job ревью. Для повторных запусков используйте request ID, commit SHA и ограничение параллельности. Разбор облачного запуска собран в статье «Облачная автоматизация AI review», а общий pipeline с Claude и GPT описан в отдельном руководстве.
После регистрации в Claudexia создайте отдельный ключ для CI, выставьте лимит и сначала прогоните бота на закрытых PR. Для каждого репозитория храните свою статистику: полезные находки, подтверждённые дефекты, ложные срабатывания, время до комментария и стоимость запуска.
FAQ
Может ли review bot нажать merge?
Не выдавайте ему это право. Бот может собрать доказательства и поставить статус проверки, но merge должен зависеть от CI и ответственного человека.
Какой контекст передавать модели?
Diff, базовый контракт, затронутые тесты и правила репозитория. Полный монорепозиторий редко нужен и увеличивает шум.
Что делать при спорном комментарии?
Оставить его черновиком, приложить вывод теста и попросить автора подтвердить сценарий. Если воспроизведения нет, находку не следует публиковать как дефект.