Отчёт по бенчмарку
Метод и результаты Codna против Cursor на 87 парных кейсах исправления багов.
Руководства, измеренный бенчмарк и прямые сравнения. Цифры взяты из 87 парных кейсов против Cursor: в 5× меньше токенов, в 1,7× быстрее, 87 из 87 проверены.
Метод и результаты Codna против Cursor на 87 парных кейсах исправления багов.
Почему агентам нужна детерминированная карта до того, как исправлять.
Как серьёзность, уверенность и чёткий вердикт ускоряют ревью pull request.
Превратите сбой в продакшне в PR с исправлением и первопричиной.
На 87 парных кейсах против Cursor Codna потратила в 5× меньше токенов и работала в 1,7× быстрее. Оба проверили 87 из 87 исправлений. Codna в среднем расходовала около $0,02 на модель за исправление.
Суммарные токены, время, стоимость модели и проверенные исправления по каждому кейсу, усреднённые по 87 парным кейсам на идентичных чекаутах.
Codna строит карту репозитория без модели, за ноль токенов, и передаёт агенту пакет доказательств, ограниченный задачей. Соотношение «сырой объём → пакет» печатается при каждом запуске.
Карта репозитория строится из паттернов импортов, поэтому не привязана к одному языку. codna impact сужает diff до тестов, на которые он может повлиять. Recall на устройстве покрывает Python, JavaScript, TypeScript, Go, Rust, Java, C, C++, C#, PHP и Ruby.
Codna находит затронутый код по графу зависимостей и радиуса влияния, исправляет по пакету доказательств и сообщает первопричину, уверенность, радиус влияния и риск регрессии. На GitHub она открывает pull request, который объясняет себя сам. Сливаете вы.
Понимание работает на вашей машине. До провайдера модели доходит только пакет доказательств или diff, с вашим ключом. Установите privacy.egress в fail-closed в codna.yaml, и Codna запускает ваши тесты только под запретом сети на уровне ядра.