TestMu AI объявила о запуске Agent Assurance — инструмента, который оценивает автономных ИИ-агентов по их реальным действиям, а не по отчётам о выполненной работе.
Автономные агенты уже работают без надзора. По данным Stack Overflow Developer Survey 2025, 14,1% разработчиков используют ИИ-агентов ежедневно, но лишь 3,1% высоко оценивают точность ИИ-инструментов. Разрыв между использованием и доверием растёт, и существующее тестирование его не закрывает.
Модульные и интеграционные тесты проверяют код, но не решения, которые агент принимает самостоятельно. Сквозные браузерные тесты проверяют интерфейс, а агент действует за его пределами. Языковая модель, читающая журнал диалога, доказывает, что ответ звучит убедительно, но не что он правдив.
Действия вместо слов
Agent Assurance — это CLI-утилита с именем rook. Она устанавливается через Homebrew, установочный скрипт или npm, читает кодовую базу агента, автоматически генерирует тестовые сценарии, запускает агента в реальных условиях и оценивает каждый критерий по наблюдаемым доказательствам.
Ключевое отличие от обычных инструментов оценки: проверяется не финальное сообщение агента, а его фактическое поведение. Agent Assurance отслеживает изменённые файлы, созданные артефакты и вызовы инструментов, сопоставляя реальный результат с критериями оценки.
Агент может сообщить, что задача выполнена, хотя изменил не тот файл, некорректно вызвал API или выполнил лишнее действие. Обычная оценка, читающая ответ агента, этого не заметит. Agent Assurance замечает, потому что смотрит на эффект, а не на отчёт.
Важно: Agent Assurance работает в режиме серого ящика — читает код, наблюдает за файловой системой и вызывает инструменты агента, чтобы проверить, что произошло. Большинство существующих методологий тестирования агентов работают по модели чёрного ящика.
Что считать проверенным
Каждый инструмент оценки сообщает об успехе или неудаче. Agent Assurance добавляет третий вердикт — «не удалось проверить»: это критерий, для которого не нашлось достаточных доказательств. Такие критерии исключаются из знаменателя, а не подмешиваются к успешным или неуспешным результатам, поэтому доля прохождения отражает только реально проверенные случаи.
Доля критериев, которые не удалось проверить, называется assurance gap. Это процент поведения агента, для которого системе не хватило доказательств. Запустите Agent Assurance на агенте без журнала вызовов инструментов — разрыв будет высоким. Добавьте журнал аудита — те же сценарии дадут гораздо больше подтверждённых результатов. Разрыв превращается в список задач: что нужно логировать, чтобы повысить наблюдаемость.
Инсайт: assurance gap — это рабочая метрика, а не цифра для отчёта. Она показывает, какую часть поведения агента вы можете доказательно оценить и что нужно изменить, чтобы расширить эту часть.
От терминала до CI-конвейера
Agent Assurance генерирует сценарии трёх классов и восемнадцати категорий. Функциональные сценарии покрывают основной и негативный пути, граничные случаи, интеграции и обработку состояний. Нефункциональные проверяют производительность, экономию токенов, надёжность и качество. Ещё девять категорий относятся к атакам: промпт-инъекция, обход ограничений, утечка данных, утечка персональных данных, вредоносный контент, галлюцинации, перехват управления, нарушение политик и техническая инъекция. Атакующие сценарии генерируются по умолчанию, а не включаются как дополнительная опция.
В безинтерфейсном режиме утилита работает как шлюз перед релизом в CI: rook explore, rook generate, rook run, rook report. Утилита возвращает 0 при успехе, 1 при ошибке, 3 при отсутствии авторизации и 4 при исчерпании бюджета — конвейер может реагировать на результат без разбора логов.
Результаты хранятся как обычные файлы в директории .testmuai/rook/ — без базы данных. Повторный запуск добавляет сравнение: что сломалось, что починилось, что нестабильно. Нестабильные сценарии выделены отдельно, потому что требуют другого подхода, чем обычные регрессии.
Внимание: Agent Assurance запускает агента в реальных условиях и не может откатить изменения. Перед запуском утилита сообщает, сколько инструментов записи объявил агент, и один раз запрашивает разрешение. Права выдаются для конкретного объекта. Разработчики рекомендуют запускать систему в тестовом окружении, а не в рабочей среде.
Новый инфраструктурный слой
По мере роста автономности агентов обычного тестирования ПО становится недостаточно. Нужно проверять траекторию поведения агента, его вызовы инструментов и реальный результат действий. Появляется отдельный инфраструктурный слой: агент выполняет задачу, система контроля проверяет действия и доказательства, и только после этого агента допускают в рабочую среду.
Рынок начинает строить инструменты контроля вокруг действий автономных систем, а не вокруг ответа языковой модели. Это выглядит как формирование новой категории — CI/CD, оценка, контроль и наблюдаемость для ИИ-агентов. Agent Assurance — ранний сигнал того, что этот слой обретает очертания.
Совет: если у вас уже есть автономные агенты в работе, начните с аудита того, что вы действительно можете проверить. Assurance gap покажет, где нужна дополнительная инструментация: журналы вызовов, хеши файлов и записи артефактов. Без этого любая оценка остаётся проверкой отчёта, а не поведения.
Доступ к Agent Assurance предоставляют поэтапно, поэтому сначала нужно записаться в лист ожидания. Первый запуск на собственном агенте обычно проваливает большую часть сценариев. Это нормально. Следить стоит за assurance gap: он показывает, какую долю поведения вы можете доказать, а не то, сколько агент заявил, что сделал.
Ссылки