Когда модель ошибается, мы привыкли спрашивать её: «Почему ты так ответила?» Anthropic предлагает другой путь — не спрашивать, а ставить эксперимент.
До сих пор диагностика выглядела так: модель ошиблась, человек открывает журнал диалога и предполагает, что пошло не так. Предположение может быть верным. А может — нет. Проверить его нечем: настоящие причины поведения модели обычно неизвестны.
CHIVE меняет подход. Вместо догадки — контрфактический эксперимент: если причина действительно в X, то при изменении X поведение должно измениться. Тот же принцип, по которому работает наука. Только эксперименты ставит не человек, а агент.
Четыре шага вместо одного предположения
Схема простая. Сначала модель прогоняют по набору запросов — по 30 ответов на каждый. Агент-исследователь читает ответы и отмечает странное поведение. Дальше строит гипотезу и запускает от 5 до 15 контрфактических экспериментов: меняет запрос, заново прогоняет модель, измеряет, как часто поведение повторяется. В конце независимый судья проверяет, насколько эксперименты подтверждают объяснение.
ИИ здесь в двух ролях сразу: и объект исследования, и автоматизированный исследователь другого ИИ. Вторую роль раньше всегда играл человек.
Доступ к внутренностям модели не помог
Самое интересное — то, что система позволила проверить. Anthropic сравнила агентов, которые предсказывают поведение модели. Одним давали только журнал диалога. Другим — ещё и инструменты, читающие внутренние активации модели.
Результат: доступ к внутренностям не даёт никакого преимущества. Агент с одним журналом диалога предсказывает поведение не хуже, чем агент с инструментами интерпретируемости.
Важно: авторы прямо оговариваются, что это не доказывает бесполезность интерпретируемости. Их оценка — упрощённый аналог реальной задачи. Но на простых, проверяемых причинах чтение активаций не помогает.
Для меня главный вывод практический. Когда ИИ ошибается, полезнее менять условия и смотреть, что изменится. CHIVE показывает, что такой подход можно автоматизировать.
И ещё одна мысль, за которой стоит последить. Мы привыкли, что ИИ — это объект, который мы изучаем. CHIVE показывает, что ИИ уже способен быть исследователем другого ИИ. Это сдвиг, который меняет саму постановку вопроса.
Ссылки