AutoDesign — исследовательская система, где оптимизируется уже не промпт и не модель, а сам harness агента: код, правила и workflow, через которые он решает задачу.

Оптимизируют не модель, а то, что её окружает

Harness — это всё, что окружает модель: системный промпт, инструменты, правила вызова, проверки результатов, стратегия повторных попыток. Модель — двигатель. Harness — шасси, руль и коробка передач.

В AutoDesign есть meta-harness optimizer — компонент, который анализирует предыдущие rollout’ы (полные циклы выполнения задачи), получает обратную связь и заставляет программирующего агента переписывать и улучшать собственный harness. Затем цикл повторяется: новый harness, новый запуск, новая обратная связь, новая версия.

Одиннадцать циклов — и результат заметно лучше

Задача — генерация научных постеров из статей. Бенчмарк PosterBench: 100 статей, пять дисциплин. Семь конфигураций код-агент-модель.

Средний PosterBench Score вырос с 54,99 до 67,39 — прирост 12,4%. На главном треке AutoDesign набрал 78,32, обогнав коммерческую систему Claude Design на 7,45 балла.

Полностью автономный запуск: 253 вызова инструментов, 11 циклов редактирования, примерно 40 минут, меньше $3. Качество — на уровне среднего постера для конференции. Слепое исследование с людьми показало наивысшее предпочтение среди всех протестированных систем.

Где появляется реальное преимущество

Цепочка развития выглядит так: модель → агент → agent harness → self-improving harness.

Инсайт: модели выравниваются, промпты копируются, а хорошо настроенный harness с накопленным опытом воспроизвести сложно.

Конкурентным преимуществом AI-систем всё чаще становится система вокруг модели — накопленный код, правила и опыт, которые агент переписывает сам.

Если вы строите агента для повторяющейся задачи, стоит посмотреть не только на выбор модели. Какой harness вы можете описать, измерить и улучшить? Что именно делает агент между получением задачи и выдачей результата? Ответы на эти вопросы часто важнее, чем очередной апгрейд модели.

Ссылки

Ссылки