Представьте, что вы дали задачу ассистенту: «Найди дешёвые билеты в Москву на пятницу, забронируй, пришли подтверждение». Чат-бот ответит: «Вот ссылка на сайт авиакомпании, ищите сами». Агент — откроет сайт, введёт даты, выберет рейс, оплатит и пришлёт посадочный талон. Разница в одном: агент действует, а не только разговаривает.
Что это
AI-агент — программа, которой дают цель и отпускают работать. Она сама разбирается в ситуации, сама решает, что делать дальше, сама пользуется инструментами — браузером, почтой, базой данных, кодом — и сама проверяет, получилось ли. Если не получилось, пробует другой подход. Так по кругу, пока задача не будет решена.
Мозг агента — большая языковая модель, LLM. Это программа, которая понимает текст и генерирует текст. GPT от OpenAI, Claude от Anthropic, Gemini от Google, Llama от Meta — всё это LLM. Сами по себе они умеют только отвечать на вопросы текстом. Агент оборачивает модель в «оболочку» из инструментов и инструкций, превращая собеседника в исполнителя.
Ключевое правило: чат-бот отвечает, агент действует. Если программа только пишет текст — это ассистент. Если она открывает сайты, запускает код, отправляет письма, меняет данные — это агент.
В 2026 году агенты перестали быть лабораторной демонстрацией. По данным Stanford HAI, в бенчмарке OSWorld — наборе задач на управление компьютером — агенты справляются с 66,3% заданий. Год назад было около 12%. Треть всё ещё проваливается, но прогресс за двенадцать месяцев — в пять раз. McKinsey сообщает, что 23% компаний уже внедряют агентов куда-то в бизнес-процессы. Ещё 39% экспериментируют.
Зачем нужно
- Автоматизация рутины — агент читает почту, сортирует заявки, заполняет таблицы, отправляет ответы по шаблону. Освобождает человека от повторяющейся работы.
- Работа с данными — агент ищет информацию в интернете, сравнивает цены, собирает отзывы, сводит в таблицу. Не нужно гуглить вручную десять вкладок.
- Программирование — агент пишет код, запускает тесты, исправляет ошибки, открывает pull request. Часть работы разработчика уже можно делегировать.
- Поддержка клиентов — агент разбирает тикеты, находит решение в базе знаний, отвечает клиенту или передаёт сложный случай человеку.
- Мультимодальность — агент может не только работать с текстом, но и анализировать изображения, генерировать графику, работать с аудио и видео.
Как устроено
Любой агент, независимо от фреймворка, состоит из четырёх частей. Представьте сотрудника, которому нужен мозг, руки, память и план.
| Элемент | Что это | Простыми словами |
|---|---|---|
| Модель (LLM) | Языковая модель — рассуждает и принимает решения | Мозг сотрудника |
| Инструменты | Функции, которые агент может вызывать: браузер, код, API, файлы | Руки сотрудника |
| Память | Хранилище контекста: что уже сделано, какие были результаты | Память сотрудника |
| Планирование | Способность разбить задачу на шаги и решать, что дальше | План действий сотрудника |
Модель
Модель — это «мозг» агента. Она читает задачу, рассуждает о ней, решает, какой инструмент вызвать, и оценивает результат. В 2026 году выбор моделей широк: GPT-5 и o-серия от OpenAI для сложных задач, Claude от Anthropic для длинного контекста и работы с инструментами, Gemini от Google для мультимодальности, DeepSeek для экономных сценариев, Llama от Meta и Qwen для запуска на собственном сервере.
Инструменты
Инструменты превращают модель из собеседника в исполнителя. Без них агент умеет только писать текст. С ними — открывать веб-страницы, запускать Python-код, читать и писать файлы, вызывать внешние API, работать с базами данных, управлять браузером.
Важно: инструменты — это то, что отличает агента от чат-бота. Чем точнее описан каждый инструмент (что делает, когда применять, какие параметры), тем лучше агент решает, когда его вызвать.
В 2024 году Anthropic выпустила Model Context Protocol, MCP — открытый стандарт для подключения инструментов к моделям. До MCP каждый разработчик писал свои коннекторы к каждому сервису отдельно. С MCP — один универсальный разъём. Образно это называют «USB-C для ИИ»: один коннектор работает с любой моделью и любым инструментом. К 2025 году OpenAI, Google и Microsoft добавили поддержку MCP.
Память
Память бывает трёх типов:
- Краткосрочная — текущий контекст диалога. У современных моделей окно контекста достигает 200K–2M токенов. Токен — это примерно слово или его часть. 200K токенов — это книга на 500 страниц.
- Долгосрочная — постоянное хранилище фактов и предпочтений. Обычно реализуется через векторные базы данных: Pinecone, Chroma, Qdrant. Векторная база — хранилище, где текст хранится как набор чисел, что позволяет искать по смыслу, а не по точному совпадению слов.
- Эпизодическая — воспоминания о конкретных прошлых сессиях. Нужна, когда агент должен учитывать, что уже пробовал в прошлый раз и к чему это привело.
Планирование
Планирование — способность агента разбивать сложную задачу на шаги, выбирать порядок действий и исправляться при неудачах. Основной паттерн называется ReAct — Reasoning + Acting, «рассуждение и действие». Агент думает вслух: «Мне нужно найти цены на билеты. Сначала открою сайт. Получил результат — теперь сравню. Сравнил — теперь выберу самый дешёвый». Если шаг не удался, агент видит это в результате и пробует другой подход.
Совет: если агент «зацикливается» — повторяет один и тот же шаг без результата — проблема обычно в плохом описании инструментов или недостаточной инструкции. Точный системный промпт с ограничением количества попыток решает это.
Агентный цикл
Весь процесс выглядит так:
- Пользователь даёт цель — например, «найди дешёвые билеты в Москву на пятницу».
- Агент читает задачу и планирует шаги — «открыть сайт, ввести даты, отсортировать по цене».
- Агент вызывает инструмент — открывает браузер, вводит данные.
- Агент проверяет результат — видит список рейсов.
- Агент решает, что делать дальше — сравнивает цены, выбирает лучший.
- Цикл повторяется, пока цель не достигнута.
Какие бывают агенты
По типу работы
| Тип | Что делает | Пример |
|---|---|---|
| Рефлексивный | Реагирует на текущую ситуацию без памяти о прошлом | Автоответчик, который определяет тему письма и отвечает по шаблону |
| Целевой | Получает цель и планирует маршрут к ней | Агент, который находит билеты и бронирует рейс |
| Утилитарный | Оценивает несколько вариантов и выбирает лучший по заданному критерию | Агент, который сравнивает тарифы и выбирает оптимальный |
| На основе модели | Строит внутреннюю модель мира и предсказывает последствия действий | Агент, который проверяет, не сломает ли изменение кода другие части программы |
По количеству агентов
Один агент. Решает задачу самостоятельно. Простой и дешёвый вариант. Подходит, когда задача укладывается в один контур: нашёл — обработал — ответил.
Мультиагентная система. Несколько агентов работают вместе. Каждый специализируется на своём: один пишет код, второй проверяет, третий пишет документацию. Самый распространённый паттерн — «оркестратор и исполнители». Один агент-менеджер разбивает задачу на части и раздаёт их агентам-специалистам. Когда один агент не справляется, он делегирует другому.
Внимание: мультиагентные системы стоят дороже — больше моделей, больше вызовов, больше точек отказа. Если один агент с хорошими инструментами справляется, не нужно добавлять второй. Дополнительные агенты оправданы, когда задача охватывает принципиально разные области: например, исследование + написание + проверка фактов.
Когда использовать
| Ситуация | Подходит / не подходит | Почему |
|---|---|---|
| Повторяющаяся работа по чёткому сценарию | Подходит | Агент делает одно и то же без усталости и ошибок внимания |
| Задача с чёткой целью и измеримым результатом | Подходит | Есть критерий завершения — агент знает, когда остановиться |
| Креативная работа без чётких границ | Не подходит | Нет критерия «готово», агент будет бесконечно уточнять |
| Задача с высокими рисками при ошибке | Только с человеком | Платежи, удаления, юридические решения — нужен контроль |
| Простые ответы на вопросы | Не нужна агентность | Обычный чат-бот или LLM справится дешевле |
Фреймворки — на чём пишут агентов
Фреймворк — это набор готовых инструментов и шаблонов для создания агентов. Большинство фреймворков — библиотеки на Python: устанавливаются одной командой, импортируешь в код — и агент готов. Как каркас здания: стены, перекрытия и крыша уже есть, остаётся добавить внутреннюю отделку.
| Фреймворк | Назначение | Кому подходит |
|---|---|---|
| LangChain / LangGraph | Самый расширяемый — 1000+ интеграций, графовая оркестрация | Командам, которым нужна гибкость и наблюдаемость |
| CrewAI | Мультиагентные команды с ролями — «исследователь», «писатель», «редактор» | Проектам, где несколько агентов работают вместе |
| OpenAI Agents SDK | Минимум абстракций, глубокая интеграция с моделями OpenAI | Командам в экосистеме OpenAI |
| Hermes Agent | Open-source, локальный запуск, поддержка MCP, голос и мессенджеры | Разработчикам, которые хотят полный контроль и приватность |
LangChain
LangChain — самый известный фреймворк для создания агентов. Главная функция — create\_agent, которая собирает агента из модели, инструментов и инструкций. Работает с любым провайдером моделей: OpenAI, Anthropic, Google, Ollama (локальный запуск). LangGraph — модуль для сложных сценариев: ветвлений, циклов, параллельных потоков. LangSmith — инструмент для отладки и мониторинга: показывает каждый шаг агента, сколько токенов потратил, где ошибся.
CrewAI
CrewAI — фреймворк для мультиагентных систем. Вы описываете агентов как членов команды: у каждого роль, цель и набор инструментов. «Исследователь» ищет данные в интернете, «писатель» пишет текст, «редактор» проверяет факты. Агенты общаются между собой и делегируют подзадачи.
OpenAI Agents SDK
OpenAI Agents SDK — официальный набор от OpenAI. Три базовых понятия: Agent (модель с инструкциями и инструментами), Handoff (передача задачи от одного агента другому), Guardrail (проверка входа и выхода на безопасность). Минимум концепций — максимум простоты. Установка одной командой: pip install openai-agents.
Hermes Agent
Hermes Agent от Nous Research — open-source агент с акцентом на локальный запуск. Работает с любой моделью, не привязан к одному провайдеру. Поддерживает MCP из коробки. Умеет работать в мессенджерах (Telegram, Discord) и с голосом. Имеет систему «скиллов» — переиспользуемых пакетов знаний и процедур, которые агент загружает при необходимости.
Пример
Простейший агент на LangChain, который умеет узнавать погоду:
# pip install langchain "langchain[openai]"
from langchain.agents import create_agent
def get_weather(city: str) -> str:
"""Узнать погоду в указанном городе."""
return f"В городе {city} сейчас +20, солнечно."
agent = create_agent(
model="openai:gpt-5",
tools=[get_weather],
system_prompt="Ты помощник, который отвечает на вопросы о погоде.",
)
result = agent.invoke({
"messages": [{"role": "user", "content": "Какая погода в Москве?"}]
})
print(result["messages"][-1].content)
Агент на OpenAI Agents SDK — ещё короче:
# pip install openai-agents
from agents import Agent, Runner
agent = Agent(name="Помощник", instructions="Ты полезный ассистент")
result = Runner.run_sync(agent, "Напиши хокку про программирование.")
print(result.final_output)
В обоих случаях модель сама решает, когда вызвать инструмент, а когда просто ответить текстом. Это и есть агентность — модель выбирает действие, а не только генерирует слова.
Ограничения
Ограничения
Что учитывать
Агенты не всесильны. Понимание границ экономит больше времени, чем попытки их обойти.
Ненадёжность на длинных цепочках — если каждый шаг агент выполняет с вероятностью 90%, то задача из десяти шагов завершится успешно в 35% случаев.
При 66% на шаг (уровень 2026 года) десять шагов почти никогда не доходят до конца. Ошибки накапливаются. Решение: дробите задачу на короткие этапы и проверяйте каждый.
Стоимость — расход токенов растёт нелинейно.
Диалог с контекстом 50K токенов стоит в 8–10 раз дороже короткого. Для регулярных длинных задач делите сценарий на части или используйте суммирование.
Галлюцинации — модель может уверенно выдать неверный факт.
Агент не отличает правду от выдумки — он генерирует правдоподобный текст. Критические факты нужно проверять внешними инструментами.
Безопасность — агент действует в реальном мире.
Если он читает веб-страницу со скрытой инструкцией (prompt injection), то может выполнить чужое указание, думая, что это часть задачи. Любой внешний контент — недоверенный.
Скорость — агент делает несколько шагов, каждый требует обращения к модели.
На задачу из 5–10 шагов уходит 30–120 секунд. Для быстрых ответов агент избыточен.
Антипаттерны
Антипаттерны
Чего не делать
Автоматизировать всё сразу — запускать агента на всех задачах без приоритизации.
Начинайте с одного понятного сценария, где ошибка недорога.
Давать слишком много инструментов — чем больше инструментов, тем хуже модель выбирает нужный.
Держите набор минимальным и описывайте каждый точно.
Игнорировать человеческий контроль — без проверки первые релизы дают 15–25% ложных срабатываний.
Платежи, удаления, отправка писем — требуют подтверждения человека.
Не логировать шаги — если вы не видите, что агент делал на каждом шаге, вы не сможете найти, где он свернул не туда.
Записывайте каждое рассуждение, каждый вызов инструмента, каждый результат.
Ожидать полной автономии — 66% успеха на изолированной задаче не значит 66% в реальном продакшене.
Демо впечатляет, реальный мир сложнее.
Чеклист
Чеклист
Проверка перед запуском
Цель определена и измерима
— записана метрика успеха (точность 85%, время ответа под 30 секунд), а не «стало лучше».
Инструменты описаны точно — каждый инструмент имеет имя, описание и схему параметров.
Модель знает, когда и какой вызывать.
Количество инструментов минимально
— 3–5 хорошо описанных лучше, чем 20 плохо описанных.
Контролируемые действия ограничены
— список того, что агент не делает без подтверждения человека: платежи, удаления, отправка внешних сообщений.
Логирование включено — каждый шаг записан:
рассуждение модели, вызов инструмента, результат, потраченные токены.
Таймаут установлен — агент не может работать бесконечно.
Жёсткий лимит на время и количество шагов.
Тестирование проведено
— запуск на десяти примерах с известным правильным ответом, прежде чем давать реальные задачи.
Ссылки
Ссылки
- Документация: LangChain
- Документация: CrewAI
- Документация: OpenAI Agents SDK
- Стандарт: Model Context Protocol
- Репозиторий: LangChain
- Репозиторий: CrewAI