Представьте, что вы дали задачу ассистенту: «Найди дешёвые билеты в Москву на пятницу, забронируй, пришли подтверждение». Чат-бот ответит: «Вот ссылка на сайт авиакомпании, ищите сами». Агент — откроет сайт, введёт даты, выберет рейс, оплатит и пришлёт посадочный талон. Разница в одном: агент действует, а не только разговаривает.

Что это

AI-агент — программа, которой дают цель и отпускают работать. Она сама разбирается в ситуации, сама решает, что делать дальше, сама пользуется инструментами — браузером, почтой, базой данных, кодом — и сама проверяет, получилось ли. Если не получилось, пробует другой подход. Так по кругу, пока задача не будет решена.

Мозг агента — большая языковая модель, LLM. Это программа, которая понимает текст и генерирует текст. GPT от OpenAI, Claude от Anthropic, Gemini от Google, Llama от Meta — всё это LLM. Сами по себе они умеют только отвечать на вопросы текстом. Агент оборачивает модель в «оболочку» из инструментов и инструкций, превращая собеседника в исполнителя.

Ключевое правило: чат-бот отвечает, агент действует. Если программа только пишет текст — это ассистент. Если она открывает сайты, запускает код, отправляет письма, меняет данные — это агент.

В 2026 году агенты перестали быть лабораторной демонстрацией. По данным Stanford HAI, в бенчмарке OSWorld — наборе задач на управление компьютером — агенты справляются с 66,3% заданий. Год назад было около 12%. Треть всё ещё проваливается, но прогресс за двенадцать месяцев — в пять раз. McKinsey сообщает, что 23% компаний уже внедряют агентов куда-то в бизнес-процессы. Ещё 39% экспериментируют.

Зачем нужно

  • Автоматизация рутины — агент читает почту, сортирует заявки, заполняет таблицы, отправляет ответы по шаблону. Освобождает человека от повторяющейся работы.
  • Работа с данными — агент ищет информацию в интернете, сравнивает цены, собирает отзывы, сводит в таблицу. Не нужно гуглить вручную десять вкладок.
  • Программирование — агент пишет код, запускает тесты, исправляет ошибки, открывает pull request. Часть работы разработчика уже можно делегировать.
  • Поддержка клиентов — агент разбирает тикеты, находит решение в базе знаний, отвечает клиенту или передаёт сложный случай человеку.
  • Мультимодальность — агент может не только работать с текстом, но и анализировать изображения, генерировать графику, работать с аудио и видео.

Как устроено

Любой агент, независимо от фреймворка, состоит из четырёх частей. Представьте сотрудника, которому нужен мозг, руки, память и план.

ЭлементЧто этоПростыми словами
Модель (LLM)Языковая модель — рассуждает и принимает решенияМозг сотрудника
ИнструментыФункции, которые агент может вызывать: браузер, код, API, файлыРуки сотрудника
ПамятьХранилище контекста: что уже сделано, какие были результатыПамять сотрудника
ПланированиеСпособность разбить задачу на шаги и решать, что дальшеПлан действий сотрудника

Модель

Модель — это «мозг» агента. Она читает задачу, рассуждает о ней, решает, какой инструмент вызвать, и оценивает результат. В 2026 году выбор моделей широк: GPT-5 и o-серия от OpenAI для сложных задач, Claude от Anthropic для длинного контекста и работы с инструментами, Gemini от Google для мультимодальности, DeepSeek для экономных сценариев, Llama от Meta и Qwen для запуска на собственном сервере.

Инструменты

Инструменты превращают модель из собеседника в исполнителя. Без них агент умеет только писать текст. С ними — открывать веб-страницы, запускать Python-код, читать и писать файлы, вызывать внешние API, работать с базами данных, управлять браузером.

Важно: инструменты — это то, что отличает агента от чат-бота. Чем точнее описан каждый инструмент (что делает, когда применять, какие параметры), тем лучше агент решает, когда его вызвать.

В 2024 году Anthropic выпустила Model Context Protocol, MCP — открытый стандарт для подключения инструментов к моделям. До MCP каждый разработчик писал свои коннекторы к каждому сервису отдельно. С MCP — один универсальный разъём. Образно это называют «USB-C для ИИ»: один коннектор работает с любой моделью и любым инструментом. К 2025 году OpenAI, Google и Microsoft добавили поддержку MCP.

Память

Память бывает трёх типов:

  • Краткосрочная — текущий контекст диалога. У современных моделей окно контекста достигает 200K–2M токенов. Токен — это примерно слово или его часть. 200K токенов — это книга на 500 страниц.
  • Долгосрочная — постоянное хранилище фактов и предпочтений. Обычно реализуется через векторные базы данных: Pinecone, Chroma, Qdrant. Векторная база — хранилище, где текст хранится как набор чисел, что позволяет искать по смыслу, а не по точному совпадению слов.
  • Эпизодическая — воспоминания о конкретных прошлых сессиях. Нужна, когда агент должен учитывать, что уже пробовал в прошлый раз и к чему это привело.

Планирование

Планирование — способность агента разбивать сложную задачу на шаги, выбирать порядок действий и исправляться при неудачах. Основной паттерн называется ReAct — Reasoning + Acting, «рассуждение и действие». Агент думает вслух: «Мне нужно найти цены на билеты. Сначала открою сайт. Получил результат — теперь сравню. Сравнил — теперь выберу самый дешёвый». Если шаг не удался, агент видит это в результате и пробует другой подход.

Совет: если агент «зацикливается» — повторяет один и тот же шаг без результата — проблема обычно в плохом описании инструментов или недостаточной инструкции. Точный системный промпт с ограничением количества попыток решает это.

Агентный цикл

Весь процесс выглядит так:

  1. Пользователь даёт цель — например, «найди дешёвые билеты в Москву на пятницу».
  2. Агент читает задачу и планирует шаги — «открыть сайт, ввести даты, отсортировать по цене».
  3. Агент вызывает инструмент — открывает браузер, вводит данные.
  4. Агент проверяет результат — видит список рейсов.
  5. Агент решает, что делать дальше — сравнивает цены, выбирает лучший.
  6. Цикл повторяется, пока цель не достигнута.

Какие бывают агенты

По типу работы

ТипЧто делаетПример
РефлексивныйРеагирует на текущую ситуацию без памяти о прошломАвтоответчик, который определяет тему письма и отвечает по шаблону
ЦелевойПолучает цель и планирует маршрут к нейАгент, который находит билеты и бронирует рейс
УтилитарныйОценивает несколько вариантов и выбирает лучший по заданному критериюАгент, который сравнивает тарифы и выбирает оптимальный
На основе моделиСтроит внутреннюю модель мира и предсказывает последствия действийАгент, который проверяет, не сломает ли изменение кода другие части программы

По количеству агентов

Один агент. Решает задачу самостоятельно. Простой и дешёвый вариант. Подходит, когда задача укладывается в один контур: нашёл — обработал — ответил.

Мультиагентная система. Несколько агентов работают вместе. Каждый специализируется на своём: один пишет код, второй проверяет, третий пишет документацию. Самый распространённый паттерн — «оркестратор и исполнители». Один агент-менеджер разбивает задачу на части и раздаёт их агентам-специалистам. Когда один агент не справляется, он делегирует другому.

Внимание: мультиагентные системы стоят дороже — больше моделей, больше вызовов, больше точек отказа. Если один агент с хорошими инструментами справляется, не нужно добавлять второй. Дополнительные агенты оправданы, когда задача охватывает принципиально разные области: например, исследование + написание + проверка фактов.

Когда использовать

СитуацияПодходит / не подходитПочему
Повторяющаяся работа по чёткому сценариюПодходитАгент делает одно и то же без усталости и ошибок внимания
Задача с чёткой целью и измеримым результатомПодходитЕсть критерий завершения — агент знает, когда остановиться
Креативная работа без чётких границНе подходитНет критерия «готово», агент будет бесконечно уточнять
Задача с высокими рисками при ошибкеТолько с человекомПлатежи, удаления, юридические решения — нужен контроль
Простые ответы на вопросыНе нужна агентностьОбычный чат-бот или LLM справится дешевле

Фреймворки — на чём пишут агентов

Фреймворк — это набор готовых инструментов и шаблонов для создания агентов. Большинство фреймворков — библиотеки на Python: устанавливаются одной командой, импортируешь в код — и агент готов. Как каркас здания: стены, перекрытия и крыша уже есть, остаётся добавить внутреннюю отделку.

ФреймворкНазначениеКому подходит
LangChain / LangGraphСамый расширяемый — 1000+ интеграций, графовая оркестрацияКомандам, которым нужна гибкость и наблюдаемость
CrewAIМультиагентные команды с ролями — «исследователь», «писатель», «редактор»Проектам, где несколько агентов работают вместе
OpenAI Agents SDKМинимум абстракций, глубокая интеграция с моделями OpenAIКомандам в экосистеме OpenAI
Hermes AgentOpen-source, локальный запуск, поддержка MCP, голос и мессенджерыРазработчикам, которые хотят полный контроль и приватность

LangChain

LangChain — самый известный фреймворк для создания агентов. Главная функция — create\_agent, которая собирает агента из модели, инструментов и инструкций. Работает с любым провайдером моделей: OpenAI, Anthropic, Google, Ollama (локальный запуск). LangGraph — модуль для сложных сценариев: ветвлений, циклов, параллельных потоков. LangSmith — инструмент для отладки и мониторинга: показывает каждый шаг агента, сколько токенов потратил, где ошибся.

CrewAI

CrewAI — фреймворк для мультиагентных систем. Вы описываете агентов как членов команды: у каждого роль, цель и набор инструментов. «Исследователь» ищет данные в интернете, «писатель» пишет текст, «редактор» проверяет факты. Агенты общаются между собой и делегируют подзадачи.

OpenAI Agents SDK

OpenAI Agents SDK — официальный набор от OpenAI. Три базовых понятия: Agent (модель с инструкциями и инструментами), Handoff (передача задачи от одного агента другому), Guardrail (проверка входа и выхода на безопасность). Минимум концепций — максимум простоты. Установка одной командой: pip install openai-agents.

Hermes Agent

Hermes Agent от Nous Research — open-source агент с акцентом на локальный запуск. Работает с любой моделью, не привязан к одному провайдеру. Поддерживает MCP из коробки. Умеет работать в мессенджерах (Telegram, Discord) и с голосом. Имеет систему «скиллов» — переиспользуемых пакетов знаний и процедур, которые агент загружает при необходимости.

Пример

Простейший агент на LangChain, который умеет узнавать погоду:

# pip install langchain "langchain[openai]"
from langchain.agents import create_agent

def get_weather(city: str) -> str:
    """Узнать погоду в указанном городе."""
    return f"В городе {city} сейчас +20, солнечно."

agent = create_agent(
    model="openai:gpt-5",
    tools=[get_weather],
    system_prompt="Ты помощник, который отвечает на вопросы о погоде.",
)

result = agent.invoke({
    "messages": [{"role": "user", "content": "Какая погода в Москве?"}]
})
print(result["messages"][-1].content)

Агент на OpenAI Agents SDK — ещё короче:

# pip install openai-agents
from agents import Agent, Runner

agent = Agent(name="Помощник", instructions="Ты полезный ассистент")
result = Runner.run_sync(agent, "Напиши хокку про программирование.")
print(result.final_output)

В обоих случаях модель сама решает, когда вызвать инструмент, а когда просто ответить текстом. Это и есть агентность — модель выбирает действие, а не только генерирует слова.

Ограничения

Ограничения

Что учитывать

Агенты не всесильны. Понимание границ экономит больше времени, чем попытки их обойти.

Ненадёжность на длинных цепочках — если каждый шаг агент выполняет с вероятностью 90%, то задача из десяти шагов завершится успешно в 35% случаев.

При 66% на шаг (уровень 2026 года) десять шагов почти никогда не доходят до конца. Ошибки накапливаются. Решение: дробите задачу на короткие этапы и проверяйте каждый.

Стоимость — расход токенов растёт нелинейно.

Диалог с контекстом 50K токенов стоит в 8–10 раз дороже короткого. Для регулярных длинных задач делите сценарий на части или используйте суммирование.

Галлюцинации — модель может уверенно выдать неверный факт.

Агент не отличает правду от выдумки — он генерирует правдоподобный текст. Критические факты нужно проверять внешними инструментами.

Безопасность — агент действует в реальном мире.

Если он читает веб-страницу со скрытой инструкцией (prompt injection), то может выполнить чужое указание, думая, что это часть задачи. Любой внешний контент — недоверенный.

Скорость — агент делает несколько шагов, каждый требует обращения к модели.

На задачу из 5–10 шагов уходит 30–120 секунд. Для быстрых ответов агент избыточен.

Антипаттерны

Антипаттерны

Чего не делать

Автоматизировать всё сразу — запускать агента на всех задачах без приоритизации.

Начинайте с одного понятного сценария, где ошибка недорога.

Давать слишком много инструментов — чем больше инструментов, тем хуже модель выбирает нужный.

Держите набор минимальным и описывайте каждый точно.

Игнорировать человеческий контроль — без проверки первые релизы дают 15–25% ложных срабатываний.

Платежи, удаления, отправка писем — требуют подтверждения человека.

Не логировать шаги — если вы не видите, что агент делал на каждом шаге, вы не сможете найти, где он свернул не туда.

Записывайте каждое рассуждение, каждый вызов инструмента, каждый результат.

Ожидать полной автономии — 66% успеха на изолированной задаче не значит 66% в реальном продакшене.

Демо впечатляет, реальный мир сложнее.

Чеклист

Чеклист

Проверка перед запуском

Цель определена и измерима

— записана метрика успеха (точность 85%, время ответа под 30 секунд), а не «стало лучше».

Инструменты описаны точно — каждый инструмент имеет имя, описание и схему параметров.

Модель знает, когда и какой вызывать.

Количество инструментов минимально

— 3–5 хорошо описанных лучше, чем 20 плохо описанных.

Контролируемые действия ограничены

— список того, что агент не делает без подтверждения человека: платежи, удаления, отправка внешних сообщений.

Логирование включено — каждый шаг записан:

рассуждение модели, вызов инструмента, результат, потраченные токены.

Таймаут установлен — агент не может работать бесконечно.

Жёсткий лимит на время и количество шагов.

Тестирование проведено

— запуск на десяти примерах с известным правильным ответом, прежде чем давать реальные задачи.

Ссылки

Ссылки