Неискусственный интеллект
Когда даже агенту нужен контракт
AI Ready-подход использует агентов для создания продуктов на данных: моделей машинного обучения, отчётов и дашбордов. До подключения языковой модели платформа должна подготовить данные, их описание, правила доступа и процессы разработки. Как это сделать, на IT Elements рассказали Павел Егоров из «Инфосистемы Джет» и Александр Анисимов из Arenadata.
👁 Работа начинается с аналитики и проектирования. Агент-аналитик собирает документацию, опросы бизнеса и сведения об источниках, готовит спецификацию продукта и связывает показатели с бизнес-глоссарием. Затем агент-проектировщик создаёт дата-контракт — описание структуры данных и правил их изменения, — а также модели хранения и бизнес-смысла.
Информационные активы должны быть описаны, а качество данных проверено. Человек способен заметить недостающий контекст сам, агенту его нужно предоставить в цифровом виде. Источником становится дата-каталог: из него агент узнаёт, где хранятся данные, как рассчитывается показатель и насколько этим данным можно доверять.
💻 Затем подключается агент-разработчик. Он получает контекст от аналитика и проектировщика, формирует параметры модели dbt и выбирает шаблон для генерации кода. dbt описывает преобразования данных с помощью SQL и благодаря коннекторам работает с разными аналитическими движками. Airflow управляет очередностью и запуском задач.
Дальше включается привычный конвейер разработки: скрипты проверки, автоматические тесты, контроль качества и согласование старшим разработчиком. Инструменты должны поддерживать шаблонную генерацию кода, встраиваться в CI/CD — автоматическую проверку и доставку релизов — и передавать агентам контекст через MCP-серверы.
Такой подход делает результат стабильнее. При слишком широкой постановке разные запуски модели создают разные артефакты, а повторная загрузка всей документации раздувает расход токенов. Поэтому агент выдаёт параметры преобразования, код собирается из проверенных шаблонов, а человек контролирует ключевые решения.
❓ Сама платформа данных проходит три уровня подготовки. Первый — порядок. Iceberg обеспечивает надёжные транзакции, изменение структуры и доступ к предыдущим версиям таблиц. Hive Metastore служит каталогом метаданных, Schema Registry проверяет совместимость схем сообщений, Ranger управляет правами и аудитом, Vault хранит пароли, токены и другие секреты.
Этот фундамент строили ради управляемости и безопасности. Агенты повышают его приоритет: то, что для человека было лучшей практикой, для машины становится обязательным условием.
ℹ️ Второй уровень — контекст. Агент должен знать структуру таблиц и lineage — происхождение данных и маршрут их преобразований. К этому добавляются статистика, события и телеметрия. Для потоковых данных нужен такой же полный маршрут. Например, в CDC-пайплайне, фиксирующем изменения в исходной базе, агент должен видеть путь события от Debezium через Kafka до записи в Iceberg и понимать, что изменилось по дороге.
🤖 Третий уровень — целевая архитектура для машинных пользователей. API и единая SQL-точка входа дают программный доступ к платформе, а MCP-серверы должны описывать инструменты и правила их вызова. Функции для администраторов ещё предстоит превратить в ограниченные и понятные машине операции.
Сам агент должен стать субъектом информационной безопасности: работать от имени конкретного пользователя, наследовать его права и оставлять журнал действий. После ошибки команда должна восстановить полученный моделью контекст, принятое решение и выполненную команду.
AI Ready в итоге описывает зрелость всей платформы. Если изменение схемы замечает только человек, права агента определены приблизительно, а происхождение данных теряется по дороге, более сильная модель систему не спасёт.
@anti_agi Если у вас установлено приложение,
вы можете сразу перейти в канал