Антон Хаймовский, Content AI: «Интеллектуальная обработка документов умрет как класс, — и это хорошая новость»
Рынок интеллектуальной обработки документов проходит через полную смену парадигмы. Распознавание документов как таковое уже в меньшей степени интересно заказчикам. Антон Хаймовский, главный владелец продукта ContentCapture компании Content AI, рассказал TAdviser, сколько осталось жить классическим IDP-системам, как галлюцинации LLM тормозят внедрения и почему ИИ-агенты — это основа для всей корпоративной автоматизации.
— Как за последний год изменился спрос на решения для автоматической обработки документов?
— Скажу откровенно — интерес к классическому распознаванию документов снижается. Но причина не в том, что этих задач больше нет на рынке. Происходит естественная эволюция спроса. Раньше заказчику было достаточно, чтобы система вытащила из документа нужные поля и отдала JSON или XML. Сейчас этого уже мало. Компании хотят, чтобы система работала с извлеченными сущностями, включалась в процесс сквозной автоматизации.
— То есть граница задачи раздвигается?
— Именно так. Возьмем рутинную обработку входящего счета. Классическая IDP-система распознает документ, забирает реквизиты, сумму и выгружает их в 1С. На этом ее работа заканчивается. В новой парадигме в этот пул задач включаются этапы, которые без агентной автоматизации и LLM реализовать невозможно. Например, в рамках глубокой комплаенс-проверки контрагента агент самостоятельно собирает неструктурированные данные из открытых источников — новостей, отзывов и реестров — анализирует этот массив с помощью LLM и формирует краткое аргументированное резюме о рисках. Классическим кодом такую аналитику не напишешь.
Или другой пример: агент анализирует историю email-переписки с партнером, чтобы убедиться, что сумма в счете соответствует новым договоренностям, даже если они еще не зафиксированы в допсоглашении. Если есть расхождения, ИИ-агент сам генерирует черновик вежливого письма-уточнения менеджеру контрагента, ссылаясь на контекст прошлых писем. С учетом выявленных нюансов и рисков, система выстраивает динамический маршрут согласования внутри компании. Для решения таких задач, требующих понимания смысла и контекста, требуется полноценная мультиагентная система. Мы как вендор должны реагировать на эти ожидания, тем более что рыночный запрос на такую автоматизацию очевиден и продолжает расти.
— Как появление LLM изменило возможности IDP-платформ?
— Мы еще два года назад понимали, что LLM и VLM в конечном счете вытеснят классические подходы к распознаванию и извлечению данных. Тогда мы предполагали, что горизонт этих изменений будет в пределах пяти-семи лет. Сейчас я думаю, что это произойдет через год-полтора. LLM уже сегодня достаточно качественно распознают документы. Но «качество» — это не только точность. Это еще и скорость, и стоимость инференса. По скорости и требованиям к GPU классические подходы пока выигрывают. Мы уверены, что от этого преимущества в скором времени ничего не останется.
Сегодня при применении генеративных моделей есть ряд ограничений, которые пока не решены разработчиками. Первое — это галлюцинации. В крупном бизнесе ошибка распознавания одной цифры в счете может иметь серьезные последствия. Классические IDP-системы подсвечивают неуверенно распознанные символы. LLM просто скажет «здесь — 15», хотя на самом деле 10, и никак это не обозначит.
Второе ограничение — невозможность использовать облачные модели для большинства корпоративных игроков. Крупный заказчик из государственного сектора рассказывал нам об опыте тестирования облачных моделей. Результаты распознавания его устроили, но использовать их они не могут по соображениям безопасности. Локальных моделей сопоставимого качества пока не существует. Вот и тупик. Поэтому мы придерживаемся гибридного подхода, в котором классические алгоритмы распознавания работают в связке с мультимодальными моделями (VLM) при обработке неструктурированных документов. Но это временная архитектура, пока локальные модели по качеству не догонят облачные. А до тех пор человек обязательно должен оставаться в контуре задачи и верифицировать результаты работы модели.
— Некоторые IDP-вендоры начинают встраивать RPA, а RPA-вендоры — усиливать OCR. Куда это приведет отрасль?
— Этому тренду уже лет десять. Когда UiPath отказалась от стороннего OCR и сделала собственный, стало понятно, что каждый вендор будет тянуть к себе максимум ценности. Российские игроки идут тем же путем. Это рационально: зачем заказчику интегрировать два решения, если можно взять одно? Но я скажу жестче: и IDP, и RPA в нынешнем виде в горизонте пяти лет перестанут существовать как самостоятельные классы. Их поглотят агентные платформы. Распознавание документов станет одним из навыков агента — инструментом внутри более широкой системы автоматизации. RPA-вендоры уже чувствуют эту логику и смотрят в сторону процессной аналитики (process mining). Но агентная автоматизация идет еще дальше. Мы не видим в этом катастрофы, это следующий уровень зрелости рынка, и Content AI уже адаптирует свои решения под эту реальность.
— Как этот поворот рынка отражается на вашем продукте?
— Платформа ContentCapture 14.13, которая вышла в апреле, — уже принципиально другой продукт. Если коротко, то мы объединили распознавание документов, инструменты роботизации и управление кодом в едином решении. Причем сценарии автоматизации теперь не привязаны к документам, платформа работает с любыми бизнес-процессами: может совершать различные операции с документами, синхронизировать данные из разных источников — и все это в интеграции с CRM, ERP и другими корпоративными системами. Раньше, чтобы построить сквозной процесс, нужно было брать IDP у одного вендора, RPA у другого, выстраивать интеграцию. И это сразу давало плюс 30−50% к стоимости проекта. Сейчас все инструменты есть внутри одной платформы.
Новая ContentCapture позволяет автоматизировать процесс, который вообще не начинается с документа, а с какого-либо события. Стартовой точкой, например, может служить ERP: система фиксирует изменение уровня запасов и сама создает заказ поставщику, обрабатывает поступивший счет, сверяет его условия с договором, отправляет на согласование и проводит в 1С. Приведу один пример из области делопроизводства: платформа разбирает входящие письма или обращения, классифицирует их, маршрутизирует по исполнителям, выдает поручения и контролирует сроки.
Важно, что настраивать сценарии и управлять всеми процессами заказчик может самостоятельно, без постоянного участия подрядчика. Сценарии автоматизации описываются на естественном языке, после чего ИИ на основе предоставленного примера генерирует нужный код и тесты к нему. Если код не заработал с первого раза, достаточно передать в систему лог ошибки и ИИ сам его поправит. Это принципиально меняет ситуацию для внутренних команд. Раньше любая доработка означала обращение к интегратору или вендору и ожидание, которое в некоторых случаях могло достигать месяцев. Сейчас бизнес-аналитик видит, что происходит на каждом шаге бизнес-процесса и может сам быстро внести изменения.
— А что дальше — следующее поколение?
— Наш следующий шаг — полноценная платформа ИИ-агентов, которая работает как надстройка над любыми системами заказчика: 1С, CRM, СЭД. Каждая из них становится инструментом для агента: в рамках настроенного сценария он забирает оттуда данные или сверяется с ними. Главная ценность такой платформы — отсутствие ограничений по сценариям: по мере роста автоматизации агенты могут брать на себя любые операции с данными в любых процессах. Мы провели большое количество встреч с представителями компаний из разных отраслей и видим устойчивый спрос на несколько типов задач. В их числе ускорение ручного сбора данных из разрозненных систем, проверка документов и контрагентов, подготовка черновиков заключений и аналитических справок, генерация документов по шаблонам. Во всех этих сценариях агент полностью снимает с сотрудников рутинную часть работы и оставляет за человеком только финальное решение.
— Что меняется в требованиях к платформам, когда речь заходит о сквозной автоматизации, а не об отдельной операции?
— Главное условие — оркестрация. Если автоматизируется процесс целиком, должен быть механизм, который управляет последовательностью шагов и распределяет задачи между агентами. Второе — готовые коннекторы: к 1С, к почтовым серверам, к шинам данных. Заказчики сегодня не будут платить за кастомную интеграцию миллион рублей, их интересует коробочное решение. Третье — low-code/no-code инструменты. Бизнес-аналитики должны самостоятельно настраивать пайплайны, не погружаясь в разработку. Четвертое — инструменты мониторинга работы системы. Крайне важно собирать логи действий LLM, осуществлять версионирование промптов и аудит каждого решения. Эти методики позволяют раскрыть логику моделей в том или ином процессе. И пятое — информационная безопасность. Для российских заказчиков — это фундаментальное требование.
— Клиенты сейчас предпочитают точечные решения или платформенный подход?
— Пока — точечные. Но запросы на платформенное внедрение постепенно растут. Такой подход требует серьезной перестройки архитектуры. Это большие затраты и большая работа. Крупный бизнес хочет разворачивать агентов у себя в контуре и не зависеть от внешних облаков. Фактически они хотят, чтобы вся галерея моделей крутилась на их собственных серверах. Но здесь мы упираемся в инфраструктурную стоимость. Нам удается ее частично снизить за счет применения классического OCR. Распознавание документов — самый ресурсоемкий инструмент агента, и в нашем случае оно не требует GPU. Тем не менее кластер под остальные задачи все равно нужен, и его стоимость может достигать 20 миллионов рублей при цене лицензии платформы в 2 миллиона. Пока это останавливает многих.
— On-premise или облако — что выбирают заказчики сегодня?
— Для корпоративного сектора почти всегда on-premise. 152-й ФЗ, банковская тайна, коммерческая тайна — эти ограничения никуда не делись. Облако рассматривают только крупные компании с собственными частными облачными контурами. SaaS в публичном облаке — удел малого и среднего бизнеса. Эта картина, кстати, характерна не только для России. Крупные международные компании отказывались от облачных IDP-решений по тем же причинам. Есть показательные примеры с продуктами, которые изначально строились только с ориентацией на облако, но так и не смогли войти в корпоративный сегмент.
— Как оценивают ROI от IDP-проектов? И действительно ли их вообще считают?
— Как ни странно, до недавнего времени почти не считали. Главным мотивом была не рентабельность инвестиций в автоматизацию, а импортозамещение. Сейчас ситуация меняется. Все чаще заказчики спрашивают: «Какой конкретный эффект мы увидим — в деньгах, в сокращении человеко-часов?» И это честный вопрос. Ключевые метрики, по которым можно измерить эффективность проекта, — сколько человек высвободится, снижение временных затрат на операции, снижение количества ошибок, и, конечно, рентабельность инвестиций.
— Какие мировые тренды в области обработки документов актуальны для России, а где у нас своя специфика?
— К общим трендам можно отнести переход к агентам и гибридные архитектуры. Бизнес на своем опыте убедился, что сценарий а-ля «подключить LLM и ждать магии» — не работает. Гибрид технологий, например, IDP и генеративных моделей, плюс маленькие специализированные агенты на узких когнитивных функциях — это и есть то, к чему сейчас движется рынок
Еще один вектор — гиперперсонализация решений. Рынок движется в сторону автоматизации, заточенной под конкретные процессы компаний. Это может быть обработка счетов, комплаенс-проверки, онбординг новых сотрудников. Далее эти блоки, как набор кубиков, собираются в единой платформе. Мы придерживаемся той же логики: начинаем с одного сценария, который дает быстрый и измеримый результат, а дальше масштабируем автоматизацию на другие процессы. То есть предлагаем заказчику не рыбу и не удочку, а доступ к океану.
Из специфики российского рынка — ставка на отечественные модели вместо зарубежных облачных. Все признают, что они хуже по качеству, зато исключают зависимость от иностранных вендоров. Еще один характерный для отечественного рынка фактор — сложность подключения к так называемым legacy-системам. Часто они не имеют API, поэтому приходится прибегать к нестабильным связкам через кликеры. Это делает коробочную интеграцию крайне сложной задачей.
У российских вендоров гораздо меньше коннекторов, чем у международных игроков типа UiPath с их тысячами готовых интеграций. У нас их мало, но каждый нетиповой и потому крайне трудоемкий для разработки.
— Какие нерешенные проблемы тормозят переход IDP-рынка к новой фазе?
— Прежде всего — стоимость инфраструктуры. Агентная автоматизация сегодня по карману только крупному бизнесу. Двадцать миллионов рублей на GPU-кластер — это не то, что готов потратить средний завод или региональный банк. Вторая проблема — регуляторная неопределенность. Мы не знаем, какими будут законодательные требования к применению ИИ в бизнес-процессах. Это в значительной мере сдерживает инвестиции. Третья — галлюцинации LLM. Пока нет надежного механизма автоматической верификации, человек остается обязательным элементом любого серьезного решения. Четвертая — интеграционный барьер. У enterprise-заказчиков масса legacy-систем без API. Агент, который вынужден «кликать» по интерфейсу вместо вызова API, не выглядит надежным решением. Это не проблема агентов, это проблема ИТ-ландшафта, который формировался десятилетиями.
И пятая — отсутствие культуры измерений. На западном рынке до старта пилота согласовывают метрики, по итогам замеряют статусы в формате «было/стало». В России этой практики почти нет. Сейчас она начинает появляться, заказчики все чаще спрашивают про ROI, но пока это скорее исключение.