Unstract: извлечение данных из документов с помощью LLM
Zipstack выпустила Unstract — открытую no-code платформу для структурированного извлечения данных из PDF, сканов и изображений с помощью LLM.
PDF — не приговор: Unstract превращает документы в чистый JSON
Kompания Zipstack развивает открытую платформу Unstract — инструмент, который берёт любой неструктурированный документ (PDF, скан, изображение, таблицу) и возвращает аккуратный JSON, готовый к загрузке в базу данных. Вместо регулярных выражений и хрупких шаблонов — обычный текстовый промпт на естественном языке. Результат разворачивается как REST API или ETL-пайплайн буквально за несколько минут.
Что такое Unstract и зачем он нужен
Организации ежедневно получают тонны документов: счета-фактуры, медицинские записи, страховые полисы, KYC-анкеты. Вручную разбирать их дорого, а классические парсеры ломаются при малейшем изменении формата. Unstract решает эту задачу через LLM: вы один раз описываете, что хотите извлечь, — платформа сама справляется с вариациями документов.
«Unstract — no-code платформа, которая устраняет ручные процессы, связанные с неструктурированными данными, используя возможности LLM.»
Ключевые возможности
| Функция | Описание |
|---|---|
| Prompt Studio | Визуальный редактор схем извлечения на естественном языке |
| API Deployment | Отправляешь документ по REST API — получаешь JSON |
| ETL Pipeline | Документы из S3/Google Drive → обработка → загрузка в хранилище |
| MCP Server | Интеграция с AI-агентами (Claude и др.) через Model Context Protocol |
| n8n Node | Готовый узел для автоматизационных воркфлоу n8n |
До и после: что меняется с Unstract
| Задача | Без Unstract | С Unstract |
|---|---|---|
| Описание схемы | Regex, шаблоны под каждого вендора | Один промпт, автообработка вариаций |
| Новый тип документа | Дни разработки | Минуты в Prompt Studio |
| Интеграция LLM | Собственный пайплайн | Любой провайдер «из коробки» |
| Деплой | Собственная инфраструктура | ./run-platform.sh или облако |
| Результат | Неструктурированный текст | Чистый JSON для базы данных |
Поддерживаемые LLM-провайдеры и хранилища
Unstract поддерживает широкий спектр LLM и систем хранения:
LLM-провайдеры: OpenAI, Azure OpenAI, Anthropic Claude, AWS Bedrock, Google Gemini, Mistral AI, Ollama (локально), Anyscale.
Векторные базы данных: Qdrant, Pinecone, Weaviate, Milvus, PostgreSQL.
ETL-источники: AWS S3, MinIO, Google Cloud Storage, Azure Blob, Google Drive, Dropbox, SFTP.
ETL-назначения: Snowflake, Amazon Redshift, Google BigQuery, PostgreSQL, MySQL, Oracle, SQL Server.
Для локального запуска нужны Docker, Docker Compose, Git и 8 ГБ ОЗУ. Три команды — и платформа готова:
git clone https://github.com/Zipstack/unstract.git
cd unstract
./run-platform.sh
Откройте http://frontend.unstract.localhost и входите с логином unstract / паролем unstract.
Архитектура платформы
graph TD
A[Frontend React] --> B[Backend Django]
B --> C[Worker Celery]
B --> D[Platform Service FastAPI]
C --> E[Cache Redis]
C --> F[Message Queue RabbitMQ]
B --> G[Database PostgreSQL]
B --> H[LLM Adapters]
B --> I[Vector DBs]
B --> J[Text Extractors]
Стек полностью открытый: React на фронтенде, Django + FastAPI на бэкенде, Celery для воркеров, Redis как кэш, RabbitMQ как очередь сообщений, PostgreSQL для хранения данных.
Enterprise и облако
Помимо open-source версии, Zipstack предлагает облачный и корпоративный уровень:
- LLMChallenge — двойная верификация через два независимых LLM
- SinglePass & Summarized Extraction — снижение затрат на токены
- Human-in-the-Loop — интерфейс ручной проверки с подсветкой в документе
- SSO & RBAC — SAML/OIDC и ролевой контроль доступа
- Сертификаты SOC 2, HIPAA, ISO 27001, GDPR
Целевые отрасли
Платформа ориентирована прежде всего на финансы и банкинг, страхование, здравоохранение и KYC/комплаенс — везде, где критична точная обработка документов с переменной структурой.
ENCRYPTION_KEY из файла backend/.env в надёжном месте. Без него доступ к уже настроенным адаптерам будет утрачен безвозвратно.Вывод
Unstract занимает чёткую нишу: это производственный инструмент для команд, которым нужно регулярно и надёжно перегонять неструктурированные документы в данные. Открытый исходный код (лицензия AGPL-3.0), поддержка всех крупных LLM-провайдеров и готовые коннекторы к популярным хранилищам делают его серьёзной альтернативой как самописным решениям, так и проприетарным сервисам. На GitHub проект уже набрал более 7 000 звёзд.