RAGFlow: открытый RAG-движок с агентами и глубоким парсингом документов

RAG переживает глубокую метаморфозу — из узкого паттерна «Retrieval-Augmented Generation» он превращается в полноценный «Context Engine» с интеллектуальным поиском в основе. RAGFlow — один из самых убедительных ответов на этот вызов: production-ready движок от команды InfiniFlow, который объединяет глубокое понимание документов, агентные сценарии и MCP в одном открытом проекте.

Что такое RAGFlow и для кого он создан

RAGFlow — open-source RAG-движок, который превращает ваши документы, PDF, таблицы и базы данных в доступную для поиска AI-базу знаний. В отличие от LangChain, где нужно кодировать каждый шаг, RAGFlow предоставляет визуальный конструктор пайплайнов с глубоким парсингом документов, который реально понимает таблицы, изображения и сложные макеты.

Проект ориентирован на несколько категорий пользователей:

  • Разработчики и ML-инженеры — строят корпоративные базы знаний с минимальным кодом
  • Компании с большим документооборотом — юридические, медицинские, финансовые организации
  • Независимые консультанты — создают AI-решения для SMB-клиентов
  • Исследователи — экспериментируют с передовыми RAG-техниками

Оркестрация RAG адаптирована как для персональных приложений, так и для крупных корпоративных экосистем.

ℹ Открытый исходный код
RAGFlow распространяется под лицензией Apache 2.0. Проект полностью открыт и бесплатен; официальный репозиторий на GitHub набрал более 33 000 звёзд, что свидетельствует о широком принятии сообществом.

Ключевые возможности

1. Глубокое понимание документов

Глубокое понимание документов позволяет извлекать знания из неструктурированных данных сложных форматов. Поддерживаются Word, PowerPoint, Excel, TXT, изображения, отсканированные копии, структурированные данные, веб-страницы и многое другое.

RAGFlow превосходно справляется с извлечением информации из сложных документов, включая таблицы и визуальные элементы. Визуализация разбивки текста на чанки позволяет человеку вмешаться и скорректировать процесс.

2. Прозрачные ссылки и цитируемость

Быстрый просмотр ключевых ссылок и отслеживаемые цитаты обеспечивают обоснованные ответы. Система находит «иголку в стоге сена» буквально в неограниченном количестве токенов.

3. Агентный воркфлоу и MCP

RAGFlow обеспечивает единую оркестрацию агентов и рабочих процессов; агент полностью переработан с поддержкой конфигураций Multi-Agent, планирования и рефлексии, а также визуальных возможностей.

Полная поддержка MCP: импорт MCP-серверов, агенты выступают MCP-клиентами, а сам RAGFlow функционирует как MCP-сервер.

4. Память агентов

Ключевым нововведением стал модуль Memory, наделяющий AI-агентов долговременной памятью: он не только обеспечивает извлечение в реальном времени наиболее релевантного исторического опыта, но и поддерживает непрерывное накопление и оптимизацию базы знаний.

5. GraphRAG и TreeRAG

GraphRAG в RAGFlow подходит для связанного, структурированного контента. TreeRAG использует LLM в офлайн-фазе для автоматического анализа документов и построения иерархической древовидной структуры-резюме.

6. Источники данных и интеграции

Поддерживается синхронизация данных из Confluence, S3, Notion, Discord, Google Drive. Последний релиз добавил Google BigQuery как коннектор для инкрементной синхронизации документов.

7. Мессенджеры и голос

Добавлена поддержка нескольких чат-каналов: Feishu, Discord, Telegram, Line и других. RAGFlow версии 0.23.0 поддерживает сквозной голосовой ввод и вывод, позволяя создавать голосовые агентные приложения, в том числе цифровых людей.

8. Поддержка ведущих LLM

Поддерживаются последние модели серии GPT-5 от OpenAI. Также поддерживается Gemini 3 Pro. Помимо этого, доступна интеграция с локальными моделями через Ollama.

💡 Совет по парсингу
В качестве методов парсинга документов поддерживаются MinerU и Docling — они особенно полезны для сложных PDF с таблицами и многоколоночными макетами.

Как работает RAGFlow: архитектура


graph TD
    A[Источники данных\nPDF / Word / Excel / S3 / BigQuery] --> B[Парсинг и OCR\nSoMark, MinerU, Docling]
    B --> C[Чанкинг с визуализацией]
    C --> D[Индексация\nElasticsearch / Infinity]
    D --> E[Hybrid Search\nВекторный + полнотекстовый]
    E --> F[Retrieval с цитатами]
    F --> G[LLM генерация\nGPT-5 / Gemini / Ollama]
    G --> H[Ответ с источниками]
    I[Agent + MCP-серверы] --> E
    I --> G
    J[Memory-модуль] --> I

Тарифы и стоимость

RAGFlow полностью открыт и бесплатен; лицензия разрешает как коммерческое, так и некоммерческое использование без каких-либо оплат.

Вариант развёртыванияСтоимостьОсобенности
Self-hosted (Docker)$0 лицензияНужны свои серверы + LLM API
Railway / VPS~$20–40/мес. за инфраструктуруПростое облачное развёртывание
RAGFlow CloudПо запросуУправляемый SaaS от InfiniFlow
Elestio (managed)от $55/мес.Полностью управляемый хостинг

Небольшая команда, работающая в одном тенанте, обычно вкладывается в $20–40 в месяц на ресурсы, плюс расходы на LLM API (OpenAI, Anthropic или self-hosted Ollama).

RAGFlow полностью открыт под лицензией Apache 2.0 — без лицензионных сборов, платы за место или ограничений функций.

⚠ Важно про ресурсы
Парсинг 100-страничного PDF со сложными макетами может занять 2–5 минут на VPS с 4 vCPU. При первоначальной загрузке 10 000 документов начальная индексация может длиться 6–12 часов. Планируйте мощности заранее.

Плюсы и минусы

✅ Плюсы❌ Минусы
Полностью бесплатный Apache 2.0Сложный первоначальный деплой (Docker, Linux)
Лучший в классе парсинг сложных PDFРесурсоёмкий: нужны RAM ≥16 ГБ и хороший CPU
Прозрачные цитаты и трассируемостьОфициальные образы только для x86 (ARM — самосборка)
Визуальный no-code конструктор агентовUI менее зрелый по сравнению с Dify
MCP + Multi-Agent + Memory из коробкиДокументация частично на английском/китайском
GraphRAG и TreeRAG для связанных данныхElasticsearch требует отдельных ресурсов
Богатые коннекторы: S3, GDrive, BigQueryНе подходит для старта без базовых DevOps-навыков
Голосовой ввод/вывод, вебхукиCommunity поддержка, нет 24/7 enterprise SLA

Сравнение с альтернативами

RAGFlow берёт верх там, где важен качественный парсинг документов; Dify выигрывает в no-code скорости; LlamaIndex — в гибкости для разработчиков.

ПараметрRAGFlowDifyLlamaIndex
ТипПлатформа + движокLow-code платформаPython-фреймворк
ЛицензияApache 2.0 (бесплатно)Apache 2.0 / платный CloudMIT (бесплатно)
Парсинг документов⭐⭐⭐⭐⭐ глубокий, OCR⭐⭐⭐ базовый⭐⭐⭐⭐ через LlamaParse
Визуальный UI✅ есть✅ drag-and-drop❌ только код
Агентный воркфлоу✅ Multi-Agent + MCP✅ есть⚠️ LlamaAgents (бета)
GraphRAG✅ встроен❌ нет✅ через плагины
Голосовой интерфейс
Self-hosted✅ Docker✅ Docker✅ локально
Порог входаСредний (Docker/Linux)НизкийВысокий (Python)
Лучший сценарийDocument-heavy RAGБыстрый прототипКастомный RAG

RAGFlow лучше всего подходит для документоориентированного RAG с глубоким парсингом PDF, таблиц и отсканированных файлов. Dify — выбор для low-code RAG-приложений с визуальным конструктором и self-hosted бэкендом.

📝 Пример быстрого старта
# Клонируем репозиторий
git clone https://github.com/infiniflow/ragflow.git
cd ragflow/docker

# Запуск через Docker Compose
docker compose up -d

# Открываем UI
# http://localhost (по умолчанию)

Для настройки потребуется: Docker Compose, постоянное хранилище, SSL через Nginx reverse proxy, интеграция с внешним LLM API (OpenAI, DeepSeek, Ollama) — в первый раз займёт 4–6 часов.

Актуальные обновления (2025–2026)

  • Июль 2026: коннектор Google BigQuery для инкрементной синхронизации документов.
  • Июнь 2026: поддержка мессенджеров Feishu, Discord, Telegram, Line.
  • Декабрь 2025: поддержка Memory для AI-агентов.
  • Ноябрь 2025: синхронизация из Confluence, S3, Notion, Discord, Google Drive.
  • Август 2025: поддержка agentic workflow и MCP.

Вердикт: кому подойдёт RAGFlow?

RAGFlow — лучший выбор для:

  • Компаний с большим объёмом документов (PDF, сканы, таблицы)
  • Команд, которым важна суверенность данных и self-hosted развёртывание
  • Разработчиков, строящих агентные системы поверх корпоративной базы знаний
  • Консультантов, которые создают AI-решения для клиентов с нулевыми лицензионными затратами

Не подойдёт, если:

  • Нет базовых навыков работы с Docker и Linux
  • Нужен мгновенный старт без настройки инфраструктуры
  • Требуется enterprise SLA и круглосуточная поддержка

RAGFlow остаётся верным своему изначальному видению: не только предоставить полную no-code платформу для разработки агентов, но и стать незаменимым фундаментом данных для всех агентных систем — независимо от инструментов, которыми они построены.

Рейтинг: 8.5 / 10

КритерийОценка
Качество парсинга документов10/10
Агентные возможности9/10
Простота развёртывания6/10
Экосистема интеграций8/10
Документация7/10
Соотношение цена/качество10/10