Один инструмент — восемь форматов знаний

Hyper-Extract — LLM-фреймворк, который превращает документы в графы знаний, гиперграфы и пространственно-временные графы буквально одной командой. Проект развивается на GitHub под лицензией Apache-2.0 и уже поддерживает все ключевые LLM-платформы — от OpenAI до локального vLLM. Свежие обновления добавили поддержку DeepSeek V4, Claude и экспорт в Obsidian.


Что такое Hyper-Extract

Hyper-Extract — интеллектуальный LLM-фреймворк для извлечения и «эволюции» знаний, кардинально упрощающий превращение неструктурированных текстов в устойчивые, предсказуемые и строго типизированные Knowledge Abstracts (абстракции знаний).

Инструмент извлекает информацию в широком спектре форматов — от простых коллекций (Lists/Sets) и Pydantic-моделей до сложных Knowledge Graphs, Hypergraphs и Spatio-Temporal Graphs.

«Stop reading. Start understanding.» — девиз проекта Hyper-Extract.

Ключевое отличие от конкурентов — поддержка гиперграфов (hypergraph). Обычный граф связывает ровно два узла одним ребром. Гиперграф позволяет одному ребру (hyperedge) соединять произвольное число сущностей, что гораздо точнее отражает реальные многосторонние зависимости в тексте.

Hyper-RAG, встроенный в Hyper-Extract движок, улучшил точность в среднем на 12,3% по сравнению с прямым использованием LLM на датасете по неврологии и превзошёл GraphRAG и LightRAG на 6,3% и 6,0% соответственно.


Ключевые возможности

Фреймворк включает 8 типов структур знаний — от базовых списков до продвинутых графов и гиперграфов, более 10 движков извлечения (GraphRAG, LightRAG, Hyper-RAG, KG-Gen и другие) и свыше 80 YAML-шаблонов для работы без написания кода в сферах финансов, права, медицины, промышленности и общих задач.

ℹ Новинки последних обновлений
  • 🤖 DeepSeek V4 — поддержка deepseek-v4-flash и deepseek-v4-pro через create_client(llm="deepseek")
  • 🧠 Anthropic Claudeclaude-opus-4-8, claude-sonnet-4-6, claude-haiku-4-5
  • 📝 Obsidian Export — граф превращается в хранилище Obsidian с Markdown-заметками и [[wikilinks]]
  • 🔌 MCP Server — запросы к базам знаний из Claude Desktop и IDE-агентов

Поддерживаемые платформы и модели

ПлатформаПроверенные модели
OpenAIgpt-4o, gpt-4o-mini, gpt-5
Anthropicclaude-opus-4-8, claude-sonnet-4-6, claude-haiku-4-5
DeepSeekdeepseek-v4-flash, deepseek-v4-pro
Alibaba Bailianqwen-plus, qwen-turbo, deepseek-r1
Локальный vLLMQwen3.5-9B (GPTQ-Marlin)
Эмбеддингиtext-embedding-3-small, text-embedding-v4, bge-m3
💡 Самый экономичный вариант
DeepSeek — наиболее выгодный выбор по стоимости: около $0.001–0.005 за страницу против $0.01–0.05 за страницу у OpenAI gpt-4o-mini. При этом DeepSeek не предоставляет API для эмбеддингов — его нужно комбинировать с OpenAI-совместимым эмбеддером.

Как это работает: архитектура


graph TD
    A[Документ / PDF / Markdown] --> B[CLI: he parse]
    B --> C{Шаблон YAML}
    C --> D[Knowledge Abstract]
    D --> E[Knowledge Graph]
    D --> F[Hypergraph]
    D --> G[Spatio-Temporal Graph]
    E --> H[he show — визуализация]
    E --> I[he search — семантический поиск]
    E --> J[export obsidian — Obsidian Vault]
    F --> H
    G --> H

Методы (Methods) предоставляют алгоритмы извлечения, построенные на базе Auto-Types: типовые методы (KG-Gen, iText2KG) и RAG-методы (GraphRAG, LightRAG, Hyper-RAG, HypergraphRAG, Cog-RAG).


Быстрый старт: три шага

# 1. Установка
uv tool install hyperextract

# 2. Настройка провайдера (пример для DeepSeek + OpenAI embedder)
he config llm -p deepseek -k YOUR_DEEPSEEK_API_KEY
he config embedder -p openai -k YOUR_OPENAI_API_KEY

# 3. Извлечение, поиск и визуализация
he parse examples/en/tesla.md -t general/biography_graph -o ./output/ -l en
he search ./output/ "What are Tesla's major achievements?"
he show ./output/

Для работы с Claude достаточно установить дополнительную зависимость:

pip install 'hyperextract[anthropic]'

Локальное развёртывание без передачи данных во внешние сервисы доступно через vLLM:

from hyperextract import create_client

llm, emb = create_client(
    llm="vllm:Qwen3.5-9B@http://localhost:8000/v1",
    embedder="vllm:bge-m3@http://localhost:8001/v1",
    api_key="dummy",
)
⚠ Важно для DeepSeek
Модели DeepSeek V4 по умолчанию включают режим «мышления» (thinking mode), который несовместим со структурированным извлечением. Hyper-Extract отключает его автоматически — никаких дополнительных настроек не требуется.

Сравнение с конкурентами

ВозможностьGraphRAGLightRAGKG-GenHyper-Extract
Knowledge Graph
Temporal Graph
Spatial Graph
Hypergraph
YAML-шаблоны✅ (80+)
Интерактивный CLI
Мультиязычность

Исследование GraphRAG-Bench (ICLR 2026) показало, что GraphRAG нередко уступает обычному RAG на реальных задачах: накладные расходы на построение графа не всегда окупаются, особенно при простых фактоидных запросах. Это делает мульти-движковый подход Hyper-Extract особенно ценным: можно выбрать подходящий инструмент под задачу — стандартный граф, гиперграф, пространственно-временной граф или простое структурированное извлечение.


Сценарии применения

Среди ключевых сценариев использования — превращение научных статей в графы знаний для исследователей, автоматическое извлечение сущностей из финансовых отчётов для аналитиков и локальное развёртывание для работы с конфиденциальными данными без выхода в интернет.

📝 Пример: анализ научной статьи
he parse paper.pdf -t general/academic_graph -o ./paper_kb/
he show ./paper_kb/

Загружаете 20-страничную статью — получаете интерактивный граф ключевых концепций, авторов и цитирований.


Контекст и значение для отрасли

Гиперграфы знаний расширяют концепцию гиперрёбер для крупномасштабного моделирования и рассуждений над сложными знаниями, демонстрируя потенциал в семантическом понимании, интеллектуальных системах вопрос-ответ и мультимодальном слиянии данных.

Hyper-Extract — один из немногих open-source инструментов, который делает всё это доступным через единый CLI и Python API без написания сложного кода. Проект доступен на GitHub, документация — на yifanfeng97.github.io/Hyper-Extract.