Hyper-Extract: извлечение знаний из текста одной командой
Hyper-Extract — LLM-фреймворк для преобразования неструктурированных документов в графы знаний, гиперграфы и спatio-temporal структуры за одну команду.
Один инструмент — восемь форматов знаний
Hyper-Extract — LLM-фреймворк, который превращает документы в графы знаний, гиперграфы и пространственно-временные графы буквально одной командой. Проект развивается на GitHub под лицензией Apache-2.0 и уже поддерживает все ключевые LLM-платформы — от OpenAI до локального vLLM. Свежие обновления добавили поддержку DeepSeek V4, Claude и экспорт в Obsidian.
Что такое Hyper-Extract
Hyper-Extract — интеллектуальный LLM-фреймворк для извлечения и «эволюции» знаний, кардинально упрощающий превращение неструктурированных текстов в устойчивые, предсказуемые и строго типизированные Knowledge Abstracts (абстракции знаний).
Инструмент извлекает информацию в широком спектре форматов — от простых коллекций (Lists/Sets) и Pydantic-моделей до сложных Knowledge Graphs, Hypergraphs и Spatio-Temporal Graphs.
«Stop reading. Start understanding.» — девиз проекта Hyper-Extract.
Ключевое отличие от конкурентов — поддержка гиперграфов (hypergraph). Обычный граф связывает ровно два узла одним ребром. Гиперграф позволяет одному ребру (hyperedge) соединять произвольное число сущностей, что гораздо точнее отражает реальные многосторонние зависимости в тексте.
Hyper-RAG, встроенный в Hyper-Extract движок, улучшил точность в среднем на 12,3% по сравнению с прямым использованием LLM на датасете по неврологии и превзошёл GraphRAG и LightRAG на 6,3% и 6,0% соответственно.
Ключевые возможности
Фреймворк включает 8 типов структур знаний — от базовых списков до продвинутых графов и гиперграфов, более 10 движков извлечения (GraphRAG, LightRAG, Hyper-RAG, KG-Gen и другие) и свыше 80 YAML-шаблонов для работы без написания кода в сферах финансов, права, медицины, промышленности и общих задач.
- 🤖 DeepSeek V4 — поддержка
deepseek-v4-flashиdeepseek-v4-proчерезcreate_client(llm="deepseek") - 🧠 Anthropic Claude —
claude-opus-4-8,claude-sonnet-4-6,claude-haiku-4-5 - 📝 Obsidian Export — граф превращается в хранилище Obsidian с Markdown-заметками и
[[wikilinks]] - 🔌 MCP Server — запросы к базам знаний из Claude Desktop и IDE-агентов
Поддерживаемые платформы и модели
| Платформа | Проверенные модели |
|---|---|
| OpenAI | gpt-4o, gpt-4o-mini, gpt-5 |
| Anthropic | claude-opus-4-8, claude-sonnet-4-6, claude-haiku-4-5 |
| DeepSeek | deepseek-v4-flash, deepseek-v4-pro |
| Alibaba Bailian | qwen-plus, qwen-turbo, deepseek-r1 |
| Локальный vLLM | Qwen3.5-9B (GPTQ-Marlin) |
| Эмбеддинги | text-embedding-3-small, text-embedding-v4, bge-m3 |
Как это работает: архитектура
graph TD
A[Документ / PDF / Markdown] --> B[CLI: he parse]
B --> C{Шаблон YAML}
C --> D[Knowledge Abstract]
D --> E[Knowledge Graph]
D --> F[Hypergraph]
D --> G[Spatio-Temporal Graph]
E --> H[he show — визуализация]
E --> I[he search — семантический поиск]
E --> J[export obsidian — Obsidian Vault]
F --> H
G --> H
Методы (Methods) предоставляют алгоритмы извлечения, построенные на базе Auto-Types: типовые методы (KG-Gen, iText2KG) и RAG-методы (GraphRAG, LightRAG, Hyper-RAG, HypergraphRAG, Cog-RAG).
Быстрый старт: три шага
# 1. Установка
uv tool install hyperextract
# 2. Настройка провайдера (пример для DeepSeek + OpenAI embedder)
he config llm -p deepseek -k YOUR_DEEPSEEK_API_KEY
he config embedder -p openai -k YOUR_OPENAI_API_KEY
# 3. Извлечение, поиск и визуализация
he parse examples/en/tesla.md -t general/biography_graph -o ./output/ -l en
he search ./output/ "What are Tesla's major achievements?"
he show ./output/
Для работы с Claude достаточно установить дополнительную зависимость:
pip install 'hyperextract[anthropic]'
Локальное развёртывание без передачи данных во внешние сервисы доступно через vLLM:
from hyperextract import create_client
llm, emb = create_client(
llm="vllm:Qwen3.5-9B@http://localhost:8000/v1",
embedder="vllm:bge-m3@http://localhost:8001/v1",
api_key="dummy",
)
Сравнение с конкурентами
| Возможность | GraphRAG | LightRAG | KG-Gen | Hyper-Extract |
|---|---|---|---|---|
| Knowledge Graph | ✅ | ✅ | ✅ | ✅ |
| Temporal Graph | ✅ | ❌ | ❌ | ✅ |
| Spatial Graph | ❌ | ❌ | ❌ | ✅ |
| Hypergraph | ❌ | ❌ | ❌ | ✅ |
| YAML-шаблоны | ❌ | ❌ | ❌ | ✅ (80+) |
| Интерактивный CLI | ✅ | ❌ | ❌ | ✅ |
| Мультиязычность | ✅ | ❌ | ❌ | ✅ |
Исследование GraphRAG-Bench (ICLR 2026) показало, что GraphRAG нередко уступает обычному RAG на реальных задачах: накладные расходы на построение графа не всегда окупаются, особенно при простых фактоидных запросах. Это делает мульти-движковый подход Hyper-Extract особенно ценным: можно выбрать подходящий инструмент под задачу — стандартный граф, гиперграф, пространственно-временной граф или простое структурированное извлечение.
Сценарии применения
Среди ключевых сценариев использования — превращение научных статей в графы знаний для исследователей, автоматическое извлечение сущностей из финансовых отчётов для аналитиков и локальное развёртывание для работы с конфиденциальными данными без выхода в интернет.
he parse paper.pdf -t general/academic_graph -o ./paper_kb/
he show ./paper_kb/
Загружаете 20-страничную статью — получаете интерактивный граф ключевых концепций, авторов и цитирований.
Контекст и значение для отрасли
Гиперграфы знаний расширяют концепцию гиперрёбер для крупномасштабного моделирования и рассуждений над сложными знаниями, демонстрируя потенциал в семантическом понимании, интеллектуальных системах вопрос-ответ и мультимодальном слиянии данных.
Hyper-Extract — один из немногих open-source инструментов, который делает всё это доступным через единый CLI и Python API без написания сложного кода. Проект доступен на GitHub, документация — на yifanfeng97.github.io/Hyper-Extract.