Что такое QuantMind

QuantMind — это agent-native (ориентированный на агентов) фреймворк для извлечения и поиска знаний в области количественных финансов. Проект от команды LLMQuant превращает сырые финансовые данные — академические статьи, новости, корпоративные отчёты — в структурированные, верифицируемые знания, готовые к дальнейшей обработке моделями. Работа уже принята на NeurIPS 2025 GenAI in Finance Workshop.

ℹ Ключевая идея
QuantMind — это не просто Python-библиотека. Авторы называют главным продуктом сам репозиторий: открываешь его, описываешь нужный пайплайн агенту — и агент строит его, опираясь на контракты и инструменты репозитория.

Проблема, которую решает фреймворк

Количественные исследования всё больше опираются на неструктурированные финансовые данные: SEC-файлинги, стенограммы звонков с инвесторами, аналитические записки. Однако существующие LLM- и RAG-пайплайны плохо справляются с корректностью данных в точке времени, атрибуцией источников и интеграцией в исследовательские процессы.

QuantMind использует двухэтапную архитектуру: (i) этап извлечения знаний, который преобразует разнородные документы в структурированные знания через мультимодальный парсинг текста, таблиц и формул, адаптивное суммирование и доменную разметку для тонкого индексирования; (ii) этап интеллектуального поиска, интегрирующий семантический поиск с гибкими стратегиями, многошаговое рассуждение по источникам и генерацию с учётом знаний для аудируемых результатов.

Архитектура: как это работает


graph TD
    A[Источники: статьи / новости / файлинги] --> B[Knowledge Extraction]
    B --> B1[Парсинг текста, таблиц, формул]
    B --> B2[Адаптивное суммирование]
    B --> B3[Доменная разметка]
    B1 & B2 & B3 --> C[Typed Knowledge: Paper / News / Earnings / Factor / Thesis]
    C --> D[Intelligent Retrieval]
    D --> D1[BM25 + Semantic Search]
    D --> D2[Multi-hop Reasoning]
    D --> D3[Agentic RAG / MCP]
    D1 & D2 & D3 --> E[Аудируемый результат]

Каждый артефакт знания самодостаточен: он несёт в себе исходный текст, временну́ю метку as_of и ссылку на источник. Это позволяет делать time-queries — запросы к состоянию знаний на конкретный момент времени — без внешних зависимостей.

Harness Engineering: слабая модель в хорошей упряжи

Одна из самых смелых идей проекта — концепция harness engineering (инженерия упряжи).

Сам репозиторий — это и есть продукт. Контракты AGENTS.md / CLAUDE.md, прогрессивное раскрытие contexts/, портативные навыки и хуки для Claude и Codex, поверяемые детерминированным скриптом, превращают обычного coding-агента в специалиста по QuantMind. Ставка такова: слабая модель в хорошем harness обыгрывает сильную модель без него.

«A weak model in a good harness beats a strong model running bare» — ключевой тезис авторов QuantMind.

Сравнение режимов работы

РежимОписаниеКогда использовать
Agent pathОткрываешь репо, запускаешь claude / codex, описываешь пайплайн словамиБыстрый старт, новые пайплайны
Library pathpip install + Python API (PaperFlow, collect_news, batch_run)Встраивание в существующий код
Magic resolveresolve_magic_input("Collect the last day of PR Newswire...")Свободный ввод намерений

Быстрый старт: пример кода

Пример извлечения структуры статьи с arXiv:

import asyncio
from quantmind.configs import PaperStructureCfg
from quantmind.configs.paper import ArxivIdentifier
from quantmind.flows import PaperFlow

async def main() -> None:
    flow = PaperFlow(PaperStructureCfg(model="gpt-5.6-luna"))
    tree = await flow.build(ArxivIdentifier(id="1706.03762v7"))
    print(tree.id, len(tree.nodes))

asyncio.run(main())

Для семантического режима (чанки + глобальное резюме) меняется только конфигурация:

flow = PaperFlow(PaperSemanticCfg(model="gpt-5.6-luna", chunk_size=512))
💡 Совет
Для работы с батчами новостей используйте batch_run с параметром concurrency — он сам управляет параллелизмом, не нужно писать asyncio.gather вручную.

Оценка и Roadmap

Команда разрабатывает собственный бенчмарк quantmind-bench по модели SWE-bench: он измеряет ставку harness напрямую, запуская парные испытания на одной и той же модели — раз на голом чекауте, раз с подключёнными контрактами, контекстами и навыками QuantMind.

В планах:

  • Расширение охвата: потоки сбора SEC-файлингов и новый тип знаний для рынков предсказаний.
  • Завершение протокола quantmind-bench и публикация первых результатов парных запусков.
⚠ Важно
Оценка (evaluation) пока находится в стадии дизайна — никаких числовых результатов ещё не опубликовано. Инструментарий для запуска экспериментов уже в репозитории, но протокол финализируется.

Значение для отрасли

Контролируемое пользовательское исследование показало, что QuantMind улучшает как фактическую точность, так и пользовательский опыт по сравнению с самостоятельным чтением и универсальными AI-помощниками. Это подтверждает ценность структурированного, доменно-специфичного контекстного инжиниринга для финансов.

Для разработчиков quant-стратегий и финансовых аналитиков QuantMind открывает возможность делегировать рутину извлечения знаний агентам, сохраняя при этом полную прослеживаемость — каждая единица знания хранит цитату и временну́ю метку.

Репозиторий: github.com/LLMQuant/quant-mind Статья: arXiv:2509.21507