ИИ-агенты получили память, которая учится

Vectorize выпустила Hindsight — open-source систему памяти для ИИ-агентов, которая впервые преодолела отметку 90% точности на LongMemEval — ведущем бенчмарке для оценки долгосрочной памяти. Это напрямую решает критический барьер для реального корпоративного применения ИИ: поддержание надёжной памяти в многосессионных разговорах. Проект распространяется под MIT-лицензией и уже используется в продакшене у крупных компаний.


Что такое Hindsight и чем он отличается от RAG

Большинство систем памяти для агентов сводятся к простому хранению истории диалогов. Hindsight идёт дальше — он заставляет агентов учиться, а не просто запоминать.

ℹ Ключевое отличие
Hindsight не просто ищет по истории переписки. Он извлекает факты, строит временны́е ряды, формирует ментальные модели — и синтезирует связный ответ из накопленного опыта.

Система организует память агента в четыре типа: знания о мире, опыт, мнения и наблюдения — структурированная основа, отражающая то, как люди разграничивают факты, убеждения и усвоенные инсайты.

Архитектура использует биомиметические структуры данных — аналог того, как работает человеческая память. Каждый факт представлен комбинацией сущностей, отношений и временны́х рядов с разреженно-плотными векторными представлениями.


Рекордная точность на LongMemEval

Hindsight с Gemini 3 Pro достигает 91.4% общей точности — лучший результат среди всех систем и моделей. Результат был верифицирован совместными исследованиями с участием The Washington Post и Virginia Tech.

Бенчмарк LongMemEval измеряет, правильно ли система отвечает на вопросы о прошлых взаимодействиях. Конкурирующие системы набирают от 49 до 81%.

СистемаМодельТочность (LongMemEval)
HindsightGemini 3 Pro94.6%
HindsightGemini 3 Pro (верифицировано)91.4%
HindsightOSS-120B89.0%
SupermemoryGPT-4o81.6%
GPT-5 (full context)84.6%
Mem0~49%

«Бутылочное горлышко — не возможности модели, а память. Без надёжных систем памяти агенты не могут сохранять контекст между разговорами и учиться на прошлых взаимодействиях.»


Три операции вместо сложного API

Hindsight предоставляет всего три метода взаимодействия:


graph LR
    A[Новая информация] --> B[retain\nЗапомнить]
    B --> C[(Memory Bank)]
    C --> D[recall\nВспомнить]
    C --> E[reflect\nОсмыслить]
    D --> F[Список релевантных фактов]
    E --> G[Синтезированный ответ]

  • Retain — передать информацию для запоминания. За кулисами LLM извлекает ключевые факты, временны́е данные, сущности и отношения.
  • Recall — извлечь воспоминания по запросу из любого типа памяти.
  • Reflect — операция синтеза, которая рассуждает над воспоминаниями с помощью LLM: вместо ранжированного списка фактов она создаёт связный ответ, соединяя точки по всему банку памяти.

Пример на Python

from hindsight_client import Hindsight

client = Hindsight(base_url="http://localhost:8888")

# Запомнить
client.retain(bank_id="my-bank", content="Алиса работает в Google инженером")

# Вспомнить
client.recall(bank_id="my-bank", query="Где работает Алиса?")

# Осмыслить
client.reflect(bank_id="my-bank", query="Расскажи об Алисе")

Быстрый старт: Docker за одну команду

💡 Запуск через Docker
Для быстрого старта достаточно одной команды. API поднимается на порту 8888, веб-интерфейс — на 9999.
export OPENAI_API_KEY=sk-xxx

docker run -it --pull always --name hindsight --restart unless-stopped \
  -p 8888:8888 -p 9999:9999 \
  -e HINDSIGHT_API_LLM_API_KEY=$OPENAI_API_KEY \
  -v hindsight-data:/home/hindsight/.pg0 \
  ghcr.io/vectorize-io/hindsight:latest

Поддерживаемые LLM-провайдеры: openai, anthropic, gemini, groq, ollama, lmstudio, minimax. Для корпоративных развёртываний поддерживается Oracle AI Database.

📝 Встроенный режим (без сервера)
Для Python-проектов доступен режим hindsight-all — сервер запускается прямо внутри процесса, отдельный Docker не нужен.

Поддержка AI-ассистентов и кодинг-агентов

Hindsight умеет интегрироваться с Claude Code, Cursor и другими AI-ассистентами прямо в процессе разработки:

npx skills add https://github.com/vectorize-io/hindsight --skill hindsight-docs

Это устанавливает документацию как «навык» — ассистент получает мгновенный доступ к docs во время написания кода.


Контекст: почему это важно для отрасли

Главное узкое место — не возможности модели, а память. Без надёжных систем памяти агенты не могут сохранять контекст между разговорами, учиться на прошлых взаимодействиях или выдавать стабильные результаты.

Следующая волна бенчмарков будет оценивать, помогает ли память агентам лучше выполнять задачи с течением времени — меньше ошибок, более быстрое вхождение в курс дела и усвоенные граничные случаи.

⚠ Ограничения текущих бенчмарков
Современные модели имеют контекстные окна в миллион токенов. На большинстве задач LongMemEval наивный подход «всё в контекст» показывает конкурентные результаты — не потому что это хорошая архитектура памяти, а потому что извлечение стало лёгкой частью. Команда Hindsight признаёт это и работает над новым поколением бенчмарков.

Hindsight уже набрал более 10 000 звёзд на GitHub и используется в продакшене у компаний из списка Fortune 500. Проект показывает: грамотная архитектура памяти, а не размер модели, определяет качество ИИ-агента — и именно в этом направлении будет развиваться следующее поколение production-ready агентов.