Что случилось

16 июля 2026 года Mistral AI выпустила OCR 4.1 — обновлённый OCR-сервис (Optical Character Recognition, оптическое распознавание символов), который лежит в основе их стека Document AI. Модель умеет извлекать bounding boxes (ограничивающие рамки) на уровне абзацев, определять структурные блоки и выставлять confidence scores (оценки уверенности) на уровне блоков. Это не просто «распознай текст» — это полноценный слой понимания документов для корпоративных пайплайнов.

OCR 4.1 — это инструмент не для сканирования, а для понимания документов: он видит структуру так же, как её видит человек.


Что нового в OCR 4.1

ℹ Ключевые возможности
OCR 4.1 — это обновление линейки OCR 4.0, вышедшей 23 июня 2026 года. Версия 4.1 переведена в статус Public Preview и доступна через API под именем mistral-ocr-4-1.

Новый релиз добавляет bounding boxes (координаты блоков на странице), block classification (классификацию блоков) и inline confidence scores (оценки уверенности прямо внутри извлечённого текста).

Когда параметр include_blocks установлен в true, каждая страница возвращает массив блоков с bounding boxes на уровне абзацев и структурной меткой — text, title, list, table, image, equation, caption, code, references, aside_text, header, footer, signature — в порядке чтения.

Модель напрямую принимает распространённые неструктурированные корпоративные форматы: PDF, DOC, PPT и OpenDocument (ODT) — без промежуточных конвертаций.

Поддерживается 170 языков в рамках 10 языковых групп, а развёртывание возможно в одном контейнере для полностью самостоятельного хостинга.


Как это работает


graph LR
    A[Документ PDF/DOC/PPT] --> B[Mistral OCR 4.1]
    B --> C[Bounding Boxes]
    B --> D[Block Classification]
    B --> E[Confidence Scores]
    C --> F[RAG / Enterprise Search]
    D --> F
    E --> F
    F --> G[AI-агент или поиск]

Модель классифицирует каждый извлечённый регион: заголовок, абзац, таблица, формула, подпись, шапка, подвал. Такой структурированный вывод позволяет направлять разные типы контента в разные обрабатывающие пайплайны — без ручной разметки.

OCR 4.1 сообщает об уверенности на уровне страницы и слова. Извлечения с низкой уверенностью можно автоматически направлять на проверку человеком — это критически важно для регулируемых отраслей: финансов и здравоохранения.


Производительность

В независимом тестировании на 600+ документах аннотаторы предпочли OCR 4 каждой из конкурирующих систем, показав средний win rate 72%, а на OlmOCRBench модель набрала наивысший результат — 85.20.

«Мы сравнили Mistral OCR 4 с ведущими парсерами и получили эквивалентную точность при стоимости в ~8 раз ниже и задержке в ~17 раз меньше» — Aidan Donohue, AI Engineer, Rogo

Модель собрала 1 800 звёзд на GitHub за первые 24 часа и набрала более 479 голосов на Hacker News, где тред насчитывал 109 комментариев.


Цены и доступность

OCR 4.1 находится в статусе Public Preview и доступна через API. Стоимость составляет €3.5 за 1 000 страниц и €4.38 за 1 000 страниц с аннотациями.

ТарифЦенаОписание
OCR API$4 / 1 000 стр.Стандартный доступ
Batch API$2 / 1 000 стр.Асинхронная обработка, скидка 50%
Document AI$5 / 1 000 стр.No-code интерфейс в Mistral Studio
Self-hostedПо запросуДеплой в собственной инфраструктуре
💡 Экономия через Batch API
Если ваш пайплайн не требует результатов в реальном времени — используйте Batch API. Пакетный эндпоинт вдвое дешевле, но рассчитан на асинхронные задачи: загружаете пакет документов и получаете результаты через несколько часов.

Пример использования через API

import mistralai

client = mistralai.Mistral(api_key="YOUR_API_KEY")

with open("document.pdf", "rb") as f:
    result = client.ocr.process(
        model="mistral-ocr-4-1",
        document=f,
        include_blocks=True  # включить bounding boxes и block labels
    )

for page in result.pages:
    for block in page.blocks:
        print(f"[{block.label}] {block.text} (confidence: {block.confidence:.2f})")
📝 Типы блоков
Модель автоматически присваивает одну из меток: text, title, list, table, image, equation, caption, code, references, aside_text, header, footer, signature.

Контекст и значение для отрасли

Если взглянуть шире, релиз Mistral OCR 4 — это не столько история про OCR, сколько история про корпоративный go-to-market на рынке интеллектуальной обработки документов стоимостью $4.4 млрд, который прогнозируется к росту с темпом более 33% в год.

OCR 4 интегрируется нативно как слой приёма данных для open-source Search Toolkit от Mistral, а для регулируемых корпоративных клиентов модель может быть развёрнута в виде единого, полностью самостоятельного контейнера.

Практический выбор прост: командам с требованиями комплаенса, которым нужны bounding boxes и confidence scores без самостоятельной сборки парсеров — Mistral. Тем, кто хочет открытые веса, без ограничений по длине PDF и без платы за страницы — Baidu Unlimited-OCR. Там, где таблицы и графики должны оставаться визуальными — PixelRAG.

⚠ Ограничения
Mistral явно позиционирует OCR 4 как инструмент понимания документов, а не автономного принятия решений. Высокорисковая автоматизация — медицинские диагнозы и подобное — выходит за рамки применения модели.

OCR 4.1 уже доступна через Mistral API и в интерфейсе Mistral Studio — в режиме Public Preview.