Mistral OCR 4.1: новый стандарт распознавания документов
Mistral AI выпустила OCR 4.1 — модель распознавания документов с bounding boxes, блочной классификацией и поддержкой 170 языков. €3.5 за 1000 страниц.
Что случилось
16 июля 2026 года Mistral AI выпустила OCR 4.1 — обновлённый OCR-сервис (Optical Character Recognition, оптическое распознавание символов), который лежит в основе их стека Document AI. Модель умеет извлекать bounding boxes (ограничивающие рамки) на уровне абзацев, определять структурные блоки и выставлять confidence scores (оценки уверенности) на уровне блоков. Это не просто «распознай текст» — это полноценный слой понимания документов для корпоративных пайплайнов.
OCR 4.1 — это инструмент не для сканирования, а для понимания документов: он видит структуру так же, как её видит человек.
Что нового в OCR 4.1
mistral-ocr-4-1.Новый релиз добавляет bounding boxes (координаты блоков на странице), block classification (классификацию блоков) и inline confidence scores (оценки уверенности прямо внутри извлечённого текста).
Когда параметр include_blocks установлен в true, каждая страница возвращает массив блоков с bounding boxes на уровне абзацев и структурной меткой — text, title, list, table, image, equation, caption, code, references, aside_text, header, footer, signature — в порядке чтения.
Модель напрямую принимает распространённые неструктурированные корпоративные форматы: PDF, DOC, PPT и OpenDocument (ODT) — без промежуточных конвертаций.
Поддерживается 170 языков в рамках 10 языковых групп, а развёртывание возможно в одном контейнере для полностью самостоятельного хостинга.
Как это работает
graph LR
A[Документ PDF/DOC/PPT] --> B[Mistral OCR 4.1]
B --> C[Bounding Boxes]
B --> D[Block Classification]
B --> E[Confidence Scores]
C --> F[RAG / Enterprise Search]
D --> F
E --> F
F --> G[AI-агент или поиск]
Модель классифицирует каждый извлечённый регион: заголовок, абзац, таблица, формула, подпись, шапка, подвал. Такой структурированный вывод позволяет направлять разные типы контента в разные обрабатывающие пайплайны — без ручной разметки.
OCR 4.1 сообщает об уверенности на уровне страницы и слова. Извлечения с низкой уверенностью можно автоматически направлять на проверку человеком — это критически важно для регулируемых отраслей: финансов и здравоохранения.
Производительность
В независимом тестировании на 600+ документах аннотаторы предпочли OCR 4 каждой из конкурирующих систем, показав средний win rate 72%, а на OlmOCRBench модель набрала наивысший результат — 85.20.
«Мы сравнили Mistral OCR 4 с ведущими парсерами и получили эквивалентную точность при стоимости в ~8 раз ниже и задержке в ~17 раз меньше» — Aidan Donohue, AI Engineer, Rogo
Модель собрала 1 800 звёзд на GitHub за первые 24 часа и набрала более 479 голосов на Hacker News, где тред насчитывал 109 комментариев.
Цены и доступность
OCR 4.1 находится в статусе Public Preview и доступна через API. Стоимость составляет €3.5 за 1 000 страниц и €4.38 за 1 000 страниц с аннотациями.
| Тариф | Цена | Описание |
|---|---|---|
| OCR API | $4 / 1 000 стр. | Стандартный доступ |
| Batch API | $2 / 1 000 стр. | Асинхронная обработка, скидка 50% |
| Document AI | $5 / 1 000 стр. | No-code интерфейс в Mistral Studio |
| Self-hosted | По запросу | Деплой в собственной инфраструктуре |
Пример использования через API
import mistralai
client = mistralai.Mistral(api_key="YOUR_API_KEY")
with open("document.pdf", "rb") as f:
result = client.ocr.process(
model="mistral-ocr-4-1",
document=f,
include_blocks=True # включить bounding boxes и block labels
)
for page in result.pages:
for block in page.blocks:
print(f"[{block.label}] {block.text} (confidence: {block.confidence:.2f})")
text, title, list, table, image, equation, caption, code, references, aside_text, header, footer, signature.Контекст и значение для отрасли
Если взглянуть шире, релиз Mistral OCR 4 — это не столько история про OCR, сколько история про корпоративный go-to-market на рынке интеллектуальной обработки документов стоимостью $4.4 млрд, который прогнозируется к росту с темпом более 33% в год.
OCR 4 интегрируется нативно как слой приёма данных для open-source Search Toolkit от Mistral, а для регулируемых корпоративных клиентов модель может быть развёрнута в виде единого, полностью самостоятельного контейнера.
Практический выбор прост: командам с требованиями комплаенса, которым нужны bounding boxes и confidence scores без самостоятельной сборки парсеров — Mistral. Тем, кто хочет открытые веса, без ограничений по длине PDF и без платы за страницы — Baidu Unlimited-OCR. Там, где таблицы и графики должны оставаться визуальными — PixelRAG.
OCR 4.1 уже доступна через Mistral API и в интерфейсе Mistral Studio — в режиме Public Preview.