DeepSeek выпустил vision-модель для анализа изображений

DeepSeek представил экспериментальную мультимодальную модель deepseek-v4-flash-vision-exp, которая принимает на вход изображения вместе с текстом. Модель умеет описывать картинки, читать текст со скриншотов и анализировать графики. Доступ открыт через стандартный OpenAI-совместимый API.


Поддерживаемые форматы и способы передачи

Модель принимает изображения в форматах JPEG, PNG, GIF и WebP. Формат определяется из содержимого файла — не из имени и не из MIME-типа в заголовке запроса.

Существует три способа передать изображение в модель:


graph TD
    A[Изображение] --> B[Base64 inline]
    A --> C[Внешний URL]
    A --> D[Files API — file_id]
    B --> E[Запрос к модели]
    C --> E
    D --> E
    E --> F[Ответ модели]

1. Base64 (inline)

Изображение кодируется в Base64 и встраивается прямо в тело запроса как data:-URL. Это самый простой вариант для локальных файлов. Encoded-данные учитываются в лимите тела запроса 48 MiB.

import base64
from openai import OpenAI

client = OpenAI(
    api_key="<DeepSeek API Key>",
    base_url="https://api.deepseek.com"
)

with open("image.jpg", "rb") as f:
    b64 = base64.b64encode(f.read()).decode("utf-8")

response = client.chat.completions.create(
    model="deepseek-v4-flash-vision-exp",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "What is in this image?"},
            {"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{b64}"}}
        ]
    }]
)
print(response.choices[0].message.content)

2. Внешний URL

Можно передать публичную http(s)-ссылку — модель скачает изображение самостоятельно. Ограничения: URL не длиннее 8 192 символов, файл не тяжелее 32 MiB, загрузка должна завершиться за 60 секунд.

3. Files API (file_id)

Изображение загружается один раз через Files API, после чего на него ссылаются по file_id. Это оптимальный вариант, если одно изображение используется в нескольких запросах или его размер превышает 32 MiB (через Files API допускается до 64 MiB).

💡 Когда использовать Files API
Применяйте Files API, если одно изображение нужно в нескольких запросах, его размер превышает 32 MiB, или общий объём запроса подходит к лимиту 48 MiB.

Уровень детализации (Detail Level)

Для способа image_url можно указать параметр detail, который управляет качеством обработки:

ЗначениеПоведение
lowИзображение уменьшается до 512×512. Быстрее и дешевле
highСохраняется оригинал (эквивалент original)
originalСохраняется оригинал
autoАвтовыбор, сейчас эквивалент original

Токены и стоимость

Изображения конвертируются в токены на основе их размера и тарифицируются вместе с текстовыми токенами. Перед инференсом каждое изображение автоматически масштабируется:

  • Изображения меньше ~384×384 пикселей масштабируются вверх с сохранением пропорций.
  • Более крупные изображения уменьшаются до эквивалента ~800×800 пикселей.

Верхний предел — 384 токена на изображение: снимок 2000×2000 и снимок 5000×5000 займут одинаковое количество токенов после ресайза.


Лимиты

ПараметрЗначение
ФорматыJPEG, PNG, GIF, WebP
Длина внешнего URLдо 8 192 символов
Тело запросадо 48 MiB
Макс. размер изображения (Base64 / URL)32 MiB
Макс. размер изображения (Files API)64 MiB
Макс. изображений в одном запросе600
Макс. измерение стороны8 192 px (от 15 изображений — 4 096 px)
⚠ Ограничения
Изображения поддерживаются только в сообщениях с ролью user. В system- и assistant-сообщениях изображения вернут ошибку 400. Другие модели DeepSeek (не vision) также вернут 400.

Совместимость с Anthropic и Responses API

Модель доступна не только через OpenAI-совместимый эндпоинт, но и через Anthropic-совместимый /messages (base_url: https://api.deepseek.com/anthropic). Все три метода передачи изображений поддерживаются — разница лишь в форме блока контента: вместо image_url используется блок image с объектом source.

Также поддерживается Responses API с теми же лимитами и методами — изображения передаются через input_image-части.

ℹ Статус модели
deepseek-v4-flash-vision-exp — экспериментальная модель. Функциональность и лимиты могут меняться по мере развития сервиса.

Итог

DeepSeek открыл доступ к vision-модели с гибкими способами интеграции и совместимостью сразу с тремя API-форматами: OpenAI, Anthropic и Responses API. Лимит в 600 изображений на запрос и поддержка Files API делают решение пригодным для промышленных сценариев — от пакетной обработки документов до анализа графиков в реальном времени.