DeepSeek запустил vision-модель с поддержкой изображений
DeepSeek выпустил экспериментальную мультимодальную модель deepseek-v4-flash-vision-exp с поддержкой анализа изображений через API.
DeepSeek выпустил vision-модель для анализа изображений
DeepSeek представил экспериментальную мультимодальную модель deepseek-v4-flash-vision-exp, которая принимает на вход изображения вместе с текстом. Модель умеет описывать картинки, читать текст со скриншотов и анализировать графики. Доступ открыт через стандартный OpenAI-совместимый API.
Поддерживаемые форматы и способы передачи
Модель принимает изображения в форматах JPEG, PNG, GIF и WebP. Формат определяется из содержимого файла — не из имени и не из MIME-типа в заголовке запроса.
Существует три способа передать изображение в модель:
graph TD
A[Изображение] --> B[Base64 inline]
A --> C[Внешний URL]
A --> D[Files API — file_id]
B --> E[Запрос к модели]
C --> E
D --> E
E --> F[Ответ модели]
1. Base64 (inline)
Изображение кодируется в Base64 и встраивается прямо в тело запроса как data:-URL. Это самый простой вариант для локальных файлов. Encoded-данные учитываются в лимите тела запроса 48 MiB.
import base64
from openai import OpenAI
client = OpenAI(
api_key="<DeepSeek API Key>",
base_url="https://api.deepseek.com"
)
with open("image.jpg", "rb") as f:
b64 = base64.b64encode(f.read()).decode("utf-8")
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "What is in this image?"},
{"type": "image_url", "image_url": {"url": f"data:image/jpeg;base64,{b64}"}}
]
}]
)
print(response.choices[0].message.content)
2. Внешний URL
Можно передать публичную http(s)-ссылку — модель скачает изображение самостоятельно. Ограничения: URL не длиннее 8 192 символов, файл не тяжелее 32 MiB, загрузка должна завершиться за 60 секунд.
3. Files API (file_id)
Изображение загружается один раз через Files API, после чего на него ссылаются по file_id. Это оптимальный вариант, если одно изображение используется в нескольких запросах или его размер превышает 32 MiB (через Files API допускается до 64 MiB).
Уровень детализации (Detail Level)
Для способа image_url можно указать параметр detail, который управляет качеством обработки:
| Значение | Поведение |
|---|---|
low | Изображение уменьшается до 512×512. Быстрее и дешевле |
high | Сохраняется оригинал (эквивалент original) |
original | Сохраняется оригинал |
auto | Автовыбор, сейчас эквивалент original |
Токены и стоимость
Изображения конвертируются в токены на основе их размера и тарифицируются вместе с текстовыми токенами. Перед инференсом каждое изображение автоматически масштабируется:
- Изображения меньше ~384×384 пикселей масштабируются вверх с сохранением пропорций.
- Более крупные изображения уменьшаются до эквивалента ~800×800 пикселей.
Верхний предел — 384 токена на изображение: снимок 2000×2000 и снимок 5000×5000 займут одинаковое количество токенов после ресайза.
Лимиты
| Параметр | Значение |
|---|---|
| Форматы | JPEG, PNG, GIF, WebP |
| Длина внешнего URL | до 8 192 символов |
| Тело запроса | до 48 MiB |
| Макс. размер изображения (Base64 / URL) | 32 MiB |
| Макс. размер изображения (Files API) | 64 MiB |
| Макс. изображений в одном запросе | 600 |
| Макс. измерение стороны | 8 192 px (от 15 изображений — 4 096 px) |
user. В system- и assistant-сообщениях изображения вернут ошибку 400. Другие модели DeepSeek (не vision) также вернут 400.Совместимость с Anthropic и Responses API
Модель доступна не только через OpenAI-совместимый эндпоинт, но и через Anthropic-совместимый /messages (base_url: https://api.deepseek.com/anthropic). Все три метода передачи изображений поддерживаются — разница лишь в форме блока контента: вместо image_url используется блок image с объектом source.
Также поддерживается Responses API с теми же лимитами и методами — изображения передаются через input_image-части.
deepseek-v4-flash-vision-exp — экспериментальная модель. Функциональность и лимиты могут меняться по мере развития сервиса.Итог
DeepSeek открыл доступ к vision-модели с гибкими способами интеграции и совместимостью сразу с тремя API-форматами: OpenAI, Anthropic и Responses API. Лимит в 600 изображений на запрос и поддержка Files API делают решение пригодным для промышленных сценариев — от пакетной обработки документов до анализа графиков в реальном времени.