Китайская DeepSeek представила экспериментальную модель DeepSeek-V4-Flash-Vision-Exp.
Она умеет работать не только с текстом, но и с изображениями и скриншотами. Модель основана на флагманской DeepSeek-V4-Flash. По словам разработчиков, в текстовых задачах она сохраняет возможности оригинальной версии, включая рассуждения, работу ИИ-агентов и знания об окружающем мире.

Главным нововведением стала поддержка визуальных запросов. Модель может анализировать изображения, понимать содержимое скриншотов и использовать полученную информацию для выполнения различных задач.
По результатам тестов мультимодальных агентных возможностей новая модель показывает результаты, близкие к Anthropic Opus 4.8, а где-то даже превосходит её. Речь идет о сценариях, в которых ИИ способен самостоятельно выполнять последовательность действий без постоянных дополнительных команд со стороны пользователя.
Пока модель имеет экспериментальный статус. Получить к ней доступ можно через API DeepSeek. [Bloomberg]
3 комментария