DeepSeek опубликовала под лицензией MIT веса модели V4-Flash-Vision-Exp с 305 млрд параметров. Нейросеть умеет анализировать изображения, графики и скриншоты, а также работать с внешними инструментами в агентских сценариях. DeepSeek открыла веса экспериментальной модели DeepSeek-V4-Flash-Vision-Exp. Релиз появился примерно через десять дней после первоначального запуска. Модель содержит 305 млрд параметров и распространяется под лицензией MIT. В репозитории опубликованы не только сами веса, но и токенизатор, пример минимального запуска на PyTorch и компоненты, необходимые для работы с изображениями. Новинка snapshots на базе V4-Flash, к которой добавили визуальные модули и дополнительное обучение на задачах анализа изображений. Модель может разбирать скриншоты, читать графики, сопоставлять элементы на картинках и использовать внешние инструменты. Изображения разрешается передавать двумя способами. Разработчики могут использовать блочный формат или компактную запись через специальные теги. Запуск поддерживают vLLM, SGLang, Transformers и Docker. DeepSeek приводит результаты внутренних сравнений на мультимодальных и текстовых тестах. На ApexBench модель получила 36,5 балла, а на Agents’ Last Exam 27,3 балла. В задачах с инструментами результат Toolathlon-Verified составил 75,9 балла, а на DeepSWE модель показала 59,3 балла. Сравнения нужно воспринимать осторожно, поскольку часть предыдущих моделей не поддерживала изображения, а опубликованный чекпоинт остаётся экспериментальным.