ComfyUI стал одним из самых популярных интерфейсов для работы с моделями Stable Diffusion благодаря своей гибкой узловой архитектуре. Однако владельцы видеокарт AMD долгое время сталкивались с трудностями при запуске нейросетевых инструментов, изначально ориентированных на технологию CUDA от NVIDIA. Решением этой проблемы для пользователей Windows стала технология DirectML, которая позволяет задействовать графические процессоры AMD, Intel и даже встроенную графику для ускорения вычислений. DirectML представляет собой низкоуровневый API от Microsoft, входящий в семейство DirectX. Он обеспечивает аппаратное ускорение машинного обучения на любом совместимом с DirectX 12 устройстве. Это означает, что владельцы карт Radeon RX 5000, 6000 и 7000 серий, а также более старых моделей могут запускать ComfyUI без необходимости установки Linux и настройки ROCm, что значительно упрощает процесс для обычных пользователей. Установка ComfyUI с поддержкой DirectML начинается с подготовки окружения. Необходим Python версии 3.10 или 3.11, установленный с опцией добавления в PATH. Далее следует клонировать репозиторий ComfyUI с GitHub и создать виртуальное окружение командой python -m venv venv. После активации окружения устанавливается специальная версия библиотек: pip install torch-directml, а также все зависимости из файла requirements.txt. Важно не устанавливать стандартную версию PyTorch с поддержкой CUDA, так как она конфликтует с DirectML. Для запуска приложения используется команда python main.py с обязательным флагом --directml. Можно дополнительно указать номер устройства, если в системе несколько графических адаптеров, например --directml 0. При первом запуске ComfyUI автоматически определит доступную видеокарту и выделит видеопамять для работы. Рекомендуется также добавить флаг --lowvram или --normalvram в зависимости от объёма доступной памяти GPU. Производительность связки ComfyUI и DirectML заметно уступает оригинальному CUDA, но остаётся вполне приемлемой для домашнего использования. На видеокарте Radeon RX 6700 XT генерация изображения размером 512 на 512 пикселей с 20 шагами занимает около 15-25 секунд, что вполне сопоставимо с картами среднего сегмента от NVIDIA. При работе с моделями SDXL время ожидания увеличивается, а требования к памяти возрастают до 8-12 гигабайт.