Библиотека llama-cpp-python — это Python-биндинг для оригинального C++ порта llama.cpp. Она позволяет запускать большие языковые модели (LLM) архитектуры LLaMA локально, используя как мощности процессора (CPU), так и видеокарты (GPU). Главное преимущество такого подхода — высокая скорость инференса и минимальное потребление оперативной памяти за счет квантования. Развертывание этой связки на Windows часто вызывает сложности из-за специфики компиляции C++ библиотек. Ниже приведена пошаговая инструкция по настройке окружения, установке библиотеки с поддержкой аппаратного ускорения и запуску первой модели. Шаг 1. Готовим Windows: Инструменты для сборки без ошибок Для успешной сборки llama-cpp-python в операционной системе Windows требуются определенные системные компоненты. Обычный pip install без подготовки приведет к ошибке Failed to build wheel. Необходимый софт: Шаг 2. Установка llama-cpp-python: Режимы для CPU и GPU Установка делится на два сценария: базовая (только на процессоре) и с поддержкой видеокарт NVIDIA (CUDA). Для максимальной производительности всегда следует выбирать второй вариант, если в системе установлена дискретная видеокарта. Вариант А. Базовая установка (Только CPU) Если у вас нет совместимой видеокарты или вы хотите тестировать модель исключительно на процессоре, достаточно выполнить стандартную команду: Bash Вариант Б. Турбо-режим на видеокарте (NVIDIA CUDA) Для работы с GPU потребуется предварительно установленный CUDA Toolkit (версии 11.8 или 12.x) от NVIDIA. Чтобы pip скомпилировал библиотеку с поддержкой cuBLAS (аппаратного ускорения), необходимо передать флаги компилятору через переменные окружения. Откройте PowerShell (желательно от имени администратора) и выполните следующие команды по очереди: PowerShell Примечание: Использование --force-reinstall и --no-cache-dir гарантирует, что система соберет библиотеку заново под вашу видеокарту, а не подтянет из кэша заранее скомпилированную версию без CUDA. Шаг 3. Где брать модели и что такое формат GGUF llama.cpp работает с форматом GGUF (предыдущий формат GGML устарел). GGUF позволяет упаковать веса нейросети и метаданные в один удобный файл. Шаг 4. Пишем код: Скрипт для инференса на Python Ниже представлен рабочий скрипт на Python для загрузки GGUF-модели и генерации текста. Код оптимизирован для использования видеокарты. Python Разбор полетов: 4 главные ошибки на Windows и как их лечить