DeepSeek 685B: Техническая правда о «тяжеловесе» и магия MTP В обсуждениях нейросетей часто фигурирует цифра 685B, когда речь идет о флагманах DeepSeek (V3 или R1). На самом деле, это не «новая секретная модель», а техническое обозначение полной сборки весов. Основное ядро моделей DeepSeek V3 и R1 имеет 671 миллиард параметров. Откуда же берутся лишние 14B? Анатомия 685B: Что внутри? Цифра 685B — это сумма двух независимых модулей, которые поставляются в одном пакете весов на Hugging Face: Почему 685B — это важно для архитектуры? Использование дополнительных 14B параметров для MTP кардинально меняет процесс обучения и инференса: Системные требования для локального запуска Запуск модели такого масштаба требует профессионального серверного оборудования. Даже в квантованном виде 685B — это вызов для любого «железа». Аппаратные конфигурации: Важно: Модули MTP пока поддерживаются не всеми движками (вроде базового llama.cpp). Для их полноценного использования требуется поддержка на уровне софта (например, через vLLM или SGLang). DeepSeek-V3 vs DeepSeek-R1 (685B) Обе модели используют одну и ту же архитектурную базу в 685B, но обучены для разных целей: