Tokenize в контексте искусственного интеллекта означает разбиение текста, кода или другого последовательного ввода на токены — минимальные элементы, с которыми работает модель. Для языковых нейросетей токенами могут быть слова, части слов, символы, пробелы, знаки препинания или специальные служебные маркеры. Именно через токены модель получает данные, оценивает контекст и формирует ответ. Токенизация стала важной частью архитектуры современных LLM, потому что нейросеть не воспринимает текст как человек. Перед обработкой фраза преобразуется в числовые идентификаторы, связанные со словарём токенизатора. От того, как именно текст разбивается на фрагменты, зависит длина контекста, стоимость вычислений, скорость генерации и точность интерпретации редких слов, терминов или фрагментов кода. В популярных моделях используются разные подходы к tokenize. Одни системы чаще опираются на подсловные единицы, другие эффективнее работают с байтами или символами. Подсловная токенизация помогает обрабатывать незнакомые слова: модель может разложить редкий термин на знакомые части и сохранить часть смысла. Байтовые схемы удобны для многоязычных данных, эмодзи, нестандартных символов и смешанного контента. Для русского языка вопрос токенизации особенно заметен из-за богатой морфологии. Одно и то же слово может иметь множество форм, и токенизатор должен представлять их достаточно компактно. Если разбиение получается слишком дробным, текст занимает больше токенов, контекст быстрее заполняется, а модель тратит больше ресурсов на обработку. Это влияет не только на стоимость API-запросов, но и на качество длинных диалогов, суммаризации и анализа документов. В задачах программирования tokenize имеет отдельное значение. Код содержит идентификаторы, скобки, отступы, операторы и строки, которые должны сохранять структуру. Некачественная токенизация может ухудшить понимание синтаксиса, особенно в длинных файлах или при работе с редкими библиотеками. Поэтому модели для кода часто обучаются с учётом специфики языков программирования и репозиториев. Термин tokenize также связан с ограничениями контекстного окна. Пользователь видит текст в символах или словах, а модель рассчитывает объём входа в токенах. Поэтому два текста одинаковой длины визуально могут занимать разное количество токенов. Английский текст обычно кодируется компактнее, чем многие другие языки, если токенизатор оптимизирован под англоязычные датасеты.