У Алисы от Яндекса есть очень удобная и бесплатная штука — умная камера. Это не просто распознавание объектов на фото. Камера может, например, сразу найти подобный товар в интернете и рассказать о нём, решить написанное на бумажке уравнение, скопировать или перевести текст с картинки и многое другое. Мы разобрались, как вообще работает эта технология, и даже пообщались с инженерами из Яндекса. Что в основе Главный мозг системы — мультимодальная модель, которую ещё называют VLM (Vision Language Model). Сперва у нас есть обычная “текстовая” нейросеть (LLM), но нужно научить её понимать изображения. Как это делается? Чтобы спрашивать что-то вроде “где купить такие кеды?”, нужны дополнительные инструменты: В конце работает VLM-суммаризатор — всё найденное собирается в короткий и понятный ответ для пользователя. Вся процедура занимает 2–3 секунды. К тому же вся цепочка подстраивается под ваши интересы и поведение. Вот такая начинка под капотом у Алисы стоит за, казалось бы, простой функцией - наведи и получи ответ.