deeplab v3 — архитектура нейронной сети для семантической сегментации, разработанная в рамках семейства DeepLab. Ее задача состоит в том, чтобы присваивать каждому пикселю изображения определенный класс: дорога, человек, автомобиль, здание, растительность и так далее. Такой подход важен там, где недостаточно просто найти объект рамкой, а требуется точно определить его форму и границы. Главная особенность deeplab v3 связана с использованием atrous convolution, или разреженных сверток. Этот механизм позволяет расширять поле зрения сети без резкого увеличения числа параметров и без сильной потери пространственного разрешения. В результате модель лучше учитывает контекст: пиксель анализируется не только по ближайшему окружению, но и с учетом более широкой области изображения. Еще один важный элемент архитектуры — Atrous Spatial Pyramid Pooling. Этот блок применяет несколько разреженных сверток с разными коэффициентами расширения, благодаря чему сеть рассматривает сцену сразу в нескольких масштабах. Для задач сегментации это особенно полезно: на одном изображении могут присутствовать и крупные объекты, и мелкие детали, а модель должна корректно обработать оба случая. deeplab v3 часто рассматривают как удачный баланс между качеством сегментации и практической применимостью. Она показывает сильные результаты на датасетах вроде PASCAL VOC и Cityscapes, хорошо работает с городскими сценами, природными объектами, людьми и транспортом. При этом архитектура может использовать разные backbone-сети, например ResNet, что дает гибкость при выборе между точностью и вычислительными затратами. К ограничениям deeplab v3 обычно относят сложность точного восстановления тонких границ объектов. Несмотря на сильную работу с контекстом, модель может сглаживать края или терять мелкие элементы, особенно если изображение содержит много перекрытий и деталей. Именно поэтому позднее появилась версия deeplab v3+, где был усилен декодер для более точной детализации масок.