OpenAI представили сразу две открытые модели — gpt-oss-safeguard 20B и 120B. Они построены на базе gpt-oss и специально обучались для классификации и проверки текстов на безопасность и соответствие политике. Главная фишка — правила фильтрации не зашиты внутрь, а задаются пользователем в момент запуска. То есть вы сами указываете, что именно хотите считать разрешённым или запрещённым, и модель работает по вашим условиям. На первый взгляд, кажется, что область применения узкая. Но на деле задач по проверке и модерации контента становится всё больше — как только растёт популярность ИИ, таких кейсов вокруг становится просто море. По словам OpenAI, safeguard-модели отлично справляются с задачей, если задать им чёткие и логичные инструкции. Если политика фильтрации продумана заранее, то модели способны разруливать даже сложные, серые ситуации на грани различных смыслов. Кстати, внутри самой OpenAI эти модели уже используют для проверки безопасности промптов и настройки поведения других ИИ. Главное удобство в том, что не нужно лепить отдельные модели для разных ситуаций. В safeguard можно просто задавать разные инструкции — к примеру, одну политику для подростков, другую для бизнес-партнёров, третью для внутренней работы.