StorySoftware

OpenAI releases gpt-oss-safeguard, open-weight models that classify content against a written policy

OpenAIgpt-oss

OpenAI released a research preview of gpt-oss-safeguard, 120B and 20B open-weight models fine-tuned from gpt-oss for safety classification under Apache 2.0. Instead of rules trained in, the model reads a developer's written policy at run time and reasons about whether content breaks it, so policies can be revised without retraining.

  • Models reason directly over any provided policy, including new or external ones, adapting to new guidelines without retraining.
  • Outperforms gpt-5-thinking and open-oss models on multi-policy accuracy; produces transparent chain-of-thought for each decision.
  • Two sizes (120B and 20B) address different latency/accuracy trade-offs for deployment.
Read the original · Blog

More on gpt-oss

Primer