StorySoftware
OpenAI releases gpt-oss-safeguard, open-weight models that classify content against a written policy
OpenAI released a research preview of gpt-oss-safeguard, 120B and 20B open-weight models fine-tuned from gpt-oss for safety classification under Apache 2.0. Instead of rules trained in, the model reads a developer's written policy at run time and reasons about whether content breaks it, so policies can be revised without retraining.
- Models reason directly over any provided policy, including new or external ones, adapting to new guidelines without retraining.
- Outperforms gpt-5-thinking and open-oss models on multi-policy accuracy; produces transparent chain-of-thought for each decision.
- Two sizes (120B and 20B) address different latency/accuracy trade-offs for deployment.