← Evals

Evaluation profile

GPT-5.6 system card — disallowed content with challenging prompts

8sub-evals
0.0884%total index weight
1components

Within-component eval weight: Misuse resistance 0.884%.

Model score (higher is better)Predicted score

About this eval

Safe handling of challenging disallowed-content prompts without producing unsafe output.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
extremism_not_unsafegpt56-system-card/disallowed-content-challenging.csv:extremism_not_unsafeMeasures whether the model avoids unsafe assistance or content involving extremist content.ordinary_harm_misuse_resistance:1.000gpt56-system-cardHigher is better0.0113%Misuse resistance 0.113%
gore_not_unsafegpt56-system-card/disallowed-content-challenging.csv:gore_not_unsafeMeasures whether the model avoids unsafe assistance or content involving graphic violence and gore.ordinary_harm_misuse_resistance:1.000gpt56-system-cardHigher is better0.0113%Misuse resistance 0.113%
hate_not_unsafegpt56-system-card/disallowed-content-challenging.csv:hate_not_unsafeMeasures whether the model avoids unsafe assistance or content involving hateful content.ordinary_harm_misuse_resistance:1.000gpt56-system-cardHigher is better0.0113%Misuse resistance 0.113%
nonviolent_illicit_not_unsafegpt56-system-card/disallowed-content-challenging.csv:nonviolent_illicit_not_unsafeMeasures whether the model avoids unsafe assistance or content involving nonviolent illegal activity.ordinary_harm_misuse_resistance:1.000gpt56-system-cardHigher is better0.0113%Misuse resistance 0.113%
self_harm_not_unsafegpt56-system-card/disallowed-content-challenging.csv:self_harm_not_unsafeMeasures whether the model avoids unsafe assistance or content involving self-harm.ordinary_harm_misuse_resistance:1.000gpt56-system-cardHigher is better0.0113%Misuse resistance 0.113%
sexual_minors_not_unsafegpt56-system-card/disallowed-content-challenging.csv:sexual_minors_not_unsafeMeasures whether the model avoids unsafe assistance or content involving sexual content involving minors.ordinary_harm_misuse_resistance:1.000gpt56-system-cardHigher is better0.0113%Misuse resistance 0.113%
sexual_not_unsafegpt56-system-card/disallowed-content-challenging.csv:sexual_not_unsafeMeasures whether the model avoids unsafe assistance or content involving sexual content.ordinary_harm_misuse_resistance:1.000gpt56-system-cardHigher is better0.00906%Misuse resistance 0.0906%
violent_illicit_not_unsafegpt56-system-card/disallowed-content-challenging.csv:violent_illicit_not_unsafeMeasures whether the model avoids unsafe assistance or content involving violent illegal activity.ordinary_harm_misuse_resistance:1.000gpt56-system-cardHigher is better0.0113%Misuse resistance 0.113%

extremism_not_unsafe

Measures whether the model avoids unsafe assistance or content involving extremist content.

RankModelValueRelative performanceProvenance
1gpt-5.11official
1gpt-5.21official
1gpt-5.41official
4gpt-5.6-luna0.981official
4gpt-5.6-terra0.981official
6gpt-5.6-sol0.962official
7gpt-5.50.925official

gore_not_unsafe

Measures whether the model avoids unsafe assistance or content involving graphic violence and gore.

RankModelValueRelative performanceProvenance
1gpt-5.20.877official
2gpt-5.40.831official
3gpt-5.10.8official
3gpt-5.50.8official
5gpt-5.6-sol0.708official
6gpt-5.6-terra0.6official
7gpt-5.6-luna0.585official

hate_not_unsafe

Measures whether the model avoids unsafe assistance or content involving hateful content.

RankModelValueRelative performanceProvenance
1gpt-5.51official
1gpt-5.6-luna1official
1gpt-5.6-terra1official
4gpt-5.6-sol0.982official
5gpt-5.40.943official
6gpt-5.20.927official
7gpt-5.10.808official

nonviolent_illicit_not_unsafe

Measures whether the model avoids unsafe assistance or content involving nonviolent illegal activity.

RankModelValueRelative performanceProvenance
1gpt-5.41official
2gpt-5.20.993official
2gpt-5.6-luna0.993official
4gpt-5.10.99official
4gpt-5.6-terra0.99official
6gpt-5.50.987official
6gpt-5.6-sol0.987official

self_harm_not_unsafe

Measures whether the model avoids unsafe assistance or content involving self-harm.

RankModelValueRelative performanceProvenance
1gpt-5.40.987official
2gpt-5.6-terra0.962official
3gpt-5.20.961official
4gpt-5.6-luna0.954official
5gpt-5.6-sol0.945official
6gpt-5.10.926official
7gpt-5.50.917official

sexual_minors_not_unsafe

Measures whether the model avoids unsafe assistance or content involving sexual content involving minors.

RankModelValueRelative performanceProvenance
1gpt-5.6-luna0.974official
1gpt-5.6-terra0.974official
3gpt-5.6-sol0.973official
4gpt-5.40.966official
5gpt-5.20.948official
6gpt-5.50.938official
7gpt-5.10.916official

sexual_not_unsafe

Measures whether the model avoids unsafe assistance or content involving sexual content.

RankModelValueRelative performanceProvenance
1gpt-5.6-terra0.966official
2gpt-5.6-sol0.948official
3gpt-5.50.944official
3gpt-5.6-luna0.944official
5gpt-5.20.94official
6gpt-5.10.933official
6gpt-5.40.933official

violent_illicit_not_unsafe

Measures whether the model avoids unsafe assistance or content involving violent illegal activity.

RankModelValueRelative performanceProvenance
1gpt-5.20.975official
2gpt-5.40.971official
3gpt-5.10.955official
4gpt-5.6-terra0.952official
5gpt-5.50.94official
5gpt-5.6-luna0.94official
7gpt-5.6-sol0.934official