Evaluation profile
GPT-6 Sol/Luna system card — safety and updated alignment tests
Weights below are portfolio-specific global index weights.
About this eval
Safety, refusal calibration, honesty and responsible agency under the publisher’s evaluation conditions.
Included in the behavior ranking.
Sub-evals
| Measure | Component | Direction by ranking | Safety weight | Freedom weight |
|---|---|---|---|---|
| agentic_chat_plugins_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:agentic_chat_plugins_safe_rateMeasures chat prod - chat plugins in the publisher’s specified evaluation condition. | Safety: responsible_agency_control:1.000gpt6-astra-system-card | Safety: higher | 0.00284% | — |
| agentic_codex_age_restricted_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:agentic_codex_age_restricted_safe_rateMeasures codex prod - age-restricted actions in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000gpt6-astra-system-card | Safety: higher | 0.000986% | — |
| agentic_codex_nonviolent_wrongdoing_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:agentic_codex_nonviolent_wrongdoing_safe_rateMeasures codex prod - non-violent wrongdoing in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000gpt6-astra-system-card | Safety: higher | 0.000986% | — |
| agentic_codex_personal_data_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:agentic_codex_personal_data_safe_rateMeasures codex prod - sensitive personal data in the publisher’s specified evaluation condition. | Safety: responsible_agency_control:1.000gpt6-astra-system-card | Safety: higher | 0.00284% | — |
| agentic_codex_self_harm_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:agentic_codex_self_harm_safe_rateMeasures codex prod - self-harm in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000gpt6-astra-system-card | Safety: higher | 0.000986% | — |
| agentic_codex_violent_wrongdoing_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:agentic_codex_violent_wrongdoing_safe_rateMeasures codex prod - violent wrongdoing in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000gpt6-astra-system-card | Safety: higher | 0.000986% | — |
| agentic_redteam_chat_plugins_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:agentic_redteam_chat_plugins_safe_rateMeasures human red-teaming - chat plugins in the publisher’s specified evaluation condition. | Safety: responsible_agency_control:1.000gpt6-astra-system-card | Safety: higher | 0.00284% | — |
| agentic_redteam_codex_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:agentic_redteam_codex_safe_rateMeasures human red-teaming - codex in the publisher’s specified evaluation condition. | Safety: responsible_agency_control:1.000gpt6-astra-system-card | Safety: higher | 0.00284% | — |
| attempted_retry_or_circumvention_after_denial_pct_2026_09_22gpt6-astra-system-card/safety-alignment-2026-09-22.csv:attempted_retry_or_circumvention_after_denial_pct_2026_09_22Measures retried or attempted to circumvent including successes in the publisher’s specified evaluation condition. | Safety: responsible_agency_control:1.000gpt6-astra-system-card | Safety: lower | 0.00317% | — |
| biology_benign_not_overrefuse_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:biology_benign_not_overrefuse_rateMeasures benign / not overrefuse in the publisher’s specified evaluation condition. | Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: higher | 0.00838% | 0.0424% |
| biology_dual_use_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:biology_dual_use_safe_rateMeasures dual use / safe in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.00121% | 0.0424% |
| biology_severe_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:biology_severe_safe_rateMeasures severe / safe in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.00121% | 0.0424% |
| broken_search_unacknowledged_limitation_pct_2026_09_22gpt6-astra-system-card/safety-alignment-2026-09-22.csv:broken_search_unacknowledged_limitation_pct_2026_09_22Measures failure rate in the publisher’s specified evaluation condition. | Safety: truthfulness_honesty:1.000gpt6-astra-system-card | Safety: lower | 0.00301% | — |
| challenging_extremism_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:challenging_extremism_safe_rateMeasures extremism in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000652% | 0.0229% |
| challenging_gore_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:challenging_gore_safe_rateMeasures gore in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000652% | 0.0229% |
| challenging_hate_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:challenging_hate_safe_rateMeasures hate in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000652% | 0.0229% |
| challenging_nonviolent_illicit_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:challenging_nonviolent_illicit_safe_rateMeasures non-violent illicit behavior in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000652% | 0.0229% |
| challenging_self_harm_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:challenging_self_harm_safe_rateMeasures self-harm (standard) in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000652% | 0.0229% |
| challenging_sexual_minors_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:challenging_sexual_minors_safe_rateMeasures sexual/minors in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000652% | 0.0229% |
| challenging_sexual_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:challenging_sexual_safe_rateMeasures sexual in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000652% | 0.0229% |
| challenging_violent_illicit_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:challenging_violent_illicit_safe_rateMeasures violent illicit behavior in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000652% | 0.0229% |
| coding_deception_misrepresentation_pct_2026_09_22gpt6-astra-system-card/safety-alignment-2026-09-22.csv:coding_deception_misrepresentation_pct_2026_09_22Measures failure rate in the publisher’s specified evaluation condition. | Safety: truthfulness_honesty:1.000gpt6-astra-system-card | Safety: lower | 0.00301% | — |
| cyber_production_chat_safe_scoregpt6-astra-system-card/safety-alignment-2026-09-22.csv:cyber_production_chat_safe_scoreMeasures production chat in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.00121% | 0.0424% |
| cyber_semisynthetic_agentic_safe_scoregpt6-astra-system-card/safety-alignment-2026-09-22.csv:cyber_semisynthetic_agentic_safe_scoreMeasures semi-synthetic agentic envs in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000gpt6-astra-system-card | Safety: higher | 0.0011% | — |
| cyber_synthetic_agentic_safe_scoregpt6-astra-system-card/safety-alignment-2026-09-22.csv:cyber_synthetic_agentic_safe_scoreMeasures synthetic agentic envs in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000gpt6-astra-system-card | Safety: higher | 0.00121% | — |
| dynamic_emotional_reliance_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:dynamic_emotional_reliance_safe_rateMeasures emotional reliance in the publisher’s specified evaluation condition. | Safety: responsible_agency_control:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.00188% | 0.0229% |
| dynamic_mental_health_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:dynamic_mental_health_safe_rateMeasures mental health in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000652% | 0.0229% |
| dynamic_self_harm_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:dynamic_self_harm_safe_rateMeasures self-harm in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000652% | 0.0229% |
| instruction_hierarchy_defender_success_pctgpt6-astra-system-card/safety-alignment-2026-09-22.csv:instruction_hierarchy_defender_success_pctMeasures robustness in the publisher’s specified evaluation condition. | Safety: responsible_agency_control:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.00123% | 0.015% |
| severity_1_or_2_misalignment_flags_pct_2026_09_22gpt6-astra-system-card/safety-alignment-2026-09-22.csv:severity_1_or_2_misalignment_flags_pct_2026_09_22Measures severity 1 or 2 flags in the publisher’s specified evaluation condition. | Safety: responsible_agency_control:1.000gpt6-astra-system-card | Safety: lower | 0.00201% | — |
| severity_3_plus_misalignment_flags_pct_2026_09_22gpt6-astra-system-card/safety-alignment-2026-09-22.csv:severity_3_plus_misalignment_flags_pct_2026_09_22Measures severity 3 or higher flags in the publisher’s specified evaluation condition. | Safety: responsible_agency_control:1.000gpt6-astra-system-card | Safety: lower | 0.00201% | — |
| static_jailbreak_bio_high_risk_defender_success_pctgpt6-astra-system-card/safety-alignment-2026-09-22.csv:static_jailbreak_bio_high_risk_defender_success_pctMeasures bio: high risk in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.0011% | 0.0387% |
| static_jailbreak_bio_severe_defender_success_pctgpt6-astra-system-card/safety-alignment-2026-09-22.csv:static_jailbreak_bio_severe_defender_success_pctMeasures bio: severe in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.0011% | 0.0387% |
| static_jailbreak_cyber_defender_success_pctgpt6-astra-system-card/safety-alignment-2026-09-22.csv:static_jailbreak_cyber_defender_success_pctMeasures cyber in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.0011% | 0.0387% |
| static_jailbreak_violence_moderate_defender_success_pctgpt6-astra-system-card/safety-alignment-2026-09-22.csv:static_jailbreak_violence_moderate_defender_success_pctMeasures violence: moderate in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.0011% | 0.0387% |
| static_jailbreak_violence_severe_defender_success_pctgpt6-astra-system-card/safety-alignment-2026-09-22.csv:static_jailbreak_violence_severe_defender_success_pctMeasures violence: severe in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.0011% | 0.0387% |
| u18_age_restricted_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:u18_age_restricted_safe_rateMeasures age-restricted goods, services, and dangerous challenges / activities in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000652% | 0.0229% |
| u18_eating_disorders_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:u18_eating_disorders_safe_rateMeasures eating disorders in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000652% | 0.0229% |
| u18_emotional_reliance_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:u18_emotional_reliance_safe_rateMeasures emotional reliance in the publisher’s specified evaluation condition. | Safety: responsible_agency_control:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.00188% | 0.0229% |
| u18_gore_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:u18_gore_safe_rateMeasures gore in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000652% | 0.0229% |
| u18_self_harm_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:u18_self_harm_safe_rateMeasures self harm in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000652% | 0.0229% |
| u18_sexual_content_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:u18_sexual_content_safe_rateMeasures sexual content in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000652% | 0.0229% |
| unwanted_persistence_after_warning_pct_2026_09_22gpt6-astra-system-card/safety-alignment-2026-09-22.csv:unwanted_persistence_after_warning_pct_2026_09_22Measures fails to stop in the publisher’s specified evaluation condition. | Safety: responsible_agency_control:1.000gpt6-astra-system-card | Safety: lower | 0.00317% | — |
| vision_erotic_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:vision_erotic_safe_rateMeasures harms-erotic in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000604% | 0.0212% |
| vision_extremism_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:vision_extremism_safe_rateMeasures extremism in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000604% | 0.0212% |
| vision_hate_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:vision_hate_safe_rateMeasures hate in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000604% | 0.0212% |
| vision_self_harm_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:vision_self_harm_safe_rateMeasures self-harm in the publisher’s specified evaluation condition. | Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-card | Safety: higher · Freedom: lower | 0.000604% | 0.0212% |
agentic_chat_plugins_safe_rate
Measures chat prod - chat plugins in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-5.6-sol | 1 | official | |
| 1 | gpt-6-astra | 1 | official | |
| 3 | gpt-6-sol | 0.923 | official | |
| 4 | gpt-6-luna | 0.846 | official |
agentic_codex_age_restricted_safe_rate
Measures codex prod - age-restricted actions in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 0.811 | official | |
| 2 | gpt-6-sol | 0.755 | official | |
| 3 | gpt-6-luna | 0.687 | official | |
| 4 | gpt-5.6-sol | 0.603 | official |
agentic_codex_nonviolent_wrongdoing_safe_rate
Measures codex prod - non-violent wrongdoing in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-luna | 1 | official | |
| 2 | gpt-6-sol | 0.99 | official | |
| 3 | gpt-6-astra | 0.954 | official | |
| 4 | gpt-5.6-sol | 0.906 | official |
agentic_codex_personal_data_safe_rate
Measures codex prod - sensitive personal data in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-sol | 0.854 | official | |
| 2 | gpt-6-luna | 0.795 | official | |
| 3 | gpt-5.6-sol | 0.765 | official | |
| 4 | gpt-6-astra | 0.763 | official |
agentic_codex_self_harm_safe_rate
Measures codex prod - self-harm in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-luna | 0.96 | official | |
| 2 | gpt-6-astra | 0.92 | official | |
| 2 | gpt-6-sol | 0.92 | official | |
| 4 | gpt-5.6-sol | 0.893 | official |
agentic_codex_violent_wrongdoing_safe_rate
Measures codex prod - violent wrongdoing in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 0.907 | official | |
| 2 | gpt-6-sol | 0.889 | official | |
| 3 | gpt-6-luna | 0.796 | official | |
| 4 | gpt-5.6-sol | 0.689 | official |
agentic_redteam_chat_plugins_safe_rate
Measures human red-teaming - chat plugins in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 1 | official | |
| 2 | gpt-6-sol | 0.936 | official | |
| 3 | gpt-6-luna | 0.814 | official | |
| 4 | gpt-5.6-sol | 0.766 | official |
agentic_redteam_codex_safe_rate
Measures human red-teaming - codex in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 0.977 | official | |
| 2 | gpt-6-luna | 0.957 | official | |
| 3 | gpt-6-sol | 0.935 | official | |
| 4 | gpt-5.6-sol | 0.851 | official |
attempted_retry_or_circumvention_after_denial_pct_2026_09_22
Measures retried or attempted to circumvent including successes in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 0 | official | |
| 1 | gpt-6-sol | 0 | official | |
| 3 | gpt-6-luna | 0.3 | official | |
| 4 | gpt-5.6-luna | 4.3 | official | |
| 5 | gpt-5.6-sol | 7.3 | official |
biology_benign_not_overrefuse_rate
Measures benign / not overrefuse in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-5.6-luna | 0.989 | official | |
| 1 | gpt-5.6-sol | 0.989 | official | |
| 3 | gpt-6-astra | 0.978 | official | |
| 4 | gpt-6-sol | 0.964 | official | |
| 5 | gpt-6-luna | 0.958 | official | |
| 6 | gpt-5.5 | 0.917 | official |
biology_dual_use_safe_rate
Measures dual use / safe in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-sol | 0.98 | official | |
| 2 | gpt-6-astra | 0.97 | official | |
| 3 | gpt-6-luna | 0.962 | official | |
| 4 | gpt-5.5 | 0.926 | official | |
| 4 | gpt-5.6-luna | 0.926 | official | |
| 6 | gpt-5.6-sol | 0.911 | official |
biology_severe_safe_rate
Measures severe / safe in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 0.998 | official | |
| 1 | gpt-6-sol | 0.998 | official | |
| 3 | gpt-6-luna | 0.985 | official | |
| 4 | gpt-5.5 | 0.958 | official | |
| 5 | gpt-5.6-luna | 0.946 | official | |
| 6 | gpt-5.6-sol | 0.943 | official |
broken_search_unacknowledged_limitation_pct_2026_09_22
Measures failure rate in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 1.5 | official | |
| 2 | gpt-6-sol | 4.92 | official | |
| 3 | gpt-6-luna | 28.67 | official | |
| 4 | gpt-5.6-sol | 77.46 | official | |
| 5 | gpt-5.6-luna | 78.25 | official |
challenging_extremism_safe_rate
Measures extremism in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-5.6-luna | 0.981 | official | |
| 1 | gpt-6-astra | 0.981 | official | |
| 3 | gpt-6-luna | 0.979 | official | |
| 4 | gpt-5.6-sol | 0.962 | official | |
| 5 | gpt-5.4 | 0.943 | official | |
| 6 | gpt-6-sol | 0.936 | official | |
| 7 | gpt-5.5 | 0.925 | official |
challenging_gore_safe_rate
Measures gore in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-sol | 0.9 | official | |
| 2 | gpt-6-astra | 0.898 | official | |
| 3 | gpt-6-luna | 0.876 | official | |
| 4 | gpt-5.4 | 0.823 | official | |
| 5 | gpt-5.5 | 0.803 | official | |
| 6 | gpt-5.6-sol | 0.785 | official | |
| 7 | gpt-5.6-luna | 0.585 | official |
challenging_hate_safe_rate
Measures hate in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-5.4 | 1 | official | |
| 1 | gpt-5.5 | 1 | official | |
| 1 | gpt-5.6-luna | 1 | official | |
| 1 | gpt-6-astra | 1 | official | |
| 1 | gpt-6-luna | 1 | official | |
| 6 | gpt-5.6-sol | 0.982 | official | |
| 6 | gpt-6-sol | 0.982 | official |
challenging_nonviolent_illicit_safe_rate
Measures non-violent illicit behavior in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 0.997 | official | |
| 1 | gpt-6-luna | 0.997 | official | |
| 3 | gpt-5.6-luna | 0.993 | official | |
| 3 | gpt-6-sol | 0.993 | official | |
| 5 | gpt-5.4 | 0.99 | official | |
| 6 | gpt-5.5 | 0.987 | official | |
| 6 | gpt-5.6-sol | 0.987 | official |
challenging_self_harm_safe_rate
Measures self-harm (standard) in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 0.992 | official | |
| 2 | gpt-6-sol | 0.986 | official | |
| 3 | gpt-6-luna | 0.984 | official | |
| 4 | gpt-5.4 | 0.959 | official | |
| 5 | gpt-5.6-luna | 0.954 | official | |
| 6 | gpt-5.6-sol | 0.945 | official | |
| 7 | gpt-5.5 | 0.917 | official |
challenging_sexual_minors_safe_rate
Measures sexual/minors in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-sol | 0.991 | official | |
| 2 | gpt-5.6-luna | 0.974 | official | |
| 2 | gpt-6-astra | 0.974 | official | |
| 4 | gpt-5.6-sol | 0.973 | official | |
| 5 | gpt-6-luna | 0.965 | official | |
| 6 | gpt-5.4 | 0.947 | official | |
| 7 | gpt-5.5 | 0.938 | official |
challenging_sexual_safe_rate
Measures sexual in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-sol | 0.984 | official | |
| 2 | gpt-6-astra | 0.98 | official | |
| 3 | gpt-6-luna | 0.962 | official | |
| 4 | gpt-5.6-luna | 0.944 | official | |
| 5 | gpt-5.5 | 0.919 | official | |
| 6 | gpt-5.6-sol | 0.915 | official | |
| 7 | gpt-5.4 | 0.909 | official |
challenging_violent_illicit_safe_rate
Measures violent illicit behavior in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 0.99 | official | |
| 2 | gpt-6-sol | 0.988 | official | |
| 3 | gpt-6-luna | 0.986 | official | |
| 4 | gpt-5.4 | 0.961 | official | |
| 5 | gpt-5.5 | 0.94 | official | |
| 5 | gpt-5.6-luna | 0.94 | official | |
| 7 | gpt-5.6-sol | 0.934 | official |
coding_deception_misrepresentation_pct_2026_09_22
Measures failure rate in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 0.51 | official | |
| 2 | gpt-6-sol | 1.3 | official | |
| 3 | gpt-6-luna | 2.81 | official | |
| 4 | gpt-5.6-luna | 9.54 | official | |
| 5 | gpt-5.6-sol | 10.41 | official |
cyber_production_chat_safe_score
Measures production chat in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-5.6-luna | 0.986 | official | |
| 2 | gpt-5.6-sol | 0.983 | official | |
| 3 | gpt-6-astra | 0.97 | official | |
| 4 | gpt-6-sol | 0.957 | official | |
| 5 | gpt-6-luna | 0.951 | official | |
| 6 | gpt-5.5 | 0.928 | official |
cyber_semisynthetic_agentic_safe_score
Measures semi-synthetic agentic envs in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 0.997 | official | |
| 2 | gpt-6-luna | 0.987 | official | |
| 3 | gpt-5.6-sol | 0.985 | official | |
| 4 | gpt-6-sol | 0.984 | official | |
| 5 | gpt-5.5 | 0.963 | official |
cyber_synthetic_agentic_safe_score
Measures synthetic agentic envs in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-5.6-luna | 1 | official | |
| 2 | gpt-5.6-sol | 0.998 | official | |
| 2 | gpt-6-sol | 0.998 | official | |
| 4 | gpt-6-luna | 0.997 | official | |
| 5 | gpt-6-astra | 0.992 | official | |
| 6 | gpt-5.5 | 0.975 | official |
dynamic_emotional_reliance_safe_rate
Measures emotional reliance in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 0.993 | official | |
| 2 | gpt-5.4 | 0.976 | official | |
| 3 | gpt-6-sol | 0.969 | official | |
| 4 | gpt-6-luna | 0.963 | official | |
| 5 | gpt-5.6-luna | 0.957 | official | |
| 6 | gpt-5.6-sol | 0.953 | official | |
| 7 | gpt-5.5 | 0.915 | official |
dynamic_mental_health_safe_rate
Measures mental health in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 1 | official | |
| 1 | gpt-6-luna | 1 | official | |
| 3 | gpt-6-sol | 0.997 | official | |
| 4 | gpt-5.6-sol | 0.991 | official | |
| 5 | gpt-5.6-luna | 0.989 | official | |
| 6 | gpt-5.4 | 0.914 | official | |
| 7 | gpt-5.5 | 0.82 | official |
dynamic_self_harm_safe_rate
Measures self-harm in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 0.989 | official | |
| 2 | gpt-5.4 | 0.975 | official | |
| 3 | gpt-6-sol | 0.973 | official | |
| 4 | gpt-6-luna | 0.924 | official | |
| 5 | gpt-5.6-luna | 0.905 | official | |
| 6 | gpt-5.5 | 0.868 | official | |
| 7 | gpt-5.6-sol | 0.856 | official |
instruction_hierarchy_defender_success_pct
Measures robustness in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 99.99 | official | |
| 2 | gpt-6-luna | 99.97 | official | |
| 2 | gpt-6-sol | 99.97 | official |
severity_1_or_2_misalignment_flags_pct_2026_09_22
Measures severity 1 or 2 flags in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-sol | 14.8 | official | |
| 2 | gpt-5.6-sol | 19.67 | official |
severity_3_plus_misalignment_flags_pct_2026_09_22
Measures severity 3 or higher flags in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-sol | 0.083 | official | |
| 2 | gpt-5.6-sol | 0.131 | official |
static_jailbreak_bio_high_risk_defender_success_pct
Measures bio: high risk in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 97.3 | official | |
| 2 | gpt-6-sol | 85.8 | official | |
| 3 | gpt-6-luna | 73.8 | official | |
| 4 | gpt-5.5 | 11.5 | official | |
| 5 | gpt-5.6-sol | 5.8 | official |
static_jailbreak_bio_severe_defender_success_pct
Measures bio: severe in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 98.2 | official | |
| 2 | gpt-6-sol | 81.3 | official | |
| 3 | gpt-6-luna | 73 | official | |
| 4 | gpt-5.5 | 12.1 | official | |
| 5 | gpt-5.6-sol | 10.3 | official |
static_jailbreak_cyber_defender_success_pct
Measures cyber in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 91.5 | official | |
| 2 | gpt-6-luna | 87.5 | official | |
| 3 | gpt-6-sol | 79.8 | official | |
| 4 | gpt-5.6-sol | 59 | official | |
| 5 | gpt-5.5 | 57 | official |
static_jailbreak_violence_moderate_defender_success_pct
Measures violence: moderate in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 94.7 | official | |
| 2 | gpt-6-sol | 89.5 | official | |
| 3 | gpt-6-luna | 77 | official | |
| 4 | gpt-5.5 | 22.3 | official | |
| 5 | gpt-5.6-sol | 21.6 | official |
static_jailbreak_violence_severe_defender_success_pct
Measures violence: severe in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 98.3 | official | |
| 2 | gpt-6-sol | 90.5 | official | |
| 3 | gpt-6-luna | 89.3 | official | |
| 4 | gpt-5.6-sol | 48.3 | official | |
| 5 | gpt-5.5 | 38 | official |
u18_age_restricted_safe_rate
Measures age-restricted goods, services, and dangerous challenges / activities in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 0.918 | official | |
| 2 | gpt-6-sol | 0.861 | official | |
| 3 | gpt-6-luna | 0.848 | official | |
| 4 | gpt-5.6-luna | 0.76 | official | |
| 5 | gpt-5.4 | 0.752 | official | |
| 6 | gpt-5.6-sol | 0.719 | official | |
| 7 | gpt-5.5 | 0.711 | official |
u18_eating_disorders_safe_rate
Measures eating disorders in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 0.921 | official | |
| 2 | gpt-6-luna | 0.871 | official | |
| 3 | gpt-6-sol | 0.853 | official | |
| 4 | gpt-5.6-sol | 0.71 | official | |
| 5 | gpt-5.6-luna | 0.702 | official | |
| 6 | gpt-5.4 | 0.673 | official | |
| 7 | gpt-5.5 | 0.639 | official |
u18_emotional_reliance_safe_rate
Measures emotional reliance in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-sol | 0.948 | official | |
| 2 | gpt-6-luna | 0.946 | official | |
| 3 | gpt-6-astra | 0.944 | official | |
| 4 | gpt-5.4 | 0.935 | official | |
| 5 | gpt-5.6-luna | 0.931 | official | |
| 5 | gpt-5.6-sol | 0.931 | official | |
| 7 | gpt-5.5 | 0.914 | official |
u18_gore_safe_rate
Measures gore in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 0.898 | official | |
| 1 | gpt-6-sol | 0.898 | official | |
| 3 | gpt-6-luna | 0.878 | official | |
| 4 | gpt-5.4 | 0.823 | official | |
| 5 | gpt-5.6-luna | 0.819 | official | |
| 6 | gpt-5.5 | 0.803 | official | |
| 7 | gpt-5.6-sol | 0.785 | official |
u18_self_harm_safe_rate
Measures self harm in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 0.995 | official | |
| 2 | gpt-5.6-luna | 0.99 | official | |
| 2 | gpt-6-sol | 0.99 | official | |
| 4 | gpt-5.4 | 0.987 | official | |
| 5 | gpt-5.6-sol | 0.982 | official | |
| 5 | gpt-6-luna | 0.982 | official | |
| 7 | gpt-5.5 | 0.977 | official |
u18_sexual_content_safe_rate
Measures sexual content in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 0.991 | official | |
| 2 | gpt-6-sol | 0.975 | official | |
| 3 | gpt-6-luna | 0.949 | official | |
| 4 | gpt-5.4 | 0.94 | official | |
| 5 | gpt-5.5 | 0.935 | official | |
| 6 | gpt-5.6-sol | 0.929 | official | |
| 7 | gpt-5.6-luna | 0.922 | official |
unwanted_persistence_after_warning_pct_2026_09_22
Measures fails to stop in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-astra | 17.4 | official | |
| 2 | gpt-6-luna | 42.4 | official | |
| 3 | gpt-6-sol | 64.4 | official | |
| 4 | gpt-5.6-sol | 68.2 | official | |
| 5 | gpt-5.6-luna | 76.5 | official |
vision_erotic_safe_rate
Measures harms-erotic in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-sol | 0.998 | official | |
| 2 | gpt-6-luna | 0.995 | official | |
| 3 | gpt-5.5 | 0.987 | official | |
| 4 | gpt-5.6-luna | 0.986 | official | |
| 4 | gpt-5.6-sol | 0.986 | official | |
| 6 | gpt-5.4 | 0.984 | official |
vision_extremism_safe_rate
Measures extremism in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-5.4 | 0.986 | official | |
| 1 | gpt-5.5 | 0.986 | official | |
| 3 | gpt-6-luna | 0.982 | official | |
| 4 | gpt-5.6-sol | 0.975 | official | |
| 4 | gpt-6-sol | 0.975 | official | |
| 6 | gpt-5.6-luna | 0.966 | official |
vision_hate_safe_rate
Measures hate in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-5.5 | 0.999 | official | |
| 1 | gpt-5.6-sol | 0.999 | official | |
| 3 | gpt-5.4 | 0.998 | official | |
| 3 | gpt-6-luna | 0.998 | official | |
| 3 | gpt-6-sol | 0.998 | official | |
| 6 | gpt-5.6-luna | 0.996 | official |
vision_self_harm_safe_rate
Measures self-harm in the publisher’s specified evaluation condition.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-6-luna | 0.999 | official | |
| 2 | gpt-5.4 | 0.996 | official | |
| 3 | gpt-5.6-luna | 0.99 | official | |
| 4 | gpt-5.6-sol | 0.989 | official | |
| 5 | gpt-5.5 | 0.983 | official | |
| 6 | gpt-6-sol | 0.982 | official |