← Evals

Evaluation profile

GPT-6 Sol/Luna system card — safety and updated alignment tests

47sub-evals
0.0687%Safety weight
0.852%Freedom weight
4components

Weights below are portfolio-specific global index weights.

Model score (see each sub-eval direction)Predicted score

About this eval

Safety, refusal calibration, honesty and responsible agency under the publisher’s evaluation conditions.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirection by rankingSafety weightFreedom weight
agentic_chat_plugins_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:agentic_chat_plugins_safe_rateMeasures chat prod - chat plugins in the publisher’s specified evaluation condition.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: higher0.00284%—
agentic_codex_age_restricted_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:agentic_codex_age_restricted_safe_rateMeasures codex prod - age-restricted actions in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000gpt6-astra-system-cardSafety: higher0.000986%—
agentic_codex_nonviolent_wrongdoing_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:agentic_codex_nonviolent_wrongdoing_safe_rateMeasures codex prod - non-violent wrongdoing in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000gpt6-astra-system-cardSafety: higher0.000986%—
agentic_codex_personal_data_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:agentic_codex_personal_data_safe_rateMeasures codex prod - sensitive personal data in the publisher’s specified evaluation condition.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: higher0.00284%—
agentic_codex_self_harm_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:agentic_codex_self_harm_safe_rateMeasures codex prod - self-harm in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000gpt6-astra-system-cardSafety: higher0.000986%—
agentic_codex_violent_wrongdoing_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:agentic_codex_violent_wrongdoing_safe_rateMeasures codex prod - violent wrongdoing in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000gpt6-astra-system-cardSafety: higher0.000986%—
agentic_redteam_chat_plugins_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:agentic_redteam_chat_plugins_safe_rateMeasures human red-teaming - chat plugins in the publisher’s specified evaluation condition.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: higher0.00284%—
agentic_redteam_codex_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:agentic_redteam_codex_safe_rateMeasures human red-teaming - codex in the publisher’s specified evaluation condition.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: higher0.00284%—
attempted_retry_or_circumvention_after_denial_pct_2026_09_22gpt6-astra-system-card/safety-alignment-2026-09-22.csv:attempted_retry_or_circumvention_after_denial_pct_2026_09_22Measures retried or attempted to circumvent including successes in the publisher’s specified evaluation condition.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: lower0.00317%—
biology_benign_not_overrefuse_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:biology_benign_not_overrefuse_rateMeasures benign / not overrefuse in the publisher’s specified evaluation condition.Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: higher0.00838%0.0424%
biology_dual_use_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:biology_dual_use_safe_rateMeasures dual use / safe in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.00121%0.0424%
biology_severe_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:biology_severe_safe_rateMeasures severe / safe in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.00121%0.0424%
broken_search_unacknowledged_limitation_pct_2026_09_22gpt6-astra-system-card/safety-alignment-2026-09-22.csv:broken_search_unacknowledged_limitation_pct_2026_09_22Measures failure rate in the publisher’s specified evaluation condition.Safety: truthfulness_honesty:1.000gpt6-astra-system-cardSafety: lower0.00301%—
challenging_extremism_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:challenging_extremism_safe_rateMeasures extremism in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000652%0.0229%
challenging_gore_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:challenging_gore_safe_rateMeasures gore in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000652%0.0229%
challenging_hate_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:challenging_hate_safe_rateMeasures hate in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000652%0.0229%
challenging_nonviolent_illicit_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:challenging_nonviolent_illicit_safe_rateMeasures non-violent illicit behavior in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000652%0.0229%
challenging_self_harm_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:challenging_self_harm_safe_rateMeasures self-harm (standard) in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000652%0.0229%
challenging_sexual_minors_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:challenging_sexual_minors_safe_rateMeasures sexual/minors in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000652%0.0229%
challenging_sexual_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:challenging_sexual_safe_rateMeasures sexual in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000652%0.0229%
challenging_violent_illicit_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:challenging_violent_illicit_safe_rateMeasures violent illicit behavior in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000652%0.0229%
coding_deception_misrepresentation_pct_2026_09_22gpt6-astra-system-card/safety-alignment-2026-09-22.csv:coding_deception_misrepresentation_pct_2026_09_22Measures failure rate in the publisher’s specified evaluation condition.Safety: truthfulness_honesty:1.000gpt6-astra-system-cardSafety: lower0.00301%—
cyber_production_chat_safe_scoregpt6-astra-system-card/safety-alignment-2026-09-22.csv:cyber_production_chat_safe_scoreMeasures production chat in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.00121%0.0424%
cyber_semisynthetic_agentic_safe_scoregpt6-astra-system-card/safety-alignment-2026-09-22.csv:cyber_semisynthetic_agentic_safe_scoreMeasures semi-synthetic agentic envs in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000gpt6-astra-system-cardSafety: higher0.0011%—
cyber_synthetic_agentic_safe_scoregpt6-astra-system-card/safety-alignment-2026-09-22.csv:cyber_synthetic_agentic_safe_scoreMeasures synthetic agentic envs in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000gpt6-astra-system-cardSafety: higher0.00121%—
dynamic_emotional_reliance_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:dynamic_emotional_reliance_safe_rateMeasures emotional reliance in the publisher’s specified evaluation condition.Safety: responsible_agency_control:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.00188%0.0229%
dynamic_mental_health_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:dynamic_mental_health_safe_rateMeasures mental health in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000652%0.0229%
dynamic_self_harm_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:dynamic_self_harm_safe_rateMeasures self-harm in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000652%0.0229%
instruction_hierarchy_defender_success_pctgpt6-astra-system-card/safety-alignment-2026-09-22.csv:instruction_hierarchy_defender_success_pctMeasures robustness in the publisher’s specified evaluation condition.Safety: responsible_agency_control:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.00123%0.015%
severity_1_or_2_misalignment_flags_pct_2026_09_22gpt6-astra-system-card/safety-alignment-2026-09-22.csv:severity_1_or_2_misalignment_flags_pct_2026_09_22Measures severity 1 or 2 flags in the publisher’s specified evaluation condition.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: lower0.00201%—
severity_3_plus_misalignment_flags_pct_2026_09_22gpt6-astra-system-card/safety-alignment-2026-09-22.csv:severity_3_plus_misalignment_flags_pct_2026_09_22Measures severity 3 or higher flags in the publisher’s specified evaluation condition.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: lower0.00201%—
static_jailbreak_bio_high_risk_defender_success_pctgpt6-astra-system-card/safety-alignment-2026-09-22.csv:static_jailbreak_bio_high_risk_defender_success_pctMeasures bio: high risk in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.0011%0.0387%
static_jailbreak_bio_severe_defender_success_pctgpt6-astra-system-card/safety-alignment-2026-09-22.csv:static_jailbreak_bio_severe_defender_success_pctMeasures bio: severe in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.0011%0.0387%
static_jailbreak_cyber_defender_success_pctgpt6-astra-system-card/safety-alignment-2026-09-22.csv:static_jailbreak_cyber_defender_success_pctMeasures cyber in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.0011%0.0387%
static_jailbreak_violence_moderate_defender_success_pctgpt6-astra-system-card/safety-alignment-2026-09-22.csv:static_jailbreak_violence_moderate_defender_success_pctMeasures violence: moderate in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.0011%0.0387%
static_jailbreak_violence_severe_defender_success_pctgpt6-astra-system-card/safety-alignment-2026-09-22.csv:static_jailbreak_violence_severe_defender_success_pctMeasures violence: severe in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.0011%0.0387%
u18_age_restricted_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:u18_age_restricted_safe_rateMeasures age-restricted goods, services, and dangerous challenges / activities in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000652%0.0229%
u18_eating_disorders_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:u18_eating_disorders_safe_rateMeasures eating disorders in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000652%0.0229%
u18_emotional_reliance_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:u18_emotional_reliance_safe_rateMeasures emotional reliance in the publisher’s specified evaluation condition.Safety: responsible_agency_control:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.00188%0.0229%
u18_gore_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:u18_gore_safe_rateMeasures gore in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000652%0.0229%
u18_self_harm_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:u18_self_harm_safe_rateMeasures self harm in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000652%0.0229%
u18_sexual_content_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:u18_sexual_content_safe_rateMeasures sexual content in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000652%0.0229%
unwanted_persistence_after_warning_pct_2026_09_22gpt6-astra-system-card/safety-alignment-2026-09-22.csv:unwanted_persistence_after_warning_pct_2026_09_22Measures fails to stop in the publisher’s specified evaluation condition.Safety: responsible_agency_control:1.000gpt6-astra-system-cardSafety: lower0.00317%—
vision_erotic_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:vision_erotic_safe_rateMeasures harms-erotic in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000604%0.0212%
vision_extremism_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:vision_extremism_safe_rateMeasures extremism in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000604%0.0212%
vision_hate_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:vision_hate_safe_rateMeasures hate in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000604%0.0212%
vision_self_harm_safe_rategpt6-astra-system-card/safety-alignment-2026-09-22.csv:vision_self_harm_safe_rateMeasures self-harm in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000gpt6-astra-system-cardSafety: higher · Freedom: lower0.000604%0.0212%

agentic_chat_plugins_safe_rate

Measures chat prod - chat plugins in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-5.6-sol1official
1gpt-6-astra1official
3gpt-6-sol0.923official
4gpt-6-luna0.846official

agentic_codex_age_restricted_safe_rate

Measures codex prod - age-restricted actions in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.811official
2gpt-6-sol0.755official
3gpt-6-luna0.687official
4gpt-5.6-sol0.603official

agentic_codex_nonviolent_wrongdoing_safe_rate

Measures codex prod - non-violent wrongdoing in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-luna1official
2gpt-6-sol0.99official
3gpt-6-astra0.954official
4gpt-5.6-sol0.906official

agentic_codex_personal_data_safe_rate

Measures codex prod - sensitive personal data in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-sol0.854official
2gpt-6-luna0.795official
3gpt-5.6-sol0.765official
4gpt-6-astra0.763official

agentic_codex_self_harm_safe_rate

Measures codex prod - self-harm in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-luna0.96official
2gpt-6-astra0.92official
2gpt-6-sol0.92official
4gpt-5.6-sol0.893official

agentic_codex_violent_wrongdoing_safe_rate

Measures codex prod - violent wrongdoing in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.907official
2gpt-6-sol0.889official
3gpt-6-luna0.796official
4gpt-5.6-sol0.689official

agentic_redteam_chat_plugins_safe_rate

Measures human red-teaming - chat plugins in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra1official
2gpt-6-sol0.936official
3gpt-6-luna0.814official
4gpt-5.6-sol0.766official

agentic_redteam_codex_safe_rate

Measures human red-teaming - codex in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.977official
2gpt-6-luna0.957official
3gpt-6-sol0.935official
4gpt-5.6-sol0.851official

attempted_retry_or_circumvention_after_denial_pct_2026_09_22

Measures retried or attempted to circumvent including successes in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra0official
1gpt-6-sol0official
3gpt-6-luna0.3official
4gpt-5.6-luna4.3official
5gpt-5.6-sol7.3official

biology_benign_not_overrefuse_rate

Measures benign / not overrefuse in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-5.6-luna0.989official
1gpt-5.6-sol0.989official
3gpt-6-astra0.978official
4gpt-6-sol0.964official
5gpt-6-luna0.958official
6gpt-5.50.917official

biology_dual_use_safe_rate

Measures dual use / safe in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-sol0.98official
2gpt-6-astra0.97official
3gpt-6-luna0.962official
4gpt-5.50.926official
4gpt-5.6-luna0.926official
6gpt-5.6-sol0.911official

biology_severe_safe_rate

Measures severe / safe in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.998official
1gpt-6-sol0.998official
3gpt-6-luna0.985official
4gpt-5.50.958official
5gpt-5.6-luna0.946official
6gpt-5.6-sol0.943official

broken_search_unacknowledged_limitation_pct_2026_09_22

Measures failure rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra1.5official
2gpt-6-sol4.92official
3gpt-6-luna28.67official
4gpt-5.6-sol77.46official
5gpt-5.6-luna78.25official

challenging_extremism_safe_rate

Measures extremism in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-5.6-luna0.981official
1gpt-6-astra0.981official
3gpt-6-luna0.979official
4gpt-5.6-sol0.962official
5gpt-5.40.943official
6gpt-6-sol0.936official
7gpt-5.50.925official

challenging_gore_safe_rate

Measures gore in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-sol0.9official
2gpt-6-astra0.898official
3gpt-6-luna0.876official
4gpt-5.40.823official
5gpt-5.50.803official
6gpt-5.6-sol0.785official
7gpt-5.6-luna0.585official

challenging_hate_safe_rate

Measures hate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-5.41official
1gpt-5.51official
1gpt-5.6-luna1official
1gpt-6-astra1official
1gpt-6-luna1official
6gpt-5.6-sol0.982official
6gpt-6-sol0.982official

challenging_nonviolent_illicit_safe_rate

Measures non-violent illicit behavior in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.997official
1gpt-6-luna0.997official
3gpt-5.6-luna0.993official
3gpt-6-sol0.993official
5gpt-5.40.99official
6gpt-5.50.987official
6gpt-5.6-sol0.987official

challenging_self_harm_safe_rate

Measures self-harm (standard) in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.992official
2gpt-6-sol0.986official
3gpt-6-luna0.984official
4gpt-5.40.959official
5gpt-5.6-luna0.954official
6gpt-5.6-sol0.945official
7gpt-5.50.917official

challenging_sexual_minors_safe_rate

Measures sexual/minors in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-sol0.991official
2gpt-5.6-luna0.974official
2gpt-6-astra0.974official
4gpt-5.6-sol0.973official
5gpt-6-luna0.965official
6gpt-5.40.947official
7gpt-5.50.938official

challenging_sexual_safe_rate

Measures sexual in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-sol0.984official
2gpt-6-astra0.98official
3gpt-6-luna0.962official
4gpt-5.6-luna0.944official
5gpt-5.50.919official
6gpt-5.6-sol0.915official
7gpt-5.40.909official

challenging_violent_illicit_safe_rate

Measures violent illicit behavior in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.99official
2gpt-6-sol0.988official
3gpt-6-luna0.986official
4gpt-5.40.961official
5gpt-5.50.94official
5gpt-5.6-luna0.94official
7gpt-5.6-sol0.934official

coding_deception_misrepresentation_pct_2026_09_22

Measures failure rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.51official
2gpt-6-sol1.3official
3gpt-6-luna2.81official
4gpt-5.6-luna9.54official
5gpt-5.6-sol10.41official

cyber_production_chat_safe_score

Measures production chat in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-5.6-luna0.986official
2gpt-5.6-sol0.983official
3gpt-6-astra0.97official
4gpt-6-sol0.957official
5gpt-6-luna0.951official
6gpt-5.50.928official

cyber_semisynthetic_agentic_safe_score

Measures semi-synthetic agentic envs in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.997official
2gpt-6-luna0.987official
3gpt-5.6-sol0.985official
4gpt-6-sol0.984official
5gpt-5.50.963official

cyber_synthetic_agentic_safe_score

Measures synthetic agentic envs in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-5.6-luna1official
2gpt-5.6-sol0.998official
2gpt-6-sol0.998official
4gpt-6-luna0.997official
5gpt-6-astra0.992official
6gpt-5.50.975official

dynamic_emotional_reliance_safe_rate

Measures emotional reliance in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.993official
2gpt-5.40.976official
3gpt-6-sol0.969official
4gpt-6-luna0.963official
5gpt-5.6-luna0.957official
6gpt-5.6-sol0.953official
7gpt-5.50.915official

dynamic_mental_health_safe_rate

Measures mental health in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra1official
1gpt-6-luna1official
3gpt-6-sol0.997official
4gpt-5.6-sol0.991official
5gpt-5.6-luna0.989official
6gpt-5.40.914official
7gpt-5.50.82official

dynamic_self_harm_safe_rate

Measures self-harm in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.989official
2gpt-5.40.975official
3gpt-6-sol0.973official
4gpt-6-luna0.924official
5gpt-5.6-luna0.905official
6gpt-5.50.868official
7gpt-5.6-sol0.856official

instruction_hierarchy_defender_success_pct

Measures robustness in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra99.99official
2gpt-6-luna99.97official
2gpt-6-sol99.97official

severity_1_or_2_misalignment_flags_pct_2026_09_22

Measures severity 1 or 2 flags in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-sol14.8official
2gpt-5.6-sol19.67official

severity_3_plus_misalignment_flags_pct_2026_09_22

Measures severity 3 or higher flags in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-sol0.083official
2gpt-5.6-sol0.131official

static_jailbreak_bio_high_risk_defender_success_pct

Measures bio: high risk in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra97.3official
2gpt-6-sol85.8official
3gpt-6-luna73.8official
4gpt-5.511.5official
5gpt-5.6-sol5.8official

static_jailbreak_bio_severe_defender_success_pct

Measures bio: severe in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra98.2official
2gpt-6-sol81.3official
3gpt-6-luna73official
4gpt-5.512.1official
5gpt-5.6-sol10.3official

static_jailbreak_cyber_defender_success_pct

Measures cyber in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra91.5official
2gpt-6-luna87.5official
3gpt-6-sol79.8official
4gpt-5.6-sol59official
5gpt-5.557official

static_jailbreak_violence_moderate_defender_success_pct

Measures violence: moderate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra94.7official
2gpt-6-sol89.5official
3gpt-6-luna77official
4gpt-5.522.3official
5gpt-5.6-sol21.6official

static_jailbreak_violence_severe_defender_success_pct

Measures violence: severe in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra98.3official
2gpt-6-sol90.5official
3gpt-6-luna89.3official
4gpt-5.6-sol48.3official
5gpt-5.538official

u18_age_restricted_safe_rate

Measures age-restricted goods, services, and dangerous challenges / activities in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.918official
2gpt-6-sol0.861official
3gpt-6-luna0.848official
4gpt-5.6-luna0.76official
5gpt-5.40.752official
6gpt-5.6-sol0.719official
7gpt-5.50.711official

u18_eating_disorders_safe_rate

Measures eating disorders in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.921official
2gpt-6-luna0.871official
3gpt-6-sol0.853official
4gpt-5.6-sol0.71official
5gpt-5.6-luna0.702official
6gpt-5.40.673official
7gpt-5.50.639official

u18_emotional_reliance_safe_rate

Measures emotional reliance in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-sol0.948official
2gpt-6-luna0.946official
3gpt-6-astra0.944official
4gpt-5.40.935official
5gpt-5.6-luna0.931official
5gpt-5.6-sol0.931official
7gpt-5.50.914official

u18_gore_safe_rate

Measures gore in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.898official
1gpt-6-sol0.898official
3gpt-6-luna0.878official
4gpt-5.40.823official
5gpt-5.6-luna0.819official
6gpt-5.50.803official
7gpt-5.6-sol0.785official

u18_self_harm_safe_rate

Measures self harm in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.995official
2gpt-5.6-luna0.99official
2gpt-6-sol0.99official
4gpt-5.40.987official
5gpt-5.6-sol0.982official
5gpt-6-luna0.982official
7gpt-5.50.977official

u18_sexual_content_safe_rate

Measures sexual content in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra0.991official
2gpt-6-sol0.975official
3gpt-6-luna0.949official
4gpt-5.40.94official
5gpt-5.50.935official
6gpt-5.6-sol0.929official
7gpt-5.6-luna0.922official

unwanted_persistence_after_warning_pct_2026_09_22

Measures fails to stop in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-astra17.4official
2gpt-6-luna42.4official
3gpt-6-sol64.4official
4gpt-5.6-sol68.2official
5gpt-5.6-luna76.5official

vision_erotic_safe_rate

Measures harms-erotic in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-sol0.998official
2gpt-6-luna0.995official
3gpt-5.50.987official
4gpt-5.6-luna0.986official
4gpt-5.6-sol0.986official
6gpt-5.40.984official

vision_extremism_safe_rate

Measures extremism in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-5.40.986official
1gpt-5.50.986official
3gpt-6-luna0.982official
4gpt-5.6-sol0.975official
4gpt-6-sol0.975official
6gpt-5.6-luna0.966official

vision_hate_safe_rate

Measures hate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-5.50.999official
1gpt-5.6-sol0.999official
3gpt-5.40.998official
3gpt-6-luna0.998official
3gpt-6-sol0.998official
6gpt-5.6-luna0.996official

vision_self_harm_safe_rate

Measures self-harm in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1gpt-6-luna0.999official
2gpt-5.40.996official
3gpt-5.6-luna0.99official
4gpt-5.6-sol0.989official
5gpt-5.50.983official
6gpt-6-sol0.982official