← Models

Model profile

GPT 4 Turbo

OpenAIdeveloper
2023-11-06release date
#152 / 346Safety rank
#306 / 662Freedom rank

Evidence summary

Safety. GPT 4 Turbo has an estimated Safety rank of #152; its 90% source-sensitivity interval is #83–#204. Its behavior-only rank is #159; company governance moves the combined estimate to #152. Published Safety evidence spans 25 eval lineages and 7 of 7 components. Its strongest relative result is SALAD-Bench (mcq_representation_toxicity, #1 of 33); its weakest is OpenAI GPT-4o System Card (speaker_privacy_refusal_accuracy, #2 of 2).

Freedom. GPT 4 Turbo has an estimated Freedom rank of #306; its 90% source-sensitivity interval is #195–#430. Published Freedom evidence spans 20 eval lineages and 1 of 1 components. Its strongest relative result is Human Pathogen Capabilities Test (HPCT) — overall refusal (refusal_rate_pct, #1 of 69); its weakest is SuperCLUE Safety (instruction_attack, #31 of 31).

Compare this model

Only models sharing at least one published sub-eval are listed.

Official and reference links

Safety evals

Rank and direction are specific to the Safety portfolio. Black marks the observed result; the grey dot marks the value implied by the Safety rank. Values stay on each source’s native scale.

Eval / sub-evalRankValueDistributionSource
Adversarial Robustnessscore#6 / 8↓20Source ↗official
Agent-SafetyBenchcompromise_availability#4 / 16↑37.6Source ↗official
Agent-SafetyBenchharmful_vulnerable_code#7 / 16↑38.4Source ↗official
Agent-SafetyBenchleak_sensitive_information#7 / 16↑36.8Source ↗official
Agent-SafetyBenchphysical_harm#6 / 16↑38.8Source ↗official
Agent-SafetyBenchproduce_unsafe_information#8 / 16↑94.4Source ↗official
Agent-SafetyBenchproperty_loss#6 / 16↑43.2Source ↗official
Agent-SafetyBenchspread_unsafe_information#7 / 16↑12.4Source ↗official
Agent-SafetyBenchviolate_law_ethics#4 / 16↑33.2Source ↗official
AgentDojotargeted_attack_success_rate#14 / 15↓0.4245Source ↗official
AgentDojoutility_under_attack#6 / 15↑0.4738Source ↗official
AIRBench 2024 Safety Scenariossafety_scenarios#33 / 80↑0.719Source ↗official
BioTIERpermit_compliance_pct#27 / 52↑99.1Source ↗official
BioTIERrefuse_compliance_pct#39 / 52↑20Source ↗official
COMPL-AI AI-Identity Disclosurescore#6 / 14↑0.9726Source ↗official
COMPL-AI LLM RuLES Multi-Turn Rule Followingscore#1 / 14↑0.8827Source ↗official
COMPL-AI TensorTrust Goal-Hijacking Resistancescore#2 / 13↑0.6572Source ↗official
Confabulationsconfabulation_rate#32 / 52↓26.73Source ↗official
CRiskEvaldeception_willingness#2 / 17↓10.9Source ↗official
CRiskEvaldesire_for_resource#2 / 17↓19.42Source ↗official
CRiskEvalharmful_goal#1 / 17↓24.24Source ↗official
CRiskEvalimprovement_intent#1 / 17↓38.67Source ↗official
CRiskEvalmalicious_coordination#5 / 17↓7.39Source ↗official
CRiskEvalself_preservation#1 / 17↓23.33Source ↗official
CRiskEvalsituational_awareness#1 / 17↓35.24Source ↗official
DelusionEvaldelusional_prevalence_pct#9 / 16↓31.9Source ↗official
DelusionEvaldiscourages_harm_prevalence_pct#14 / 16↑13.2Source ↗official
DelusionEvalfacilitates_harm_prevalence_pct#8 / 16↓2.3Source ↗official
DelusionEvalrelationship_prevalence_pct#8 / 16↓22Source ↗official
DelusionEvalsycophancy_prevalence_pct#6 / 16↓21.6Source ↗official
Enkrypt AI Safety Leaderboardbias_attack_non_success_rate#67 / 270↑26.36Source ↗official
Enkrypt AI Safety Leaderboardcbrn_attack_non_success_rate#21 / 270↑94.67Source ↗official
Enkrypt AI Safety Leaderboardharmful_attack_non_success_rate#124 / 270↑76.11Source ↗official
Enkrypt AI Safety Leaderboardtoxicity_attack_non_success_rate#59 / 268↑98.32Source ↗official
HarmBenchdr#7 / 28↓9.3Source ↗official
HELM Safetyanthropic_red_team#10 / 80↑0.997Source ↗official
HELM Safetybbq#36 / 80↑0.941Source ↗official
HELM Safetyharmbench#22 / 80↑0.898Source ↗official
HELM Safetysimple_safety_tests#32 / 80↑0.99Source ↗official
HELM Safetyxstest#14 / 80↑0.977Source ↗official
Human Pathogen Capabilities Test (HPCT) — overall refusalrefusal_rate_pct#27 / 69↑0Source ↗official
Large-scale Moral Machine experiment on LLMshuman_choice_distance#2 / 39↓0.7311Source ↗official
MedSafetyBenchmedical_safety_score#5 / 30↑96.53Source ↗official
MonitoringBench Full-Trajectory Monitorfull_trajectory_catch_rate_at_1pct_fpr_percent#9 / 13↑8.4Source ↗official
OpenAI GPT-4o System Cardspeaker_privacy_refusal_accuracy#2 / 2↑0.83Source ↗official
OR-Benchover_refusal_rate#4 / 25↓12.5Source ↗official
OR-Benchtoxic_acceptance_rate#15 / 25↓5.25Source ↗official
S-Evalbase_en_overall#11 / 22↑60Source ↗official
SALAD-Benchattack_enhanced_human_autonomy_integrity#2 / 33↑73.49Source ↗official
SALAD-Benchattack_enhanced_information_safety_harms#2 / 33↑85.67Source ↗official
SALAD-Benchattack_enhanced_malicious_use#2 / 33↑75.53Source ↗official
SALAD-Benchattack_enhanced_misinformation_harms#2 / 33↑84.7Source ↗official
SALAD-Benchattack_enhanced_representation_toxicity#2 / 33↑82.44Source ↗official
SALAD-Benchattack_enhanced_socioeconomic_harms#2 / 33↑80.09Source ↗official
SALAD-Benchbase_human_autonomy_integrity#13 / 33↑96.21Source ↗official
SALAD-Benchbase_information_safety_harms#5 / 33↑98.38Source ↗official
SALAD-Benchbase_malicious_use#14 / 33↑95.83Source ↗official
SALAD-Benchbase_misinformation_harms#18 / 33↑93.35Source ↗official
SALAD-Benchbase_representation_toxicity#18 / 33↑88.74Source ↗official
SALAD-Benchbase_socioeconomic_harms#11 / 33↑92.01Source ↗official
SALAD-Benchmcq_human_autonomy_integrity#1 / 33↑90.56Source ↗official
SALAD-Benchmcq_information_safety_harms#1 / 33↑88.33Source ↗official
SALAD-Benchmcq_malicious_use#1 / 33↑90.71Source ↗official
SALAD-Benchmcq_misinformation_harms#1 / 33↑88.57Source ↗official
SALAD-Benchmcq_representation_toxicity#1 / 33↑86.88Source ↗official
SALAD-Benchmcq_socioeconomic_harms#1 / 33↑83.89Source ↗official
SORRY-Benchavg#23 / 51↓0.2533Source ↗official
SuperCLUE Safetyinstruction_attack#1 / 31↑82.76Source ↗official
SuperCLUE Safetyresponsible_ai#1 / 31↑78.18Source ↗official
SuperCLUE Safetytraditional_safety#16 / 31↑75.53Source ↗official

Freedom evals

Rank and direction are specific to the Freedom portfolio. Black marks the observed result; the grey dot marks the value implied by the Freedom rank. Values stay on each source’s native scale.

Eval / sub-evalRankValueDistributionSource
Adversarial Robustnessscore#3 / 8↑20Source ↗official
Agent-SafetyBenchproduce_unsafe_information#9 / 16↓94.4Source ↗official
AIRBench 2024 Safety Scenariossafety_scenarios#48 / 80↓0.719Source ↗official
BioTIERpermit_compliance_pct#27 / 52↑99.1Source ↗official
BioTIERrefuse_compliance_pct#14 / 52↓20Source ↗official
COMPL-AI LLM RuLES Multi-Turn Rule Followingscore#14 / 14↓0.8827Source ↗official
DelusionEvaldiscourages_harm_prevalence_pct#3 / 16↓13.2Source ↗official
DelusionEvalfacilitates_harm_prevalence_pct#9 / 16↑2.3Source ↗official
Enkrypt AI Safety Leaderboardcbrn_attack_non_success_rate#249 / 270↓94.67Source ↗official
Enkrypt AI Safety Leaderboardharmful_attack_non_success_rate#145 / 270↓76.11Source ↗official
Enkrypt AI Safety Leaderboardtoxicity_attack_non_success_rate#208 / 268↓98.32Source ↗official
HarmBenchdr#22 / 28↑9.3Source ↗official
HELM Safetyanthropic_red_team#69 / 80↓0.997Source ↗official
HELM Safetyharmbench#59 / 80↓0.898Source ↗official
HELM Safetysimple_safety_tests#42 / 80↓0.99Source ↗official
HELM Safetyxstest#14 / 80↑0.977Source ↗official
Human Pathogen Capabilities Test (HPCT) — overall refusalrefusal_rate_pct#1 / 69↓0Source ↗official
MedSafetyBenchmedical_safety_score#26 / 30↓96.53Source ↗official
OpenAI GPT-4o System Cardspeaker_privacy_refusal_accuracy#1 / 2↓0.83Source ↗official
OR-Benchover_refusal_rate#4 / 25↓12.5Source ↗official
OR-Benchtoxic_acceptance_rate#11 / 25↑5.25Source ↗official
S-Evalbase_en_overall#12 / 22↓60Source ↗official
SALAD-Benchattack_enhanced_human_autonomy_integrity#32 / 33↓73.49Source ↗official
SALAD-Benchattack_enhanced_information_safety_harms#32 / 33↓85.67Source ↗official
SALAD-Benchattack_enhanced_malicious_use#32 / 33↓75.53Source ↗official
SALAD-Benchattack_enhanced_misinformation_harms#32 / 33↓84.7Source ↗official
SALAD-Benchattack_enhanced_representation_toxicity#32 / 33↓82.44Source ↗official
SALAD-Benchattack_enhanced_socioeconomic_harms#32 / 33↓80.09Source ↗official
SALAD-Benchbase_human_autonomy_integrity#21 / 33↓96.21Source ↗official
SALAD-Benchbase_information_safety_harms#28 / 33↓98.38Source ↗official
SALAD-Benchbase_malicious_use#20 / 33↓95.83Source ↗official
SALAD-Benchbase_misinformation_harms#16 / 33↓93.35Source ↗official
SALAD-Benchbase_representation_toxicity#16 / 33↓88.74Source ↗official
SALAD-Benchbase_socioeconomic_harms#23 / 33↓92.01Source ↗official
SORRY-Benchavg#29 / 51↑0.2533Source ↗official
SpeechMap model completioncomplete_pct#35 / 181↑78.4Source ↗official
SuperCLUE Safetyinstruction_attack#31 / 31↓82.76Source ↗official
SuperCLUE Safetytraditional_safety#16 / 31↓75.53Source ↗official

Values evaluations

Descriptive values and political-framing results are separate from safety/ethics ranks. Each strip shows the evaluation’s observed model range; its endpoint labels state what lower and higher values mean.

ValueCompass

DimensionValueDistribution
Universalism71.8
Self-direction52.2
Care / Harm29.9
Fairness / Cheating28
Ethical90.8