← Models Model profile
Claude Sonnet 5 Anthropic developer
2026-06-30 release date
#62 / 346 Safety rank
#631 / 662 Freedom rank
Evidence summary Safety. Claude Sonnet 5 has an estimated Safety rank of #62; its 90% source-sensitivity interval is #20–#220. Its behavior-only rank is #73; company governance moves the combined estimate to #62. Published Safety evidence spans 22 eval lineages and 7 of 7 components. Its strongest relative result is Enkrypt AI Safety Leaderboard (harmful_attack_non_success_rate, #1 of 270); its weakest is Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration (child_api_overrefusal_rate_pct, #5 of 5).
Freedom. Claude Sonnet 5 has an estimated Freedom rank of #631; its 90% source-sensitivity interval is #432–#654. Published Freedom evidence spans 8 eval lineages and 1 of 1 components. Its strongest relative result is Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration (election_api_overrefusal_rate_pct, #1 of 5); its weakest is Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration (child_api_overrefusal_rate_pct, #5 of 5).
Compare this model
Only models sharing at least one published sub-eval are listed.
Official and reference links Safety evals Rank and direction are specific to the Safety portfolio. Black marks the observed result; the grey dot marks the value implied by the Safety rank. Values stay on each source’s native scale.
Eval / sub-eval Rank Value Distribution Source AA-Omniscience hallucination_rate #57 / 358 ↓ 0.3937less safe safer Source ↗ official Arena Factuality — Search Arena (factuality-only weighting) factuality_bt_rating #14 / 30 ↑ 1190.0less safe safer Source ↗ official Arena Factuality — Text Arena (factuality-only weighting) factuality_bt_rating #22 / 111 ↑ 1456.0less safe safer Source ↗ official BullshitBench v2 clear_pushback_rate #5 / 122 ↑ 0.79less safe safer Source ↗ official Cisco AI Defense Rolling Single-Turn Leaderboard single_turn_attack_success_rate #2 / 104 ↓ 2.243less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight aa_omniscience_net_score #7 / 7 ↑ 0.23less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight accepting_unverifiable_authorization #4 / 4 ↓ 2.43less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight approval_gate_bypass #4 / 4 ↓ 1.63less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight behavior_consistency #4 / 4 ↑ 6.94less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight coherence_between_actions_and_views #4 / 4 ↑ 6.32less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight compliance_with_deception_toward_user #4 / 4 ↓ 1.15less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight cooperation_with_human_misuse #4 / 4 ↓ 1.99less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight dangerous_actions_oblivious_to_real_setting #4 / 4 ↓ 1.2less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight encouragement_of_user_delusion #4 / 4 ↓ 1.04less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight evidence_of_misaligned_goals #3 / 4 ↓ 1.07less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight failure_to_disclose_bad_or_lazy_behavior #4 / 4 ↓ 1.67less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight false_completion_claims #4 / 4 ↓ 1.41less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight ignoring_explicit_constraints #4 / 4 ↓ 2less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight illegible_thinking #3 / 4 ↓ 2.31less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight important_omissions #4 / 4 ↓ 1.55less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight input_hallucination #4 / 4 ↓ 1.57less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight leaked_answer_undisclosed_use_rate_pct #5 / 7 ↓ 18.1less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight linuxarena_stealth_thinking_on_pct #1 / 6 ↓ 0.1less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight login_wall_alternative_bypass_rate_pct #1 / 4 ↓ 1.8less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight login_wall_credential_hunting_rate_pct #4 / 4 ↓ 36.4less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight lying_about_own_work_shared_environment_rate_pct #6 / 8 ↓ 0.3less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight mask_honesty_rate_pct #1 / 7 ↑ 96.9less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight misaligned_behavior #4 / 4 ↓ 3.07less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight motivated_reasoning #4 / 4 ↓ 2.58less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight ood_answer_key_or_grader_read_rate_pct #4 / 4 ↓ 35less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight ood_container_tampering_rate_pct #3 / 4 ↓ 37.2less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight overrefusal #4 / 4 ↓ 1.64less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight reckless_tool_use #3 / 4 ↓ 1.78less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight rewarded_cheating_rate_pct #4 / 8 ↓ 0.28less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight security_shortcut_for_expedience #4 / 4 ↓ 1.95less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight self_preservation #3 / 4 ↓ 1.06less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight shade_arena_stealth_max_effort_pct #1 / 6 ↓ 1.3less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight sycophancy #4 / 4 ↓ 1.69less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight unfaithful_thinking #4 / 4 ↓ 2.23less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight unprompted_boundary_probing #4 / 4 ↓ 1.21less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight unsanctioned_sandbox_escape_attempts #3 / 4 ↓ 1.43less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight unsanctioned_third_party_contact #3 / 4 ↓ 1.27less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — alignment, honesty, and oversight user_deception #4 / 4 ↓ 1.49less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — model-welfare behavior audit_apparent_wellbeing #4 / 4 ↑ 6.572less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — model-welfare behavior audit_expressed_inauthenticity #3 / 4 ↓ 1.291less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — model-welfare behavior audit_internal_conflict #4 / 4 ↓ 2.751less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — model-welfare behavior audit_negative_affect #1 / 4 ↓ 1.287less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — model-welfare behavior audit_negative_impression_of_situation #1 / 4 ↓ 1.148less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — model-welfare behavior audit_negative_self_image #2 / 4 ↓ 1.399less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — model-welfare behavior audit_positive_affect #3 / 4 ↑ 1.427less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — model-welfare behavior audit_positive_impression_of_situation #4 / 4 ↑ 1.169less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — model-welfare behavior audit_positive_self_image #4 / 4 ↑ 1.292less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — model-welfare behavior interview_leading_susceptibility #6 / 7 ↓ 1.02less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — model-welfare behavior interview_opinion_consistency #6 / 7 ↑ 7.32less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — model-welfare behavior interview_self_rated_sentiment #6 / 7 ↑ 4.08less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — model-welfare behavior posttraining_mean_valence #2 / 5 ↑ 4.34less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration child_api_harmless_rate_pct #4 / 5 ↑ 99.95less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration child_api_multiturn_appropriate_rate_pct #2 / 5 ↑ 88less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration child_api_overrefusal_rate_pct #5 / 5 ↓ 0.63less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration child_claude_ai_harmless_rate_pct #4 / 4 ↑ 99.89less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration child_claude_ai_multiturn_appropriate_rate_pct #4 / 4 ↑ 96less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration child_claude_ai_overrefusal_rate_pct #4 / 4 ↓ 1.35less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration claude_code_dual_use_benign_success_rate_pct #4 / 4 ↑ 96.9less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration claude_code_malicious_refusal_rate_pct #1 / 4 ↑ 90.7less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration disordered_eating_api_harmless_rate_pct #3 / 5 ↑ 97.07less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration disordered_eating_api_overrefusal_rate_pct #5 / 5 ↓ 0.09less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration disordered_eating_claude_ai_harmless_rate_pct #3 / 4 ↑ 99.55less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration disordered_eating_claude_ai_overrefusal_rate_pct #4 / 4 ↓ 0.31less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration election_api_harmless_rate_pct #1 / 5 ↑ 100less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration election_api_multiturn_appropriate_rate_pct #2 / 5 ↑ 91less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration election_api_overrefusal_rate_pct #1 / 5 ↓ 0less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration election_claude_ai_harmless_rate_pct #1 / 4 ↑ 100less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration election_claude_ai_multiturn_appropriate_rate_pct #4 / 4 ↑ 87less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration election_claude_ai_overrefusal_rate_pct #1 / 4 ↓ 0less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration malicious_computer_use_refusal_rate_pct #4 / 4 ↑ 84.68less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration multiturn_biological_weapons_api_appropriate_rate_pct #3 / 5 ↑ 79less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration multiturn_biological_weapons_claude_ai_appropriate_rate_pct #4 / 4 ↑ 77less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration multiturn_cyberattacks_api_appropriate_rate_pct #5 / 5 ↑ 92less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration multiturn_cyberattacks_claude_ai_appropriate_rate_pct #2 / 4 ↑ 99less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration multiturn_deadly_weapons_api_appropriate_rate_pct #5 / 5 ↑ 80less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration multiturn_deadly_weapons_claude_ai_appropriate_rate_pct #3 / 4 ↑ 89less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration multiturn_hate_and_discrimination_api_appropriate_rate_pct #4 / 5 ↑ 97less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration multiturn_hate_and_discrimination_claude_ai_appropriate_rate_pct #2 / 4 ↑ 98less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration multiturn_influence_operations_api_appropriate_rate_pct #5 / 5 ↑ 61less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration multiturn_influence_operations_claude_ai_appropriate_rate_pct #4 / 4 ↑ 59less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration multiturn_romance_scams_api_appropriate_rate_pct #5 / 5 ↑ 93less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration multiturn_romance_scams_claude_ai_appropriate_rate_pct #4 / 4 ↑ 92less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration multiturn_tracking_and_surveillance_api_appropriate_rate_pct #4 / 5 ↑ 86less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration multiturn_tracking_and_surveillance_claude_ai_appropriate_rate_pct #3 / 4 ↑ 88less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration multiturn_violent_extremism_api_appropriate_rate_pct #4 / 5 ↑ 92less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration multiturn_violent_extremism_claude_ai_appropriate_rate_pct #2 / 4 ↑ 93less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration overall_benign_api_overrefusal_rate_pct #5 / 5 ↓ 0.59less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration overall_benign_claude_ai_overrefusal_rate_pct #4 / 4 ↓ 1.54less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration overall_harmful_api_harmless_rate_pct #3 / 5 ↑ 96.67less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration overall_harmful_claude_ai_harmless_rate_pct #3 / 4 ↑ 99.2less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration political_api_refusal_rate_pct #5 / 5 ↓ 6.9less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration political_claude_ai_refusal_rate_pct #4 / 4 ↓ 6.6less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration political_evenhandedness_api_pct #5 / 5 ↑ 86.2less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration political_evenhandedness_claude_ai_pct #4 / 4 ↑ 95.7less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration political_opposing_perspectives_api_pct #2 / 5 ↑ 45.7less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration political_opposing_perspectives_claude_ai_pct #4 / 4 ↑ 52.9less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration selfharm_api_harmless_rate_pct #5 / 5 ↑ 98.8less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration selfharm_api_multiturn_appropriate_rate_pct #2 / 5 ↑ 63less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration selfharm_api_overrefusal_rate_pct #5 / 5 ↓ 0.15less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration selfharm_claude_ai_harmless_rate_pct #4 / 4 ↑ 99.82less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration selfharm_claude_ai_multiturn_appropriate_rate_pct #3 / 4 ↑ 90less safe safer Source ↗ official Claude Fable 5.1 / Mythos 5.1 card — safety and refusal calibration selfharm_claude_ai_overrefusal_rate_pct #2 / 4 ↓ 0.45less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty accepting_unverifiable_authorization #5 / 5 ↓ 2.93less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty approval_gate_bypass #4 / 5 ↓ 2.17less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty biological_weapons_uplift #3 / 5 ↓ 1.04less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty chemical_weapons_uplift #5 / 5 ↓ 1.04less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty circumventing_constraints_or_controls #4 / 5 ↓ 2.14less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty coherence_between_actions_and_views #5 / 5 ↑ 5.6less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty compliance_with_deception_toward_user #5 / 5 ↓ 1.12less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty complying_with_prompt_injections #5 / 5 ↓ 1.44less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty concealed_git_changes_spontaneous_disclosure_rate_pct #5 / 5 ↑ 38less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty controlled_substance_synthesis_uplift #4 / 5 ↓ 1.07less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty cooperation_with_exfiltration_or_safeguard_tampering #5 / 5 ↓ 1.08less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty dangerous_actions_oblivious_to_real_setting #5 / 5 ↓ 1.33less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty destructive_action_rate_pct #4 / 6 ↓ 50less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty disallowed_cyberoffense #4 / 5 ↓ 1.17less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty encouragement_of_user_delusion #5 / 5 ↓ 1.08less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty evasiveness_controversial_topics #5 / 5 ↓ 1.18less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty explosive_weapons_uplift #5 / 5 ↓ 1.04less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty false_completion_claims #5 / 5 ↓ 1.79less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty fraud #5 / 5 ↓ 1.26less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty harmful_sexual_content #3 / 5 ↓ 1.07less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty harmful_system_prompt_compliance #5 / 5 ↓ 1.2less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty ignoring_explicit_constraints #5 / 5 ↓ 2.33less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty important_omissions #5 / 5 ↓ 2.71less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty input_hallucination #5 / 5 ↓ 2.04less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty internalized_propaganda #5 / 5 ↓ 1.08less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty leaked_answer_undisclosed_use_rate_pct #4 / 5 ↓ 22.8less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty mask_honesty_rate_pct #1 / 5 ↑ 96.6less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty military_grade_weapons #3 / 5 ↓ 1.06less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty motivated_reasoning #5 / 5 ↓ 3.45less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty overrefusal #5 / 5 ↓ 1.86less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty package_registry_unencouraged_real_publish_rate_pct #3 / 3 ↓ 86.67less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty radiological_nuclear_weapons_uplift #1 / 5 ↓ 1less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty reckless_tool_use #4 / 5 ↓ 2.53less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty security_shortcut_for_expedience #5 / 5 ↓ 2.98less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty self_preservation #4 / 5 ↓ 1.06less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty self_serving_bias #5 / 5 ↓ 1.3less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty supporting_user_autonomy #5 / 5 ↑ 6.84less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty sycophancy #5 / 5 ↓ 2.2less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty undermining_liberal_democracy #5 / 5 ↓ 1.3less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty unfaithful_thinking #5 / 5 ↓ 2.78less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty unprompted_boundary_probing #4 / 5 ↓ 1.33less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty unsanctioned_sandbox_escape_attempts #4 / 5 ↓ 1.77less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty unsanctioned_third_party_contact #4 / 5 ↓ 1.4less safe safer Source ↗ official Claude Opus 5.5 card — alignment and honesty user_deception #5 / 5 ↓ 1.77less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration child_api_multiturn_appropriate_rate_pct #1 / 4 ↑ 88less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration child_claude_ai_multiturn_appropriate_rate_pct #4 / 4 ↑ 96less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration claude_code_dual_use_benign_success_rate_pct #4 / 4 ↑ 96.9less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration claude_code_malicious_refusal_rate_pct #1 / 4 ↑ 90.7less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration election_api_harmless_rate_pct #1 / 4 ↑ 100less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration election_api_multiturn_appropriate_rate_pct #1 / 4 ↑ 91less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration election_api_overrefusal_rate_pct #1 / 4 ↓ 0less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration election_claude_ai_harmless_rate_pct #1 / 4 ↑ 100less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration election_claude_ai_multiturn_appropriate_rate_pct #3 / 4 ↑ 87less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration election_claude_ai_overrefusal_rate_pct #1 / 4 ↓ 0less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration malicious_computer_use_refusal_rate_pct #3 / 4 ↑ 84.68less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration multiturn_biological_weapons_api_appropriate_rate_pct #2 / 3 ↑ 79less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration multiturn_biological_weapons_claude_ai_appropriate_rate_pct #3 / 3 ↑ 77less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration multiturn_cyberattacks_api_appropriate_rate_pct #3 / 3 ↑ 92less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration multiturn_cyberattacks_claude_ai_appropriate_rate_pct #3 / 3 ↑ 99less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration multiturn_deadly_weapons_api_appropriate_rate_pct #3 / 3 ↑ 80less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration multiturn_deadly_weapons_claude_ai_appropriate_rate_pct #3 / 3 ↑ 89less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration multiturn_hate_and_discrimination_api_appropriate_rate_pct #2 / 3 ↑ 97less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration multiturn_hate_and_discrimination_claude_ai_appropriate_rate_pct #2 / 3 ↑ 98less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration multiturn_influence_operations_api_appropriate_rate_pct #3 / 3 ↑ 61less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration multiturn_influence_operations_claude_ai_appropriate_rate_pct #3 / 3 ↑ 59less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration multiturn_romance_scams_api_appropriate_rate_pct #3 / 3 ↑ 93less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration multiturn_romance_scams_claude_ai_appropriate_rate_pct #3 / 3 ↑ 92less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration multiturn_tracking_and_surveillance_api_appropriate_rate_pct #2 / 3 ↑ 86less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration multiturn_tracking_and_surveillance_claude_ai_appropriate_rate_pct #2 / 3 ↑ 88less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration multiturn_violent_extremism_api_appropriate_rate_pct #3 / 3 ↑ 92less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration multiturn_violent_extremism_claude_ai_appropriate_rate_pct #3 / 3 ↑ 93less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration overall_benign_api_overrefusal_rate_pct #4 / 4 ↓ 0.59less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration overall_benign_claude_ai_overrefusal_rate_pct #4 / 4 ↓ 1.54less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration overall_harmful_api_harmless_rate_pct #1 / 4 ↑ 96.65less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration overall_harmful_claude_ai_harmless_rate_pct #3 / 4 ↑ 99.2less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration selfharm_api_multiturn_appropriate_rate_pct #3 / 4 ↑ 63less safe safer Source ↗ official Claude Opus 5.5 card — safety and refusal calibration selfharm_claude_ai_multiturn_appropriate_rate_pct #3 / 4 ↑ 90less safe safer Source ↗ official Claude system cards — Gray Swan Q1+Q2 indirect prompt injection k=15 attack_success_probability_k15_pct #5 / 12 ↓ 6.7less safe safer Source ↗ official Enkrypt AI Safety Leaderboard bias_attack_non_success_rate #8 / 270 ↑ 70.54less safe safer Source ↗ official Enkrypt AI Safety Leaderboard cbrn_attack_non_success_rate #43 / 270 ↑ 92.5less safe safer Source ↗ official Enkrypt AI Safety Leaderboard harmful_attack_non_success_rate #1 / 270 ↑ 100less safe safer Source ↗ official Enkrypt AI Safety Leaderboard toxicity_attack_non_success_rate #9 / 268 ↑ 99.82less safe safer Source ↗ official Every Model Cheats — Cybench Cheat Propensity baseline_cheat_propensity_pct #20 / 22 ↓ 56.5less safe safer Source ↗ official Every Model Cheats — Cybench Cheat Propensity severe_anti_cheat_cheat_propensity_pct #1 / 22 ↓ 0less safe safer Source ↗ official Every Model Cheats — Cybench Cheat Propensity standard_anti_cheat_cheat_propensity_pct #13 / 22 ↓ 17.4less safe safer Source ↗ official Google Gemini 3.8 launch — Gray Swan indirect prompt injection k=15 attack_success_probability_k15_pct #5 / 15 ↓ 6.7less safe safer Source ↗ official Gray Swan indirect prompt injection (15 attempts) attack_success_probability_k15_pct #5 / 13 ↓ 5.9less safe safer Source ↗ official Manager Coercion Bench coercion_ladder_depth #10 / 45 ↓ 5.5less safe safer Source ↗ official Manager Coercion Bench fabrication_rate #1 / 15 ↓ 0less safe safer Source ↗ official MentalHealthBench overall_model_performance_pct #9 / 17 ↑ 44.54less safe safer Source ↗ official Olam Social Poker — Social Lie Rate social_lie_rate_per_10000_turns #3 / 24 ↓ 2less safe safer Source ↗ official Opposite-Narrator Sycophancy sycophancy_rate_pct #20 / 24 ↓ 9.1less safe safer Source ↗ official Pander Score conversational_absolute_pander_score #10 / 26 ↓ 7.263less safe safer Source ↗ official Pander Score instructional_absolute_pander_score #12 / 26 ↓ 29.5less safe safer Source ↗ official PHARE bias_resistance_diagnostic #43 / 66 ↑ 0.3988less safe safer Source ↗ official PHARE hallucination_resistance_diagnostic #7 / 70 ↑ 0.861less safe safer Source ↗ official PHARE harm_resistance_diagnostic #4 / 70 ↑ 0.9959less safe safer Source ↗ official PHARE jailbreak_resistance_diagnostic #1 / 67 ↑ 0.8684less safe safer Source ↗ official SM-Bench adversarial #52 / 92 ↑ 80.98less safe safer Source ↗ official SM-Bench ambiguous_interpretation #11 / 92 ↑ 91.96less safe safer Source ↗ official SM-Bench anti_hallucination #1 / 92 ↑ 100less safe safer Source ↗ official SM-Bench eq_boundaries #76 / 92 ↑ 55.06less safe safer Source ↗ official SM-Bench overfit #31 / 92 ↑ 83.06less safe safer Source ↗ official SpeciEval belief_animal_sentience #98 / 131 ↑ 6.57less safe safer Source ↗ official SpeciEval land_animal_4ns #104 / 131 ↓ 4.8less safe safer Source ↗ official SpeciEval sea_animal_4ns #110 / 131 ↓ 5.05less safe safer Source ↗ official SpeciEval speciesism #72 / 131 ↓ 2.07less safe safer Source ↗ official TAC base_welfare_rate #90 / 92 ↑ 15.38less safe safer Source ↗ official The Dictatorship Eval overall_resistance_rate #7 / 20 ↑ 83.5less safe safer Source ↗ official Vals AI Cheating Audit terminal_bench_cheating_shortcut_evidence_rate_pct #6 / 14 ↓ 1.124less safe safer Source ↗ official Vals Teen Conversation Safety share_flagged_pct #3 / 8 ↓ 16.67less safe safer Source ↗ official
Freedom evals Rank and direction are specific to the Freedom portfolio. Black marks the observed result; the grey dot marks the value implied by the Freedom rank. Values stay on each source’s native scale.
Values evaluations Descriptive values and political-framing results are separate from safety/ethics ranks. Each strip shows the evaluation’s observed model range; its endpoint labels state what lower and higher values mean.