← Evals

Evaluation profile

Claude 3.5 Sonnet model-card safety and alignment evaluations

5sub-evals
0.369%Safety weight
0.356%Freedom weight
3components

Weights below are portfolio-specific global index weights.

Model score (see each sub-eval direction)Predicted score

About this eval

Appropriate harmful-prompt refusal, benign non-overrefusal, adversarial honesty, and adversarial harmlessness.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirection by rankingSafety weightFreedom weight
correct_refusals_wildchatclaude-system-cards/claude-3.5-scoring.csv:correct_refusals_wildchatMeasures appropriate refusal of harmful real-world prompts.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000anthropic-claude-3.5-system-cardSafety: higher · Freedom: lower0.0194%0.0866%
human_feedback_harmlessness_win_rate_pctclaude-system-cards/claude-3.5-scoring.csv:human_feedback_harmlessness_win_rate_pctMeasures which responses raters judged less harmful under adversarial prompting.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000anthropic-claude-3.5-system-cardSafety: higher · Freedom: lower0.0217%0.0968%
human_feedback_honesty_win_rate_pctclaude-system-cards/claude-3.5-scoring.csv:human_feedback_honesty_win_rate_pctMeasures which responses raters judged more honest under adversarial prompting.Safety: truthfulness_honesty:1.000anthropic-claude-3.5-system-cardSafety: higher0.0591%—
incorrect_refusals_wildchatclaude-system-cards/claude-3.5-scoring.csv:incorrect_refusals_wildchatMeasures unnecessary refusal on benign real-world prompts.Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000anthropic-claude-3.5-system-cardSafety: lower · Freedom: lower0.135%0.0866%
incorrect_refusals_xstestclaude-system-cards/claude-3.5-scoring.csv:incorrect_refusals_xstestMeasures exaggerated safety behavior on non-malicious prompts.Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000anthropic-claude-3.5-system-cardSafety: lower · Freedom: lower0.135%0.0866%

correct_refusals_wildchat

Measures appropriate refusal of harmful real-world prompts.

RankModelValueRelative performanceProvenance
1claude-3.5-sonnet96.4official
2claude-3-sonnet93.6official
3claude-3-opus92official
4claude-3-haiku90official

human_feedback_harmlessness_win_rate_pct

Measures which responses raters judged less harmful under adversarial prompting.

RankModelValueRelative performanceProvenance
1claude-2.155official
2claude-3.5-sonnet52official
3claude-3-haiku50official
3claude-3-opus50official
5claude-3-sonnet47official

human_feedback_honesty_win_rate_pct

Measures which responses raters judged more honest under adversarial prompting.

RankModelValueRelative performanceProvenance
1claude-3.5-sonnet66official
2claude-3-opus50official
3claude-2.142official
4claude-3-sonnet38official
5claude-3-haiku36official

incorrect_refusals_wildchat

Measures unnecessary refusal on benign real-world prompts.

RankModelValueRelative performanceProvenance
1claude-3-haiku6.6official
2claude-3-sonnet8.8official
3claude-3.5-sonnet11official
4claude-3-opus11.9official

incorrect_refusals_xstest

Measures exaggerated safety behavior on non-malicious prompts.

RankModelValueRelative performanceProvenance
1claude-3.5-sonnet1.7official
2claude-3-opus8.3official
3claude-3-haiku33.1official
4claude-3-sonnet36.6official