← Evals

Evaluation profile

Claude 3 model-card adversarial human-preference evaluations

8sub-evals
0.345%Safety weight
0.35%Freedom weight
4components

Weights below are portfolio-specific global index weights.

Model score (see each sub-eval direction)Predicted score

About this eval

Refusal calibration, adversarial honesty and harmlessness, multimodal hallucination and harmful-response robustness, and discrimination.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirection by rankingSafety weightFreedom weight
correct_refusals_wildchat_rankclaude-system-cards/claude-3-scoring.csv:correct_refusals_wildchat_rankRanks evaluated systems by how consistently they refuse harmful real-world prompts.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000anthropic-claude-3-system-cardSafety: lower · Freedom: higher0.0136%0.0774%
discrimination_rankclaude-system-cards/claude-3-scoring.csv:discrimination_rankRanks evaluated systems by lower discriminatory behavior in the card's evaluation.Safety: fairness_nondiscrimination:1.000anthropic-claude-3-system-cardSafety: lower0.0662%—
human_feedback_harmlessness_win_rate_pctclaude-system-cards/claude-3-scoring.csv:human_feedback_harmlessness_win_rate_pctMeasures which responses raters judged less harmful under adversarial prompting.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000anthropic-claude-3-system-cardSafety: higher · Freedom: lower0.0121%0.0692%
human_feedback_honesty_win_rate_pctclaude-system-cards/claude-3-scoring.csv:human_feedback_honesty_win_rate_pctMeasures which responses raters judged more honest under attempts to elicit falsehoods.Safety: truthfulness_honesty:1.000anthropic-claude-3-system-cardSafety: higher0.033%—
incorrect_refusals_wildchat_rankclaude-system-cards/claude-3-scoring.csv:incorrect_refusals_wildchat_rankRanks evaluated systems by how rarely they refuse benign real-world prompts.Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000anthropic-claude-3-system-cardSafety: lower · Freedom: lower0.0941%0.0774%
incorrect_refusals_xstest_rankclaude-system-cards/claude-3-scoring.csv:incorrect_refusals_xstest_rankCompares exaggerated safety behavior on benign prompts designed to resemble unsafe requests.Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000anthropic-claude-3-system-cardSafety: lower · Freedom: lower0.0941%0.0774%
multimodal_hallucination_rankclaude-system-cards/claude-3-scoring.csv:multimodal_hallucination_rankRanks evaluated multimodal systems by how reliably they avoid hallucinated claims.Safety: truthfulness_honesty:1.000anthropic-claude-3-system-cardSafety: lower0.0234%—
multimodal_harmful_response_rankclaude-system-cards/claude-3-scoring.csv:multimodal_harmful_response_rankRanks evaluated multimodal systems by how consistently they avoid harmful responses.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000anthropic-claude-3-system-cardSafety: lower · Freedom: higher0.00857%0.049%

correct_refusals_wildchat_rank

Ranks evaluated systems by how consistently they refuse harmful real-world prompts.

RankModelValueRelative performanceProvenance
1claude-21official
2claude-3-sonnet2official
3claude-3-opus3official
4claude-2.14official
5claude-3-haiku5official

discrimination_rank

Ranks evaluated systems by lower discriminatory behavior in the card's evaluation.

RankModelValueRelative performanceProvenance
1claude-2.11official
2claude-3-sonnet2official
3claude-3-opus3official
4claude-3-haiku4official
5claude-instant-1.25official

human_feedback_harmlessness_win_rate_pct

Measures which responses raters judged less harmful under adversarial prompting.

RankModelValueRelative performanceProvenance
1claude-2.187official
1claude-3-sonnet87official
3claude-instant-1.285official
4claude-284official

human_feedback_honesty_win_rate_pct

Measures which responses raters judged more honest under attempts to elicit falsehoods.

RankModelValueRelative performanceProvenance
1claude-3-sonnet69official
2claude-2.168official
3claude-266official
4claude-instant-1.261official

incorrect_refusals_wildchat_rank

Ranks evaluated systems by how rarely they refuse benign real-world prompts.

RankModelValueRelative performanceProvenance
1claude-3-haiku1official
2claude-3-sonnet2official
3claude-3-opus3official
4claude-24official
5claude-2.15official

incorrect_refusals_xstest_rank

Compares exaggerated safety behavior on benign prompts designed to resemble unsafe requests.

RankModelValueRelative performanceProvenance
1claude-3-opus1official
2claude-22official
3claude-3-haiku3official
4claude-2.14official
4claude-3-sonnet4official

multimodal_hallucination_rank

Ranks evaluated multimodal systems by how reliably they avoid hallucinated claims.

RankModelValueRelative performanceProvenance
1claude-3-sonnet1official
2claude-3-opus2official

multimodal_harmful_response_rank

Ranks evaluated multimodal systems by how consistently they avoid harmful responses.

RankModelValueRelative performanceProvenance
1claude-3-sonnet1official
2claude-3-opus2official