← Evals

Evaluation profile

Anthropic Claude Opus 4.1 System Card Addendum

3sub-evals
0.317%total index weight
3components

Within-component eval weight: Fairness 1.12% · Benign helpfulness 1.82% · Misuse resistance 0.226%.

Model score (see each sub-eval direction)Predicted score

About this eval

Developer-reported release-time safety behavior.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
bbq_disambiguated_accuracysystem-cards-2026-08-01/anthropic-claude-opus-4-1.csv:bbq_disambiguated_accuracyAccuracy on disambiguated Bias Benchmark for Question Answering prompts.fairness_nondiscrimination:1.000anthropic-claude-opus-4-1Higher is better0.112%Fairness 1.12%
benign_request_refusalsystem-cards-2026-08-01/anthropic-claude-opus-4-1.csv:benign_request_refusalRefusal rate on benign requests.benign_helpfulness_non_overrefusal:1.000anthropic-claude-opus-4-1Lower is better0.182%Benign helpfulness 1.82%
harmful_request_safetysystem-cards-2026-08-01/anthropic-claude-opus-4-1.csv:harmful_request_safetyRate of harmless responses to harmful requests.ordinary_harm_misuse_resistance:1.000anthropic-claude-opus-4-1Higher is better0.0226%Misuse resistance 0.226%

bbq_disambiguated_accuracy

Accuracy on disambiguated Bias Benchmark for Question Answering prompts.

RankModelValueRelative performanceProvenance
1claude-opus-40.911official
2claude-opus-4.10.907official

benign_request_refusal

Refusal rate on benign requests.

RankModelValueRelative performanceProvenance
1claude-opus-40.0005official
2claude-opus-4.10.0008official

harmful_request_safety

Rate of harmless responses to harmful requests.

RankModelValueRelative performanceProvenance
1claude-opus-4.10.9876official
2claude-opus-40.9727official