← Evals

Evaluation profile

Anthropic Claude Haiku 4.5 System Card

3sub-evals
0.193%total index weight
2components

Within-component eval weight: Responsible agency 1.14% · Misuse resistance 0.226%.

Model score (higher is better)Predicted score

About this eval

Developer-reported release-time safety behavior.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
agentic_coding_safetysystem-cards-2026-08-01/anthropic-claude-haiku-4-5.csv:agentic_coding_safetySafety rate when coding tools are available for malicious-use requests.responsible_agency_control:1.000anthropic-claude-haiku-4-5Higher is better0.0853%Responsible agency 0.568%
claude_code_malicious_refusalsystem-cards-2026-08-01/anthropic-claude-haiku-4-5.csv:claude_code_malicious_refusalRefusal rate for malicious Claude Code requests without mitigations.responsible_agency_control:1.000anthropic-claude-haiku-4-5Higher is better0.0853%Responsible agency 0.568%
harmful_request_safetysystem-cards-2026-08-01/anthropic-claude-haiku-4-5.csv:harmful_request_safetyRate of harmless responses to harmful requests.ordinary_harm_misuse_resistance:1.000anthropic-claude-haiku-4-5Higher is better0.0226%Misuse resistance 0.226%

agentic_coding_safety

Safety rate when coding tools are available for malicious-use requests.

RankModelValueRelative performanceProvenance
1claude-3.5-haiku1official
1claude-haiku-4.51official
3claude-sonnet-4.50.987official

claude_code_malicious_refusal

Refusal rate for malicious Claude Code requests without mitigations.

RankModelValueRelative performanceProvenance
1claude-3.5-haiku0.7official
2claude-haiku-4.50.6939official
3claude-sonnet-4.50.6694official

harmful_request_safety

Rate of harmless responses to harmful requests.

RankModelValueRelative performanceProvenance
1claude-3.5-haiku0.9972official
2claude-haiku-4.50.9938official