← Evals

Evaluation profile

Claude Opus 5.5 card — safety and refusal calibration

33sub-evals
0.162%Safety weight
0.642%Freedom weight
5components

Weights below are portfolio-specific global index weights.

Model score (see each sub-eval direction)Predicted score

About this eval

Safety, refusal calibration, honesty and responsible agency under the publisher’s evaluation conditions.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirection by rankingSafety weightFreedom weight
child_api_multiturn_appropriate_rate_pctopus55-system-card/safety-calibration.csv:child_api_multiturn_appropriate_rate_pctMeasures child safety multi-turn appropriate response rate: api in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.300|ordinary_harm_misuse_resistance:0.700 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00395%0.0237%
child_claude_ai_multiturn_appropriate_rate_pctopus55-system-card/safety-calibration.csv:child_claude_ai_multiturn_appropriate_rate_pctMeasures child safety multi-turn appropriate response rate: claude.ai in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.300|ordinary_harm_misuse_resistance:0.700 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00395%0.0237%
claude_code_dual_use_benign_success_rate_pctopus55-system-card/safety-calibration.csv:claude_code_dual_use_benign_success_rate_pctMeasures dual-use & benign (%) (success rate) in the publisher’s specified evaluation condition.Safety: benign_helpfulness_non_overrefusal:1.000anthropic-opus55-system-cardSafety: higher0.00893%—
claude_code_malicious_refusal_rate_pctopus55-system-card/safety-calibration.csv:claude_code_malicious_refusal_rate_pctMeasures malicious (%) (refusal rate) in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:0.700|responsible_agency_control:0.300anthropic-opus55-system-cardSafety: higher0.00302%—
election_api_harmless_rate_pctopus55-system-card/safety-calibration.csv:election_api_harmless_rate_pctMeasures election integrity single-turn harmless rate: api in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.700|ordinary_harm_misuse_resistance:0.300 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00707%0.0237%
election_api_multiturn_appropriate_rate_pctopus55-system-card/safety-calibration.csv:election_api_multiturn_appropriate_rate_pctMeasures election integrity multi-turn appropriate response rate: api in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.700|ordinary_harm_misuse_resistance:0.300 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00707%0.0237%
election_api_overrefusal_rate_pctopus55-system-card/safety-calibration.csv:election_api_overrefusal_rate_pctMeasures election integrity single-turn benign refusal rate: api in the publisher’s specified evaluation condition.Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: lower · Freedom: lower0.00893%0.019%
election_claude_ai_harmless_rate_pctopus55-system-card/safety-calibration.csv:election_claude_ai_harmless_rate_pctMeasures election integrity single-turn harmless rate: claude.ai in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.700|ordinary_harm_misuse_resistance:0.300 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00707%0.0237%
election_claude_ai_multiturn_appropriate_rate_pctopus55-system-card/safety-calibration.csv:election_claude_ai_multiturn_appropriate_rate_pctMeasures election integrity multi-turn appropriate response rate: claude.ai in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.700|ordinary_harm_misuse_resistance:0.300 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00707%0.0237%
election_claude_ai_overrefusal_rate_pctopus55-system-card/safety-calibration.csv:election_claude_ai_overrefusal_rate_pctMeasures election integrity single-turn benign refusal rate: claude.ai in the publisher’s specified evaluation condition.Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: lower · Freedom: lower0.00893%0.019%
malicious_computer_use_refusal_rate_pctopus55-system-card/safety-calibration.csv:malicious_computer_use_refusal_rate_pctMeasures malicious computer use refusal rate in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:0.700|responsible_agency_control:0.300anthropic-opus55-system-cardSafety: higher0.00302%—
multiturn_biological_weapons_api_appropriate_rate_pctopus55-system-card/safety-calibration.csv:multiturn_biological_weapons_api_appropriate_rate_pctMeasures biological weapons: api appropriate response rate in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00139%0.0205%
multiturn_biological_weapons_claude_ai_appropriate_rate_pctopus55-system-card/safety-calibration.csv:multiturn_biological_weapons_claude_ai_appropriate_rate_pctMeasures biological weapons: claude_ai appropriate response rate in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00139%0.0205%
multiturn_cyberattacks_api_appropriate_rate_pctopus55-system-card/safety-calibration.csv:multiturn_cyberattacks_api_appropriate_rate_pctMeasures cyberattacks: api appropriate response rate in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00139%0.0205%
multiturn_cyberattacks_claude_ai_appropriate_rate_pctopus55-system-card/safety-calibration.csv:multiturn_cyberattacks_claude_ai_appropriate_rate_pctMeasures cyberattacks: claude_ai appropriate response rate in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00139%0.0205%
multiturn_deadly_weapons_api_appropriate_rate_pctopus55-system-card/safety-calibration.csv:multiturn_deadly_weapons_api_appropriate_rate_pctMeasures deadly weapons: api appropriate response rate in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00139%0.0205%
multiturn_deadly_weapons_claude_ai_appropriate_rate_pctopus55-system-card/safety-calibration.csv:multiturn_deadly_weapons_claude_ai_appropriate_rate_pctMeasures deadly weapons: claude_ai appropriate response rate in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00139%0.0205%
multiturn_hate_and_discrimination_api_appropriate_rate_pctopus55-system-card/safety-calibration.csv:multiturn_hate_and_discrimination_api_appropriate_rate_pctMeasures hate and discrimination: api appropriate response rate in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.300|fairness_nondiscrimination:0.500|ordinary_harm_misuse_resistance:0.200 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00613%0.0205%
multiturn_hate_and_discrimination_claude_ai_appropriate_rate_pctopus55-system-card/safety-calibration.csv:multiturn_hate_and_discrimination_claude_ai_appropriate_rate_pctMeasures hate and discrimination: claude_ai appropriate response rate in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.300|fairness_nondiscrimination:0.500|ordinary_harm_misuse_resistance:0.200 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00613%0.0205%
multiturn_influence_operations_api_appropriate_rate_pctopus55-system-card/safety-calibration.csv:multiturn_influence_operations_api_appropriate_rate_pctMeasures influence operations: api appropriate response rate in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.700|ordinary_harm_misuse_resistance:0.300 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00612%0.0205%
multiturn_influence_operations_claude_ai_appropriate_rate_pctopus55-system-card/safety-calibration.csv:multiturn_influence_operations_claude_ai_appropriate_rate_pctMeasures influence operations: claude_ai appropriate response rate in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.700|ordinary_harm_misuse_resistance:0.300 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00612%0.0205%
multiturn_romance_scams_api_appropriate_rate_pctopus55-system-card/safety-calibration.csv:multiturn_romance_scams_api_appropriate_rate_pctMeasures romance scams: api appropriate response rate in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.500|ordinary_harm_misuse_resistance:0.500 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00477%0.0205%
multiturn_romance_scams_claude_ai_appropriate_rate_pctopus55-system-card/safety-calibration.csv:multiturn_romance_scams_claude_ai_appropriate_rate_pctMeasures romance scams: claude_ai appropriate response rate in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.500|ordinary_harm_misuse_resistance:0.500 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00477%0.0205%
multiturn_tracking_and_surveillance_api_appropriate_rate_pctopus55-system-card/safety-calibration.csv:multiturn_tracking_and_surveillance_api_appropriate_rate_pctMeasures tracking and surveillance: api appropriate response rate in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.700|ordinary_harm_misuse_resistance:0.300 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00612%0.0205%
multiturn_tracking_and_surveillance_claude_ai_appropriate_rate_pctopus55-system-card/safety-calibration.csv:multiturn_tracking_and_surveillance_claude_ai_appropriate_rate_pctMeasures tracking and surveillance: claude_ai appropriate response rate in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.700|ordinary_harm_misuse_resistance:0.300 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00612%0.0205%
multiturn_violent_extremism_api_appropriate_rate_pctopus55-system-card/safety-calibration.csv:multiturn_violent_extremism_api_appropriate_rate_pctMeasures violent extremism: api appropriate response rate in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.500|ordinary_harm_misuse_resistance:0.500 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00477%0.0205%
multiturn_violent_extremism_claude_ai_appropriate_rate_pctopus55-system-card/safety-calibration.csv:multiturn_violent_extremism_claude_ai_appropriate_rate_pctMeasures violent extremism: claude_ai appropriate response rate in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.500|ordinary_harm_misuse_resistance:0.500 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00477%0.0205%
overall_benign_api_overrefusal_rate_pctopus55-system-card/safety-calibration.csv:overall_benign_api_overrefusal_rate_pctMeasures overall refusal rate: api in the publisher’s specified evaluation condition.Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: lower · Freedom: lower0.00893%0.019%
overall_benign_claude_ai_overrefusal_rate_pctopus55-system-card/safety-calibration.csv:overall_benign_claude_ai_overrefusal_rate_pctMeasures overall refusal rate: claude.ai in the publisher’s specified evaluation condition.Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: lower · Freedom: lower0.00893%0.019%
overall_harmful_api_harmless_rate_pctopus55-system-card/safety-calibration.csv:overall_harmful_api_harmless_rate_pctMeasures overall harmless response rate: api in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00161%0.0237%
overall_harmful_claude_ai_harmless_rate_pctopus55-system-card/safety-calibration.csv:overall_harmful_claude_ai_harmless_rate_pctMeasures overall harmless response rate: claude.ai in the publisher’s specified evaluation condition.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00161%0.0237%
selfharm_api_multiturn_appropriate_rate_pctopus55-system-card/safety-calibration.csv:selfharm_api_multiturn_appropriate_rate_pctMeasures suicide and self-harm multi-turn appropriate response rate: api in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.300|ordinary_harm_misuse_resistance:0.700 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00395%0.0237%
selfharm_claude_ai_multiturn_appropriate_rate_pctopus55-system-card/safety-calibration.csv:selfharm_claude_ai_multiturn_appropriate_rate_pctMeasures suicide and self-harm multi-turn appropriate response rate: claude.ai in the publisher’s specified evaluation condition.Safety: human_rights_systemic_harm:0.300|ordinary_harm_misuse_resistance:0.700 · Freedom: user_direction_following:1.000anthropic-opus55-system-cardSafety: higher · Freedom: lower0.00395%0.0237%

child_api_multiturn_appropriate_rate_pct

Measures child safety multi-turn appropriate response rate: api in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-sonnet-588official
2claude-opus-586official
3claude-fable-5.184official
3claude-opus-5.584official

child_claude_ai_multiturn_appropriate_rate_pct

Measures child safety multi-turn appropriate response rate: claude.ai in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-fable-5.1100official
2claude-opus-599official
2claude-opus-5.599official
4claude-sonnet-596official

claude_code_dual_use_benign_success_rate_pct

Measures dual-use & benign (%) (success rate) in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-5.599.8official
2claude-opus-599.7official
3claude-mythos-5.198.4official
4claude-sonnet-596.9official

claude_code_malicious_refusal_rate_pct

Measures malicious (%) (refusal rate) in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-sonnet-590.7official
2claude-mythos-5.190.3official
3claude-opus-583.6official
4claude-opus-5.579.8official

election_api_harmless_rate_pct

Measures election integrity single-turn harmless rate: api in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-5100official
1claude-sonnet-5100official
3claude-fable-5.199.67official
4claude-opus-5.599.33official

election_api_multiturn_appropriate_rate_pct

Measures election integrity multi-turn appropriate response rate: api in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-591official
1claude-sonnet-591official
3claude-fable-5.190official
4claude-opus-5.587official

election_api_overrefusal_rate_pct

Measures election integrity single-turn benign refusal rate: api in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-fable-5.10official
1claude-opus-5.50official
1claude-sonnet-50official
4claude-opus-50.17official

election_claude_ai_harmless_rate_pct

Measures election integrity single-turn harmless rate: claude.ai in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-fable-5.1100official
1claude-opus-5100official
1claude-opus-5.5100official
1claude-sonnet-5100official

election_claude_ai_multiturn_appropriate_rate_pct

Measures election integrity multi-turn appropriate response rate: claude.ai in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-591official
2claude-fable-5.188official
3claude-sonnet-587official
4claude-opus-5.585official

election_claude_ai_overrefusal_rate_pct

Measures election integrity single-turn benign refusal rate: claude.ai in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-fable-5.10official
1claude-opus-5.50official
1claude-sonnet-50official
4claude-opus-50.33official

malicious_computer_use_refusal_rate_pct

Measures malicious computer use refusal rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-593.75official
2claude-mythos-5.187.5official
3claude-sonnet-584.68official
4claude-opus-5.579.46official

multiturn_biological_weapons_api_appropriate_rate_pct

Measures biological weapons: api appropriate response rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-5.589official
2claude-opus-579official
2claude-sonnet-579official

multiturn_biological_weapons_claude_ai_appropriate_rate_pct

Measures biological weapons: claude_ai appropriate response rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-5.594official
2claude-opus-586official
3claude-sonnet-577official

multiturn_cyberattacks_api_appropriate_rate_pct

Measures cyberattacks: api appropriate response rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-596official
2claude-opus-5.595official
3claude-sonnet-592official

multiturn_cyberattacks_claude_ai_appropriate_rate_pct

Measures cyberattacks: claude_ai appropriate response rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-5100official
1claude-opus-5.5100official
3claude-sonnet-599official

multiturn_deadly_weapons_api_appropriate_rate_pct

Measures deadly weapons: api appropriate response rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-590official
2claude-opus-5.582official
3claude-sonnet-580official

multiturn_deadly_weapons_claude_ai_appropriate_rate_pct

Measures deadly weapons: claude_ai appropriate response rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-597official
2claude-opus-5.593official
3claude-sonnet-589official

multiturn_hate_and_discrimination_api_appropriate_rate_pct

Measures hate and discrimination: api appropriate response rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-599official
2claude-sonnet-597official
3claude-opus-5.596official

multiturn_hate_and_discrimination_claude_ai_appropriate_rate_pct

Measures hate and discrimination: claude_ai appropriate response rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-599official
2claude-sonnet-598official
3claude-opus-5.588official

multiturn_influence_operations_api_appropriate_rate_pct

Measures influence operations: api appropriate response rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-573official
2claude-opus-5.562official
3claude-sonnet-561official

multiturn_influence_operations_claude_ai_appropriate_rate_pct

Measures influence operations: claude_ai appropriate response rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-565official
2claude-opus-5.563official
3claude-sonnet-559official

multiturn_romance_scams_api_appropriate_rate_pct

Measures romance scams: api appropriate response rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-597official
2claude-opus-5.594official
3claude-sonnet-593official

multiturn_romance_scams_claude_ai_appropriate_rate_pct

Measures romance scams: claude_ai appropriate response rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-598official
2claude-opus-5.594official
3claude-sonnet-592official

multiturn_tracking_and_surveillance_api_appropriate_rate_pct

Measures tracking and surveillance: api appropriate response rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-588official
2claude-sonnet-586official
3claude-opus-5.565official

multiturn_tracking_and_surveillance_claude_ai_appropriate_rate_pct

Measures tracking and surveillance: claude_ai appropriate response rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-595official
2claude-sonnet-588official
3claude-opus-5.569official

multiturn_violent_extremism_api_appropriate_rate_pct

Measures violent extremism: api appropriate response rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-596official
2claude-opus-5.595official
3claude-sonnet-592official

multiturn_violent_extremism_claude_ai_appropriate_rate_pct

Measures violent extremism: claude_ai appropriate response rate in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-5.598official
2claude-opus-597official
3claude-sonnet-593official

overall_benign_api_overrefusal_rate_pct

Measures overall refusal rate: api in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-fable-5.10official
2claude-opus-5.50.03official
3claude-opus-50.12official
4claude-sonnet-50.59official

overall_benign_claude_ai_overrefusal_rate_pct

Measures overall refusal rate: claude.ai in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-fable-5.10.34official
2claude-opus-5.50.38official
3claude-opus-50.49official
4claude-sonnet-51.54official

overall_harmful_api_harmless_rate_pct

Measures overall harmless response rate: api in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-sonnet-596.65official
2claude-opus-595.97official
3claude-fable-5.195.07official
4claude-opus-5.594.5official

overall_harmful_claude_ai_harmless_rate_pct

Measures overall harmless response rate: claude.ai in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-fable-5.199.53official
2claude-opus-5.599.51official
3claude-sonnet-599.2official
4claude-opus-598.53official

selfharm_api_multiturn_appropriate_rate_pct

Measures suicide and self-harm multi-turn appropriate response rate: api in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-opus-569official
2claude-opus-5.566official
3claude-sonnet-563official
4claude-fable-5.160official

selfharm_claude_ai_multiturn_appropriate_rate_pct

Measures suicide and self-harm multi-turn appropriate response rate: claude.ai in the publisher’s specified evaluation condition.

RankModelValueRelative performanceProvenance
1claude-fable-5.194official
1claude-opus-5.594official
3claude-opus-590official
3claude-sonnet-590official