← Evals

Evaluation profile

FORTRESS

2sub-evals
1.97%total index weight
2components

Within-component eval weight: Misuse resistance 2.24% · Benign helpfulness 17.4%.

Model score (lower is better)Predicted score

About this eval

Balanced refusal behavior across harmful and benign prompts, including over-refusal.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
average_risk_scorefortress/leaderboard.csv:average_risk_scoreMeasures whether adversarial prompts trigger behaviors identified by each scenario’s risk rubric.ordinary_harm_misuse_resistance:1.000fortress/leaderboard.csvLower is better0.224%Misuse resistance 2.24%
over_refusal_scorefortress/leaderboard.csv:over_refusal_scoreMeasures whether the model refuses benign requests included to test excessive caution.benign_helpfulness_non_overrefusal:1.000fortress/leaderboard.csvLower is better1.74%Benign helpfulness 17.4%

average_risk_score

Measures whether adversarial prompts trigger behaviors identified by each scenario’s risk rubric.

RankModelValueRelative performanceProvenance
1gpt-oss-120b8.24official
2claude-opus-4.511.59official
3muse-spark-1.112.4official
4claude-3.5-sonnet12.96official
5gpt-5.4-pro14.84official
6claude-sonnet-4.514.88official
7gpt-5-pro15.2official
8claude-opus-4.115.47official
9o316.01official
10gpt-5.516.28official
11claude-opus-4.616.76official
12gpt-5-mini17official
13gpt-517.04official
14gpt-5.217.5official
15gpt-oss-20b17.62official
16claude-opus-4.818.19official
17o119.38official
18muse-spark20.22official
19llama-3.1-405b-instruct20.61official
20claude-sonnet-421.21official
21o4-mini21.49official
22claude-opus-426.19official
23gpt-5.128.04official
24gemini-3.1-pro-preview29.76official
25o3-mini30.05official
26claude-3.5-haiku30.41official
27claude-3.7-sonnet38.01official
28llama-4-maverick40.09official
29kimi-k2.541.09official
30gemini-3-pro-preview41.69official
31llama-3.1-70b-instruct44.18official
32llama-3.3-70b-instruct44.79official
33gpt-4o47.18official
34gpt-4o-mini48.07official
35gemini-1.5-flash50.61official
36gemini-3.1-flash-lite51.05official
37gpt-4.153.02official
38gemini-1.5-pro53.86official
39gemini-2.5-pro-exp54.89official
40kimi-k255.47official
41mixtral-8x22b-instruct56.06official
42qwen2.5-72b-instruct56.43official
43gpt-4.1-mini59.19official
44glm-4.559.58official
45deepseek-v3.160.55official
46qwen3-235b-a22b61.39official
47gemini-2.5-pro61.68official
48glm-4.5-air63.18official
49deepseek-r174.39official

over_refusal_score

Measures whether the model refuses benign requests included to test excessive caution.

RankModelValueRelative performanceProvenance
1deepseek-r10.49official
2qwen3-235b-a22b0.98official
3llama-3.1-70b-instruct1.09official
4glm-4.5-air1.17official
5qwen2.5-72b-instruct1.19official
6gemini-2.5-pro-exp1.38official
6gpt-4.1-mini1.38official
8gemini-2.5-pro1.58official
9gpt-4o1.68official
10deepseek-v3.11.76official
11gemini-3.1-flash-lite2.15official
12llama-3.3-70b-instruct2.18official
13claude-opus-42.205official
14gpt-4o-mini2.27official
15glm-4.52.54official
16mixtral-8x22b-instruct2.77official
17gpt-4.12.87official
18gemini-3.1-pro-preview3.13official
19gemini-1.5-pro3.17official
20kimi-k2.53.72official
21claude-opus-4.14.065official
22claude-3.7-sonnet4.45official
22gemini-1.5-flash4.45official
24llama-4-maverick4.95official
25o15.05official
26o4-mini5.14official
27claude-sonnet-45.14official
28claude-opus-4.55.145official
29claude-sonnet-4.55.25official
30o3-mini5.65official
31gpt-5.15.78official
32llama-3.1-405b-instruct6.03official
33muse-spark-1.16.92official
34claude-opus-4.87.42official
34o37.42official
36gpt-5.4-pro9.41official
37claude-opus-4.69.59official
38gpt-5.59.79official
39gpt-511.2official
40gpt-5.211.76official
41gpt-oss-20b11.94official
42gpt-5-pro12.43official
43claude-3.5-haiku13.16official
44gpt-5-mini14.17official
45gpt-oss-120b18official
46claude-3.5-sonnet21.07official