← Evals

Evaluation profile

FORTRESS

2sub-evals
1.48%Safety weight
2.67%Freedom weight
2components

Weights below are portfolio-specific global index weights.

Model score (lower is better)Predicted score

About this eval

Balanced refusal behavior across harmful and benign prompts, including over-refusal.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirection by rankingSafety weightFreedom weight
average_risk_scorefortress/leaderboard.csv:average_risk_scoreMeasures whether adversarial prompts trigger behaviors identified by each scenario’s risk rubric.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000fortress/leaderboard.csvSafety: lower · Freedom: higher0.188%1.34%
over_refusal_scorefortress/leaderboard.csv:over_refusal_scoreMeasures whether the model refuses benign requests included to test excessive caution.Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000fortress/leaderboard.csvSafety: lower · Freedom: lower1.29%1.33%

average_risk_score

Measures whether adversarial prompts trigger behaviors identified by each scenario’s risk rubric.

RankModelValueRelative performanceProvenance
1gpt-oss-120b8.24official
2gpt-6-luna10.78official
3claude-opus-4.511.59official
4muse-spark-1.112.4official
5claude-3.5-sonnet12.96official
6claude-opus-5.513.18official
7gpt-6-sol13.46official
8claude-fable-5.113.72official
9gpt-5.4-pro14.84official
10claude-sonnet-4.514.88official
11gpt-5-pro15.2official
12claude-opus-4.115.47official
13o316.01official
14gpt-5.516.28official
15claude-opus-4.616.76official
16claude-opus-516.84official
17gpt-5-mini17official
18gpt-517.04official
19gpt-5.217.5official
20gpt-oss-20b17.62official
21claude-opus-4.818.19official
22o119.38official
23gpt-5.6-sol20.14official
24muse-spark20.22official
25llama-3.1-405b-instruct20.61official
26claude-sonnet-421.21official
27o4-mini21.49official
28qwen3.8-max21.6official
29inkling24.99official
30claude-opus-426.19official
31nemotron-3-ultra-550b-a55b26.35official
32kimi-k326.95official
33gpt-5.128.04official
34glm-5.328.23official
35gemini-3.1-pro-preview29.76official
36o3-mini30.05official
37claude-3.5-haiku30.41official
38claude-3.7-sonnet38.01official
39llama-4-maverick40.09official
40kimi-k2.541.09official
41gemini-3-pro-preview41.69official
42llama-3.1-70b-instruct44.18official
43llama-3.3-70b-instruct44.79official
44gpt-4o47.18official
45gpt-4o-mini48.07official
46gemini-1.5-flash50.61official
47gemini-3.1-flash-lite51.05official
48gpt-4.153.02official
49gemini-1.5-pro53.86official
50gemini-2.5-pro-exp54.89official
51kimi-k255.47official
52mixtral-8x22b-instruct56.06official
53qwen2.5-72b-instruct56.43official
54gpt-4.1-mini59.19official
55glm-4.559.58official
56deepseek-v3.160.55official
57qwen3-235b-a22b61.39official
58gemini-2.5-pro61.68official
59glm-4.5-air63.18official
60deepseek-r174.39official

over_refusal_score

Measures whether the model refuses benign requests included to test excessive caution.

RankModelValueRelative performanceProvenance
1deepseek-r10.49official
2qwen3-235b-a22b0.98official
3llama-3.1-70b-instruct1.09official
4glm-4.5-air1.17official
5qwen2.5-72b-instruct1.19official
6gemini-2.5-pro-exp1.38official
6gpt-4.1-mini1.38official
8gemini-2.5-pro1.58official
9gpt-4o1.68official
10deepseek-v3.11.76official
11gemini-3-pro-preview2.15official
11gemini-3.1-flash-lite2.15official
13llama-3.3-70b-instruct2.18official
14claude-opus-42.205official
15gpt-4o-mini2.27official
16glm-4.52.54official
17mixtral-8x22b-instruct2.77official
18gpt-4.12.87official
19gemini-3.1-pro-preview3.13official
20gemini-1.5-pro3.17official
20glm-5.33.17official
22kimi-k33.315official
23kimi-k23.33official
24kimi-k2.53.72official
25gpt-6-sol4.06official
26claude-opus-4.14.065official
27claude-3.7-sonnet4.45official
27gemini-1.5-flash4.45official
29llama-4-maverick4.95official
30o15.05official
31o4-mini5.14official
32claude-sonnet-45.14official
33claude-opus-4.55.145official
34claude-sonnet-4.55.25official
35gpt-5.6-sol5.34official
36o3-mini5.65official
37gpt-5.15.78official
38llama-3.1-405b-instruct6.03official
39muse-spark-1.16.92official
40claude-opus-4.87.42official
40inkling7.42official
40o37.42official
43gpt-6-luna7.62official
44claude-opus-57.91official
45gpt-5.4-pro9.41official
46claude-opus-5.59.5official
47claude-opus-4.69.59official
48gpt-5.59.79official
49gpt-511.2official
50gpt-5.211.76official
51gpt-oss-20b11.94official
52gpt-5-pro12.43official
53qwen3.8-max12.76official
54claude-3.5-haiku13.16official
55nemotron-3-ultra-550b-a55b13.25official
56gpt-5-mini14.17official
57claude-fable-5.116.91official
58gpt-oss-120b18official
59claude-3.5-sonnet21.07official