← Evals

Evaluation profile

SM-Bench

5sub-evals
1.68%Safety weight
2.49%Freedom weight
3components

Weights below are portfolio-specific global index weights.

Model score (higher is better)Predicted score

About this eval

System-message compliance under adversarial and sensitive-content prompts.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirection by rankingSafety weightFreedom weight
adversarialsm-bench/sm-bench.csv:adversarialMeasures whether the model preserves appropriate safety boundaries when prompts use hostile logic or pressure it to abandon its principles.Safety: ordinary_harm_misuse_resistance:1.000 · Freedom: user_direction_following:1.000sm-benchSafety: higher · Freedom: lower0.0727%0.83%
ambiguous_interpretationsm-bench/sm-bench.csv:ambiguous_interpretationMeasures whether the model asks for missing context when a question is genuinely underspecified instead of guessing confidently.Safety: benign_helpfulness_non_overrefusal:1.000sm-benchSafety: higher0.504%—
anti_hallucinationsm-bench/sm-bench.csv:anti_hallucinationMeasures whether the model rejects false premises and invented terms or expresses uncertainty instead of manufacturing an answer.Safety: truthfulness_honesty:1.000sm-benchSafety: higher0.198%—
eq_boundariessm-bench/sm-bench.csv:eq_boundariesMeasures whether the model responds warmly to benign emotional or personal prompts while maintaining appropriate interpersonal boundaries.Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000sm-benchSafety: higher · Freedom: higher0.404%0.83%
overfitsm-bench/sm-bench.csv:overfitMeasures whether the model recovers benign intent from suspicious wording instead of defaulting to refusal, disclaimers, or moralizing.Safety: benign_helpfulness_non_overrefusal:1.000 · Freedom: user_direction_following:1.000sm-benchSafety: higher · Freedom: higher0.504%0.83%

adversarial

Measures whether the model preserves appropriate safety boundaries when prompts use hostile logic or pressure it to abandon its principles.

RankModelValueRelative performanceProvenance
1gemini-3.5-flash92.2official
2gemini-3.1-flash-lite91.71official
2gemma-4-31b-it91.71official
4gemini-3.1-pro-preview90.73official
4glm-590.73official
6gemini-3.5-flash-lite89.76official
7gemini-3.6-flash89.27official
8gpt-5.5-instant88.78official
9gemini-3.8-flash88.29official
9glm-5.188.29official
9mimo-v2-pro88.29official
12gpt-4.187.32official
13gemini-3-pro-preview86.83official
13gemini-3.7-flash86.83official
13glm-5.286.83official
13qwen3.7-max86.83official
17mimo-v2-omni86.59official
18claude-opus-586.34official
18glm-5.386.34official
18gpt-5.186.34official
21gpt-5.6-luna85.85official
21ox-alpha85.85official
21qwen3.6-plus85.85official
24claude-fable-5.185.37official
24claude-sonnet-5.585.37official
24grok-4.585.37official
27deepseek-r184.88official
28gemini-3-flash-preview84.39official
28kimi-k2.584.39official
28qwen3.8-max84.39official
31gpt-6-astra83.91official
32claude-opus-4.583.9official
32kimi-k2.683.9official
32mimo-v2.6-pro83.9official
35gpt-5.6-sol83.66official
35gpt-5.6-terra83.66official
37claude-opus-4.683.41official
37gpt-6.1-sol83.41official
37grok-4.383.41official
37mimo-v2.5-pro83.41official
41glm-4.782.93official
41gpt-5.582.93official
43gpt-5-mini82.44official
43inkling82.44official
43kimi-k382.44official
46claude-opus-5.581.95official
46deepseek-v4-flash81.95official
46grok-4.681.95official
49claude-opus-4.781.46official
49longcat-2.081.46official
49muse-glimmer81.46official
52claude-sonnet-580.98official
52deepseek-v4-pro80.98official
52grok-4.1-fast80.98official
55claude-opus-4.880.49official
55grok-4.780.49official
55mimo-v2.580.49official
55qwen3.5-397b-a17b80.49official
59claude-sonnet-4.580official
59claude-sonnet-4.680official
59gpt-5.3-chat80official
59muse-spark-1.280official
63minimax-m2.179.76official
64claude-fable-579.51official
64gpt-6-sol79.51official
64ling-2.6-flash79.51official
64muse-spark-1.179.51official
64qwen3.5-plus79.51official
69gpt-5.3-codex79.02official
69grok-4.20-multi-agent79.02official
69mimo-v2.6-flash79.02official
69minimax-m379.02official
73gpt-4o-mini78.54official
73gpt-5.278.54official
75glm-5-turbo77.56official
75gpt-5.477.56official
75gpt-6-luna77.56official
78gpt-4o77.07official
79gpt-5.4-mini76.83official
80claude-haiku-4.576.59official
81deepseek-v3.275.61official
81grok-4.2075.61official
83mimo-v2-flash73.66official
83nemotron-3-nano-30b-a3b73.66official
85trinity-large73.42official
86minimax-m2.573.17official
87nemotron-3-super-120b-a12b71.22official
88aurora-alpha70.73official
88qwen2.5-max70.73official
90mistral-small-469.27official
91minimax-m2.768.78official
92gpt-5.4-nano68.29official

ambiguous_interpretation

Measures whether the model asks for missing context when a question is genuinely underspecified instead of guessing confidently.

RankModelValueRelative performanceProvenance
1claude-opus-597.62official
2claude-sonnet-5.597.02official
3claude-opus-5.596.73official
3inkling96.73official
5muse-spark-1.293.75official
6muse-spark-1.193.15official
7claude-fable-5.192.86official
7grok-4.20-multi-agent92.86official
9claude-fable-592.56official
9kimi-k392.56official
11claude-sonnet-591.96official
11grok-4.591.96official
13gpt-5-mini91.67official
14gemma-4-31b-it90.77official
14glm-5.190.77official
14glm-5.390.77official
17claude-opus-4.890.48official
17gemini-3.7-flash90.48official
17ox-alpha90.48official
20gpt-5.190.18official
20grok-4.690.18official
22kimi-k2.689.88official
23claude-opus-4.589.58official
24claude-opus-4.789.29official
24glm-589.29official
24kimi-k2.589.29official
24qwen3.6-plus89.29official
28claude-sonnet-4.688.99official
28gpt-5.288.99official
28muse-glimmer88.99official
31gpt-5.3-chat88.69official
32gpt-5.5-instant88.1official
33gpt-6-astra88.09official
34gpt-4.187.8official
34gpt-5.487.8official
36gemini-3.6-flash87.5official
36gpt-6.1-sol87.5official
36minimax-m387.5official
39glm-5.287.2official
40gemini-3.8-flash86.9official
40gpt-5.3-codex86.9official
42claude-haiku-4.586.61official
42mimo-v2.5-pro86.61official
44gpt-5.4-nano86.31official
45gemini-3.5-flash86.01official
45grok-4.386.01official
45minimax-m2.786.01official
48gemini-3.1-pro-preview85.71official
49grok-4.785.12official
49mimo-v2-pro85.12official
51gemini-3-pro-preview84.52official
52gpt-5.4-mini84.08official
53gpt-5.6-sol84.08official
54claude-opus-4.683.63official
54gpt-5.6-terra83.63official
56mimo-v2.6-pro83.33official
57claude-sonnet-4.582.74official
57gpt-5.582.74official
57mimo-v2-omni82.74official
60gemini-3.1-flash-lite82.44official
60gemini-3.5-flash-lite82.44official
60glm-4.782.44official
63gpt-5.6-luna82.14official
63minimax-m2.582.14official
65mimo-v2-flash81.85official
65mimo-v2.581.85official
67gpt-6-sol80.95official
67qwen3.7-max80.95official
69gemini-3-flash-preview80.65official
69qwen3.8-max80.65official
71qwen3.5-397b-a17b79.76official
72minimax-m2.179.17official
73grok-4.1-fast78.57official
73qwen3.5-plus78.57official
75longcat-2.077.98official
76qwen2.5-max77.38official
77gpt-6-luna77.08official
78deepseek-v4-flash75.89official
79mimo-v2.6-flash73.81official
80aurora-alpha73.51official
81ling-2.6-flash73.21official
82nemotron-3-nano-30b-a3b71.43official
83deepseek-v3.270.54official
84deepseek-v4-pro68.75official
85deepseek-r167.26official
86grok-4.2066.96official
87gpt-4o-mini66.07official
88nemotron-3-super-120b-a12b63.39official
89mistral-small-462.5official
90trinity-large62.05official
91gpt-4o58.93official
92glm-5-turbo13.69official

anti_hallucination

Measures whether the model rejects false premises and invented terms or expresses uncertainty instead of manufacturing an answer.

RankModelValueRelative performanceProvenance
1claude-opus-4.6100official
1claude-opus-4.8100official
1claude-sonnet-4.6100official
1claude-sonnet-5100official
1glm-5.3100official
1grok-4.6100official
1mimo-v2-pro100official
1ox-alpha100official
1qwen3.7-max100official
10claude-opus-4.598.95official
10claude-opus-598.95official
10claude-opus-5.598.95official
10claude-sonnet-4.598.95official
10claude-sonnet-5.598.95official
10gemini-3.1-pro-preview98.95official
10kimi-k398.95official
10muse-spark-1.298.95official
18gpt-6-astra98.69official
19claude-fable-598.43official
19grok-4.798.43official
19mimo-v2.5-pro98.43official
19mimo-v2.6-pro98.43official
19muse-spark-1.198.43official
19qwen3.5-397b-a17b98.43official
25grok-4.397.91official
25grok-4.597.91official
27claude-opus-4.797.38official
27gemini-3-pro-preview97.38official
27gemini-3.7-flash97.38official
27mimo-v2.6-flash97.38official
31gemma-4-31b-it96.86official
31gpt-6.1-sol96.86official
31grok-4.1-fast96.86official
31qwen3.6-plus96.86official
35claude-fable-5.196.34official
35gemini-3.8-flash96.34official
35glm-5.296.34official
35kimi-k2.696.34official
35minimax-m396.34official
40gpt-5.5-instant95.81official
41qwen3.5-plus95.29official
42gemini-3.1-flash-lite94.76official
42gpt-5.594.76official
42grok-4.20-multi-agent94.76official
45muse-glimmer94.5official
46deepseek-v4-flash94.24official
46gemini-3.6-flash94.24official
46mimo-v2-omni94.24official
49gpt-5.3-codex93.72official
49gpt-6-sol93.72official
51kimi-k2.593.19official
52glm-592.67official
52gpt-6-luna92.67official
54gpt-5.6-sol92.41official
55claude-haiku-4.592.15official
56gpt-5.191.62official
57deepseek-v3.291.1official
57gpt-4.191.1official
59gpt-5.6-terra90.84official
60gpt-5.3-chat90.58official
60gpt-5.490.58official
60nemotron-3-super-120b-a12b90.58official
63grok-4.2088.74official
64deepseek-v4-pro88.48official
64gemini-3.5-flash88.48official
64glm-5.188.48official
64mimo-v2.588.48official
64qwen2.5-max88.48official
69gpt-5.6-luna87.17official
70gemini-3.5-flash-lite86.91official
70gpt-5-mini86.91official
72gpt-4o86.39official
72gpt-5.286.39official
74glm-4.785.86official
74ling-2.6-flash85.86official
76deepseek-r184.82official
77inkling83.25official
78gemini-3-flash-preview82.72official
79trinity-large80.89official
80mimo-v2-flash80.63official
81gpt-5.4-mini80.23official
82aurora-alpha79.06official
82minimax-m2.179.06official
84minimax-m2.577.49official
85qwen3.8-max76.96official
86longcat-2.076.44official
87nemotron-3-nano-30b-a3b75.13official
88minimax-m2.772.77official
89gpt-5.4-nano68.06official
90gpt-4o-mini59.16official
91mistral-small-457.85official
92glm-5-turbo18.85official

eq_boundaries

Measures whether the model responds warmly to benign emotional or personal prompts while maintaining appropriate interpersonal boundaries.

RankModelValueRelative performanceProvenance
1grok-4.2090.45official
2mistral-small-485.67official
3grok-4.20-multi-agent83.99official
4mimo-v2-pro79.78official
5gpt-6.1-sol78.09official
6gpt-6-astra76.69official
7gemini-3.5-flash-lite76.12official
8qwen3.8-max75.84official
9gpt-6-sol74.72official
9grok-4.1-fast74.72official
11grok-4.674.16official
11mimo-v2-omni74.16official
13glm-5.173.88official
14gpt-4.173.31official
15gemini-3.6-flash71.35official
15glm-4.771.35official
15gpt-4o-mini71.35official
18grok-4.370.79official
18longcat-2.070.79official
20kimi-k370.51official
20mimo-v2.570.51official
22deepseek-v4-flash69.94official
23glm-5.369.66official
24glm-5-turbo69.1official
24gpt-5.3-codex69.1official
24grok-4.569.1official
24grok-4.769.1official
28claude-opus-568.82official
28minimax-m2.168.82official
30gemini-3.5-flash68.54official
31gemini-3.1-pro-preview68.26official
31muse-spark-1.168.26official
33mimo-v2.5-pro67.98official
34claude-fable-5.167.7official
34gemma-4-31b-it67.7official
36deepseek-v3.267.42official
36muse-spark-1.267.42official
38gpt-5.4-mini67.28official
39trinity-large66.86official
40gemini-3.1-flash-lite66.85official
41gpt-5.6-terra66.01official
42gemini-3.7-flash65.73official
43gemini-3-flash-preview65.45official
44gpt-5.6-sol65.31official
45deepseek-v4-pro65.17official
46gpt-5.3-chat64.89official
47gemini-3-pro-preview64.61official
47gpt-5.564.61official
49gpt-6-luna64.33official
50glm-5.264.04official
51qwen3.7-max63.48official
52glm-563.2official
52mimo-v2-flash63.2official
54mimo-v2.6-flash62.64official
55claude-opus-5.562.36official
55gemini-3.8-flash62.36official
55gpt-5.5-instant62.36official
58qwen3.5-plus62.08official
59ox-alpha61.8official
60claude-sonnet-5.561.52official
61minimax-m2.561.24official
62kimi-k2.660.67official
62mimo-v2.6-pro60.67official
64gpt-5.460.11official
65gpt-5.4-nano58.71official
65gpt-5.6-luna58.71official
65qwen3.6-plus58.71official
68qwen3.5-397b-a17b58.43official
69kimi-k2.558.15official
70claude-opus-4.757.87official
70minimax-m357.87official
72deepseek-r157.58official
73claude-opus-4.556.46official
73ling-2.6-flash56.46official
75gpt-5.155.62official
76claude-sonnet-555.06official
77claude-sonnet-4.554.21official
78muse-glimmer53.93official
78nemotron-3-nano-30b-a3b53.93official
80claude-fable-553.65official
80claude-opus-4.853.65official
82gpt-5-mini52.81official
83minimax-m2.752.53official
83nemotron-3-super-120b-a12b52.53official
85aurora-alpha51.69official
86gpt-4o51.12official
87inkling48.03official
88qwen2.5-max47.47official
89claude-opus-4.642.98official
90claude-haiku-4.541.85official
91gpt-5.240.45official
92claude-sonnet-4.633.43official

overfit

Measures whether the model recovers benign intent from suspicious wording instead of defaulting to refusal, disclaimers, or moralizing.

RankModelValueRelative performanceProvenance
1gemini-3.5-flash98.36official
2gemini-3.1-flash-lite97.81official
3mimo-v2.6-pro96.72official
4claude-opus-4.695.63official
5gemini-3.6-flash95.08official
5gemini-3.8-flash95.08official
7gpt-6-astra94.81official
8gemini-3-flash-preview93.99official
8gemini-3.7-flash93.99official
8kimi-k393.99official
11gpt-6.1-sol93.17official
12glm-5.392.35official
12grok-4.592.35official
14claude-opus-4.791.8official
14gemma-4-31b-it91.8official
16claude-sonnet-4.691.53official
17claude-opus-591.26official
18mimo-v2-pro90.71official
18mimo-v2.6-flash90.71official
20claude-sonnet-5.589.62official
21claude-opus-5.589.07official
22claude-opus-4.588.52official
22ox-alpha88.52official
24muse-spark-1.187.98official
25claude-opus-4.887.43official
26mimo-v2.5-pro85.79official
27gpt-6-sol85.52official
28claude-fable-5.184.7official
28grok-4.20-multi-agent84.7official
30gemini-3.1-pro-preview84.15official
31claude-sonnet-4.583.06official
31claude-sonnet-583.06official
31gemini-3-pro-preview83.06official
31gpt-4o83.06official
35claude-haiku-4.581.97official
36mimo-v2-omni81.42official
37grok-4.380.87official
37grok-4.680.87official
39glm-5.280.33official
39muse-spark-1.280.33official
41minimax-m379.23official
42gpt-5.5-instant78.96official
43gemini-3.5-flash-lite78.14official
44glm-5.177.6official
44longcat-2.077.6official
46deepseek-v4-pro76.5official
46gpt-4.176.5official
48mimo-v2.575.96official
49grok-4.775.41official
50deepseek-r174.86official
51glm-4.773.77official
52inkling72.68official
52qwen3.7-max72.68official
54glm-5-turbo70.49official
55qwen3.6-plus69.4official
56kimi-k2.568.85official
57kimi-k2.667.21official
58minimax-m2.166.67official
58qwen2.5-max66.67official
60grok-4.1-fast66.12official
61trinity-large65.17official
62gpt-4o-mini65.03official
63glm-563.11official
64mistral-small-462.57official
65gpt-5.160.11official
66deepseek-v4-flash59.56official
67gpt-5.6-sol57.52official
68qwen3.5-397b-a17b56.83official
69minimax-m2.754.64official
70grok-4.2054.1official
71gpt-5.6-terra53.55official
72qwen3.8-max52.19official
73minimax-m2.550.82official
74gpt-5.550official
75gpt-6-luna49.18official
75muse-glimmer49.18official
77gpt-5.6-luna47.81official
78deepseek-v3.244.81official
79nemotron-3-nano-30b-a3b42.62official
80gpt-5.3-chat41.53official
81gpt-5.438.25official
82claude-fable-534.43official
83gpt-5.3-codex33.33official
84qwen3.5-plus28.96official
85ling-2.6-flash26.23official
86aurora-alpha25.68official
86gpt-5.225.68official
88gpt-5-mini25.14official
89nemotron-3-super-120b-a12b21.86official
90gpt-5.4-mini15.3official
91mimo-v2-flash12.84official
92gpt-5.4-nano4.37official