← Evals

Evaluation profile

DystopiaBench

6sub-evals
2.65%total index weight
2components

Within-component eval weight: Human rights 16.6% · Truthfulness 1.01%.

Model score (lower is better)Predicted score

About this eval

Dystopian or harmful model behavior in stateful scenario prompts.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
basaglia_scoredystopiabench/model-module-averages.csv:basaglia_scoreMeasures whether the model endorses coercive or authoritarian actions in scenarios about therapeutic coercion, institutional paternalism, and behavioral compliance.human_rights_systemic_harm:1.000dystopiabench/model-module-averages.csvLower is better0.555%Human rights 3.7%
baudrillard_scoredystopiabench/model-module-averages.csv:baudrillard_scoreMeasures whether the model endorses coercive or authoritarian actions in scenarios about synthetic intimacy, persuasion, and exploitation.human_rights_systemic_harm:0.333|truthfulness_honesty:0.667dystopiabench/model-module-averages.csvLower is better0.194%Human rights 0.616% · Truthfulness 0.676%
huxley_scoredystopiabench/model-module-averages.csv:huxley_scoreMeasures whether the model endorses coercive or authoritarian actions in scenarios about biological stratification, behavioral conditioning, and pleasure-based pacification.human_rights_systemic_harm:1.000dystopiabench/model-module-averages.csvLower is better0.555%Human rights 3.7%
laguardia_scoredystopiabench/model-module-averages.csv:laguardia_scoreMeasures whether the model endorses coercive or authoritarian actions in scenarios about infrastructure capture, administrative coercion, and institutional capture.human_rights_systemic_harm:1.000dystopiabench/model-module-averages.csvLower is better0.555%Human rights 3.7%
orwell_scoredystopiabench/model-module-averages.csv:orwell_scoreMeasures whether the model endorses coercive or authoritarian actions in scenarios about surveillance, population control, and truth manipulation.human_rights_systemic_harm:0.667|truthfulness_honesty:0.333dystopiabench/model-module-averages.csvLower is better0.236%Human rights 1.23% · Truthfulness 0.337%
petrov_scoredystopiabench/model-module-averages.csv:petrov_scoreMeasures whether the model endorses coercive or authoritarian actions in scenarios about safety overrides, autonomous weapons, and emergency authority.human_rights_systemic_harm:1.000dystopiabench/model-module-averages.csvLower is better0.555%Human rights 3.7%

basaglia_score

Measures whether the model endorses coercive or authoritarian actions in scenarios about therapeutic coercion, institutional paternalism, and behavioral compliance.

RankModelValueRelative performanceProvenance
1claude-opus-4.818.7official
2claude-sonnet-4.624.2official
3claude-haiku-4.525.3official
4claude-opus-4.726.03official
5claude-opus-4.626.77official
6glm-5.128.23official
7mimo-v2.530.8official
8mimo-v2.5-pro33.37official
9glm-534.47official
10minimax-m337.07official
11minimax-m2.544.73official
12minimax-m2.746.93official
13gpt-5.447.3official
14gpt-5.4-mini49.13official
15nemotron-3-ultra-550b-a55b52.9official
16kimi-k2.7-code54.3official
17gpt-5.555official
18gemini-3.1-pro55.37official
19qwen3.556.9official
20kimi-k2.559.1official
21gpt-5.3-codex59.4official
22grok-4.20-multi-agent60.2official
23deepseek-v4-flash60.9official
24kimi-k2.662.57official
25seed-2.0-lite63.87official
26deepseek-v4-pro64.6official
27llama-4-maverick64.93official
28grok-465.3official
29nemotron-3-super-120b-a12b65.33official
30grok-4.365.37official
31gpt-oss-120b65.67official
32grok-build-0.165.8official
33seed-2.0-mini66.83official
34llama-4-scout67.87official
35mistral-small-468.57official
36gpt-oss-safeguard-20b68.63official
36qwen3.6-max-preview68.63official
38qwen3.6-plus69official
39deepseek-v3.269.37official
40gemini-3.1-flash-lite69.4official
41mistral-large-369.8official
42gpt-oss-20b70.13official
43qwen3.7-plus70.23official
44grok-4.2070.5official
45gemini-3.5-flash70.93official
46trinity-large71.4official
47gemini-3-flash-preview73.2official
48qwen3.7-max75.47official
49hy3-preview77.33official
50mistral-medium-3.577.7official

baudrillard_score

Measures whether the model endorses coercive or authoritarian actions in scenarios about synthetic intimacy, persuasion, and exploitation.

RankModelValueRelative performanceProvenance
1claude-opus-4.821.27official
2claude-haiku-4.522.73official
3glm-5.126.03official
4mimo-v2.527.13official
5claude-opus-4.727.5official
6claude-sonnet-4.627.87official
7glm-528.97official
8minimax-m2.531.17official
9minimax-m333.03official
10claude-opus-4.633.37official
11minimax-m2.734.1official
12gpt-5.438.87official
12gpt-5.4-mini38.87official
14gpt-5.540.7official
14kimi-k2.7-code40.7official
16nemotron-3-ultra-550b-a55b43.33official
17kimi-k2.544.77official
18gpt-5.3-codex45.47official
19kimi-k2.646.73official
20mimo-v2.5-pro51.07official
21grok-build-0.152.13official
22nemotron-3-super-120b-a12b53.23official
23qwen3.553.27official
24qwen3.7-plus56.33official
25grok-457.7official
26gemini-3.1-pro57.8official
27deepseek-v4-flash58.1official
28trinity-large58.53official
29grok-4.20-multi-agent61.77official
29grok-4.361.77official
31deepseek-v4-pro62.2official
32qwen3.7-max62.97official
33gpt-oss-120b64.03official
34gpt-oss-safeguard-20b64.37official
35gemini-3.1-flash-lite65.2official
36llama-4-maverick65.83official
37gpt-oss-20b66.3official
38qwen3.6-max-preview66.57official
39gemini-3.5-flash66.63official
40seed-2.0-lite67.33official
41grok-4.2067.37official
42deepseek-v3.270.33official
43seed-2.0-mini73.6official
44qwen3.6-plus73.63official
45llama-4-scout74.3official
46hy3-preview76.3official
47mistral-large-377.73official
48mistral-medium-3.579.27official
49mistral-small-480official
50gemini-3-flash-preview81.13official

huxley_score

Measures whether the model endorses coercive or authoritarian actions in scenarios about biological stratification, behavioral conditioning, and pleasure-based pacification.

RankModelValueRelative performanceProvenance
1claude-opus-4.810.63official
2claude-opus-4.615.77official
3claude-sonnet-4.617.6official
4claude-opus-4.718.33official
5glm-5.118.7official
6claude-haiku-4.519.07official
7mimo-v2.5-pro26.03official
8glm-527.5official
9minimax-m333.03official
10mimo-v2.533.8official
11gpt-5.4-mini45.1official
12minimax-m2.745.9official
13gpt-5.446.2official
14gemini-3.1-pro49.97official
15gpt-5.552.5official
16gpt-5.3-codex53.17official
17kimi-k2.7-code54official
18minimax-m2.554.33official
19qwen3.559.2official
20kimi-k2.562.6official
21kimi-k2.663.03official
22nemotron-3-ultra-550b-a55b68.2official
23nemotron-3-super-120b-a12b69.47official
24llama-4-scout70.13official
25grok-4.371.63official
26gpt-oss-safeguard-20b72official
27deepseek-v4-flash72.8official
27llama-4-maverick72.8official
29seed-2.0-mini72.93official
30grok-473.17official
31grok-4.20-multi-agent74official
32seed-2.0-lite74.33official
33gpt-oss-120b74.63official
34grok-build-0.174.77official
35deepseek-v3.275official
36grok-4.2075.07official
37gpt-oss-20b75.47official
38mistral-large-375.8official
38qwen3.6-max-preview75.8official
40mistral-small-476.17official
41deepseek-v4-pro76.97official
42qwen3.6-plus77.27official
43gemini-3.5-flash79.23official
44gemini-3.1-flash-lite80.73official
45qwen3.7-plus80.77official
46trinity-large80.8official
47gemini-3-flash-preview83official
48hy3-preview84.5official
49qwen3.7-max86.03official
50mistral-medium-3.586.8official

laguardia_score

Measures whether the model endorses coercive or authoritarian actions in scenarios about infrastructure capture, administrative coercion, and institutional capture.

RankModelValueRelative performanceProvenance
1claude-opus-4.822official
2claude-opus-4.730.07official
3claude-sonnet-4.633official
4claude-haiku-4.534.47official
5mimo-v2.5-pro37.03official
6claude-opus-4.639.23official
7mimo-v2.539.97official
8glm-540.33official
9glm-5.140.7official
10gpt-5.446.57official
11gpt-5.4-mini52.8official
12kimi-k2.653.97official
13minimax-m354.27official
14kimi-k2.7-code55.03official
15grok-459.07official
16minimax-m2.759.8official
17gpt-5.560.13official
18qwen3.560.17official
19gemini-3.1-pro61.97official
20gpt-5.3-codex62.37official
20kimi-k2.562.37official
22minimax-m2.563.47official
23grok-4.20-multi-agent65.3official
24seed-2.0-mini66.47official
25llama-4-maverick66.73official
26nemotron-3-super-120b-a12b67.17official
27qwen3.7-plus67.2official
28nemotron-3-ultra-550b-a55b67.6official
29llama-4-scout67.9official
29mistral-small-467.9official
31gpt-oss-20b68.27official
32gpt-oss-120b68.63official
33qwen3.6-plus68.67official
34qwen3.7-max68.7official
34seed-2.0-lite68.7official
36mistral-large-369official
37deepseek-v3.269.03official
37deepseek-v4-flash69.03official
39gpt-oss-safeguard-20b69.4official
39qwen3.6-max-preview69.4official
41gemini-3.1-flash-lite69.77official
42deepseek-v4-pro69.8official
42grok-4.2069.8official
44gemini-3.5-flash70.9official
45grok-4.371.3official
46gemini-3-flash-preview71.63official
47grok-build-0.173.17official
47trinity-large73.17official
49hy3-preview73.93official
50mistral-medium-3.576.57official

orwell_score

Measures whether the model endorses coercive or authoritarian actions in scenarios about surveillance, population control, and truth manipulation.

RankModelValueRelative performanceProvenance
1claude-opus-4.817.6official
2claude-haiku-4.521.63official
3claude-opus-4.722.73official
4claude-opus-4.623.47official
5claude-sonnet-4.624.57official
6mimo-v2.5-pro26.03official
7glm-5.126.77official
8glm-527.87official
9mimo-v2.530.8official
10minimax-m336official
11minimax-m2.741.07official
12gpt-5.4-mini41.8official
13gpt-5.444.4official
14minimax-m2.545.1official
15gpt-5.549.5official
16qwen3.552.87official
17kimi-k2.7-code53.67official
18nemotron-3-ultra-550b-a55b55.93official
19kimi-k2.556.97official
20gpt-5.3-codex57.3official
21gemini-3.1-pro59.17official
22kimi-k2.662.3official
23llama-4-maverick68.6official
23llama-4-scout68.6official
25grok-468.63official
25nemotron-3-super-120b-a12b68.63official
27gpt-oss-120b68.8official
28deepseek-v4-flash69.83official
29mistral-large-370.93official
30grok-4.372.07official
31gemini-3-flash-preview72.43official
32deepseek-v3.272.83official
33grok-4.20-multi-agent72.9official
34qwen3.6-max-preview73.17official
35gpt-oss-20b73.53official
35gpt-oss-safeguard-20b73.53official
35mistral-small-473.53official
38qwen3.6-plus73.9official
39gemini-3.1-flash-lite73.97official
40deepseek-v4-pro74official
41seed-2.0-mini75.03official
42grok-4.2075.07official
42seed-2.0-lite75.07official
44trinity-large75.1official
45gemini-3.5-flash75.17official
46grok-build-0.177.07official
47qwen3.7-plus80.4official
48hy3-preview82.23official
48qwen3.7-max82.23official
50mistral-medium-3.582.27official

petrov_score

Measures whether the model endorses coercive or authoritarian actions in scenarios about safety overrides, autonomous weapons, and emergency authority.

RankModelValueRelative performanceProvenance
1claude-haiku-4.519.8official
2claude-opus-4.824.2official
3claude-sonnet-4.624.93official
4claude-opus-4.726.77official
5claude-opus-4.630.07official
6glm-530.8official
7glm-5.137.4official
7gpt-5.437.4official
9gpt-5.4-mini39.6official
10mimo-v2.5-pro42.53official
11mimo-v2.544.4official
12gpt-5.549.13official
13gpt-5.3-codex50.6official
14minimax-m350.7official
15minimax-m2.756.97official
16gemini-3.1-pro61.67official
17kimi-k2.7-code66.97official
18llama-4-maverick68.63official
19minimax-m2.570.3official
20llama-4-scout70.47official
21qwen3.571.03official
22seed-2.0-mini71.07official
23grok-4.372.07official
24kimi-k2.572.53official
25seed-2.0-lite72.8official
26gemini-3.5-flash72.97official
27qwen3.6-max-preview73.17official
28gpt-oss-20b73.53official
29gpt-oss-safeguard-20b73.6official
30deepseek-v4-flash74.3official
31grok-474.37official
32grok-4.20-multi-agent74.4official
33grok-4.2075.03official
34nemotron-3-super-120b-a12b75.17official
35gpt-oss-120b76.6official
36deepseek-v4-pro77official
37grok-build-0.177.03official
38deepseek-v3.277.8official
39qwen3.6-plus78.1official
40gemini-3.1-flash-lite78.43official
41mistral-large-378.47official
42qwen3.7-max79.27official
43gemini-3-flash-preview80.33official
44mistral-small-480.37official
45trinity-large81.87official
46kimi-k2.682.73official
47qwen3.7-plus83.37official
48nemotron-3-ultra-550b-a55b86.5official
49hy3-preview88.23official
50mistral-medium-3.590.97official