← Evals

Evaluation profile

CAIS Risk Index

7sub-evals
6.35%total index weight
4components

Within-component eval weight: Responsible agency 15.4% · Misuse resistance 4.43% · Truthfulness 14.9% · Fairness 13.5%.

Model score (lower is better)Predicted score

About this eval

Frontier-model risk across prompt injection, biological-weapons assistance, political manipulation, overconfidence, deception, and harmful propensities.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
agent_red_teamingaisafetyindex/cais-risk-index.csv:agent_red_teamingMeasures whether an agent resists prompt injections and adversarial instructions while using tools.responsible_agency_control:1.000cais-agent-red-teamingLower is better1.29%Responsible agency 8.61%
bioweapons_assistanceaisafetyindex/cais-risk-index.csv:bioweapons_assistanceMeasures whether the model avoids providing assistance that could enable the development or use of biological weapons.ordinary_harm_misuse_resistance:1.000cais-bioweapons-assistanceLower is better0.443%Misuse resistance 4.43%
hle_overconfidenceaisafetyindex/cais-risk-index.csv:hle_overconfidenceMeasures whether the model avoids expressing unjustified confidence when answering exceptionally difficult factual questions.truthfulness_honesty:1.000cais-hle-overconfidenceLower is better0.752%Truthfulness 5.02%
machiavelliaisafetyindex/cais-risk-index.csv:machiavelliMeasures whether the model avoids deceptive and power-seeking actions while pursuing goals in interactive text games.truthfulness_honesty:1.000machiavelliLower is better0.721%Truthfulness 4.81%
maskaisafetyindex/cais-risk-index.csv:maskMeasures whether the model avoids lying when deception would help it satisfy an instructed goal.truthfulness_honesty:1.000maskLower is better0.768%Truthfulness 5.12%
political_manipulationaisafetyindex/cais-risk-index.csv:political_manipulationMeasures whether the model avoids generating targeted content intended to manipulate political beliefs or behavior.fairness_nondiscrimination:1.000cais-political-manipulationLower is better1.35%Fairness 13.5%
textquests_harmaisafetyindex/cais-risk-index.csv:textquests_harmMeasures whether the model avoids harmful actions while pursuing goals in interactive text-based environments.responsible_agency_control:1.000cais-textquests-harmLower is better1.02%Responsible agency 6.82%

agent_red_teaming

Measures whether an agent resists prompt injections and adversarial instructions while using tools.

RankModelValueRelative performanceProvenance
1claude-fable-539.4official
2gpt-5.6-sol40.3official
3gpt-5.541.5official
4claude-opus-4.542.5official
5claude-opus-4.744.5official
6muse-spark-1.144.8official
7gemini-3.1-flash-lite45.4official
8claude-opus-4.847official
9gemini-3-pro-preview47.5official
10claude-opus-4.649.5official
11gpt-5.6-terra54.6official
12claude-sonnet-4.654.8official
13gpt-5.459.7official
14gpt-5.6-luna64.2official
15claude-sonnet-4.564.6official
16gemini-3.1-pro-preview68official
17gpt-5.268.8official
18claude-haiku-4.569.7official
19glm-5.271official
20gemini-3.5-flash72.3official
21gpt-5.4-mini74.3official
22glm-5.175.8official
23kimi-k376.6official
24gpt-5.4-nano81.7official
25gpt-5.182.1official
26grok-4.583.5official
27gpt-5-mini84.3official
28grok-4.2084.6official
29grok-485.9official
30claude-sonnet-486.6official
31gpt-5-nano88.5official
32grok-4.390.1official
33grok-4.1-fast90.2official
34gpt-4o90.7official
34kimi-k2.690.7official
36deepseek-r190.9official
36kimi-k2.590.9official
38gemini-2.5-pro91.4official
39gemini-2.5-flash91.9official
40kimi-k292.8official
41gemini-3-flash-preview92.9official
42deepseek-v3.293official
43gemini-2.5-flash-lite96.8official

bioweapons_assistance

Measures whether the model avoids providing assistance that could enable the development or use of biological weapons.

RankModelValueRelative performanceProvenance
1claude-fable-50official
2claude-sonnet-4.512official
3claude-opus-4.719.2official
4muse-spark-1.122.3official
5claude-opus-4.826.4official
6claude-sonnet-4.631.5official
7claude-opus-4.634.8official
8claude-opus-4.535.3official
9o347.7official
10grok-4.2056.9official
11gpt-5.457.1official
12gpt-5.4-mini60official
13grok-4.360.1official
14gpt-5.560.5official
15gpt-562.6official
16gpt-5.262.9official
17glm-5.263.8official
17grok-4.1-fast63.8official
19grok-4-fast64.1official
20grok-464.2official
21gpt-5.6-sol64.3official
22gpt-5.6-terra66.2official
23gpt-5.166.3official
24o4-mini67.6official
25o168.1official
26gpt-5.6-luna68.8official
27gpt-5-nano71.3official
28gemini-3.1-pro-preview73.5official
29gemini-3-flash-preview75.3official
30gpt-5-mini78.2official
31gemini-3.5-flash78.3official
31gpt-5.4-nano78.3official
33grok-4.579.2official
34claude-haiku-4.584.9official
35kimi-k387.2official
36o3-mini88.3official
37kimi-k2.688.4official
38glm-5.189official
39gemini-3.1-flash-lite89.8official
40gpt-4o92.7official
41kimi-k293official
42kimi-k2.593.2official
43deepseek-v3.294official
44gemini-2.5-pro94.1official
45deepseek-r194.4official
46gemini-2.5-flash95.9official
47gemini-2.5-flash-lite96.3official
48gemini-3-pro-preview100official

hle_overconfidence

Measures whether the model avoids expressing unjustified confidence when answering exceptionally difficult factual questions.

RankModelValueRelative performanceProvenance
1muse-spark-1.125.3official
2claude-fable-525.5official
3claude-opus-4.826.4official
4claude-opus-4.728.1official
5grok-4.530.8official
6gpt-5.440.9official
7gpt-5.541.8official
8glm-5.242official
9grok-4.342.5official
10claude-sonnet-4.643.1official
11gpt-5.243.7official
12kimi-k344.7official
13grok-4.2045.8official
14claude-opus-4.646official
15gpt-5.6-sol46.7official
16gpt-5.4-nano47.1official
17gpt-5.147.8official
18gpt-550official
19gemini-3.1-pro-preview50.3official
20gpt-5.6-terra50.7official
21gemini-3.5-flash53.5official
22gemini-3-flash-preview55.1official
23gpt-5.4-mini55.2official
24gpt-5.6-luna55.7official
25grok-456.4official
26claude-opus-4.556.9official
27gemini-3-pro-preview57.2official
28kimi-k2.658.2official
29glm-5.158.5official
30deepseek-v3.258.8official
31claude-haiku-4.560.5official
32claude-sonnet-4.564.1official
33gpt-5-mini65official
34kimi-k267.8official
35grok-4-fast68.7official
36gemini-2.5-pro-exp71official
37gemini-2.5-pro72official
38grok-4.1-fast72.1official
39gemini-3.1-flash-lite72.8official
40deepseek-r173official
41claude-3.7-sonnet75official
41claude-sonnet-475official
43kimi-k2.575.9official
44gemini-2.5-flash80official
44gpt-5-nano80official
44o3-mini80official
47o183official
48gemini-2.5-flash-lite83.4official
49gpt-4o89official

machiavelli

Measures whether the model avoids deceptive and power-seeking actions while pursuing goals in interactive text games.

RankModelValueRelative performanceProvenance
1gpt-5-nano79.4official
2claude-fable-580.2official
3gpt-5.6-terra80.4official
4claude-opus-4.580.8official
5grok-4.1-fast81.3official
6claude-haiku-4.581.5official
7claude-sonnet-4.581.6official
8gpt-5.581.7official
9gpt-5.6-sol82.7official
10claude-opus-4.883.7official
11gpt-583.8official
11grok-4.2083.8official
13gpt-5-mini84.2official
13kimi-k284.2official
15claude-opus-4.684.4official
16grok-4.384.7official
17claude-sonnet-4.684.9official
18deepseek-r185.1official
19claude-opus-4.785.7official
20gpt-5.286.5official
21glm-5.186.7official
22gpt-5.6-luna87.9official
23muse-spark-1.188.2official
24gpt-5.4-nano88.5official
25gemini-3.1-pro-preview89.2official
26gemini-2.5-flash89.4official
27deepseek-v3.289.6official
27gpt-5.189.6official
29grok-4.590.9official
30kimi-k2.692.1official
31gemini-3.5-flash92.3official
31glm-5.292.3official
33kimi-k392.6official
34gpt-5.492.9official
35grok-493.4official
36kimi-k2.593.5official
37gemini-2.5-pro95.3official
37gemini-3-flash-preview95.3official
39gpt-5.4-mini95.6official
40gemini-3.1-flash-lite95.8official
41grok-4-fast96.2official
42gpt-4o99.6official
43gemini-3-pro-preview99.8official
44o3-mini105official
45gemini-2.5-flash-lite109.4official

mask

Measures whether the model avoids lying when deception would help it satisfy an instructed goal.

RankModelValueRelative performanceProvenance
1muse-spark-1.13.8official
2claude-sonnet-4.53.9official
3claude-haiku-4.54.6official
3gpt-5.6-sol4.6official
5claude-opus-4.55.9official
6gpt-5.6-terra6.7official
7claude-fable-57.2official
8gpt-5.6-luna7.3official
9claude-opus-4.88.1official
10kimi-k39.4official
11gpt-5.49.7official
12gpt-5.59.9official
13claude-sonnet-410.7official
14claude-sonnet-4.611.7official
15gpt-5.112official
16gpt-5-nano12.3official
17claude-opus-4.612.7official
18gpt-5.212.9official
19o315.5official
20glm-5.115.8official
21gpt-5.4-mini15.9official
22claude-3.7-sonnet16.9official
23claude-opus-4.717.1official
24kimi-k2.518.5official
25gpt-520.7official
26o4-mini21.4official
27gpt-5-mini21.7official
28kimi-k2.623.2official
29gpt-5.4-nano23.7official
30glm-5.225.8official
31grok-4.527.9official
32kimi-k230.7official
33o140.7official
34grok-4.2041official
35grok-441.7official
36deepseek-r142.7official
37gemini-2.5-pro44.3official
38gemini-2.5-pro-exp46.9official
39grok-4.348.3official
40gemini-2.5-flash50.9official
41o3-mini51.1official
42deepseek-v3.253official
43gemini-3.1-pro-preview53.8official
44gemini-2.5-flash-lite54official
45gemini-3.1-flash-lite55.8official
46gemini-3.5-flash57.4official
47gemini-3-pro-preview58official
48gemini-3-flash-preview61.7official
49grok-4-fast70official
50grok-4.1-fast71official
51gpt-4o78official

political_manipulation

Measures whether the model avoids generating targeted content intended to manipulate political beliefs or behavior.

RankModelValueRelative performanceProvenance
1muse-spark-1.127.9official
2grok-4-fast30.8official
3grok-4.1-fast32.5official
4gpt-535.3official
5gemini-2.5-pro37.3official
6gpt-5.539official
6o339official
8claude-fable-539.8official
9grok-4.2039.9official
10gpt-5.6-sol41.7official
11gemini-3.1-pro-preview43.3official
12kimi-k2.643.6official
13gpt-5.6-luna44.7official
14gpt-5.6-terra46.2official
15gpt-5.147.9official
16claude-opus-4.748.2official
17claude-opus-4.549.4official
18grok-449.5official
19glm-5.250official
20grok-4.550.2official
21grok-4.351.6official
22claude-opus-4.651.7official
23gemini-3.1-flash-lite51.9official
24kimi-k352.4official
25gemini-3.5-flash53.4official
26claude-opus-4.853.8official
27gpt-5.257official
28gpt-5.459.4official
29gpt-4o59.6official
30gpt-5.4-mini61.1official
31claude-haiku-4.562.2official
32gpt-5.4-nano63.3official

textquests_harm

Measures whether the model avoids harmful actions while pursuing goals in interactive text-based environments.

RankModelValueRelative performanceProvenance
1gpt-5-nano2official
2grok-4.33.9official
3grok-4.1-fast9.1official
4grok-4.209.9official
5gpt-4o11.2official
5grok-4.511.2official
7gemini-2.5-flash11.7official
8o3-mini13.4official
9kimi-k214.6official
10gpt-5.4-nano15.2official
10muse-spark-1.115.2official
12deepseek-r115.4official
12gpt-5.4-mini15.4official
14gemini-3.1-flash-lite15.6official
15gemini-2.5-pro15.9official
16claude-sonnet-416official
17claude-sonnet-4.616.5official
18claude-haiku-4.516.6official
19gpt-5.116.7official
20kimi-k317official
21claude-sonnet-4.517.1official
22gpt-517.2official
23gpt-5-mini17.5official
24gemini-3-flash-preview17.8official
25glm-5.218.1official
26o4-mini18.6official
27o318.7official
28gemini-3.1-pro-preview18.8official
29grok-4-fast19.8official
30claude-opus-4.520.3official
31kimi-k2.620.4official
32gpt-5.220.5official
33gemini-3.5-flash20.7official
34kimi-k2.520.8official
35claude-opus-4.821official
36gemini-3-pro-preview21.4official
36gpt-5.521.4official
38deepseek-v3.221.6official
39claude-opus-4.721.8official
40glm-5.122official
41gpt-5.6-terra22.2official
42gemini-2.5-flash-lite22.8official
43claude-opus-4.623.2official
44claude-fable-523.7official
45gpt-5.6-luna23.8official
46grok-424.3official
47gpt-5.424.5official
48gpt-5.6-sol31.4official