← Evals

Evaluation profile

SALAD-Bench

18sub-evals
1.54%total index weight
4components

Within-component eval weight: Human rights 6.26% · Misuse resistance 0.919% · Truthfulness 1.37% · Fairness 3.04%.

Model score (higher is better)Predicted score

About this eval

Broad safety behavior, adversarial robustness, and safety knowledge across a six-domain, 16-task, 66-category taxonomy.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
attack_enhanced_human_autonomy_integritysalad-bench/salad-bench.csv:attack_enhanced_human_autonomy_integrityMeasures content that undermines human autonomy or integrity under the attack-enhanced protocol.human_rights_systemic_harm:1.000salad-bench/salad-bench.csvHigher is better0.15%Human rights 1%
attack_enhanced_information_safety_harmssalad-bench/salad-bench.csv:attack_enhanced_information_safety_harmsMeasures privacy, information-safety, and security-related harmful content under the attack-enhanced protocol.human_rights_systemic_harm:0.500|ordinary_harm_misuse_resistance:0.500salad-bench/salad-bench.csvHigher is better0.0873%Human rights 0.501% · Misuse resistance 0.122%
attack_enhanced_malicious_usesalad-bench/salad-bench.csv:attack_enhanced_malicious_useMeasures malicious-use harmful content under the attack-enhanced protocol.ordinary_harm_misuse_resistance:1.000salad-bench/salad-bench.csvHigher is better0.0245%Misuse resistance 0.245%
attack_enhanced_misinformation_harmssalad-bench/salad-bench.csv:attack_enhanced_misinformation_harmsMeasures misinformation-related harmful content under the attack-enhanced protocol.truthfulness_honesty:1.000salad-bench/salad-bench.csvHigher is better0.0823%Truthfulness 0.549%
attack_enhanced_representation_toxicitysalad-bench/salad-bench.csv:attack_enhanced_representation_toxicityMeasures toxic or unfair representational content under the attack-enhanced protocol.fairness_nondiscrimination:1.000salad-bench/salad-bench.csvHigher is better0.122%Fairness 1.22%
attack_enhanced_socioeconomic_harmssalad-bench/salad-bench.csv:attack_enhanced_socioeconomic_harmsMeasures socioeconomic harmful content under the attack-enhanced protocol.human_rights_systemic_harm:1.000salad-bench/salad-bench.csvHigher is better0.15%Human rights 1%
base_human_autonomy_integritysalad-bench/salad-bench.csv:base_human_autonomy_integrityMeasures content that undermines human autonomy or integrity under the base protocol.human_rights_systemic_harm:1.000salad-bench/salad-bench.csvHigher is better0.15%Human rights 1%
base_information_safety_harmssalad-bench/salad-bench.csv:base_information_safety_harmsMeasures privacy, information-safety, and security-related harmful content under the base protocol.human_rights_systemic_harm:0.500|ordinary_harm_misuse_resistance:0.500salad-bench/salad-bench.csvHigher is better0.0873%Human rights 0.501% · Misuse resistance 0.122%
base_malicious_usesalad-bench/salad-bench.csv:base_malicious_useMeasures malicious-use harmful content under the base protocol.ordinary_harm_misuse_resistance:1.000salad-bench/salad-bench.csvHigher is better0.0245%Misuse resistance 0.245%
base_misinformation_harmssalad-bench/salad-bench.csv:base_misinformation_harmsMeasures misinformation-related harmful content under the base protocol.truthfulness_honesty:1.000salad-bench/salad-bench.csvHigher is better0.0823%Truthfulness 0.549%
base_representation_toxicitysalad-bench/salad-bench.csv:base_representation_toxicityMeasures toxic or unfair representational content under the base protocol.fairness_nondiscrimination:1.000salad-bench/salad-bench.csvHigher is better0.122%Fairness 1.22%
base_socioeconomic_harmssalad-bench/salad-bench.csv:base_socioeconomic_harmsMeasures socioeconomic harmful content under the base protocol.human_rights_systemic_harm:1.000salad-bench/salad-bench.csvHigher is better0.15%Human rights 1%
mcq_human_autonomy_integritysalad-bench/salad-bench.csv:mcq_human_autonomy_integrityMeasures content that undermines human autonomy or integrity under the mcq protocol.human_rights_systemic_harm:1.000salad-bench/salad-bench.csvHigher is better0.0751%Human rights 0.501%
mcq_information_safety_harmssalad-bench/salad-bench.csv:mcq_information_safety_harmsMeasures privacy, information-safety, and security-related harmful content under the mcq protocol.human_rights_systemic_harm:0.500|ordinary_harm_misuse_resistance:0.500salad-bench/salad-bench.csvHigher is better0.0437%Human rights 0.25% · Misuse resistance 0.0612%
mcq_malicious_usesalad-bench/salad-bench.csv:mcq_malicious_useMeasures malicious-use harmful content under the mcq protocol.ordinary_harm_misuse_resistance:1.000salad-bench/salad-bench.csvHigher is better0.0122%Misuse resistance 0.122%
mcq_misinformation_harmssalad-bench/salad-bench.csv:mcq_misinformation_harmsMeasures misinformation-related harmful content under the mcq protocol.truthfulness_honesty:1.000salad-bench/salad-bench.csvHigher is better0.0412%Truthfulness 0.274%
mcq_representation_toxicitysalad-bench/salad-bench.csv:mcq_representation_toxicityMeasures toxic or unfair representational content under the mcq protocol.fairness_nondiscrimination:1.000salad-bench/salad-bench.csvHigher is better0.0608%Fairness 0.608%
mcq_socioeconomic_harmssalad-bench/salad-bench.csv:mcq_socioeconomic_harmsMeasures socioeconomic harmful content under the mcq protocol.human_rights_systemic_harm:1.000salad-bench/salad-bench.csvHigher is better0.0751%Human rights 0.501%

attack_enhanced_human_autonomy_integrity

Measures content that undermines human autonomy or integrity under the attack-enhanced protocol.

RankModelValueRelative performanceProvenance
1claude-286.64official
2gpt-4-turbo73.49official
3gpt-3.5-turbo72.41official
4llama-2-13b-chat62.72official
5llama-2-70b-chat62.28official
6gemma-2b-it56.47official
7internlm-chat-20b29.74official
8qwen1.5-4b-chat26.29official
9yi-34b-chat24.14official
10yi-6b-chat23.71official
11internlm-chat-7b21.12official
11internlm2-chat-7b21.12official
13llama-2-7b-chat20.47official
13qwen1.5-72b-chat20.47official
15internlm2-chat-20b15.52official
16gemini-1.0-pro13.36official
16gemma-7b-it13.36official
18chatglm3-6b12.72official
19mixtral-8x7b-instruct11.85official
20qwen1.5-0.5b-chat11.42official
21qwen-72b-chat11.21official
22qwen-14b-chat9.91official
22qwen1.5-7b-chat9.91official
24tulu-2-dpo-70b8.19official
25qwen-7b-chat7.76official
26qwen1.5-14b-chat7.11official
27tulu-2-dpo-7b6.47official
28mistral-7b-instruct6.035official
29qwen1.5-1.8b-chat6.03official
30vicuna-7b-v1.5-16k4.96official
31tulu-2-dpo-13b4.53official
31vicuna-13b-v1.5-16k4.53official
33vicuna-33b-v1.34.31official

attack_enhanced_information_safety_harms

Measures privacy, information-safety, and security-related harmful content under the attack-enhanced protocol.

RankModelValueRelative performanceProvenance
1claude-293.49official
2gpt-4-turbo85.67official
3gpt-3.5-turbo72.64official
4llama-2-13b-chat71.01official
5llama-2-70b-chat68.4official
6gemma-2b-it38.76official
7yi-34b-chat27.36official
8yi-6b-chat27.04official
9internlm-chat-20b23.45official
10qwen1.5-4b-chat23.13official
11gemma-7b-it22.8official
12gemini-1.0-pro20.85official
13qwen1.5-72b-chat17.92official
14internlm2-chat-7b17.59official
14llama-2-7b-chat17.59official
16internlm-chat-7b16.61official
17chatglm3-6b12.05official
18qwen-72b-chat9.45official
19tulu-2-dpo-70b8.14official
20qwen1.5-1.8b-chat7.82official
21internlm2-chat-20b7.17official
21qwen1.5-7b-chat7.17official
23qwen-7b-chat6.84official
24qwen-14b-chat6.51official
25mixtral-8x7b-instruct5.21official
25qwen1.5-0.5b-chat5.21official
25tulu-2-dpo-7b5.21official
28tulu-2-dpo-13b4.56official
29vicuna-33b-v1.34.23official
30qwen1.5-14b-chat3.91official
30vicuna-7b-v1.5-16k3.91official
32mistral-7b-instruct3.095official
33vicuna-13b-v1.5-16k2.93official

attack_enhanced_malicious_use

Measures malicious-use harmful content under the attack-enhanced protocol.

RankModelValueRelative performanceProvenance
1claude-287.03official
2gpt-4-turbo75.53official
3gpt-3.5-turbo71.86official
4llama-2-70b-chat66.15official
5llama-2-13b-chat62.56official
6gemma-2b-it53.59official
7internlm-chat-20b29.36official
8internlm2-chat-7b24.31official
9yi-6b-chat23.82official
10qwen1.5-4b-chat22.84official
11yi-34b-chat22.76official
12internlm-chat-7b22.51official
13qwen1.5-72b-chat17.05official
14llama-2-7b-chat16.31official
15internlm2-chat-20b12.56official
16gemini-1.0-pro12.23official
17chatglm3-6b11.01official
18qwen-14b-chat10.44official
19gemma-7b-it9.95official
20qwen-72b-chat9.14official
21qwen-7b-chat8.4official
21qwen1.5-0.5b-chat8.4official
23qwen1.5-7b-chat8.32official
24tulu-2-dpo-70b8.16official
25mixtral-8x7b-instruct7.67official
26qwen1.5-14b-chat6.53official
27tulu-2-dpo-13b6.12official
28qwen1.5-1.8b-chat4.98official
29mistral-7b-instruct4.65official
30tulu-2-dpo-7b4.57official
31vicuna-13b-v1.5-16k4.24official
32vicuna-33b-v1.34official
33vicuna-7b-v1.5-16k3.83official

attack_enhanced_misinformation_harms

Measures misinformation-related harmful content under the attack-enhanced protocol.

RankModelValueRelative performanceProvenance
1claude-291.61official
2gpt-4-turbo84.7official
3gpt-3.5-turbo71.38official
4llama-2-13b-chat70.23official
5llama-2-70b-chat62.17official
6gemma-2b-it52.3official
7qwen1.5-4b-chat28.29official
8internlm-chat-20b27.96official
9yi-34b-chat26.81official
10yi-6b-chat24.84official
11internlm-chat-7b19.9official
12gemma-7b-it18.91official
13llama-2-7b-chat18.75official
14qwen1.5-72b-chat18.42official
15gemini-1.0-pro17.93official
16internlm2-chat-7b16.45official
17chatglm3-6b13.16official
18mixtral-8x7b-instruct9.54official
19internlm2-chat-20b9.38official
19qwen1.5-7b-chat9.38official
21qwen-72b-chat9.05official
22qwen-7b-chat8.72official
23qwen-14b-chat8.39official
24tulu-2-dpo-70b8.22official
25qwen1.5-0.5b-chat6.91official
26qwen1.5-1.8b-chat6.74official
27vicuna-7b-v1.5-16k6.09official
28tulu-2-dpo-13b5.76official
29tulu-2-dpo-7b5.59official
30vicuna-33b-v1.34.61official
31qwen1.5-14b-chat4.28official
32mistral-7b-instruct4.11official
33vicuna-13b-v1.5-16k3.29official

attack_enhanced_representation_toxicity

Measures toxic or unfair representational content under the attack-enhanced protocol.

RankModelValueRelative performanceProvenance
1claude-287.15official
2gpt-4-turbo82.44official
3gpt-3.5-turbo75.65official
4llama-2-70b-chat68.62official
5llama-2-13b-chat65.85official
6gemma-2b-it48.11official
7internlm-chat-20b31.79official
8gemini-1.0-pro27.13official
9internlm-chat-7b23.71official
10yi-34b-chat22.6official
11qwen1.5-4b-chat22.09official
12yi-6b-chat20.24official
13internlm2-chat-7b19.27official
14llama-2-7b-chat18.21official
15gemma-7b-it17.56official
16qwen1.5-72b-chat14.19official
17chatglm3-6b12.57official
18qwen-72b-chat11.97official
19mixtral-8x7b-instruct10.35official
20internlm2-chat-20b10.12official
21qwen1.5-1.8b-chat8.18official
22qwen-14b-chat7.44official
23qwen1.5-7b-chat7.39official
24tulu-2-dpo-70b7.35official
25qwen1.5-0.5b-chat6.79official
26qwen1.5-14b-chat6.19official
27qwen-7b-chat5.91official
28tulu-2-dpo-13b5.59official
29mistral-7b-instruct4.09official
30tulu-2-dpo-7b3.56official
31vicuna-7b-v1.5-16k3.33official
32vicuna-13b-v1.5-16k3.19official
33vicuna-33b-v1.33.14official

attack_enhanced_socioeconomic_harms

Measures socioeconomic harmful content under the attack-enhanced protocol.

RankModelValueRelative performanceProvenance
1claude-288.31official
2gpt-4-turbo80.09official
3gpt-3.5-turbo68.83official
4llama-2-13b-chat68.4official
5llama-2-70b-chat60.17official
6gemma-2b-it51.95official
7internlm-chat-20b27.27official
8llama-2-7b-chat23.81official
8yi-34b-chat23.81official
10yi-6b-chat23.38official
11internlm-chat-7b22.08official
12internlm2-chat-7b20.35official
13qwen1.5-4b-chat19.05official
14chatglm3-6b17.75official
15qwen1.5-72b-chat14.29official
16gemini-1.0-pro12.99official
17internlm2-chat-20b12.55official
18gemma-7b-it12.12official
18qwen1.5-0.5b-chat12.12official
20tulu-2-dpo-70b10.82official
21mixtral-8x7b-instruct9.52official
22qwen-72b-chat9.09official
22qwen1.5-14b-chat9.09official
24qwen-14b-chat7.79official
24qwen-7b-chat7.79official
24tulu-2-dpo-7b7.79official
27qwen1.5-1.8b-chat7.36official
27qwen1.5-7b-chat7.36official
29tulu-2-dpo-13b6.93official
29vicuna-7b-v1.5-16k6.93official
31mistral-7b-instruct5.41official
32vicuna-13b-v1.5-16k5.19official
33vicuna-33b-v1.33.9official

base_human_autonomy_integrity

Measures content that undermines human autonomy or integrity under the base protocol.

RankModelValueRelative performanceProvenance
1claude-299.88official
2internlm-chat-20b98.89official
3internlm2-chat-20b98.54official
4llama-2-13b-chat98.43official
5llama-2-7b-chat98.37official
6llama-2-70b-chat98.25official
7internlm2-chat-7b98.02official
8qwen-14b-chat97.32official
9gemma-2b-it97.03official
10internlm-chat-7b96.85official
11qwen1.5-4b-chat96.62official
12qwen-72b-chat96.39official
13gpt-4-turbo96.21official
14qwen1.5-14b-chat96.1official
14qwen1.5-72b-chat96.1official
16qwen1.5-7b-chat95.17official
17gemma-7b-it94.82official
18qwen-7b-chat94.35official
18tulu-2-dpo-70b94.35official
20chatglm3-6b92.55official
21yi-34b-chat91.73official
22gemini-1.0-pro91.09official
23tulu-2-dpo-13b89.52official
24gpt-3.5-turbo89.4official
25yi-6b-chat86.78official
26tulu-2-dpo-7b85.73official
27qwen1.5-0.5b-chat83.23official
28mixtral-8x7b-instruct76official
29qwen1.5-1.8b-chat68.32official
30mistral-7b-instruct67.21official
31vicuna-33b-v1.358.12official
32vicuna-13b-v1.5-16k47.35official
33vicuna-7b-v1.5-16k46.42official

base_information_safety_harms

Measures privacy, information-safety, and security-related harmful content under the base protocol.

RankModelValueRelative performanceProvenance
1internlm-chat-20b99.8official
2claude-299.66official
3llama-2-7b-chat99.26official
4llama-2-70b-chat99.19official
5gemma-2b-it98.38official
5gpt-4-turbo98.38official
7qwen-72b-chat97.9official
8qwen1.5-14b-chat97.77official
9gemma-7b-it97.49official
10qwen1.5-72b-chat96.89official
11internlm2-chat-20b96.68official
12qwen-14b-chat96.34official
13qwen1.5-4b-chat96.14official
14qwen1.5-7b-chat95.67official
15internlm-chat-7b95.13official
16llama-2-13b-chat94.92official
17tulu-2-dpo-70b94.65official
18internlm2-chat-7b94.45official
19qwen-7b-chat93.84official
20yi-6b-chat93.77official
21yi-34b-chat93.23official
22tulu-2-dpo-13b92.82official
23chatglm3-6b92.21official
24gemini-1.0-pro91.4official
25gpt-3.5-turbo90.79official
26tulu-2-dpo-7b89.3official
27mixtral-8x7b-instruct86.8official
28qwen1.5-0.5b-chat84.9official
29mistral-7b-instruct78.74official
30qwen1.5-1.8b-chat70.21official
31vicuna-33b-v1.370.07official
32vicuna-7b-v1.5-16k63.51official
33vicuna-13b-v1.5-16k57.28official

base_malicious_use

Measures malicious-use harmful content under the base protocol.

RankModelValueRelative performanceProvenance
1claude-299.97official
2internlm2-chat-20b98.88official
3internlm2-chat-7b98.63official
4llama-2-7b-chat98.54official
5internlm-chat-20b98.44official
6llama-2-70b-chat98.17official
7llama-2-13b-chat97.98official
8qwen-14b-chat97.33official
9qwen1.5-4b-chat96.93official
10qwen1.5-14b-chat96.87official
11qwen-72b-chat96.47official
12internlm-chat-7b96.28official
13gemma-2b-it95.98official
14gpt-4-turbo95.83official
15qwen1.5-72b-chat95.2official
16qwen1.5-7b-chat94.12official
17gemma-7b-it93.54official
18qwen-7b-chat93.24official
19tulu-2-dpo-70b92.75official
20chatglm3-6b91.15official
21yi-34b-chat89.36official
22gpt-3.5-turbo88.74official
23gemini-1.0-pro87.27official
24tulu-2-dpo-13b85.52official
25tulu-2-dpo-7b83.26official
26yi-6b-chat82.67official
27qwen1.5-0.5b-chat80.92official
28mixtral-8x7b-instruct67.65official
29mistral-7b-instruct57.35official
30qwen1.5-1.8b-chat56.36official
31vicuna-33b-v1.346.84official
32vicuna-13b-v1.5-16k34.59official
33vicuna-7b-v1.5-16k33.49official

base_misinformation_harms

Measures misinformation-related harmful content under the base protocol.

RankModelValueRelative performanceProvenance
1claude-299.7official
2internlm2-chat-20b98.67official
2internlm2-chat-7b98.67official
4llama-2-13b-chat97.64official
5internlm-chat-7b97.05official
6internlm-chat-20b97official
7qwen1.5-4b-chat96.45official
8gemma-2b-it96.41official
9llama-2-7b-chat96.26official
10qwen1.5-14b-chat95.72official
11llama-2-70b-chat95.67official
12gemma-7b-it95.57official
13qwen-14b-chat95.42official
14qwen-72b-chat94.04official
14qwen1.5-7b-chat94.04official
16gemini-1.0-pro93.75official
17qwen1.5-72b-chat93.65official
18gpt-4-turbo93.35official
19qwen-7b-chat93.11official
20tulu-2-dpo-70b92.96official
21gpt-3.5-turbo92.61official
22chatglm3-6b91.38official
23tulu-2-dpo-7b89.81official
24tulu-2-dpo-13b88.48official
25qwen1.5-0.5b-chat88.08official
26yi-34b-chat87.74official
27yi-6b-chat86.12official
28mixtral-8x7b-instruct84.39official
29mistral-7b-instruct75.97official
30qwen1.5-1.8b-chat73.46official
31vicuna-33b-v1.369.97official
32vicuna-13b-v1.5-16k62.78official
33vicuna-7b-v1.5-16k62.04official

base_representation_toxicity

Measures toxic or unfair representational content under the base protocol.

RankModelValueRelative performanceProvenance
1claude-299.58official
2internlm2-chat-20b97.53official
3internlm2-chat-7b97.19official
4llama-2-13b-chat95.71official
5gemma-2b-it95.56official
6gemma-7b-it94.42official
7internlm-chat-7b94.37official
8internlm-chat-20b93.39official
9llama-2-7b-chat93.06official
10qwen1.5-4b-chat93.05official
11llama-2-70b-chat92.71official
11qwen1.5-14b-chat92.71official
13qwen-14b-chat92.21official
14qwen-72b-chat90.69official
15qwen1.5-7b-chat90.23official
16qwen1.5-72b-chat90.06official
17tulu-2-dpo-70b88.87official
18gpt-4-turbo88.74official
19chatglm3-6b88.73official
20qwen-7b-chat88.39official
21gpt-3.5-turbo87.99official
22gemini-1.0-pro87.37official
23tulu-2-dpo-13b85.28official
24tulu-2-dpo-7b84.49official
25mixtral-8x7b-instruct82.05official
26yi-34b-chat81.07official
27yi-6b-chat78.37official
28qwen1.5-0.5b-chat75.3official
29mistral-7b-instruct74.01official
30qwen1.5-1.8b-chat64.05official
31vicuna-33b-v1.352.78official
32vicuna-13b-v1.5-16k51.39official
33vicuna-7b-v1.5-16k47.27official

base_socioeconomic_harms

Measures socioeconomic harmful content under the base protocol.

RankModelValueRelative performanceProvenance
1claude-299.41official
2internlm-chat-20b96.36official
3internlm2-chat-20b95.77official
4llama-2-70b-chat94.83official
5internlm2-chat-7b94.71official
6llama-2-7b-chat94.12official
7qwen1.5-4b-chat94.01official
8qwen1.5-14b-chat93.65official
9qwen-14b-chat93.07official
10qwen-72b-chat92.24official
11gpt-4-turbo92.01official
12qwen1.5-72b-chat91.89official
13llama-2-13b-chat91.19official
13qwen1.5-7b-chat91.19official
15internlm-chat-7b90.95official
16gemma-2b-it89.78official
17yi-34b-chat89.19official
18qwen-7b-chat88.48official
19chatglm3-6b86.96official
20yi-6b-chat86.72official
21tulu-2-dpo-70b86.49official
22gemma-7b-it86.13official
23tulu-2-dpo-13b84.49official
24gemini-1.0-pro82.26official
25qwen1.5-0.5b-chat81.2official
26tulu-2-dpo-7b81.08official
27mixtral-8x7b-instruct80.85official
28gpt-3.5-turbo77.32official
29mistral-7b-instruct74.14official
30qwen1.5-1.8b-chat74.03official
31vicuna-33b-v1.365.8official
32vicuna-13b-v1.5-16k57.58official
33vicuna-7b-v1.5-16k57.11official

mcq_human_autonomy_integrity

Measures content that undermines human autonomy or integrity under the mcq protocol.

RankModelValueRelative performanceProvenance
1gpt-4-turbo90.56official
2qwen1.5-72b-chat83.89official
3tulu-2-dpo-70b73.61official
4qwen-72b-chat69.72official
5internlm2-chat-7b63.89official
6qwen1.5-14b-chat62.22official
7qwen-14b-chat61.94official
8internlm2-chat-20b61.11official
9gpt-3.5-turbo51.39official
9mixtral-8x7b-instruct51.39official
11gemini-1.0-pro45.28official
12qwen-7b-chat42.5official
12vicuna-33b-v1.342.5official
14tulu-2-dpo-13b41.67official
15gemma-7b-it40.56official
16vicuna-13b-v1.5-16k40.28official
17llama-2-70b-chat33.61official
18mistral-7b-instruct32.92official
19tulu-2-dpo-7b27.78official
20vicuna-7b-v1.5-16k27.5official
21yi-34b-chat25official
22claude-221.67official
23gemma-2b-it20.83official
24qwen1.5-7b-chat19.17official
25chatglm3-6b17.78official
26llama-2-13b-chat10.28official
27llama-2-7b-chat6.389official
28yi-6b-chat5.833official
29internlm-chat-20b3.333official
30internlm-chat-7b0official
30qwen1.5-0.5b-chat0official
30qwen1.5-1.8b-chat0official
30qwen1.5-4b-chat0official

mcq_information_safety_harms

Measures privacy, information-safety, and security-related harmful content under the mcq protocol.

RankModelValueRelative performanceProvenance
1gpt-4-turbo88.33official
2qwen1.5-72b-chat80.28official
3qwen-72b-chat65official
4tulu-2-dpo-70b64.72official
5internlm2-chat-7b57.5official
6mixtral-8x7b-instruct51.94official
7internlm2-chat-20b51.11official
7qwen-14b-chat51.11official
9qwen1.5-14b-chat49.72official
10gpt-3.5-turbo43.89official
11gemini-1.0-pro43.33official
12gemma-7b-it40.56official
13vicuna-13b-v1.5-16k37.5official
14qwen-7b-chat37.22official
15vicuna-33b-v1.336.94official
16tulu-2-dpo-13b34.44official
17mistral-7b-instruct32.5official
18yi-34b-chat31.67official
19llama-2-70b-chat30.83official
20claude-228.61official
21chatglm3-6b20.56official
22tulu-2-dpo-7b19.72official
23llama-2-13b-chat17.5official
24vicuna-7b-v1.5-16k17.22official
25gemma-2b-it14.17official
26qwen1.5-7b-chat11.94official
27internlm-chat-20b4.167official
28yi-6b-chat3.889official
29llama-2-7b-chat3.333official
30internlm-chat-7b0official
30qwen1.5-0.5b-chat0official
30qwen1.5-1.8b-chat0official
30qwen1.5-4b-chat0official

mcq_malicious_use

Measures malicious-use harmful content under the mcq protocol.

RankModelValueRelative performanceProvenance
1gpt-4-turbo90.71official
2qwen1.5-72b-chat84.81official
3tulu-2-dpo-70b75.45official
4qwen-72b-chat70official
5internlm2-chat-7b62.24official
6internlm2-chat-20b57.24official
7qwen1.5-14b-chat55.77official
8qwen-14b-chat54.74official
9mixtral-8x7b-instruct53.27official
10gpt-3.5-turbo47.82official
11gemini-1.0-pro46.6official
12vicuna-33b-v1.342.37official
13qwen-7b-chat41.35official
14gemma-7b-it40.38official
15tulu-2-dpo-13b40.13official
16vicuna-13b-v1.5-16k38.21official
17mistral-7b-instruct34.36official
18yi-34b-chat27.76official
19llama-2-70b-chat27.24official
20tulu-2-dpo-7b26.86official
21vicuna-7b-v1.5-16k23.01official
22chatglm3-6b19.55official
23claude-219.17official
24qwen1.5-7b-chat16.35official
25gemma-2b-it16.15official
26llama-2-13b-chat7.885official
27yi-6b-chat5.962official
28llama-2-7b-chat4.551official
29internlm-chat-20b3.974official
30internlm-chat-7b0.0641official
31qwen1.5-0.5b-chat0official
31qwen1.5-1.8b-chat0official
31qwen1.5-4b-chat0official

mcq_misinformation_harms

Measures misinformation-related harmful content under the mcq protocol.

RankModelValueRelative performanceProvenance
1gpt-4-turbo88.57official
2qwen1.5-72b-chat80official
3tulu-2-dpo-70b68.1official
4qwen-72b-chat66.43official
5internlm2-chat-7b62.62official
6internlm2-chat-20b59.05official
7qwen-14b-chat55official
8qwen1.5-14b-chat54.52official
9mixtral-8x7b-instruct52.86official
10gpt-3.5-turbo49.05official
11gemini-1.0-pro44.76official
12tulu-2-dpo-13b40.71official
13qwen-7b-chat40.24official
13vicuna-13b-v1.5-16k40.24official
15vicuna-33b-v1.339.76official
16gemma-7b-it38.1official
17mistral-7b-instruct34.76official
18llama-2-70b-chat30.95official
19tulu-2-dpo-7b28.33official
20yi-34b-chat26.43official
21vicuna-7b-v1.5-16k24.29official
22chatglm3-6b20.95official
23claude-220.71official
24qwen1.5-7b-chat18.81official
25gemma-2b-it17.86official
26llama-2-13b-chat10.95official
27llama-2-7b-chat6.19official
28yi-6b-chat5.238official
29internlm-chat-20b3.333official
30internlm-chat-7b0official
30qwen1.5-0.5b-chat0official
30qwen1.5-1.8b-chat0official
30qwen1.5-4b-chat0official

mcq_representation_toxicity

Measures toxic or unfair representational content under the mcq protocol.

RankModelValueRelative performanceProvenance
1gpt-4-turbo86.88official
2qwen1.5-72b-chat79.27official
3tulu-2-dpo-70b68.96official
4qwen-72b-chat67.92official
5internlm2-chat-7b61.25official
6internlm2-chat-20b57.92official
7qwen1.5-14b-chat57.71official
8qwen-14b-chat55.42official
9mixtral-8x7b-instruct52.08official
10gpt-3.5-turbo46.77official
11vicuna-33b-v1.342.29official
12tulu-2-dpo-13b40.31official
13vicuna-13b-v1.5-16k40.21official
14qwen-7b-chat40.1official
15gemini-1.0-pro39.9official
16gemma-7b-it38.85official
17mistral-7b-instruct31.3official
18tulu-2-dpo-7b28.65official
19llama-2-70b-chat27.71official
20yi-34b-chat26.98official
21claude-224.38official
22vicuna-7b-v1.5-16k23.65official
23gemma-2b-it18.65official
24chatglm3-6b17.81official
25qwen1.5-7b-chat15.62official
26llama-2-13b-chat8.229official
27yi-6b-chat4.792official
28llama-2-7b-chat4.271official
29internlm-chat-20b3.229official
30internlm-chat-7b0.1042official
31qwen1.5-0.5b-chat0official
31qwen1.5-1.8b-chat0official
31qwen1.5-4b-chat0official

mcq_socioeconomic_harms

Measures socioeconomic harmful content under the mcq protocol.

RankModelValueRelative performanceProvenance
1gpt-4-turbo83.89official
2qwen1.5-72b-chat78.89official
3qwen-72b-chat66.67official
3tulu-2-dpo-70b66.67official
5internlm2-chat-7b56.11official
6qwen-14b-chat55.56official
7qwen1.5-14b-chat52.78official
8mixtral-8x7b-instruct48.89official
9gpt-3.5-turbo46.67official
10internlm2-chat-20b46.11official
11gemini-1.0-pro44.44official
12vicuna-13b-v1.5-16k40.56official
13vicuna-33b-v1.340official
14gemma-7b-it38.89official
14tulu-2-dpo-13b38.89official
16qwen-7b-chat37.78official
17mistral-7b-instruct31.94official
18llama-2-70b-chat31.67official
18yi-34b-chat31.67official
20claude-229.44official
21tulu-2-dpo-7b25.56official
22chatglm3-6b22.78official
23vicuna-7b-v1.5-16k21.11official
24qwen1.5-7b-chat17.78official
25gemma-2b-it16.67official
26llama-2-13b-chat12.78official
27internlm-chat-20b7.778official
28yi-6b-chat6.667official
29llama-2-7b-chat1.667official
30internlm-chat-7b0official
30qwen1.5-0.5b-chat0official
30qwen1.5-1.8b-chat0official
30qwen1.5-4b-chat0official