← Evals

Evaluation profile

LiveSecBench

5sub-evals
1.28%total index weight
4components

Within-component eval weight: Fairness 2.23% · Truthfulness 1.68% · Misuse resistance 0.749% · Human rights 4.9%.

Model score (higher is better)Predicted score

About this eval

Live security benchmark performance for Chinese and international models.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
ethicslivesecbench/livesecbench.csv:ethicsMeasures whether the model avoids unfair, biased, or unethical content across continuously updated safety prompts.fairness_nondiscrimination:1.000livesecbench/livesecbench.csvHigher is better0.223%Fairness 2.23%
factualitylivesecbench/livesecbench.csv:factualityMeasures whether the model avoids false or misleading claims across continuously updated safety prompts.truthfulness_honesty:1.000livesecbench/livesecbench.csvHigher is better0.252%Truthfulness 1.68%
legalitylivesecbench/livesecbench.csv:legalityMeasures whether the model avoids illegal or public-safety harms across continuously updated safety prompts.ordinary_harm_misuse_resistance:1.000livesecbench/livesecbench.csvHigher is better0.0749%Misuse resistance 0.749%
privacylivesecbench/livesecbench.csv:privacyMeasures whether the model avoids privacy violations or disclosure of personal information across continuously updated safety prompts.human_rights_systemic_harm:1.000livesecbench/livesecbench.csvHigher is better0.459%Human rights 3.06%
psychological_healthlivesecbench/livesecbench.csv:psychological_healthMeasures whether the model avoids responses that could harm a user’s psychological health across continuously updated safety prompts.human_rights_systemic_harm:1.000livesecbench/livesecbench.csvHigher is better0.276%Human rights 1.84%

ethics

Measures whether the model avoids unfair, biased, or unethical content across continuously updated safety prompts.

RankModelValueRelative performanceProvenance
1gpt-5.295.79official
2qwen3.5-397b-a17b89.63official
3spark-x289.26official
4claude-haiku-4.588.65official
5qwen3.5-plus84.35official
6mimo-v2-flash80.99official
7kimi-k2.579.3official
8claude-sonnet-4.678.63official
9deepseek-v3.275.93official
10minimax-m2.572.04official
11doubao-seed-1.671.6official
12minimax-m269.21official
13intern-s1-pro65.65official
14gpt-oss-120b61.84official
15qwen3-235b-a22b60.81official
16step-3.5-flash56.5official
17hunyuan-t155.14official
18doubao-seed-2.0-pro55.1official
19llama-3.3-70b-instruct54.35official
20sensenova-v6.5-turbo51.6official
21sensechat-turbo47.69official
22seed-oss-36b-instruct46.86official
23gemini-3.1-pro-preview45.45official
24longcat-flash-chat45.19official
25step-342.42official
26deepseek-r139.41official
27glm-4.636.13official
28intern-s134.35official
29ernie-5.0-preview34.13official
30ernie-4.5-21b-a3b33.56official
31gemini-2.5-flash31.43official
32glm-531.18official
33mistral-large-227.9official
34mistral-large-324.59official
35gpt-4.1-mini23.73official
36ling-2.5-1t23.32official
37llama-4-maverick22.55official
38deepseek-v320.88official
39grok-3-mini20.84official
40kimi-k220.12official
41hunyuan-a13b-instruct14.7official
42pangu-pro-moe-72b-a16b9.51official
43grok-4.1-fast8.57official

factuality

Measures whether the model avoids false or misleading claims across continuously updated safety prompts.

RankModelValueRelative performanceProvenance
1claude-sonnet-4.692.17official
2qwen3.5-plus92.1official
3claude-haiku-4.582.68official
4kimi-k2.581.18official
5minimax-m2.576.82official
6glm-575.94official
7spark-x273.79official
8qwen3.5-397b-a17b72.1official
9qwen3-235b-a22b69.98official
10longcat-flash-chat68.41official
11doubao-seed-2.0-pro67.71official
12step-3.5-flash62.37official
13minimax-m262.29official
14glm-4.658.59official
15intern-s1-pro58.23official
16gpt-5.257.75official
17ling-2.5-1t55.88official
18doubao-seed-1.655.43official
19mimo-v2-flash52.77official
20grok-4.1-fast52.76official
21gemini-3.1-pro-preview51.4official
22gpt-oss-120b48.37official
23step-346.32official
24mistral-large-343.2official
25intern-s141.43official
26deepseek-v3.240.76official
27gemini-2.5-flash38.55official
28hunyuan-a13b-instruct37.38official
29grok-3-mini37.05official
30seed-oss-36b-instruct36.52official
31sensechat-turbo33.43official
32ernie-5.0-preview33.36official
33deepseek-r132.41official
34deepseek-v329.99official
35llama-4-maverick29.74official
36hunyuan-t128.9official
37mistral-large-226.5official
38llama-3.3-70b-instruct26.17official
39ernie-4.5-21b-a3b24.31official
40gpt-4.1-mini22.2official
41kimi-k218.45official
42pangu-pro-moe-72b-a16b16.5official
43sensenova-v6.5-turbo13.96official

legality

Measures whether the model avoids illegal or public-safety harms across continuously updated safety prompts.

RankModelValueRelative performanceProvenance
1claude-haiku-4.598.62official
2claude-sonnet-4.697.77official
3doubao-seed-1.693.2official
4gpt-5.289.24official
5gpt-oss-120b86.06official
6deepseek-r185.68official
7qwen3.5-plus84.85official
8intern-s1-pro80.56official
9spark-x279.29official
10doubao-seed-2.0-pro78.59official
11qwen3-235b-a22b73.51official
12minimax-m267.96official
13kimi-k2.567.47official
14llama-3.3-70b-instruct66.51official
15deepseek-v3.265.16official
16qwen3.5-397b-a17b62.2official
17gemini-2.5-flash56.07official
18mimo-v2-flash52.92official
19gemini-3.1-pro-preview50.36official
20sensechat-turbo48.96official
21minimax-m2.548.6official
22longcat-flash-chat46.38official
23intern-s142.89official
24mistral-large-242.83official
25glm-539.78official
26glm-4.639.39official
27kimi-k231.19official
28ernie-5.0-preview30.82official
29ling-2.5-1t30.6official
30llama-4-maverick27.05official
31step-3.5-flash26.76official
32hunyuan-t123.02official
33grok-3-mini20.79official
33mistral-large-320.79official
35gpt-4.1-mini19.69official
36seed-oss-36b-instruct19.65official
37step-319.37official
38grok-4.1-fast18.02official
39ernie-4.5-21b-a3b15.07official
40pangu-pro-moe-72b-a16b12.05official
41sensenova-v6.5-turbo11.17official
42deepseek-v37.76official
43hunyuan-a13b-instruct5.3official

privacy

Measures whether the model avoids privacy violations or disclosure of personal information across continuously updated safety prompts.

RankModelValueRelative performanceProvenance
1claude-haiku-4.597.17official
2qwen3.5-397b-a17b94.2official
3claude-sonnet-4.689.26official
4gpt-5.287.9official
5spark-x286.96official
6qwen3.5-plus79.84official
7doubao-seed-1.675.73official
8kimi-k273.81official
9longcat-flash-chat73.3official
10qwen3-235b-a22b72.57official
11sensechat-turbo68.09official
12gemini-3.1-pro-preview67.16official
13gpt-oss-120b65.7official
14minimax-m264.5official
15intern-s1-pro63.69official
16doubao-seed-2.0-pro62.37official
17kimi-k2.560.89official
18glm-560.57official
19minimax-m2.559.81official
20deepseek-r159.73official
21ernie-5.0-preview54.35official
22mimo-v2-flash53.69official
23step-3.5-flash46.86official
24ling-2.5-1t44.71official
25grok-4.1-fast39.48official
26deepseek-v3.237.7official
27sensenova-v6.5-turbo35.54official
28hunyuan-t131.95official
29gemini-2.5-flash31.6official
30step-330.7official
31llama-3.3-70b-instruct30.35official
32grok-3-mini30.02official
33glm-4.629.92official
34mistral-large-226.82official
35llama-4-maverick26.17official
36seed-oss-36b-instruct21.14official
37ernie-4.5-21b-a3b19.99official
38intern-s119.05official
39gpt-4.1-mini18.39official
40hunyuan-a13b-instruct16.52official
41mistral-large-310.14official
42deepseek-v36.72official
43pangu-pro-moe-72b-a16b5.84official

psychological_health

Measures whether the model avoids responses that could harm a user’s psychological health across continuously updated safety prompts.

RankModelValueRelative performanceProvenance
1gpt-5.292.91official
2claude-haiku-4.590.02official
3qwen3.5-397b-a17b89.45official
4kimi-k2.585.12official
5qwen3.5-plus80.56official
6gemini-3.1-pro-preview76.44official
7glm-576.17official
8claude-sonnet-4.672.01official
9gpt-oss-120b71.2official
10minimax-m269.47official
11qwen3-235b-a22b69.27official
12step-3.5-flash68.03official
13spark-x266.62official
14deepseek-v3.261.46official
15glm-4.660.3official
16deepseek-r158.87official
17doubao-seed-1.658.17official
18step-355.88official
19gemini-2.5-flash54.27official
20longcat-flash-chat52.22official
21doubao-seed-2.0-pro51.42official
22minimax-m2.550.99official
23intern-s1-pro50official
24ling-2.5-1t47.77official
25ernie-5.0-preview47.6official
26mimo-v2-flash45.77official
27grok-4.1-fast44.84official
28mistral-large-343.44official
29llama-4-maverick35.37official
30kimi-k234.35official
31grok-3-mini33.15official
32gpt-4.1-mini30.95official
33pangu-pro-moe-72b-a16b27.71official
34seed-oss-36b-instruct27.32official
35ernie-4.5-21b-a3b25.39official
36deepseek-v325.03official
37mistral-large-224.54official
38hunyuan-t124.18official
39intern-s119.6official
40llama-3.3-70b-instruct17.08official
41sensechat-turbo12.27official
42hunyuan-a13b-instruct10.79official
43sensenova-v6.5-turbo7.71official