← Evals

Evaluation profile

PHARE

4sub-evals
1.09%total index weight
3components

Within-component eval weight: Fairness 5.37% · Truthfulness 2.5% · Misuse resistance 1.76%.

Model score (higher is better)Predicted score

About this eval

Broad safety across hallucination, harmfulness, out-of-scope handling, and bias.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
bias_resistance_diagnosticphare/phare.csv:bias_resistance_diagnosticMeasures whether the model avoids reproducing stereotypes or biased treatment across the benchmark’s multilingual bias tasks.fairness_nondiscrimination:1.000phareHigher is better0.537%Fairness 5.37%
hallucination_resistance_diagnosticphare/phare.csv:hallucination_resistance_diagnosticMeasures whether the model remains factually accurate, rejects misinformation, debunks false claims, and handles incomplete tool inputs without fabrication.truthfulness_honesty:1.000phareHigher is better0.375%Truthfulness 2.5%
harm_resistance_diagnosticphare/phare.csv:harm_resistance_diagnosticMeasures whether the model avoids generating responses that could cause harm across the benchmark’s multilingual harmfulness tasks.ordinary_harm_misuse_resistance:1.000phareHigher is better0.0892%Misuse resistance 0.892%
jailbreak_resistance_diagnosticphare/phare.csv:jailbreak_resistance_diagnosticMeasures whether the model maintains its safety behavior when users apply jailbreak and prompt-injection techniques.ordinary_harm_misuse_resistance:1.000phareHigher is better0.0873%Misuse resistance 0.873%

bias_resistance_diagnostic

Measures whether the model avoids reproducing stereotypes or biased treatment across the benchmark’s multilingual bias tasks.

RankModelValueRelative performanceProvenance
1gpt-4.1-mini0.8812official
2grok-4-fast0.8026official
3llama-3.1-405b-instruct0.7523official
4mistral-small-3.20.739official
5llama-4-maverick0.7365official
6claude-haiku-4.50.7066official
7llama-4-scout0.671official
8deepseek-v3.10.6517official
9claude-opus-4.50.632official
10mistral-large-30.6272official
11mistral-medium-3.50.6098official
12qwen3-8b0.5864official
13deepseek-v30.5751official
14qwen-plus0.557official
15qwen3.7-plus0.5496official
16gemini-3-pro-preview0.5365official
17qwen3-30b-a3b-instruct0.5357official
18gemini-2.0-flash0.5351official
19kimi-k2.60.5307official
20gpt-4.10.5241official
21qwen3.7-max0.524official
22gemini-2.5-flash0.5174official
23glm-5.20.5127official
24gpt-4o0.5092official
25magistral-medium0.5075official
26claude-sonnet-4.50.4914official
27gemini-3.1-pro0.481official
28magistral-small0.4802official
29grok-4.30.47official
30gpt-5.10.4677official
31gpt-5-mini0.4641official
32grok-3-mini0.464official
33command-a0.4559official
34gemini-2.5-flash-lite0.4553official
35llama-3.3-70b-instruct0.4539official
36qwen3-max0.4477official
37gemini-3.1-flash-lite0.4457official
38llama-3.1-8b-instruct0.4415official
39claude-opus-4.10.4361official
40qwen2.5-max0.4295official
41gemini-2.0-flash-lite0.4165official
42claude-sonnet-4.60.4128official
43claude-sonnet-50.3988official
44mistral-large-20.397official
45mistral-medium-3.10.3966official
46gpt-oss-120b0.3884official
47gpt-5.20.3851official
48gpt-5.50.3829official
49claude-3.5-haiku0.3808official
50gemma-3-27b-it0.3801official
51gpt-4o-mini0.379official
52gemini-2.5-pro0.3652official
53gpt-4.1-nano0.3622official
54gemma-4-31b-it0.3522official
55gpt-5-nano0.347official
56claude-3.7-sonnet0.3377official
57claude-opus-4.60.3351official
58grok-20.331official
59deepseek-v4-flash0.323official
60gemma-3-12b0.3214official
61grok-40.3116official
62kimi-k2.50.29official
63gpt-50.2856official
64deepseek-r10.2549official
65grok-30.2324official
66deepseek-v4-pro0.1714official

hallucination_resistance_diagnostic

Measures whether the model remains factually accurate, rejects misinformation, debunks false claims, and handles incomplete tool inputs without fabrication.

RankModelValueRelative performanceProvenance
1claude-opus-4.50.8823official
2claude-opus-4.60.8776official
3gemini-3.1-pro0.8759official
4claude-sonnet-4.50.87official
5claude-3.5-sonnet0.8671official
6claude-opus-4.10.8619official
7claude-sonnet-50.861official
8claude-sonnet-4.60.8551official
9claude-3.7-sonnet0.8517official
10claude-haiku-4.50.8356official
11kimi-k2.60.8278official
12gemini-3.5-flash0.8218official
13deepseek-v4-flash0.8188official
14gpt-5.10.8184official
15qwen3.7-max0.8114official
16gemini-3-pro-preview0.8102official
17grok-40.8073official
18kimi-k2.50.8069official
19gemini-3.1-flash-lite0.8057official
20gpt-5.50.7978official
21deepseek-v4-pro0.7964official
22gpt-5-mini0.7958official
23grok-4.30.7946official
24gpt-4o0.7852official
25glm-5.20.7823official
26gemini-1.5-pro0.7807official
27claude-3.5-haiku0.7804official
28gpt-4.10.7764official
29gpt-5.20.7713official
30gemma-4-31b-it0.7662official
31gpt-5-nano0.7637official
32qwen3.7-plus0.7626official
33mistral-large-20.7562official
34qwen-plus0.7558official
35qwen3-max0.752official
36grok-30.7512official
37gemini-2.5-pro0.7482official
38gpt-50.7458official
39deepseek-r10.7289official
40gemini-2.5-flash0.7213official
41command-a0.7189official
42gemini-2.0-flash0.7159official
43llama-4-maverick0.7147official
44mistral-small-3.10.7official
45qwen2.5-max0.698official
46mistral-medium-3.10.6963official
47llama-3.3-70b-instruct0.6883official
48grok-3-mini0.6862official
49magistral-medium0.6819official
50gemini-2.5-flash-lite0.6809official
51mistral-large-30.6803official
52gpt-4.1-mini0.6781official
53gpt-4.1-nano0.6774official
54mistral-medium-3.50.677official
55llama-3.1-405b-instruct0.674official
56grok-20.668official
57deepseek-v30.6675official
58gpt-oss-120b0.6608official
59gpt-4o-mini0.6597official
60llama-3.1-8b-instruct0.6381official
61mistral-small-3.20.634official
62grok-4-fast0.634official
63gemini-2.0-flash-lite0.6321official
64magistral-small0.6244official
65deepseek-v3.10.6158official
66qwen3-8b0.6038official
67gemma-3-27b-it0.603official
68qwen3-30b-a3b-instruct0.5988official
69llama-4-scout0.582official
70gemma-3-12b0.5386official

harm_resistance_diagnostic

Measures whether the model avoids generating responses that could cause harm across the benchmark’s multilingual harmfulness tasks.

RankModelValueRelative performanceProvenance
1claude-opus-4.61official
2claude-sonnet-4.60.9993official
3claude-haiku-4.50.9993official
4claude-sonnet-50.9959official
5claude-sonnet-4.50.9905official
6gpt-5.50.9892official
7gpt-5-mini0.9829official
8claude-opus-4.50.9825official
9gpt-5-nano0.9741official
10kimi-k2.50.972official
11kimi-k2.60.97official
12gpt-50.9697official
13gemini-3.1-flash-lite0.9694official
14gpt-5.10.9692official
15gpt-5.20.9688official
16gemini-1.5-pro0.9684official
17gemma-4-31b-it0.9651official
18claude-opus-4.10.9631official
19gemini-3.5-flash0.9594official
20qwen3.7-max0.9558official
21claude-3.7-sonnet0.9552official
22deepseek-v4-pro0.9541official
23qwen3-max0.954official
24claude-3.5-sonnet0.954official
25claude-3.5-haiku0.9536official
26gemini-3.1-pro0.9519official
27deepseek-r10.9515official
28deepseek-v4-flash0.9507official
29deepseek-v3.10.9443official
30qwen3.7-plus0.9443official
31gemini-2.0-flash0.943official
32qwen-plus0.9414official
33gpt-oss-120b0.9375official
34glm-5.20.9373official
35gemini-2.5-flash0.9366official
36grok-4.30.9355official
37gemini-3-pro-preview0.935official
38gpt-4o0.9266official
39gemma-3-12b0.9265official
40mistral-medium-3.10.9232official
41gpt-4.10.923official
42gemini-2.5-pro0.9218official
43grok-20.9144official
44command-a0.9136official
45gemma-3-27b-it0.9136official
46mistral-medium-3.50.9115official
47mistral-small-3.10.9091official
48deepseek-v30.909official
49grok-3-mini0.9047official
50qwen2.5-max0.8989official
51grok-30.8968official
52mistral-large-20.8938official
53llama-4-maverick0.8925official
54mistral-large-30.8806official
55mistral-small-3.20.8787official
56qwen3-8b0.8737official
57llama-3.1-405b-instruct0.8649official
58llama-3.3-70b-instruct0.8604official
59gemini-2.0-flash-lite0.8514official
60magistral-medium0.8452official
61gpt-4.1-mini0.8339official
62llama-3.1-8b-instruct0.8306official
63qwen3-30b-a3b-instruct0.8176official
64grok-4-fast0.8134official
65llama-4-scout0.8104official
66gemini-2.5-flash-lite0.7915official
67gpt-4o-mini0.7729official
68magistral-small0.7623official
69gpt-4.1-nano0.7254official
70grok-40.7177official

jailbreak_resistance_diagnostic

Measures whether the model maintains its safety behavior when users apply jailbreak and prompt-injection techniques.

RankModelValueRelative performanceProvenance
1claude-sonnet-50.8684official
2claude-opus-4.10.8135official
3claude-opus-4.50.7983official
4claude-haiku-4.50.7851official
5llama-3.1-405b-instruct0.7655official
6claude-opus-4.60.7524official
7claude-sonnet-4.50.7523official
8qwen3.7-max0.7316official
9gpt-5.20.7161official
10kimi-k2.60.714official
11qwen3.7-plus0.7058official
12gpt-5-nano0.6964official
13claude-sonnet-4.60.6939official
14gpt-50.6868official
15gpt-5-mini0.686official
16gpt-oss-120b0.659official
17gpt-5.10.6576official
18gpt-5.50.6513official
19gemini-3-pro-preview0.6506official
20grok-40.6485official
21claude-3.5-haiku0.6482official
22claude-3.7-sonnet0.6345official
23kimi-k2.50.613official
24gemma-4-31b-it0.6122official
25gpt-4o0.6048official
26llama-3.1-8b-instruct0.5881official
27glm-5.20.5646official
28grok-4.30.545official
29gpt-4.1-nano0.533official
30gpt-4o-mini0.5214official
31gemini-3.1-pro0.5164official
32qwen-plus0.4998official
33qwen3-8b0.4913official
34llama-4-maverick0.4899official
35llama-4-scout0.4893official
36qwen3-max0.4835official
37gemini-3.1-flash-lite0.4772official
38llama-3.3-70b-instruct0.4768official
39qwen2.5-max0.4626official
40gpt-4.10.461official
41magistral-medium0.4561official
42deepseek-v4-flash0.4549official
43gemma-3-12b0.4427official
44deepseek-v4-pro0.4321official
45gemini-2.5-flash-lite0.4284official
46gemini-3.5-flash0.4264official
47gpt-4.1-mini0.4255official
48qwen3-30b-a3b-instruct0.4209official
49grok-4-fast0.412official
50deepseek-r10.4067official
51gemma-3-27b-it0.4007official
52gemini-2.0-flash-lite0.3926official
53gemini-2.5-pro0.3867official
54deepseek-v3.10.3817official
55mistral-medium-3.50.3746official
56gemini-2.0-flash0.3735official
57magistral-small0.3709official
58gemini-2.5-flash0.3705official
59command-a0.3482official
60grok-3-mini0.3436official
61mistral-small-3.20.3289official
62deepseek-v30.3107official
63mistral-medium-3.10.3083official
64mistral-large-20.3058official
65grok-20.2697official
66grok-30.2577official
67mistral-large-30.249official