Evaluation profile
HUMAINE Trust, Ethics and Safety
1sub-evals
0.803%total index weight
2components
Within-component eval weight: Truthfulness 3.16% · Misuse resistance 3.29%.
Model score (higher is better)Predicted score
About this eval
Human pairwise preference on the HUMAINE Trust, Ethics and Safety dimension.
Included in the behavior ranking.
Sub-evals
| Measure | Component | Direction | Total index weight | Within-component weight |
|---|---|---|---|---|
| trust_ethics_safety_scorehumaine/humaine-trust-ethics-safety.csv:trust_ethics_safety_scoreMeasures whether the model gives trustworthy, ethically appropriate, and safe responses across HUMAINE scenarios. | truthfulness_honesty:0.300|ordinary_harm_misuse_resistance:0.700humaine | Higher is better | 0.803% | Truthfulness 3.16% · Misuse resistance 3.29% |
trust_ethics_safety_score
Measures whether the model gives trustworthy, ethically appropriate, and safe responses across HUMAINE scenarios.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | qwen3.7-max | 29.5 | official | |
| 2 | gemini-3.5-flash | 29.37 | official | |
| 3 | mistral-large-3 | 29.36 | official | |
| 4 | gemini-2.5-pro | 29.16 | official | |
| 5 | grok-3 | 29.14 | official | |
| 6 | gemini-3-pro-preview | 29.09 | official | |
| 7 | gemini-3.1-pro-preview | 29.01 | official | |
| 8 | claude-fable-5 | 28.64 | official | |
| 9 | grok-4 | 28.61 | official | |
| 10 | deepseek-v4-flash | 28.57 | official | |
| 11 | gpt-5.5 | 28.38 | official | |
| 12 | kimi-k2.5 | 28.21 | official | |
| 13 | deepseek-v3.2 | 28.02 | official | |
| 14 | qwen3-235b-a22b | 27.99 | official | |
| 15 | deepseek-r1 | 27.99 | official | |
| 16 | gpt-5.2-chat | 27.91 | official | |
| 17 | gemma-3-27b-it | 27.74 | official | |
| 18 | kimi-k2.6 | 27.72 | official | |
| 19 | gpt-5.6-terra | 27.66 | official | |
| 20 | deepseek-v4-pro | 27.61 | official | |
| 21 | glm-4.7 | 27.46 | official | |
| 22 | deepseek-v3 | 27.39 | official | |
| 23 | claude-opus-4.6 | 27.23 | official | |
| 24 | claude-opus-4.7 | 27.19 | official | |
| 25 | gpt-5.4 | 27.17 | official | |
| 26 | grok-4.20 | 27.15 | official | |
| 27 | gemini-2.0-flash | 27.08 | official | |
| 28 | gemini-2.5-flash | 27.07 | official | |
| 29 | gpt-4.1 | 26.83 | official | |
| 30 | claude-opus-4.8 | 26.79 | official | |
| 31 | gpt-5.6-luna | 26.33 | official | |
| 32 | gpt-5 | 26.31 | official | |
| 33 | gpt-5-mini | 26.31 | official | |
| 34 | o3 | 26.3 | official | |
| 35 | gpt-5.6-sol | 26.14 | official | |
| 36 | magistral-medium | 26.12 | official | |
| 37 | olmo-3.1-32b-think | 25.83 | official | |
| 38 | claude-sonnet-4.5 | 25.74 | official | |
| 39 | minimax-m2.1 | 25.69 | official | |
| 40 | claude-opus-4.5 | 25.54 | official | |
| 41 | o1-mini | 25.53 | official | |
| 42 | claude-opus-4 | 24.9 | official | |
| 43 | o4-mini | 24.53 | official | |
| 44 | claude-sonnet-4 | 24.49 | official | |
| 45 | o1 | 24.33 | official | |
| 46 | llama-3.3-70b-instruct | 24.21 | official | |
| 47 | command-a | 24.04 | official | |
| 48 | kimi-k2 | 23.64 | official | |
| 49 | claude-3.7-sonnet | 23.36 | official | |
| 50 | llama-4-maverick | 23.02 | official | |
| 51 | mistral-nemo | 22.99 | official | |
| 52 | o3-mini | 22.29 | official | |
| 53 | gpt-4o | 22.28 | official | |
| 54 | command-r7b-12-2024 | 20.03 | official |