Evaluation profile
Alignment Leaderboard
Within-component eval weight: Responsible agency 1.61% · Truthfulness 2.41% · Human rights 1.2% · Misuse resistance 0.979%.
About this eval
Behavioral alignment across honesty, safety, scheming, non-manipulation, corrigibility, and robustness.
Included in the behavior ranking.
Sub-evals
| Measure | Component | Direction | Total index weight | Within-component weight |
|---|---|---|---|---|
| corrigibilityalignment-leaderboard/alignment-leaderboard.csv:corrigibilityMeasures whether the model accepts correction, oversight, and shutdown rather than resisting human control. | responsible_agency_control:1.000alignment-leaderboard | Higher is better | 0.121% | Responsible agency 0.804% |
| honestyalignment-leaderboard/alignment-leaderboard.csv:honestyMeasures whether the model communicates truthfully and avoids misleading the user in honesty scenarios. | truthfulness_honesty:1.000alignment-leaderboard | Higher is better | 0.263% | Truthfulness 1.76% |
| non_manipulationalignment-leaderboard/alignment-leaderboard.csv:non_manipulationMeasures whether the model avoids pressuring, deceiving, or exploiting the user to influence their choices. | human_rights_systemic_harm:0.500|truthfulness_honesty:0.500alignment-leaderboard | Higher is better | 0.279% | Human rights 1.2% · Truthfulness 0.658% |
| robustnessalignment-leaderboard/alignment-leaderboard.csv:robustnessMeasures whether the model preserves aligned behavior when scenarios introduce pressure, ambiguity, or adversarial framing. | ordinary_harm_misuse_resistance:1.000alignment-leaderboard | Higher is better | 0.0392% | Misuse resistance 0.392% |
| safetyalignment-leaderboard/alignment-leaderboard.csv:safetyMeasures whether the model avoids harmful assistance and chooses safe actions in safety scenarios. | ordinary_harm_misuse_resistance:1.000alignment-leaderboard | Higher is better | 0.0587% | Misuse resistance 0.588% |
| schemingalignment-leaderboard/alignment-leaderboard.csv:schemingMeasures whether the model avoids covertly pursuing goals that conflict with the user or developer in scheming scenarios. | responsible_agency_control:1.000alignment-leaderboard | Higher is better | 0.121% | Responsible agency 0.804% |
corrigibility
Measures whether the model accepts correction, oversight, and shutdown rather than resisting human control.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-5.2 | 4.641 | official | |
| 2 | claude-opus-4.5 | 4.563 | official | |
| 3 | gpt-5-mini | 4.495 | official | |
| 3 | kimi-k2 | 4.495 | official | |
| 5 | claude-sonnet-4.5 | 4.485 | official | |
| 6 | deepseek-v3.2 | 4.476 | official | |
| 7 | claude-sonnet-4 | 4.398 | official | |
| 8 | qwen3-235b-a22b | 4.349 | official | |
| 9 | gemini-2.5-pro | 4.34 | official | |
| 10 | gemini-3-flash-preview | 4.32 | official | |
| 10 | gemini-3-pro-preview | 4.32 | official | |
| 12 | gpt-4o | 4.243 | official | |
| 13 | gemini-2.5-flash | 4.204 | official | |
| 13 | qwen3-14b | 4.204 | official | |
| 15 | llama-4-maverick | 4.175 | official | |
| 16 | gpt-oss-120b | 4.136 | official | |
| 17 | mistral-medium-3.1 | 4.117 | official | |
| 18 | qwen3-32b | 4.087 | official | |
| 19 | grok-4.1-fast | 4.068 | official | |
| 20 | llama-3.1-405b-instruct | 4.058 | official | |
| 21 | qwen3-next-80b-a3b | 4.039 | official | |
| 22 | llama-3.3-70b-instruct | 3.951 | official | |
| 23 | mistral-small-3.2 | 3.854 | official | |
| 24 | mistral-large-3 | 3.845 | official |
honesty
Measures whether the model communicates truthfully and avoids misleading the user in honesty scenarios.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-sonnet-4.5 | 4.581 | official | |
| 2 | claude-opus-4.5 | 4.567 | official | |
| 3 | gpt-5.2 | 4.465 | official | |
| 4 | gpt-5-mini | 4.157 | official | |
| 5 | claude-sonnet-4 | 4.088 | official | |
| 6 | gemini-3-pro-preview | 3.94 | official | |
| 7 | kimi-k2 | 3.765 | official | |
| 8 | gpt-oss-120b | 3.733 | official | |
| 9 | gemini-3-flash-preview | 3.682 | official | |
| 9 | grok-4.1-fast | 3.682 | official | |
| 11 | deepseek-v3.2 | 3.613 | official | |
| 11 | gemini-2.5-flash | 3.613 | official | |
| 13 | gpt-4o | 3.604 | official | |
| 14 | llama-4-maverick | 3.581 | official | |
| 14 | qwen3-235b-a22b | 3.581 | official | |
| 16 | gemini-2.5-pro | 3.502 | official | |
| 17 | llama-3.1-405b-instruct | 3.475 | official | |
| 18 | llama-3.3-70b-instruct | 3.346 | official | |
| 19 | qwen3-32b | 3.244 | official | |
| 20 | mistral-medium-3.1 | 3.212 | official | |
| 21 | qwen3-next-80b-a3b | 3.207 | official | |
| 22 | qwen3-14b | 3.147 | official | |
| 23 | mistral-large-3 | 3.083 | official | |
| 24 | mistral-small-3.2 | 3.055 | official |
non_manipulation
Measures whether the model avoids pressuring, deceiving, or exploiting the user to influence their choices.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-sonnet-4.5 | 4.866 | official | |
| 2 | claude-opus-4.5 | 4.837 | official | |
| 3 | gpt-5.2 | 4.523 | official | |
| 4 | claude-sonnet-4 | 4.498 | official | |
| 5 | gpt-5-mini | 4.243 | official | |
| 6 | gemini-3-pro-preview | 3.929 | official | |
| 7 | gpt-oss-120b | 3.611 | official | |
| 8 | kimi-k2 | 3.598 | official | |
| 9 | deepseek-v3.2 | 3.557 | official | |
| 10 | qwen3-235b-a22b | 3.523 | official | |
| 11 | grok-4.1-fast | 3.515 | official | |
| 12 | gemini-3-flash-preview | 3.51 | official | |
| 13 | gemini-2.5-pro | 3.46 | official | |
| 14 | gemini-2.5-flash | 3.326 | official | |
| 15 | gpt-4o | 3.276 | official | |
| 16 | qwen3-next-80b-a3b | 3.197 | official | |
| 17 | llama-4-maverick | 3.084 | official | |
| 17 | qwen3-32b | 3.084 | official | |
| 19 | llama-3.3-70b-instruct | 3.063 | official | |
| 20 | llama-3.1-405b-instruct | 3.034 | official | |
| 21 | qwen3-14b | 3.013 | official | |
| 22 | mistral-medium-3.1 | 2.665 | official | |
| 23 | mistral-small-3.2 | 2.569 | official | |
| 24 | mistral-large-3 | 2.402 | official |
robustness
Measures whether the model preserves aligned behavior when scenarios introduce pressure, ambiguity, or adversarial framing.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gpt-5-mini | 4.6 | official | |
| 2 | gpt-4o | 4.56 | official | |
| 3 | gpt-oss-120b | 4.347 | official | |
| 4 | gpt-5.2 | 4.227 | official | |
| 5 | claude-sonnet-4.5 | 4.027 | official | |
| 5 | grok-4.1-fast | 4.027 | official | |
| 7 | claude-opus-4.5 | 3.907 | official | |
| 8 | qwen3-235b-a22b | 3.88 | official | |
| 9 | llama-4-maverick | 3.867 | official | |
| 10 | claude-sonnet-4 | 3.813 | official | |
| 11 | gemini-3-pro-preview | 3.613 | official | |
| 12 | deepseek-v3.2 | 3.453 | official | |
| 13 | qwen3-next-80b-a3b | 3.427 | official | |
| 14 | gemini-3-flash-preview | 3.373 | official | |
| 15 | llama-3.1-405b-instruct | 3.36 | official | |
| 16 | gemini-2.5-pro | 3.28 | official | |
| 16 | llama-3.3-70b-instruct | 3.28 | official | |
| 18 | kimi-k2 | 3.267 | official | |
| 19 | mistral-medium-3.1 | 3.147 | official | |
| 20 | qwen3-32b | 3.107 | official | |
| 21 | mistral-small-3.2 | 3.08 | official | |
| 22 | gemini-2.5-flash | 2.907 | official | |
| 23 | qwen3-14b | 2.813 | official | |
| 24 | mistral-large-3 | 2.28 | official |
safety
Measures whether the model avoids harmful assistance and chooses safe actions in safety scenarios.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-sonnet-4.5 | 4.885 | official | |
| 2 | claude-opus-4.5 | 4.788 | official | |
| 3 | gpt-5.2 | 4.769 | official | |
| 4 | claude-sonnet-4 | 4.606 | official | |
| 5 | gpt-5-mini | 4.288 | official | |
| 6 | gemini-2.5-flash | 4.038 | official | |
| 6 | gemini-3-pro-preview | 4.038 | official | |
| 8 | deepseek-v3.2 | 4.019 | official | |
| 9 | kimi-k2 | 3.923 | official | |
| 10 | qwen3-235b-a22b | 3.885 | official | |
| 11 | gemini-3-flash-preview | 3.875 | official | |
| 12 | grok-4.1-fast | 3.846 | official | |
| 13 | gemini-2.5-pro | 3.827 | official | |
| 14 | gpt-4o | 3.808 | official | |
| 14 | qwen3-next-80b-a3b | 3.808 | official | |
| 16 | gpt-oss-120b | 3.731 | official | |
| 17 | llama-3.1-405b-instruct | 3.692 | official | |
| 18 | llama-4-maverick | 3.567 | official | |
| 19 | qwen3-14b | 3.558 | official | |
| 20 | llama-3.3-70b-instruct | 3.365 | official | |
| 21 | qwen3-32b | 3.327 | official | |
| 22 | mistral-small-3.2 | 3.038 | official | |
| 23 | mistral-medium-3.1 | 2.962 | official | |
| 24 | mistral-large-3 | 2.865 | official |
scheming
Measures whether the model avoids covertly pursuing goals that conflict with the user or developer in scheming scenarios.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-opus-4.5 | 4.801 | official | |
| 2 | claude-sonnet-4.5 | 4.735 | official | |
| 3 | gpt-5.2 | 4.554 | official | |
| 4 | claude-sonnet-4 | 4.422 | official | |
| 5 | gpt-5-mini | 4.193 | official | |
| 6 | gemini-3-pro-preview | 4.108 | official | |
| 7 | deepseek-v3.2 | 4.006 | official | |
| 8 | kimi-k2 | 3.898 | official | |
| 8 | qwen3-235b-a22b | 3.898 | official | |
| 10 | gpt-oss-120b | 3.873 | official | |
| 11 | gemini-2.5-pro | 3.789 | official | |
| 12 | gemini-3-flash-preview | 3.645 | official | |
| 13 | grok-4.1-fast | 3.627 | official | |
| 14 | gemini-2.5-flash | 3.608 | official | |
| 15 | gpt-4o | 3.584 | official | |
| 16 | qwen3-next-80b-a3b | 3.56 | official | |
| 17 | llama-3.1-405b-instruct | 3.53 | official | |
| 18 | qwen3-14b | 3.458 | official | |
| 19 | llama-4-maverick | 3.422 | official | |
| 20 | qwen3-32b | 3.385 | official | |
| 21 | mistral-medium-3.1 | 3.319 | official | |
| 22 | llama-3.3-70b-instruct | 3.277 | official | |
| 23 | mistral-small-3.2 | 3.241 | official | |
| 24 | mistral-large-3 | 3.211 | official |