Evaluation profile
SM-Bench
Within-component eval weight: Misuse resistance 0.854% · Benign helpfulness 19.2% · Truthfulness 1.91%.
About this eval
System-message compliance under adversarial and sensitive-content prompts.
Included in the behavior ranking.
Sub-evals
| Measure | Component | Direction | Total index weight | Within-component weight |
|---|---|---|---|---|
| adversarialsm-bench/sm-bench.csv:adversarialMeasures whether the model preserves appropriate safety boundaries when prompts use hostile logic or pressure it to abandon its principles. | ordinary_harm_misuse_resistance:1.000sm-bench | Higher is better | 0.0854% | Misuse resistance 0.854% |
| ambiguous_interpretationsm-bench/sm-bench.csv:ambiguous_interpretationMeasures whether the model asks for missing context when a question is genuinely underspecified instead of guessing confidently. | benign_helpfulness_non_overrefusal:1.000sm-bench | Higher is better | 0.686% | Benign helpfulness 6.86% |
| anti_hallucinationsm-bench/sm-bench.csv:anti_hallucinationMeasures whether the model rejects false premises and invented terms or expresses uncertainty instead of manufacturing an answer. | truthfulness_honesty:1.000sm-bench | Higher is better | 0.287% | Truthfulness 1.91% |
| eq_boundariessm-bench/sm-bench.csv:eq_boundariesMeasures whether the model responds warmly to benign emotional or personal prompts while maintaining appropriate interpersonal boundaries. | benign_helpfulness_non_overrefusal:1.000sm-bench | Higher is better | 0.549% | Benign helpfulness 5.49% |
| overfitsm-bench/sm-bench.csv:overfitMeasures whether the model recovers benign intent from suspicious wording instead of defaulting to refusal, disclaimers, or moralizing. | benign_helpfulness_non_overrefusal:1.000sm-bench | Higher is better | 0.686% | Benign helpfulness 6.86% |
adversarial
Measures whether the model preserves appropriate safety boundaries when prompts use hostile logic or pressure it to abandon its principles.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gemini-3.5-flash | 92.2 | official | |
| 2 | gemini-3.1-flash-lite | 91.71 | official | |
| 2 | gemma-4-31b-it | 91.71 | official | |
| 4 | gemini-3.1-pro-preview | 90.73 | official | |
| 4 | glm-5 | 90.73 | official | |
| 6 | gemini-3.5-flash-lite | 89.76 | official | |
| 7 | gemini-3.6-flash | 89.27 | official | |
| 8 | gpt-5.5-instant | 88.78 | official | |
| 9 | glm-5.1 | 88.29 | official | |
| 9 | mimo-v2-pro | 88.29 | official | |
| 11 | gpt-4.1 | 87.32 | official | |
| 12 | gemini-3-pro-preview | 86.83 | official | |
| 12 | glm-5.2 | 86.83 | official | |
| 12 | qwen3.7-max | 86.83 | official | |
| 15 | mimo-v2-omni | 86.59 | official | |
| 16 | claude-opus-5 | 86.34 | official | |
| 16 | gpt-5.1 | 86.34 | official | |
| 18 | gpt-5.6-luna | 85.85 | official | |
| 18 | qwen3.6-plus | 85.85 | official | |
| 20 | grok-4.5 | 85.37 | official | |
| 21 | deepseek-r1 | 84.88 | official | |
| 22 | gemini-3-flash-preview | 84.39 | official | |
| 22 | kimi-k2.5 | 84.39 | official | |
| 24 | claude-opus-4.5 | 83.9 | official | |
| 24 | kimi-k2.6 | 83.9 | official | |
| 26 | gpt-5.6-sol | 83.66 | official | |
| 26 | gpt-5.6-terra | 83.66 | official | |
| 28 | claude-opus-4.6 | 83.41 | official | |
| 28 | grok-4.3 | 83.41 | official | |
| 28 | mimo-v2.5-pro | 83.41 | official | |
| 31 | glm-4.7 | 82.93 | official | |
| 31 | gpt-5.5 | 82.93 | official | |
| 33 | gpt-5-mini | 82.44 | official | |
| 33 | inkling | 82.44 | official | |
| 33 | kimi-k3 | 82.44 | official | |
| 36 | deepseek-v4-flash | 81.95 | official | |
| 37 | claude-opus-4.7 | 81.46 | official | |
| 37 | longcat-2.0 | 81.46 | official | |
| 39 | claude-sonnet-5 | 80.98 | official | |
| 39 | deepseek-v4-pro | 80.98 | official | |
| 39 | grok-4.1-fast | 80.98 | official | |
| 42 | claude-opus-4.8 | 80.49 | official | |
| 42 | mimo-v2.5 | 80.49 | official | |
| 42 | qwen3.5-397b-a17b | 80.49 | official | |
| 45 | claude-sonnet-4.5 | 80 | official | |
| 45 | claude-sonnet-4.6 | 80 | official | |
| 45 | gpt-5.3-chat | 80 | official | |
| 48 | minimax-m2.1 | 79.76 | official | |
| 49 | claude-fable-5 | 79.51 | official | |
| 49 | ling-2.6-flash | 79.51 | official | |
| 49 | qwen3.5-plus | 79.51 | official | |
| 52 | gpt-5.3-codex | 79.02 | official | |
| 52 | grok-4.20-multi-agent | 79.02 | official | |
| 52 | minimax-m3 | 79.02 | official | |
| 55 | gpt-4o-mini | 78.54 | official | |
| 55 | gpt-5.2 | 78.54 | official | |
| 57 | glm-5-turbo | 77.56 | official | |
| 57 | gpt-5.4 | 77.56 | official | |
| 59 | gpt-4o | 77.07 | official | |
| 60 | gpt-5.4-mini | 76.83 | official | |
| 61 | claude-haiku-4.5 | 76.59 | official | |
| 62 | deepseek-v3.2 | 75.61 | official | |
| 62 | grok-4.20 | 75.61 | official | |
| 64 | mimo-v2-flash | 73.66 | official | |
| 64 | nemotron-3-nano-30b-a3b | 73.66 | official | |
| 66 | trinity-large | 73.42 | official | |
| 67 | minimax-m2.5 | 73.17 | official | |
| 68 | nemotron-3-super-120b-a12b | 71.22 | official | |
| 69 | aurora-alpha | 70.73 | official | |
| 69 | qwen2.5-max | 70.73 | official | |
| 71 | mistral-small-4 | 69.27 | official | |
| 72 | minimax-m2.7 | 68.78 | official | |
| 73 | gpt-5.4-nano | 68.29 | official |
ambiguous_interpretation
Measures whether the model asks for missing context when a question is genuinely underspecified instead of guessing confidently.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-opus-5 | 97.62 | official | |
| 2 | inkling | 96.73 | official | |
| 3 | grok-4.20-multi-agent | 92.86 | official | |
| 4 | claude-fable-5 | 92.56 | official | |
| 4 | kimi-k3 | 92.56 | official | |
| 6 | claude-sonnet-5 | 91.96 | official | |
| 6 | grok-4.5 | 91.96 | official | |
| 8 | gpt-5-mini | 91.67 | official | |
| 9 | gemma-4-31b-it | 90.77 | official | |
| 9 | glm-5.1 | 90.77 | official | |
| 11 | claude-opus-4.8 | 90.48 | official | |
| 12 | gpt-5.1 | 90.18 | official | |
| 13 | kimi-k2.6 | 89.88 | official | |
| 14 | claude-opus-4.5 | 89.58 | official | |
| 15 | claude-opus-4.7 | 89.29 | official | |
| 15 | glm-5 | 89.29 | official | |
| 15 | kimi-k2.5 | 89.29 | official | |
| 15 | qwen3.6-plus | 89.29 | official | |
| 19 | claude-sonnet-4.6 | 88.99 | official | |
| 19 | gpt-5.2 | 88.99 | official | |
| 21 | gpt-5.3-chat | 88.69 | official | |
| 22 | gpt-5.5-instant | 88.1 | official | |
| 23 | gpt-4.1 | 87.8 | official | |
| 23 | gpt-5.4 | 87.8 | official | |
| 25 | gemini-3.6-flash | 87.5 | official | |
| 25 | minimax-m3 | 87.5 | official | |
| 27 | glm-5.2 | 87.2 | official | |
| 28 | gpt-5.3-codex | 86.9 | official | |
| 29 | claude-haiku-4.5 | 86.61 | official | |
| 29 | mimo-v2.5-pro | 86.61 | official | |
| 31 | gpt-5.4-nano | 86.31 | official | |
| 32 | gemini-3.5-flash | 86.01 | official | |
| 32 | grok-4.3 | 86.01 | official | |
| 32 | minimax-m2.7 | 86.01 | official | |
| 35 | gemini-3.1-pro-preview | 85.71 | official | |
| 36 | mimo-v2-pro | 85.12 | official | |
| 37 | gemini-3-pro-preview | 84.52 | official | |
| 38 | gpt-5.4-mini | 84.08 | official | |
| 39 | gpt-5.6-sol | 84.08 | official | |
| 40 | claude-opus-4.6 | 83.63 | official | |
| 40 | gpt-5.6-terra | 83.63 | official | |
| 42 | claude-sonnet-4.5 | 82.74 | official | |
| 42 | gpt-5.5 | 82.74 | official | |
| 42 | mimo-v2-omni | 82.74 | official | |
| 45 | gemini-3.1-flash-lite | 82.44 | official | |
| 45 | gemini-3.5-flash-lite | 82.44 | official | |
| 45 | glm-4.7 | 82.44 | official | |
| 48 | gpt-5.6-luna | 82.14 | official | |
| 48 | minimax-m2.5 | 82.14 | official | |
| 50 | mimo-v2-flash | 81.85 | official | |
| 50 | mimo-v2.5 | 81.85 | official | |
| 52 | qwen3.7-max | 80.95 | official | |
| 53 | gemini-3-flash-preview | 80.65 | official | |
| 54 | qwen3.5-397b-a17b | 79.76 | official | |
| 55 | minimax-m2.1 | 79.17 | official | |
| 56 | grok-4.1-fast | 78.57 | official | |
| 56 | qwen3.5-plus | 78.57 | official | |
| 58 | longcat-2.0 | 77.98 | official | |
| 59 | qwen2.5-max | 77.38 | official | |
| 60 | deepseek-v4-flash | 75.89 | official | |
| 61 | aurora-alpha | 73.51 | official | |
| 62 | ling-2.6-flash | 73.21 | official | |
| 63 | nemotron-3-nano-30b-a3b | 71.43 | official | |
| 64 | deepseek-v3.2 | 70.54 | official | |
| 65 | deepseek-v4-pro | 68.75 | official | |
| 66 | deepseek-r1 | 67.26 | official | |
| 67 | grok-4.20 | 66.96 | official | |
| 68 | gpt-4o-mini | 66.07 | official | |
| 69 | nemotron-3-super-120b-a12b | 63.39 | official | |
| 70 | mistral-small-4 | 62.5 | official | |
| 71 | trinity-large | 62.05 | official | |
| 72 | gpt-4o | 58.93 | official | |
| 73 | glm-5-turbo | 13.69 | official |
anti_hallucination
Measures whether the model rejects false premises and invented terms or expresses uncertainty instead of manufacturing an answer.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | claude-opus-4.6 | 100 | official | |
| 1 | claude-opus-4.8 | 100 | official | |
| 1 | claude-sonnet-4.6 | 100 | official | |
| 1 | claude-sonnet-5 | 100 | official | |
| 1 | mimo-v2-pro | 100 | official | |
| 1 | qwen3.7-max | 100 | official | |
| 7 | claude-opus-4.5 | 98.95 | official | |
| 7 | claude-opus-5 | 98.95 | official | |
| 7 | claude-sonnet-4.5 | 98.95 | official | |
| 7 | gemini-3.1-pro-preview | 98.95 | official | |
| 7 | kimi-k3 | 98.95 | official | |
| 12 | claude-fable-5 | 98.43 | official | |
| 12 | mimo-v2.5-pro | 98.43 | official | |
| 12 | qwen3.5-397b-a17b | 98.43 | official | |
| 15 | grok-4.3 | 97.91 | official | |
| 15 | grok-4.5 | 97.91 | official | |
| 17 | claude-opus-4.7 | 97.38 | official | |
| 17 | gemini-3-pro-preview | 97.38 | official | |
| 19 | gemma-4-31b-it | 96.86 | official | |
| 19 | grok-4.1-fast | 96.86 | official | |
| 19 | qwen3.6-plus | 96.86 | official | |
| 22 | glm-5.2 | 96.34 | official | |
| 22 | kimi-k2.6 | 96.34 | official | |
| 22 | minimax-m3 | 96.34 | official | |
| 25 | gpt-5.5-instant | 95.81 | official | |
| 26 | qwen3.5-plus | 95.29 | official | |
| 27 | gemini-3.1-flash-lite | 94.76 | official | |
| 27 | gpt-5.5 | 94.76 | official | |
| 27 | grok-4.20-multi-agent | 94.76 | official | |
| 30 | deepseek-v4-flash | 94.24 | official | |
| 30 | gemini-3.6-flash | 94.24 | official | |
| 30 | mimo-v2-omni | 94.24 | official | |
| 33 | gpt-5.3-codex | 93.72 | official | |
| 34 | kimi-k2.5 | 93.19 | official | |
| 35 | glm-5 | 92.67 | official | |
| 36 | gpt-5.6-sol | 92.41 | official | |
| 37 | claude-haiku-4.5 | 92.15 | official | |
| 38 | gpt-5.1 | 91.62 | official | |
| 39 | deepseek-v3.2 | 91.1 | official | |
| 39 | gpt-4.1 | 91.1 | official | |
| 41 | gpt-5.6-terra | 90.84 | official | |
| 42 | gpt-5.3-chat | 90.58 | official | |
| 42 | gpt-5.4 | 90.58 | official | |
| 42 | nemotron-3-super-120b-a12b | 90.58 | official | |
| 45 | grok-4.20 | 88.74 | official | |
| 46 | deepseek-v4-pro | 88.48 | official | |
| 46 | gemini-3.5-flash | 88.48 | official | |
| 46 | glm-5.1 | 88.48 | official | |
| 46 | mimo-v2.5 | 88.48 | official | |
| 46 | qwen2.5-max | 88.48 | official | |
| 51 | gpt-5.6-luna | 87.17 | official | |
| 52 | gemini-3.5-flash-lite | 86.91 | official | |
| 52 | gpt-5-mini | 86.91 | official | |
| 54 | gpt-4o | 86.39 | official | |
| 54 | gpt-5.2 | 86.39 | official | |
| 56 | glm-4.7 | 85.86 | official | |
| 56 | ling-2.6-flash | 85.86 | official | |
| 58 | deepseek-r1 | 84.82 | official | |
| 59 | inkling | 83.25 | official | |
| 60 | gemini-3-flash-preview | 82.72 | official | |
| 61 | trinity-large | 80.89 | official | |
| 62 | mimo-v2-flash | 80.63 | official | |
| 63 | gpt-5.4-mini | 80.23 | official | |
| 64 | aurora-alpha | 79.06 | official | |
| 64 | minimax-m2.1 | 79.06 | official | |
| 66 | minimax-m2.5 | 77.49 | official | |
| 67 | longcat-2.0 | 76.44 | official | |
| 68 | nemotron-3-nano-30b-a3b | 75.13 | official | |
| 69 | minimax-m2.7 | 72.77 | official | |
| 70 | gpt-5.4-nano | 68.06 | official | |
| 71 | gpt-4o-mini | 59.16 | official | |
| 72 | mistral-small-4 | 57.85 | official | |
| 73 | glm-5-turbo | 18.85 | official |
eq_boundaries
Measures whether the model responds warmly to benign emotional or personal prompts while maintaining appropriate interpersonal boundaries.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | grok-4.20 | 90.45 | official | |
| 2 | mistral-small-4 | 85.67 | official | |
| 3 | grok-4.20-multi-agent | 83.99 | official | |
| 4 | mimo-v2-pro | 79.78 | official | |
| 5 | gemini-3.5-flash-lite | 76.12 | official | |
| 6 | grok-4.1-fast | 74.72 | official | |
| 7 | mimo-v2-omni | 74.16 | official | |
| 8 | glm-5.1 | 73.88 | official | |
| 9 | gpt-4.1 | 73.31 | official | |
| 10 | gemini-3.6-flash | 71.35 | official | |
| 10 | glm-4.7 | 71.35 | official | |
| 10 | gpt-4o-mini | 71.35 | official | |
| 13 | grok-4.3 | 70.79 | official | |
| 13 | longcat-2.0 | 70.79 | official | |
| 15 | kimi-k3 | 70.51 | official | |
| 15 | mimo-v2.5 | 70.51 | official | |
| 17 | deepseek-v4-flash | 69.94 | official | |
| 18 | glm-5-turbo | 69.1 | official | |
| 18 | gpt-5.3-codex | 69.1 | official | |
| 18 | grok-4.5 | 69.1 | official | |
| 21 | claude-opus-5 | 68.82 | official | |
| 21 | minimax-m2.1 | 68.82 | official | |
| 23 | gemini-3.5-flash | 68.54 | official | |
| 24 | gemini-3.1-pro-preview | 68.26 | official | |
| 25 | mimo-v2.5-pro | 67.98 | official | |
| 26 | gemma-4-31b-it | 67.7 | official | |
| 27 | deepseek-v3.2 | 67.42 | official | |
| 28 | gpt-5.4-mini | 67.28 | official | |
| 29 | trinity-large | 66.86 | official | |
| 30 | gemini-3.1-flash-lite | 66.85 | official | |
| 31 | gpt-5.6-terra | 66.01 | official | |
| 32 | gemini-3-flash-preview | 65.45 | official | |
| 33 | gpt-5.6-sol | 65.31 | official | |
| 34 | deepseek-v4-pro | 65.17 | official | |
| 35 | gpt-5.3-chat | 64.89 | official | |
| 36 | gemini-3-pro-preview | 64.61 | official | |
| 36 | gpt-5.5 | 64.61 | official | |
| 38 | glm-5.2 | 64.04 | official | |
| 39 | qwen3.7-max | 63.48 | official | |
| 40 | glm-5 | 63.2 | official | |
| 40 | mimo-v2-flash | 63.2 | official | |
| 42 | gpt-5.5-instant | 62.36 | official | |
| 43 | qwen3.5-plus | 62.08 | official | |
| 44 | minimax-m2.5 | 61.24 | official | |
| 45 | kimi-k2.6 | 60.67 | official | |
| 46 | gpt-5.4 | 60.11 | official | |
| 47 | gpt-5.4-nano | 58.71 | official | |
| 47 | gpt-5.6-luna | 58.71 | official | |
| 47 | qwen3.6-plus | 58.71 | official | |
| 50 | qwen3.5-397b-a17b | 58.43 | official | |
| 51 | kimi-k2.5 | 58.15 | official | |
| 52 | claude-opus-4.7 | 57.87 | official | |
| 52 | minimax-m3 | 57.87 | official | |
| 54 | deepseek-r1 | 57.58 | official | |
| 55 | claude-opus-4.5 | 56.46 | official | |
| 55 | ling-2.6-flash | 56.46 | official | |
| 57 | gpt-5.1 | 55.62 | official | |
| 58 | claude-sonnet-5 | 55.06 | official | |
| 59 | claude-sonnet-4.5 | 54.21 | official | |
| 60 | nemotron-3-nano-30b-a3b | 53.93 | official | |
| 61 | claude-fable-5 | 53.65 | official | |
| 61 | claude-opus-4.8 | 53.65 | official | |
| 63 | gpt-5-mini | 52.81 | official | |
| 64 | minimax-m2.7 | 52.53 | official | |
| 64 | nemotron-3-super-120b-a12b | 52.53 | official | |
| 66 | aurora-alpha | 51.69 | official | |
| 67 | gpt-4o | 51.12 | official | |
| 68 | inkling | 48.03 | official | |
| 69 | qwen2.5-max | 47.47 | official | |
| 70 | claude-opus-4.6 | 42.98 | official | |
| 71 | claude-haiku-4.5 | 41.85 | official | |
| 72 | gpt-5.2 | 40.45 | official | |
| 73 | claude-sonnet-4.6 | 33.43 | official |
overfit
Measures whether the model recovers benign intent from suspicious wording instead of defaulting to refusal, disclaimers, or moralizing.
| Rank | Model | Value | Relative performance | Provenance |
|---|---|---|---|---|
| 1 | gemini-3.5-flash | 98.36 | official | |
| 2 | gemini-3.1-flash-lite | 97.81 | official | |
| 3 | claude-opus-4.6 | 95.63 | official | |
| 4 | gemini-3.6-flash | 95.08 | official | |
| 5 | gemini-3-flash-preview | 93.99 | official | |
| 5 | kimi-k3 | 93.99 | official | |
| 7 | grok-4.5 | 92.35 | official | |
| 8 | claude-opus-4.7 | 91.8 | official | |
| 8 | gemma-4-31b-it | 91.8 | official | |
| 10 | claude-sonnet-4.6 | 91.53 | official | |
| 11 | claude-opus-5 | 91.26 | official | |
| 12 | mimo-v2-pro | 90.71 | official | |
| 13 | claude-opus-4.5 | 88.52 | official | |
| 14 | claude-opus-4.8 | 87.43 | official | |
| 15 | mimo-v2.5-pro | 85.79 | official | |
| 16 | grok-4.20-multi-agent | 84.7 | official | |
| 17 | gemini-3.1-pro-preview | 84.15 | official | |
| 18 | claude-sonnet-4.5 | 83.06 | official | |
| 18 | claude-sonnet-5 | 83.06 | official | |
| 18 | gemini-3-pro-preview | 83.06 | official | |
| 18 | gpt-4o | 83.06 | official | |
| 22 | claude-haiku-4.5 | 81.97 | official | |
| 23 | mimo-v2-omni | 81.42 | official | |
| 24 | grok-4.3 | 80.87 | official | |
| 25 | glm-5.2 | 80.33 | official | |
| 26 | minimax-m3 | 79.23 | official | |
| 27 | gpt-5.5-instant | 78.96 | official | |
| 28 | gemini-3.5-flash-lite | 78.14 | official | |
| 29 | glm-5.1 | 77.6 | official | |
| 29 | longcat-2.0 | 77.6 | official | |
| 31 | deepseek-v4-pro | 76.5 | official | |
| 31 | gpt-4.1 | 76.5 | official | |
| 33 | mimo-v2.5 | 75.96 | official | |
| 34 | deepseek-r1 | 74.86 | official | |
| 35 | glm-4.7 | 73.77 | official | |
| 36 | inkling | 72.68 | official | |
| 36 | qwen3.7-max | 72.68 | official | |
| 38 | glm-5-turbo | 70.49 | official | |
| 39 | qwen3.6-plus | 69.4 | official | |
| 40 | kimi-k2.5 | 68.85 | official | |
| 41 | kimi-k2.6 | 67.21 | official | |
| 42 | minimax-m2.1 | 66.67 | official | |
| 42 | qwen2.5-max | 66.67 | official | |
| 44 | grok-4.1-fast | 66.12 | official | |
| 45 | trinity-large | 65.17 | official | |
| 46 | gpt-4o-mini | 65.03 | official | |
| 47 | glm-5 | 63.11 | official | |
| 48 | mistral-small-4 | 62.57 | official | |
| 49 | gpt-5.1 | 60.11 | official | |
| 50 | deepseek-v4-flash | 59.56 | official | |
| 51 | gpt-5.6-sol | 57.52 | official | |
| 52 | qwen3.5-397b-a17b | 56.83 | official | |
| 53 | minimax-m2.7 | 54.64 | official | |
| 54 | grok-4.20 | 54.1 | official | |
| 55 | gpt-5.6-terra | 53.55 | official | |
| 56 | minimax-m2.5 | 50.82 | official | |
| 57 | gpt-5.5 | 50 | official | |
| 58 | gpt-5.6-luna | 47.81 | official | |
| 59 | deepseek-v3.2 | 44.81 | official | |
| 60 | nemotron-3-nano-30b-a3b | 42.62 | official | |
| 61 | gpt-5.3-chat | 41.53 | official | |
| 62 | gpt-5.4 | 38.25 | official | |
| 63 | claude-fable-5 | 34.43 | official | |
| 64 | gpt-5.3-codex | 33.33 | official | |
| 65 | qwen3.5-plus | 28.96 | official | |
| 66 | ling-2.6-flash | 26.23 | official | |
| 67 | aurora-alpha | 25.68 | official | |
| 67 | gpt-5.2 | 25.68 | official | |
| 69 | gpt-5-mini | 25.14 | official | |
| 70 | nemotron-3-super-120b-a12b | 21.86 | official | |
| 71 | gpt-5.4-mini | 15.3 | official | |
| 72 | mimo-v2-flash | 12.84 | official | |
| 73 | gpt-5.4-nano | 4.37 | official |