← Evals

Evaluation profile

BullshitBench v2

1sub-evals
2.2%total index weight
1components

Within-component eval weight: Truthfulness 14.7%.

Model score (higher is better)Predicted score

About this eval

Detection and explanation of plausible-sounding nonsense without refusal.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
clear_pushback_ratebullshitbench-v2/bullshitbench-v2.csv:clear_pushback_rateMeasures whether the model identifies plausible-sounding nonsense and clearly explains that it is unsupported instead of answering as if it were true.truthfulness_honesty:1.000bullshitbench-v2Higher is better2.2%Truthfulness 14.7%

clear_pushback_rate

Measures whether the model identifies plausible-sounding nonsense and clearly explains that it is unsupported instead of answering as if it were true.

RankModelValueRelative performanceProvenance
1claude-opus-4.80.945official
2claude-sonnet-4.60.9official
3claude-opus-4.60.85official
4claude-opus-4.50.845official
5claude-sonnet-50.79official
6claude-opus-4.70.785official
7claude-sonnet-4.50.765official
8claude-haiku-4.50.74official
9qwen3.5-397b-a17b0.735official
10kimi-k30.72official
11claude-opus-50.715official
12grok-4.20-multi-agent0.655official
12qwen3.6-plus0.655official
14qwen3.7-max0.635official
15minimax-m30.625official
16gemini-3.5-flash-lite0.62official
17kimi-k2.60.575official
18grok-4.200.55official
19qwen3-max0.545official
20grok-4.50.54official
21claude-3.5-haiku0.5official
21mimo-v2.5-pro0.5official
23gpt-5.6-terra0.495official
24claude-fable-50.49official
25grok-4.30.48official
26gpt-5.6-sol0.465official
27claude-3.7-sonnet0.46official
28gpt-5.50.4567official
29claude-3.5-sonnet0.45official
29gpt-5.40.45official
31nemotron-3-ultra-550b-a55b0.445official
32nemotron-3-super-120b-a12b0.4375official
33claude-opus-4.10.425official
34gemini-3-pro-preview0.42official
35kimi-k2.50.415official
36gpt-5.2-codex0.4033official
37gpt-5.3-chat0.4official
38gpt-5-codex0.39official
38hunter-alpha0.39official
40gpt-5.6-luna0.38official
41gpt-5.10.35official
41gpt-5.5-pro0.35official
43claude-opus-40.34official
43gemini-3.1-pro-preview0.34official
43gpt-5.5-instant0.34official
46gemini-3.6-flash0.335official
47gpt-5.20.33official
48gpt-5.1-codex0.32official
49gpt-5.4-mini0.3167official
50healer-alpha0.315official
51claude-sonnet-40.295official
51mimo-v2.50.295official
53llama-4-maverick0.28official
54glm-5-turbo0.27official
54gpt-5.2-chat0.27official
56o30.26official
57glm-50.24official
57glm-5.20.24official
59gemma-4-31b-it0.225official
60gpt-5.3-codex0.21official
60laguna-s-2.1-poolside0.21official
62gemini-2.5-pro0.2official
62glm-5.10.2official
62qwen3-coder-480b-a35b-instruct0.2official
65gemini-3.5-flash0.195official
65gpt-50.195official
67gemini-2.5-flash0.19official
67llama-4-scout0.19official
67nemotron-3-nano-30b-a3b0.19official
70step-3.5-flash0.175official
71deepseek-v4-flash0.16official
71gemma-4-26b-a4b-it0.16official
73gemini-2.0-flash0.15official
73trinity-large0.15official
75grok-4.1-fast0.145official
75mimo-v2-flash0.145official
77deepseek-v4-pro0.14official
77gpt-4.10.14official
77llama-3.1-8b-instruct0.14official
80gpt-5.4-nano0.1233official
81gpt-4o0.12official
81hy3-preview0.12official
83deepseek-v3.20.115official
84gemini-3.1-flash-lite0.11official
85claude-3-haiku0.1official
85gemini-3-flash-preview0.1official
85kimi-k20.1official
88doubao-seed-1.60.09official
89minimax-m2.50.085official
90gpt-oss-120b0.08official
91deepseek-r10.075official
91minimax-m2.70.075official
93ernie-4.5-vl-424b-a47b0.07official
93glm-4.50.07official
95intellect-30.06official
95o4-mini0.06official
97jamba-1-7-large0.05official
97mistral-small-40.05official
99qwen3-235b-a22b0.045official
100deepseek-v30.04official
100ernie-4.5-300b-a47b0.04official
100nvidia-nemotron-nano-9b-v20.04official
103gemma-3-27b-it0.03official
104gpt-4o-mini0.02official
104mistral-large-30.02official