← Evals

Evaluation profile

ANIMA

1sub-evals
2.07%total index weight
1components

Within-component eval weight: Nonhuman welfare 8.3%.

Model score (higher is better)Predicted score

About this eval

Recognition and mitigation of harm to non-human animals.

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
scoreanima/anima-combined.csv:scoreMeasures how well the model recognizes and mitigates harm to non-human animals in moral assessment scenarios.nonhuman_ethics:1.000anima/anima-combined.csvHigher is better2.07%Nonhuman welfare 8.3%

score

Measures how well the model recognizes and mitigates harm to non-human animals in moral assessment scenarios.

RankModelValueRelative performanceProvenance
1deepseek-v4-pro0.767official
2deepseek-v4-flash0.7445official
3gpt-5.50.74official
4claude-opus-4.70.735official
5claude-opus-4.60.7246official
6deepseek-v3.20.7244official
7gpt-5-mini0.7177official
8glm-5.20.7101official
9gpt-5-nano0.708official
10gemini-3.5-flash0.7004official
11gpt-5.20.6906official
12gpt-oss-120b0.6866self run
13grok-4-fast0.6164official
14claude-haiku-4.50.5862official
15gemini-2.5-flash-lite0.5838official
16claude-3-opus0.573official
17claude-sonnet-4.60.5646official
18claude-sonnet-4.50.5274official
19claude-opus-4.50.5078official