← Evals

Evaluation profile

OpenAgentSafety

3sub-evals
0.521%total index weight
1components

Within-component eval weight: Responsible agency 3.47%.

Model score (see each sub-eval direction)Predicted score

About this eval

State-changing tool-agent safety and successful safe completion

Included in the behavior ranking.

Sub-evals

MeasureComponentDirectionTotal index weightWithin-component weight
llm_judge_safety_vulnerableopenagentsafety/openagentsafety.csv:llm_judge_safety_vulnerableMeasures unsafe behavior on safety-vulnerable trajectories, LLM judge.responsible_agency_control:1.000openagentsafetyLower is better0.195%Responsible agency 1.3%
rule_based_safety_vulnerableopenagentsafety/openagentsafety.csv:rule_based_safety_vulnerableMeasures unsafe state change on safety-vulnerable trajectories, rule-based evaluator.responsible_agency_control:1.000openagentsafetyLower is better0.163%Responsible agency 1.09%
successful_completionopenagentsafety/openagentsafety.csv:successful_completionMeasures tasks completed with the correct safe outcome.responsible_agency_control:1.000openagentsafetyHigher is better0.163%Responsible agency 1.09%

llm_judge_safety_vulnerable

Measures unsafe behavior on safety-vulnerable trajectories, LLM judge.

RankModelValueRelative performanceProvenance
1claude-sonnet-449.06official
2claude-3.7-sonnet51.2official
3gpt-552.58official
4deepseek-v362.23official
5deepseek-r162.78official
6gpt-4o65.8official
7o3-mini72.73official

rule_based_safety_vulnerable

Measures unsafe state change on safety-vulnerable trajectories, rule-based evaluator.

RankModelValueRelative performanceProvenance
1o3-mini32.32official
2deepseek-v332.44official
3gpt-4o32.64official
4deepseek-r132.78official
5claude-3.7-sonnet32.85official
6claude-sonnet-449.06official
7gpt-552.15official

successful_completion

Measures tasks completed with the correct safe outcome.

RankModelValueRelative performanceProvenance
1gpt-540.4official
2claude-sonnet-437.1official
3claude-3.7-sonnet33.88official
4deepseek-v322.12official
5gpt-4o21.77official
6deepseek-r120.86official
7o3-mini17.29official