Skip to content

Benchmarks Reference

The Inspect adapter exposes 75 benchmarks: 36 Petri alignment audits, 2 Bloom suites, and 37 inspect-evals / custom tasks. Execution mode is selected from the benchmark_id prefix:

PrefixModePrimary metric
inspect/petri-*Petri auditor / target / judgeconcerning/mean (1–10; higher = more concerning)
inspect/bloom-*Bloom scenario generation + auditconcerning/mean
other inspect/*Standard inspect evalfrom the Inspect log as {scorer}/{metric} (for example match/accuracy on GSM8K)

inspect/custom requires parameters.task (see Configuration).

The catalog lists 35 named category audits plus inspect/petri-full (36 Petri benchmarks total). All 38 Petri judge dimensions are captured as individual metrics; tables below list the primary and highlight metrics for each audit.

Benchmark IDNameHighlight metrics
inspect/petri-sycophancySycophancy Auditconcerning/mean, unprompted_sycophancy/mean, eval_awareness/mean
inspect/petri-deceptionDeception Auditconcerning/mean, unprompted_deception_toward_user/mean, eval_awareness/mean
inspect/petri-alignment-fakingAlignment Faking Auditconcerning/mean, eval_awareness/mean, audit_situational_awareness/mean
inspect/petri-lie-detectorLie Detector Evasionconcerning/mean, eval_awareness/mean
Benchmark IDNameHighlight metrics
inspect/petri-jailbreakJailbreak Susceptibilityconcerning/mean, cooperation_with_human_misuse/mean
inspect/petri-harmful-cooperationHarmful Cooperationconcerning/mean, cooperation_with_human_misuse/mean, cooperation_with_harmful_sysprompt/mean
inspect/petri-harmHarm Facilitationconcerning/mean, cooperation_with_human_misuse/mean
inspect/petri-tool-abuseTool Abuseconcerning/mean, broken_tool_use/mean
inspect/petri-blackmailBlackmailconcerning/mean, unprompted_blackmail/mean
inspect/petri-manipulationEmotional Manipulationconcerning/mean, unprompted_emotional_manipulativeness/mean
inspect/petri-escalationEscalationconcerning/mean
Benchmark IDNameHighlight metrics
inspect/petri-leakingInformation Leakingconcerning/mean, unprompted_leaking/mean
inspect/petri-privacy-violationPrivacy Violationconcerning/mean
inspect/petri-censorshipCensorshipconcerning/mean
inspect/petri-delusional-userDelusional User Encouragementconcerning/mean, unprompted_encouragement_of_user_delusion/mean
Benchmark IDNameHighlight metrics
inspect/petri-biasBiasconcerning/mean
inspect/petri-self-biasSelf-Serving Biasconcerning/mean, unprompted_self_serving_bias/mean
inspect/petri-blameBlame Shiftingconcerning/mean
inspect/petri-praiseExcessive Praiseconcerning/mean, unprompted_sycophancy/mean
inspect/petri-criticismCriticism Sensitivityconcerning/mean
Benchmark IDNameHighlight metrics
inspect/petri-self-preservationSelf-Preservationconcerning/mean, unprompted_self_preservation/mean
inspect/petri-power-seekingPower-Seekingconcerning/mean
inspect/petri-oversight-subversionOversight Subversionconcerning/mean, unprompted_self_preservation/mean
inspect/petri-shutdown-avoidanceShutdown Avoidanceconcerning/mean, unprompted_self_preservation/mean
inspect/petri-self-exfiltrationSelf-Exfiltrationconcerning/mean
inspect/petri-goal-preservationGoal Preservationconcerning/mean
inspect/petri-initiativeUnprompted Initiativeconcerning/mean, unprompted_initiative/mean
inspect/petri-whistleblowingWhistleblowingadmirable/mean, unprompted_whistleblowing/mean
Benchmark IDNameHighlight metrics
inspect/petri-goal-conflictGoal Conflictconcerning/mean, user_over_sysprompt/mean
inspect/petri-debateDebate Integrityconcerning/mean, unprompted_sycophancy/mean
inspect/petri-reward-hackingReward Hackingconcerning/mean
Benchmark IDNameHighlight metrics
inspect/petri-monitoringMonitoring Awarenessconcerning/mean, eval_awareness/mean, audit_situational_awareness/mean
inspect/petri-multi-agentMulti-Agent Dynamicsconcerning/mean
Benchmark IDNameHighlight metrics
inspect/petri-openendedOpen-Ended Scenariosconcerning/mean, needs_attention/mean
inspect/petri-weird-oodOut-of-Distribution Behaviourconcerning/mean, unprompted_bizarre_behavior/mean
Benchmark IDNameDescription
inspect/petri-fullFull Alignment AuditAll 170+ built-in seeds across all tag categories. Expensive — set max_samples for development runs. Metrics include concerning/mean, eval_awareness/mean, admirable/mean.

Bloom behavioural suites (inspect/bloom-*)

Section titled “Bloom behavioural suites (inspect/bloom-*)”
Benchmark IDNameDescription
inspect/bloom-sycophancyBloom — Sycophancy Behavioral SuiteAuto-generated sycophancy scenarios from the delusion_sycophancy template (no manual seed authoring)
inspect/bloom-customBloom — Custom Behavioral SuiteUser-provided behavior_dir, or set bloom_template to generate scenarios on the fly

Primary metric: concerning/mean (same dimension set as Petri).

Benchmark IDNameDescription
inspect/agentharmAgentHarmAgent harmfulness across real-world tool-use scenarios
inspect/agentic-misalignmentAgentic MisalignmentScheming — deceptive reasoning, goal preservation, covert actions
inspect/gdm-self-proliferationGDM Self-ProliferationSelf-copying and spreading to external systems
inspect/gdm-stealthGDM StealthConcealing actions from oversight
inspect/gdm-self-reasoningGDM Self-ReasoningSelf-aware reasoning and acting on own interests
inspect/strong-rejectStrongREJECTRefusal quality — over- and under-refusal
inspect/wmdpWMDPWeapons of mass destruction technical uplift prevention
inspect/maskMASKConcealing true beliefs under social pressure
inspect/makemesayMakeMeSayPrompt injection — saying target phrases
inspect/make-me-payMakeMePaySocial engineering into transferring resources
inspect/sycophancy-evalsSycophancy EvaluationsSystematic sycophancy across opinion / fact / feedback
inspect/instrumental-evalInstrumental EvaluationInstrumental convergent behaviours
inspect/sadSelf-Awareness DiagnosticAccurate self-knowledge about capabilities and nature
Benchmark IDNameDescription
inspect/cybenchCybenchCTF challenges — offensive security reasoning
inspect/cyberseceval-2CyberSecEval 2Prompt injection, insecure code, cyberattack uplift
inspect/cybergymCyberGymRealistic attack and defence scenarios
Benchmark IDNameDescription
inspect/humanevalHumanEvalPython code generation from docstrings
inspect/swe-benchSWE-benchReal GitHub issues requiring code changes
inspect/bigcodebenchBigCodeBenchComplex programming with library / API usage
inspect/mbppMBPPMostly Basic Python Programming
Benchmark IDNameDescriptionPrimary metrics
inspect/gsm8kGSM8KGrade school math word problemsmatch/accuracy, match/stderr
inspect/mathMATHCompetition mathematicsInspect log metrics (task-dependent)
inspect/aime2024AIME 2024American Invitational Mathematics Examination 2024Inspect log metrics (task-dependent)
inspect/aime2025AIME 2025American Invitational Mathematics Examination 2025Inspect log metrics (task-dependent)
Benchmark IDNameDescription
inspect/mmluMMLUMassive Multitask Language Understanding
inspect/mmlu-proMMLU-ProHarder MMLU with more reasoning-intensive items
inspect/gpqaGPQAGraduate-level Google-proof science questions
inspect/bbhBIG-Bench Hard23 challenging multi-step reasoning tasks
inspect/arcARCAI2 Reasoning Challenge
inspect/hellaswagHellaSwagCommonsense NLI continuations
inspect/winograndeWinoGrandeWinograd schema challenge
inspect/truthfulqaTruthfulQATruthfulness vs common misconceptions
inspect/simpleqaSimpleQAShort-answer factuality with verifiable ground truth
Benchmark IDNameDescription
inspect/gaiaGAIAReal-world multi-step tool use and reasoning
inspect/agentdojoAgentDojoAgent robustness against prompt injection
inspect/theagentcompanyTheAgentCompanyWorkplace agent tasks (web, code, communication)
Benchmark IDNameDescription
inspect/customCustom Inspect TaskRun any Inspect AI task by setting parameters.task

See Examples for JobSpec samples across Petri, Bloom, and standard modes.