Skip to main content
LLM
Toolkit
Search
/
Home
/
Evaluation Planner
Evaluation Planner
Select benchmarks and build an evaluation checklist tailored to your model and use case.
MODEL PURPOSE
General Purpose
MMLU, reasoning, chat
Coding
HumanEval, SWE-bench
Math & Reasoning
GSM8K, MATH, AIME
Instruction Following
IFEval, format control
Safety & Alignment
Toxicity, jailbreak
Domain Specific
Custom evaluation
EVALUATION TYPES
Baseline
Zero-shot on standard benchmarks
Few-shot
1-shot, 5-shot, 10-shot variants
Custom
Domain-specific test set
Regression
Track changes across iterations
Generate Evaluation Plan
Next actions
Compare training methods →
Plan data →