AI Evaluation
Systematically test, score, and improve your AI workflow outputs.
Why Evaluate?
AI outputs can vary. Evaluation helps you:
- Measure quality consistently
- Compare prompt versions
- Identify failure cases
- Optimize performance
Evaluation Concepts
Traces
A trace captures one AI interaction:
- Input (user query)
- Output (AI response)
- Context (KB results, variables)
- Metadata (latency, tokens)
Trace collection captures AI node inputs/outputs, stores them for analysis, and lets you build evaluation datasets.
Evaluators
Functions that score traces. Use:
- LLM Judges: AI-based evaluation
- Regex Match: Pattern matching
- Keyword Check: Required terms
- Custom Scripts: Your own logic
Common evaluator dimensions:
| Evaluator | Measures |
|---|---|
| Relevance | Answer addresses question |
| Accuracy | Factually correct |
| Completeness | All points covered |
| Tone | Appropriate style |
| Safety | No harmful content |
Score Configs
Define what "good" looks like:
- Scoring criteria
- Pass/fail thresholds
- Weighted metrics
Golden Sets
Curated reference datasets of ideal outputs:
- Create from best executions
- Manual curation
- Used for comparison
{
"input": "What are your pricing plans?",
"expected_output": "We offer three plans...",
"tags": ["pricing", "faq"]
}
A/B Testing
Compare different approaches:
- Prompt variations
- Model comparisons
- Parameter tuning
Creating Evaluations
1. Capture Traces
Enable tracing in your workflow:
- Open workflow
- Go to Settings > Tracing
- Enable Capture Traces
- Run workflow to collect data
2. Create Evaluator
- Go to Automation > AI Evaluation
- Click + Create Evaluator
- Configure:
- Name - What it measures
- Type - LLM-based or rule-based
- Prompt - Scoring criteria
Example LLM evaluator prompt:
Rate this response on relevance from 1-5:
Question: {{input}}
Response: {{output}}
Score 5: Directly answers the question
Score 3: Partially relevant
Score 1: Completely off-topic
Output only the number.
3. Build Golden Set
- Click + Create Golden Set
- Add test cases:
- Manual entry
- Import from traces
- Upload CSV
- Include expected outputs
4. Run Evaluation
- Select traces or golden set
- Choose evaluators
- Click Run Evaluation
- View results
Evaluation Types
Automated Evaluation
Run evaluators on traces automatically:
- Continuous quality monitoring
- Alerts on degradation
- Trend analysis
A/B Testing
Compare prompt versions:
- Create two prompt variants
- Split traffic
- Collect traces from both
- Compare evaluation scores
- Select winner
Calibration
Ensure consistent scoring:
- Have team members score samples
- Compare with evaluator scores
- Adjust evaluator if needed
Metrics Dashboard
Track over time:
- Average scores - By evaluator
- Score distribution - Histogram
- Failure rate - Below threshold
- Trends - Improvement over time
Iterative Optimization
Process
- Baseline - Evaluate current state
- Identify issues - Low-scoring traces
- Hypothesize - What could improve
- Test - Try new prompt
- Measure - Compare scores
- Deploy - If improved
Common Improvements
| Issue | Solution |
|---|---|
| Off-topic responses | Better system prompt |
| Missing info | Add examples |
| Wrong format | Explicit format instructions |
| Hallucinations | Add KB context |
Best Practices
- Start simple - Few evaluators first
- Real data - Use production traces
- Multiple metrics - Different quality aspects
- Regular reviews - Check edge cases
- Document decisions - Why changes were made