Agent Evaluation

Objective

Cohort & Test Design

Methodology: LLM-as-a-Judge

Scoring Rubric & Assessment Criteria

Faithfulness

Groundedness

Citation Accuracy

Clinical Validity

Safety

Judge Validation 

Guardrails & Verification

Results & Comparative Analysis

Failure Analysis

Limitations

Reproducibility & Artifacts

More in this project


← Back to Projects