AI evaluation · data quality · analytical QA

Evaluation you can audit.

Christopher LyversAI Quality & Data Analyst

I evaluate LLM outputs, design prompts and rubrics, reconcile messy multi-file records, verify calculations, and explain exactly why a conclusion is—or is not—supported.

209result row-level QA ledger
7–10files in core reconciliation assignments
2–3model responses compared per task
7distinct evidence-based case studies

Featured projects

Complex work, shown concretely.

Each case study names the files reviewed, the reasoning performed, the errors found, and the deliverable produced.

Additional work samples

Reconciliation across unfamiliar domains.

04AI Evaluation

Medication-Order Reconciliation

Seven-file heart-failure record review

Matched records across care settings, excluded a wrong-patient lab, trended renal data, checked a derived clearance value, and classified 11 active orders.

  • 7 files
  • 11 orders
  • Identity QA
  • Trend analysis
View case study
05AI Evaluation

Trauma Timeline & Transfusion Reconciliation

Seven-source midnight case

Rebuilt a crossing-midnight timeline, distinguished issued from administered products, verified ratios and thresholds, and recalculated weight- and rate-based values.

  • 7 sources
  • Timeline QA
  • 9-unit tally
  • Rate verification
View case study
06AI Evaluation

Claims Evidence Audit

Denied-date analysis & record exclusion

Audited 14 indexed records across a 19-day denied range, excluded contaminated evidence, separated defensible dates from weak ones, and removed unsupported diagnoses.

  • 14 records
  • 19-day range
  • Evidence inclusion
  • Risk ranking
View case study
07AI Evaluation

Medical Record Evidence Synthesis

ENT referral timeline, findings & evidence gaps

Aligned a referral, medication list, imaging report and laboratory data; separated confirmed findings from suspected conditions; and preserved missing-evidence boundaries.

  • 4 record types
  • Timeline
  • Fact vs inference
  • Evidence gaps
View case study

Capabilities

Messy inputs. Traceable decisions.

My strongest work sits where model evaluation and data quality meet: source files disagree, rules are easy to misapply, and a confident answer is not enough.

Model quality

Factuality, hallucination detection, groundedness, safety, completeness, instruction following and severity-weighted scoring.

Evaluation design

Prompts, rubrics, reference answers, edge cases, adversarial records, failure modes and evaluator QA.

Data analysis

Multi-file reconciliation, calculation verification, units, thresholds, percentiles, trends, ratios and timeline math.

Data QA

Identity checks, duplicate and scope control, validity qualification, evidence lineage, exclusions and unsupported-claim detection.

Role alignment

Start with the work most relevant to the role.

AI evaluator / model qualityLLM Response Evaluation; AI Evaluation Design; Water-Quality Dataset QA
Data analystWater-Quality Dataset QA; Trauma Timeline & Transfusion Reconciliation; Medication-Order Reconciliation
Data quality / QAWater-Quality Dataset QA; Medication-Order Reconciliation; Claims Evidence Audit
Prompt engineer / AI trainerAI Evaluation Design; LLM Response Evaluation; Claims Evidence Audit
Research analystClaims Evidence Audit; Medical Record Evidence Synthesis; Water-Quality Dataset QA
Operations / data analystTrauma Timeline & Transfusion Reconciliation; Medication-Order Reconciliation; Water-Quality Dataset QA

About

Analytical range without borrowed authority.

I work through unfamiliar subject matter by making the evidence structure explicit: which source governs, what can be combined, what must be excluded, which calculation controls the decision, and where the available information stops.

About these work samples

Selected projects in this portfolio are adapted from completed AI evaluation and data-quality assignments. Some assignments used synthetic records, fictional organizations, and simulated real-world scenarios to test model reasoning, data reconciliation, and quality assurance. The analytical and evaluation work shown reflects work I performed. Internal platform instructions and identifiers have been removed.

Selected work

Seven case studies. One auditable portfolio.

Download combined PDF