Skip to main content
. 2026 Jun 15;28:e95452. doi: 10.2196/95452

Table 2.

Evidence classification for framework recommendations. Summary of bias mitigation practices included in the proposed framework, organized by strength of evidence. Established evidence base indicates practices supported by studies conducted in aesthetic facial evaluation contexts. Adapted evidence base indicates practices supported by evidence from adjacent domains (facial recognition, general medical AI, or computer vision) that have been translated to aesthetic evaluation by analogy and require validation in aesthetic-specific contexts before adoption as standard practice. Proposed evidence base indicates conceptual recommendations without empirical validation in any closely related domain, to be treated as research directions.

Bias source Pipeline stage Mitigation strategy Evidence base Residual gap
Targeting bias: narrow beauty standard definition Data collection
  • Pillar 1: ≥7 ethnic categories

  • Mixed-ancestry probabilistic labeling

  • Continuous morphometric representation

Established
  • Discrete ethnic categories essentialize group-level patterns

  • Intragroup variation (eg, nationality, socioeconomic background) is rarely captured

Annotation bias: culturally skewed rater judgments Data collection
  • Pillar 1: diverse rater recruitment

  • Structured training and calibration

  • Tiered disagreement adjudication

  • Ongoing score audits

Adapted
  • No validated rater calibration protocol exists for aesthetic evaluation

  • Cultural feature weighting may persist despite diverse panels

Generative adversarial network amplification bias: synthetic augmentation Data collection
  • Pillar 1: quality control gate for synthetic images—fairness audit, feature distribution check, and human review

Adapted
  • Mode collapse and feature exaggeration are documented in generative systems

  • Quality control criteria not validated for aesthetic contexts

Modeling bias: fairness-unaware training Model training
  • Pillar 2: adversarial debiasing

  • Centroid fairness loss

  • Skewness-aware reinforcement learning

  • Debiasing variational autoencoder

  • Multitask learning

Adapted
  • All techniques validated in facial recognition or general computer vision, not aesthetic evaluation

  • Several rest on preprint evidence

  • Combined validation absent

Domain shift bias: train/deploy distribution mismatch Model training → deployment
  • Pillar 2: hybrid pretraining on standardized images

  • Fine-tuning on clinical images

  • Domain generalization evaluation prerelease

Proposed
  • No validated hybrid protocol for aesthetic AI

  • Clinical image variation not systematically characterized

Evaluation bias: aggregate metrics obscure subgroup disparities Evaluation
  • Pillar 3: layered fairness metrics with prioritization hierarchy

  • Intersectional assessment

  • Bayesian hierarchical modeling for rare subgroups

Adapted
  • Thresholds are proposed benchmarks without empirical derivation

  • Metrics can conflict

  • Intersectional sample sizes often insufficient

Explainability gap: black-box outputs in a cultural context Evaluation → deployment
  • Pillar 4: Grad-CAMa, LIMEb, SHAPc with required human expert review

  • Geometric/physics-based models as a longer-term goal

Adapted
  • Explainable AI tools cannot explain why features are culturally valued

  • No method validated for cultural appropriateness verification in aesthetic AI

Human–AI decision bias: clinician interpretation and override Deployment
  • Pillar 5 + 6: documentation and audit of AI recommendation override rates by patient demographic

  • Clinician training on implicit bias

Proposed
  • No empirical data on differential override in aesthetic AI

  • Audit infrastructure absent

  • Accountability for remediation undefined

Deployment bias: commercial systems without governance Deployment
  • Pillar 6: disclosure-based accountability for commercial developers

  • FDA SaMDd framework alignment

Proposed
  • No enforcement mechanism for commercial tools

  • Patient and clinician verification of compliance is currently impossible

Drift bias: postdeployment fairness degradation Monitoring
  • Pillar 6: tiered monitoring—continuous process control, quarterly review, annual audit, drift-triggered escalation

  • Designated AI clinical lead

Adapted
  • Drift thresholds not empirically derived for aesthetic AI

  • Continuous monitoring may not be feasible for community practices

aGrad-CAM: gradient-weighted class activation mapping.

bLIME: local interpretable model-agnostic explanations.

cSHAP: Shapley additive explanations.

dFDA SaMD: Food and Drug Administration’s Software as a Medical Device.