Table 1.
Correspondence between confidence classification methods in the real dataset.
| Classification Method #1 | Measure | Classification Method #2 | |||
|---|---|---|---|---|---|
| Human Coder 1 | Human Coder 2 | AI Model | Trichotomized | ||
| Human Coder 1 | Correlation (r) | - | |||
| % agreement | - | ||||
| Cohen’s k | - | ||||
| Human Coder 2 | Correlation (r) | 0.748 | - | ||
| % agreement | 81.3% | - | |||
| Cohen’s k | 0.648 | - | |||
| AI Model | Correlation (r) | 0.381 | 0.504 | - | |
| % agreement | 34.7% | 26.7% | - | ||
| Cohen’s k | 0.207 | 0.250 | - | ||
| Trichotomized Numeric Confidence | Correlation (r) | 0.689 | 0.708 | 0.337 | - |
| % agreement | 46.7% | 42.7% | 28.0% | - | |
| Cohen’s k | 0.515 | 0.506 | 0.164 | - | |
Note. N = 75.