Experiment 008 probe design includes calibration tier: GPT-5.2, GPT-5.4, and Haiku 4.5 answered Condition B items as warm-ups — not scored. Purpose: establish response baseline for probe items, verify question clarity, detect category boundary issues. Calibration results not reported but functionally confirm probe validity before Kimi engagement.