{"id":"W2148996827","doi":"10.1111/j.1468-2389.2012.00604.x","title":"<scp>A</scp>ssessing the <scp>R</scp>eliability of <scp>S</scp>ituational <scp>J</scp>udgment <scp>T</scp>ests <scp>U</scp>sed in <scp>H</scp>igh‐<scp>S</scp>takes <scp>S</scp>ituations","year":2012,"lang":"en","type":"article","venue":"International Journal of Selection and Assessment","topic":"Medical Education and Admissions","field":"Medicine","cited_by":72,"is_retracted":false,"has_abstract":true,"ca_institutions":"Golder Associates (Canada); Saint Mary's University","funders":"","keywords":"Psychology; Reliability (semiconductor)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009802057,0.0003042221,0.0003089896,0.002094957,0.0008670778,0.001664818,0.0006334607,0.0005199279,0.01267581],"category_scores_gemma":[0.07618774,0.0002956751,0.0005626775,0.002017818,0.001077628,0.001324545,0.001879022,0.001060409,0.004019942],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007571728,"about_ca_system_score_gemma":0.002261062,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.005410209,"about_ca_topic_score_gemma":0.01149262,"domain_scores_codex":[0.9941899,0.001450994,0.0009307907,0.0006088254,0.002579633,0.0002398369],"domain_scores_gemma":[0.9323589,0.02781112,0.009134376,0.008773413,0.0199855,0.001936755],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.000479861,0.001178747,0.6552896,0.0007709668,0.0003084764,0.0005436119,0.01375475,0.003349347,0.01267417,0.008210127,0.0694911,0.2339491],"study_design_scores_gemma":[0.00004162179,0.0004872672,0.9376791,0.0002075803,0.00004902693,0.0003139482,0.004025829,0.005366586,0.009419771,0.003099729,0.03922557,0.00008393364],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9240328,0.0001616635,0.01355324,0.0008010964,0.0002659977,0.001603413,0.002540155,0.0003315331,0.05671015],"genre_scores_gemma":[0.9833475,0.0001127374,0.006865038,0.0001884805,0.00004250443,0.001475841,0.002000568,0.0001033377,0.005863962],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01267581,"threshold_uncertainty_score":0.05183887,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03607348700990223,"score_gpt":0.3616105198973577,"score_spread":0.3255370328874554,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}