{"id":"W2005784320","doi":"10.1097/00001888-200410001-00017","title":"Using the NBME Self-Assessments to Project Performance on USMLE Step 1 and Step 2: Impact of Test Administration Conditions","year":2004,"lang":"en","type":"article","venue":"Academic Medicine","topic":"Innovations in Medical Education","field":"Medicine","cited_by":19,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Test (biology); United States Medical Licensing Examination; Medicine; Self-assessment; Medical education; Psychology; Medical school; Biology","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.009869808,0.0005084106,0.0003547785,0.0009368249,0.0003106647,0.0006322234,0.0005689676,0.000363866,0.001177461],"category_scores_gemma":[0.05460063,0.0002195796,0.000618939,0.000784998,0.0004853568,0.0005396913,0.0008467206,0.000631155,0.0003081623],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001064253,"about_ca_system_score_gemma":0.002267372,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02601038,"about_ca_topic_score_gemma":0.03953628,"domain_scores_codex":[0.9948377,0.002328521,0.0004175803,0.0005274829,0.001636932,0.0002517058],"domain_scores_gemma":[0.9587654,0.02585896,0.008941304,0.002253503,0.003064474,0.001116287],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0003521968,0.0002168988,0.9843485,0.00002044685,0.00008001878,0.000009397774,0.0001886109,0.0003571084,0.000266532,0.00002225316,0.000151565,0.01398643],"study_design_scores_gemma":[0.00001503723,0.0004798163,0.9975073,0.000009812066,0.00001990489,0.00001618404,0.00006485358,0.001025708,0.0006715817,0.00001769934,0.0001662403,0.000005911395],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9982533,0.00007958494,0.0007987883,0.00004536218,0.000009043886,0.00006785618,0.0001549823,0.00002309723,0.0005680383],"genre_scores_gemma":[0.9974226,0.00004251292,0.001681236,0.00003410316,0.000007269289,0.00009628732,0.0003281369,0.000007720405,0.0003802388],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02601038,"threshold_uncertainty_score":0.05219722,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06894134633383839,"score_gpt":0.4714328715210706,"score_spread":0.4024915251872322,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}