{"id":"W4391112649","doi":"10.5334/pme.1110","title":"The Next Era of Assessment: Building a Trustworthy Assessment System","year":2024,"lang":"en","type":"article","venue":"Perspectives on Medical Education","topic":"Innovations in Medical Education","field":"Medicine","cited_by":26,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Ottawa; University of Calgary","funders":"","keywords":"Contextualization; Context (archaeology); Variety (cybernetics); Medical education; Trustworthiness; Knowledge management; Computer science; Psychology; Public relations; Engineering ethics; Medicine; Political science; Social psychology; Interpretation (philosophy)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001898572,0.0001775784,0.0002682186,0.0002445871,0.0002576188,0.0001065869,0.0002235521,0.0001646765,0.0004310145],"category_scores_gemma":[0.002435167,0.0001199539,0.0001243106,0.001079266,0.0003287189,0.0001505933,0.00003388319,0.001252209,0.00002733757],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001429596,"about_ca_system_score_gemma":0.005710325,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00005432653,"about_ca_topic_score_gemma":0.000001986028,"domain_scores_codex":[0.9970848,0.000150381,0.0005739945,0.0004341036,0.001489811,0.0002668917],"domain_scores_gemma":[0.9983091,0.0004165196,0.0001370509,0.000481114,0.0005026752,0.0001535767],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"qualitative","study_design_scores_codex":[0.00003076456,0.0007886337,0.0005128928,0.0004819048,0.0001352708,0.000005767637,0.003292987,0.000002947605,0.0002099772,0.5784385,0.01220331,0.4038971],"study_design_scores_gemma":[0.002441989,0.001895476,0.115982,0.01966593,0.0008709754,0.0006269571,0.4997438,0.153928,0.0005032911,0.004820028,0.1986009,0.0009206696],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.7321252,0.008326274,0.02378856,0.1588595,0.01116681,0.001816329,0.000005580412,0.0005159232,0.06339578],"genre_scores_gemma":[0.9885428,0.0005275542,0.007950884,0.0008576265,0.001399206,0.0002587833,0.00003301417,0.00003333142,0.0003968044],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5736184,"threshold_uncertainty_score":0.9999264,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01414073531963129,"score_gpt":0.4025149743163983,"score_spread":0.388374238996767,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}