{"id":"W1974436001","doi":"10.1207/s15328015tlm1403_3","title":"Comparison of an Aggregate Scoring Method With a Consensus Scoring Method in a Measure of Clinical Reasoning Capacity","year":2002,"lang":"en","type":"article","venue":"Teaching and Learning in Medicine","topic":"Clinical Reasoning and Diagnostic Skills","field":"Medicine","cited_by":74,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal; Université du Québec à Montréal","funders":"","keywords":"Concordance; Context (archaeology); Test (biology); Psychology; Medical education; Computer science; Medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.06398638,0.0009445309,0.001261423,0.008206487,0.0009079878,0.002404959,0.001552012,0.001715701,0.002984768],"category_scores_gemma":[0.2221186,0.0005199197,0.001595468,0.004534528,0.001588646,0.003288933,0.003650495,0.001325891,0.0009341261],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001219549,"about_ca_system_score_gemma":0.0009795757,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0009997003,"about_ca_topic_score_gemma":0.001696081,"domain_scores_codex":[0.8953609,0.06138334,0.008966567,0.005380794,0.02794365,0.0009647541],"domain_scores_gemma":[0.6477755,0.2735714,0.02067935,0.01569879,0.03954381,0.002731106],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.01090781,0.001046303,0.5004221,0.001395955,0.003021205,0.000340634,0.01327158,0.01495844,0.01260866,0.005572592,0.004392904,0.4320618],"study_design_scores_gemma":[0.001496835,0.009511084,0.7292228,0.0007253058,0.001781716,0.002321993,0.00770652,0.2120379,0.01542763,0.01236814,0.006605498,0.000794619],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8440493,0.0008320803,0.1398757,0.0002616741,0.0002848889,0.001517408,0.0005571351,0.0005768554,0.012045],"genre_scores_gemma":[0.9100574,0.0001760981,0.08689061,0.00006205926,0.00007379729,0.001319139,0.0003577499,0.0001094001,0.0009537018],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.06398638,"threshold_uncertainty_score":0.3383964,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1503521672836052,"score_gpt":0.4714027456551148,"score_spread":0.3210505783715096,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}