{"id":"W4415656798","doi":"10.1080/10872981.2025.2574647","title":"Large language models for generating key-feature questions in medical education","year":2025,"lang":"en","type":"article","venue":"Medical Education Online","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Uniwersytet Jagielloński Collegium Medicum","keywords":"Checklist; Metric (unit); Workflow; Quality (philosophy); Descriptive statistics; Inclusion (mineral); Minor (academic); MEDLINE","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.0009093632,0.0001521364,0.0002716884,0.0003623288,0.0001482425,0.00002203661,0.0001668075,0.0004389254,0.0007495857],"category_scores_gemma":[0.01027234,0.0001397504,0.00007867071,0.0006323375,0.00006554378,0.0001217618,0.00003088284,0.0005835951,0.00001414497],"about_ca_system_candidate":true,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0003029484,"about_ca_system_score_gemma":0.02047313,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0008005539,"about_ca_topic_score_gemma":0.002935714,"domain_scores_codex":[0.998049,0.00009528154,0.0006291579,0.0003572706,0.0005344042,0.000334903],"domain_scores_gemma":[0.9984047,0.0002444359,0.00009058812,0.0003134741,0.0004720664,0.0004746899],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00009972564,0.01032078,0.00725813,0.0005914217,0.00002769232,0.000003969469,0.006093292,0.00004204283,0.0001063388,0.0357011,0.103513,0.8362425],"study_design_scores_gemma":[0.001203214,0.0003519764,0.00836047,0.007690749,0.0002062682,0.000124399,0.04756043,0.6093755,0.0009207316,0.02840915,0.2951016,0.0006955261],"study_design_candidate":"design_other","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5981087,0.005964198,0.03066425,0.3565605,0.004942311,0.001421444,0.00003030534,0.0001344016,0.002173888],"genre_scores_gemma":[0.9046775,0.0006236024,0.0150827,0.06242994,0.003624283,0.0007577877,0.002724718,0.00003394404,0.01004556],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.835547,"threshold_uncertainty_score":0.9980646,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0558199528456924,"score_gpt":0.490967376924955,"score_spread":0.4351474240792626,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}