{"id":"W7104010971","doi":"10.6084/m9.figshare.30527891.v1","title":"Additional file 1 of Evaluating the performance of five large language models in answering Delphi consensus questions relating to patellar instability and medial patellofemoral ligament reconstruction","year":2025,"lang":"","type":"article","venue":"Open MIND","topic":"Lower Extremity Biomechanics and Pathologies","field":"Engineering","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Manitoba; University of Calgary; University of Ottawa; McMaster University","funders":"","keywords":"Medial patellofemoral ligament; Delphi; Delphi method; Ligament","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.007355523,0.001096113,0.001100034,0.002643466,0.001368974,0.001810763,0.00153819,0.001386928,0.8267488],"category_scores_gemma":[0.134267,0.0006068361,0.0009864559,0.002539681,0.0003928085,0.001586225,0.001410116,0.001180714,0.1103484],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00169986,"about_ca_system_score_gemma":0.00297349,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006688123,"about_ca_topic_score_gemma":0.01496516,"domain_scores_codex":[0.996765,0.001385465,0.0007089971,0.0003562227,0.0005562775,0.0002279742],"domain_scores_gemma":[0.7968791,0.182634,0.004336113,0.004401132,0.01071217,0.001037432],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001112892,0.0007370525,0.005248134,0.003483911,0.00007353569,0.00008320345,0.0006602984,0.000667849,0.0000887895,0.001289074,0.9492787,0.03727647],"study_design_scores_gemma":[0.03051053,0.002734831,0.114539,0.01512146,0.0008118955,0.001144717,0.01001441,0.01357275,0.002963263,0.03588373,0.7720519,0.0006515315],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.003882551,0.00003389851,0.001762683,0.0004870112,0.0001159999,0.001919606,0.9862759,0.0006814011,0.004840971],"genre_scores_gemma":[0.07302903,0.0002557678,0.03987852,0.001977687,0.0002143658,0.08233288,0.7659503,0.001730713,0.03463086],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.8267488,"threshold_uncertainty_score":0.2471217,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03836301609056054,"score_gpt":0.298867041616996,"score_spread":0.2605040255264355,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}