{"id":"W4408976398","doi":"10.1093/jhps/hnaf011.084","title":"OP1.5 Evaluating ChatGPT’s Performance in Answering Patients’ Questions Relating to Femoroacetabular Impingement Syndrome and Arthroscopic Hip Surgery","year":2025,"lang":"en","type":"article","venue":"Journal of Hip Preservation Surgery","topic":"Hip disorders and treatments","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"McMaster University","funders":"","keywords":"Femoroacetabular impingement; Medicine; Hip arthroscopy; Arthroscopy; Surgery; Physical therapy","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001717148,0.0001583427,0.0005510758,0.0008558769,0.0001326733,0.00004336569,0.00005164321,0.00007191573,0.00002972605],"category_scores_gemma":[0.001548231,0.0001449501,0.0001111247,0.0006173072,0.00002113881,0.0005866492,0.00005642975,0.0002371162,0.000003326158],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001863212,"about_ca_system_score_gemma":0.0002847502,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0000431123,"about_ca_topic_score_gemma":0.00001092612,"domain_scores_codex":[0.9979759,0.0001267156,0.001004524,0.0001935727,0.0004356089,0.0002637137],"domain_scores_gemma":[0.9984516,0.0005346495,0.0003824001,0.0001850588,0.0003267512,0.0001195424],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0001062203,0.0001948069,0.9831502,0.0002349509,0.00008850251,0.00003509647,0.0003460079,0.0003796121,0.0001782764,0.000009486759,0.000300393,0.01497642],"study_design_scores_gemma":[0.0009065982,0.0001623098,0.9941621,0.002787482,0.00007660555,0.00002652825,0.0001301449,0.001031289,0.0001593662,0.00006623365,0.0003865757,0.0001047866],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9959421,0.001085576,0.0002039564,0.001767556,0.0004280962,0.0003985567,0.000001351934,0.00001523597,0.0001575484],"genre_scores_gemma":[0.9981754,0.0003120895,0.0008714623,0.0003370735,0.0000340923,0.00002699929,0.00001134333,0.00001601725,0.0002155547],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01487164,"threshold_uncertainty_score":0.5910894,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04802582627426989,"score_gpt":0.3218167469445914,"score_spread":0.2737909206703215,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}