{"id":"W4417312634","doi":"10.1142/9789819824755_0028","title":"Asking the Right Questions: Benchmarking Large Language Models in the Development of Clinical Consultation Templates","year":2025,"lang":"en","type":"article","venue":"","topic":"Topic Modeling","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia; University of Alberta","funders":"","keywords":"Benchmarking; Template; Prioritization; Pipeline (software); Comparability; Matching (statistics); Dependency (UML); Salient","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01129893,0.001135524,0.0005451665,0.001165922,0.0004861219,0.001973562,0.001770798,0.001189665,0.002820675],"category_scores_gemma":[0.04998963,0.0005445238,0.0008191617,0.0008281671,0.0006155282,0.001832703,0.001888459,0.001255223,0.0009919013],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002691275,"about_ca_system_score_gemma":0.003675146,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01305677,"about_ca_topic_score_gemma":0.01695246,"domain_scores_codex":[0.9930803,0.004863231,0.0004677539,0.0007002605,0.0007220311,0.000166375],"domain_scores_gemma":[0.956144,0.03767073,0.0009837111,0.002450714,0.002064433,0.000686483],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001560147,0.0008404937,0.01854508,0.000678118,0.0002512094,0.0003239301,0.001834486,0.771679,0.004535817,0.005709082,0.0083633,0.1856793],"study_design_scores_gemma":[0.0001632881,0.000282954,0.001102116,0.00004878995,0.00005420917,0.00005722938,0.0002946055,0.9857677,0.00511448,0.003029349,0.004049332,0.00003592064],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.6449609,0.001012768,0.3175971,0.001335171,0.0001781167,0.001591562,0.00305234,0.01899243,0.01127963],"genre_scores_gemma":[0.7728449,0.0002370224,0.2194743,0.0003601203,0.0000221203,0.0006330957,0.004490967,0.0006993689,0.00123812],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01305677,"threshold_uncertainty_score":0.05975521,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04134578372500843,"score_gpt":0.3577342401636168,"score_spread":0.3163884564386084,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}