{"id":"W7129041067","doi":"10.1111/epic.70016","title":"Co‐designing a Large Language Model Benchmarking Dataset for Primary Care with Nurses in Kenya","year":2025,"lang":"en","type":"article","venue":"Ethnographic Praxis in Industry Conference Proceedings","topic":"Global Health and Surgery","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Programs for Assessment of Technology in Health Research Institute","funders":"","keywords":"Benchmarking; Primary care; Context (archaeology); Participatory design; Benchmark (surveying); Health care; Citizen journalism; Work (physics); Participatory evaluation","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0104566,0.0004641411,0.0003790122,0.00197612,0.002272856,0.001167413,0.001486443,0.001373913,0.003232274],"category_scores_gemma":[0.03896486,0.0003292895,0.000585382,0.001981976,0.0009931958,0.001363211,0.002648321,0.001092231,0.001053828],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003380774,"about_ca_system_score_gemma":0.004668693,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02349545,"about_ca_topic_score_gemma":0.05807203,"domain_scores_codex":[0.9886957,0.007761064,0.0006953198,0.001331621,0.001085158,0.0004311457],"domain_scores_gemma":[0.9682787,0.01997955,0.001423898,0.003961589,0.005459422,0.0008969014],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001832472,0.005266926,0.3775479,0.006233251,0.0004407897,0.003184042,0.06230146,0.03368981,0.01357894,0.02197695,0.1641342,0.3098131],"study_design_scores_gemma":[0.0008804119,0.001783027,0.3431801,0.003127392,0.0002603585,0.001274145,0.1025516,0.0668735,0.01854101,0.01644032,0.4446549,0.0004331628],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.81511,0.0007102917,0.06490881,0.003334388,0.0002536507,0.009423613,0.09093692,0.001119543,0.01420279],"genre_scores_gemma":[0.6860133,0.0002525898,0.1474762,0.000917071,0.00004851183,0.01935399,0.1421971,0.0003144143,0.003426785],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.02349545,"threshold_uncertainty_score":0.05530047,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0268118763577169,"score_gpt":0.3422582837054772,"score_spread":0.3154464073477603,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}