{"id":"W7129041067","doi":"10.1111/epic.70016","title":"Co‐designing a Large Language Model Benchmarking Dataset for Primary Care with Nurses in Kenya","year":2025,"lang":"en","type":"article","venue":"Ethnographic Praxis in Industry Conference Proceedings","topic":"Global Health and Surgery","field":"Medicine","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Programs for Assessment of Technology in Health Research Institute","funders":"","keywords":"Benchmarking; Primary care; Context (archaeology); Participatory design; Benchmark (surveying); Health care; Citizen journalism; Work (physics); Participatory evaluation","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0009069432,0.0003156154,0.0005907245,0.0009585969,0.0001459871,0.00006409673,0.0002396292,0.0006831986,0.00001793364],"category_scores_gemma":[0.0002299705,0.0002890996,0.00006366323,0.001440376,0.0001625467,0.0003120363,0.00005695194,0.00161766,7.781339e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.000194075,"about_ca_system_score_gemma":0.001202256,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001601441,"about_ca_topic_score_gemma":0.0001694598,"domain_scores_codex":[0.9975404,0.00002114736,0.0005333183,0.0006364262,0.0003365918,0.0009320756],"domain_scores_gemma":[0.9989979,0.0001378705,0.0001522064,0.0002265763,0.0002782796,0.0002071629],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.001078308,0.0002580456,0.9671769,0.003356982,0.00003957499,0.00006060997,0.009179961,0.00001770223,0.0008806232,0.001309281,0.006823988,0.009818092],"study_design_scores_gemma":[0.04120565,0.003402133,0.4176437,0.06885374,0.0006737793,0.0001986068,0.3602772,0.05026531,0.006396561,0.003381224,0.04347437,0.004227719],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.984969,0.0007426041,0.0006468632,0.0006675188,0.0001659551,0.001652304,0.0008448653,0.00008799943,0.01022291],"genre_scores_gemma":[0.9931588,0.00006458068,0.002512194,0.001838524,0.00005644394,0.000401479,0.001789991,0.00002249285,0.0001555502],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.5495332,"threshold_uncertainty_score":0.9999561,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0268118763577169,"score_gpt":0.3422582837054772,"score_spread":0.3154464073477603,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}