{"id":"W4416940015","doi":"10.1007/s41060-025-00885-x","title":"Sequential Bayesian estimation of the F1 score using the Dirichlet-multinomial model","year":2025,"lang":"en","type":"article","venue":"International Journal of Data Science and Analytics","topic":"Imbalanced Data Classification Techniques","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":false,"ca_institutions":"Western University; University of Manitoba","funders":"","keywords":"Benchmark (surveying); Metric (unit); Bayesian probability; Sample (material); Point estimation; Sample size determination; Bayesian inference; Prior probability; Class (philosophy)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01318409,0.00107724,0.003013643,0.002660747,0.001598509,0.003011813,0.003474212,0.002535763,0.004933598],"category_scores_gemma":[0.04527277,0.001093149,0.001975813,0.002218478,0.002019789,0.004314807,0.002881022,0.003742596,0.002431131],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001830217,"about_ca_system_score_gemma":0.002956248,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01183092,"about_ca_topic_score_gemma":0.01362019,"domain_scores_codex":[0.9940383,0.003044388,0.0002734665,0.001325877,0.0008418623,0.000476104],"domain_scores_gemma":[0.9741392,0.02060796,0.0008676273,0.001979109,0.001891429,0.0005146256],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.001363085,0.0004749075,0.01717274,0.000436819,0.0004449832,0.0002588336,0.0008514204,0.4518918,0.005061198,0.1171438,0.01248876,0.3924116],"study_design_scores_gemma":[0.00004633098,0.00003803613,0.001734233,0.00004122452,0.0000337995,0.00008407229,0.00004505962,0.9406273,0.0008728148,0.05517806,0.001264293,0.00003493573],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.0423588,0.0005925516,0.9539271,0.0006531546,0.000106485,0.00008972979,0.0003972249,0.0006108917,0.001264003],"genre_scores_gemma":[0.650162,0.0008242686,0.3358129,0.000440546,0.0004728048,0.0004685214,0.003240581,0.0005146354,0.008063829],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01318409,"threshold_uncertainty_score":0.06972492,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0841653532904757,"score_gpt":0.3783429684597155,"score_spread":0.2941776151692398,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}