{"id":"W3209485542","doi":"10.1080/00031305.2021.2000495","title":"Comparative Probability Metrics: Using Posterior Probabilities to Account for Practical Equivalence in A/B tests","year":2021,"lang":"en","type":"article","venue":"The American Statistician","topic":"Statistical Methods and Bayesian Inference","field":"Mathematics","cited_by":12,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Mathematics; Statistics; Equivalence (formal languages); Posterior probability; Bayesian probability; Discrete mathematics","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.1232861,0.003009471,0.002888416,0.01131884,0.002244997,0.007562865,0.004795641,0.005350318,0.006259874],"category_scores_gemma":[0.5218622,0.001325371,0.002482422,0.008108482,0.01249226,0.01645608,0.007323822,0.008775358,0.0009365876],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003477973,"about_ca_system_score_gemma":0.004043447,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002614508,"about_ca_topic_score_gemma":0.001734418,"domain_scores_codex":[0.852631,0.1069413,0.007131678,0.01111703,0.02101407,0.001165],"domain_scores_gemma":[0.4380431,0.4938458,0.02375605,0.02747127,0.01486678,0.002016984],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003094279,0.0001442235,0.01340074,0.0006930568,0.0005595112,0.000362198,0.001661887,0.05388786,0.001360898,0.7331965,0.00510252,0.1893212],"study_design_scores_gemma":[0.00008235128,0.0003568267,0.004579303,0.0003782834,0.0001522109,0.000442288,0.0002759568,0.1170787,0.001441822,0.8645194,0.01055728,0.0001356398],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.004463681,0.0006926024,0.9901799,0.0006672005,0.0001444255,0.0002358002,0.0001691329,0.0002015049,0.003245665],"genre_scores_gemma":[0.1953305,0.0007674673,0.7988912,0.0008019722,0.0005011876,0.002010027,0.0004014934,0.0003474957,0.0009487817],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.1232861,"threshold_uncertainty_score":0.6520069,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2844714646661516,"score_gpt":0.5027176178365009,"score_spread":0.2182461531703493,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}