{"id":"W7104268932","doi":"10.7910/dvn/bgvihx","title":"Replication data for: The Power of Tests for Detecting p-Hacking","year":2025,"lang":"","type":"dataset","venue":"Harvard Dataverse","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Queen's University","funders":"","keywords":"Power (physics); Replication (statistics); Key (lock); Noise (video); Reliability (semiconductor)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["metaresearch"],"domain":"reproducibility","study_design":"not_applicable","genre":"dataset","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":[],"domain":null,"study_design":"not_applicable","genre":"dataset","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.01584445,0.00238708,0.002601332,0.008937367,0.001410014,0.004910818,0.00619607,0.004339709,0.1627662],"category_scores_gemma":[0.1590543,0.001546955,0.002784314,0.01570811,0.001334542,0.003475158,0.004751106,0.003921218,0.1184788],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001686636,"about_ca_system_score_gemma":0.005181563,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01757803,"about_ca_topic_score_gemma":0.02926831,"domain_scores_codex":[0.9909536,0.002828317,0.001795591,0.001285315,0.002439156,0.00069806],"domain_scores_gemma":[0.9019129,0.05138006,0.007632406,0.02130045,0.01506716,0.002707048],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00008244028,0.00001602457,0.001481387,0.0007667611,0.00008905729,0.00001976445,0.00002112586,0.0001336212,0.00004868205,0.0008783648,0.993616,0.002846802],"study_design_scores_gemma":[0.001843617,0.00006844814,0.01499253,0.001632383,0.0002566498,0.0001811221,0.0001781403,0.0007163676,0.0006212203,0.01080716,0.9685842,0.0001180058],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.000188626,0.0002035802,0.0003713382,0.0005058082,0.000136519,0.00003193918,0.9970643,0.0006439452,0.0008539063],"genre_scores_gemma":[0.002208854,0.0002182182,0.001756453,0.0004178459,0.0001134101,0.0004151566,0.9928347,0.000511386,0.001523975],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.9841555,"threshold_uncertainty_score":0.5445071,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06764329387006822,"score_gpt":0.3440787444167645,"score_spread":0.2764354505466963,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}