{"id":"W4415381631","doi":"10.1145/3736731.3746136","title":"Experience with Reproducibility and Consistency in Writing an Academic Paper","year":2025,"lang":"","type":"article","venue":"","topic":"Scientific Computing and Data Management","field":"Decision Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Critical Systems Labs; University of British Columbia","funders":"Natural Sciences and Engineering Research Council of Canada","keywords":"Consistency (knowledge bases); Reproducibility; Reliability (semiconductor); Measure (data warehouse)","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["metaresearch"],"domain":"reproducibility","study_design":"not_applicable","genre":"commentary","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":["metaresearch"],"domain":"reporting","study_design":"design_other","genre":"other","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2795574,0.001626077,0.001291673,0.005082149,0.0102134,0.01896978,0.008182506,0.004807281,0.006671999],"category_scores_gemma":[0.6080421,0.001940574,0.002081868,0.006677836,0.01294021,0.01605756,0.01327981,0.008994486,0.003888599],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00457985,"about_ca_system_score_gemma":0.01027559,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001773504,"about_ca_topic_score_gemma":0.001667694,"domain_scores_codex":[0.5901228,0.2706493,0.02844321,0.01817862,0.08696216,0.005643847],"domain_scores_gemma":[0.2414638,0.4895648,0.02696538,0.1125224,0.1157054,0.01377829],"domain_codex":null,"domain_gemma":"reporting","domain_candidate":"reporting","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"qualitative","study_design_scores_codex":[0.0006751481,0.001215036,0.02116046,0.002041015,0.0004629659,0.0041161,0.3239172,0.005686402,0.01305545,0.02676556,0.04512975,0.555775],"study_design_scores_gemma":[0.0005743916,0.003913893,0.01471707,0.003031264,0.0006784181,0.02000842,0.1083385,0.02727487,0.05649649,0.1196205,0.6436567,0.001689409],"study_design_candidate":"qualitative","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1725388,0.005094388,0.7279999,0.03332262,0.002789967,0.001718455,0.0002234226,0.005513322,0.05079908],"genre_scores_gemma":[0.5772133,0.002908672,0.3900983,0.005837157,0.001641153,0.000942033,0.0004403429,0.003955934,0.01696305],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.7204427,"threshold_uncertainty_score":0.8884341,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1157862929031439,"score_gpt":0.4215548920575341,"score_spread":0.3057685991543903,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}