{"id":"W7077455550","doi":"10.5281/zenodo.16939067","title":"Replication Package for \"A Case Study on the Effectiveness of LLMs in Verification with Proof Assistants\"","year":2025,"lang":"en","type":"other","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Diverse Scientific and Economic Studies","field":"Economics, Econometrics and Finance","cited_by":1,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Toronto","funders":"","keywords":"Replication (statistics); Key (lock); Proof of concept; Scheme (mathematics)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.01980676,0.00147244,0.001308828,0.002119488,0.001683592,0.002658736,0.005270323,0.002786078,0.6530854],"category_scores_gemma":[0.162197,0.001530432,0.003177,0.002600509,0.001292651,0.002439765,0.003174941,0.002777189,0.24561],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001634927,"about_ca_system_score_gemma":0.006207567,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.008958287,"about_ca_topic_score_gemma":0.008257333,"domain_scores_codex":[0.9877598,0.006323543,0.001075636,0.001353763,0.00271955,0.0007677351],"domain_scores_gemma":[0.8092267,0.1005702,0.00405239,0.06020489,0.02380696,0.002138859],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.001646564,0.0003186427,0.0004332355,0.001400685,0.0001272814,0.00006249044,0.0002612123,0.001267082,0.000633649,0.01025749,0.9376831,0.04590842],"study_design_scores_gemma":[0.006844244,0.0007370325,0.005282307,0.001068762,0.0002458013,0.0002082539,0.0003038682,0.007854089,0.004521484,0.033578,0.9391522,0.0002040118],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.005825725,0.0003125218,0.1771153,0.004609455,0.005020686,0.007391606,0.538025,0.1268333,0.1348665],"genre_scores_gemma":[0.08140659,0.0004026451,0.3404228,0.002528416,0.001077159,0.02710031,0.3175459,0.08303062,0.1464855],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.9801933,"threshold_uncertainty_score":0.4948316,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06140218940992098,"score_gpt":0.2475640755397663,"score_spread":0.1861618861298454,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}