{"id":"W4415381531","doi":"10.1145/3736731.3746137","title":"LLMs in Citation Intent Classification: Progress, Precision, and Reproducibility Challenges","year":2025,"lang":"en","type":"article","venue":"","topic":"Natural Language Processing Techniques","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Good Ventures Foundation; Open Philanthropy Project; Alfred P. Sloan Foundation","keywords":"Citation; Reproducibility; Reliability (semiconductor)","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch","bibliometrics"],"consensus_categories":[],"category_scores_codex":[0.181472,0.00317771,0.007565836,0.02413376,0.004609883,0.02337981,0.01035274,0.006748307,0.003777478],"category_scores_gemma":[0.3580924,0.002223248,0.003362545,0.01908998,0.005259148,0.02028695,0.01032495,0.01023077,0.008299362],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.003193246,"about_ca_system_score_gemma":0.006833194,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01469392,"about_ca_topic_score_gemma":0.02314659,"domain_scores_codex":[0.8224731,0.09985244,0.01605017,0.01786871,0.04050911,0.003246507],"domain_scores_gemma":[0.4002295,0.394989,0.01807561,0.1212535,0.06038687,0.005065619],"domain_codex":null,"domain_gemma":"reproducibility","domain_candidate":"reproducibility","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0009734287,0.0007876952,0.0445628,0.002237735,0.00187413,0.0001049587,0.001468266,0.009087473,0.002258468,0.01516393,0.09014346,0.8313376],"study_design_scores_gemma":[0.000453804,0.0007638147,0.03095859,0.002107694,0.00170985,0.0007141889,0.002453011,0.5879772,0.01560615,0.2398938,0.1167603,0.0006015702],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1466668,0.1125827,0.605948,0.0488127,0.009520143,0.001255207,0.01644135,0.03820313,0.0205699],"genre_scores_gemma":[0.5650694,0.01034127,0.3689283,0.005527781,0.01194825,0.0008524748,0.01901334,0.003496635,0.01482259],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9758663,"threshold_uncertainty_score":0.959727,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04366004339709035,"score_gpt":0.3280326195008369,"score_spread":0.2843725761037466,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}