{"id":"W4392557674","doi":"10.1002/leap.1600","title":"Using automated analysis of the bibliography to detect potential research integrity issues","year":2024,"lang":"en","type":"article","venue":"Learned Publishing","topic":"Academic integrity and plagiarism","field":"Social Sciences","cited_by":3,"is_retracted":false,"has_abstract":true,"ca_institutions":"Honeywell (Canada)","funders":"","keywords":"Workflow; Computer science; Data science; Key (lock); Research integrity; Bibliography; Data integrity; Information retrieval; Database; Library science; Computer security; Engineering ethics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["metaresearch","research_integrity","bibliometrics"],"domain":"evaluation","study_design":"simulation_or_modeling","genre":"empirical","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":["metaresearch","research_integrity"],"domain":"methods","study_design":"observational","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"medium","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch","bibliometrics","research_integrity"],"consensus_categories":[],"category_scores_codex":[0.02341032,0.001228299,0.001246555,0.06390762,0.003241311,0.01359213,0.002313109,0.001556605,0.0153132],"category_scores_gemma":[0.1508976,0.0006815462,0.0009770688,0.02983607,0.001346265,0.007864576,0.004471004,0.00125712,0.01390876],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002293137,"about_ca_system_score_gemma":0.007661914,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.006603171,"about_ca_topic_score_gemma":0.006133657,"domain_scores_codex":[0.9737216,0.005458854,0.004804309,0.003491085,0.01179349,0.0007306073],"domain_scores_gemma":[0.7343103,0.09067935,0.04664525,0.03177722,0.09360633,0.002981591],"domain_codex":null,"domain_gemma":"evaluation","domain_candidate":"evaluation","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0006741401,0.0001787752,0.05980436,0.004029753,0.000340354,0.001945868,0.006156046,0.002224555,0.01396249,0.02208685,0.07705822,0.8115387],"study_design_scores_gemma":[0.0002164178,0.0004874172,0.1277269,0.004173876,0.001059476,0.003526353,0.01041749,0.05342395,0.06791095,0.0750894,0.6552705,0.0006971981],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.208386,0.01951572,0.4841044,0.01358867,0.0034297,0.003636394,0.06694717,0.05434509,0.1460469],"genre_scores_gemma":[0.4020469,0.008008013,0.4816499,0.00110963,0.001722099,0.001998705,0.06371169,0.003318812,0.03643431],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9984434,"threshold_uncertainty_score":0.1238071,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.144943481836799,"score_gpt":0.4536236169249125,"score_spread":0.3086801350881135,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}