{"id":"W4409603033","doi":"10.1101/2025.04.18.25326076","title":"AutoReporter: Development of an artificial intelligence tool for automated assessment of research reporting guideline adherence","year":2025,"lang":"en","type":"preprint","venue":"medRxiv","topic":"Biomedical Text Mining and Ontologies","field":"Biochemistry, Genetics and Molecular Biology","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia; McMaster University; University of Toronto","funders":"","keywords":"Guideline; Computer science; Medicine","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006613372,0.0002019933,0.0005041445,0.0001530672,0.0001007405,0.0000241411,0.0005583482,0.0004961122,0.00001382809],"category_scores_gemma":[0.004645677,0.0001809943,0.0001404514,0.0001664246,0.0003504529,0.000001661298,0.0008225621,0.0003061876,1.946872e-7],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00003683009,"about_ca_system_score_gemma":0.002636019,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000041403,"about_ca_topic_score_gemma":0.00004816461,"domain_scores_codex":[0.9954156,0.0001608195,0.002969431,0.0006915568,0.0004490677,0.0003134773],"domain_scores_gemma":[0.9962469,0.00009270776,0.001731461,0.0007925498,0.00107109,0.00006531275],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"bench_or_experimental","study_design_scores_codex":[0.0002056419,0.0007442514,0.01443197,0.002486011,0.0004792917,0.00002874485,0.0006688766,0.001311991,0.4821315,0.0004480546,0.001254872,0.4958088],"study_design_scores_gemma":[0.0001253928,0.0007035519,0.008935816,0.0007575199,0.00004724872,0.000007649799,0.0004526578,0.04889062,0.9318787,0.001646111,0.006167835,0.0003868924],"study_design_candidate":"bench_or_experimental","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8496732,0.0001638675,0.1489369,0.00007359314,0.000426826,0.0004664883,0.00005016158,0.00006628916,0.0001426837],"genre_scores_gemma":[0.6393869,0.00001339797,0.3598961,0.00001118321,0.00009231888,0.0001350822,0.0003484559,0.0000102699,0.0001063276],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4954219,"threshold_uncertainty_score":0.7380735,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1907627597976437,"score_gpt":0.5019322412940268,"score_spread":0.3111694814963831,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}