{"id":"W4400974494","doi":"10.1101/2024.07.24.24310930","title":"The TRIPOD-LLM Statement: A Targeted Guideline For Reporting Large Language Models Use","year":2024,"lang":"en","type":"preprint","venue":"medRxiv","topic":"Artificial Intelligence in Healthcare and Education","field":"Medicine","cited_by":22,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Alberta","funders":"","keywords":"Tripod (photography); Guideline; Statement (logic); Computer science; Medicine; Political science; Engineering; Mechanical engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":["metaresearch"],"category_scores_codex":[0.2722189,0.002630967,0.00319923,0.01415017,0.003429995,0.01244019,0.009611958,0.01167921,0.03170688],"category_scores_gemma":[0.5579002,0.003953495,0.008637197,0.00929964,0.004952977,0.01189003,0.01634312,0.01328632,0.02755324],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00818904,"about_ca_system_score_gemma":0.04785548,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01224295,"about_ca_topic_score_gemma":0.0123173,"domain_scores_codex":[0.6931654,0.1710499,0.0987216,0.004522405,0.03004406,0.002496689],"domain_scores_gemma":[0.3603849,0.4050229,0.03660889,0.04176064,0.1521265,0.004096081],"domain_codex":null,"domain_gemma":"reporting","domain_candidate":"reporting","domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0002457207,0.0001712432,0.001456074,0.01715079,0.0003367587,0.0003101118,0.004669013,0.001313173,0.001080343,0.02679078,0.7852224,0.1612537],"study_design_scores_gemma":[0.0005350172,0.0001985134,0.002973506,0.05141769,0.0004026027,0.0007900088,0.002901234,0.003070816,0.001945138,0.03715642,0.8982611,0.0003478844],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.003805586,0.01420494,0.5842128,0.1242025,0.01114412,0.09296528,0.08444821,0.01344184,0.0715747],"genre_scores_gemma":[0.01182788,0.01071753,0.7278744,0.0287221,0.001269122,0.1493194,0.05178009,0.004726139,0.01376343],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.7277811,"threshold_uncertainty_score":0.8974836,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2488992623115137,"score_gpt":0.4834255985225807,"score_spread":0.234526336211067,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}