{"id":"W4404764563","doi":"10.1038/s41562-024-02046-9","title":"Large language models surpass human experts in predicting neuroscience results","year":2024,"lang":"en","type":"article","venue":"Nature Human Behaviour","topic":"Topic Modeling","field":"Computer Science","cited_by":111,"is_retracted":false,"has_abstract":true,"ca_institutions":"Institut Universitaire de Gériatrie de Montréal","funders":"National Eye Institute; Economic and Social Research Council; Research Councils UK; Royal Society","keywords":"Cognitive science; Psychology; Neuroscience","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01502947,0.001968106,0.0009912736,0.002315501,0.000576195,0.003386639,0.0009935427,0.002783559,0.003060538],"category_scores_gemma":[0.06061502,0.0005306891,0.001074608,0.0008559178,0.001046996,0.005933926,0.001727986,0.002954337,0.002064499],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001025088,"about_ca_system_score_gemma":0.001753513,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.004821627,"about_ca_topic_score_gemma":0.008664686,"domain_scores_codex":[0.9943638,0.003125307,0.0003271175,0.001247756,0.0006588225,0.0002771],"domain_scores_gemma":[0.93847,0.05180813,0.002286199,0.00380252,0.001970335,0.001662848],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002944181,0.0007395688,0.09122994,0.001519605,0.001331568,0.0007439185,0.002061161,0.4743049,0.01310379,0.01724701,0.04985119,0.3449232],"study_design_scores_gemma":[0.0001137354,0.0003776995,0.007052858,0.0001323718,0.0001340835,0.0001655034,0.0002704205,0.9322146,0.005508805,0.04729022,0.006641774,0.00009804636],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5938138,0.007816267,0.3487285,0.01082506,0.000969463,0.0002625346,0.005344354,0.01175745,0.02048256],"genre_scores_gemma":[0.9283525,0.0006596078,0.06254801,0.001315551,0.0002816689,0.0001205633,0.003919631,0.000482344,0.002320199],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.01502947,"threshold_uncertainty_score":0.0794844,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02928450250818994,"score_gpt":0.3250620535175684,"score_spread":0.2957775510093785,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}