{"id":"W7091335869","doi":"10.5281/zenodo.17353963","title":"Data for \"A flaw in using pre-trained pLMs in protein-protein interaction inference models\"","year":2025,"lang":"en","type":"dataset","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Bioinformatics and Genomic Networks","field":"Biochemistry, Genetics and Molecular Biology","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"McGill University","funders":"","keywords":"Inference; Pattern recognition (psychology); Feature (linguistics); Bayesian inference; Data modeling","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003034882,0.002161722,0.001179336,0.001278883,0.001184077,0.001819223,0.003646212,0.003720357,0.06586747],"category_scores_gemma":[0.01210219,0.0006741898,0.001970605,0.002117372,0.001031885,0.001123737,0.002034439,0.002787442,0.06535156],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002025161,"about_ca_system_score_gemma":0.002633533,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.02312572,"about_ca_topic_score_gemma":0.0640158,"domain_scores_codex":[0.9978156,0.0005409253,0.0001996169,0.0005474535,0.0006805873,0.0002157646],"domain_scores_gemma":[0.9939813,0.002070166,0.0003970822,0.001745277,0.001421822,0.0003844091],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.00009240644,0.00003784404,0.000358554,0.0002593872,0.00002887503,0.00001899076,0.000008669153,0.0004334155,0.0001146699,0.0003936398,0.9964258,0.001827721],"study_design_scores_gemma":[0.0008783656,0.00004166198,0.004030777,0.0002809794,0.00005947044,0.0001251847,0.00005854179,0.002912546,0.001635927,0.004363108,0.9855654,0.00004805529],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.000637272,0.0001483818,0.0006055287,0.0008897343,0.0002891827,0.00004449834,0.9943778,0.001120305,0.001887263],"genre_scores_gemma":[0.001971818,0.00004242293,0.001703141,0.0005173763,0.00002544159,0.0001606638,0.9934508,0.0001917035,0.001936687],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.06586747,"threshold_uncertainty_score":0.2203487,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05509660663805174,"score_gpt":0.3056263473297567,"score_spread":0.250529740691705,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}