{"id":"W4223988818","doi":"10.1186/s12859-022-04667-1","title":"Deep clustering of small molecules at large-scale via variational autoencoder embedding and K-means","year":2022,"lang":"en","type":"article","venue":"BMC Bioinformatics","topic":"Machine Learning in Materials Science","field":"Materials Science","cited_by":51,"is_retracted":false,"has_abstract":true,"ca_institutions":"CancerCare Manitoba; University of Manitoba","funders":"Canadian Institutes of Health Research","keywords":"Cluster analysis; Autoencoder; Computer science; Pattern recognition (psychology); Artificial intelligence; Feature (linguistics); Principal component analysis; Cluster (spacecraft); Embedding; Similarity (geometry); Biological system; Data mining; Deep learning; Biology","routes":{"ca_aff":true,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":[],"domain":null,"study_design":"simulation_or_modeling","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"},{"model":"gpt","categories":[],"domain":null,"study_design":"simulation_or_modeling","genre":"methods","about_ca_system":false,"about_ca_topic":false,"confidence":"low","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.0008973761,0.0009911517,0.0009836522,0.0007796056,0.0005492849,0.0008057231,0.001490071,0.001212009,0.001195463],"category_scores_gemma":[0.002109343,0.0006900692,0.001476522,0.0006738771,0.001094235,0.001205703,0.0008838426,0.001622772,0.0003610684],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001849142,"about_ca_system_score_gemma":0.001486073,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01457088,"about_ca_topic_score_gemma":0.01200979,"domain_scores_codex":[0.9996707,0.00009442944,0.00001670601,0.00008795423,0.00009268429,0.0000375363],"domain_scores_gemma":[0.9991,0.0004086055,0.0001224023,0.0001066675,0.0002074295,0.00005488028],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00001635491,0.00001209051,0.0001859692,0.00002111237,0.00002461624,0.00001363654,0.00002527547,0.9831306,0.001413426,0.004031209,0.0002927336,0.01083298],"study_design_scores_gemma":[6.747546e-7,0.000001329922,0.00001675283,6.214399e-7,6.854759e-7,9.935054e-7,0.000001141104,0.9988362,0.0001308072,0.000969656,0.00003995612,0.000001208097],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01916301,0.0001546932,0.9793023,0.0001485574,0.00001872967,0.00002643025,0.00004559715,0.0004274631,0.0007130182],"genre_scores_gemma":[0.4814343,0.0002962524,0.514147,0.0001539862,0.00005033251,0.0001794607,0.0004151247,0.0002689322,0.003054574],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01457088,"threshold_uncertainty_score":0.02897215,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01183289589264877,"score_gpt":0.2411205728047431,"score_spread":0.2292876769120943,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}