{"id":"W2922481072","doi":"10.48550/arxiv.1903.08351","title":"Distributed Maximization of Submodular plus Diversity Functions for Multi-label Feature Selection on Huge Datasets","year":2019,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Text and Document Classification Technologies","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Submodular set function; Feature selection; Redundancy (engineering); Computer science; Automatic summarization; Feature (linguistics); Greedy algorithm; Maximization; Function (biology); Data mining; Mathematical optimization; Optimization problem; Minimum redundancy feature selection; Selection (genetic algorithm); Artificial intelligence; Machine learning; Algorithm; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004344011,0.001315366,0.002464347,0.0009324752,0.0008619135,0.001240124,0.001877447,0.00169356,0.002032498],"category_scores_gemma":[0.008792123,0.0005470781,0.0009189309,0.002071139,0.001171927,0.002301404,0.001601981,0.001809227,0.0006539891],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00172431,"about_ca_system_score_gemma":0.001328397,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002183266,"about_ca_topic_score_gemma":0.00288797,"domain_scores_codex":[0.998002,0.001014923,0.00005502981,0.0003823529,0.0003726471,0.0001730047],"domain_scores_gemma":[0.9938049,0.004638604,0.0003861809,0.0004529038,0.0005379099,0.0001794847],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0002525641,0.0002162024,0.0008439865,0.0001541581,0.00009113272,0.0001183162,0.00009107486,0.8477446,0.002880451,0.01264875,0.005902754,0.1290561],"study_design_scores_gemma":[0.00002550501,0.0000308969,0.000135696,0.00000383689,0.000005465248,0.00001761905,0.0000113698,0.9867859,0.0004045812,0.01230147,0.0002727015,0.000004910893],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.01250656,0.0003168497,0.9854465,0.0004637624,0.00002496531,0.00005502884,0.00009121279,0.0003746739,0.0007205802],"genre_scores_gemma":[0.5424305,0.0004511305,0.4506389,0.0005648852,0.0003126836,0.0005764589,0.0008818695,0.0002314037,0.003912125],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.004344011,"threshold_uncertainty_score":0.02297366,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1241586205553751,"score_gpt":0.225360866407087,"score_spread":0.1012022458517119,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}