{"id":"W4313171465","doi":"10.1109/cvpr52688.2022.00037","title":"How Much More Data Do I Need? Estimating Requirements for Downstream Tasks","year":2022,"lang":"en","type":"article","venue":"2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","topic":"Machine Learning and Algorithms","field":"Computer Science","cited_by":24,"is_retracted":false,"has_abstract":true,"ca_institutions":"Vector Institute; University of Toronto","funders":"","keywords":"Computer science; Task (project management); Function (biology); Set (abstract data type); Downstream (manufacturing); Data set; Estimator; Data validation; Machine learning; Artificial intelligence; Data mining; Database; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01049118,0.00109628,0.001523699,0.001012213,0.0008461419,0.002886235,0.003011931,0.002785476,0.004787068],"category_scores_gemma":[0.1457647,0.001189613,0.001002278,0.001290576,0.001590699,0.009978307,0.00227256,0.003110964,0.004533781],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001086809,"about_ca_system_score_gemma":0.002306984,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003997496,"about_ca_topic_score_gemma":0.003791376,"domain_scores_codex":[0.9918298,0.002997949,0.000622032,0.001948576,0.002128958,0.0004726938],"domain_scores_gemma":[0.8979675,0.07026947,0.00402414,0.01757713,0.008281738,0.001879922],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002869084,0.001190613,0.05934878,0.001333476,0.0002439477,0.0005159874,0.001426045,0.1699769,0.0788507,0.02132668,0.01463938,0.6482784],"study_design_scores_gemma":[0.0001660549,0.0009883959,0.0344166,0.00025205,0.0001176682,0.0009345406,0.0009645988,0.8266732,0.06726153,0.05563064,0.01243763,0.0001571178],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.2152359,0.0008331428,0.7678846,0.004697604,0.0001201656,0.0004575351,0.001610648,0.002522563,0.006637901],"genre_scores_gemma":[0.4862083,0.0004411663,0.5057552,0.0008681652,0.0001126289,0.0007852818,0.002185433,0.001099898,0.002543928],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.01049118,"threshold_uncertainty_score":0.05548334,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09217580612085,"score_gpt":0.3321902057448282,"score_spread":0.2400143996239782,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}