{"id":"W4287206427","doi":"10.48550/arxiv.2104.09399","title":"TREC Deep Learning Track: Reusable Test Collections in the Large Data\\n Regime","year":2021,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Domain Adaptation and Few-Shot Learning","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Microsoft (Canada)","funders":"","keywords":"Overfitting; Computer science; Reuse; Test set; Set (abstract data type); Deep learning; Track (disk drive); Data set; Information retrieval; Test data; Artificial intelligence; Training set; Artificial neural network; Test (biology); Selection (genetic algorithm); Data mining; Programming language","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.001089454,0.0002543216,0.0002882996,0.0003401209,0.0006553911,0.0006515684,0.003288643,0.0002235551,0.0001209359],"category_scores_gemma":[0.0005369358,0.0002645003,0.0001237726,0.002418773,0.00006704346,0.0007285265,0.002231242,0.001526315,0.00007023817],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001723035,"about_ca_system_score_gemma":0.0003184541,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.000206214,"about_ca_topic_score_gemma":0.001222244,"domain_scores_codex":[0.9972916,0.0006204841,0.0002427001,0.001244831,0.0001580978,0.0004422917],"domain_scores_gemma":[0.9968136,0.0006777152,0.0002456191,0.002036396,0.0001249423,0.0001017546],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.00003961689,0.001236813,0.01985025,0.0001384689,0.0001901164,0.003099089,0.01344603,0.8613212,0.00007522845,0.08982249,0.006308404,0.004472283],"study_design_scores_gemma":[0.0006095999,0.00004205888,0.002618245,0.00008152096,0.000039282,0.00002241997,0.004022387,0.9460642,0.000007645426,0.001735697,0.04438306,0.0003738661],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.02768157,0.0003083254,0.9256524,0.0006128825,0.000588726,0.0004249797,0.00001654681,0.0003528267,0.04436177],"genre_scores_gemma":[0.9806147,0.0003238291,0.003079246,0.0002413587,0.00006647496,0.000002111274,0.0001252134,0.00001841072,0.01552864],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9529331,"threshold_uncertainty_score":0.9999807,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.09775210036667754,"score_gpt":0.2110734881241472,"score_spread":0.1133213877574697,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}