{"id":"W2949286092","doi":"10.48550/arxiv.1506.00717","title":"Assessing Efficiency-Effectiveness Tradeoffs in Multi-Stage Retrieval Systems Without Using Relevance Judgments","year":2015,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Information Retrieval and Search Behavior","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Waterloo","funders":"","keywords":"Ranking (information retrieval); Computer science; Relevance (law); Information retrieval; Set (abstract data type); Filter (signal processing); Matching (statistics); Data mining; Categorization; Quality (philosophy); Sequence (biology); Range (aeronautics); Artificial intelligence; Statistics; Mathematics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.002226224,0.0004173239,0.0005741548,0.0006056136,0.0002219667,0.0006605965,0.001796671,0.0004090825,0.00000255824],"category_scores_gemma":[0.0002574239,0.0004571519,0.0001524785,0.00149098,0.0001447665,0.002393257,0.001428057,0.001023898,0.00003279168],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001545416,"about_ca_system_score_gemma":0.0009200028,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004222642,"about_ca_topic_score_gemma":0.000007825774,"domain_scores_codex":[0.9966615,0.0007524423,0.0004718846,0.001065409,0.0004154178,0.0006333785],"domain_scores_gemma":[0.9974898,0.0002183991,0.0004626777,0.001011163,0.0005519905,0.0002659878],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001295003,0.0002956509,0.01263241,0.0004027211,0.00003390231,0.000587336,0.0007877483,0.9763867,0.0003590048,0.008203939,0.000004308492,0.000176778],"study_design_scores_gemma":[0.001419824,0.00005382722,0.003972922,0.0005867187,0.00003068627,0.00001231253,0.0004035365,0.9923484,0.0003809986,0.0001905731,0.00006282586,0.0005373372],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.5006717,0.0001011189,0.4975036,0.000005618738,0.0007920943,0.0005829568,0.00001220134,0.0001235568,0.0002071742],"genre_scores_gemma":[0.9964905,0.00003126081,0.003039983,0.00002181808,0.00003085934,0.000001333519,0.00001310153,0.00002143477,0.0003496488],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.4958189,"threshold_uncertainty_score":0.999788,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3072605242575094,"score_gpt":0.3051748975643966,"score_spread":0.002085626693112796,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}