{"id":"W2082055394","doi":"10.1007/s10791-012-9218-8","title":"Increasing evaluation sensitivity to diversity","year":2013,"lang":"en","type":"article","venue":"Information Retrieval","topic":"Information Retrieval and Search Behavior","field":"Computer Science","cited_by":22,"is_retracted":false,"has_abstract":false,"ca_institutions":"University of Waterloo","funders":"National Science Foundation","keywords":"Computer science; Diversity (politics); Context (archaeology); Information retrieval; Discriminative model; Measure (data warehouse); Data science; Data mining; Artificial intelligence; Geography","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.03186589,0.0007833574,0.001394857,0.002833553,0.0009257513,0.004663874,0.001071175,0.002570878,0.003536755],"category_scores_gemma":[0.2705443,0.0007639112,0.0007706834,0.001766243,0.001700003,0.007153212,0.004030129,0.00277407,0.0006886284],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002269134,"about_ca_system_score_gemma":0.001143727,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00133173,"about_ca_topic_score_gemma":0.0008784998,"domain_scores_codex":[0.9497899,0.03108793,0.00242184,0.00580089,0.00940295,0.001496581],"domain_scores_gemma":[0.5014905,0.427412,0.01602565,0.03529934,0.01712867,0.002643789],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.006039691,0.001363112,0.1730998,0.001315174,0.001667957,0.0007646561,0.004143725,0.1022283,0.1067958,0.04872802,0.006792291,0.5470616],"study_design_scores_gemma":[0.0004234088,0.003205668,0.1506961,0.0004257455,0.001517262,0.00289762,0.001958851,0.5333737,0.09894913,0.1924105,0.01372273,0.000419242],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8302637,0.002683844,0.1340203,0.003195961,0.0002006663,0.0002245028,0.0002306398,0.001389529,0.02779097],"genre_scores_gemma":[0.9887512,0.0001527054,0.009589763,0.000322578,0.0000856514,0.00002820682,0.00006204025,0.0001001476,0.0009077214],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.03186589,"threshold_uncertainty_score":0.1685249,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02380544427014461,"score_gpt":0.2593833951838307,"score_spread":0.2355779509136861,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}