{"id":"W3034927159","doi":"10.1145/3397271.3401412","title":"Vis-Trec: A System for the In-depth Analysis of trec_eval Results","year":2020,"lang":"en","type":"article","venue":"","topic":"Scientific Computing and Data Management","field":"Decision Sciences","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"Toronto Metropolitan University","funders":"Agence Nationale de la Recherche","keywords":"Computer science; Python (programming language); Information retrieval; Extensibility; Open source; Source code; World Wide Web; Programming language; Software","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.006560918,0.00006814636,0.0002852007,0.0003595598,0.00007723098,0.0001977525,0.001087431,0.00001779849,0.0000646987],"category_scores_gemma":[0.003670063,0.00003466369,0.0002093393,0.004643987,0.00004117579,0.00007847724,0.0002564893,0.00003656089,0.00005835718],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00001645105,"about_ca_system_score_gemma":0.00002346005,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001749178,"about_ca_topic_score_gemma":0.0005343552,"domain_scores_codex":[0.9975152,0.0001181728,0.0007775217,0.0005618262,0.0008797096,0.0001475881],"domain_scores_gemma":[0.9953101,0.003403562,0.0002194021,0.0008601136,0.0001484452,0.00005842435],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0008975526,0.0001624069,0.01295579,0.00006488774,0.001046026,0.000009705198,0.007440707,0.1014215,0.0001813962,0.01683129,0.4857893,0.3731995],"study_design_scores_gemma":[0.0004770659,0.00004430207,0.02164786,0.000007779048,0.0001915109,1.303017e-7,0.007812111,0.9352118,0.0001103598,0.00007200898,0.034361,0.00006401362],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1923686,0.0002082392,0.6606682,0.03608154,0.002305576,0.001677597,0.0006743236,0.0002447409,0.1057712],"genre_scores_gemma":[0.9971009,8.564172e-7,0.001062545,0.0001630489,0.00003046591,0.000005865614,0.00001021025,0.00000230689,0.001623794],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8337904,"threshold_uncertainty_score":0.4393673,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2569924804930374,"score_gpt":0.4157226528767722,"score_spread":0.1587301723837348,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}