{"id":"W3153557349","doi":"10.1145/3404835.3462951","title":"Not All Relevance Scores are Equal: Efficient Uncertainty and Calibration Modeling for Deep Retrieval Models","year":2021,"lang":"en","type":"article","venue":"","topic":"Information Retrieval and Search Behavior","field":"Computer Science","cited_by":17,"is_retracted":false,"has_abstract":true,"ca_institutions":"Microsoft (Canada)","funders":"","keywords":"Ranking (information retrieval); Relevance (law); Metric (unit); Calibration; Bayesian probability; Divergence-from-randomness model; Process (computing); Scope (computer science); Bayesian inference","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.005511242,0.0009862108,0.002115187,0.001125592,0.0006978548,0.002548932,0.002766163,0.002094714,0.002427248],"category_scores_gemma":[0.0337263,0.001003058,0.001042947,0.001380219,0.002027183,0.006490821,0.002191836,0.003736472,0.0006954925],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002243426,"about_ca_system_score_gemma":0.001545343,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007629321,"about_ca_topic_score_gemma":0.006429613,"domain_scores_codex":[0.9969796,0.001177046,0.000173491,0.0005852534,0.0007781982,0.000306407],"domain_scores_gemma":[0.9870682,0.009089162,0.001116026,0.001347247,0.001078108,0.0003012178],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000227179,0.00008888509,0.001618878,0.00008702752,0.00005526179,0.0001297825,0.0002439216,0.8709745,0.001976399,0.06268125,0.001422848,0.06049401],"study_design_scores_gemma":[0.000009081874,0.0000229545,0.0001839872,0.000008076608,0.000008791631,0.00002327158,0.00001083066,0.9650818,0.000358114,0.0340915,0.0001909049,0.00001064929],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.04376347,0.000372959,0.9531468,0.0006563823,0.00001840218,0.00005614653,0.0001416436,0.0005123859,0.00133178],"genre_scores_gemma":[0.8779553,0.0004566686,0.1165323,0.0003089488,0.0001007578,0.0001838432,0.0004300264,0.0001829585,0.003849192],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.007629321,"threshold_uncertainty_score":0.02914655,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.06952907239637028,"score_gpt":0.2941728339338712,"score_spread":0.2246437615375009,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}