{"id":"W2964250748","doi":"","title":"Yes, but did it work?: Evaluating variational inference","year":2018,"lang":"en","type":"article","venue":"Aaltodoc (Aalto University)","topic":"Statistical Methods and Inference","field":"Mathematics","cited_by":24,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"Office of Naval Research; National Science Foundation","keywords":"Inference; Pareto principle; Computer science; Calibration; Sampling (signal processing); Mathematical optimization; Point (geometry); Sampling distribution; Algorithm; Work (physics); Applied mathematics; Mathematics; Artificial intelligence; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02512591,0.0008108194,0.001262558,0.001012025,0.0008059299,0.002768436,0.001492451,0.002833019,0.002517502],"category_scores_gemma":[0.1369228,0.0004590356,0.0006605771,0.0009254391,0.002396453,0.003251333,0.001659542,0.002447314,0.0002661425],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002485337,"about_ca_system_score_gemma":0.00257022,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009278839,"about_ca_topic_score_gemma":0.007326561,"domain_scores_codex":[0.9905811,0.007275412,0.0002286371,0.000859103,0.0008112664,0.0002445696],"domain_scores_gemma":[0.9002669,0.09304385,0.001620994,0.001514846,0.002541623,0.001011709],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"theoretical_or_conceptual","study_design_scores_codex":[0.001017213,0.0002567599,0.03527712,0.0005244733,0.0007740085,0.000262102,0.0008445222,0.5830662,0.001151816,0.1343513,0.009424903,0.2330496],"study_design_scores_gemma":[0.00004431278,0.00009738215,0.00162473,0.0001191016,0.00004148351,0.00004599787,0.00009789343,0.8777214,0.0006786616,0.1184221,0.001073097,0.00003375604],"study_design_candidate":"theoretical_or_conceptual","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.2963488,0.007800678,0.6681377,0.01750171,0.0006054855,0.0002371389,0.0005860446,0.000761513,0.00802105],"genre_scores_gemma":[0.8657954,0.0008328476,0.1304277,0.0007649836,0.0001716292,0.00009748165,0.0004323522,0.0002052918,0.001272225],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.02512591,"threshold_uncertainty_score":0.1328801,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1916885171313321,"score_gpt":0.399855185023395,"score_spread":0.2081666678920628,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}