{"id":"W2901302597","doi":"10.23889/ijpds.v3i5.1045","title":"Administrative Data Format Standardization for Efficient Analytics","year":2018,"lang":"en","type":"article","venue":"International Journal for Population Data Science","topic":"Data Quality and Management","field":"Decision Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Statistics Canada","funders":"","keywords":"Computer science; Standardization; Data quality; Data management; Data science; Data pre-processing; Metadata; Data governance; Data processing; Data warehouse; Database; Data mining; World Wide Web; Engineering","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaresearch","scholarly_communication","open_science"],"consensus_categories":[],"category_scores_codex":[0.01599687,0.0001228643,0.0001691149,0.0005723927,0.0009868543,0.002598764,0.00973547,0.00003439567,0.000117272],"category_scores_gemma":[0.01698376,0.00009507621,0.00005265886,0.0007306591,0.000373211,0.006162618,0.001989515,0.00008006117,0.00003938696],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0001728803,"about_ca_system_score_gemma":0.0003707409,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0000232593,"about_ca_topic_score_gemma":0.0001946837,"domain_scores_codex":[0.9945347,0.00006322112,0.001014566,0.0007887357,0.003303351,0.0002953865],"domain_scores_gemma":[0.9931769,0.0006220698,0.0008145085,0.001790282,0.00342982,0.0001663892],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0009518501,0.0003688736,0.003581701,0.00001437183,0.0001943838,0.0000054849,0.0008959461,0.008862997,0.0002892292,0.2632155,0.4371873,0.2844323],"study_design_scores_gemma":[0.0005114861,0.0001173113,0.002886443,0.00001800442,0.00002232787,0.00001802284,0.0004732809,0.5718463,0.0001015852,0.01822569,0.405654,0.0001255464],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.004825141,0.00001119596,0.9750781,0.002890409,0.005146208,0.0004413729,0.01106358,0.00001985199,0.0005241592],"genre_scores_gemma":[0.930027,0.00001545623,0.06265778,0.0006246463,0.001296191,0.000008096834,0.004863081,0.00001030493,0.0004974221],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9252019,"threshold_uncertainty_score":0.9984366,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.5881116757594165,"score_gpt":0.5992713194419055,"score_spread":0.01115964368248901,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}