{"id":"W6912967016","doi":"10.5683/sp3/qcfq3x","title":"Technical Note on the Extraction of StatCan Data Files","year":2007,"lang":"en","type":"dataset","venue":"Borealis","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université du Québec à Montréal","funders":"","keywords":"Microdata (statistics); Data extraction; Data file; File format; Information extraction","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.02823226,0.001377857,0.001185179,0.007796706,0.003088611,0.005314339,0.002763603,0.00123164,0.09267198],"category_scores_gemma":[0.1079589,0.002112682,0.002264631,0.009064515,0.001507859,0.004518846,0.005337954,0.005867324,0.094637],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.002730727,"about_ca_system_score_gemma":0.01024136,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01853972,"about_ca_topic_score_gemma":0.03531753,"domain_scores_codex":[0.9725209,0.006499958,0.005244855,0.003073375,0.01172545,0.0009354336],"domain_scores_gemma":[0.8864127,0.04127189,0.003113268,0.02529535,0.04239343,0.00151328],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0001466897,0.00007179962,0.0009413593,0.0004493699,0.00002668897,0.0001974048,0.0005598475,0.0002135104,0.003296874,0.004277123,0.9437442,0.04607515],"study_design_scores_gemma":[0.00006797094,0.00003650957,0.004363712,0.0004534543,0.0000346073,0.0002365763,0.0003230147,0.0007430075,0.005831576,0.002933159,0.9848801,0.00009633541],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.006944678,0.0005701365,0.333916,0.02692312,0.01723947,0.005738703,0.4886844,0.06602882,0.05395466],"genre_scores_gemma":[0.009177412,0.0007230123,0.5225132,0.01027842,0.002374067,0.01207101,0.3609999,0.03207416,0.04978879],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.9814603,"threshold_uncertainty_score":0.3100187,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0722647363438514,"score_gpt":0.3712212135801127,"score_spread":0.2989564772362613,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}