{"id":"W4414576662","doi":"10.7910/dvn/w5ai5a","title":"Replication Package for \"From Online Job Postings to Economic Insights: A Machine Learning Approach to Structuring Naturally Occurring Data\"","year":2025,"lang":"en","type":"dataset","venue":"Harvard Dataverse","topic":"AI and HR Technologies","field":"Business, Management and Accounting","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Bank of Canada","funders":"","keywords":"Replication (statistics); Replicate; Transparency (behavior); Confidentiality; Raw data; Code (set theory); Pipeline (software)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[{"model":"gemma","categories":["open_science"],"domain":null,"study_design":"not_applicable","genre":"dataset","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"},{"model":"gpt","categories":["open_science"],"domain":null,"study_design":"not_applicable","genre":"dataset","about_ca_system":false,"about_ca_topic":false,"confidence":"high","status":"direct model label, unvalidated"}],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01262559,0.001870796,0.00145632,0.003194206,0.001409562,0.003594207,0.004458843,0.001288779,0.2143608],"category_scores_gemma":[0.09879031,0.002077448,0.003721205,0.005660364,0.001216319,0.003364869,0.004682607,0.003412518,0.1352108],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001909532,"about_ca_system_score_gemma":0.00798117,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.03031299,"about_ca_topic_score_gemma":0.02813768,"domain_scores_codex":[0.9936103,0.001683363,0.0008343877,0.001821686,0.001712424,0.0003378468],"domain_scores_gemma":[0.9420559,0.02201857,0.001502986,0.02378006,0.009813994,0.0008286837],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"not_applicable","study_design_scores_codex":[0.0003738555,0.00008266798,0.001817982,0.0007816602,0.0002194886,0.0000949867,0.0004770462,0.001879968,0.0007538669,0.008205024,0.9452333,0.04008017],"study_design_scores_gemma":[0.0007853275,0.00009921019,0.006833036,0.0004767822,0.0001291096,0.0001790859,0.0003568518,0.01713842,0.005194306,0.03216575,0.9363984,0.0002437676],"study_design_candidate":"not_applicable","study_design_consensus":"not_applicable","genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.001648618,0.00009887043,0.165458,0.0009265851,0.00103774,0.001051071,0.6194251,0.2016975,0.008656439],"genre_scores_gemma":[0.0136963,0.0001785181,0.3006581,0.0006148044,0.0002247609,0.00770361,0.5774538,0.08804654,0.01142357],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.2143608,"threshold_uncertainty_score":0.7171084,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02730397854844898,"score_gpt":0.2575495038037025,"score_spread":0.2302455252552535,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}