{"id":"W4412603234","doi":"10.2139/ssrn.5353923","title":"Generative AI for Data Scraping","year":2025,"lang":"en","type":"preprint","venue":"SSRN Electronic Journal","topic":"Data Mining Algorithms and Applications","field":"Computer Science","cited_by":4,"is_retracted":false,"has_abstract":false,"ca_institutions":"McGill University","funders":"","keywords":"Generative grammar; Artificial intelligence; Computer science; Generative model; Natural language processing; Data science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004041997,0.0007928805,0.001813426,0.001795915,0.001390279,0.002819247,0.00325068,0.002227369,0.006834511],"category_scores_gemma":[0.02311479,0.001060395,0.002602658,0.002253345,0.003293987,0.003696365,0.006485669,0.004826315,0.001560301],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001273062,"about_ca_system_score_gemma":0.001539332,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.003056243,"about_ca_topic_score_gemma":0.004464125,"domain_scores_codex":[0.9962669,0.001624146,0.0002462559,0.0006628872,0.0009623163,0.0002375431],"domain_scores_gemma":[0.9789659,0.01525393,0.0003737013,0.004146113,0.0009146754,0.0003457062],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000212112,0.0001367877,0.002233207,0.0006213664,0.0002463509,0.0005608633,0.001056375,0.2983883,0.004194629,0.4172316,0.01353913,0.2615793],"study_design_scores_gemma":[0.00001515228,0.00002007912,0.00008235014,0.00003797509,0.00002430044,0.0001184421,0.00005072468,0.72675,0.001072443,0.2679644,0.003850222,0.00001380643],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.003129859,0.0004298479,0.9926667,0.0004652175,0.00005849967,0.00004357666,0.00008492427,0.001265094,0.001856305],"genre_scores_gemma":[0.3384888,0.0008460988,0.6467939,0.001056729,0.000202153,0.0003253111,0.0009205685,0.001088831,0.01027763],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.006834511,"threshold_uncertainty_score":0.02286369,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.04355453867628083,"score_gpt":0.3401694084707009,"score_spread":0.29661486979442,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}