{"id":"W4410794822","doi":"10.1177/08944393251344865","title":"Prompting the Machine: Introducing an LLM Data Extraction Method for Social Scientists","year":2025,"lang":"en","type":"article","venue":"Social Science Computer Review","topic":"Topic Modeling","field":"Computer Science","cited_by":7,"is_retracted":false,"has_abstract":true,"ca_institutions":"Université de Montréal; Université Laval","funders":"","keywords":"Computer science; Extraction (chemistry); Data extraction; Data science; Political science; MEDLINE; Chromatography; Chemistry","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":["metaresearch"],"consensus_categories":[],"category_scores_codex":[0.1282117,0.001391391,0.001244066,0.009563798,0.00291445,0.01062924,0.004221381,0.002695635,0.008368352],"category_scores_gemma":[0.2816649,0.001932982,0.002581187,0.007100431,0.003890993,0.01197218,0.0144098,0.00524304,0.006069045],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00300799,"about_ca_system_score_gemma":0.01177463,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.002174107,"about_ca_topic_score_gemma":0.004518499,"domain_scores_codex":[0.8845164,0.08762831,0.01087006,0.004789598,0.01139722,0.0007983572],"domain_scores_gemma":[0.7292083,0.186458,0.01265598,0.0463017,0.02397156,0.001404537],"domain_codex":null,"domain_gemma":"methods","domain_candidate":"methods","domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003998844,0.0002929585,0.005414987,0.004633668,0.000289539,0.0005386425,0.04186461,0.003641615,0.01089733,0.2278631,0.04746553,0.656698],"study_design_scores_gemma":[0.0002744042,0.00026879,0.003622803,0.004446723,0.0001684368,0.0004760863,0.00716556,0.04331813,0.01762284,0.3607984,0.5614027,0.0004350501],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"methods","genre_scores_codex":[0.001380412,0.0001258465,0.9890404,0.001985813,0.000162962,0.001954462,0.000906766,0.002803367,0.001639934],"genre_scores_gemma":[0.005220815,0.0000968111,0.9894695,0.0003339997,0.00006099503,0.003288409,0.0005277047,0.0005127367,0.0004890133],"genre_candidate":"methods","genre_consensus":"methods","teacher_disagreement_score":0.8717883,"threshold_uncertainty_score":0.6780564,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1056737097266691,"score_gpt":0.46011694349039,"score_spread":0.3544432337637208,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}