{"id":"W4413611910","doi":"10.1016/j.rmal.2025.100248","title":"Generating synthetic data for CALL research with GenAI: A proof-of-concept study","year":2025,"lang":"en","type":"article","venue":"Research Methods in Applied Linguistics","topic":"Video Analysis and Summarization","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of British Columbia","funders":"","keywords":"Proof of concept; Computer science; Data science","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.01516985,0.00104898,0.0006603219,0.0006887354,0.0005520086,0.001568685,0.001723716,0.001400477,0.004124374],"category_scores_gemma":[0.05090247,0.0002643339,0.000714354,0.0005957533,0.001273981,0.00165227,0.001822628,0.002069393,0.001017002],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001004672,"about_ca_system_score_gemma":0.001239585,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001417471,"about_ca_topic_score_gemma":0.001462426,"domain_scores_codex":[0.9913366,0.006038394,0.0002232846,0.0006382816,0.001510275,0.0002531466],"domain_scores_gemma":[0.9409685,0.04800616,0.001384559,0.005163906,0.003791649,0.0006852719],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.003003762,0.003608781,0.01667967,0.003829614,0.0006379237,0.0009074841,0.001302182,0.5292176,0.01321219,0.09926153,0.04976798,0.2785713],"study_design_scores_gemma":[0.0007176902,0.002115936,0.003371686,0.0004243017,0.00009618697,0.0006027399,0.0007240421,0.9041681,0.01888823,0.03598687,0.03281019,0.00009395979],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3542955,0.004548903,0.5908659,0.006648195,0.001176926,0.004096795,0.008204557,0.003239288,0.026924],"genre_scores_gemma":[0.7339628,0.001224812,0.2487006,0.001734987,0.0002400313,0.00317779,0.006957776,0.00038596,0.00361519],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01516985,"threshold_uncertainty_score":0.08022684,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.3565748183624333,"score_gpt":0.5723938787290209,"score_spread":0.2158190603665877,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}