{"id":"W2239662196","doi":"10.5539/elt.v9n2p102","title":"How Do Raters Judge Spoken Vocabulary?","year":2016,"lang":"en","type":"article","venue":"English Language Teaching","topic":"Second Language Acquisition and Learning","field":"Psychology","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Psychology; Vocabulary; Consistency (knowledge bases); Variation (astronomy); Linguistics; Rasch model; Rating scale; Natural language processing; Cognitive psychology; Artificial intelligence; Developmental psychology; Computer science","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":true,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.0008136594,0.0002352952,0.0002338822,0.0001857689,0.000176124,0.0001980793,0.0003272223,0.0001530984,0.03037183],"category_scores_gemma":[0.0007848237,0.0001671526,0.0001319709,0.00009850883,0.00005739168,0.0003674169,0.00006784769,0.000499463,0.0005465243],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00006372086,"about_ca_system_score_gemma":0.00001259948,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00007729862,"about_ca_topic_score_gemma":0.0000045119,"domain_scores_codex":[0.9980572,0.0005244141,0.0002021513,0.0004865426,0.0002046361,0.0005250131],"domain_scores_gemma":[0.9987708,0.0002832027,0.0001158782,0.0006437066,0.00002785994,0.00015849],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"qualitative","study_design_gemma":"qualitative","study_design_scores_codex":[0.00008958466,0.0001284179,0.002061124,0.0000185661,0.0001877299,0.00147014,0.5653476,0.000001518875,0.02546659,0.01406156,0.01732544,0.3738417],"study_design_scores_gemma":[0.005582467,0.0002427749,0.004685406,0.0002554977,0.00009198944,0.0001934123,0.6186437,0.000009246295,0.003981765,0.0001076985,0.3648023,0.001403749],"study_design_candidate":"qualitative","study_design_consensus":"qualitative","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.9022071,0.003827638,0.002553213,0.0007991937,0.001620183,0.0001599051,0.00001675039,0.0006482139,0.08816778],"genre_scores_gemma":[0.9656804,0.000002051492,0.0004385543,0.003116401,0.001675886,0.00002399911,0.00002484852,0.00006417463,0.02897366],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.372438,"threshold_uncertainty_score":0.9705145,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.008731158519110651,"score_gpt":0.2708562456947734,"score_spread":0.2621250871756627,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}