{"id":"W4402474540","doi":"10.1109/ccece59415.2024.10667080","title":"Evaluating GPT-4’s Ability to Identify Additional Context","year":2024,"lang":"en","type":"article","venue":"","topic":"Intelligent Tutoring Systems and Adaptive Learning","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Queen's University","funders":"","keywords":"Context (archaeology); Computer science; Biology","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.000812826,0.00009166698,0.00009207355,0.00008388906,0.000115189,0.0005074649,0.0003492961,0.00002888459,0.002836457],"category_scores_gemma":[0.0002302454,0.00007709749,0.00007422377,0.0002566095,0.00001059698,0.0003575649,0.0001637009,0.0001337716,0.00311648],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00008981107,"about_ca_system_score_gemma":0.00008439666,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00007346039,"about_ca_topic_score_gemma":0.000007566144,"domain_scores_codex":[0.9987187,0.0000816445,0.0002131963,0.0004168592,0.0003706551,0.0001988844],"domain_scores_gemma":[0.9991657,0.0003562556,0.00001990864,0.0002528226,0.0001249754,0.00008039945],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"not_applicable","study_design_scores_codex":[0.000001105883,0.00001133054,0.00004721197,0.0000320036,0.00001300151,0.00001343811,0.0008439728,0.0005514298,0.003208419,0.8584222,0.02490501,0.1119509],"study_design_scores_gemma":[0.00006625741,0.0001604092,0.004161855,0.0003931562,0.000004419752,0.00003084756,0.0002199657,0.1193902,0.001824204,0.00507229,0.8683568,0.0003195832],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.0179585,0.0001335746,0.965225,0.001291226,0.00194852,0.0002071769,0.00002098287,0.0005847662,0.01263025],"genre_scores_gemma":[0.943823,3.074722e-7,0.02488143,0.0004148542,0.0003444083,0.00004479076,0.000006366868,0.000007986819,0.03047681],"genre_candidate":"methods","genre_consensus":null,"teacher_disagreement_score":0.9403436,"threshold_uncertainty_score":0.9980751,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0939552438365819,"score_gpt":0.4011849008741182,"score_spread":0.3072296570375363,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}