{"id":"W1540287813","doi":"","title":"Robustness of Level-k Reasoning in Generalized Beauty Contest Games","year":2009,"lang":"en","type":"preprint","venue":"RePEc: Research Papers in Economics","topic":"Experimental Behavioral Economics Studies","field":"Social Sciences","cited_by":5,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"CONTEST; Predictive power; Robustness (evolution); Beauty; Private information retrieval; Computer science; Mathematics; Social psychology; Psychology; Physics; Political science; Chemistry; Statistics","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.004212732,0.0003438861,0.001049398,0.000616267,0.0002590711,0.000143633,0.001050869,0.0005542734,0.00008345486],"category_scores_gemma":[0.0007970369,0.0004217423,0.0002182357,0.0002160293,0.001152363,0.0001913025,0.001038277,0.001323149,0.000002927971],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00310048,"about_ca_system_score_gemma":0.001215219,"about_ca_topic_candidate":true,"about_ca_topic_consensus":true,"about_ca_topic_score_codex":0.01006111,"about_ca_topic_score_gemma":0.03907595,"domain_scores_codex":[0.9958162,0.0007309641,0.001055411,0.0009439276,0.0003240108,0.001129454],"domain_scores_gemma":[0.9981201,0.0004438063,0.0003909664,0.0006822907,0.0001587382,0.0002041294],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"observational","study_design_scores_codex":[0.0006630759,0.001852745,0.480275,0.0003395454,0.0002754671,0.0001302865,0.03924455,0.1597569,0.00149002,0.0301372,0.0003915751,0.2854435],"study_design_scores_gemma":[0.02411918,0.001832481,0.4977359,0.01213477,0.0001967533,0.00002840321,0.269941,0.06976473,0.01642826,0.03153486,0.06275334,0.01353029],"study_design_candidate":"observational","study_design_consensus":"observational","genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.8871509,0.0007147015,0.000002004394,0.0005220837,0.0004687461,0.0009707626,0.00006629127,0.00003261402,0.1100719],"genre_scores_gemma":[0.9770988,0.01716607,0.003421112,0.00003764711,0.0002596517,0.0002665794,0.00003678414,0.00005039176,0.001663026],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.2719132,"threshold_uncertainty_score":0.9998235,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1029547175652267,"score_gpt":0.4018851204680235,"score_spread":0.2989304029027968,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}