{"id":"W4407684169","doi":"10.48550/arxiv.2502.10760","title":"Why is prompting hard? Understanding prompts on binary sequence predictors","year":2025,"lang":"en","type":"preprint","venue":"ArXiv.org","topic":"Evolutionary Algorithms and Applications","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Institute for Catastrophic Loss Reduction","keywords":"Sequence (biology); Binary number; Psychology; Computer science; Genetics; Mathematics; Biology; Arithmetic","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004951756,0.0009131391,0.001018875,0.0005717057,0.0006791578,0.002270154,0.0009700999,0.001698559,0.01022191],"category_scores_gemma":[0.06715906,0.0006028,0.0004809132,0.0005511929,0.002262617,0.005728676,0.001969251,0.003958346,0.001313551],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001104766,"about_ca_system_score_gemma":0.001246805,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001501118,"about_ca_topic_score_gemma":0.001518647,"domain_scores_codex":[0.9977197,0.001122189,0.0001025569,0.0005747922,0.0002716913,0.000209159],"domain_scores_gemma":[0.9615892,0.03097175,0.00258443,0.002562623,0.001206499,0.001085482],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002408999,0.0006257366,0.03116712,0.001277662,0.0001647241,0.0006628822,0.003773265,0.335292,0.0176047,0.3082718,0.01703888,0.2817123],"study_design_scores_gemma":[0.0000948532,0.0003147972,0.007860957,0.0001961243,0.00003969955,0.0001504824,0.0006759741,0.4570462,0.004321478,0.5253171,0.003901113,0.00008119246],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3635384,0.00127551,0.617029,0.003751466,0.0001787582,0.0001447529,0.0008594395,0.001845632,0.01137714],"genre_scores_gemma":[0.9415037,0.0004266716,0.05350116,0.0003641856,0.00006038611,0.000194646,0.0005963808,0.0003938559,0.002958974],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.01022191,"threshold_uncertainty_score":0.03419566,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1358133988045544,"score_gpt":0.3089118984965303,"score_spread":0.1730984996919759,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}