{"id":"W4327671617","doi":"10.48550/arxiv.2303.08518","title":"UPRISE: Universal Prompt Retrieval for Improving Zero-Shot Evaluation","year":2023,"lang":"en","type":"preprint","venue":"arXiv (Cornell University)","topic":"Topic Modeling","field":"Computer Science","cited_by":2,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"","keywords":"Task (project management); Computer science; Generalization; Set (abstract data type); Zero (linguistics); Shot (pellet); Labrador Retriever; Filling-in; Code (set theory); Computer security; Artificial intelligence; Medicine; Engineering; Programming language; Pathology; Mathematics","routes":{"ca_aff":false,"ca_fund":false,"ca_venue":false,"about_ca":true,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.001226395,0.0003411517,0.0003407324,0.0004005725,0.0002465109,0.000189993,0.00209719,0.0003960546,0.0000144858],"category_scores_gemma":[0.0002359834,0.0004309251,0.0002670439,0.0006195192,0.00005972185,0.0005457089,0.00230242,0.0005301873,0.00004686082],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0007436268,"about_ca_system_score_gemma":0.0008517033,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0001433134,"about_ca_topic_score_gemma":0.00002901759,"domain_scores_codex":[0.9970728,0.0001640221,0.0002825123,0.00171086,0.0002690588,0.000500805],"domain_scores_gemma":[0.9971849,0.0001874751,0.0003577727,0.001556623,0.000546419,0.0001667623],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"simulation_or_modeling","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001221743,0.00007930482,0.0005657013,0.0003701388,0.000150807,0.0001226592,0.0007370801,0.7845853,0.000485405,0.2066336,0.0005481861,0.005599634],"study_design_scores_gemma":[0.0008029087,0.00005663146,0.0002110021,0.00005601255,0.0001362235,0.000001567102,0.00006819239,0.9272981,0.0002388017,0.07051034,0.0001998947,0.0004203652],"study_design_candidate":"simulation_or_modeling","study_design_consensus":"simulation_or_modeling","genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.1319424,0.0000281436,0.8639569,0.0002426171,0.001621613,0.001218345,0.00002028321,0.0005605999,0.0004090763],"genre_scores_gemma":[0.9864083,0.00001651677,0.01044642,0.0000367154,0.0001607438,0.00000365165,0.00004795804,0.00003769536,0.002842036],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.8544658,"threshold_uncertainty_score":0.9998143,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.2033081645517611,"score_gpt":0.2405385146988309,"score_spread":0.03723035014706982,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}