{"id":"W6910292781","doi":"10.48448/4cw1-5y07","title":"Few-shot Fine-tuning vs. In-context Learning: A Fair Comparison and Evaluation","year":2022,"lang":"en","type":"other","venue":"Underline Science Inc.","topic":"","field":"","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Mila - Quebec Artificial Intelligence Institute","funders":"","keywords":"Generalization; Spurious relationship; Property (philosophy); Adaptation (eye); Task (project management); Variation (astronomy); Simplicity","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.006099627,0.000494645,0.0006859399,0.002522638,0.000530278,0.0002774356,0.0009340965,0.0001972427,0.01004214],"category_scores_gemma":[0.001202304,0.0004989205,0.0000540009,0.002623651,0.001172741,0.0003319753,0.0006846678,0.001244852,0.0007212683],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001150414,"about_ca_system_score_gemma":0.001142173,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.001149973,"about_ca_topic_score_gemma":0.009349609,"domain_scores_codex":[0.9943048,0.0005687801,0.0005721752,0.001338586,0.002430141,0.0007855343],"domain_scores_gemma":[0.9981285,0.0002007114,0.0006994961,0.0005911819,0.0001673975,0.0002127066],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.000379953,0.0009519559,0.1889596,0.0003891808,0.0001600279,0.00008659639,0.01406121,0.03521992,0.008968619,0.004472492,0.4711081,0.2752424],"study_design_scores_gemma":[0.002116844,0.0004709929,0.002601167,0.0002468941,0.0001034269,0.00002403088,0.004053101,0.5437722,0.00007025277,0.0001682257,0.4454784,0.0008943756],"study_design_candidate":"not_applicable","study_design_consensus":null,"genre_codex":"other","genre_gemma":"empirical","genre_scores_codex":[0.08509333,0.006032379,0.0003704622,0.0007434508,0.001493163,0.003783633,0.0001272439,0.001389499,0.9009668],"genre_scores_gemma":[0.9329354,0.00002631997,0.0009773775,0.0001067854,0.0001834603,0.000124748,0.0003194084,0.0005888626,0.06473765],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.847842,"threshold_uncertainty_score":0.9997463,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.07042102379805251,"score_gpt":0.3611356012055079,"score_spread":0.2907145774074554,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}