{"id":"W7102431007","doi":"","title":"Agent Data Protocol: Unifying Datasets for Diverse, Effective Fine-tuning of LLM Agents","year":2025,"lang":"","type":"article","venue":"arXiv (Cornell University)","topic":"Multi-Agent Systems and Negotiation","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"","funders":"Institute for Catastrophic Loss Reduction","keywords":"Bottleneck; Variety (cybernetics); Protocol (science); Parsing; Representation (politics); Simple (philosophy); Code (set theory); Pipeline (software); Data access","routes":{"ca_aff":false,"ca_fund":true,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":true},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.001135724,0.0004337421,0.0005757933,0.0005212667,0.0006143367,0.0001496218,0.003274682,0.0002172832,0.00005644789],"category_scores_gemma":[0.0002481696,0.0005015897,0.0002040953,0.001669479,0.0001602161,0.00182334,0.003288671,0.0002466959,0.00003492661],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002969375,"about_ca_system_score_gemma":0.0003089824,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0004996923,"about_ca_topic_score_gemma":0.000177068,"domain_scores_codex":[0.9963737,0.0004614446,0.000598906,0.001776639,0.0001975001,0.0005918707],"domain_scores_gemma":[0.9954633,0.0004828218,0.0007896774,0.002765217,0.0003052707,0.0001937334],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"theoretical_or_conceptual","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.004016735,0.007445819,0.1045733,0.01877493,0.005339901,0.0010823,0.005699224,0.209316,0.005785346,0.403102,0.1052324,0.129632],"study_design_scores_gemma":[0.004557934,0.00025841,0.008610343,0.0009595164,0.0002905708,0.000001460002,0.0002489548,0.9589288,0.001002931,0.000555482,0.02411064,0.0004749329],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.01866625,0.00003093276,0.9238943,0.00005598112,0.001145939,0.05409116,0.001315928,0.00008188299,0.0007176161],"genre_scores_gemma":[0.9960648,0.00001847268,0.001349945,0.00007217455,0.00007896944,0.0004249792,0.0004266359,0.00002071638,0.001543343],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.9773985,"threshold_uncertainty_score":0.9997436,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.1825657341906636,"score_gpt":0.2814527220478224,"score_spread":0.09888698785715877,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}