{"id":"W4416034391","doi":"10.18653/v1/2025.findings-emnlp.1386","title":"STA-CoT: Structured Target-Centric Agentic Chain-of-Thought for Consistent Multi-Image Geological Reasoning","year":2025,"lang":"","type":"article","venue":"","topic":"Geological Modeling and Analysis","field":"Earth and Planetary Sciences","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"Artificial Intelligence in Medicine (Canada)","funders":"","keywords":"Argument (complex analysis); Context (archaeology); Interpretation (philosophy); Perspective (graphical); Reflection (computer programming)","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","insufficient_payload"],"consensus_categories":[],"category_scores_codex":[0.001083798,0.0005441495,0.00118776,0.0003819877,0.0006274682,0.000163691,0.0006518118,0.000468877,0.009350006],"category_scores_gemma":[0.001259385,0.000388198,0.0008305752,0.001181262,0.0004516669,0.0001299885,0.0001138116,0.0004176259,0.0000816695],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00001802572,"about_ca_system_score_gemma":0.0002032077,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0007143048,"about_ca_topic_score_gemma":0.0005599495,"domain_scores_codex":[0.9956527,0.0003248539,0.001260922,0.001161623,0.0004444162,0.001155523],"domain_scores_gemma":[0.9976264,0.0006894576,0.0003995083,0.000528991,0.0004084075,0.0003472526],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001201078,0.001174371,0.6101246,0.001486866,0.002510849,0.0001397547,0.0005608179,0.2614745,0.0006202457,0.009074208,0.004592041,0.1070407],"study_design_scores_gemma":[0.00179806,0.0003663939,0.05321418,0.0001131744,0.0007017436,0.000005367631,0.0006275926,0.9342486,0.0005849654,0.002225118,0.005608125,0.0005066539],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.3115044,0.01921229,0.6548827,0.003238567,0.002234109,0.001834251,0.0007456418,0.000184412,0.006163662],"genre_scores_gemma":[0.8681557,0.0004756646,0.1196464,0.0005601245,0.00009768261,0.00000780895,0.0002493805,0.000006169244,0.01080103],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.6727742,"threshold_uncertainty_score":0.999857,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02661213531258422,"score_gpt":0.2552277005097201,"score_spread":0.2286155651971359,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}