{"id":"W7117268552","doi":"10.1109/vl-hcc65237.2025.00039","title":"TreeReader: A Hierarchical Academic Paper Reader Powered by Language Models","year":2025,"lang":"","type":"article","venue":"","topic":"AI in Service Interactions","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"GRASP; Bridging (networking); Automatic summarization; Reading (process); Key (lock); Language model; Formative assessment; Readability","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow","research_integrity","insufficient_payload"],"consensus_categories":["insufficient_payload"],"category_scores_codex":[0.0003908891,0.0005972843,0.000569457,0.0003861732,0.0003640838,0.0004434543,0.003112431,0.0007750879,0.00211151],"category_scores_gemma":[0.0001064918,0.0005715448,0.0003100637,0.001499792,0.0002603718,0.002772651,0.001402588,0.002471695,0.001058136],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.0002636937,"about_ca_system_score_gemma":0.0004195234,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.0008166143,"about_ca_topic_score_gemma":0.0001592789,"domain_scores_codex":[0.9952345,0.0003363444,0.001105149,0.001485621,0.0007131221,0.001125262],"domain_scores_gemma":[0.9966033,0.0006907808,0.0001750861,0.001941597,0.000198279,0.0003909952],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0001395535,0.0008547863,0.0001347523,0.0001685318,0.0005363043,0.00008391193,0.03377904,0.0005494329,0.02468624,0.3391788,0.4641803,0.1357084],"study_design_scores_gemma":[0.001465475,0.000166636,0.0002004084,0.0005596103,0.0001501501,0.00008292708,0.004376988,0.8226895,0.004286412,0.04520098,0.119629,0.001191937],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.005728348,0.005015131,0.6896296,0.1049414,0.002268954,0.0006305724,0.00007013405,0.0005908309,0.1911251],"genre_scores_gemma":[0.810682,0.0006377751,0.01237762,0.03816796,0.0002291477,0.00009172414,0.00003831869,0.00005154407,0.1377239],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.82214,"threshold_uncertainty_score":0.9998296,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.01837221842680093,"score_gpt":0.3060336056080364,"score_spread":0.2876613871812355,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}