{"id":"W7154409946","doi":"10.5281/zenodo.19561441","title":"Unlocking Web Histories: Leveraging LLMs and RAG to Transform Discovery in Web Archives","year":2025,"lang":"","type":"article","venue":"Zenodo (CERN European Organization for Nuclear Research)","topic":"Web Data Mining and Analysis","field":"Computer Science","cited_by":0,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Victoria","funders":"","keywords":"Transparency (behavior); Stewardship (theology); Pipeline (software); Semantic Web; Digital preservation; Digital library; Cultural heritage","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.004682594,0.0005695316,0.000682445,0.00328781,0.001032322,0.004952049,0.001639469,0.001081035,0.002697024],"category_scores_gemma":[0.02394257,0.0006580788,0.001317378,0.002175876,0.002394036,0.009978707,0.004766635,0.001769448,0.001783087],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001311742,"about_ca_system_score_gemma":0.001907292,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.00711574,"about_ca_topic_score_gemma":0.01057511,"domain_scores_codex":[0.9973558,0.001203079,0.0001817713,0.000486373,0.0006368844,0.0001360397],"domain_scores_gemma":[0.9905233,0.005675904,0.0005113192,0.002488307,0.0006150248,0.0001860997],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"design_other","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.0003904567,0.0002136782,0.00789946,0.0006833238,0.0001303916,0.0007726981,0.005807017,0.09687634,0.01161732,0.1347418,0.01180204,0.7290655],"study_design_scores_gemma":[0.00004434097,0.0001128425,0.001369392,0.0001460391,0.00009027306,0.0004224355,0.001451641,0.6539151,0.0172968,0.2692212,0.05581623,0.0001135834],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"methods","genre_gemma":"empirical","genre_scores_codex":[0.03880965,0.0009433607,0.9350391,0.00205363,0.00008239445,0.0001938616,0.0009225946,0.01665263,0.005302686],"genre_scores_gemma":[0.328576,0.0006875968,0.661698,0.0004311596,0.00007985361,0.0001629102,0.002408905,0.001925001,0.004030546],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.00711574,"threshold_uncertainty_score":0.02476424,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.02313008818105575,"score_gpt":0.2389026225362874,"score_spread":0.2157725343552316,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}