{"id":"W4410086952","doi":"10.1109/wi-iat62293.2024.00028","title":"HouseOfTheDragonQA: Open-Domain Long-form Context-Aware QA Pairs for TV Series","year":2024,"lang":"en","type":"article","venue":"","topic":"Multimedia Communication and Technology","field":"Social Sciences","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Toronto Metropolitan University","funders":"","keywords":"Series (stratigraphy); Computer science; Context (archaeology); Domain (mathematical analysis); Open domain; Information retrieval; Mathematics; History","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.001855146,0.001466069,0.0008016553,0.004868859,0.001339589,0.001980799,0.001814894,0.002405348,0.009685599],"category_scores_gemma":[0.01311177,0.0004429602,0.001245891,0.002588852,0.0007960644,0.004581441,0.004175238,0.001959966,0.009732625],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001285413,"about_ca_system_score_gemma":0.001441397,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.009262559,"about_ca_topic_score_gemma":0.02336411,"domain_scores_codex":[0.9966671,0.001129276,0.0003387503,0.0009973492,0.0006468436,0.0002207123],"domain_scores_gemma":[0.9945615,0.00205702,0.0004768739,0.001408182,0.001060314,0.0004361793],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001631884,0.001107762,0.02493294,0.007288583,0.0003350894,0.001497809,0.007891539,0.01321356,0.03040307,0.01909531,0.6063385,0.286264],"study_design_scores_gemma":[0.0002794536,0.0005713339,0.02935199,0.000582748,0.0001269912,0.001453736,0.005635748,0.06115327,0.01574533,0.01867993,0.8661926,0.0002269109],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"dataset","genre_gemma":"empirical","genre_scores_codex":[0.1379953,0.006797358,0.1280791,0.002597946,0.00116543,0.003050922,0.6448998,0.04264351,0.03277066],"genre_scores_gemma":[0.1227299,0.0005359189,0.1295321,0.0009412364,0.0002270152,0.002076438,0.7344258,0.0009425884,0.008589005],"genre_candidate":"empirical","genre_consensus":null,"teacher_disagreement_score":0.009685599,"threshold_uncertainty_score":0.03240156,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.05709954398164591,"score_gpt":0.3721838186245334,"score_spread":0.3150842746428875,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}