{"id":"W4415683709","doi":"10.3390/info16110937","title":"DefAn: Definitive Answer Dataset for LLM Hallucination Evaluation","year":2025,"lang":"en","type":"article","venue":"Information","topic":"Topic Modeling","field":"Computer Science","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"Ontario Tech University","funders":"King Fahd University of Petroleum and Minerals","keywords":"Benchmark (surveying); Benchmarking; Consistency (knowledge bases); Scope (computer science); Scale (ratio); Generative grammar","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"metacan-v3-hybrid-931329e0061c","candidate_categories":[],"consensus_categories":[],"category_scores_codex":[0.003612054,0.003385186,0.00101328,0.001863569,0.001018369,0.001458686,0.003352408,0.003268928,0.01785914],"category_scores_gemma":[0.0200474,0.0004266269,0.001398721,0.001310689,0.001009558,0.003158073,0.003277986,0.003231028,0.01512009],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.001614376,"about_ca_system_score_gemma":0.00199392,"about_ca_topic_candidate":false,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.007948169,"about_ca_topic_score_gemma":0.01592234,"domain_scores_codex":[0.9954801,0.001837879,0.0005125175,0.0008565996,0.001100074,0.0002128782],"domain_scores_gemma":[0.9919949,0.003971515,0.0004188561,0.001683319,0.001517246,0.0004142243],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"not_applicable","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.001459069,0.0009593742,0.005077435,0.003264885,0.000177863,0.0005680969,0.0006398506,0.00797874,0.00487183,0.002892029,0.8501211,0.1219896],"study_design_scores_gemma":[0.001960077,0.00179487,0.017392,0.0009000345,0.0001907605,0.001637392,0.002321475,0.1415357,0.0253393,0.01335066,0.7932532,0.0003246873],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"dataset","genre_gemma":"dataset","genre_scores_codex":[0.1098238,0.007917889,0.04390563,0.003724026,0.001842395,0.003568847,0.7105834,0.08457306,0.03406091],"genre_scores_gemma":[0.07256325,0.000614227,0.04671729,0.001217509,0.0001417747,0.001953945,0.8673287,0.0008680713,0.008595258],"genre_candidate":"dataset","genre_consensus":"dataset","teacher_disagreement_score":0.01785914,"threshold_uncertainty_score":0.05974472,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.03434413762232726,"score_gpt":0.3188867060780858,"score_spread":0.2845425684557585,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}