{"id":"W7125599361","doi":"10.1109/cascon66301.2025.00115","title":"LLM-Driven Event Log Generation from Forensic Cases: A Comparative Study of ChatGPT, Claude, and Gemini","year":2025,"lang":"","type":"article","venue":"","topic":"Business Process Modeling and Analysis","field":"Business, Management and Accounting","cited_by":1,"is_retracted":false,"has_abstract":true,"ca_institutions":"University of Toronto","funders":"","keywords":"Timeline; Digital forensics; Schema (genetic algorithms); Bespoke; Event (particle physics); Context (archaeology); Consistency (knowledge bases); Visualization","routes":{"ca_aff":true,"ca_fund":false,"ca_venue":false,"about_ca":false,"invisible_to_affiliation_only":false},"retraction":null,"screen":null,"direct_labels":[],"prediction":{"model_version":"codex-gemma-dda1882f352a","candidate_categories":["metaepi_narrow"],"consensus_categories":[],"category_scores_codex":[0.0003150963,0.0005031071,0.001086497,0.0006624448,0.0004621926,0.0005013481,0.0002945281,0.0001707532,0.0002801883],"category_scores_gemma":[0.00008251861,0.0004558026,0.0001600094,0.001487545,0.000143255,0.001006884,0.0004791566,0.0002195408,0.00002467409],"about_ca_system_candidate":false,"about_ca_system_consensus":false,"about_ca_system_score_codex":0.00004126745,"about_ca_system_score_gemma":0.00008322168,"about_ca_topic_candidate":true,"about_ca_topic_consensus":false,"about_ca_topic_score_codex":0.01049919,"about_ca_topic_score_gemma":0.007080685,"domain_scores_codex":[0.9971272,0.00005380655,0.001118621,0.0009257247,0.0004270188,0.0003476541],"domain_scores_gemma":[0.9976473,0.0001224343,0.000697816,0.0004931919,0.001013004,0.00002623503],"domain_codex":null,"domain_gemma":null,"domain_candidate":null,"domain_consensus":null,"study_design_codex":"observational","study_design_gemma":"simulation_or_modeling","study_design_scores_codex":[0.002164651,0.03221155,0.4944014,0.005347031,0.01764429,0.0002525117,0.02342288,0.1660166,0.005867304,0.04265393,0.04854926,0.1614686],"study_design_scores_gemma":[0.003075863,0.0001360709,0.009082423,0.0004932155,0.003116398,7.438952e-7,0.01910853,0.9614225,0.0002410244,0.001491149,0.001228761,0.0006033196],"study_design_candidate":"simulation_or_modeling","study_design_consensus":null,"genre_codex":"empirical","genre_gemma":"empirical","genre_scores_codex":[0.976756,0.002914978,0.0162875,0.0007696975,0.0004530355,0.0007287197,0.00001573122,0.00005719049,0.002017143],"genre_scores_gemma":[0.9967023,0.0002034884,0.0003214482,0.0005471676,0.0006175168,0.00005322627,0.0001369351,0.00002270376,0.001395189],"genre_candidate":"empirical","genre_consensus":"empirical","teacher_disagreement_score":0.7954059,"threshold_uncertainty_score":0.9997894,"prediction_status":"machine_predicted_unvalidated"},"machine_scores":{"provisional":true,"baseline":true,"maturity_gate_passed":false,"score_opus":0.0484112145332152,"score_gpt":0.2955463398487193,"score_spread":0.2471351253155041,"validation_status":"score_only:v0-immature-baseline","note":"Baseline scores from an immature model (maturity gate not passed). Scores rank; they never assert a category."}}