On the Measurement and Analysis of Safety in a Large City
Notice bibliographique
Résumé
Sharing city's operational data with public is a recent trend that can help in identifying deficiencies and bringing improvements in city operations. Analyzing such kinds of data can have a strong impact on problem solving as it connects public and private sectors with their city. Los Angeles (LA) is a good example of the ongoing index on the US open datasets. Since last several years, LA authorities worked hard to engage with its residents by launching several datasets, these datasets were represented by dashboards showing the progress of the city's performance and services. Any resident can review and assess progress of the city authorities in many aspects (e.g. building information, safety, water, streets conditions). Since open datasets can provide us with the ability to analyze and discover their values, we decided to analyze a dataset on crime statistics in Los Angeles. In this paper, we present a comprehensive analysis for the LA crime data from 2010 to present. This dataset was created by the Los Angeles Police Department (LAPD) and it is updated on a regular basis. The dataset contains approximately 1.5 million records, where each record represents a crime incident. We analyze multiple features including the activity of crimes (i.e. number of crimes) in terms of year, month, weekdays, time of the day, area, victim sex, victim age and victim descent. In addition, we analyze the reporting period of a crime incident by calculating the average reporting days (i.e. number of days the victim took to report a crime incident) in terms of multiple factors. Our analysis uncovers the unique characteristics and insights of safety measures and crime prevention in the city.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction machine sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Le volet Gemma est une étiquette directe du modèle pour chaque travail de la base, lue sur la notice réduite au titre. Le volet Codex est un classifieur appris des 10 348 étiquettes directes de Codex et calibré sur les taux pondérés de l'échantillon; les champs sans appui suffisant ne portent aucun appel Codex. Le mode candidate est l'union des deux volets; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont pas des étiquettes humaines.
Scores du classifieur distillé par catégorie (deux têtes)
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,003 | 0,015 |
| Méta-épidémiologie (sens strict) | 0,001 | 0,000 |
| Méta-épidémiologie (sens large) | 0,000 | 0,001 |
| Bibliométrie | 0,005 | 0,009 |
| Études des sciences et des technologies | 0,001 | 0,001 |
| Communication savante | 0,002 | 0,003 |
| Science ouverte | 0,001 | 0,002 |
| Intégrité de la recherche | 0,001 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,001 | 0,001 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule source (Gemma direct ou Codex distillé), pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».