Clasificación de ofertas de vivienda en Madrid mediante modelos de aprendizaje automático y su visualización interactiva
Notice bibliographique
Résumé
En un mercado inmobiliario caracterizado por un incremento sostenido de los precios y la urgencia en la toma de decisiones que ello provoca, surge la necesidad de adoptar un enfoque basado en datos que permita a los distintos actores identificar directamente las oportunidades de compraventa relevantes. Este proyecto presenta una solución tecnológica basada en aprendizaje automático para la valoración de las ofertas de vivienda ubicadas en el municipio de Madrid y su posterior visualización a través de un cuadro de mando interactivo. Para ello, se parte de un conjunto de datos publicado por Idealista sobre viviendas en venta durante el año 2018, al que se aplican procesos de limpieza de datos, tratamiento de valores atípicos y normalización de variables. A continuación, se entrenan y estudian modelos de regresión para la predicción del precio de los inmuebles en función de sus características y se utiliza su desviación respecto al precio real para clasificar la calidad de las ofertas. Finalmente, se desarrolla un panel interactivo que permite explorar dinámicamente las ofertas, filtrando por características específicas y visualizando en un mapa los inmuebles disponibles en una zona determinada. Se incluyen adicionalmente indicadores y gráficos para el análisis de tendencias a lo largo del año estudiado. Este cuadro de mando puede ser utilizado tanto por usuarios particulares interesados en comprar una vivienda como por profesionales del sector que deseen analizar orientaciones del mercado. Los resultados obtenidos muestran una notable capacidad predictiva de los modelos seleccionados, permitiendo clasificar con precisión distintas ofertas inmobiliarias en un amplio rango de precios, especialmente para precios inferiores al millón de euros. Además, la visualización interactiva facilita un análisis completo y directo, que sirve de apoyo a la toma de decisiones de los agentes del sector. A modo de conclusión, el estudio realizado refleja patrones en la concentración geográfica de las ofertas y una variabilidad estacional a lo largo del año. Se observa una escasa presencia de ofertas calificadas como malas en las zonas del sur de la localidad, así como una mayor afluencia de viviendas a la venta durante el último trimestre del año, coincidiendo con una reducción proporcional de las ofertas identificadas como de buena calidad. Abstract: In a real estate market characterized by a sustained increase in prices and the urgency in decision-making that it brings, the need to adopt a data-driven approach that enables various stakeholders to directly identify relevant buying and selling opportunities arises. This project presents a technological solution based on machine learning for the rating of housing offers located in the municipality of Madrid, followed by their visualization through an interactive dashboard. To achieve this, the project starts with a dataset published by Idealista on homes for sale during the year 2018, to which processes of data cleaning, outlier treatment, and variable normalization are applied. Regression models are then trained and analyzed to predict property prices based on their characteristics, and the deviation from the actual price is used to classify the quality of each offer. Lastly, an interactive panel is developed to dynamically explore the offers by filtering specific features and visualizing on a map the available properties of a selected area. Indicators and graphs are also included for trend analysis over the year under study. This dashboard can be used by both private individuals interested in purchasing a house and real estate professionals who may want to analyze market trends. The obtained results show a remarkable predictive capacity of the selected models, allowing to accurately classify various real estate offers across a wide price range, especially for houses priced below one million euros. In addition, the interactive visualization facilitates a complete and direct analysis, which supports decision-making for market participants. In conclusion, the study reveals patterns in the geographic concentration of offers and seasonal variability throughout the year. A low presence of poorly rated offers is observed in the southern areas of the municipality, along with a higher number of properties for sale during the last quarter of the year, together with a proportional decrease in offers identified as high quality.
Récupéré en direct depuis OpenAlex et désinversé. Les résumés ne sont pas conservés dans cette base de données : les index inversés représentent 8,6 Go des 9,3 Go de texte de la base, et le serveur dispose de 13 Go libres.
Comment cette classification a été obtenuedéplier
Prédiction distillée sur la base complète
Imitation des enseignantsNi prévalence calibrée, ni vérité terrain. Validation humaine à venir. Apprise à partir de 10 348 étiquettes directes de Codex et de 10 348 étiquettes directes de Gemma. Le mode candidate est l'union des têtes enseignantes seuillées; le consensus est leur intersection. Ces sorties portent le statut machine_predicted_unvalidated et ne sont ni des étiquettes humaines ni des étiquettes directes de modèles de pointe.
Scores Codex et Gemma par catégorie
| Catégorie | Codex | Gemma |
|---|---|---|
| Métarecherche | 0,001 | 0,001 |
| Méta-épidémiologie (sens strict) | 0,000 | 0,001 |
| Méta-épidémiologie (sens large) | 0,001 | 0,001 |
| Bibliométrie | 0,001 | 0,000 |
| Études des sciences et des technologies | 0,000 | 0,001 |
| Communication savante | 0,000 | 0,001 |
| Science ouverte | 0,001 | 0,001 |
| Intégrité de la recherche | 0,000 | 0,001 |
| Charge utile insuffisante (le modèle a refusé de juger) | 0,000 | 0,000 |
Scores machine (provisoires)
Les deux têtes enseignantes du modèle étudiant, lues sur ce travail. Un score ordonne la base pour la relecture; il n'affirme jamais une catégorie, et le statut de validation accompagne chaque rangée tel quel.
Scores de référence d'un modèle non mature (critères de maturité non atteints, 7 itérations). Un score ordonne; il n'affirme jamais une catégorie.
score_only:v0-immature-baseline · tel quel depuis la passe de notation : score_only signifie que le nombre peut ordonner les travaux, et qu'aucune étiquette de catégorie n'en découleClassification
machine, non validéePrédiction automatique; un appel candidat d’une seule tête enseignante, pas un consensus.
Le détail, modèle par modèle et score par score, se trouve en fin de page sous « Comment cette classification a été obtenue ».