VraiPrix
Le calcul, en entier

Méthodologie ultra-détaillée

Notre différenciateur est la transparence totale. Cette page documente chaque étape — données, fusion, modèle, validation, moteur — au niveau de détail d'un rapport technique.

01

Données sources

Deux corpus publics forment la fondation de Vrai-Prix. Premièrement, les rôles d'évaluation foncière géoréférencés du Québec, publiés en données ouvertes par le ministère des Affaires municipales et de l'Habitation (MAMH) : six millésimes complets (2021 à 2026), de 3 626 120 à 3 747 008 unités d'évaluation par millésime, soit 22,15 millions d'observations unité-année. Chaque unité porte sa géométrie ponctuelle (NAD83, EPSG:4269), son matricule, son usage (code CUBF), ses caractéristiques de bâtiment et de terrain, et ses valeurs au rôle.

Deuxièmement, 745 119 transactions immobilières publiées entre janvier 2021 et juillet 2026, couvrant 1 100 municipalités, chacune géolocalisée et documentée (prix, date, type, année de construction, aire d'étages, valeurs au rôle).

Millésimes de rôle

2021 · 2022 · 2023 · 2024 · 2025 · 2026

Unités d'évaluation (2026)

3 747 008

Observations unité-année

22 150 285

Transactions

745 119 (2021-01 → 2026-07)

Municipalités couvertes

1 100

Système de référence

NAD83 (EPSG:4269), projeté EPSG:32198

02

Fusion spatiale transaction ↔ unité d'évaluation

Chaque transaction est appariée à son unité d'évaluation par coordonnées XY, dans le rôle de l'année de la transaction. L'appariement se fait en deux passes, en coordonnées projetées Québec Lambert (EPSG:32198).

Passe A — spatiale : parmi les 25 plus proches voisins dans un rayon de 200 m, chaque candidat reçoit un score : +100 si la valeur au rôle est identique à celle portée par la transaction, +60 si la valeur du rôle antérieur concorde, +30 si l'année de construction concorde, +30 si l'aire d'étages concorde à ±0,6 m², moins 0,5 point par mètre de distance. Le meilleur score gagne.

Passe B — jointure par valeur : les tours à condos placent des centaines d'unités sur le même point ; la géométrie seule ne suffit pas. Pour toute transaction sans concordance exacte de valeur en passe A, on cherche l'unité de valeur au rôle strictement identique dans un rayon de 500 m. En dernier recours, les millésimes adjacents (année ±1) sont essayés — les rôles triennaux étant déposés à des années différentes selon les municipalités.

Résultat : 99,88 % des transactions appariées, 82,2 % avec concordance exacte de la valeur au rôle, distance médiane de 0,6 m (p90 = 12 m). Ce lien est vérifiable transaction par transaction.

03

Modèle hédonique de masse

Le cœur du système est un modèle de gradient boosting (LightGBM) entraîné à prédire le logarithme du prix de vente. L'échantillon d'entraînement compte 689 231 transactions, après exclusion des ventes non représentatives du marché : appariement incertain, prix hors de 50 000 $ à 20 M$, ratio prix/évaluation hors de l'intervalle [0,3 ; 4].

Dix-huit variables décrivent chaque propriété au moment de la vente : aire d'étages, superficie et frontage du terrain, nombre d'étages, de logements, de locaux non résidentiels et de chambres locatives, âge du bâtiment, usage CUBF (et sa famille), lien physique, genre de construction, municipalité et région (variables catégorielles), latitude, longitude, temps continu (mois écoulés) et mois de l'année, plus les valeurs au rôle (terrain, bâtiment, total, croissance vs rôle antérieur, part du terrain).

Hyperparamètres : 255 feuilles, taux d'apprentissage 0,05, sous-échantillonnage 85 %, arrêt précoce sur ensemble de validation (~825 itérations retenues). La rétro-transformation du logarithme applique le facteur de correction de Duan (smearing, 1,04). Deux modèles de régression quantile (α = 0,10 et 0,90), entraînés sur les mêmes variables, produisent la fourchette P10-P90 propre à chaque propriété. Un second modèle « hédonique pur », sans les valeurs au rôle, sert de contrôle.

Le modèle final est appliqué aux 3,75 millions d'unités de chaque millésime (temps fixé à la mi-année), produisant 22 millions d'estimations historisées 2021-2026.

04

Validation — norme IAAO

La validation suit la norme de l'International Association of Assessing Officers (IAAO) sur les études de ratios : ratio médian (estimation/prix), coefficient de dispersion (COD), différentiel lié au prix (PRD) et coefficient de biais lié au prix (PRB). Deux protocoles : un ensemble aléatoire réservé de 15 % (102 943 ventes jamais vues) et un test temporel strict (entraînement sans 2026, test sur les 68 364 ventes de 2026).

Le COD provincial (22,7) dépasse la cible urbaine IAAO (≤ 15) — attendu pour un modèle unique couvrant aussi les marchés ruraux minces ; le segment condo (11,9) y satisfait pleinement. Le ratio médian de 0,995 indique l'absence de biais systématique.

MétriqueHoldout aléatoireTest temporel 2026
Erreur médiane (MdAPE)11,0 %14,0 %
± 20 % du prix réel72,1 %66,7 %
R² (log)0,7890,743
Ratio médian (cible 0,90-1,10)0,9950,961
COD (cible ≤ 15-20)22,7 (condos 11,9)23,7
PRD (cible 0,98-1,03)1,0921,075
PRB (cible ±0,05)−0,104−0,082
05

Moteur d'estimation en ligne

Au moment de la consultation, l'estimation affichée combine deux sources indépendantes. (1) L'estimation du modèle hédonique, pré-calculée pour la propriété. (2) Une estimation par comparables : les ventes candidates sont cherchées dans un rayon adaptatif (2,2 km, élargi jusqu'à ~28 km si le marché est mince, minimum 30 candidates sur 30-36 mois), filtrées par famille de type et par aire d'étages (±20 %, relâché à ±40 % puis abandonné sous 6 candidates).

Chaque comparable est ajusté, en dollars affichés : ajustement de marché (indice mensuel, section 06), ajustement de superficie (50 % du $/m² du comparable par m² d'écart, plafonné à ±25 % du prix), ajustement d'âge (0,5 % du prix par année d'écart, plafonné à ±10 %). Le poids de chaque comparable est le produit de trois gaussiennes : distance (σ = 1 500 m), récence (σ = 24 mois) et similarité de superficie (σ = 25 %). L'estimation comparables est la médiane pondérée des prix ajustés (12 meilleures retenues).

Combinaison : 65 % modèle + 35 % comparables lorsque les deux existent (≥ 3 comparables) ; sinon la source disponible seule. La fourchette affichée est l'intervalle P10-P90 du modèle, recentré sur l'estimation finale.

L'indice de confiance (0-100, niveaux A ≥ 75, B ≥ 60, C ≥ 45, D < 45) agrège : le nombre de comparables (+2,5/comparable, max 25), leur dispersion (jusqu'à +20 quand la déviation médiane est faible), la présence du modèle (+15) et une pénalité de largeur de fourchette au-delà de 30 %. Aucune estimation n'est affichée sans son niveau de confiance.

06

Indice de marché mensuel

L'ajustement temporel des comparables repose sur un indice mensuel par type de propriété : médiane du prix au mètre carré des ventes du mois (minimum 5 ventes), lissée par médiane mobile centrée de 3 mois, normalisée au dernier mois observé. Une vente de janvier 2024 comparée en août 2026 est ainsi ramenée aux conditions de marché actuelles avant tout autre ajustement.

07

Limites connues

L'honnêteté méthodologique exige de nommer ce que le système ne voit pas. Les rénovations intérieures, garages, piscines et l'état d'entretien n'apparaissent pas dans les données ouvertes du rôle. Dans les marchés ruraux minces, la dispersion dépasse les cibles IAAO urbaines — l'indice de confiance le reflète. Les unités d'une même tour à condos partagent un point géographique : sans numéro d'appartement, la recherche peut retourner une unité voisine. Les valeurs au rôle utilisées comme variables sont établies 18 à 24 mois avant leur entrée en vigueur. Enfin, une estimation statistique, aussi rigoureuse soit-elle, ne remplace pas l'évaluation d'un évaluateur agréé (OEAQ) ni l'analyse d'un courtier pour une mise en vente.

Sources : rôles d'évaluation foncière du Québec (MAMH, données ouvertes) · IAAO Standard on Ratio Studies · IAAO Standard on AVMs