No todos los datos espaciales son iguales. Se clasifican en tres tipos principales según la naturaleza del dominio espacial (D) donde se estudian:
Para distinguirlos rápidoPregúntate: ¿puedo medir la variable en cualquier punto del espacio? → geoestadístico. ¿Los datos ya vienen agregados por zonas fijas? → lattice. ¿Lo que me interesa es dónde ocurrieron los eventos, no un valor medido? → patrón de puntos.
Característica principal: la variable Z(s) se puede observar en cualquier punto de un dominio continuo D (por ejemplo, temperatura o concentración de un contaminante).
Diferencia clave: aunque el interés sea continuo, en la práctica solo se toman mediciones en ubicaciones específicas (estaciones de monitoreo). El objetivo es predecir valores en lugares no observados.
Herramienta clave: el semivariograma, usado para cuantificar la correlación espacial entre observaciones.
EjemploUn mapa de concentración de un contaminante atmosférico en una ciudad, construido a partir de una red de estaciones de monitoreo: entre estaciones no hay datos, pero la variable física sí existe en todos esos puntos intermedios.
Característica principal: el dominio D es discreto y fijo (por ejemplo, provincias, unidades censales o códigos postales). Los datos suelen estar agregados sobre áreas.
Diferencia clave: a diferencia de los geoestadísticos, aquí la observación es exhaustiva (se conoce el total de cada área), por lo que la predicción pierde sentido. Lo importante es el vecindario y el suavizado (smoothing).
EjemploEl porcentaje de hogares con un determinado problema socioeconómico, agregado por unidad censal: no tiene sentido "predecir" el valor de una unidad censal completa, porque ya se conoce; lo que interesa es suavizar el patrón usando la información de las unidades vecinas.
Característica principal: el dominio D es aleatorio y el interés recae en la ubicación misma de los eventos (por ejemplo, la ubicación de incendios o de nidos de aves).
Diferencia clave: se busca determinar si la distribución de los puntos es aleatoria, regular o agrupada (clustered).
Concepto extra: si a cada punto se le asocia un valor adicional (por ejemplo, la intensidad de un incendio), se llama patrón marcado.
EjemploLa ubicación de focos de incendio dentro de una región durante una temporada: aquí no hay una "variable medida en todas partes"; lo que es aleatorio es dónde aparecen los puntos mismos.
Los tres tipos anteriores pueden extenderse en el tiempo, generando datos espacio-temporales. Esto permite predecir valores en ubicaciones y tiempos no observados, aprovechando la correlación conjunta entre espacio y tiempo.
EjemplosMonitorear una variable ambiental cada hora (geoestadístico espacio-temporal), censos periódicos por unidad territorial (lattice espacio-temporal), o la ubicación de incendios a lo largo de varios años (patrón de puntos espacio-temporal).
La estadística clásica asume que las observaciones son independientes. Sin embargo, la Primera Ley de la Geografía (Tobler) dice:
“Todo está relacionado con todo lo demás, pero las cosas cercanas están más relacionadas que las lejanas”.
Ignorar esta dependencia espacial rompe los supuestos clásicos.
IntuiciónSi mides la temperatura en dos termómetros separados por un metro, sus lecturas casi seguro están correlacionadas: no son dos experimentos "independientes" en el sentido clásico, aunque la fórmula de un libro de estadística básica los trate como si lo fueran.
Para demostrar el problema, se asume un modelo donde las observaciones siguen una distribución Gaussiana con media μ y varianza σ0². La covarianza entre dos puntos i y j depende de la distancia h según un modelo esférico con rango 110:
Cómo leer esta fórmulaEs solo una "regla de descuento": cuando h=0 (mismo punto), el corchete vale 1 y C(0)=σ0² (covarianza máxima, un punto está perfectamente correlacionado consigo mismo). A medida que h crece hasta 110, el corchete baja hacia 0: la covarianza se apaga con la distancia. Más allá de h=110, se asume C(h)=0: puntos tan lejanos ya no comparten información.
Si se ignora la correlación espacial, la varianza de la media muestral (Z̄) se calcula como σ0²/n. Pero al considerar la correlación real, la fórmula cambia drásticamente.
Ecuación clave 1 (la varianza real):
De dónde sale esta fórmulaPara cualquier suma de variables aleatorias, V(∑Xi) = ∑∑ Cov(Xi,Xj) (incluyendo i=j, donde Cov(Xi,Xi)=V(Xi)). Como Z̄=(1/n)∑Z(si), al sacar el factor 1/n de cada término se obtiene el 1/n² de la fórmula. Si las observaciones fueran independientes, todos los términos cruzados (i≠j) valdrían cero y solo quedarían los n términos C(0)=σ0² en la diagonal, recuperando el resultado clásico σ0²/n. La diferencia con el caso correlacionado es exactamente esos términos cruzados que la estadística clásica descarta.
Al desarrollar esto (asumiendo n=16 en una grilla 4×4), se simplifica a:
Conclusión crítica: la varianza de la media muestral es mayor que en el caso de muestreo aleatorio simple. En el ejemplo numérico, la varianza real es 0.3969σ0², mientras que la clásica era σ0²/16 = 0.0625σ0². La varianza se multiplica por más de 6.
Al no tomar en cuenta la correlación, los intervalos de confianza y las pruebas de hipótesis son incorrectos:
Por qué pasa estoUn intervalo de confianza usa el error estándar (raíz de la varianza) en su ancho. Si la varianza real es ~6 veces mayor que la calculada de forma clásica, el error estándar real es ~√6≈2.5 veces mayor —coherente con que el intervalo pase de 0.5σ0 a 2.47σ0 (casi 5 veces más ancho, porque el intervalo completo suma ambos lados). Usar el error estándar clásico, más pequeño, es lo que produce intervalos artificialmente angostos y un estadístico t artificialmente grande.
La media muestral (Z̄) sigue siendo un estimador insesgado de μ, pero la varianza muestral clásica (S²) no es un estimador insesgado de σ² cuando hay correlación espacial.
Ecuación clave 2 (el sesgo de la varianza muestral):
Por qué se resta ese términoLa varianza muestral clásica S² se construye asumiendo que toda la dispersión de los datos viene de que cada observación es "distinta de las demás". Pero si hay correlación positiva (C>0), parte de esa dispersión aparente en realidad es solo el patrón espacial compartido, no verdadera variabilidad nueva. S² termina "confundiendo" covarianza con varianza, y como la resta el término positivo ∑C(·), el resultado esperado queda por debajo de σ².
Esto significa que la varianza muestral subestima la varianza real.
Conclusión final: ignorar las correlaciones espaciales y usar estimadores clásicos para datos correlacionados no es una buena idea. Lleva a decisiones equivocadas. Se necesitan métodos geoestadísticos para obtener estimadores adecuados.
La geoestadística estudia fenómenos que se extienden por el espacio y tienen cierta organización espacial (fenómenos regionalizados). No se aplica directamente al fenómeno físico, sino a una descripción matemática de él: una función numérica llamada variable regionalizada o regionalización, definida en un espacio geográfico.
Cuando s recorre el dominio de estudio D, el conjunto {z(s), s∈D} se llama variable regionalizada o regionalización; cada valor z(si) es un valor regionalizado.
EjemploEl contenido de materia orgánica del suelo en un lote agrícola: existe un valor en cada punto del lote (D es continuo), pero solo puedes tomar muestras de laboratorio en unos pocos puntos s1, s2,… por costo y tiempo.
Desde la perspectiva probabilística, el valor regionalizado se ve como el resultado de un mecanismo aleatorio: la variable aleatoria (va). Si se consideran los valores regionalizados en todos los puntos del dominio, se obtiene una función aleatoria espacial (fa) —también llamada proceso estocástico o campo aleatorio—: la familia {Z(s), s∈D}.
Esta decisión metodológica es una de las piedras angulares de la geoestadística: la variable regionalizada se interpreta como una realización de una fa. Esto es posible porque la fa recoge dos aspectos:
EjemploEl mapa real de materia orgánica que mediste es una realización concreta de la fa "materia orgánica en ese tipo de suelo"; si pudieras regresar en el tiempo geológico y dejar que el suelo se formara de nuevo, obtendrías otro mapa distinto pero con el mismo tipo de patrón —esa es la idea de "realización".
Dado un conjunto de puntos (s1,…,sk), la fa Z(s) queda caracterizada por su función de distribución k-dimensional. El conjunto de todas esas funciones, para todo k y toda elección de puntos, se llama la ley espacial de probabilidad:
Ejemplo con k=2Con solo dos puntos s1, s2, la Ec. 2.1 es simplemente la probabilidad conjunta de que la materia orgánica en s1 sea ≤3% y en s2 sea ≤2.5% al mismo tiempo —una pregunta que solo tiene sentido si tratamos Z(s1) y Z(s2) como variables aleatorias conjuntas, no como dos números fijos aislados.
Es una función no aleatoria de s: para cada ubicación da un solo número, el promedio de todas las realizaciones posibles en ese punto. Se llama deriva cuando varía con la ubicación.
EjemploSi la materia orgánica tiende a ser más alta en la parte baja del lote (por acumulación de sedimentos) y más baja en la parte alta, μ(s) no es constante: crece a medida que s se acerca a la zona baja.
También no aleatoria: en cada punto coincide con la varianza de la va Z(s) en ese punto —qué tan dispersas están las realizaciones posibles alrededor de μ(s).
EjemploSi en la zona baja del lote la materia orgánica varía mucho de una parcela a otra (por drenaje irregular) pero en la zona alta es muy uniforme, entonces V(s) también cambia con la ubicación, igual que μ(s).
Mide si dos puntos tienden a desviarse juntos de su propia media (covarianza alta y positiva), de forma opuesta (negativa), o sin relación (cercana a cero).
EjemploSi dos puntos vecinos casi siempre están ambos por encima de su media, o ambos por debajo, C(si,sj) será positiva y grande —es exactamente el reflejo matemático de la Primera Ley de Tobler (Parte 2 de este documento).
El variograma se define como la varianza de las primeras diferencias de la fa:
γ(si,sj) se llama el semivariograma. En vez de comparar valores contra su media (como la covarianza), compara directamente dos puntos entre sí: mide cuánto se diferencian en promedio dos ubicaciones separadas cierta distancia.
EjemploSi dos puntos muy cercanos casi siempre tienen valores parecidos, sus diferencias son pequeñas y γ es bajo; si están muy lejos y ya no se parecen, las diferencias son grandes y γ crece —por eso el variograma es la herramienta estándar para "ver" hasta qué distancia hay correlación espacial (lo que en la Parte 2 llamamos el rango, ahí igual a 110).
Imagina un transecto hipotético de 20 puntos, muestreados cada 10 m, con contenido de materia orgánica (MO, en %) que aumenta a lo largo del transecto (con pequeñas variaciones locales, como ocurriría en la realidad):
La fórmula del variograma experimental, para un lag h fijo, promedia el cuadrado de las diferencias entre todos los pares de puntos separados exactamente esa distancia:
Con h=10 m, cada punto se compara con su vecino inmediato. Con 20 puntos hay N(10)=19 pares posibles (s1-s2, s2-s3,…, s19-s20):
Sumando los 19 cuadrados: ∑(dif)² = 0.550. Aplicando la fórmula:
El mismo procedimiento —cambiando solo qué tan separados están los pares que se comparan— se repite para h=20, 30,…, 90 m. A mayor h, hay menos pares disponibles (N(h) baja) porque los puntos empiezan a "salirse" del transecto.
| h (m) | N(h) pares | ∑(dif)² | γ(h) |
|---|---|---|---|
| 10 | 19 | 0.550 | 0.015 |
| 20 | 18 | 1.420 | 0.039 |
| 30 | 17 | 2.620 | 0.077 |
| 40 | 16 | 4.310 | 0.135 |
| 50 | 15 | 6.090 | 0.203 |
| 60 | 14 | 8.240 | 0.294 |
| 70 | 13 | 10.010 | 0.385 |
| 80 | 12 | 11.950 | 0.498 |
| 90 | 11 | 14.140 | 0.643 |
Se calculó solo hasta h=90 m (la mitad del transecto): a distancias mayores quedan muy pocos pares y la estimación de γ(h) deja de ser confiable —una regla práctica común en geoestadística.
El variograma sube de forma continua y no se aplana en ninguna meseta visible dentro del rango calculado.
Z(s) es una fa Gaussiana si, para cualquier k y cualquier conjunto de puntos s1,…,sk, la distribución conjunta de (Z(s1),…,Z(sk)) es una normal multivariada.
Una normal multivariada queda completamente determinada por su vector de medias y su matriz de varianzas-covarianzas —es decir, únicamente por los dos primeros momentos que ya definimos (deriva y covarianza). Por eso es un supuesto tan común: simplifica enormemente el trabajo.
EjemploSi asumes que la materia orgánica es Gaussiana, entonces conocer μ(s) y C(si,sj) en todos los puntos te basta para conocer toda la distribución de probabilidad conjunta —no necesitas nada más (ni asimetría, ni curtosis, ni momentos de orden superior).
Sería imposible inferir la ley de probabilidad de una fa si solo existiera una realización (como tener una muestra de tamaño 1). Para hacer inferencia con consistencia hacen falta muchas realizaciones, pero en la realidad solo existe una —y de ella solo se conoce una parte (las ubicaciones muestreadas).
La solución es adoptar la hipótesis de estacionariedad (u homogeneidad espacial): sustituir las repeticiones inaccesibles de la fa por repeticiones en el espacio, es decir, tratar los valores observados en distintas ubicaciones del dominio como realizaciones de la misma fa. Esto no es una propiedad del fenómeno, sino una decisión metodológica sobre cómo interpretarlo. Suele acompañarse de un supuesto adicional, la ergodicidad (que esas "realizaciones espaciales" efectivamente se comporten como si fueran independientes para efectos de estimación).
AnalogíaEs como si, en vez de repetir el mismo experimento muchas veces (lo que no puedes hacer con un solo mapa del mundo real), asumieras que distintos lugares del mapa son como "repeticiones" del mismo experimento —razonable si el fenómeno es razonablemente homogéneo, pero una suposición, no un hecho verificable directamente.
{Z(s), s∈D} es estrictamente estacionaria si, para todo k, todo conjunto de puntos s1,…,sk y cualquier vector de traslación h, las familias {Z(s1),…,Z(sk)} y {Z(s1+h),…,Z(sk+h)} tienen la misma función de distribución conjunta (siempre que los puntos trasladados sigan estando en D).
En otras palabras: trasladar todos los puntos una misma distancia y dirección no cambia nada de la distribución conjunta. Es una condición muy estricta.
EjemploEn la Figura de los cuatro pares de puntos (más abajo), si el proceso es estrictamente estacionario, los pares {s1,s2}, {s3,s4}, {s5,s6} y {s7,s8} —todos separados por la misma distancia h, pero en direcciones y lugares distintos del dominio— deben tener exactamente la misma distribución bivariada.
Como la estacionariedad estricta es tremendamente exigente, casi siempre se usa una versión más débil, que solo pide condiciones sobre los dos primeros momentos:
Como C(h) es función solo de h, existe y es finita, la varianza también es constante:
Bajo esta hipótesis, la variable fluctúa alrededor de una media constante, y la magnitud de esas fluctuaciones es la misma en todo el dominio.
Cuando se usa el correlograma (o función de correlación) en vez de la covarianza:
Demostración: la relación entre variograma y covarianza
Bajo estacionariedad de segundo orden, el variograma y la covarianza son equivalentes para describir la dependencia espacial. Partiendo de la Ec. 2.5:
γ(h) = ½ V(Z(s+h)−Z(s))
= ½ [ V(Z(s+h)) + V(Z(s)) − 2C(Z(s+h),Z(s)) ] (propiedad general de la varianza de una diferencia)
= ½ [ C(0) + C(0) − 2C(h) ] (por las Ecs. 2.7 y 2.8)
= C(0) − C(h)
Así que γ(h) = C(0) − C(h): el variograma es simplemente "la covarianza máxima menos la covarianza a distancia h". Cuando h=0, γ(0)=0 (un punto no difiere de sí mismo); cuando h crece y C(h)→0, γ(h)→C(0)=σ² (el variograma se "aplana" en la varianza total, la llamada meseta o sill).
Ejemplo numéricoSi σ²=C(0)=4 y a cierta distancia h la covarianza es C(h)=1, entonces γ(h)=4−1=3. A mayor distancia, si C(h) baja a 0.2, γ(h) sube a 3.8, acercándose a la meseta de 4.
La distribución conjunta de {Z(s1),...,Z(sk)} no cambia al trasladar todos los puntos por un vector h. Condición muy fuerte, rara vez verificable.
La esperanza es constante y la covarianza entre dos puntos depende solo de h, no de su ubicación. Es la hipótesis habitual en geoestadística lineal.
Solo se exige que los incrementos Z(s+h)−Z(s) sean estacionarios de segundo orden, aunque la fa misma no lo sea. Es la hipótesis más débil y más usada.
Si una fa es estrictamente estacionaria, también lo es en sentido amplio. El recíproco no es cierto en general (para fa Gaussianas sí lo es: ambas nociones coinciden).
Una fa es cuasi-estacionaria cuando la hipótesis de estacionariedad de segundo orden solo es válida para distancias |h|<d, con d una distancia límite: μ(s+h)≈μ(s) y C(Z(s+h),Z(s))=C(h) solo si |h|<d. Es útil porque muchos fenómenos reales son "aproximadamente homogéneos" solo a escala local, no en todo el dominio.
EjemploLa materia orgánica puede comportarse como estacionaria dentro de una misma ladera (d = unos cientos de metros), pero no si comparas esa ladera con un valle completamente distinto a varios kilómetros.
{Z(s), s∈D} es intrínsecamente estacionaria (o simplemente intrínseca) si, para cualquier vector de traslación h, los incrementos de primer orden Z(s+h)−Z(s) son estacionarios de segundo orden, aunque la fa misma no lo sea:
donde la deriva μ(s) es necesariamente lineal en h, y
lo que equivale a que ½V(Z(s+h)−Z(s))=γ(h), función solo de h (2.12). Si la deriva lineal es cero (caso simplificado, el que se usa por defecto en el resto del curso):
Si una fa es estacionaria de segundo orden, también es intrínsecamente estacionaria (ya lo vimos: γ(h)=C(0)−C(h) existe). El recíproco no es cierto: hay fa intrínsecas que no son estacionarias de segundo orden (su varianza puede ser infinita), llamadas estrictamente intrínsecas. El ejemplo de Wiener-Lévy, más abajo, es precisamente uno de estos casos.
Por qué es tan usadaEs la hipótesis más débil de las tres: casi cualquier fenómeno razonable la cumple, porque solo exige que las diferencias entre puntos cercanos se comporten de forma estable —no exige que la variable original tenga varianza finita o media constante en todo el dominio.
Considera el proceso discreto Z(sk+1) = Z(sk) + εk, con εk variables aleatorias independientes N(0,1), tomadas en puntos univariados s1, s2,…
Paso 1: la varianza de Z crece sin límite
V(Z(sk+h)) = V(Z(sk) + εk + εk+1 + … + εk+h−1) = V(Z(sk)) + h
Cada paso independiente suma exactamente 1 a la varianza (porque V(εi)=1 y son independientes, así que las varianzas se suman). Por lo tanto la varianza crece indefinidamente con h: no es finita, no es estacionaria de segundo orden.
Paso 2: pero los incrementos sí son estables
Si en cambio miramos el incremento Z(sk+h)−Z(sk) = εk+…+εk+h−1 (la suma de los h pasos intermedios, sin el punto de partida):
E(Z(sk+h)−Z(sk)) = E(∑εi) = 0 (media cero, no depende de k)
V(Z(sk+h)−Z(sk)) = V(∑εi) = h (varianza finita, tampoco depende de k, solo de h)
Como ambos momentos del incremento son estables (no dependen de dónde estás, k, sino solo de qué tan lejos miras, h), el proceso es intrínsecamente estacionario, con
γ(h) = h/2 (de ½V(incremento) = ½h).
Este es el ejemplo que justifica por qué existe la hipótesis intrínseca: Z(s) por sí solo es un desastre estadístico (varianza infinita a largo plazo), pero sus incrementos son perfectamente manejables —y son justo esos incrementos los que la geoestadística intrínseca usa para hacer inferencia.
Ilustración esquemática (datos simulados): arriba, la trayectoria; abajo, sus incrementos.
{Z(s), s∈D} es no estacionaria cuando la media y/o la función de covarianza dependen de la ubicación (no son invariantes ante traslación). Cuando la media no es constante y varía con s se dice que la fa tiene deriva; si además los incrementos de primer orden tampoco son estacionarios, se dice que la fa es no intrínseca (algunos autores la llaman función aleatoria intrínseca de orden k>0).
EjemploLa elevación del terreno a lo largo de una ladera: tiene una tendencia clara (sube o baja de forma sistemática), así que ni la media ni, probablemente, los incrementos simples son estacionarios —hace falta modelar esa tendencia (deriva) antes de poder aplicar geoestadística sobre los residuos.
El soporte V de una fa se refiere a la geometría de la característica representada: puede ser un punto, un segmento, una superficie o un volumen.
Ejemplo del texto: la porosidadLa porosidad de un material (la relación entre el volumen de huecos y el volumen total) es un ejemplo clásico donde una medición puntual simplemente no tiene sentido: en un punto exacto solo hay "sólido" o "hueco" (la función aleatoria solo tomaría valores 0 o 1). La porosidad únicamente es interpretable como un promedio sobre un volumen —es decir, es una variable definida por naturaleza sobre soporte de bloque, no puntual.
El tamaño del soporte de observación tiene consecuencias estadísticas: la más importante es que las mediciones sobre bloques tienen menos variabilidad que las mediciones tomadas en puntos (promediar suaviza). El análisis de estas consecuencias al cambiar el tamaño del soporte se conoce como el problema del cambio de soporte. También se usa la distinción soporte-puntual / soporte-bloque para indicar si una predicción se hace en un punto no observado o en un bloque.