Todas las guías
emap/labs

Dentro de emap/labs: cómo se evalúa una búsqueda geográfica

Datasets versionados, consultas en castellano y euskera, un conjunto held-out y una regla esencial: abstenerse cuando no hay evidencia.

Buscar “una fuente cerca de una estación” parece sencillo hasta que aparecen idiomas, nombres parecidos, distancias y coberturas incompletas. emap/labs es la parte del proyecto que convierte esas preguntas en experimentos reproducibles en lugar de ajustar resultados a ojo.

Un corpus con preguntas y respuestas esperadas

El benchmark reúne 139 casos sobre 22 capas geográficas en castellano y euskera. Cada caso define la consulta, el contexto geográfico y qué resultados pueden considerarse correctos. También incluye preguntas que no deberían responderse porque la información no existe o no es suficiente.

Una parte se reserva como conjunto held-out. Esos ejemplos no se utilizan para calibrar el buscador. Sirven para comprobar si una mejora funciona fuera de las preguntas que guiaron el desarrollo.

De palabras clave a recuperación híbrida

El baseline combina coincidencias léxicas con contexto geográfico. El retriever híbrido puede recurrir a una representación semántica multilingüe cuando las palabras exactas no bastan. La geografía sigue siendo decisiva: una coincidencia de nombre a cientos de kilómetros no debería ganar a un lugar cercano y compatible.

La abstención también se mide

Un sistema que siempre devuelve algo puede parecer eficaz y, sin embargo, inventar respuestas. Los casos answerable: false comprueban que el buscador sepa parar. En movilidad, decir “no puedo verificarlo” es mejor que recomendar una parada inexistente o una vuelta sin horario.

Límites publicados

El corpus todavía contiene material sintético, la cobertura de OpenStreetMap es desigual y cualquier reranker debe demostrar su valor en la evaluación completa. emap/labs publica esos límites junto al código, los datasets y las métricas. La idea no es presentar la IA como magia, sino como una parte medible de una cadena de datos.