Búsqueda Semántica en Análisis de Mercado: Por Qué el Motor "Inteligente" Pierde
Un modelo de embeddings entiende que "empresa tecnológica" y "compañía de software" significan lo mismo. Ese mismo modelo puede fallar en encontrar la cifra exacta "EBITDA Q3 2026" porque la trata como una entidad más a generalizar, no como un dato que hay que matchear literal.
Cuando el Significado es Secundario
Los Mismos Vendors que Empujan Hybrid Search por Defecto
Asumen que "entender el lenguaje" siempre gana. En corpus dominados por entidades nombradas explícitas — acrónimos técnicos, cifras, fechas, nombres propios — el significado semántico es secundario frente a la exactitud del dato. Ahí, un motor denso no es una mejora: es ruido que compite con la coincidencia exacta que el usuario realmente necesita.
Método
Por Qué Sparse Gana en Este Terreno
Los motores dispersos (sparse) — basados en hashes de tokens como FNV-1a, o en algoritmos como BM25 — son letalmente precisos para coincidencias exactas. Si la búsqueda es "Q3 revenue EBITDA", el usuario quiere esos términos exactos, no una aproximación como "ingresos de empresa tecnológica en otoño".
Un motor denso tiende a generalizar: puede confundir el nombre de una empresa con el concepto de su industria, o diluir la importancia de un acrónimo específico en favor del contexto general de la oración. Fusionar con un motor híbrido no arregla esto por defecto — si el componente denso no aporta señal útil para ese tipo de consulta, solo mete ruido al ranking (mismo efecto ancla de RRF que documentamos en la subpágina de búsqueda híbrida).
Evidencia — Caso Real
Análisis de Mercado, Sector Seguridad e Industrial — Viña del Mar
Las consultas típicas de este corpus son de precisión de entidad (nombre de competidor exacto, cifra de facturación, fecha de reporte, código de producto), no reformulaciones conceptuales. Un motor denso, entrenado para capturar similitud semántica, no está optimizado para esto: puede devolver documentos "relacionados temáticamente" que no contienen el dato exacto que se buscó.
Cuadro de Decisión
No Confundir "Simple" con "Menos Capaz"
Sparse-solo no es una solución de segunda categoría: es la estrategia correcta cuando el corpus lo pide. El riesgo real está en el sentido contrario: activar hybrid search "porque el motor lo ofrece" sobre un corpus de entidades exactas, sin haberlo medido antes.
| Naturaleza del corpus | Estrategia óptima | Riesgo de falla |
|---|---|---|
| Mercado, finanzas, inventario | Sparse solo | Denso generaliza y pierde precisión en datos duros |
| Legal, políticas, filosofía | Denso solo | Sparse mete falsos positivos por falta de solapamiento léxico |
| Soporte IT, historiales clínicos, e-commerce complejo | Híbrido (RRF) | Falta de ponderación si un motor no aporta señal |
Implementación
La Capa de Recuperación no es Toda la Arquitectura
La misma pregunta que aplica a las otras estrategias: si el resultado del motor de búsqueda es la fuente de verdad, o si sigue siendo la base de datos relacional. En análisis de mercado, casi siempre es lo segundo — el motor sparse encuentra qué documento/fila es relevante, pero el dato final que el usuario necesita se recupera de la base de datos estructurada, no del fragmento que devolvió el motor de búsqueda.
Esta es la subpágina 2 de la serie de estrategias de búsqueda en RAG empresarial: