Hybrid Search en RAG: Cuándo Suma y Cuándo Resta
La mayoría de los proveedores venden hybrid search (fusión léxica + semántica con RRF) como mejora automática. Medimos esa promesa sobre el mismo corpus, las mismas 30 consultas, con recall verificado — y no es tan simple: hay un tercio del espacio de consultas donde fusionar rinde peor que un solo motor por separado.
El Problema Real
"Prender" Hybrid Search no es Neutro
Los motores vectoriales modernos (Qdrant entre ellos) soportan hybrid search nativo: una sola consulta con fusión de rangos (Reciprocal Rank Fusion, RRF) entre el componente léxico y el semántico. Se presenta como "lo mejor de ambos mundos" — combinar nunca puede ser peor que usar uno solo, es la intuición implícita.
Esa intuición no se sostiene cuando se mide. Un sistema de búsqueda documental empresarial recibe consultas con distinto grado de literalidad respecto al texto indexado — desde alguien que ya conoce el vocabulario interno hasta alguien preguntando algo que nunca vio documentado exactamente así. Cada régimen se comporta distinto, y "activar hybrid" no es una decisión neutral en todos ellos.
El Experimento
Mismo Corpus, Mismas Consultas, Tres Motores
Sobre un corpus real de 276 documentos indexamos tres motores en paralelo — léxico puro (sparse, hash de tokens), semántico puro (embeddings densos) e híbrido (ambos fusionados con RRF nativo) — y corrimos las mismas 30 consultas divididas en 3 niveles de literalidad respecto al texto indexado.
Literal
La consulta reusa palabras del documento indexado — simula búsqueda por keyword.
Moderado
Reformulación con sinónimos — comparte poco vocabulario literal con el original.
Agresivo
Cero coincidencia de palabras, verificado programáticamente — ninguna intersección léxica con el documento.
El Resultado Que No Esperábamos
Ningún Motor Gana Siempre
| Tipo de Consulta | Motor que Gana | Motor que Pierde |
|---|---|---|
| Literal | Léxico solo (empata con híbrido, costo cero de API) | Semántico solo |
| Moderado | Híbrido — único caso donde fusionar supera a ambos por separado | — |
| Agresivo (cero overlap) | Semántico solo | Híbrido — fusionar lo empeora |
En consultas sin ningún ancla léxica, el motor semántico solo llegó al 60% de recall en el top 10. El mismo motor, fusionado con el léxico, cayó a 40%. La razón: cuando el componente léxico no encuentra nada relevante, no queda neutro — su ruido compite en el ranking fusionado y desplaza al resultado correcto.
Implicancia de Diseño
No Hay Configuración "Correcta" Única
Un sistema de búsqueda documental empresarial no recibe un solo tipo de consulta. Optimizar para un solo escenario — como hace la mayoría de las implementaciones que solo "prenden" hybrid search porque el motor lo ofrece — deja al otro escenario peor de lo que estaría con un motor más simple.
Diseñar bien esto significa medir cómo se comporta tu corpus específico en cada régimen, y decidir la arquitectura (léxico, denso, híbrido, o selección dinámica por tipo de consulta) con ese dato, no con la ficha técnica del proveedor. Es el mismo criterio de ingeniería que aplicamos en cualquier contrato I+D: dimensionar la arquitectura al caso de uso real, medido, no adoptado por defecto.
Estado Real — Sin Inflar
Medimos Quién Encuentra el Documento. Falta Quién Puede Verlo.
Este benchmark responde solo la mitad del problema de un sistema de búsqueda documental empresarial: qué motor encuentra el documento correcto. La otra mitad — que la búsqueda no devuelva resultados de documentos que el usuario que pregunta no debería poder ver, vía Control de Acceso Basado en Roles (RBAC) sobre la propia capa de búsqueda, no solo sobre permisos de archivo — todavía no está medida ni implementada en este sistema. Es el siguiente paso de esta serie, documentado con la misma honestidad: no publicamos como resuelto lo que sigue siendo trabajo pendiente.
Contenido relacionado
Cívica: Búsqueda Semántica Sobre Leyes del Congreso de Chile
Ese reporte dejó pendiente medir el salto a embeddings densos. Este es esa medición, con recall real.
Leer el caso original → Denso, el Siguiente PasoAdopción de IA y Datos en Empresas Chilenas: Síntesis 2026
Contexto de mercado: por qué medir en vez de adoptar por defecto es la diferencia entre un piloto y un sistema en producción.
Leer síntesis - Escaló IA con Retorno MedibleContratos I+D en IA y Datos
Misma metodología de medición aplicada a tu corpus documental propio, no solo a proyectos internos de Cifrid.
Ver la solución - Contratos de IA y DatosEste benchmark es el caso híbrido de la serie de estrategias de búsqueda en RAG: