Consulta Documental · Arquitectura de IA

Hybrid Search en RAG:

La mayoría de los proveedores venden hybrid search (fusión léxica + semántica con RRF) como mejora automática. Medimos esa promesa sobre el mismo corpus, las mismas 30 consultas, con recall verificado — y no es tan simple: hay un tercio del espacio de consultas donde fusionar rinde peor que un solo motor por separado.

276 documentos · 30 consultas · 3 motores · 3 niveles de literalidad
Portada Reportes Estrategias de Búsqueda en RAG Hybrid Search en RAG El Problema El Experimento El Resultado Implicancia de Diseño Estado Real

El Problema Real

"Prender" Hybrid Search no es Neutro

Los motores vectoriales modernos (Qdrant entre ellos) soportan hybrid search nativo: una sola consulta con fusión de rangos (Reciprocal Rank Fusion, RRF) entre el componente léxico y el semántico. Se presenta como "lo mejor de ambos mundos" — combinar nunca puede ser peor que usar uno solo, es la intuición implícita.

Esa intuición no se sostiene cuando se mide. Un sistema de búsqueda documental empresarial recibe consultas con distinto grado de literalidad respecto al texto indexado — desde alguien que ya conoce el vocabulario interno hasta alguien preguntando algo que nunca vio documentado exactamente así. Cada régimen se comporta distinto, y "activar hybrid" no es una decisión neutral en todos ellos.

El Experimento

Mismo Corpus, Mismas Consultas, Tres Motores

Sobre un corpus real de 276 documentos indexamos tres motores en paralelo — léxico puro (sparse, hash de tokens), semántico puro (embeddings densos) e híbrido (ambos fusionados con RRF nativo) — y corrimos las mismas 30 consultas divididas en 3 niveles de literalidad respecto al texto indexado.

Literal

La consulta reusa palabras del documento indexado — simula búsqueda por keyword.

Moderado

Reformulación con sinónimos — comparte poco vocabulario literal con el original.

Agresivo

Cero coincidencia de palabras, verificado programáticamente — ninguna intersección léxica con el documento.

El Resultado Que No Esperábamos

Ningún Motor Gana Siempre

Tipo de Consulta Motor que Gana Motor que Pierde
Literal Léxico solo (empata con híbrido, costo cero de API) Semántico solo
Moderado Híbrido — único caso donde fusionar supera a ambos por separado
Agresivo (cero overlap) Semántico solo Híbrido — fusionar lo empeora

En consultas sin ningún ancla léxica, el motor semántico solo llegó al 60% de recall en el top 10. El mismo motor, fusionado con el léxico, cayó a 40%. La razón: cuando el componente léxico no encuentra nada relevante, no queda neutro — su ruido compite en el ranking fusionado y desplaza al resultado correcto.

Implicancia de Diseño

No Hay Configuración "Correcta" Única

Un sistema de búsqueda documental empresarial no recibe un solo tipo de consulta. Optimizar para un solo escenario — como hace la mayoría de las implementaciones que solo "prenden" hybrid search porque el motor lo ofrece — deja al otro escenario peor de lo que estaría con un motor más simple.

Diseñar bien esto significa medir cómo se comporta tu corpus específico en cada régimen, y decidir la arquitectura (léxico, denso, híbrido, o selección dinámica por tipo de consulta) con ese dato, no con la ficha técnica del proveedor. Es el mismo criterio de ingeniería que aplicamos en cualquier contrato I+D: dimensionar la arquitectura al caso de uso real, medido, no adoptado por defecto.

Estado Real — Sin Inflar

Medimos Quién Encuentra el Documento. Falta Quién Puede Verlo.

Este benchmark responde solo la mitad del problema de un sistema de búsqueda documental empresarial: qué motor encuentra el documento correcto. La otra mitad — que la búsqueda no devuelva resultados de documentos que el usuario que pregunta no debería poder ver, vía Control de Acceso Basado en Roles (RBAC) sobre la propia capa de búsqueda, no solo sobre permisos de archivo — todavía no está medida ni implementada en este sistema. Es el siguiente paso de esta serie, documentado con la misma honestidad: no publicamos como resuelto lo que sigue siendo trabajo pendiente.

Contenido relacionado

Caso Propio

Cívica: Búsqueda Semántica Sobre Leyes del Congreso de Chile

Ese reporte dejó pendiente medir el salto a embeddings densos. Este es esa medición, con recall real.

Leer el caso original → Denso, el Siguiente Paso
Síntesis de Mercado

Adopción de IA y Datos en Empresas Chilenas: Síntesis 2026

Contexto de mercado: por qué medir en vez de adoptar por defecto es la diferencia entre un piloto y un sistema en producción.

Leer síntesis - Escaló IA con Retorno Medible
Solución

Contratos I+D en IA y Datos

Misma metodología de medición aplicada a tu corpus documental propio, no solo a proyectos internos de Cifrid.

Ver la solución - Contratos de IA y Datos

Este benchmark es el caso híbrido de la serie de estrategias de búsqueda en RAG: