Volver al blog

IA

Bases de vectores y arquitectura de búsqueda semántica

Patrones de indexación, actualización y mantenimiento de índices vectoriales para productos con documentos y conocimiento interno.

2 min de lectura

La búsqueda semántica promete encontrar significado, no solo palabras. Pero para que funcione en producción necesita una arquitectura que cuide documentos, permisos, actualización de índices y evaluación de resultados.

Una base vectorial es una pieza del sistema, no el sistema completo. La calidad depende tanto del preprocesamiento como del modelo de embeddings y la forma de presentar resultados.

Preparar documentos antes de indexar

El chunking define qué fragmentos podrá recuperar el sistema. Chunks demasiado grandes mezclan ideas; chunks demasiado pequeños pierden contexto.

También conviene conservar metadatos: fuente, fecha, autor, permisos, versión y relaciones con otros documentos. Sin eso, la recuperación puede ser correcta semánticamente pero incorrecta operativamente.

  • Dividir por estructura real: títulos, secciones y tablas.
  • Guardar metadatos de permisos junto a cada chunk.
  • Versionar el documento original y el embedding generado.

Diseñar recuperación híbrida

La búsqueda vectorial encuentra similitud, pero la búsqueda léxica sigue siendo fuerte para nombres, códigos, IDs y términos exactos.

En productos serios suele funcionar mejor una estrategia híbrida: búsqueda semántica, filtros por metadatos, ranking léxico y reranking cuando el caso lo justifica.

Actualizar sin reindexar todo

A medida que crece la base de conocimiento, reindexar todo ante cada cambio se vuelve lento y caro. Es mejor detectar cambios por documento, recalcular solo chunks afectados y eliminar versiones obsoletas.

La consistencia importa: si el usuario actualiza una política, el asistente no debería seguir citando la anterior.

Evaluar con preguntas reales

La evaluación no debe limitarse a métricas técnicas. Hay que probar preguntas que los usuarios harían, respuestas esperadas, fuentes obligatorias y casos donde la respuesta correcta es admitir que no hay información suficiente.

Un buen sistema RAG sabe recuperar, responder y negarse con precisión.

Checklist para aplicar

  • Estrategia de chunking documentada.
  • Filtros de permisos antes de mostrar resultados.
  • Reindexación incremental.
  • Dataset de evaluación con preguntas frecuentes y difíciles.

La búsqueda semántica se vuelve valiosa cuando deja de ser una demo y se convierte en una capa confiable de acceso al conocimiento.

Contacto

Iniciemos una conversación.

Cuéntanos sobre tu proyecto. Nuestro equipo revisará tus requerimientos y te contactará en menos de 24 horas.

Email directo

hola@codilogia.dev

Ubicación

Santiago, Chile