Los modelos de lenguaje pueden responder con seguridad, pero no conocen automáticamente los documentos privados o la información más reciente. RAG (generación aumentada mediante recuperación) resuelve esto buscando primero fragmentos relevantes y entregándolos al modelo como contexto. 🤖
La pieza clave son los embeddings: representaciones numéricas que capturan el significado de un texto. Los fragmentos con ideas similares quedan cerca en un espacio vectorial. Para medir esa cercanía se pueden usar distancias L1, L2 o similitud del coseno.
Una implementación práctica puede almacenar esos vectores en PostgreSQL mediante PGVector. El sistema divide los documentos en fragmentos, calcula sus embeddings, los indexa y recupera los más parecidos cuando llega una pregunta. AWS Lambda puede automatizar el indexado cada vez que aparecen nuevos archivos. ⚙️
💡 Explicación en pocas palabras#
Imagina una biblioteca inteligente: en lugar de pedirle al modelo que memorice todos los libros, RAG encuentra las páginas relacionadas con tu pregunta y se las muestra antes de generar la respuesta. Así se reducen las respuestas inventadas y se puede trabajar con conocimiento propio.
El tamaño de los fragmentos, la cantidad de contexto y una evaluación continua influyen directamente en la calidad final.
Más información en el link 👇

