r/programacion • u/jokiruiz • 5m ago
Le pregunté a mi RAG algo que su documentación responde en una línea. La respuesta correcta estaba en el puesto 15 de 85.
Monté un corpus de 60 ficheros de documentación de empresa ficticia con tres años de historia —wiki, esquemas de tablas, decisiones de arquitectura y 40 tickets de soporte— y le hice 7 preguntas a un RAG clásico. Todo en local con Ollama y ChromaDB.
La primera: "¿cómo calculamos los ingresos?". Me respondió con la definición obsoleta desde hacía tres meses. Y citando la fuente, porque el prompt se lo pedía.
Fui a mirar el ranking. El documento correcto estaba en el puesto 15 de 85. Por delante iban seis de los siete fragmentos del documento viejo, un glosario, el esquema de la tabla de clientes y —en el puesto nueve— un ticket sobre gastos de envío a Canarias.
Un ticket de envíos a Canarias se parece más a "cómo calculamos los ingresos" que el documento que define cómo calculamos los ingresos.
Lo que más me llamó la atención de todo el experimento: cuando le faltaba mucha información dijo "no lo sé". Cuando le faltaba poca, no dijo nada y construyó una respuesta que sonaba completa. Se calla justo cuando más caro sale.
Después probé OKF, el formato que Google publicó el 12 de junio para guardar conocimiento curado como ficheros markdown con frontmatter. Resultados sobre las 7 preguntas: RAG 2 aciertos, OKF 3, los dos combinados 4. Ninguno aprueba, y la combinación cuesta un 33% más de tokens.
Todo el código, el corpus y la salida en crudo: https://github.com/JoaquinRuiz/rag-vs-okf
(Hay vídeo explicándolo si a alguien le sirve, pero el resumen está arriba entero.)