Porque una pregunta compleja casi nunca es una sola pregunta — es un grupo de subpreguntas con distinto peso, y ningún motor de respuesta las cubre todas. Un estudio de Georgia Institute of Technology y Salesforce AI Research (NAACL 2025) descompuso 200 preguntas complejas en cerca de 4.000 subpreguntas y midió cuántas aparecían en las respuestas de tres motores comerciales: You.com, Perplexity AI y Bing Chat. Los tres priorizan bien las subpreguntas centrales por sobre las secundarias — pero aun así dejan sin cubrir cerca de la mitad de esas subpreguntas centrales.
Es el criterio que en Nostos pesa 12%: Cobertura de subpreguntas. No mide si tocaste el tema — mide si respondiste todas las partes que importan.
Es la parte de tu pregunta sin la cual la respuesta queda incompleta — no un detalle adicional, sino un componente necesario del razonamiento. El paper clasifica cada subpregunta en tres tipos:
Que los tres distinguen bien: cubren más las subpreguntas core que las de background o follow-up. Pero ninguno recupera de forma consistente toda la información necesaria para las core, y aun cuando esa información ya estaba entre las fuentes citadas, muchas veces no llegó a la respuesta final. Dos hallazgos adicionales del mismo estudio: la cobertura de subpreguntas core predice con 82% de precisión cuál de dos respuestas prefiere un humano — más que pedirle directamente a un modelo que compare las dos respuestas, que llega a 71%. Y cuando un sistema RAG prioriza las subpreguntas core al momento de buscar información, la respuesta resultante le gana a la respuesta base —sin ese paso— hasta en un 74% de las comparaciones.
Descomponer tu propio tema antes de escribir, no después. Cuatro pasos concretos:
Obtené tu score GEO sobre los ocho criterios con respaldo académico, incluida tu Cobertura de subpreguntas.
Hacer el análisis en nostosgeo.app