Como um LLM só sabe o que aprendeu durante o treinamento, o RAG resolve o problema de informação desatualizada ou privada: antes de responder, o sistema busca ("retrieval") documentos relevantes — de um banco de dados, uma wiki, um vault do Obsidian — e inclui esse conteúdo no prompt para o modelo gerar ("generation") uma resposta fundamentada neles.
É a técnica por trás de muitos assistentes que "conhecem" a documentação interna de uma empresa.