Die Eingabe des Nutzers (Web-Chat oder eingehender Lead) gelangt zum Orchestrator, der aus n8n oder individuellem Node.js-/Python-Code besteht. Der Orchestrator entscheidet: Ist Retrieval (RAG) nötig, ist ein Tool-Aufruf erforderlich, welches LLM-Modell passt zu diesem Fall.
Die Vektordatenbank (pgvector oder Pinecone) enthält indexierte Dokumente. Die Wissensdatenbank kann ein PDF-Archiv, ein Notion-Export oder eine Live-API sein. Jeder LLM-Aufruf wird protokolliert, damit wir Kosten und Genauigkeit messen können.