Erste Hürde: Der ungarische Katalogtext ist ungleichmäßig. Manche Produkte haben Beschreibungen von 2 Sätzen, andere von 2 Seiten. Wir fügten einen „Content-Qualitäts“-Score pro Produkt hinzu, und bei Produkten mit geringem Content leitet der Bot proaktiv an einen Menschen weiter.
Zweitens: Halluzinations-Grenzfälle. Beim Eval-Set mit 80 Tickets erreichten wir 95 % Präzision, bei einer blinden Stichprobe von 200 Produktions-Tickets nur 87 %. Der Unterschied: Nutzer in der Produktion formulieren Fragen deutlich vielfältiger. Wir iterierten den System-Prompt und fügten einen „Confidence-Schwellenwert“ hinzu — fällt die Top-1-Kosinusähnlichkeit unter 0,7, erfolgt automatisch eine Weiterleitung an einen Menschen.
Drittens: Kostenüberwachung. In den ersten Wochen lag der Token-Verbrauch 40 % über der Erwartung — der System-Prompt wurde bei jedem Retrieval mitgesendet, was den Kontext aufblähte. Wir führten Prompt-Caching ein, und die monatlichen LLM-Kosten sanken um 28 %.