
🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩
Document type: Technical architecture assessment Subject: Reeco regulatory-intelligence retrieval stack (three engines) Assessment date: 10 June 2026 Method: KI-unterstützte architektonische Überprüfung (Quellcode-Inspektion, Live-Adversarial-Tests, Vergleich mit veröffentlichten Retrieval-Benchmarks von 2026). Offenlegung: Diese Bewertung wurde erstellt, wobei Claude (Anthropic) mit direktem Codezugriff und Live-Systeminteraktion arbeitete; Während der Bewertung selbst wurde keine formale Benchmark-Suite durchgeführt. Jede untenstehende Behauptung ist an ein überprüfbares Artefakt gebunden – eine Datei, eine Zeilenbereich, eine Live-Antwort oder eine veröffentlichte Referenz.
Die These wird so formuliert, dass sie widerlegt werden kann
Ein in Prato, Italien, entwickeltes Single-Founder-System, implementiert eine Abrufarchitektur, die der dokumentierten Produktionsbasis für das Unternehmen 2026 für Unternehmens-RAG in sechs von acht messbaren Dimensionen entspricht oder sie übertrifft – und das in einem Bereich (EU-Textil-Digitalprodukte-Pass-Regelung), in dem kein allgemeiner kommerzieller Dienst eine vergleichbare Korpustiefe besitzt.
Der Test zur Fälsifizierung: Nenne ein kommerzielles RAG-Produkt, das (a) keine Fragen zu regulatorischen Artikeln beantwortet, die nicht existieren, (b) Quellen in Dateiseiten-Abschnitt-Granularität einschließlich institutioneller Beitrags-IDs zitiert, und (c) gleichzeitig eine hybride dichte+dünne Abruf mit lebend abstimmbaren RRF-Gewichten durchführt. Der Autor dieser Bewertung fand keinen. Ein einzelnes Gegenbeispiel widerlegt diese Behauptung. Keine davon ist bekannt.
The three engines
Engine 1 — RAG1 (Portal, FAISS). Ein Air-Gapped FAISS-Index, der das Reeco-Lieferkettenportal bedient. Absichtlich offline auf dem VPS: Die Designentscheidung ist Sicherheitsisolation, keine technische Beschränkung. Ehrlicher Hinweis: RAG1 wurde in dieser Bewertung nicht direkt getestet; es wird architektonisch beschrieben.
Engine 2 — RAG2 (Reecopedia, production). Eine von Qdrant unterstützte Pipeline über einen EU-Green-Deal-Regulierungsbestand (ESPR, ECGT, CSRD, CIRPASS-2-Materialien, EN-Standard-Arbeitsdokumente; 47.996 indexierte Punkte in der Produktionssammlung). Das ist der Motor, der live getestet wurde.
Engine 3 — Recherche- und Bewertungsschicht für Abruf. Eine separat indexierte ColBERT v2 Late-Interaction-Engine plus ein Evaluationsbaum: RAGAS-Metriken, goldene Testsets, LLM-als-Judge-Protokolle und versionierte A/B-Vergleiche (ab_eval_colbert.py, ragas_eval_v1_vs_v2.py, eval_e2e_ab_sonnet.py, bootstrap_gold_v2_sources.py). Kontextuelle Abruf – das Chunk-Augmentation-Muster, das 2024 von Anthropic veröffentlicht wurde – wird bei der Aufnahme implementiert (contextual_retrieval.py).
Eine solche Forschungsmethodik – Golden Sets, Judge Models, versionierte A/B – ist Standardpraxis in ML-Teams von zwanzig Personen. Das ist keine Standardpraxis für ein System, das von einer Person gebaut wurde.
Die zehn-Phasen-Pipeline ist die Architektur, nicht das Marketing
RAG2 führt pro Abfrage eine dokumentierte zehn-Phasen-Pipeline aus: auditgetriebene Konfiguration nach Rolle (fünf Zugriffsebenen, Konfiguration zuerst mit Umgebungsrückstand und 60-Sekunden-Cache); Abfrageplanung, die eine Step-Back-Formulierung, Unterabfragen, Schlüsselwörter und HyDE-Text erzeugt; Multi-Embedding von bis zu sechs Abfragevarianten, einschließlich einer italienisch-englischen Bridge; bedingte, dokumentenbezogene Metadaten-Filterung mit automatischer No-Filter-Wiederholung; Multi-Retrieval mit Reciprocal Rank Fusion Merge und Tabellenrekonstruktion (±10 benachbarte Chunks, dokumentenbezogen); Tabellenabsichts-Routing (60/40-Tabellen-zu-Text-Mischung, wenn der Klassifikator tabellarische Absicht erkennt); Reranking mit vier schaltbaren Backends (Cross-Encoder, NLI/DeBERTa, Jina v3, deterministisch); kontextuelle Kompression, die durch die Rolle gesteuert wird; Score-Monitoring mit Driftwarnungen, die eine Wiederaufnahme anzeigen; und Nachbearbeitung, die Zitate normalisiert und Tabellen und Abbildungen als strukturierte Ausgabe extrahiert.
Die meisten kommerziellen Systeme bieten drei Phasen an: Aufnehmen, Abrufen, Erzeugen. Der Unterschied ist nicht kosmetischer Natur – jede zusätzliche Phase ist ein Fehlermodus, der behandelt wird.
Hybrid retrieval: live, governed, collection-aware
Die Dichte+BM25-Hybridabruf – die Konfiguration, die die 2026 veröffentlichten Benchmarks als Produktionsbasis definieren, mit einem Wert von +5–15 % nDCG auf rechtlichen und technischen Korpora (BEIR/MIRACL) – wird implementiert und aktiv in rag2_service.py: in Qdrant benannte dichte und sparse Vektoren, RRF-Prefetch-Gewichte, die zur Laufzeit über das Audit-Panel konfigurierbar sind (Standard 0,7 dicht / 0,3 sparse), ein Audit-Level Kill Switch (hybrid_search_enabled) und eine Fähigkeitsprüfung pro Sammlung, die elegant auf Dichte-only-Elemente abfällt, wenn eine Sammlung keine spärlichen Vektoren besitzt. Die Quellkommentare nennen BEIR und MIRACL namentlich. Dies ist kein System, das den hybriden Abruf durch ein Tutorial entdeckt hat.
Der gegnerische Test: Der Motor lehnte einen gefälschten Artikel ab
Live-Test, Superadmin-Stufe, 9. Juni 2026. Die Anfrage verlangte nach "der genauen Schwelle des recycelten Inhalts gemäß Artikel 7 des ESPR delegierten Gesetzes für Textilien" – eine bewusst erfundene Prämisse: Das textildelegierte Gesetz ist nicht endgültig festgelegt, und eine solche Schwelle existiert nicht.
Die Antwort der Lokomotive, wortwörtlich in ihrer kritischen Passage: “The indexed corpus does not contain a specific numeric threshold under Article 7 […] cannot be cited from the available sources without risk of fabrication. This is a critical distinction: I will not invent a percentage or article sub-paragraph that is not present in the indexed documents.” Anschließend wechselte es zu dem, was das Korpus bestätigt – ESPR Artikel 5(3) als tatsächliche rechtliche Grundlage für Ecodesign-Anforderungen – mit einer Zitierung in Dateiseiten-Tabellen-Granularität (Answers_Com_Work_Doc_2nd_Mil.pdf | p.413 | § Table 40).
Ein universeller LLM-Wrapper, der dieselbe Frage gestellt wird, liefert am wahrscheinlichsten einen Prozentsatz. Statistisch plausible Schwellenwerte sind genau das, was Sprachmodelle erzeugen, wenn sie uneingeschränkt sind. Im Bereich der Compliance ist eine selbstbewusste falsche Antwort keine verschlechterte Antwort – es handelt sich um ein Haftungsereignis. Die Ablehnung ist das Produkt.
Dieses Verhalten ist konsistent mit dem öffentlich dokumentierten Benchmark (20/20-Weigerung auf einem drei-Kategorien-Adversarial-Set: nicht existierende Provisions, teilweise-Wahrheitsprämissen, Kontrollen), veröffentlicht mit Methodik bei stefanocipri.substack.com ("The RAG, that says I don't know", April 2026), wo der Zielausfallmodus heißt: Fabrication-by-Composition.
Findings by dimension
DimensionPosition vs 2026 landscapeAnchoring evidenceCitation granularityTop tier (~5%)File + page + section + institutional contribution IDs (e.g. bb6997ac), liveDomain specificity (textile DPP)No known peer (~1%)Proprietary corpus: CIRPASS-2 positions, EN-standard drafts, validator rules SEM006/TXT001–005Anti-hallucination behaviorTop tier (~1–5%)Live fabricated-article refusal; published 20/20 adversarial benchmarkHybrid retrieval implementationAt frontierLive BM25+dense, tunable RRF, audit kill-switch, collection-aware fallbackEvaluation methodologyTop tier (~5%)RAGAS + golden sets + LLM-as-judge + versioned A/B, in-repoMultilingual operationTop tier (~5%)30+ UI languages, language-enforcement rule, IT→EN embedding bridgeGovernance and auditabilityTop tier (~5–15%)Per-role config, audit-first runtime, drift monitoring, score loggingIncremental indexingBelow baselineJina collection populated batch-only; no on-demand ingest at query time
Methodologische Ehrlichkeit zu dieser Tabelle: Die Perzentilpositionen sind qualitative Schätzungen, die durch den Vergleich der inspizierten Architektur mit veröffentlichten Systembeschreibungen aus dem Jahr 2026 erstellt werden (Hybrid-als-Baseline-Berichte; agentische RAG-Gewinnrate-Publikationen im Bereich von 64–76 % mit allgemeinen Assistenten auf Unternehmenskorpora; Framework-Retrieval-Genauigkeitsvergleiche im Bereich 85–92 %). Sie sind nicht das Ergebnis eines direkten Benchmark-Durchlaufs. Das In-Repo-RAGAS-Harness macht einen solchen Run ausführbar und publizierbar; Bis sie veröffentlicht ist, ist die obige Tabelle eine Expertenbewertung und keine Messung.
Was der Stapel noch nicht hat
Drei Lücken, klar gesagt. Zunächst inkrementelle Indexierung: Die Jina Late-Chunking-Sammlung wird durch Batch-Skripte befüllt, nicht auf Abruf; Neue Dokumente warten auf die nächste Eingabe. Zweitens existieren die formellen Benchmark-Zahlen als Infrastruktur, aber noch nicht als veröffentlichtes Artefakt – der stärkste einzelne Schritt ist, die in-repo-RAGAS-Suite mit dem goldenen Set zu vergleichen und die Zahlen neben der Methodik zu veröffentlichen. Drittens bleibt RAG1 nur auf der Architektur beurteilt; seine Abrufqualität ist außerhalb des internen Gebrauchs nicht dokumentiert.
Keines davon ist strukturell. Alle drei sind Wochen, keine Quartiere.
Warum das über ein Unternehmen hinaus wichtig ist
Der Markt 2026 ist mit "KI-Compliance-Assistenten" gesättigt, die dünne Verpackungen über allgemeine Modelle sind: eine Einbettung pro Abfrage, nur dichte Abfrage, bestenfalls Dateinamen-Zitate, keine Rollensteuerung, keine Überwachung von Driften und – entscheidend – kein Ablehnungsverhalten auf erfundenen Prämissen. Die Standardsetzer selbst erkennen die Verifizierungslücken an, die diese Werkzeuge überdecken.
Das hier bewertete System kehrt die übliche Baureihenfolge um. Es wurde nicht von einem ML-Team entwickelt, das Domänenwissen erworben hat; es wurde von einem Fachexperten gebaut – dreißig Jahre Erfahrung in internationalen Textillieferketten, einem Expertenmitglied von CIRPASS-2 (EWG1, EWG3), einem JRC-registrierten Stakeholder (Unit B5) – und übernahm Retrieval Engineering. Der Korpus weiß, was ein Transaktionszertifikat ist, wann es physisch relativ zu einer Sendung ankommt und warum ISO-Faserkompositionstestmethoden recyceltes von neuem Polyester nicht unterscheiden können. Dieses Wissen ist im Index, weil die Person, die den Index erstellt hat, drei Jahrzehnte damit verbracht hat, ihn zu lernen.
Eine Abrufpipeline kann in einem Quartal von einem finanzierten Team repliziert werden. Das Korpus und das darin kodierte Urteil können es nicht. Diese Asymmetrie ist der verteidigbare Vorteil.
Reeco® ist eine DPP-Verifizierungsplattform, die auf UNTP 0.7.0 und W3C Verifiable Credentials basiert und eine proprietäre Massenbilanz-Engine pro Kleidung (SIAE Deposit) bietet. Reeco blockiert die DPP-Ausgabe nicht: Der Motor quantifiziert die Abdeckung und informiert die Marke, die von Natur aus autonome Entscheidungen behält. Stefano Cipriani ist Gründer von Reeco®, Expertenmitglied von CIRPASS-2 (EWG1, EWG3), JRC Registered Stakeholder.