Fallakte 07 Analyse-Plattform Live

Zwei Expertenteams.
Null erfundene Autorität. Eine Pipeline, in der kein Modell die eigene Hausaufgabe korrigiert.

Consultants ist unsere konto-basierte Analyse-App: Team wählen — Marketing oder Recht, DACH-Jurisdiktionen —, Vorfall beschreiben, quellenbelegten Bericht als PDF erhalten. Die Oberfläche ist bewusst klein. Die Arbeit steckt darunter, wo eine Frage bis zu sieben Stufen durchläuft, bevor ein einziger Satz Sie erreicht.

Die Regel, die alles geformt hat: Der letzte Wortlaut stammt nie von derselben Modellfamilie, die den Entwurf geschrieben hat, und die Gegenprüfung läuft immer auf einem anderen Modell als die Synthese. Eine Pipeline, die die eigene Hausaufgabe nicht korrigieren kann — das ist der Unterschied zwischen einer KI-Demo und einem Produkt, auf das ein zahlender Kunde seinen Namen setzt.

Auf einen Blick
Status
Live (v0.7)
Art
PWA + Pipeline
Teams
Marketing · Recht DACH
Pipeline
7 Stufen (legal)
Bericht
PDF, on demand
Stack
TypeScript · SQLite
Pipeline was eine Frage durchläuft
  1. 01 Eingang GateSafety-Layer 1: Der Brief wird auf Injection-Muster geprüft, bevor ein Job existiert. Bösartige Eingaben sterben hier — mit klarer Absage.
  2. 02 Bestand FaktenBestandsaufnahme: Was weiss der eigene Vault über so einen Fall schon?
  3. 03 Recherche QuellenNur kuratierte Quellen — eine Rechtsmeinung ohne Quellen verweigert die Pipeline selbst.
  4. 04 Gegenprüfunganderes Modell PrüfungDie Gegenprüfung läuft auf einer ANDEREN Modellfamilie als alles danach. Keine Selbstbenotung.
  5. 05 Synthese EntwurfDer Entwurf existiert jetzt — aber er darf nie raus. Zwei weitere Text-Stufen folgen, keine davon das Autoren-Modell.
  6. 06 ParaphraseNon-Autor-Modell NeuformulierungEine andere Familie formuliert neu. Erkennbarer Modell-Stil ist ein Defekt, kein Feature.
  7. 07 Lektorat + GatePDF VersandUmlaut-Garantie, Jurisdiktions-Check, Safety-Layer 2 über den Endtext — dann ein PDF mit Analyse-ID auf jeder Seite.

Eine Frage kommt oben rein und wird unten ein PDF. Jede Stufe hat eine Aufgabe, eigenes Modell-Routing und die Fähigkeit, laut zu scheitern, statt etwas Falsches weiterzureichen.

Ausgangslage Warum die schwere Version der Sinn war § 01

Jeder kann ein LLM an ein Formular hängen. Das ist nicht das Produkt.

Die verführerische Version dieses Produkts: ein Textfeld, ein API-Call, eine gestreamte Antwort. Demo-tauglich — und sie scheitert an der zweiten echten Frage: Sie zitiert nichts, sie unterscheidet einen deutschen von einem Schweizer Rechtskontext nicht, sie trägt den Tonfall des Modells, das sie schrieb, und sie vertraut jedem Wort, das der Nutzer getippt hat.

Consultants ist die andere Version. Zwei Expertenteams statt einem Chatbot. Eine Pipeline aus bis zu sieben Stufen statt einem Call. Ein Safety-Layer, der Freitext als feindliche Eingabe behandelt — in einem Rechtsprodukt ist er das. Und ein Bericht, den Sie einem Kunden mit Ihrem Namen übergeben können, weil jede Seite eine Analyse-ID trägt und jede Aussage eine Quelle.

Zeitleiste Wie das Produkt seine Guardrails erwarb § 02

Jede Regel unten existiert, weil zuerst etwas schiefging.

2026Jul
Erfahrung

Wir betreiben seit 2024 eigene Agenten-Flotten.

Das Business OS hat uns die Ausfallmoden gelehrt: Agenten, die raten statt suchen; geteilter Kontext, der in Widersprüche driftet; Kosten, die explodieren, wenn alles auf Frontier-Modellen läuft. Consultants ist diese Erfahrung, produktisiert für zahlende Nutzer.

2026Aug
Problem

Der eigene CEO-Vault leakte in eine Kundendatenbank.

Ein früher Indexierungslauf scannte einen persönlichen Memo-Ordner. Achtundzwanzig interne Fallakten — darunter ein echtes Rechtsmandat — lagen in der kundensichtbaren Wissensdatenbank. Kein Kunde hat sie je gesehen; das Audit, das sie fand, war unseres. Der schlimmste Bug, den dieses Produkt je ausgeliefert hat.

2026Aug
Lösung

Per-Team-Vaults, Trennung auf SQL-Ebene, und eine stehende Purge-Regel.

Jedes Team scannt jetzt nur seine eigenen Roots; der teamübergreifende Query filtert in der WHERE-Klausel, nicht im Client. Und die Regel, die wir aufschrieben: Jede neue Zugriffstrennung bekommt ein Bestands-Audit plus Purge — ein Index, der nur upsertet, löscht seine eigenen Fehler nie.

2026Aug
Problem

Der Safety-Filter blockte ehrliche Fragen.

Die ersten Injection-Muster griffen zu breit. „Ist es verboten, …?“ — eine völlig normale Rechtsfrage — wurde als feindliche Eingabe abgewiesen. Ein False Positive kostet den Nutzer die komplette Anfrage; die wütende Nachricht danach kostet uns den Nutzer.

2026Aug
Lösung

Ein Korpus-Test ist seit jedem Pattern-Change Pflicht.

Zehn legitime Briefe, die durch müssen, und acht Angriffe, die nicht durch dürfen — direkt gegen den Matcher, bei jeder Änderung. Patterns sind plain, erklärbare Regex-Listen, bewusst kein ML-Klassifikator: eine Blackbox hätte blinde Flecken und keinen Audit-Trail.

2026Aug
Problem

Der Bericht beantwortete eine Frage, die niemand gestellt hatte.

Die Thema-Erkennung las die kuratierten Quellen, nicht nur den Brief des Kunden. Eine Immobilienfrage bekam die DSGVO-Meinung — weil die Quellenbasis voll Datenschutzmaterial war. Der Quellenbestand klassifizierte die Anfrage.

2026Aug
Lösung

Routing liest nur, was der Kunde geschrieben hat.

Jede Entscheidung, die eine Anfrage klassifiziert, läuft jetzt allein auf dem Brief. Kuratiertes Material darf eine Antwort anreichern, aber nie eine Routing-Entscheidung treffen — die Lektion generalisiert auf alles, das abgerufenen Kontext in Kontrollfluss mischt.

2026Aug
Heute

Ein Bericht, auf den ein Kunde seinen Namen setzen kann.

Version 0.7 liefert die volle Schleife: Jurisdiktion abgeleitet und persistent, Agenten-Roster mit Stufen-IDs im Fuss, umlaut-garantiertes Deutsch, PDF on demand aus der Datenbank. Der Demo-Provider fährt die Staging-Pipeline; Produktions-Routing ist eine Konfigurationsfrage, kein Rewrite.

Drei dieser fünf Vorfälle haben nie einen Nutzer erreicht. Wir zählen sie trotzdem — die Pipeline wird daran gemessen, was sie verweigert, und wir ebenso.

Entscheidungen Was wir wählten, und was es kostete § 03

Vier Entscheidungen, die die Demo langweilig und den Betrieb sicher machen.

Entscheidung 01 · Autorschaft

Keine Modellfamilie schreibt den Endtext des eigenen Entwurfs.

Die Synthese entwirft, eine andere Modellfamilie paraphrasiert, eine dritte lektoriert. Das letzte Wort eines Kundenberichts ist nie das des Erstautors — erkennbarer Modell-Stil gilt als Defekt. Das Routing erzwingt das im Code: Konfiguriert man die Paraphrase-Stufe auf die Entwurfs-Familie, verweigert die Pipeline den Start.

Kosten: drei Text-Stufen statt einer, und Modell-Routing als Konfigurationsproblem erster Klasse.
Kauft: Berichte, die klingen, als hätte sie ein Mensch geschrieben — und die Frage „welche KI ist das?“ überstehen.

Entscheidung 02 · Vertrauen

Jeder Nutzertext ist feindlich, bis er pattern-geprüft ist.

Freitext-Briefe sind eine Angriffsfläche: Prompt-Injection, Exfiltrationsversuche, Anweisungen, über „mein Fall sieht so aus …“ geschmuggelt. Stufe eins prüft Patterns, bevor ein Job existiert; Stufe zwei prüft den Endbericht, bevor er speichert. Eine kompromittierte Mittelstufe kann die Kundendaten nicht durchs PDF nach aussen leaken.

Kosten: False-Positive-Disziplin — ein Korpus-Test bei jeder Pattern-Änderung, weil eine blockte ehrliche Rechtsfrage ein eigener Vorfall ist.
Kauft: ein Rechtsprodukt, dessen Eingangsfläche sich benimmt wie die einer Bank, nicht wie die eines Chatbots.

Entscheidung 03 · Quellen

Keine Quellen, kein Bericht. Die Pipeline verweigert — nicht der Nutzer.

Eine Rechtsmeinung ohne Belege ist eine Halluzination mit Selbstbewusstsein. Die Pipeline selbst weigert sich, eine zu produzieren — fehlt die Recherche-Stufe, scheitert der Job sichtbar, statt dass die Synthese erfindet. Der Nutzer bekommt einen Fehler und sein Credit zurück, nie eine souveräne Vermutung.

Kosten: harte Abhängigkeit von kuratiertem Quellenmaterial pro Jurisdiktion.
Kauft: jede Aussage in jedem Bericht führt auf etwas zurück — und Fehler sind laut.

Entscheidung 04 · Fairness

Eine gescheiterte Analyse erstattet das Credit. Automatisch.

Quota-Systeme bestrafen normalerweise die Nutzer für Infrastruktur-Ausfälle. Hier bucht jeder terminale Fehlerpfad ein Refund-Event — idempotent pro Job — und ein Restart-Button führt die Analyse kostenlos erneut aus. Die Wahrheit der Buchhaltung ist „gestartet minus erstattet“, nicht „gestartet“.

Kosten: Refund-Logik auf jedem Fehlerpfad und ein zweiter Button in der UI.
Kauft: Nutzer zahlen nie für unsere Ausfälle — in einem Vertrauensprodukt ist das Preisgestaltung, kein Gefallen.

Produkt Die App selbst § 04

Kleine Oberfläche. Die Arbeit steckt darunter.

Screenshot der Consultants-Landingpage mit den beiden Expertenteams
Landing — zwei Teams, eine Frage
Screenshot des Auftrag-Formulars in der Consultants-App
Auftrag — Fall beschreiben — das Team tönt die ganze App
Screenshot eines abgeschlossenen Analyse-Berichts in der Consultants-App
Bericht — Summary auf dem Screen, belegte Details im PDF
Screenshot des Live-Prozessdiagramms der Analyse-Pipeline
Prozess-Ansicht — die echte Pipeline, live aus der Datenbank gerendert

Live-Screenshots aus der laufenden App. Die Prozess-Ansicht ist keine Marketing-Grafik — sie rendert aus der Pipeline-Definition in der Datenbank. Deshalb kann sie nie eine Stufe zeigen, die nicht existiert.

Störfälle Was kaputtging, und was es verändert hat § 05

Die Pipeline wird daran gemessen, was sie verweigert.

Cross-Tenant-Leak

Eine Migration lief monatelang nicht in Produktion — unsichtbar.

Der Build kopierte SQL-Migrationen schlicht nicht: Tabellen existierten in Produktion nur durch frühere manuelle Zustände. Bemerkt, als eine Stufe ihre Tabellen nicht fand. Nichts ging verloren; alles war unverifiziert.

Was wir angenommen hatten: dass ein grüner Build ein vollständiges Deploy impliziert. Der Compiler kopiert Code, kein Schema.

Fix → der Build-Schritt kopiert Migrationen jetzt explizit, und das Boot-Log nennt jede angewendete Migration. Ein Deploy, das sein Schema nicht beweisen kann, gilt als gescheitert.

Qualitäts-Gate

„Das PDF ist dünn. Ich hätte die Antwort erwartet.“

Das Gründer-Urteil über einen Bericht, dessen ganze Begründung im Summary-Feld lebte. Die Daten existierten — Meinung, Quellen, Roster — aber nichts propagated sie auf die sichtbare Fläche. Ein PDF, das verlangt, dass der Leser der App vertraut, ist kein Bericht.

Was wir angenommen hatten: dass Daten in der Datenbank gleich Inhalt im Deliverable sind. Die Lücke zwischen beiden ist die Stelle, an der Produkte sterben.

Fix → die Fachmeinung steht jetzt als ganze Fliesstext-Sektion im Bericht, die Jurisdiktion wird pro Thread abgeleitet und persistiert, und jede PDF-Seite trägt die Analyse-ID im Fuss — damit auch ausgedruckte Blätter den Weg zurück finden.

Übertrag Was das für Sie bedeutet § 06

Wenn Sie ein LLM vor Kunden stellen, sind das die Stellen, die beissen.

Selbstbenotung ist der Standard-Fehlschlag

Ohne bewusstes Routing entwirft, prüft, paraphrasiert und versendet dasselbe Modell. Es wird die eigene Hausaufgabe immer abnehmen. Autorschaft nach Modellfamilie zu trennen ist billig; es nicht zu tun ist teuer.

Behandeln Sie Freitext als Angriffsfläche

Ihre Nutzer werden Anweisungen einfügen, und manche davon sind nicht Ihre Nutzer. Pattern-Checks am Eingang und vor dem Persistieren — plain, auditierbare Listen, kein ML-Klassifikator — fangen, was Alignment-Training verpasst.

Abgerufener Kontext darf nie den Kontrollfluss steuern

In dem Moment, in dem Ihr Quellenbestand das Routing beeinflusst, klassifiziert die Wissensdatenbank die Anfrage statt des Kunden. Routen auf dem Brief, informieren mit den Quellen.

Laut scheitern, automatisch erstatten

Eine Pipeline, die sichtbar scheitert und das Credit zurückgibt, baut mehr Vertrauen auf als eine, die nie fehlschlägt und manchmal erfindet. In Produkten, die Fragen beantworten, nach denen Menschen handeln, ist Verweigerung ein Feature.

Wir bauen die Version, die den Kontakt mit Kunden übersteht.

Wenn Sie ein KI-Produkt planen und die Demo der leichte Teil ist, sollten wir reden. Wir bauen Pipelines, die Halluzinationen verweigern, Eingaben als feindlich behandeln und Dokumente erzeugen, nach denen Ihre Kunden handeln können. Erstes Gespräch kostenlos und kurz.