a3f9 7c1e 09bb 4d20
1d44 be07 92fa 3c55
6c2b 81e4 0af7 d539
e70a 4b8f c611 3d9a

$ ./wortlaut --verbatim --no-summarize

#wortlaut_

Ein Archiv des öffentlichen Wortes. Was Mandatsträger öffentlich sagen, wird erfasst, fremdarchiviert, gehasht und wörtlich wiederauffindbar gemacht.

Wortlaut oder gar nichts. Die Maschine urteilt nicht.

„Ich will Zeugnis ablegen bis zum letzten." — Victor Klemperer

Was es tut

Belegen statt behaupten.

Frag das System, was eine Mandatsträgerin oder ein Mandatsträger zu einem Thema wörtlich gesagt hat, und zwar nicht nur im Parlament, sondern überall dort, wo öffentlich gesprochen wird: Plenum und Drucksache heute, dazu Interview, Podcast, Video und Presse, wie das Archiv wächst. Die Antwort ist nie ein geglätteter Fließtext, sondern eine Liste wörtlicher Zitate mit Sprecher, Datum, Permalink zur Primärquelle, Archivlink und Hash. Jedes Zitat ist unabhängig gegen seinen Hash nachprüfbar. Kein „fasse zusammen": Ein Zitat, das ein Modell geglättet hat, ist eine Behauptung. Der echte Wortlaut nicht, der steht da.

$ wortlaut "Mandatsträger:in A · Thema Z"
„<wörtliches Zitat aus dem Plenarprotokoll>"
Sprecher:in: <amtliche Zuordnung> · Datum: 0000-00-00 · Drucksache: 00/0000
Quelle: Permalink zur Primärquelle · Archiv: Fremdarchiv-Kopie · sha256: a3f9…1c40
▸ 0 generierter Text · 0 Interpretation · 100% wörtlich

Status: Planungsphase / Pre-Alpha. Architektur, Recht, Security und Datenmodell sind spezifiziert und offen im Repo. MVP-Fokus: öffentliche, amtliche Quellen (gemeinfrei nach § 5 UrhG); weitere Quellen wie Interview, Podcast, Video und Presse folgen in späteren Phasen. Die Architektur ist von Tag 1 partei- und quellen-agnostisch.

Die Verfassung des Projekts

Prinzipien, nicht verhandelbar.

01

Provenienz vor allem

Nichts wird verarbeitet, was nicht vorher archiviert und gehasht ist. Die Kette Rohbyte → Hash → Fremdarchiv → Span ist lückenlos.

02

Die Maschine urteilt nicht

Als Architektur, nicht als Absicht. Retrieval gibt nur wörtliche Spans zurück, nie generierten Fließtext. Es gibt keinen summarize-Pfad.

03

Parteineutral by design

Kein Datenmodellfeld, kein Ranking bevorzugt eine Partei. Neutralität ist in die Struktur gebaut, nicht angekündigt.

04

Offen & reproduzierbar

Code offen unter AGPL-3.0. Jede Beweiskette ist von außen nachprüfbar. Wer eine Instanz betreibt, legt den Code offen.

05

Nur öffentliches Wort

Ausschließlich öffentliche Äußerungen von Mandatsträgern in politischer Funktion. Keine Privatsphäre, keine Nicht-Mandatsträger, kein Doxxing.

Fahrplan

Erst das Fundament.

wortlaut ist in der Planungs- und Pre-Alpha-Phase. Wir bauen bewusst klein und sauber, ein Schritt nach dem anderen. First make it run.

jetzt

Fundament

Architektur, Recht, Security und Datenmodell sind spezifiziert und offen im Repo. Das Persistenz-Fundament (Datenbank, Migrationen, Tests) steht.

danach

MVP

Erste amtliche Quellen (Parlaments-Drucksachen und Plenarprotokolle), wörtliches Retrieval mit Sprecher, Datum, Permalink, Archivlink und Hash.

später

Breite

Weitere Quellen und Parteien (die Architektur ist agnostisch), sowie Spracherkennung und Diarization für Audio und Video.

Häufige Fragen

Was wir beweisen, und was nicht.

Beweist der Hash, dass die Aussage echt ist?

Ehrliche Antwort: Nein, nicht allein. Ein Hash beweist, dass ein Wortlaut seit dem Archivieren unverändert ist und dass genau dieses Zitat wiedergefunden wurde. Er beweist nicht automatisch die Authentizität der Quelle im Moment der Erfassung.

Deshalb ist wortlaut kein Wahrheits-Orakel, sondern eine lückenlose Beweiskette: Erfassungs-Metadaten (Quell-URL, TLS-Zertifikat der Quelldomain, Zeitstempel), ein vertrauenswürdiger Zeitstempel, und mehrere unabhängige Archive gleichzeitig. Weichen die Kopien voneinander ab, ist das ein Manipulations-Alarm. So wird Fälschung sehr schwer und, wo sie passiert, sichtbar.

Ausführlich, mit den Tabellen „Was wir beweisen / was nicht" und den fünf Gliedern der Beweiskette: Beweiskraft →. Technische Details im offenen Threat-Model und der Rechtslage.

Urteilt die KI? Fasst sie zusammen?

Nein, und zwar architektonisch. Es gibt keinen summarize-Pfad. Das System findet, strukturiert und sortiert wörtliche Spans. Es bewertet nicht, wer „recht hat", und labelt niemanden. Das Urteil bleibt beim Menschen, der den belegten Wortlaut liest.

Ist das parteiisch?

Nein. Parteineutralität ist in die Struktur gebaut: kein Feld, kein Ranking, kein Modellpfad bevorzugt oder benachteiligt eine Partei. Erfasst wird das öffentliche Wort aller Mandatsträger gleich. Die Architektur ist quellen- und partei-agnostisch.

Warum fangt ihr ausgerechnet bei der AfD an?

Ehrlich: weil dort öffentlich am lautesten mit Hass und Hetze aufgefallen wird und der wörtliche Beleg deshalb dort am dringendsten gebraucht wird. Wo anzufangen ist, ist eine menschliche Entscheidung, kein Urteil der Maschine.

Und genau hier greift der Kern: Die Engine ist neutral. Sie gibt nur den Wortlaut zurück, den jemand tatsächlich gesagt hat, mit Quelle, Fremdarchiv und Hash. Wenn ein Zitat einen Sprecher schlecht aussehen lässt, ist das sein eigenes Wort, nicht unsere Wertung. wortlaut urteilt nicht: Wer nichts Menschenverachtendes gesagt hat, hat nichts zu befürchten.

Die AfD ist der erste Datensatz, nicht der einzige. Kein Feld, kein Ranking, kein Modellpfad bevorzugt oder benachteiligt eine Partei. Wir fangen bei einer an und ziehen alle nach, bis das öffentliche Wort aller Mandatsträger gleich belegbar ist. Von Tag 1 partei- und quellen-agnostisch.

Woher kommen die Daten? Ist das legal?

MVP-Fokus sind öffentliche, amtliche Quellen (z.B. Parlaments-Drucksachen und Plenarprotokolle). Amtliche Werke sind nach § 5 UrhG gemeinfrei, die Sprecherzuordnung ist amtlich. Nur öffentliche Äußerungen in politischer Funktion, keine privaten Daten. Details in der offenen Rechts-Dokumentation.

Wie stellt ihr Qualität und Vertrauen sicher?

Alles offen im Repo. Spec-driven mit testgetriebener Entwicklung (TDD), harten CI-Gates (Lint, Typen, Tests, Coverage, Security-Scan, Architektur-Fitness) und dokumentierten Architektur-Entscheidungen (ADRs). Ein Serving-Layer darf per Test keinen generierenden Pfad enthalten. Vertrauen entsteht durch Nachprüfbarkeit, nicht durch Versprechen.

Verbraucht das nicht viel Strom?

wortlaut trainiert keine großen Modelle im Dauerbetrieb. Der Kern ist Archivierung, Hashing und Retrieval, also Nachschlagen statt Rechen-Marathon. Wo KI eingesetzt wird, geschieht das ressourcenbewusst und, wo möglich, auf souveräner, sparsamer Infrastruktur.

Mitmachen

Eine Truppe, ein Ziel.

wortlaut baut gerade eine kleine, agile Kern-Truppe fürs Fundament. Wir denken nicht in Rollen, sondern in Kompetenzen: jede und jeder bringt die eigenen Stärken ein, so wie es passt. Wenn du dich in einer der Kompetenzen wiederfindest, bist du willkommen.

Data Science & RAG souveräne KI Spracherkennung / Diarization Security & Threat-Model Beweisketten / Provenienz Recht & Datenschutz UX & Design Archivierung & Datenqualität Orga & Koordination

Der Code ist offen auf GitHub. Mitcoden geht jederzeit über Issues und Pull Requests, siehe CONTRIBUTING. Neue Quellen kommen als Ingest-Adapter dazu, der Beweis-Kern bleibt unberührt.

Fair und offen: wortlaut ist ein Herzensprojekt in der Freizeit, kein kommerzielles Produkt. Es gibt (noch) keine Bezahlung. Wer mitmacht, ist aus Überzeugung dabei: für ein belastbares, neutrales Archiv des öffentlichen Wortes.