Wer heute ein Buch, ein Paper oder eine Reportage mit Unterstützung eines Sprachmodells schreibt, kommt früher oder später an einer unbequemen Frage nicht vorbei: Wer hat diesen Satz eigentlich geschrieben? Die Frage klingt vernünftig. Sie führt nur leider in die falsche Richtung. Ein Absatz entsteht heute in mehreren Durchgängen, halb diktiert, halb vorgeschlagen, dreimal umgestellt, eine Koproduktion, bei der am Ende niemand mehr sagen kann, wer den Beifall verdient und wer die Quittung bekommt. Die Urheberschaft einzelner Wörter lässt sich da kaum noch rekonstruieren. Die Frage, die sich dagegen beantworten lässt, lautet: Wer steht für diesen Satz ein?
Dieser Text beschreibt, wie sich ein Framework zur Verteilung von Entscheidungsbefugnis zwischen Mensch und KI auf das Schreiben selbst übertragen lässt. Herausgekommen ist eine App, die hier verlinkt ist: die Schreibwerkstatt.
Leistungsfähigkeit ist nicht Legitimität
Das Adaptive Complementarity Framework (ACF) wurde für Organisationen entwickelt, die entscheiden müssen, welche Entscheidungen ein KI-System eigenständig treffen darf, welche es vorbereiten soll und welche besser beim Menschen bleiben (Russmann 2026). Sein Ausgangspunkt ist eine ebenso einfache wie gern übersehene Beobachtung: Dass ein System eine Aufgabe gut erledigt, beantwortet noch lange nicht, ob es sie erledigen soll. Leistungsfähigkeit und Legitimität sind verschiedene Größen. Wer beide verwechselt, automatisiert mit beeindruckender Konsequenz genau die Entscheidungen, für die später niemand mehr einstehen kann.
Beim Schreiben ist das nicht anders. Ein Sprachmodell formuliert eine Überleitung oft eleganter als der erschöpfte Autor um Mitternacht. Es liefert mit derselben Eleganz auch eine Seitenangabe, die plausibel aussieht und schlicht nicht existiert. Beide Leistungen fühlen sich verblüffend gleich an und verlangen völlig unterschiedliche Zuständigkeiten.
Ein Text ist eine Folge von Entscheidungen
Der erste Schritt besteht darin, nicht mehr „das Buch“ oder „den Artikel“ als untrennbare Einheit zu betrachten. Ein Kapitel zerfällt bei näherem Hinsehen in Entscheidungen sehr verschiedener Art:
- die Kernthese und ihre Stellung im Gesamtbogen,
- ein wörtliches Zitat mit Seitenangabe,
- eine Interpretation, etwa von Kants Unterscheidung zwischen bestimmender und reflektierender Urteilskraft,
- eine Überleitung zwischen zwei Abschnitten,
- die LaTeX-Auszeichnung einer Formel.
Diese Entscheidungen haben unterschiedliche Eigenschaften, und genau diese Eigenschaften erfasst das ACF über fünf Dimensionen.
Fünf Dimensionen, übersetzt auf das Schreiben
Die ersten beiden Dimensionen gehen auf Kant zurück. Die bestimmende Urteilskraft ordnet Einzelnes einem gegebenen Allgemeinen unter; die reflektierende sucht erst das Allgemeine, das zum Einzelnen passt (vgl. Kant 2000: 179–181). Daraus folgen Unsicherheit und Neuheit als Signale dafür, dass bloße Regelanwendung nicht mehr genügt.
Unsicherheit (U) fragt, ob eine Aussage durch verfügbare Quellen gedeckt ist. Seitenangaben, Erscheinungsjahre und Zuschreibungen haben strukturell hohe Unsicherheit, weil ein Modell sie flüssig und mit Überzeugung erzeugen kann, ohne dass sie stimmen. Flüssigkeit ist hier, anders als in diesem Text, kein Gütesiegel.
Neuheit (N) misst den Abstand zum bereits Etablierten. Ein Absatz, der eine bestehende Definition für ein neues Publikum umformuliert, hat geringe Neuheit. Ein Absatz, der einen neuen Begriff einführt, hat hohe.
Wertkonflikt (W) betrifft Interpretation, Positionierung und Aussagen über reale Personen. Hier ist nicht die Lösung unklar, sondern das Ziel selbst umstritten. Eine solche Stelle braucht einen Entscheidungspunkt, an dem jemand Rechenschaft ablegen kann, eine Adresse also, keinen Posteingang ohne Absender.
Präzision (ϖ) beschreibt, wie verlässlich die KI für genau diese Art von Aufgabe ist, nicht, wie leistungsfähig sie im Allgemeinen zu sein behauptet. Der Begriff stammt aus der präzisionsgewichteten Inferenz des Free Energy Principle, in der Signale nach ihrer erwarteten Verlässlichkeit gewichtet werden (vgl. Friston 2010: 127–138; Clark 2013: 181–204). Für LaTeX-Markup ist die Präzision hoch, für bibliographische Details ernüchternd niedrig.
Vorhersagefehler (ε) zeigt sich erst im Nachhinein: als Anteil der KI-Entwürfe, die der Autor substanziell überarbeiten oder verwerfen musste. Diese Dimension steuert nicht die einzelne Passage, sondern die Kalibrierung ganzer Aufgabenkategorien.
Gates, die nichts ausgleichen
Der wichtigste Baustein des Frameworks ist erfreulich unscheinbar. Bevor irgendeine Abwägung stattfindet, prüfen nicht-kompensatorische Gates, ob eine Entscheidung überhaupt für die KI infrage kommt (Russmann 2026). Hohe Präzision kann einen hohen Wertkonflikt nicht ausgleichen. Ein brillanter Entwurf macht eine ungeprüfte Seitenangabe nicht zuverlässiger, er macht sie nur schöner.
Für das Schreiben ergibt sich daraus eine kurze Liste von Kategorien, die immer beim Autor bleiben:
- Zitate, Seitenangaben und bibliographische Angaben,
- Zahlen, Daten und empirische Aussagen,
- Aussagen über reale Personen,
- die Kernthese und zentrale Interpretationen,
- die Entscheidung über die Veröffentlichung.
Jede Textsorte ergänzt eigene Kategorien. Bei einer Reportage gehören jede Tatsachenbehauptung und jedes wörtliche Zitat eines Gesprächspartners dazu. Bei einer Monographie sind es Axiome, Beweise und Notationsentscheidungen.
Drei Modi und eine asymmetrische Regel
Jeder Arbeitsschritt erhält einen von drei Modi:
- AI-led: Formatierung, Stilprüfung, der Abgleich von Zitaten im Text mit dem Literaturverzeichnis.
- Hybrid: Erstentwürfe aus eigenem Material, Übersetzungen, Überleitungen. Die KI liefert, der Autor überarbeitet aktiv.
- Human-led: Thesen, Interpretationen, Zitatprüfung, Veröffentlichung.
Interessanter als die Zuordnung selbst ist die Regel, nach der sie sich ändern darf. Einen Schritt strenger zu stellen, also mehr menschliche Beteiligung zu verlangen, ist jederzeit möglich. Nötig ist nur eine kurze Begründung, die zugleich das Lernsignal für die Kalibrierung liefert.
Eine Lockerung dagegen ist keine spontane Entscheidung am einzelnen Schritt, so verlockend das um Mitternacht auch sein mag. Sie ist eine Änderung der Policy, mit Begründung und neuer Versionsnummer. Schritte hinter einem Gate lassen sich überhaupt nicht lockern.
Diese Asymmetrie hat einen philosophischen Grund. Heinz von Foerster formulierte als ethischen Imperativ, so zu handeln, dass die Zahl der Wahlmöglichkeiten wächst (vgl. von Foerster 1993: 133–134). Übertragen auf Werkzeuge heißt das: Die Option, eine Entscheidung zurückzuholen, darf nie hinter einem Verfahren verschwinden. Die Option, sie abzugeben, darf es sehr wohl.
Das Protokoll aller Entscheidungen ist dabei mehr als Buchhaltung. Luhmann hat gezeigt, dass Legitimität in komplexen Systemen weniger aus der Einsicht in jede einzelne Operation entsteht als aus verlässlichen, nachvollziehbaren Verfahren (vgl. Luhmann 1969: 26–29). Das Innere eines Sprachmodells bleibt undurchsichtig, darauf darf man sich verlassen. Das Verfahren, in dem es eingesetzt wird, muss es nicht sein. Kontrollierte Intransparenz nannte Luhmann diese Konstellation: Die interne Arbeitsweise bleibt verborgen, das nach außen relevante Verhalten wird festgelegt und überprüfbar (vgl. Luhmann 2017: 186–187).
Das ACF fasst diese Anforderungen in drei Eigenschaften zusammen, die jede Umsetzung erfüllen muss (Russmann 2026):
- Traceability: Jede Entscheidung ist nachvollziehbar.
- Contestability: Jede Zuweisung lässt sich anfechten.
- Governance Closure: Regeln ändern sich nur durch explizite, protokollierte Änderung.
Der Karteikasten
Umberto Eco hat in seiner Anleitung zum wissenschaftlichen Arbeiten ein System von Karteikarten beschrieben, das Lektüre, Zitate und eigene Gedanken voneinander trennt (Eco 1977). Die Schreibwerkstatt übernimmt diese Idee und ergänzt sie um das, was die Zusammenarbeit mit KI verlangt: einen Status.
Es gibt bibliographische Karten, Lektüre-, Zitat- und Faktenkarten, Themen-, Personen-, Verbindungs- und Arbeitskarten. Zwei Markierungen sind entscheidend:
- Bibliographische, Zitat- und Faktenkarten gelten als ungeprüft, bis der Autor sie am Original bestätigt.
- Was aus einem Gespräch mit der KI in den Kasten wandert, bleibt als KI-Vorschlag markiert, bis der Autor es inhaltlich übernimmt.
Die Herkunft eines Gedankens geht dadurch nicht verloren, auch nicht nach Monaten, in denen man sich geschworen hätte, man merke sich das schon.
Das Werk als Text-Adventure
Die ungewöhnlichste Komponente ist ein Text-Adventure. Jedes Kapitel, jede Szene oder jeder Denkschritt wird zu einem Raum, und die Reihenfolge der Räume ist die Leserichtung. Motive, Begriffe und Fakten sind Gegenstände. Ein Leser besitzt einen Gegenstand erst, wenn er den Raum betreten hat, in dem dieser eingeführt wird.
Wer das Werk mit Befehlen wie weiter, gehe 5 oder inventar durchläuft, bekommt Meldungen wie diese: Blockiert: Der Begriff „Adresse der Verantwortung“ ist dem Leser noch unbekannt, eingeführt wird er in Kapitel 2. Eine Figur, die in Kapitel 3 spricht, aber erst in Kapitel 5 vorgestellt wird, fällt sofort auf. Ebenso ein Motiv, das eingeführt und nie wieder aufgegriffen wird, oder ein Fakt in einer Reportage, der sich auf keine geprüfte Karte stützt.
Die Metapher ist mehr als Spielerei. Auch hier steckt Kants Unterscheidung dahinter: Ein Begriff lässt sich nur anwenden, wenn er verfügbar ist. Was ein Leser noch nicht hat, kann er nicht unterordnen.
Diese Prüfung arbeitet regelbasiert und ist deshalb AI-led. Ergänzend kann ein KI-Leser dieselbe Welt durchspielen und strukturelle Beobachtungen melden, etwa Kapitel ohne erkennbare Funktion oder Thesen, die nicht aufeinander aufbauen. Das ist Hybrid: Die Bewertung dieser Beobachtungen bleibt beim Autor.
Die KI als Diskussionspartner
Im Diskussionsbereich tritt die KI in festen Rollen auf: als Sokratischer Frager, Advocatus Diaboli, strenger Gutachter, Erstleser, Lektorat oder als Prüfliste, die jede belegbedürftige Behauptung markiert. Alle Rollen folgen denselben Werkstattregeln:
- keine erfundenen Quellen, Zitate, Zahlen oder Aussagen realer Personen,
- Vermutungen werden als Vermutungen gekennzeichnet,
- keine Entscheidung an Stelle des Autors.
Warum Diskussionspartner und nicht Mitautor? Die Stelle, an die sich Rückfragen zu einem Text richten, verlangt mehr als Formulierungskraft. Wer sie besetzt, muss befragt werden können. Er muss einen Maßstab revidieren und sich zu eigen machen können. Und er muss einen Verlust tragen, wenn der Text nicht hält. Keine Steigerung der Leistungsfähigkeit erfüllt diese Bedingungen von selbst, so beeindruckend die Modellkarten sich auch lesen.
Das Werkzeug behauptet nicht, nur ein Mensch könne diese Stelle einnehmen. Es sorgt dafür, dass sie besetzt ist und dass sichtbar bleibt, von wem.
Das eigentliche Risiko: Passivity Drift
Die größte Gefahr beim Schreiben mit KI ist nicht der offensichtliche Fehler. Es ist die schleichende Gewöhnung. Die Forschung zu Automation Bias und Complacency beschreibt, wie Menschen automatisierten Empfehlungen zunehmend folgen und ihre eigene Prüfung zurückfahren (vgl. Parasuraman/Manzey 2010: 381–410; Skitka/Mosier/Burdick 1999: 991–1006). Parasuraman und Riley unterschieden dabei früh zwischen Fehlgebrauch und Nichtgebrauch von Automation (vgl. Parasuraman/Riley 1997: 230–253). Beim Schreiben zeigt sich Fehlgebrauch als Überarbeitung, die unmerklich zum Abnicken wird, der Klassiker unter den Karrierewegen eines kritischen Lesers.
Die Schreibwerkstatt begegnet dem mit drei konstruktiven Entscheidungen:
- Nichts ist vorausgewählt. Wenn die KI aus einem Entwurf eine Werkstruktur vorschlägt, ist kein einziger Vorschlag angehakt. Übernahme ist eine Handlung, kein Unterlassen.
- Drift-Schutz im Buchprozess. Pro Kapitel wird mindestens ein Abschnitt zuerst selbst skizziert, bevor ein KI-Entwurf gelesen wird.
- Sinkende Überarbeitungsraten sind ein Warnsignal. Ein Rückgang kann heißen, dass die KI besser geworden ist. Er kann ebenso heißen, dass die Aufmerksamkeit nachgelassen hat. Das Log macht diese Mehrdeutigkeit sichtbar, statt sie als Erfolg zu verbuchen.
Ein Vorschlag
Die Schreibwerkstatt ist ein Vorschlag, und so arbeitet Wissenschaft. Eine Designtheorie wird als konkretes Artefakt ausformuliert, damit andere sie benutzen, prüfen und weiterentwickeln können. Die Design Science Research beschreibt diesen Weg als Zusammenspiel von Bauen und Evaluieren (vgl. Hevner et al. 2004: 75–105). Eine funktionsfähige Instanz macht eine Designtheorie greifbar und gehört als expositorische Instanziierung zu ihren Bestandteilen (vgl. Gregor/Jones 2007: 322–335).
Die Moduszuordnungen sind eine Startkonfiguration, die sich über das Log kalibrieren lässt. Jede Textsorte, jedes Gate und jede Diskussionsrolle ist als Daten definiert und lässt sich verändern und erweitern. Wer die App für ein eigenes Projekt verwendet, erzeugt genau die Erfahrung, an der sich der Vorschlag messen lassen muss.
Die App ist hier verlinkt: Zur Schreibwerkstatt
Die Frage, wer einen Satz geschrieben hat, wird mit jeder Modellgeneration schwerer zu beantworten sein. Die Frage, wer für ihn einsteht, lässt sich organisieren. Man muss es nur wollen.
Literatur
Clark, A. (2013): „Whatever Next? Predictive Brains, Situated Agents, and the Future of Cognitive Science“, Behavioral and Brain Sciences, 36(3), 181–204. https://doi.org/10.1017/S0140525X12000477
Eco, U. (1977): Come si fa una tesi di laurea. Milano: Bompiani.
Friston, K. (2010): „The Free-Energy Principle: A Unified Brain Theory?“, Nature Reviews Neuroscience, 11(2), 127–138. https://doi.org/10.1038/nrn2787
Gregor, S./Jones, D. (2007): „The Anatomy of a Design Theory“, Journal of the Association for Information Systems, 8(5), 312–335. https://doi.org/10.17705/1jais.00129
Hevner, A. R./March, S. T./Park, J./Ram, S. (2004): „Design Science in Information Systems Research“, MIS Quarterly, 28(1), 75–105. https://doi.org/10.2307/25148625
Kant, I. (2000): Critique of the Power of Judgment. Hrsg. von P. Guyer, übers. von P. Guyer und E. Matthews. Originalausgabe 1790. Cambridge: Cambridge University Press.
Luhmann, N. (1969): Legitimation durch Verfahren. Neuwied: Luchterhand.
Luhmann, N. (2017): Die Kontrolle von Intransparenz. Berlin: Suhrkamp.
Parasuraman, R./Manzey, D. H. (2010): „Complacency and Bias in Human Use of Automation: An Attentional Integration“, Human Factors, 52(3), 381–410. https://doi.org/10.1177/0018720810376055
Parasuraman, R./Riley, V. (1997): „Humans and Automation: Use, Misuse, Disuse, Abuse“, Human Factors, 39(2), 230–253. https://doi.org/10.1518/001872097778543886
Russmann, M. (2026): The Address of Responsibility: A Design Theory for Allocating Decision Authority in Human-AI Systems. Version 1. Zenodo. https://doi.org/10.5281/zenodo.21043361
Skitka, L. J./Mosier, K. L./Burdick, M. D. (1999): „Does Automation Bias Decision-Making?“, International Journal of Human-Computer Studies, 51(5), 991–1006. https://doi.org/10.1006/ijhc.1999.0252
von Foerster, H. (1993): KybernEthik. Berlin: Merve.