Das Interface gehört niemandem mehr: Warum die Zusammenarbeit von Mensch und Maschine eine dritte Dimension bekommt

Das Interface gehört niemandem mehr: Warum die Zusammenarbeit von Mensch und Maschine eine dritte Dimension bekommt

21. September 2026

Seit es Computer gibt, ist ihre Bedienung im Kern eine Zweierbeziehung. Ein Mensch will etwas, ein System reagiert, und dazwischen liegt eine Oberfläche, die übersetzt. Stapelverarbeitung, Kommandozeile, grafische Oberfläche, Touch: Die Sprache hat sich verändert, die Beziehung nicht.

Auch der Chat mit einer KI ändert daran zunächst wenig. Die Maschine ist gesprächiger geworden, aber wir sitzen noch immer vor einer Oberfläche und formulieren, was wir von ihr wollen.

Ich glaube, dass dieses Modell gerade an eine Grenze kommt.

Die Idee trage ich seit über einem Jahr mit mir herum. Wirklich klar wurde sie mir erst vor Kurzem, als ich gemeinsam mit einem KI-Agenten eine Softwarekomponente entwickelt habe. Dabei fiel mir auf, wie schwer es ist, einen gemeinsamen Fokus zu halten. Man diskutiert eine Implementierung, stößt auf eine grundsätzlichere Frage, verfolgt einen Gedanken, verwirft ihn, kehrt zurück, ähnlich wie in einem Gespräch mit Kollegen.

Nur fehlt etwas Entscheidendes: ein gemeinsamer Arbeitsraum.

Irgendwann sucht man im Chatverlauf, kopiert frühere Entscheidungen zusammen, erklärt Kontext erneut und versucht herauszufinden, an welcher Stelle der gemeinsame Gedankengang eigentlich verloren gegangen ist. Das Problem ist nicht, dass der Agent zu wenig sagen kann. Das Problem ist, dass Chat noch immer eine Oberfläche für zwei ist.

Aus zwei werden drei

Sobald ein Agent selbst handelt, also nicht nur antwortet, sondern Prozessschritte ausführt, Abläufe anstößt und Zustand verändert, ist er ein Akteur im System und kein Teil der Oberfläche mehr.

Aus der Zweierbeziehung wird ein Dreieck:

Dreieck aus Mensch, Agent und System, alle drei Beziehungen innerhalb der Oberfläche

Die Oberfläche steht dann nicht mehr zwischen Mensch und Maschine. Sie wird zu dem Raum, in dem alle drei Beziehungen sichtbar werden. Sie gehört damit keinem der Beteiligten mehr allein. Ich nenne dieses Konzept Intent-UI.

Nicht die Maske ist der Ausgangspunkt, sondern die Absicht

Klassische Software liefert ihre Masken fertig aus. Wer die Telefonnummer einer Person ändern will, öffnet den Personendialog und sieht vielleicht dreißig Felder, obwohl er genau eines davon braucht. Die Oberfläche bildet dabei häufig die Struktur des Systems ab: Es gibt eine Entität, also gibt es einen Dialog für diese Entität. Es gibt dreißig Eigenschaften, also zeigt der Dialog dreißig Felder.

Intent-UI dreht diese Beziehung um.

Ausgangspunkt ist nicht die Datenstruktur, sondern die Absicht, der Intent.

„Ich möchte die Telefonnummer dieser Person ändern“ ist zunächst weder eine Maske noch ein Eingabefeld und auch kein Prozess. Es beschreibt lediglich eine gewünschte Veränderung im System.

Erst aus diesem Intent, dem aktuellen Kontext, den Fähigkeiten des Systems und den geltenden Regeln entsteht die dafür notwendige Interaktion.

Wer nur eine Telefonnummer ändern will, bekommt also ein Feld für die Telefonnummer. Danach verschwindet die Komponente wieder, weil es keinen Grund gibt, sie dauerhaft vorzuhalten.

Das Interface ist in diesem Sinne keine feste Struktur mehr. Es ist eine temporäre Projektion dessen, was in einem bestimmten Moment zwischen den Beteiligten geklärt werden muss.

Die Richtung spielt keine Rolle

Entscheidend ist, dass dieser Mechanismus in beide Richtungen funktioniert. Ein Mensch kann etwas vom System wollen. Aber genauso kann ein laufender Prozess etwas vom Menschen benötigen: eine Entscheidung, eine Freigabe, einen fehlenden Wert oder eine Einschätzung. Heute modellieren wir solche Situationen häufig im Voraus. Wir bauen Masken, Dialoge und Prozessschritte und überlegen dabei bereits, an welcher Stelle ein Mensch welche Eingabe machen muss. In einer Intent-UI kann stattdessen der konkrete Bedarf die Interaktion erzeugen. Der Agent verweist dann nicht auf eine Maske mit dem Hinweis, dort Feld 17 auszufüllen. Er erzeugt genau die Frage oder Komponente, die in diesem Moment notwendig ist. Der Mensch muss dafür nicht eigens in jede mögliche Variante eines Prozesses eingebaut werden. Mensch und Agent werden damit zu zwei möglichen Initiatoren derselben Interaktionslogik.

Fünf Grundsätze

  1. Das Interface ist ein Ereignis, kein Produkt. Es entsteht, wenn ein Akteur etwas braucht, und vergeht danach.
  2. Die Initiative liegt bei beiden. Der Mensch kann etwas vom System wollen, und der Agent kann etwas vom Menschen brauchen. Der Mechanismus ist derselbe.
  3. Ohne gemeinsames Modell gibt es keine Zusammenarbeit. Beide Akteure brauchen ein geteiltes Verständnis davon, welche Dinge existieren, welche Fähigkeiten das System anbietet und was im aktuellen Zusammenhang relevant ist. Dieses Verständnis darf nicht für jeden Einzelfall neu von Hand hergestellt werden. Teile des Systems müssen beschreiben können, was sie anbieten und in welchem Kontext diese Fähigkeiten stehen. Fehlt dieses Modell, rät der Agent, und der Mensch kann nur hoffen, dass er richtig geraten hat. Dieses Modell muss nicht vollständig statisch sein. Ein loser Gedanke kann sich zu einer Struktur verdichten, bis daraus ein nachvollziehbarer Prozess wird.
  4. Für beide gelten dieselben Regeln. Rechte, Grenzen und Nachvollziehbarkeit gelten für Mensch und Agent nach derselben Logik. Ein Agent besitzt die Rechte, die ihm ausdrücklich gegeben wurden, und keine weiteren, nur weil er technisch tiefer im System sitzt.
  5. Aufmerksamkeit ist die knappe Ressource. Das Interface richtet sich nach der Entscheidung, die gerade ansteht, nicht nach der Datenstruktur dahinter.

Dazu kommt eine technische Grenze, ohne die das Konzept nicht funktionieren kann: Der Agent darf die Interaktion gestalten, aber nicht beliebig den Prozess verändern. Diese Unterscheidung ist entscheidend.

Der Agent gestaltet den Zugang, nicht die Wahrheit

Heutige Bedienungslogik ist meist deterministisch angelegt. Sie wird durchdacht, implementiert, getestet und ausgeliefert. Das ist kein Nachteil, sondern eine wichtige Eigenschaft verlässlicher Systeme. Problematisch wird lediglich der Abstand zwischen neuem Wissen und seiner Abbildung in der Oberfläche. Entsteht während des laufenden Betriebs eine neue Situation, ändert sich die Anwendung zunächst nicht. Entwickler müssen davon erfahren, eine Lösung entwerfen und sie mit einem späteren Release ausliefern.

Ein Agent kann diesen Abstand verkürzen. Er kann erkennen, dass in einem bestimmten Zusammenhang eine zusätzliche Information benötigt wird, und eine passende Interaktion dafür erzeugen. Er kann entscheiden, welche Frage gestellt werden muss oder welches der vorhandenen Elemente dafür geeignet ist. Aber er darf deshalb nicht die Steuerung des Prozesses neu erfinden. Was der Agent gestaltet, ist die Eingabe in einen Ablauf, nicht der Ablauf selbst.

Eine Zustandsmaschine, Geschäftsregel oder andere deterministische Prozesssteuerung bleibt davon getrennt. Wer zur Laufzeit unkontrolliert in diese Steuerung eingreift, riskiert Zustände, die niemand vorgesehen hat, mit Konsequenzen, die sich im Vorfeld kaum abschätzen lassen. Die äußere Schicht, die ein Agent verändern darf, ist deshalb die Kommunikation zwischen Mensch und Anwendung. Diese Grenze ist keine technische Fußnote. Sie ist eine Voraussetzung dafür, dass ein Agent überhaupt Zugriff auf ein produktives System bekommen kann.

Vom Intent zur Interaktion

Was bedeutet das konkret?

Nehmen wir das einfache Beispiel von zuvor: Ein Mensch möchte die Telefonnummer einer Person ändern.

In einer klassischen Anwendung ist der Weg dorthin bereits Teil der Oberfläche. Man öffnet die Personensuche, wählt eine Person aus, öffnet deren Stammdaten, findet das entsprechende Feld, ändert den Wert und speichert den Datensatz.

Die Anwendung hat diesen Weg lange vorher festgelegt.

In einer Intent-UI wäre zunächst nur die Absicht bekannt:

Intent
  ChangePhoneNumber(Person)

Das System beschreibt gleichzeitig, welche Fähigkeiten es besitzt:

Capability
  UpdatePersonPhone

Requires
  Person
  PhoneNumber

Permission
  Person.ContactData.Write

Aus dem Intent allein entsteht aber noch keine Oberfläche. Erst zusammen mit dem aktuellen Kontext, den verfügbaren Fähigkeiten und den geltenden Regeln lässt sich bestimmen, welche Interaktion tatsächlich notwendig ist.

Ist die Person bereits bekannt, muss sie nicht erneut ausgewählt werden. Ist die neue Telefonnummer noch unbekannt, fehlt genau diese Information.

Der aktuelle Bedarf reduziert sich damit auf:

Missing
  PhoneNumber

Daraus kann die Interaktionsschicht eine passende Komponente erzeugen:

PhoneNumberInput
ConfirmAction

Der Mensch gibt die Telefonnummer ein und bestätigt die Änderung.

An dieser Stelle endet die Freiheit der Intent-UI.

Die erzeugte Interaktion verändert nicht selbst die Person und erfindet auch keinen neuen Prozess. Sie liefert lediglich die Eingabe für eine bereits vorhandene, deterministische Fähigkeit des Systems:

UpdatePersonPhone(Person, PhoneNumber)

Ob diese Operation zulässig ist, welche Geschäftsregeln gelten, welche Zustandsänderungen daraus entstehen und wie die Änderung protokolliert wird, entscheidet weiterhin das System.

Der Agent hat also nicht entschieden, was UpdatePersonPhone bedeutet.

Er hat lediglich dabei geholfen zu bestimmen, was im aktuellen Moment geklärt werden muss, damit diese Fähigkeit ausgeführt werden kann.

Genau darin liegt die Trennung zwischen generativer Interaktion und deterministischem Prozess.

Vereinfacht entsteht eine Kette:

Intent
   ↓
Kontext
   ↓
Capability
   ↓
fehlende Information oder Entscheidung
   ↓
Interaktion
   ↓
validierte Eingabe
   ↓
deterministischer Prozess

Die Oberfläche ist damit weder Ursprung der Geschäftslogik noch deren Besitzer.

Sie ist die temporäre Projektion eines konkreten Bedarfs.

Das hat noch eine weitere Konsequenz: Für das System ist zunächst unerheblich, ob die fehlende Information von einem Menschen, einem Agenten oder einer anderen Fähigkeit geliefert werden kann. Entscheidend ist, was benötigt wird, wer es liefern darf und unter welchen Regeln es verwendet werden kann.

Damit verschiebt sich ein Teil der Softwarearchitektur.

Wir modellieren nicht mehr jeden möglichen Dialog im Voraus. Wir modellieren die Fähigkeiten des Systems, ihre Voraussetzungen, ihre Regeln und die möglichen Formen der Interaktion.

Die konkrete Oberfläche entsteht erst dort, wo diese Dinge auf eine konkrete Absicht treffen.

Ein gemeinsames Alphabet

Dynamisch bedeutet deshalb nicht beliebig. Eine Intent-UI braucht stabile Grundstrukturen, aus denen die konkrete Interaktion zusammengesetzt werden kann. Man kann sich das wie ein Alphabet vorstellen. Aus wenigen Buchstaben lassen sich unzählige Sätze bilden, ohne dass für jeden neuen Satz neue Buchstaben erfunden werden müssen. Gerade weil die Grundelemente stabil sind, können immer neue Aussagen entstehen und trotzdem verstanden werden. Mensch und Agent brauchen etwas Vergleichbares: eine definierte Menge von Elementen, Fähigkeiten und Methoden, aus denen beide dieselben Dinge ableiten können.

Der Agent generiert dann nicht irgendeine Oberfläche.

Vereinfacht könnte man sagen:

Intent + Kontext + Fähigkeiten + Regeln → Interface

Die konkrete Oberfläche darf vergänglich sein. Das Alphabet, aus dem sie entsteht, darf es nicht sein.

Fehlt dieses gemeinsame Alphabet, führt jede spontane Anpassung zu einer eigenen Sprache. Dann entsteht keine gemeinsame Arbeitsumgebung, sondern eine Folge von Einzellösungen, deren Bedeutung immer wieder neu gelernt werden muss.

Was das für Gestalter und Entwickler bedeutet

Wenn dieses Modell stimmt, verändert sich die Aufgabe von Softwareentwicklung und Interface-Design.

Wir entwerfen dann nicht mehr ausschließlich Bildschirme.

Wir entwerfen die Grundelemente, aus denen Interaktion entstehen kann, die Fähigkeiten, die ein System anbietet, das Modell, das diese Fähigkeiten beschreibt, und die Regeln, unter denen Mensch und Agent sie benutzen dürfen.

Ausgeliefert werden nicht nur Oberflächen, sondern Fähigkeiten, Modelle und Regeln.

Damit beginnt sich auch der Begriff der Anwendung aufzulösen.

Für einen Menschen muss irgendwann kaum noch sichtbar sein, ob eine Information aus einem CRM-System, einer Produktionssteuerung oder einem Dokumentenmanagement stammt. Relevant ist zunächst nur, was er erreichen möchte und welche Fähigkeiten dafür zur Verfügung stehen. Die Grenzen zwischen Anwendungen bleiben technisch bestehen. In der Interaktion verlieren sie jedoch an Bedeutung.

Die unbequeme Seite

Dieses Konzept hat allerdings eine Seite, die wichtiger ist als viele technische Fragen:

Wer die Komponente erzeugt, rahmt die Entscheidung.

Wenn ich nur sehe, was in diesem Moment notwendig erscheint, hat vorher jemand oder etwas entschieden, was notwendig ist.

Auslassen ist die subtilste Form von Einfluss.

Intent-UI braucht deshalb ein Gegenprinzip.

Der Mensch muss jederzeit den größeren Zusammenhang einfordern können. Er muss nachvollziehen können, warum eine Komponente entstanden ist, warum sie genau diese Informationen zeigt und welche Alternativen ausgeblendet wurden.

Das System darf reduzieren.

Der Mensch muss expandieren können.

Ohne dieses Gegenprinzip entmündigt das Konzept den Menschen, statt ihn zu entlasten.

Zwei weitere Risiken kommen hinzu.

Wer nie das Ganze sieht, verlernt das System. Und wenn nichts mehr einen festen Ort besitzt, geht Wiedererkennbarkeit verloren.

Eine dynamische Oberfläche darf deshalb nicht mit einer zufälligen Oberfläche verwechselt werden. Dieselbe Absicht im selben Kontext sollte verlässlich zu derselben oder zumindest einer erkennbar verwandten Form führen.

Das grundlegende Problem lässt sich trotzdem nicht vollständig auflösen.

Wer will, dass Mensch und Agent besser zusammenarbeiten, muss akzeptieren, dass irgendwo eine Auswahl getroffen wird, was im aktuellen Moment relevant ist.

Intent-UI ist deshalb keine endgültige Antwort auf dieses Problem.

Aber das Problem verschwindet auch nicht, wenn wir weiterhin statische Masken bauen. Dort wurde dieselbe Auswahl lediglich Monate oder Jahre vorher von einem Entwickler oder Designer getroffen und anschließend in Software eingefroren.

Nicht aus dem Nichts

Die einzelnen Bausteine dieser Idee haben Vorläufer.

Die Forschung zu Mixed-Initiative Interaction beschrieb bereits in den späten Neunzigerjahren den Wechsel der Initiative zwischen Mensch und Maschine. Arbeiten zu Joint Cognitive Systems betrachten Mensch und Maschine als gemeinsames System. Generative Oberflächen sind heute selbst ein aktives Feld.

Intent-UI beansprucht nicht, diese Ideen erfunden zu haben.

Neu ist aus meiner Sicht ihre Verbindung zu einem gemeinsamen Prinzip: eine Oberfläche, die aus einer konkreten Absicht und einem konkreten Kontext entsteht, ein Agent, der als eigener Akteur auf Prozessebene handeln kann, und ein gemeinsames Modell aus Fähigkeiten, Grundelementen und Regeln, das festlegt, was dabei möglich ist. Wir haben vierzig Jahre lang Oberflächen für Menschen gebaut, die Maschinen bedienen. Die nächsten Jahre werden davon handeln, Räume zu bauen, in denen Menschen und Maschinen gemeinsam mit Systemen arbeiten. Für diese Aufgabe fehlt uns noch ein Vokabular. Intent-UI ist mein Vorschlag für einen dieser Begriffe.