KI-gesteuerte Webautomatisierung

Ein KI-Agent, der das Web bedient wie ein Mensch.

Viele Unternehmen nutzen Software, die keinerlei Schnittstelle nach außen hat — kein API, kein Export, nur eine Weboberfläche. Klassische Automatisierungswerkzeuge funktionieren trotzdem, solange sich nichts am Layout ändert. Tut es das doch, brechen sie.

Dieser Agent löst das anders: Er macht einen Screenshot, versteht mithilfe von KI-Bildanalyse, was er sieht, und entscheidet selbst, worauf er klickt — genauso wie ein Mensch es täte. Spalten können umsortiert, Beschriftungen umbenannt, das ganze Design ausgetauscht werden. Der Agent findet sein Ziel trotzdem.

Das Ergebnis: Datentransfers zwischen Systemen, die keine gemeinsame Sprache sprechen — vollautomatisch, mit menschlicher Kontrolle wo nötig.

Live-Demo starten

Der Robustheitsbeweis

Gleiche Aufgabe, komplett anderes Layout — kein Code wurde angepasst.

Vor Layout-Änderung
Starte einen Lauf, damit hier ein Screenshot erscheint
Nach Layout-Änderung
Starte einen zweiten Lauf nach dem Klick auf "Layout ändern"

Die Screenshots werden automatisch aus den letzten abgeschlossenen Läufen geladen. Starte zwei Läufe — einmal mit und einmal ohne Layout-Änderung — um den Beweis zu sehen.

Wie es funktioniert

Eine kontinuierliche Schleife aus vier Schritten.

👁
Wahrnehmen

Screenshot + Accessibility-Tree der aktuellen Seite

🧠
Denken

KI-Modell analysiert Screenshot und plant nächste Aktion

🖱
Handeln

Playwright führt Klick, Texteingabe oder Scroll aus

Verifizieren

Neuer Screenshot prüft ob Aktion das Ziel erreicht hat

Technologie-Stack

🎭
Playwright (Chromium)
Steuert den Browser headless — klickt, tippt, scrollt ohne feste Koordinaten
🤖
Anthropic Claude Vision
Versteht Screenshots semantisch und entscheidet, was als Nächstes zu tun ist
FastAPI + WebSocket
Backend-API und Live-Push jedes AgentenSchritts ans Dashboard
🗄
SQLAlchemy + SQLite
Persistiert alle Läufe und Schritte mit Screenshot-Pfaden
🔒
Sicherheitsgrenzen
Sperrliste, Domain-Allowlist, Konfidenz-Schwelle, Freigabe-Modus
🐍
Python 3.13
Async-First — Agent-Schleife und WebSocket laufen nebenläufig

Eingebaute Sicherheitsgrenzen

Der Agent handelt nie unkontrolliert. Mehrere Schutzschichten verhindern unerwünschte Aktionen.

🚫
Sperrliste
Aktionen auf Elementen mit Woertern wie 'loeschen' oder 'bezahlen' erfordern menschliche Freigabe
🌐
Domain-Allowlist
Der Agent darf nur auf vorab erlaubten Domains operieren — konfigurierbar
📊
Konfidenz-Schwelle
Ist die KI unsicher (unter 60 %), pausiert der Agent und wartet auf Bestätigung
👤
Freigabe-Modus
Jede Aktion erscheint im Dashboard zur manuellen Genehmigung, bevor sie ausgeführt wird
🔢
Schritt-Limit
Maximal 40 Schritte pro Lauf — danach automatischer Abbruch
🔄
Fehlerwiederholung
Maximal 3 Fehlversuche pro Aktion, dann Abbruch mit Fehlermeldung

Selbst ausprobieren

Starte die Demo, beobachte den Agenten live beim Denken — und klicke dann auf "Layout ändern", um den Robustheitsbeweis selbst zu erleben.

Live-Demo starten

Kontakt

Interesse an einem Gespräch? Erreichbar über:

[Hier deine Kontaktdaten/LinkedIn/E-Mail einfügen]