Agent Zero

Agent Zero: Open-Source-KI-Framework mit Linux-Desktop

Branko Trebsche 4 Min. Lesezeit Autonomous Agents Docker KI-Agenten Linux Desktop MCP Open Source Plugin Hub
Agent Zero: Open-Source-KI-Framework mit Linux-Desktop
Auf einen Blick

Agent Zero ist ein quelloffenes KI-Agent-Framework, das in einem Docker-Container einen vollständigen Linux-Desktop mit XFCE, einen Browser mit DOM-Annotationen und eine Plugin-Hub mit über 100 Community-Erweiterungen bereitstellt. Der Artikel erklärt die Architektur, die wichtigsten Features und wer von diesem Framework profitiert.

Ein vollständiges Linux-System für KI-Agenten

Die meisten KI-Agenten arbeiten in isolierten Sandboxen ohne echte System-Umgebung. Agent Zero geht einen radikal anderen Weg: Das Framework stellt dem Agenten einen vollständigen Linux-Desktop mit XFCE-Oberfläche zur Verfügung – inklusive Terminal, Dateimanager und LibreOffice. Alles läuft in einem Docker-Container und wird über die rechte Canvas-Seite der Web-Oberfläche gesteuert.

Das bedeutet: Der Agent kann echte Desktop-Software bedienen. Blender für 3D-Modellierung, ein Terminal für Shell-Befehle oder LibreOffice Writer für die gemeinsame Bearbeitung von Dokumenten. Der Nutzer sieht jeden Schritt und kann jederzeit eingreifen, weil Maus und Tastatur denselben Desktop teilen.

Das Framework ist auf GitHub verfügbar, hat über 18.000 Sterne und wird von Jan Tomasek und der Community unter der Agent Zero s.r.o. (Tschechien) entwickelt. Die aktuelle Version 2.0 erschien im Juni 2026.

Architektur: Docker, Prompt-Engineering und Hybrid-Memory

Agent Zero besteht aus vier zentralen technischen Säulen:

Docker-Sandbox mit vollem Betriebssystem. Der Agent läuft in einem Docker-Container, der ein komplettes Linux-System bereitstellt. SearXNG ermöglicht datenschutzfreundliche Websuche, Pakete werden bei Bedarf automatisch installiert. Die A0 CLI Connector-Komponente erlaubt dem Agenten, kontrolliert auf Dateien, Terminal und Browser des Host-Systems zuzugreifen – ohne die Docker-Isolation aufzugeben.

Prompt- und Context-Engineering. Agent Zero definiert sein Verhalten nicht über fest programmierte Logik, sondern über sorgfältig gestaltete System-Prompts und dynamisches Context-Management. Agent Profile ändern den Arbeitsstil des Agenten, Model Presets erlauben das schnelle Umschalten zwischen verschiedenen LLM-Konfigurationen.

Hybrid-Memory-System. Agent Zero nutzt eine hybride Speicherarchitektur auf Basis von FAISS-Vektorsuche. Informationen werden in Hauptspeicher, Konversationsfragmente und bewährte Lösungen eingeteilt. Hinzu kommen ein Knowledge Base-Verzeichnis für Dokumente, plattformübergreifende Skills (SKILL.md-Standard von Anthropic) und eine dynamische Kontextkompression.

Multi-Provider-LLM-Unterstützung. Der Agent kann gleichzeitig mehrere Modelle nutzen: OpenAI, Anthropic, Grok, OpenRouter, GitHub Copilot und lokale Modelle via Ollama. Ein Utility-Modell erledigt schnelle Hilfsaufgaben, während das Chat-Modell für komplexe Reasoning-Aufgaben zuständig ist.

Browser mit DOM-Annotationen und Plugin-Ökosystem

Zwei Features heben Agent Zero von anderen Frameworks ab:

Der eingebaute Browser kann nicht nur Webseiten öffnen und Screenshots machen. Im Annotate-Mode kann der Nutzer jedes Element einer Seite anklicken und direkt Anweisungen geben: "Mach diesen Button blau" wird als JavaScript-Instruktion vom Agenten ausgeführt und verifiziert. Komponenten von anderen Seiten lassen sich markieren und in das eigene Projekt übernehmen. Via Bring Your Own Browser kann der Agent auch Chrome/Edge auf dem Host-System steuern.

Der Plugin Hub enthält über 100 Community-Plugins. Entwicklungs-Frameworks wie die BMAD-Methode (Software-Entwicklungszyklus mit 20 Spezial-Agenten), alternative Memory-Backends, UI-Erweiterungen, Workflow-Plugins und MCP-Server. Plugins werden mit einem Klick aus der Web-Oberfläche installiert.

Use Cases: Vom Coding bis zur Penetration-Testing

Agent Zero deckt ein breites Spektrum an Anwendungen ab:

Software-Entwicklung: Code generieren, debuggen, Tests schreiben, Git-Workflows managen und Deployment-Pipelines aufsetzen. Der Agent arbeitet polyglott in Python, JavaScript, TypeScript, Java, C++ und weiteren Sprachen. Projekte isolieren Workspaces mit eigenem Git-Repository, eigenen Secrets und eigenem Memory.

Penetration-Testing: Die Kali-Linux-Integration ermöglicht automatisierte Netzwerkscans mit Nmap, Schwachstellenanalyse mit OpenVAS, Exploitation mit Metasploit und Reporting. Der Agent orchestriert die Tools in der richtigen Reihenfolge und dokumentiert jeden Schritt.

Datenanalyse und Recherche: Datensätze verarbeiten, Visualisierungen erstellen, statistische Analysen durchführen. Über Sub-Agents können komplexe Aufgaben parallelisiert werden – der Haupt-Agent delegiert, die Sub-Agents arbeiten fokussiert und berichten zurück.

Dokumenten-Coworking: Der Markdown-Editor im Canvas erlaubt echte gleichzeitige Bearbeitung. LibreOffice Writer, Calc und Impress sind voll integriert. Besonders nützlich für Plans, TODOs, RFCs und Meeting-Notes, die als Text-Dokumente leben sollen.

Sicherheitsmodell und Community

Agent Zero ist ein mächtiges Werkzeug, weil es eine echte System-Umgebung nutzt. Daher empfiehlt das Projekt einige Sicherheitsregeln:

  • Den Agenten immer in Docker oder einer isolierten Umgebung betreiben
  • Nicht das gesamte Home-Verzeichnis mounten
  • A0 CLI nur auf vertrauenswürdigen Maschinen mit Read+Write-Zugriff erlauben
  • Credentials in Project Secrets speichern, nicht in Prompts

Die Community ist auf Discord und Skool aktiv, die Entwicklung läuft komplett offen auf GitHub.

Für wen ist Agent Zero geeignet?

Agent Zero richtet sich an drei Gruppen:

Entwickler und DevOps-Ingenieure, die einen Coding-Agenten mit echtem Systemzugriff suchen – für Code-Generierung, Refactoring, Debugging und CI/CD-Automation. Die Möglichkeit, mit MCP und A2A (Agent-to-Agent) externe Tools und andere Agent-Instanzen anzubinden, macht das Framework zur Integrationsplattform.

Sicherheitsforscher und Pentester, die eine KI-gestützte Umgebung mit Kali-Linux-Tools und automatischer Dokumentation nutzen möchten. Agent Zero orchestriert Reconnaissance, Vulnerability Assessment und Exploitation in einem Workflow.

KI-Entwickler und Tüftler, die das Framework an ihre Bedürfnisse anpassen wollen. Der gesamte Code liegt offen, Prompts und Tools sind in prompts/ und tools/ einsehbar und veränderbar. Wer bereits mit Odysseus oder anderen AI-Workspaces gearbeitet hat, findet in Agent Zero eine leistungsfähigere Alternative mit Desktop-Integration.

Wer einen einfachen Coding-Assistenten sucht, ist mit Claude Code oder anderen Terminal-Agenten besser bedient. Agent Zero entfaltet seine Stärke, wenn der Agent echte Desktop-Software, Browser-Automation oder Multi-Tool-Orchestrierung braucht.

Fachbegriffe in diesem Artikel
Agent Profile
Eine vorkonfigurierte Rolle für KI-Agenten, die Tonfall, Arbeitsstil, Prompt-Verhalten und Workflow des gesamten Chats bestimmt. Profile können zwischen verschiedenen Aufgaben gewechselt werden.
Annotate-Mode
Ein Browser-Modus in Agent Zero, bei dem der Nutzer Elemente einer Webseite direkt anklicken kann. Der Agent erhält die DOM-Struktur des markierten Elements und führt Änderungen als JavaScript-Instruktionen aus.
Model Presets
Benannte Verknüpfungen für LLM-Konfigurationen in Agent Zero. Sie erlauben das schnelle Umschalten zwischen verschiedenen Modell-Setups wie günstig, ausgewogen, lokal oder maximal leistungsfähig.
System-Prompt
Die initiale Anweisung an ein LLM, die sein Verhalten, seine Rolle und seine verfügbaren Werkzeuge definiert. Ein guter System-Prompt ist kurz und präzise – viele Coding-Agenten verschwenden tausende Token mit überflüssigen Anweisungen.
Coding-Agent
Ein KI-System, das selbstständig Code schreiben, ausführen, testen und debuggen kann.
Claude Code
Ein Coding-Agent von Anthropic, der direkt im Terminal läuft. Bietet Funktionen wie Editieren, Bash-Zugriff und Sub-Agents. Nutzt ein ausführliches System-Prompt-Template mit über 10.000 Tokens.
Agent Zero
Ein Open-Source-KI-Agent-Framework, das in einem Docker-Container einen vollständigen Linux-Desktop mit XFCE bereitstellt. Der Agent kann Desktop-Software bedienen, Browser-Automation mit DOM-Annotationen durchführen und über 100 Community-Plugins nutzen.
Plugin Hub
Ein in Agent Zero integrierter Katalog mit über 100 Community-Plugins. Plugins umfassen Entwicklungs-Frameworks, Memory-Backends, UI-Erweiterungen und Workflow-Automationen und werden mit einem Klick installiert.
Anthropic
Ein US-amerikanisches KI-Unternehmen, bekannt für die Entwicklung der Claude-Modelle. Anthropic hat das SKILL.md-Format als offenen Standard für Agent-Fähigkeiten veröffentlicht.
Sub-Agent
Ein untergeordneter Agent, der vom Haupt-Agenten für Teilaufgaben gestartet wird. Nachteil: Sub-Agents sind oft Black Boxes, deren vollständige Kommunikation für den Nutzer nicht einsehbar ist.
SKILL.md
Ein offenes Dateiformat von Anthropic zur Beschreibung von Agent-Fähigkeiten. Eine SKILL.md enthält Anweisungen, Kontext und Regeln, die ein KI-Agent bei einer bestimmten Aufgabe befolgen soll.
Canvas
Eine Canvas (englisch für Arbeitsfläche) ist bei Diffusions-Sprachmodellen ein Zwischenspeicher für mehrere Tokens. Das Modell bearbeitet alle Tokens in der Canvas gleichzeitig, statt sie einzeln zu erzeugen.
FAISS
Eine von Meta entwickelte Open-Source-Bibliothek für effiziente Ähnlichkeitssuche in Vektordatenbanken. In KI-Agenten wie Agent Zero wird FAISS für hybride Speichersysteme genutzt, um semantische Erinnerungen schnell abrufen zu können.
A2A
Agent-to-Agent-Protokoll für die direkte Kommunikation und Koordination zwischen mehreren KI-Agenten. In Agent Zero können verschiedene Instanzen über das FastA2A-Protokoll zusammenarbeiten.
AST
Abstract Syntax Tree – eine Baumstruktur, die den syntaktischen Aufbau von Quellcode repräsentiert. Sicherheitswerkzeuge nutzen AST-Analyse, um gefährliche Code-Aufrufe wie exec(), eval() oder subprocess zu erkennen.
MCP
Model Context Protocol – Ein Protokoll zur Anbindung externer Werkzeuge und Dienste an LLM-Agenten. MCP-Server stellen APIs als Tool-Beschreibungen bereit, die der Agent dynamisch nutzen kann. In der Praxis oft überdimensioniert für einfache Anwendungsfälle.
RAG
Retrieval-Augmented Generation – Ein Verfahren, bei dem ein LLM vor der Antwortrelevante Informationen aus einer externen Wissensdatenbank abruft, um seine Antworten zu verbessern.

Häufige Fragen

Was ist Agent Zero?

Agent Zero ist ein Open-Source-KI-Agent-Framework, das in einem Docker-Container einen vollständigen Linux-Desktop bereitstellt. Der Agent kann Desktop-Software bedienen, im Browser arbeiten und über 100 Plugins nutzen.

Was ist der Unterschied zwischen Agent Zero und Odysseus?

Während Odysseus auf lokale Modelle und einen minimalistischen Workspace fokussiert, bietet Agent Zero einen vollständigen XFCE-Linux-Desktop, DOM-Browser-Annotationen und ein umfangreiches Plugin-Ökosystem.

Welche LLMs unterstützt Agent Zero?

Agent Zero unterstützt OpenAI, Anthropic, Groq, OpenRouter, GitHub Copilot und lokale Modelle via Ollama. Es können verschiedene Modelle für Chat und Utility-Aufgaben gleichzeitig konfiguriert werden.

Ist Agent Zero sicher für Penetration-Testing?

Ja, Agent Zero läuft in einem isolierten Docker-Container. Die A0 CLI erlaubt kontrollierten Host-Zugriff. Das Framework integriert Kali-Linux-Tools wie Nmap, Metasploit und OpenVAS.

Kann ich Agent Zero auch offline nutzen?

Ja, über lokale Modelle via Ollama. Agent Zero unterstützt Embedding-, Chat- und Utility-Modelle, die alle lokal laufen können. Voraussetzung ist ausreichend GPU-Speicher auf dem Host-System.