Wenn ein LLM das „Gehirn“ ist, dann ist ein Agent ein Körper, der Arme (Werkzeuge) und ein Gedächtnis besitzt. Damit das Gehirn diese Arme effizient steuern kann, ohne dass man für jedes neue Werkzeug das gesamte Modell neu trainieren muss, gibt es standardisierte Schnittstellen.
Inhalt
1. Was ist ein MCP-Server?
MCP steht für Model Context Protocol. Man kann es sich als das „USB-Kabel für KI‑Modelle“ vorstellen.
Früher musste man für jede App (z.B. Google Calendar, Slack, GitHub) eine eigene, komplizierte Integration schreiben, damit die KI sie nutzen konnte. MCP standardisiert diesen Zugriff.
Wie funktioniert ein MCP-Server technisch?
Ein MCP-Server ist ein kleiner, separater Dienst, der zwischen dem LLM und den eigentlichen Daten/Werkzeugen sitzt.
Der Ablauf einer Aktion:
- Anfrage: Der Agent (das LLM) entscheidet: „Ich muss eine Datei lesen, um die Antwort zu finden.“
- MCP-Call: Der Agent sendet einen standardisierten Befehl an den MCP-Server:
read_file(path="config.yaml"). - Ausführung: Der MCP-Server (der die eigentlichen Berechtigungen auf dem Computer hat) führt den Befehl aus und liest die Datei.
- Rückgabe: Der Server schickt den Inhalt der Datei als strukturierten Text zurück an das LLM.
- Integration: Das LLM liest diese Information in seinen Kontext ein und generiert die finale Antwort.
Warum ist das so revolutionär?
- Modularität: Man kann einen MCP-Server für „Datenbanken“ schreiben und ihn dann mit jedem beliebigen LLM (GPT-4, Claude, Llama) verbinden, ohne den Code zu ändern.
- Sicherheit: Das LLM hat keinen direkten Zugriff auf deinen PC. Der MCP-Server fungiert als Türsteher, der genau definiert, welche Befehle erlaubt sind (z.B. „Lesen erlaubt, Löschen verboten“).
- Zustandsverwaltung: MCP-Server helfen dabei, den Fortschritt eines Agenten zu speichern, damit er bei einem Absturz nicht wieder bei Schritt 1 anfangen muss.
2. KI-Agenten: OpenClaw vs. Hermes Agent
Während MCP das Protokoll ist, sind Frameworks wie OpenClaw oder der Hermes Agent die eigentlichen „Persönlichkeiten“ oder „Systeme“, die dieses Protokoll nutzen. Sie verfolgen unterschiedliche Philosophien:
A. OpenClaw: Das modulare Framework
OpenClaw ist eher ein Ökosystem oder ein Baukasten. Es ist darauf ausgelegt, extrem flexible, oft parallele Workflows zu steuern.
- Kernidee: „Divide and Conquer“. OpenClaw kann eine große Aufgabe in viele kleine Sub-Aufgaben zerlegen und diese an verschiedene spezialisierte Sub-Agenten verteilen.
- Stärke: Hyper-Automation. Es ist ideal für komplexe Recherchen, bei denen gleichzeitig zehn verschiedene Quellen gescannt und die Daten dann zusammengeführt werden müssen.
- Analogie: Ein Projektleiter mit einem Team von Experten. Er delegiert Aufgaben und führt die Ergebnisse am Ende zusammen.
B. Hermes Agent: Das spezialisierte Präzisionswerkzeug
Der Hermes Agent ist stark auf Effizienz, Sicherheit und deterministische Tool-Nutzung optimiert. Oft basiert er auf einem Modell, das explizit darauf trainiert wurde, Werkzeuge perfekt zu bedienen.
- Kernidee: „Präzision und Verlässlichkeit“. Hermes ist darauf getrimmt, Tool-Aufrufe extrem exakt zu formulieren und Fehlermeldungen von Servern intelligent zu interpretieren, um den Plan sofort anzupassen.
- Stärke: Unternehmensnahe Anwendungen. Wo es darauf ankommt, dass eine API-Anfrage exakt im richtigen Format erfolgt und Sicherheitsrichtlinien strikt eingehalten werden, spielt Hermes seine Stärke aus.
- Analogie: Ein hochspezialisierter Chirurg. Er arbeitet sehr präzise, folgt strikten Protokollen und macht kaum Fehler bei der Bedienung seiner Instrumente.
📊 Vergleich auf einen Blick
| Feature | MCP-Server | OpenClaw | Hermes Agent |
|---|---|---|---|
| Was ist es? | Das Protokoll / Die Schnittstelle | Das Framework | Das spezialisierte Framework |
| Funktion | Verbindet Gehirn ↔ Werkzeug | Plant und delegiert Aufgaben | Führt Tools präzise aus |
| Hauptziel | Standardisierung & Sicherheit | Skalierbarkeit & Automatisierung | Verlässlichkeit & Tool-Expertise |
| Analogie | Das USB-Kabel / Der Treiber | Der Projektleiter | Der Präzisions-Spezialist |
📚 Zusammenfassung
Um einen funktionierenden KI-Agenten zu bauen, benötigt man alle drei Ebenen:
- Ein LLM als Gehirn (für die Logik).
- Ein Framework (wie OpenClaw oder Hermes), um den Denkprozess und die Planung zu steuern.
- Einen MCP-Server, um dem Gehirn einen sicheren und standardisierten Zugriff auf die echte Welt (Dateien, APIs, Web) zu ermöglichen.
Alle Antworten sind von der KI erstellt. Sie wurden von mir nochmal durchgelesen und nach meinem Wissensstand kontrolliert.
Zur Hauptseite: Wie funktionieren eigentlich LLMs?
Vorherige Seite: 🤖 KI-Agenten – Von der Antwort zur Aktion
Nächste Seite: 🛠️ Wie die Steuerung konkret funktioniert (Tool-Calling)
Pingback: 🛠 Wie die Steuerung konkret funktioniert (Tool-Calling) | LierschIT