30 Skills, 0 echte Zitat-Messung: Was Claude Code für GEO wirklich kann
Mit Thomas Sander und Gorden Wübbe

30 Claude Code Skills versprechen, GEO messbar zu machen. Aber misst auch nur einer davon, ob ChatGPT oder Perplexity dich wirklich zitieren? Thomas Sander und Gorden Wübbe schauen genau hin. Skills wie geo-citability liefern laut Repo-Beschreibung einen eigenen Citability-Score. Das ist eine Angabe des Erstellers, keine unabhängig validierte Messmethode. Eine neue, noch nicht begutachtete Studie von Bajemon & Rochet (Preprint, September 2026) kommt zudem zu dem Ergebnis, dass die GEO-Taktiken aus dem bekannten 2023-Paper auf modernen Systemen keinen messbaren Zitier-Effekt mehr zeigen. Die Autoren schlagen dafür selbst einen eigenen Score als Ersatz vor.
Quellen dieser Folge
Transkript
THOMAS: Kurzer Hinweis vorab: Die Stimmen in dieser Folge sind KI-generiert. Ich bin die KI-Stimme von Thomas Sander, mein Gesprächspartner ist die KI-Stimme von Gorden Wübbe. Die Inhalte kommen vom geo-tool.com-Team.
THOMAS: Gorden, heute geht es um einen Blogpost, der verspricht: 30 Claude-Code-Skills für SEO und GEO. AEO – also Answer Engine Optimization – lassen wir heute bewusst raus, dazu kommen wir in einer späteren Folge. Die Frage, die ich mir sofort gestellt habe – ist das Substanz oder ist das Marketing?
GORDEN: Beides. Aber in unterschiedlichem Maß, je nachdem, welchen Teil man sich anschaut. Der Artikel listet 30 Skills aus 3 Open-Source-Repos auf GitHub. Die Repos existieren, die Skills lassen sich installieren, die Aufgaben sind real. Soweit solide. Aber sobald es um Messbarkeit geht – konkret um KI-Zitierbarkeit – wird es deutlich dünner.
THOMAS: Und die Zahl 30 selbst – ist die neutral?
GORDEN: Nein. Das ist eine redaktionelle Entscheidung. Die Repos enthalten deutlich mehr als 30 Skills insgesamt. Der Autor hat ausgewählt, was er vorstellt. Das ist legitim, sollte man aber wissen.
THOMAS: Bevor wir die Skills beurteilen – ich würde gerne einen Schritt zurück. Was ist technisch überhaupt ein Skill im Claude-Kontext, und wo kommt GEO als Begriff her?
GORDEN: Fangen wir mit Skills an. Ein Skill ist bei Anthropic ein Ordner. Darin muss eine Datei namens SKILL.md liegen. Diese Datei hat einen YAML-Frontmatter-Block mit Name und Beschreibung. Claude liest diesen Frontmatter beim Start – das sind etwa 100 Token pro Skill. Den Inhalt dahinter lädt Claude erst, wenn ein Request dazu passt. Das nennt sich lazy loading.
THOMAS: Heißt das, ich kann theoretisch unbegrenzt viele Skills installieren?
GORDEN: Richtig, und das ist kein Zufall – Claude lädt den Inhalt eines Skills erst, wenn ein Request dazu passt, nicht alles sofort. Das hält den Kontext schlank. Es gibt aber praktische Grenzen bei der Verwaltung. Skills werden per Slash-Befehl gestartet – der Ordnername wird zum Befehl.
THOMAS: Und GEO?
GORDEN: Der Begriff Generative Engine Optimization stammt aus einem Paper vom November 2023. Erschienen auf arXiv, später auf der KDD 2024 präsentiert. Autoren aus Princeton, dem Allen Institute for AI, Georgia Tech und IIT Delhi. Die Kernfrage des Papers: Wie optimiert man Inhalte nicht für klassische Suchmaschinen, sondern für KI-Systeme, die Antworten generieren?
THOMAS: Und das Paper hatte damals konkrete Ergebnisse.
GORDEN: Ja. Im GEO-Paper von 2023 wurden Schreibtaktiken wie Zitate einbauen, Statistiken nennen und Quellen angeben gemessen – mit messbaren Effekten auf den damaligen Systemen. Schauen wir uns an, was die Repos daraus machen.
THOMAS: Welche Repos sind das konkret, und was versprechen sie?
GORDEN: Es gibt 3 Repos im Artikel. Erstes: AgriciDaniel/claude-seo. Das beschreibt sich selbst als universelles SEO-Skill-Paket. Es enthält laut GitHub-README 26 Sub-Skills und 19 Sub-Agenten – für Technik-Audits, E-E-A-T, Schema-Markup, GEO/AEO, Backlinks, lokales SEO, E-Commerce und internationale SEO. MIT-lizenziert, Installation über den Plugin-Marketplace von Claude Code.
THOMAS: Das klingt nach dem größten Paket.
GORDEN: Der Artikel nennt es auch so. Aber das stimmt nicht. Das zweite Repo, coreyhaines31/marketingskills von Corey Haines, listet nach eigenen Angaben 50 Skills – von CRO über Copywriting bis Analytics. Die Behauptung, claude-seo sei die größte Sammlung, ist eine Einschätzung, keine belegte Tatsache.
THOMAS: Moment mal.
GORDEN: Ja, das ist ein Beispiel für Eigendarstellung, die man nicht ungeprüft übernehmen sollte. Schauen wir uns noch zubair-trabzada/geo-seo-claude an. Das ist das interessanteste für unsere Diskussion heute. Es beschreibt sich als GEO-first SEO-Skill und gibt einen sogenannten Citability-Score aus – eine Zahl zwischen 0 und 100, die messen soll, wie zitierbar ein Inhalt für KI-Systeme ist. Alle drei Repos sind MIT-lizenziert, alle drei existieren auf GitHub, alle drei Funktionsbeschreibungen sind Eigenangaben der Repo-Ersteller.
THOMAS: Das heißt, die Skills selbst hat niemand unabhängig geprüft?
GORDEN: Korrekt. Die Beschreibungen geben wieder, was die Repos selbst behaupten. Und genau beim Citability-Score wird es dann wissenschaftlich heikel.
THOMAS: Was ist an diesem Score problematisch?
GORDEN: Das Problem ist der Unterbau. Zitate einbauen, Statistiken nennen, Quellen angeben – das waren die Interventionen aus dem GEO-Paper von 2023, die damals Wirkung gezeigt haben. Eine neue Studie – ein Preprint, den ich in den Shownotes verlinke – hat diese exakt gleichen Taktiken auf zehn modernen Engine-Familien erneut gemessen, darunter 3 GPT-5.x-Varianten. Ergebnis: kein messbarer Effekt mehr auf die Zitierrate. Die Autoren schlagen darin gleich einen eigenen, robusteren Score als Ersatz vor.
THOMAS: Heißt das, die damaligen Hebel wirken auf modernen Systemen einfach nicht mehr?
GORDEN: So liest die neue Studie es – ja. Die Autoren sagen nicht "widerlegt", sondern: Die Effekte sind auf den getesteten Systemen von null statistisch nicht mehr zu unterscheiden. Für einen Score, der genau auf diesen Taktiken aufgebaut ist, hat das direkte Konsequenzen.
THOMAS: Der Score misst also Signale, die möglicherweise veraltet sind.
GORDEN: Ja, und es kommt noch ein zweites Problem dazu. Eine ebenfalls noch nicht begutachtete Studie von Zhang, He und Yao aus dem April 2026 unterscheidet zwei Ebenen von KI-Zitierungen. Erste Ebene: Wird eine Quelle vom System überhaupt gefunden und in Betracht gezogen? Zweite Ebene: Taucht sie dann tatsächlich im generierten Text auf? Das sind zwei verschiedene Vorgänge. Ein einfacher Citability-Score erfasst nur die erste Ebene. Was auf der zweiten Ebene passiert – ob ein Inhalt wirklich zitiert wird – bleibt außen vor.
THOMAS: Das heißt, selbst wenn der Score korrekt wäre, wäre er unvollständig.
GORDEN: Richtig. Es ist strukturell ein halbes Bild.
THOMAS: Was bedeutet das für die Praxis? Soll man diese Tools gar nicht anfassen?
GORDEN: Nein, das wäre die falsche Schlussfolgerung. Man muss trennen: Was leisten die Skills, unabhängig vom GEO-Messwert? Technische Audits, Schema-Markup, E-E-A-T, internationales SEO – das sind strukturierte Aufgaben. Die lassen sich automatisieren, egal ob der GEO-Score valide ist oder nicht. Ob der Citability-Score belastbar ist, ändert nichts daran, dass ein Schema-Markup-Skill nützlich sein kann.
THOMAS: Ich höre von Geschäftsführern oft: "Ich will eine Zahl im Report, die ich dem Kunden zeigen kann." Was sagst du denen?
GORDEN: Ich sage: Eine Zahl ist kein Argument, wenn ihr Fundament nicht replizierbar ist. Wer den Citability-Score unkritisch als KPI ins Reporting übernimmt, riskiert damit ein Glaubwürdigkeitsproblem. Das ist kein kleiner Vorbehalt.
THOMAS: Was ist dann die ehrliche Alternative?
GORDEN: Skills nach konkretem Aufgabenfit auswählen. Brauche ich schnellere technische Audits? Dann prüfe ich, ob ein Skill das leistet. Brauche ich strukturiertere Schema-Ausgaben? Gleiches Prinzip. Konkret: Probiert es einfach aus – stoppt die Zeit vorher und nachher, unabhängig davon, ob der GEO-Score stimmt. Das ist der Unterschied zu einem Score, der auf nicht replizierbaren Taktiken sitzt. Aber kein Score als Versprechen gegenüber Kunden, solange die Messmethode nicht validiert ist.
THOMAS: Gut. Und dann gibt es noch den Sicherheitsaspekt bei der Installation.
GORDEN: Den darf man nicht übersehen. Das geo-seo-claude-Repo bietet eine One-Command-Installation an – curl, Pipe, bash. Das bedeutet: Ein Skript von einem fremden Server wird direkt ausgeführt. Das ist ein dokumentiertes Supply-Chain-Risiko. Interessanterweise warnt das AgriciDaniel-Repo selbst davor in seiner Installationsdokumentation. Die Empfehlung dort für Windows-Nutzer: git clone, dann das Skript manuell lesen und prüfen.
THOMAS: Das AgriciDaniel-Repo warnt also vor dem Ansatz, den das andere Repo empfiehlt?
GORDEN: Genau – und generell vor dem Prinzip. Wer diesen Schritt überspringt, führt ungeprüften Code aus. Das ist kein theoretisches Risiko.
THOMAS: Zusammenfassung: Welche Schlussfolgerung zieht der Praktiker?
GORDEN: Claude-Code-Skills sind nützliche Werkzeuge zur Workflow-Automatisierung im SEO. Daran zweifle ich nicht. Aber sie sind kein valides Messinstrument für KI-Zitierbarkeit. Der Unterschied ist wichtig. Das eine ist ein Produktivitätshebel. Das andere ist eine Behauptung über Wirkung, die derzeit nicht belegt ist.
THOMAS: Und die 30 Skills aus dem Artikel?
GORDEN: Guter Ausgangspunkt. Aber: Die genannte Skill-Zahl ist eine redaktionelle Entscheidung, keine vollständige Marktübersicht. Die Repo-Angaben sind Eigenangaben, keine unabhängigen Leistungsnachweise. Und wer ein Installationsskript ausführt, sollte es vorher gelesen haben.
THOMAS: Dann ist die Botschaft: Werkzeug ja, Messgläubigkeit nein.
GORDEN: So ist es.
THOMAS: Wer sich die 30 Skills selbst anschauen will, findet den Artikel auf geo-tool.com – dort gibt es auch einen kostenlosen Test.