Beim Kopieren eines Textes aus ChatGPT, einer Website, einem PDF oder einem Textverarbeitungsprogramm können Zeichen übernommen werden, die wie gewöhnliche Leerzeichen oder Trennstellen aussehen. In einem Content-Management-System, Quelltext oder Datenimport können sie trotzdem auffallen: Suchvorgänge greifen nicht wie erwartet, Zeilen brechen ungewöhnlich um oder ein technischer Vergleich meldet Unterschiede, obwohl der Text identisch wirkt.

Solche Zeichen sind kein zuverlässiger Beweis dafür, dass ein Text von einer KI stammt. Für die verbreitete Behauptung, einzelne Leerraumzeichen seien grundsätzlich ein geheimes ChatGPT-Wasserzeichen, gibt es keine belastbare Grundlage. Unicode-Sonderzeichen können aus vielen Quellen kommen – etwa aus typografischer Formatierung, Browsern, PDFs, Übersetzungssoftware, Betriebssystemen oder einem Zwischenschritt beim Kopieren.

Welche unsichtbaren Zeichen kommen häufig vor?

Unicode kennt zahlreiche Zeichen, die keinen sichtbaren Buchstaben darstellen. Nicht alle sind problematisch. Einige erfüllen wichtige typografische oder sprachliche Aufgaben. Bei Webtexten begegnen uns besonders häufig:

Wann werden Sonderzeichen zum Problem?

Im normalen Absatz sind typografische Leerzeichen oft harmlos. Kritisch können sie werden, wenn ein Inhalt technisch weiterverarbeitet wird. Beispiele sind URL-Slugs, Dateinamen, E-Mail-Adressen, CSV-Dateien, Suchfelder, Produktnummern, Code, strukturierte Daten und Vorlagen mit exakten Platzhaltern.

Auch bei SEO sind Sonderzeichen nicht automatisch schädlich. Suchmaschinen können viele Unicode-Zeichen korrekt verarbeiten. Problematisch ist eher eine uneinheitliche Datenbasis: Ein sichtbares Wort kann intern aus anderen Zeichen bestehen und dadurch bei interner Suche, Filtern, Dublettenprüfung oder automatisierter Verarbeitung abweichen.

Unsichtbare Zeichen sichtbar machen

Für eine schnelle Prüfung genügt meist ein Editor, der Leerraum und Steuerzeichen anzeigen kann. Visual Studio Code, Notepad++, Sublime Text und viele Entwicklungsumgebungen besitzen entsprechende Ansichten. Bei sensiblen oder vertraulichen Texten sind lokale Programme gegenüber unbekannten Online-Prüfseiten vorzuziehen.

  1. Text in einen reinen Texteditor kopieren.
  2. Die Anzeige für Leerraum, Steuerzeichen oder unsichtbare Zeichen aktivieren.
  3. Auffällige Stellen prüfen, statt jedes Sonderzeichen automatisch zu löschen.
  4. Die bereinigte Fassung als UTF-8 speichern.
  5. Nach dem Einfügen in das CMS Überschriften, Links und Absätze kontrollieren.

Technische Prüfung mit JavaScript

In der Browserkonsole oder in einem lokalen Skript lassen sich die Unicode-Codepunkte eines Textes anzeigen. Das ist hilfreich, wenn zwei Zeichen optisch gleich wirken:

Beispiel: Mit Array.from(text).map(c => c.codePointAt(0).toString(16)) werden die Codepunkte der enthaltenen Zeichen sichtbar.

Bei produktiven Inhalten sollte ein solches Werkzeug nur lokal und ohne vertrauliche Daten verwendet werden. Für einzelne Such- und Ersetzungsvorgänge können Editoren häufig auch Unicode-Angaben wie \u00A0 oder \u200B verarbeiten.

Sicher bereinigen statt blind löschen

Eine gute Bereinigung ersetzt geschützte Leerzeichen dort durch normale Leerzeichen, wo kein typografischer Grund für sie besteht. Bedingte Trennstriche können in Webtexten meist entfernt werden. Zero-Width-Zeichen sollten dagegen kontextabhängig behandelt werden, weil sie in einigen Sprachen für die korrekte Darstellung erforderlich sind.

Für deutschsprachige Webtexte hat sich folgende Reihenfolge bewährt:

  1. HTML-Tags und Links nicht durch unkontrolliertes Suchen-und-Ersetzen beschädigen.
  2. U+00A0 und U+202F nur an passenden Stellen in normale Leerzeichen umwandeln.
  3. U+00AD entfernen, wenn keine bewusste Silbentrennung gewünscht ist.
  4. U+200B und U+FEFF innerhalb des Inhalts nach Sichtprüfung entfernen.
  5. Mehrfache Leerzeichen reduzieren und Absatzstruktur erhalten.
  6. Das Ergebnis in Vorschau, Quelltext und mobiler Ansicht prüfen.

Kann man an unsichtbaren Zeichen KI-Texte erkennen?

Nein, jedenfalls nicht verlässlich. Ein einzelnes Unicode-Zeichen sagt nichts Sicheres über den Ursprung eines Textes aus. Derselbe Zeichentyp kann aus einer PDF-Datei, einem Office-Dokument, einer Website oder einer automatischen Typografiefunktion stammen. Umgekehrt kann ein KI-Text vollständig aus gewöhnlichen Zeichen bestehen.

Auch allgemeine KI-Erkennung anhand sprachlicher Muster ist fehleranfällig. Für redaktionelle Qualität sind deshalb andere Fragen wichtiger: Sind Aussagen richtig und aktuell? Sind Quellen nachvollziehbar? Passt der Text zur Zielgruppe? Enthält er eigene Erfahrung, konkrete Beispiele und überprüfbare Informationen? Wurde er vor der Veröffentlichung von einem Menschen geprüft?

Prüfung vor der Veröffentlichung

Wer KI-gestützte Texte auf einer Website verwendet, sollte nicht nur Sonderzeichen entfernen. Eine sinnvolle redaktionelle Prüfung umfasst Fakten, Tonalität, Dopplungen, Überschriften, interne Links, Metadaten und strukturierte Daten. Unsichtbare Zeichen sind dabei ein kleiner technischer Teil der Qualitätssicherung – nicht das entscheidende Qualitätsmerkmal.

12cloud prüft Webinhalte deshalb sowohl redaktionell als auch technisch. Ziel ist kein steril bereinigter Text, sondern ein verständlicher, korrekt strukturierter und zuverlässig verarbeitbarer Inhalt.