HTML-Tags entfernen

Wandelt HTML-Quelltext in lesbaren Text um: Tags, Kommentare, Skripte und Styles verschwinden, Absätze, Listen und <br> werden zu Zeilenumbrüchen, Entities werden dekodiert.

So funktioniert es

  1. HTML einfügen oder eine .html-, .xml- oder Textdatei laden.
  2. Bei Bedarf weitere Bereinigungen hinzufügen, z. B. Leerzeichen oder leere Zeilen.
  3. Den Text kopieren oder als .txt-Datei herunterladen.

Gut geeignet für

  • Den Text aus einer HTML-E-Mail, einem Seitenquelltext oder einem CMS-Export holen
  • Absätze, Überschriften, Listen und <br> werden zu Zeilenumbrüchen
  • Entities wie &amp;, &nbsp; und &#8364; werden zu echten Zeichen
  • Inhalt von <script> und <style> wird mit den Tags entfernt

Grenzen

  • Kein HTML-Sanitizer: Das Ergebnis ist reiner Text, kein sicheres HTML für eine Website – aus &lt; und &gt; werden echte < und >.
  • CSS wird nicht angewendet: Per CSS versteckter Text bleibt, Tabellenzellen werden nur durch Leerzeichen getrennt.
  • Linkadressen und Alt-Texte von Bildern stehen in Tags und werden daher ebenfalls entfernt.
  • Nur gängige benannte Entities werden dekodiert (numerische alle); seltene benannte bleiben unverändert.

Häufige Fragen

Wird das HTML ausgeführt oder geladen?

Nein. Das HTML wird von einem kleinen Tokenizer als Text gelesen; nichts wird dargestellt, ausgeführt oder nachgeladen, auch keine Bilder oder Skripte.

Was passiert mit <script> und <style>?

Sie werden samt Inhalt entfernt, damit kein JavaScript- oder CSS-Code im Text landet.

Bleiben Absätze erhalten?

Ja. Blockelemente wie Absätze, Überschriften, Listenpunkte und Tabellenzeilen sowie <br> und <hr> werden zu Zeilenumbrüchen. Mehrere Leerzeilen in Folge werden zu einer.

Wird mein HTML hochgeladen?

Nein, es wird im Browser verarbeitet. Bis zu 1 MB Text ohne Konto, 2 MB mit kostenlosem Konto und 10 MB mit Pro.