HTML-Tags entfernen
Wandelt HTML-Quelltext in lesbaren Text um: Tags, Kommentare, Skripte und Styles verschwinden, Absätze, Listen und <br> werden zu Zeilenumbrüchen, Entities werden dekodiert.
So funktioniert es
- HTML einfügen oder eine .html-, .xml- oder Textdatei laden.
- Bei Bedarf weitere Bereinigungen hinzufügen, z. B. Leerzeichen oder leere Zeilen.
- Den Text kopieren oder als .txt-Datei herunterladen.
Gut geeignet für
- Den Text aus einer HTML-E-Mail, einem Seitenquelltext oder einem CMS-Export holen
- Absätze, Überschriften, Listen und <br> werden zu Zeilenumbrüchen
- Entities wie &, und € werden zu echten Zeichen
- Inhalt von <script> und <style> wird mit den Tags entfernt
Grenzen
- Kein HTML-Sanitizer: Das Ergebnis ist reiner Text, kein sicheres HTML für eine Website – aus < und > werden echte < und >.
- CSS wird nicht angewendet: Per CSS versteckter Text bleibt, Tabellenzellen werden nur durch Leerzeichen getrennt.
- Linkadressen und Alt-Texte von Bildern stehen in Tags und werden daher ebenfalls entfernt.
- Nur gängige benannte Entities werden dekodiert (numerische alle); seltene benannte bleiben unverändert.
Häufige Fragen
Wird das HTML ausgeführt oder geladen?
Nein. Das HTML wird von einem kleinen Tokenizer als Text gelesen; nichts wird dargestellt, ausgeführt oder nachgeladen, auch keine Bilder oder Skripte.
Was passiert mit <script> und <style>?
Sie werden samt Inhalt entfernt, damit kein JavaScript- oder CSS-Code im Text landet.
Bleiben Absätze erhalten?
Ja. Blockelemente wie Absätze, Überschriften, Listenpunkte und Tabellenzeilen sowie <br> und <hr> werden zu Zeilenumbrüchen. Mehrere Leerzeilen in Folge werden zu einer.
Wird mein HTML hochgeladen?
Nein, es wird im Browser verarbeitet. Bis zu 1 MB Text ohne Konto, 2 MB mit kostenlosem Konto und 10 MB mit Pro.