テキストクリーナー
カテゴリごとのカウンターを使用して、HTML タグ、スマート引用符、奇妙なダッシュ、絵文字、非表示文字をテキストから削除します。ブラウザ内で非公開で実行できます。
結果
Word、Google ドキュメント、PDF、Web サイト、メッセンジャーを通過するテキストは、大きな問題を抱えています。活版印刷の引用符が直線引用符に置き換えられ、ダッシュが長くなり、絵文字が増え、HTML フラグメントがタグ付けされ、目に見えないゼロ幅文字が文字の間に隠れて編集者が表示しないようになります。結果は画面上では問題ないように見えますが、コード、CSV インポート、データベース、差分、または検索クエリに到達して、静かに問題を解決するまでは問題ありません。
このクリーナーは、ブラウザ内ですべてを 1 回のパスで修正します。貼り付けたものは何もアップロードされません。 7 つの独立したチェックボックスは、何が起こるかを正確に制御します。ブラウザの実際のパーサーで HTML タグを削除し (エンティティがデコードされ、スクリプトとスタイルのコンテンツが削除されます)、スマート引用符をストレート引用符に変換し、en および em ダッシュをハイフンに正規化し、フラグやスキントーン シーケンスを含む絵文字を削除し、ゼロ幅スペース、BOM マーク、ソフト ハイフンなどの非表示文字を削除し、乱雑に並んだスペースとタブを折りたたみます。
重要なのは透明性です。各実行後にカテゴリごとのカウンターが実際に削除されたタグ、引用符、ダッシュ、絵文字、または隠し文字の数を報告するため、何が変更されたのかを推測する必要はありません。この攻撃的な非 ASCII フィルタは警告に値し、無効な状態で出荷されます。基本的なラテン語範囲外のすべての文字が削除され、アクセント付き文字や非ラテン語アルファベット全体が破壊されます。純粋な ASCII 出力が本当に必要な場合にのみ有効にします。
このクリーナーは隣接するクリーナーとよく連携しています。幅ゼロの文字が必要な場合は削除する代わりに非表示のテキスト ジェネレーターを使用し、PDF からハードラップされた行だけが問題の場合は専用の改行削除ツールを使用します。コピー&ペーストが必要な他のすべてのものについては、これがワンストップのスクラブです。