先日、運営をしている友人からデータ処理を手伝ってほしいと頼まれました。彼女はウェブページに頭を抱えていると愚痴っていました。事情はこうです。競合サイトの製品紹介や記事をスクレイピングして、自分の資料庫に整理したいと考えていました。最初はAIクローラーを一回走らせれば終わりだと思っていたのですが、出てきたものはとても見られたものではありませんでした——画面中HTMLタグだらけ、改行はめちゃくちゃ、意味不明な記号が文字に混ざっている。彼女はその山を見て、本の箱をミキサーに放り込んだような気分だと言いました。
その気持ちはよくわかります。多くの人はクローラーで取得すれば万事解決だと思っていますが、実は本当の面倒はそこから始まります。ウェブページから引っ張ってきた内容は、本質的には構造化されたコードの塊です。ブラウザはそれを美しいページとしてレンダリングできますが、そのままドキュメントやノートアプリに放り込むと大惨事になります。divタグ、class属性、scriptスクリプト、各種インラインスタイルが本文に混ざり、読むどころか本文がどこにあるか見つけるのも運任せです。
以前はこういう場合、手動でコピー&ペーストするか、大量の正規表現を書いてクリーニングするしかありませんでした。手動は遅すぎるし、正規表現は誤爆しやすい。その後、とても楽な方法を見つけました——HTMLをMarkdownに変換するツールです。これは要するに翻訳機で、ウェブページの複雑なHTML構造を、Markdownという軽量マークアップ言語に変換します。変換後は、見出しは見出し、リストはリスト、リンクはリンク、すっきりきれいになります。
具体的な操作方法は?実は簡単です。まずAIクローラーが取得したHTMLコンテンツをファイルに保存するか、変換ツールに直接貼り付けます。ワンクリック変換で、余分なタグを自動的に除去し、核心的なテキスト構造と書式を保持します。例えば、元々ネストしたdivの中に包まれた文章は、変換後にはきれいな段落になります。ulとliで作られたリストは、変換後にはMarkdownのハイフンリストになります。太字のテキストは、変換後には2つのアスタリスクで挟まれます。
友人は試した後、あの文字化けの山にシャワーを浴びせたような感じだと言いました。元々頭痛の種だった内容が、今では直接NotionやObsidianに入れて使えます。彼女はもう一つの利点も発見しました。Markdown形式は二次加工に非常に適しているのです。見出しレベルを変えたり、段落の順序を調整したり、一部の内容を抽出したりするのは、HTMLで操作するよりずっと簡単です。
ただし一点注意が必要です。すべてのHTMLからMarkdownへの変換ツールが信頼できるわけではありません。あるツールは変換後に書式が失われ、あるツールは表がめちゃくちゃになり、あるツールは中国語のサポートが悪く文字化けが発生します。自分でいくつか試しましたが、最終的にはオープンソースのツールに落ち着きました。変換精度が高く、バッチ処理もサポートしています。クローラーで取得した内容を頻繁に処理するなら、いくつか試して一番使いやすいものを見つけることをお勧めします。
もう一つの小さなコツは、変換前にHTML内のscriptとstyleタグを削除しておくことです。これらは変換ツールでは処理できず、残しておくと変換の負担が増え、時には変換エラーの原因にもなります。多くのツールにはフィルタ機能が備わっていますが、手動で確認した方が安全です。
結局のところ、AIクローラーは良いツールで、大量のコンテンツを迅速に取得できます。しかし取得は第一歩に過ぎず、クリーニングと整理こそがデータを本当に有用にする工程です。HTMLをMarkdownに変換する操作は、小さなテクニックに見えますが、実際には大量の時間と労力を節約できます。次にクローラーで取得した内容がめちゃくちゃな状況に遭遇したら、すぐに手を動かして削除せず、この方法を試してみてください。物事は想像よりもずっと簡単だとわかるでしょう。