AIが読みやすいWebナレッジ

llms.txt v2:AIがWebサイトの知識を見つけやすくする仕組み

llms.txt v2では、明示的な検出、柔軟なMarkdown URL、パス単位の索引、AI向けWebナレッジを必要に応じて取得する明確な流れが追加されました。

Webサイトからllms.txt v2による検出、選択したソース、SourceShelfパックを経てAIワークフローへ進む5段階の図。
このページの内容

AIで読み取れるウェブサイトの知識は、発見しやすくなっています。

llms.txt提案はバージョン2に達し、AIアシスタントやエージェントがウェブサイトで有用で機械に優しいコンテンツを見つけるのに役立つ新興のコンベンションを更新しました。フォーマットが初めての場合は、llms.txtの紹介から始めてください。

元の提案は、ウェブサイトにサイトに含まれる内容を説明し、AIシステムがその最も有用なリソースに誘導する小さなMarkdownインデックスを与えるというシンプルなアイデアを導入しました。

バージョン2はそのシンプルさを維持していますが、元の提案の最大の実用的な問題の1つに対処しています。

AIエージェントは、llms.txtファイル、またはページのクリーンなMarkdownバージョンが存在することをどのように知るのですか?

答えは、より良い発見です。

SourceShelf1.0.2 はすでに新しい llms.txt v2 ワークフローをサポートしているため、Safariから直接 AI 対応の Web サイト 知識を検索、プレビュー、選択、インポート、整理、保存することが可能です。

llms.txtがバージョン2を必要とした理由

llms.txtが2024年に最初に提案されたとき、ウェブサイトを定期的に読み込むAIエージェントは、ウェブがどこに向かっているかについての期待のほとんどがまだ大きく残っていました。

それはすぐに変わりました。

AIコーディングアシスタントは現在、作業中にドキュメントを参照しています。検索機能付きのアシスタントは、ウェブページを検索して質問に答えます。エージェントは、単にそのサイトを人に表示するのではなく、ウェブサイト内の特定の情報を特定する必要があることがますます多くなっています。

公式llms.txtv2変更ログは、現在何千ものサイトがllms.txtファイルを公開しており、ドキュメントプラットフォームが自動的にそれらを生成し、主要なAIプロバイダーが独自の開発者ドキュメント用に公開していることを指摘しています。

バージョン2は、その採用から学んだことを反映しています。

基本的な形式を再発明したり、バージョン1の動作を停止したりするものではありません。代わりに、llms.txtをより簡単に発見し、エージェントがどのように使用すべきかを明確にします。

1. ウェブサイトは、llms.txtを明示的に宣伝することができます。

v2で最も重要な追加機能は、発見可能性です。

以前は、llms.txtファイルを探すために必要なツールは、通常、次の予測可能な場所を試す必要がありました。

/llms.txt

従来のURLは依然として有用ですが、既知の場所を試すことは、関係性を明示的に宣言しているウェブサイトと同じではありません。

バージョン2では、標準のHTML関係を使用することを推奨しています。

<link rel="describedby" href="/llms.txt">

ウェブサイトはこれを使用して、互換性のあるソフトウェアに伝えることができます。

これは、このページを説明するllms.txtファイルです。

同じ情報は、HTTP Linkヘッダーを介して提供することができ、つまりウェブサイト、ドキュメントシステム、CDN、およびその他のインフラストラクチャは、表示されるページを変更することなく関係を公開できます。

ウェブサイトは、AIツールを使用して特定のファイルをウェブサイトから探す必要ではなく、直接AIで読み取れる知識を宣言できます。

2. ページはクリーンなMarkdownバージョンを宣伝できます

llms.txtはインデックスとして便利ですが、詳細情報は通常、参照するページに保存されています。

問題は、通常のウェブページには、主要なコンテンツよりもはるかに多くのコンテンツが含まれていることです。

ナビゲーション、メニュー、スクリプト、スタイリング、クッキー制御、広告、インタラクティブなコンポーネント、およびその他のインターフェース要素はすべてブラウザでは意味があります。 それらは、基本的な情報を理解しようとするAIシステムにとって、必ずしも最適な表現ではありません。

したがって、バージョン2は別の発見関係を正式に規定します。

<link
  rel="alternate"
  type="text/markdown"
  href="/docs/example.md">

これは、互換性のあるソフトウェアに、このページにMarkdownの表現が利用可能であることを伝えます。

したがって、AIエージェントは通常のウェブページに遭遇しながらも、同じ情報のよりクリーンで簡潔な表現を発見することができます。

これは、抽出量が少なくなり、無関係な素材が少なくなり、出版社がすでに機械に友好的な形式で公開したコンテンツを再構築するために費やされたトークン数が少なくなると意味します。

並べた図では、従来の/llms.txt位置を試すことと、その説明されたインデックスと代替のMarkdown表現を明示的に宣言したページを対比しています。
llms.txt v2では、ページを説明する索引と、利用可能なMarkdown表現の両方をページから明示的に知らせることができます。

3. MarkdownURL はより柔軟です。

元の提案では、.mdを既存のURLに付け加えることで、Markdownバージョンのページを作成することを提案していました。

例えば:

guide.html
guide.html.md

実際には、一部の出版システムは代わりに元の拡張子を置き換えます。

guide.html
guide.md

バージョン2は両方のアプローチを認識します。

これは小さな互換性変更のように見えますが、これは更新された提案の背後にある重要な原則を反映しています。llms.txtは、すべてのサイトを単一のURL構造に強制するのではなく、開発者と出版システムがすでに使用している慣行に適応しています。

4. llms.txtはウェブサイトの一部を説明できます

特に役立つもう一つの明確化はパススコーピングです。

llms.txtファイルは、全体のドメインを記述する必要はありません。たとえば:

/llms.txt
/docs/llms.txt
/api/llms.txt

同じサイトの異なる部分を説明できます。

llms.txtファイルは、その独自のパスの下のページに適用され、複数のインデックスが適用できる場合、最も具体的なインデックスが優先されます。

それは意味します:

/docs/llms.txt

ウェブサイトの残りの部分を表現することなく、ドキュメントセクションを説明できます。

これは大規模な組織、ドキュメントプラットフォーム、ホストされたプロジェクト、大学、ソフトウェア製品、および異なる分野が異なる知識コレクションを含むサイトに役立ちます。

また、発見をより正確なものにします。APIドキュメントを読み込むAIエージェントは、必ずしもマーケティングページ、会社ニュース、キャリアセクション、および同じドメインで公開されている他のすべてのものが必要とは限りません。

範囲限定のllms.txtは、実際に関連する知識に導くことができます。

サイトツリーには、より広範なサイト用のルートllms.txtと、ドキュメントおよびAPIパス内のより具体的なllms.txtファイルが表示されます。
llms.txtファイルはサイトの特定部分を説明できるため、大規模なサイトでも対象を絞ったナレッジコレクションを公開できます。

5. エージェントは必要なものを取得することが期待されます。

バージョン2では、llms.txtに関する重要な誤解も明確にしています。

目標は必ずしもウェブサイト全体を連結してAIモデルにフィードインすることではありません。

代わりに、llms.txtファイルはマップとして機能します。

エージェントは比較的小さなインデックスを読み取り、検索し、現在のタスクに関連しているリソースを特定し、必要に応じてそれらのリソースを検索できます。

概念的には、ワークフローは次のようになります。

Question
   ↓
llms.txt
   ↓
Find relevant sources
   ↓
Retrieve only those sources
   ↓
Use them as context

これは、利用可能なすべてのドキュメントをすべての質問のコンテキストとして扱うよりも、はるかにスケーラブルなモデルです。

それはまた、良い研究が行われている方法に似ています。整理されたコレクションから始め、関連するソースを特定し、その後、それらのソースを詳細に調べます。

6.「オプション」は処理規則ではなく慣習です。

提案の初期のバージョンでは、## オプション セクションが、llms.txt コレクションをモデルコンテキストに拡張する際に特別な役割を果たしていました。

バージョン2では、その機械的な意味が削除されています。

オプションセクションは、より小さなコレクションが望ましい場合、エージェントがスキップする可能性のある二次資料を識別できますが、エージェントはこれを実質的に特別な処理手順として扱う必要はありません。

それはフォーマットをシンプルにします。

インデックスは知識を説明し、整理します。エージェントは、どの知識がタスクに関連しているかを決定します。

llms.txtは、より広範なAIで読み取れるウェブの一部です

これらの変化は、ウェブがより意図的にAIエージェントに適応し始めているにつれて到来しています。

たとえば、Chromeの実験的なエージェント型ブラウジング機能は、現在Lighthouseでllms.txtの発見可能性監査を含んでいます。

llms.txtは普遍的なウェブ標準になるわけではありませんし、それを公開してもすべてのAIシステムがそれを使用することを保証するものではありません。

それは、AIが読み取ることができるコンテンツが興味深い実験を超えていることを示しています。

ウェブサイトの作成者は、情報があの人や検索エンジンにどのように表示されるかだけでなく、ソフトウェアエージェントがどのように確実にそれを発見し理解できるかをますます検討しています。

llms.txtは、その問題に対して意図的にシンプルなアプローチを提供します。

SourceShelf1.0.2はllms.txtv2をサポートします

SourceShelfはllms.txtを表示するファイル以上のものとして扱います。

バージョン1.0.2では、ワークフローをSafariに拡張し、互換性のあるウェブサイトのllms.txtコレクションをローカルリサーチパックの出発点にすることができます。SourceShelfllms.txtガイドは、アプリが保持する完全な発見順序、選択ワークフロー、保護措置、および原産地を記録しています。

SourceShelfが利用可能なコレクションを発見すると、サイトが提供する内容をプレビューし、実際に必要なソースを選択し、その選択をSourceShelfにインポートできます。

Safariは合成研究ウェブサイトを表示し、実際のSourceShelf拡張機能は、インポートするための発見されたllms.txtコレクションをプレビューします。
SourceShelf 1.0.2はSafariからllms.txtコレクションを直接検出し、リサーチパックの出発点にできます。

これは重要な区別です。

ウェブサイトは、llms.txtを介して数十、あるいは最終的には数百のリソースを公開する可能性があります。 あなたの研究プロジェクトには、わずか5つが必要かもしれません。

SourceShelfを使用すると、サイトのインデックスが、コレクション全体が作業コンテキストの一部になることなく、発見を支援できます。

SourceShelfコレクションレビューは、12のリアルなリソースを使用した配送拡張インターフェースを使用し、インポート用に選択されたのは6つだけです。
コレクションをプレビューし、調査に必要なソースだけを読み込みます。

ウェブサイトのコレクションからローカルリサーチパックまで

典型的なワークフローは次のようになります。

  1. Safariでウェブサイトにアクセスしてください。
  2. SourceShelf拡張子を開きます。
  3. サイトの利用可能なllms.txtコレクションを発見してください。
  4. それを明らかにするリソースをプレビューします。
  5. あなたの研究に関連するソースを選択してください。
  6. それらを新しいまたは既存のSourceShelfパックにインポートします。
  7. 結果となったコレクションをローカルでレビューして整理します。
  8. AIワークフローに適した形式を使用して、パックをエクスポートまたは共有します。

インポートされると、これらのソースはもはやブラウザのタブのコレクションに過ぎなくなります。

それらは、ソースの順序、メタデータ、原産地、アーカイブされた資産、およびワークフロー間で研究を移動するために必要なその他の情報を保存できる組織化された研究プロジェクトの一部になります。

実際のSourceShelf三列インターフェイスには、llms.txtリソース、その他のドキュメント、およびウェブサイトからのプローブインプルの完成した合成研究パックが表示されています。
読み込んだWebリソースは、他の調査資料とともにローカルのSourceShelfリサーチパックに加わります。

llms.txtとローカルファーストの研究

情報を発見する研究コレクションを所有するには重要な違いがあります。

llms.txtは最初の問題に役立ちます。

それは出版社に有用な知識を説明する方法を与え、互換性のあるソフトウェアがその知識を見つけるのを助けます。

SourceShelfは二つ目の問題に対処しています。

これにより、どのソースが重要かを選択し、それらを研究パックとして保存し、独自のPDF、ドキュメント、メモ、スキャン、その他の資料と組み合わせ、そのコレクションをどのように使用するかを決定できます。

ウェブサイトは依然として出版社です。

llms.txtファイルはガイドとして残ります。

あなたのSourceShelfパックはあなたの研究コレクションになります。

1つのコレクション、複数のAIワークフロー

llms.txtのインポートは、永遠にllms.txtコレクションである必要はありません。

関連する知識がSourceShelfに整理されると、同じパックは異なるワークフローに参加できます。

あなたはそれをポータブルな研究アーカイブとして保存したり、Markdownを別のアプリケーションにエクスポートしたり、AI指向の参考パッケージを作成したり、SourceShelfのローカル、読み取り専用MCP統合を介して、選択したパックを互換性のあるAIクライアントに公開したりすることができます。

知識の収集AIツールを選択するの間のこの分離は意図的なものです。

有用な研究は、それが収集するのに役立つAI製品に永久に結びつかないようにする必要があります。

Markdown、原産地、ポータブルパッケージ、およびオープンインターフェースは、AIツールが変化しても研究が有用であることを維持する方法を提供します。

llms.txtv2ができないこと

提案が解決しようとしていることとは異なることを理解することも同様に重要です。

llms.txtrobots.txtの代替品ではありません。

それはサイトマップの代替品ではありません。

AIプロバイダーがウェブサイトをインデックスするかどうかは保証されません。

AIシステムに、それ以外の制限されたコンテンツにアクセスする許可を与えることはありません。

そして、Markdownで書かれたからといって、情報が自動的に信頼できるわけではありません。

その目的ははるかに狭くなっています。

AIシステムが有用なウェブサイトの知識をより意図的に発見し、ナビゲートするのを支援します。

そのシンプルさが、フォーマットが興味深い部分の1つです。

大きな意味を持つ小さな変化

llms.txt v2 の最も重要な部分は、個々の構文変更ではないかもしれません。

それは提案の背後にある仮定の変化です。

2024年、AIシステムがより使いやすい形で表示されたウェブサイトを定期的に必要とするかどうかという疑問がありました。

2026年までに、ドキュメントを読み、ウェブサイトを検索し、ソフトウェアを作成し、研究を集め、オンラインソースからの質問に答えるエージェントはすでに当たり前になっています。

問題はますます次のように変わっています。

ウェブサイトはどのようにして自分の知識を自分たちで発見できるようにすべきですか?

バージョン2はバージョン1よりも良い答えを提供します。

小さなMarkdownインデックスは、重要な知識を説明することができます。

標準のウェブ関係により、そのインデックスが発見可能になります。

Clean Markdownは、個々のページの代理店向けのバージョンを提供できます。

パススコーピングは、大規模なサイトを整理するのに役立ちます。

そして、エージェントは手元のタスクに関連する情報のみを検索できます。

SourceShelf1.0.2 を使用すると、同じ構造がプライベートでポータブルな研究ワークフローの始まりにもなり、ウェブから始まり、自分のデバイスで継続できます。

AIで読み取れるウェブはまだ進化しています。

しかし、llms.txt v2 では、検索がはるかに簡単になっています。

SourceShelf

AIが読みやすいWebサイトを持ち運べるリサーチパックへ

SafariでWebサイトのコレクションを見つけ、必要なソースを選び、SourceShelfでローカルに保存できます。

SourceShelfのパックを見る