日本の古書店で売上が5倍に急増。買い手は日本語書籍をトン単位で買い付け、米国のAI学習用スキャン施設へ送っている。1回あたり50トンの発注も出ており、日本語の高品質テキストがLLM学習データとして世界のAI企業に取り合いされる構図が浮かび上がってきた。

何が起きたか

Tom's Hardwareの報道によれば、日本の古書店に対する海外からの大量発注が相次いでいる。1回あたり50トンという単位は、書籍1冊300gと仮定すれば約16.6万冊に相当する。それが「読むため」ではなく「スキャンして破棄する」ための発注である点が、これまでの古書流通と決定的に異なる。送り先は米国のscan-and-shred施設で、そこでOCR処理された日本語テキストがLLMの学習コーパスとして吸い上げられていく。売上5倍という数字は、単なる需要の波ではなく、AI企業が日本語データを「工業原料」として扱い始めた市場転換のシグナルだ。破壊的買付という表現がふさわしい。

なぜこのニュースが重要か

エンジニア視点で見ると、この動きの本質は「Web上の日本語テキストが枯渇し始めている」という一点に集約される。Common CrawlやmC4に含まれる日本語はデータ量こそ多いが、SEOスパム、機械翻訳、テンプレートECの残骸が大半を占め、実質的な高品質トークンは英語に比べて桁違いに少ない。日本語Wikipediaは約140万記事、英語版の4分の1程度だ。一方で書籍は編集を経た文章であり、文法・語彙・専門用語の分布がWebより圧倒的にクリーンだ。GPT-3のトレーニングコーパスでBooks1・Books2がわずか16%の割合ながら品質面で中核を担った事実を踏まえれば、日本語LLMを本気で作るなら「本を食わせる」以外に選択肢がない、という結論はエンジニアリング上ほぼ自明である。5倍の売上は、この帰結が価格シグナルに表れただけの話だ。

技術的な深掘り

問題は、なぜ「スキャン後に破棄」という荒っぽいスキームが米国側で成立しているか、である。答えは著作権法のフェアユース解釈にある。米国では書籍を1部だけ購入・スキャンし、その物理コピーを破棄すれば「複製物の数は増えていない」という論理でリスクを最小化できる(Google Booksの一部訴訟で援用された論法の応用形)。だからこそscan-and-shredというワークフローが工業化しているわけだ。日本の著作権法30条の4はAI学習利用に寛容だと語られがちだが、「享受目的」との線引きが曖昧で、日本国内で同規模の産業化を進めるにはリーガル上の摩擦が大きい。結果として、日本語データが物理的に太平洋を渡り、米国のデータセンターで消化されて、後から日本市場にAPI経由で戻ってくる。データ主権という観点では、これは半導体以上に深刻な構造的従属だ。仕様書レベルで見れば、日本語トークナイザとコーパスの上流を海外に握られることを意味する。

経営者として次に取るべき動き

第一に、社内の紙資産を棚卸すること。議事録、設計図面、保守マニュアル、営業提案書、これらは自社ドメインに特化したファインチューニングの一次原料であり、市場価値ではなく戦略価値で評価すべきだ。第二に、外部委託前にデータガバナンスを設計すること。スキャン業者に丸投げすれば、そのデータが第三者のLLMに混入するリスクがある。契約書に「学習利用禁止」条項と物理的な処理場所の指定を入れる。第三に、RAG基盤への統合を前提にOCR品質を仕様化すること。文字認識率99%未満のデータは検索精度を破壊する。紙をデジタル資産に転換する工程は、もはや総務案件ではなく技術投資である。5倍の売上は他人事ではなく、自社の紙束が同じ値付けをされる日の予告編だ。