ふたつめにAI開発企業にとってAIの学習データが枯渇し始めたという問題があります。すでにインターネット上にあるデータについては、グーグルなどのハイパースケーラーが開発するAIは学習を完了しているのです。

 そこで目をつけられたのがまだインターネットができる以前に出版された書籍データです。日本でいえば昭和の時代に刊行された膨大な書籍群があって、現在では電子書籍化されることもなく絶版になっています。

 実はグーグルやアマゾンはAI学習が始まるよりも以前から、古書データの電子化に取り組んでいます。グーグルの場合は世界各地の図書館と提携して裁断しない方法で数千万冊の書籍データを電子化しています。

「でも昭和の時代の専門書に書かれていることは、現在では学説がアップデートされているから時代遅れなんじゃないの?」と思われるかもしれません。それがそうでもないのです。

 たとえば1980年頃に大学教授によって書かれた「江戸時代の社会構造」の本があったとします。その内容は、その後の研究で一部否定されていることはあるかもしれません。しかし1980年代にどう歴史認識がされていたのかという知識であるうえに、2026年のデータと比較学習することで、歴史研究がどう進歩したのかもAIは学習できます。

 歴史、科学、医学などさまざまな分野の昭和の専門書を学習していくことでAIの知識は2026年だけでなく、1960年代→1980年代→2000年代→2020年代と積みあがりながら現在の定説がどう形成されたのかを理解できるようになります。

 それに加えて特に専門書の場合は、そこで扱われている内容がそもそもネットにはないものも多いのです。たとえば幕末に活躍した人物というと、日本人の知識が圧倒的に多いのが坂本龍馬ですが、なぜかというと1962年に連載が始まった司馬遼太郎の『竜馬がゆく』という小説のおかげです。

 この小説がなければ、竜馬についての知識は専門書に小さく書かれた情報だけだったかもしれません。そういった有名ではない無数の志士や幕臣たちの歴史が、古い専門書に詳しく書かれているケースは多いのです。

 さらに古書は長文で詳しいという利点があります。今のようにパソコンで大量の文章を入力保存できる時代とは違い、専門家が書籍を著すのは数年かけて取り組む人生の大プロジェクトでした。専門家が半生をかけて研究してきた膨大な学問が、ひとつの分厚い本に集大成の形で組み込まれているものも多いのです。

 今回報道された古書の注文をみると、哲学、歴史、医学、法律、江戸文化、政治などが対象だといいます。これは日本語で書かれた、日本人が一世紀近くの時間をかけて蓄積してきた知識の巨大な大樹のような知的財産です。日本人が徐々に忘れはじめている知識を今、アメリカのAIが学ぼうとしている可能性があるのです。