AI企業、モデル訓練のために中古書籍を大量購入し実物書籍を廃棄

最近の調査報告によると、多くの大手AI企業が仲介業者を通じて数百万冊の中古書籍を秘密裏に購入し、内容をスキャンしてAIモデルのトレーニングデータとして抽出し、デジタル化後に実物の書籍を破棄していることが明らかになりました。AIモデルのトレーニングには大量の高品質なオリジナルデータが必要ですが、現在ネット上には低品質なAI生成コンテンツが大量に存在し、トレーニングデータプールを汚染し、モデルのトレーニング効果に影響を与えています。そのため、AI企業は2022年以前に出版された紙の書籍に目を向けています。このようなコンテンツはほとんどが人間のオリジナルであり、AI生成コンテンツに汚染される可能性が低いのです。

以前にも関連する事例があり、AI企業Anthropicは数百万ドルを投じて大量の紙の書籍を購入し、情報を抽出してClaudeモデルのトレーニングを行い、スキャン後に実物の書籍を破棄しました。同社は700万冊の海賊版書籍をトレーニングに使用したとして、15億ドルの罰金を科せられたことがあります。最近では、出版連盟がGoogleを訴え、数百万冊の著作権書籍を不法に使用してGeminiモデルをトレーニングしたと主張しています。

AI企業が秘密裏に中古書籍を購入してモデルのトレーニングを行う

書籍データベースプラットフォームISBNdbのデータによると、今年4月以降、中古書籍の大量注文が明らかに増加しており、単一の注文規模は1000冊から100万冊に及び、特定のテーマ、ジャンル、または著者の傾向はなく、購入者は価格に敏感ではなく、プレミアムを支払ってでも直接購入することがあります。ある中古書籍の販売者によると、以前は売上が良い時には毎週約20冊を販売していたが、最近は毎週の売上が数百冊に急増し、通常の売上の5倍になっています。他の中古書籍プラットフォームでも同様の大量注文の増加が見られています。

効率を高め、コストを削減するために、AI企業の多くは破壊的なスキャン方式を選択し、書籍の製本を解体した後、単ページを高速工業スキャナーに送ってスキャンし、最終的に数百万冊の実物書籍が破棄されることになります。現在の議論は主に2つの点に集中しています。1つは、AI企業がスキャン過程で希少または絶版の書籍を選別するかどうかであり、これらの書籍が流通から退出することで公共文化資源の損失を引き起こす可能性があります。もう1つは、スキャン後の書籍の内容がプライベートデータベースに入り、AIトレーニングに使用されるため、一般の人々がアクセスできず、関連する知識が社会で共有されないことです。

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle