最近の調査報告によると、多くの主要なAI企業が仲介業者を通じて数百万冊の中古書籍を秘密裏に購入し、内容をスキャンしてAIモデルのトレーニングデータとして抽出し、デジタル化後に実物の書籍を破棄していることが明らかになりました。AIモデルのトレーニングには大量の高品質なオリジナルデータが必要ですが、現在、ネット上には大量の低品質なAI生成コンテンツが存在し、トレーニングデータプールを汚染し、モデルのトレーニング効果に影響を与えています。そのため、AI企業は2022年以前に出版された紙の印刷書籍に目を向けており、このような内容はほとんどが人間のオリジナルであり、AI生成コンテンツに汚染される可能性が低くなっています。
以前にも関連する事例があり、AI企業Anthropicは数百万ドルを投じて大量の紙の書籍を購入し、情報を抽出してClaudeモデルをトレーニングしました。スキャン後、実物の書籍は破棄されました。同社は700万冊の海賊版書籍をトレーニングに使用していたため、15億ドルの罰金を科せられました。最近、出版連盟がGoogleを訴え、数百万冊の著作権書籍を不法に使用してGeminiモデルをトレーニングしたと主張しています。
AI企業が秘密裏に中古書籍を購入してモデルのトレーニングを行っている
書籍データベースプラットフォームISBNdbのデータによると、今年4月から中古書籍の大量注文が明らかに増加しており、単一の注文規模は1000冊から100万冊に及び、特定の題材、ジャンル、または著者の傾向はなく、購入者は価格に敏感ではなく、プレミアムがあっても直接購入します。ある中古書籍の販売者は、以前は好調な時に毎週約20冊を販売していたが、最近は毎週の販売量が数百冊に急増し、通常の販売量の5倍になっていると明かしました。他の中古書籍プラットフォームでも同様の大量注文の増加が見られます。
効率を高め、コストを削減するために、AI企業は主に破壊的スキャン方式を選択し、書籍の製本を解体した後、単ページを高速工業スキャナーに送ってスキャンし、最終的に数百万冊の実物書籍が破棄されることになります。現在の論争は主に2つの点に集中しています。1つは、AI企業がスキャン過程で希少または絶版の書籍を選別するかどうかであり、これらの書籍が流通から退出することは公共文化資源の損失を引き起こす可能性があります。もう1つは、スキャン後の書籍の内容がプライベートデータベースに入りAIトレーニングに使用され、一般の人々がアクセスできず、関連する知識が社会で共有されないことです。

