概要
- The New York Times によるOpenAIとMicrosoftへの著作権訴訟の新たな未編集情報
- AIによるデータスクレイピングが「窃盗」と認識されていた事実
- AI製品が出版業界に重大な脅威を与えるという内部認識
- ペイウォール回避や著作権表示削除などの手法詳細
- 法的な「フェアユース」適用の是非と今後の影響
NYT対OpenAI・Microsoft著作権訴訟の新事実
- The New York Times が3年前に起こした著作権訴訟に関する未編集情報の公開
- Microsoft幹部がAIによるスクレイピング行為を「窃盗」と私的に認めていた事実
- OpenAIのリーダー陣もAIモデルが出版業界やジャーナリストに「存亡の危機」をもたらすと認識
- 公開資料の多くはNYT側の主張書面からで、証拠資料自体は未公開
- 訴訟の核心は、AI企業が著作権保護コンテンツを無断でAI学習に利用できるかという法的論点
AIスクレイピングの具体的手法と影響
- MicrosoftとOpenAIはペイウォールを回避し、検知されずに大量スクレイピングを実施
- 学習用データセット構築時に著作権表示を意図的に削除
- OpenAI研究者がペイウォール回避の「ハック」を共有し、幹部が賛同するやりとり
- Common Crawlなどの無料ウェブクロールデータから数百万の記事を抽出
- WebTextやWebText2などのデータセットもニュース記事に大きく依存
フェアユースと市場への影響
- 「フェアユース」適用の是非が法的争点
- パロディ、報道、批評など特定用途での無断利用を認める米国法規定
- AI学習が原著作物の市場を「代替」し、著しい経済的損害を与える可能性
- Microsoft CopilotによるNYTドメインのクリック率が最大93%減少
- Microsoft内部では「ドゥームループ(悪循環)」として危機意識が共有
- Microsoft CEO Satya Nadellaは「ペイウォール裏の情報はライセンス取得が必要」と証言
- OpenAI幹部も「AI製品は今後ますます代替的になる」と内部で認識
大規模な著作物コピーの実態
- OpenAIの中間学習データセットには NYT、Daily News、Center for Investigative Reporting の作品が9万件以上含まれる
- Common Crawl由来のデータセットには nytimes.com から200万件超の記事
- MicrosoftとOpenAI間でデータセットを相互提供し、商用製品への実装を推進
- Project Taxi、Project Mangoなどの社内プロジェクト名でデータ共有
出版業界・労働市場への影響
- Microsoft内部資料では「生成AIがデータ提供者の雇用を著しく脅かすリスク」を明記
- OpenAIの社内メモで「人類史上最大規模の労働の窃盗」と表現
- 著作権表示の意図的削除は「モデルの出力に著作権表示が出ないようにするため」と記載
今後の法的・社会的展開
- AIによる著作権侵害の認識が企業内部で共有されていた新証拠
- フェアユース防御論の根幹を揺るがす内部発言やデータ
- OpenAI、Microsoftはコメントを控えている状況
- 今後の判決や業界への波及効果に注目