世界を動かす技術を、日本語で。

マイクロソフトの幹部がAIスクレイピングを「人類史上最大の労働の盗難」と呼ぶ

2026年9月18日原文(techcrunch.com)

概要

  • The New York Times によるOpenAIとMicrosoftへの著作権訴訟の新たな未編集情報
  • AIによるデータスクレイピングが「窃盗」と認識されていた事実
  • AI製品が出版業界に重大な脅威を与えるという内部認識
  • ペイウォール回避や著作権表示削除などの手法詳細
  • 法的な「フェアユース」適用の是非と今後の影響

NYT対OpenAI・Microsoft著作権訴訟の新事実

  • The New York Times が3年前に起こした著作権訴訟に関する未編集情報の公開
  • Microsoft幹部がAIによるスクレイピング行為を「窃盗」と私的に認めていた事実
  • OpenAIのリーダー陣もAIモデルが出版業界やジャーナリストに「存亡の危機」をもたらすと認識
  • 公開資料の多くはNYT側の主張書面からで、証拠資料自体は未公開
  • 訴訟の核心は、AI企業が著作権保護コンテンツを無断でAI学習に利用できるかという法的論点

AIスクレイピングの具体的手法と影響

  • MicrosoftとOpenAIはペイウォールを回避し、検知されずに大量スクレイピングを実施
  • 学習用データセット構築時に著作権表示を意図的に削除
  • OpenAI研究者がペイウォール回避の「ハック」を共有し、幹部が賛同するやりとり
  • Common Crawlなどの無料ウェブクロールデータから数百万の記事を抽出
  • WebTextやWebText2などのデータセットもニュース記事に大きく依存

フェアユースと市場への影響

  • 「フェアユース」適用の是非が法的争点
    • パロディ、報道、批評など特定用途での無断利用を認める米国法規定
  • AI学習が原著作物の市場を「代替」し、著しい経済的損害を与える可能性
    • Microsoft CopilotによるNYTドメインのクリック率が最大93%減少
    • Microsoft内部では「ドゥームループ(悪循環)」として危機意識が共有
  • Microsoft CEO Satya Nadellaは「ペイウォール裏の情報はライセンス取得が必要」と証言
  • OpenAI幹部も「AI製品は今後ますます代替的になる」と内部で認識

大規模な著作物コピーの実態

  • OpenAIの中間学習データセットには NYT、Daily News、Center for Investigative Reporting の作品が9万件以上含まれる
  • Common Crawl由来のデータセットには nytimes.com から200万件超の記事
  • MicrosoftとOpenAI間でデータセットを相互提供し、商用製品への実装を推進
    • Project Taxi、Project Mangoなどの社内プロジェクト名でデータ共有

出版業界・労働市場への影響

  • Microsoft内部資料では「生成AIがデータ提供者の雇用を著しく脅かすリスク」を明記
  • OpenAIの社内メモで「人類史上最大規模の労働の窃盗」と表現
  • 著作権表示の意図的削除は「モデルの出力に著作権表示が出ないようにするため」と記載

今後の法的・社会的展開

  • AIによる著作権侵害の認識が企業内部で共有されていた新証拠
  • フェアユース防御論の根幹を揺るがす内部発言やデータ
  • OpenAI、Microsoftはコメントを控えている状況
  • 今後の判決や業界への波及効果に注目

Hackerたちの意見

文化を奪って、それを高く売りつけるなんて、まさに文化の強盗だよね。こんな大きな犯罪は人類に対する犯罪だと思う。多くの人が、自分の人生をかけて作り上げたものを、考慮も補償も同意もなしに奪われているのは本当に驚きだよ。大きな富の裏には大きな犯罪があると言われているから、地球上で最も価値のある企業がこうした犯罪から生まれるのは驚くことじゃないね。そして、金持ちが正義を買える世の中だから、これがどうなるかなんて期待できないよ。

少なくとも、中国のAI企業は、自社のモデルをオープンソースとして公開してくれてるから、いいサービスをしてるよね。

「文化を奪って、それを高く売りつけるなんて、まさに文化の強盗だ」 それに規制は役立つのかな?今は「盗まれた」データで訓練された無料のモデルをダウンロードできるけど、規制と補償があれば、金持ちの企業だけがそれをできるようになるだろうし、絶対に無料で返してはくれないよね。「盗まれた」と引用符をつけたのは、それが本当に盗みと言えるかまだ不明だから。人間が本を読んで学ぶのは盗みとは言わないし、機械が同じことをするのが同じだとは言わないけど、「盗み」と呼べるかどうかは確信が持てないな。

ソフトウェアを書いたり、機械や工場を作ったり(つまり自動化すること)するたびに、犯罪を犯していることになるよ。上司や同僚から学んで、彼らよりも優れた存在になったり、昇進したり、彼らが解雇されたりするたびに、犯罪を犯しているんだ。まずはそこで正義を提供してほしいな。

データをコピーするのは犯罪じゃないよ。

アイデアを著作権や特許で所有することが、アメリカと共産主義を分ける要素なんだ。初めてテトリスについてのドキュメンタリーを見たとき、共産主義が何かを本当に理解した。誰も自分が発明したり創造したものを所有していなかったから。昔のことだけど、その話を見て悲しくなったのを覚えてる。ソ連では、約15人の政治局が、紙に書かれた考えまで含めて全てをコントロールしていた。この一文、アメリカ合衆国をソ連の災害から分けるものだと思う:> 科学と有用な技術の進歩を促進するために、著者や発明者にそれぞれの著作物や発見に対する独占的権利を限られた期間保障すること。著作権条項を無視することは、暴力的かどうかに関わらず共産主義の革命だと言っても過言ではないと思う。これが、アメリカの中にいる多くの共産主義者たちが、アメリカを共産主義国家にするために変えたいと思っていることなんだ。

これは今までで最大の知識の民主化だと思う。「私たちに売り戻せ」という主張は、私の見解では弱い。無料のバージョンはたくさんあるし、いずれ便利なモデルがすべてのスマホにプリインストールされるようになるよ。このコメントはすごく悲観的で、かなりドラマチックに感じるね。

AIが作った作品は著作権がないんだよね。じゃあ、公共のものなの?公共のものにあるユニークな作品を売ることはできるのかな?

私たちの「文化」は長い間、企業のものだった。以前の時代も、まだパトロンや権力の産物だった。少なくともLLM(大規模言語モデル)のおかげで、何世代もの人々が求めてきた世界への脱出ルートが見えてきたかも。つまり、豊かな生活を送るために必要な労働がほぼゼロに近づく世界だよね。AIを犯罪化しようとする解決策にこだわるのではなく、LLMの利益を再分配するという比較的達成可能な目標に焦点を当てるべきじゃないかな。それが最も望ましい正義だと思うけど、あなたの代替案は何?そして、実際には存在しなかった過去の名のもとに未来を閉ざすつもり?

海賊行為が盗みじゃないなら、トレーニングも絶対に盗みじゃないよ。

少なくとも、モデルを強制的に押収して、誰でもダウンロードできるオープンウェイトとして提供すべきだよ。それが無理なら、ギロチンを復活させるべきだね。

誰かが「人類史上最大の労働の盗みは何か?」と聞いたら、奴隷制度だと思っただろうな。

Hacker Newsで議論の続きを見る