世界を動かす技術を、日本語で。

クロードがAI生成コンテンツにどのようにマークを付けるか

概要

  • Anthropic がEU AI法第50条(2)の 透明性コード に署名
  • Claude生成コンテンツ への機械可読マーク付与の方針
  • ウォーターマーク署名付きメタデータ による識別方法
  • マークの 検出方法と制限事項 についての説明
  • 今後、 技術的ガイダンス の詳細を随時公開予定

AnthropicによるAI生成コンテンツの透明性確保への取り組み

  • Anthropic はEU AI Act第50条(2)の AI生成コンテンツ透明性コード に署名
  • 生成AIモデル および 生成AIシステム の提供者としての責任明記
  • 透明性向上と法令遵守のため、 Claudeが生成したコンテンツ に機械可読マークを導入予定
  • 情報の出所 を示し、ユーザーに有用な文脈を提供

Claudeによるコンテンツのマーク方法

  • 2つの技術 でClaude生成・処理コンテンツを識別
    • テキスト埋め込み型ウォーターマーク
      • Claudeモデルが生成したテキストに 不可視ウォーターマーク を埋め込み
      • 意味や品質、可読性に影響なし
      • テキストをコピー&ペーストしてもウォーターマークは残存
      • すべてのClaude製品・サービスで一貫して適用
    • 署名付きプロヴェナンスメタデータ
      • Claudeが生成する .svg, .png, .jpg などのファイルに 署名付きメタデータ を付与
      • C2PA(Coalition for Content Provenance and Authenticity) のオープン標準に準拠
      • メタデータにより ファイルの改ざん検出 やClaudeによる処理の判別が可能

Claudeのマーク検出方法

  • ユーザーや第三者が ウォーターマークメタデータ を検出できる仕組みを開発中
  • テキストやファイルに Claudeのマーク が付与されているかを確認可能
  • マークが検出された場合、そのコンテンツが Claudeで生成・処理された可能性 を示唆
  • 検出メカニズムの詳細 は今後技術ドキュメントで公開予定

制限事項と注意点

  • 機械可読マーク はコンテンツの出所を示す重要な信号だが、 すべての改変や形式に完全対応するものではない
  • Claudeを活用した 自社製品開発者 は、 Article 50の要件 を独自に評価する必要
  • Anthropicは 透明性義務の支援技術ガイダンスの提供 を継続予定

関連情報

  • Claudeの誤回答・誤解を招く回答 に関する記事
  • Claudeによるファイル作成・編集方法 の紹介
  • AIモデル学習への出力利用可否 についてのガイド
  • Claudeアカウントへのログイン方法 案内
  • Claude for Governmentの利用開始方法

Hackerたちの意見

しばらく前から、(これらのツールに加えて)AnthropicがClaudeの独特な書き方に寄り添っている気がしてるんだよね。そうすることで、テキストが明らかにAI生成だって分かりやすくなって、悪用されにくくなるから。これはマルコフスタイルのフィンガープリントとは必ずしも同じことじゃないけど、関連する要素かもしれないね。

僕も似たようなことを考えたけど、パフォーマンスが向上するから寄り添ったのかなって思ってた。

それをああいう風に話さないように指示するのは、かなり簡単なことだよ。プロンプトに最初に書くべきことの一つだね。どんなスタイルで書いてほしいかを指定するんだ。あまり感情的な表現や華やかな言葉を使わず、非常に簡潔でドライな学術的スタイルにしてもらうといいよ。

サポートされているClaudeモデルがテキストを生成すると、そのテキスト自体に気づかれないウォーターマークが織り込まれるんだ。目には見えないし、Claudeの返答の意味や質、読みやすさには影響しないよ。これがどう機能するのか、もっと知りたいな。Claudeとのやり取りでは、かなり正確なテキストが返ってくることが多いんだ。特定の関数をいくつかの場所でリファクタリングしてほしいと頼むと、何が起こるかはっきり分かってるから、もしそのリファクタリングにウォーターマークとしての変なパターンが含まれてたら、全然ダメなんだよね。これについては、以下のようにカバーされてるかもね。> Claudeによって生成されたコンテンツは、例えば以下のような場合には検出可能なマークを持たないかもしれない:[...] パッセージが非常に短く、信号として信頼できるテキストがほとんど残らない場合。

ただ、段落に負荷を支える縫い目を通すだけだよ。

これがどう機能するのか、もっと知りたいな。二つの異なるアルゴリズムを使って、負荷を支える単語をベルトとブレースのようにカウントするんだ。

おそらくこの方法だね https://arxiv.org/pdf/2301.10226 (EDIT: それに基づいたGoogleのSynthID論文も https://www.nature.com/articles/s41586-024-08025-4)

誰かがClaudeの出力を手書きして、その手書きのテキストを誰かが参考にしたらどうなるんだろう?そうなると、Claudeの使用とは直接関係のないウォーターマーク付きのアイデアができちゃうよね。

テキストにウォーターマークとして機能するような変なパターンが埋め込まれている。 public abstract class BaseAnimalBeanFactoryGeneratedFromClaudeFactory

その仕組みについてもっと知りたいな。僕の推測では、GeminiのSynthIDみたいに、次のトークンのログ確率を変えることで動いてるんじゃないかな。例えば、10番目のトークンの代わりに、最も確率の高いものを出すのではなく、17番目に確率の高いものを出すみたいな感じ。 (もちろん、実際はもっと複雑だけど、概念的にはこんな感じだと思う。)人間には気づかれないけど、Claudeの出力に基づいて訓練された分類器には気づかれるだろうね。だから、ウォーターマークが「le epic bacon」って言葉で、Claudeがすべてに「le epic bacon」って出力するわけじゃないんだ。それだとめっちゃうざいし(簡単に対処できちゃう)。

Opus 5がそんな言葉のサラダみたいな会話を生み出す理由があるのかもしれないね。

早かったよ :) … https://claudewatermarkremover.app/

Hacker Newsで議論の続きを見る