OpenAIのAIモデルが生成した文章を見分けるための技術です
Image:DC Studio / Shutterstock.com
OpenAIが、ChatGPTで生成した文章に「電子透かし(ウォーターマーク)」を付ける取り組みをEU(欧州連合)で開始する。これは、AIが作った文章であることを機械的に識別できるようにするための仕組みで、EUで8月から適用が始まったAI規制への対応が背景にある。
ただし、ここでいう透かしは、文章に特定の文言を表示するわけではない。そのため、出力される文章はごく普通に読めるものとなり、おそらく人の目では、それがAI生成かどうかはどうかを見分けることはできない。
OpenAIが導入するのは「textGrain」と呼ばれる技術だ。ChatGPTは文章を記述するときに、どの単語を選ぶかという確率をわずかに調整することが可能だ。そのため文章全体で見ると、単語選択に一定の統計的なパターンが生まれる。このパターンを専用の検出システムで分析することで、「OpenAIのAIによって生成された可能性がある文章」と判定できるようにする。
イメージとしては、文章そのものにそれとわかる目印を貼り付けるのではなく、文章の「書き方」に見えない特徴を埋め込むようなものだ。
この仕組みが注目される理由の一つが、文章をコピー&ペーストしても一定の条件ではウォーターマークが残る点だ。ChatGPTで作った文章をWordやGoogleドキュメント、メールなどに貼り付けても、文章の特徴そのものに信号が含まれているため、単純なコピーでは消えない。
一方で、textGrainは決して万能な「AI文章検出器」ではない。文章が短い場合や、翻訳・大幅な編集・言い換えなどを行った場合には、検出精度が低下する可能性がある。OpenAIのテストでも、文章の一部を類義語などに置き換えるだけで検出率が下がることが確認されている。
そのため、「ウォーターマークが検出されなかった=人間が書いた文章」と判断することはできない。逆に、ウォーターマークが検出されたとしても、それだけで「この人がChatGPTに文章を全部書かせた」と証明できるわけでもない。
検出できるのは、あくまで「OpenAIの生成AIが文章の作成に関与した可能性がある」という情報だ。つまり、他社の生成AIが出力した文章を見分けることはできず、また誰がChatGPTを利用したのか、どのようなプロンプトを使ったのか、出力された文章に人間がどの程度手を加えたのかといった情報まで分かるわけではない。
OpenAIは、テキスト透かしが示せる情報に限界があることを以下のように明示している。
・透かしは人間の関与度を測定するものではない
・そのテキストの所有権や法的責任を示すものではない
・ユーザーを特定するものではない
・内容の正確性や信頼性を保証するものではない
・透かしが検出されないことは、人間が書いたことの証明にはならない
冒頭に記したように、今回の取り組みの背景には、EUで進むAI規制がある。EUではAIによって生成されたコンテンツについて、その出所を識別できるようにするための透明性確保が重視されている。OpenAIはその対応策として、ChatGPTなどで生成される文章に識別可能な信号を組み込む方針を打ち出した。
現時点では、textGrainはEU圏のChatGPTユーザーを対象として提供される。そのため日本を含む世界中のChatGPTで一斉に同じ仕組みが導入されるという話ではない。一方、OpenAIのAPIでは、対応モデルについてウォーターマークを任意で有効化できる仕組みも提供されるとのことだ。
これまで「AI文章検出」といえば、文章の特徴からAIらしさを推測する方法が中心だった。しかし、今回のtextGrainは、OpenAI自身が生成時に信号を埋め込むという点で性質が異なる。
今後、AIが文章を書くことが当たり前になるにつれて、「これは人間が書いたのか、それともAIが作ったのか」という問題は、教育、出版、報道、企業活動など幅広い分野で重要になっていくだろう。今回のウォーターマーク導入は、AI時代における「コンテンツの出所」をどう確認するのかという、大きな流れの一歩といえそうだ。
関連キーワード: