新しい研究がAI Disclosures Projectによって発表され、OpenAIが採用しているトレーニング手法の透明性と倫理性に関する重要な疑問が提起されています。調査の中心には、企業の最新の言語モデルであるGPT-4oがあり、O’Reilly Mediaの機密資料からの著作権で保護されたコンテンツを認識し、使用していると非難されています。
Summary
人工知能競争における透明性を高めるための研究
この研究は、技術者のTim O’Reillyと経済学者のIlan Straussが主導するAI Disclosures Projectの一環として実施されました。プロジェクトの目的は明確です:責任を促進することです。人工知能の分野で、LLM(Large Language Models)を開発する企業による透明性のある実践の必要性を強調しています。
このドキュメントは、ワーキングペーパーであり、これらのモデルを訓練するために使用されるデータの開示に関する現在の正式な義務の欠如が、信頼性と合法性に深刻な問題を引き起こす可能性があることを分析しています。研究者たちは、bullとbearの市場において、強固な市場を促進するために開示ルールが生まれたように、AIの分野でも同様の規制が必要であり、乱用やシステミックな損害を防ぐべきだと主張しています。
OpenAI、著作権で保護されたコンテンツのテストを実施:データは明確に示している
彼らの調査を行うために、研究者たちはO’Reilly Mediaによって出版された34 libri protetti da copyrightのデータセットを合法的に取得しました。DE-COP membership inference attackとして知られる技術を通じて、言語モデルが人間によって書かれたテキストとLLMによって生成されたパラフレーズ版を区別できるかどうかを測定しました。結果はGPT-4oに対して非難の矛先を向けています。
AUROCスコア(モデルが2つのクラスを区別する能力を測定する指標)は明確に示しています:
- GPT-4oは、O’Reilly Mediaからの非公開コンテンツを認識する能力で82%のスコアを獲得しました。これは、そのコンテンツがトレーニングデータに含まれている可能性が高いことを示しています。
- 比較として、モデルGPT-3.5 Turboは非常に弱い認識(約50%)を示しましたが、モデルの軽量版であるGPT-4o Miniは、公開コンテンツも非公開コンテンツも認識しませんでした。
- データはまた、GPT-4oが非公開の資料を、自由に利用可能なO’Reillyのコンテンツ(64% AUROC)よりもよく認識することを示しています(82% AUROC)。
- 反対に、GPT-3.5 Turboは非公開のコンテンツ(54%)に比べて、公開のコンテンツ(64%)に対してより高い親和性を示しています。
研究者たちが示唆するには、著作権で保護されたコンテンツへのアクセスの可能な情報源として、LibGenが考えられます。これは、著作権で保護された本の無許可のデジタルコピーをホストする有名なオンラインプラットフォームです。研究で分析されたすべての本は、実際にそのバーチャルライブラリに存在しています。
AI業界の合法性、経済、コンテンツの持続可能性
これらの結果は、より広範な問題を提起します。著作権で保護されたデータを体系的に使用して言語モデルを訓練することは、オリジナルコンテンツを作成する専門家の経済的持続可能性を損なう可能性があります。企業が自社の出版物の使用に対して補償を受けない場合、情報のエコシステム全体 — 出版を含む — は貧困化するリスクがあります。
レポートによると、許可されていないデータの使用は補償なしで、オンラインコンテンツの質と多様性の低下に寄与しています。これは倫理的な問題だけでなく、経済的な問題でもあります。収入がなければ、出版社やプロのクリエイターは価値のあるコンテンツを作り続けることができません。
研究者の懸念: モデルは宣言されている以上のことを知っている
研究で強調されたもう一つの側面は、最新の言語モデルが人間の言語と人工知能によって生成された言語の微妙な違いを理解し再現する能力の向上です。さらに、研究者たちは「時間的バイアス」の可能性を指摘しています。なぜなら、言語は時間とともに進化するからです。この種の歪みを中和するために、テストは同じ期間に訓練された2つのモデル(GPT-4oとGPT-4o Mini)で実施されました。
特定のケースに限定されているにもかかわらず — OpenAI と O’Reilly のテキスト — 著者たちは、この現象が生成的人工知能の分野で広範かつシステム的である可能性があると考えています。
トレーニングデータの合法市場に向けて?
この研究はより広範な考察で締めくくられています: IA開発者がトレーニングデータに合法的にアクセスできるシステムを構築する必要があります。これは、ライセンス契約とコンテンツクリエーターへの透明な報酬を通じて実現されます。
いくつかの企業はすでにこの方向でビジネスモデルを開発しています。これは、データを販売するプラットフォームであるDefined.aiのケースです。このプラットフォームは、著者の同意を保証し、すべての個人を特定できる情報を削除します。規制された産業は、一部の大手AI企業の現在の不透明な行動に対する合法的かつ持続可能な代替手段を提供する可能性があります。
政治の役割:ヨーロッパは先駆者になれる
レポートはまた、規制の観点からの洞察も提供しています: 新しい欧州連合のAI法の施行は、モデルのトレーニングに関する開示義務を規定しており、bullとbearの間で好循環を引き起こす可能性があります。 ルールが明確に定義され、実際に適用される場合、権利者は自分の作品がいつどのように使用されているかをついに知ることができるようになります。
これは、クリエイターのコンテンツが実際にIAによって使用される経済的財として認識される合法市場の創出にとって重要な一歩となるでしょう。
OpenAIだけではない: ますます頻繁になる慣行を指摘する研究
詳細な分析を通じて、O’Reilly Mediaの34冊の本、研究者たちは実証的な証拠を提供し、OpenAIがbullモデルGPT-4oを非公開かつ著作権で保護されたデータでも訓練した可能性があることを示唆しています。
確認された場合、それは著作権に関する規則だけでなく、透明性、同意、公平性の原則に対する潜在的に重大な違反となるでしょう。これは、人工知能が私たちの社会や経済にますます深く影響を与える時代において、大手テック企業が遵守すべきものです。

