ホームAI概念的推論指数:最高のAIモデルのスコアは73.6、上限は91

概念的推論指数:最高のAIモデルのスコアは73.6、上限は91

Anthropic と独立系研究者らは、AI モデルが歴史的に苦手としてきた能力、つまり明確で検証可能な答えのない問題を筋道立てて考える力を測定する新しい方法を導入した。今週発表された Conceptual Reasoning Index(概念的推論指数、CRI)は、AI モデルが哲学的議論、論理的一貫性、そして意思決定理論のパズルをどれだけうまく扱えるかを評価するために、3 つのベンチマークを組み合わせたものだ。これは、多くの研究者が、AI システムが自らのリスクを管理する上でより大きな役割を担うようになるにつれて、最も重要になると考えている種類の思考である。

主なポイント

  • Conceptual Reasoning Index は、LMCA、ACCoRD、DTBench の 3 つのベンチマークを統合し、AI の概念的推論を 0〜100 の単一スコアで評価する。
  • 最も高い性能を示したモデル Opus 5 の CRI スコアは 73.6 であり、推定上限値である約 91 を大きく下回っている。
  • LMCA データセット には、哲学、意思決定理論、AI リスクを対象とした 560 本の立場テキストと 1,461 本の専門家評価付き議論が含まれている。
  • スコアは 2024 年末以降、おおむね線形に上昇しており、頭打ちの兆候は見られない。
  • 本プロジェクトは、Anthropic と研究者 Emery Cooper、Caspar Oesterheld との協力により構築された。

Conceptual Reasoning Index(CRI)の概要

CRI が存在する理由は、AI システムが将来的に担う可能性のある最も重要な仕事の一部、すなわち高度な AI リスクについて人間が理解し計画するのを助けるような仕事は、数学やコーディング問題のように明確な正解と照らし合わせてチェックすることができないからだ。CRI の開発者たちは、AI リスク軽減に関わる多くのタスクは、実証的な検証ではなく、哲学や AI フューチャリズムで用いられるような議論の形式を必要とすると主張している。また、信頼できるフィードバックを伴うデータに大きく依存する現在の学習手法は、まさにこの種の推論においてモデルを弱くしがちだとも指摘している。

この測定ギャップを埋めるため、研究者たちは 3 つの独立したAI リスク・ベンチマークを構築し、それらを 1 つの総合スコアにまとめた。Conceptual Reasoning Index(CRI) は、LMCA、ACCoRD、DTBench の 3 つのベンチマークを集約し、モデルの全体的な概念的推論能力を捉えることを意図した単一の数値を算出する。インデックスは conceptualreasoning.ai で一般公開されており、チームは新しいモデルや新しいベンチマークが登場するたびに、スコアと手法を更新していくとしている。

AI リスク管理における CRI の目的

そもそも、なぜこれを構築するのか。プロジェクトの研究者たちは、AI モデルがリスク低減の仕事を人間の専門家レベルでこなせるようになれば、その分野における AI 支援のアウトプットは、人間だけが生み出すものをはるかに上回る可能性があると述べている。つまり、AI を巡るガバナンス、アラインメント、協調の失敗といった問題について、モデルがどれだけ早くうまく推論できるように訓練されるかが、リスクに間に合うかどうかを左右する決定的な要因になり得るということだ。経験的なフィードバックループを欠くがゆえに標準的な訓練では軽視されがちなタスクを対象としているからこそ、AI モデルの概念的推論を改善することが重要視されている。

ベンチマークの統合と公開状況

CRI は単一のテストではなく、重み付けされた複合指標である。現在、スコアの 60% を LMCA が占め、ACCoRD と DTBench の能力がそれぞれ 20% ずつを占めている。チームは、今後新たなベンチマークを追加し、飽和したものは廃止し、モデルの進歩に応じてこれらの重みを再調整する可能性があるとしている。

CRI を構成するベンチマークの詳細な内訳

3 つの構成要素はそれぞれ、経験的には検証しにくいが、専門家の判断や論理規則によって測定可能な異なるタイプの推論を対象としている。

LMCA データセット:範囲と専門家評価

LMCA(Language Model Conceptual Argumentation、言語モデル概念的議論)は、意思決定理論、哲学、高度な AI からのリスクにまたがる、精選された専門家評価付き議論を中心に構築されている。LMCA データセットには、560 本の立場テキストと、それに対して書かれた 1,461 本の専門家評価付き議論が含まれている。ほぼすべての議論は概念研究者 Emery Cooper によって評価されており、その一部は少なくとももう 1 人の研究者によって独立に評価され、合計 2,140 件の評価が得られている。約 50 本の議論からなる検証セットは、4〜6 人によって独立に評価され、その後合計 7〜8 時間にわたって議論された。このプロセスは、モデル出力と比較する前に、人間同士がどの程度合意できるかを確立することを目的としている。

現時点では、LMCA は新たな議論を生成する能力ではなく、既存の議論をどれだけうまく評価できるかのみをスコア化している。ただし、チームは将来的に議論生成の指標を追加したいと述べている。

ACCoRD:モデルの信念の論理的一貫性の測定

ACCoRD がチェックするのは別の側面だ。モデルが自ら表明する信念や選好が、論理的に首尾一貫しているかどうかである。たとえば、ある事象 A の確率と、別に A と B が同時に起こる確率を報告したとき、P(A) ≥ P(A&B) といった基本的な規則を守っているかどうかが問われる。完全な ACCoRD データセットには、18 種類の制約タイプにわたる約 14,000 件のモデル生成の一貫性制約が含まれており、自動チェッカーで検証される。そのうち 567 件の検証済み制約が手動レビューを経て CRI に採用されている。これは、研究者たちが自信を持てるチェックのみに絞り込むことを意図した、意図的に保守的なフィルタリングである。

DTBench:意思決定理論に基づく推論評価

DTBench は 407 問の多肢選択式問題を用いて、意思決定理論に基づく推論をテストする。これらの問題の大半は、意思決定理論に関する学術研究を発表している Caspar Oesterheld によって手作業で作成され、Emery Cooper によって独立に検証されている。問題は、自己予測やエージェントのほぼコピーとの相互作用を含むシナリオを扱っており、意思決定理論家たちが長年議論してきた思考実験の類型を探るものだ。完全な DTBench スイートには、意思決定理論的な態度を測定する追加の 130 問も含まれているが、これらは CRI スコアからは除外されている。

CRI の性能結果とトレンド

テストされた中で最良のモデルであっても、ベンチマークが「ほぼ完璧」と見なすスコアにはまだ大きく届いていないが、そのギャップは着実に縮まりつつある。

現在の性能スコアと上限値との比較

CRI スコアは 0〜100 の範囲で、0 はランダムな当て推量を表す。研究者たちは、現実的な上限値を 100 ではなく約 91 と見積もっている。これは、人間による評価自体にノイズが含まれるためであり、専門家評価者同士であっても常に 100% 一致するわけではないからだ。これまでに記録された最高スコアは Opus 5 の 73.6 であり、95% 信頼区間は ±2.1 となっている。これは、現在の最高性能と推定上限値との間に依然として意味のあるギャップがあることを示しており、ベンチマーク自体が制約要因となる前に、モデルが概念的推論をさらに向上させる余地が十分に残されていることを示唆している。

時間経過に伴うモデル性能向上のトレンド

データで際立っているのは、現在の水準だけでなく、その向上スピードである。モデル性能は 2024 年末以降、おおむね線形に改善しており、そのトレンドが鈍化している兆候は報告されていない。この着実な上昇は、AI システムが、AI セーフティ研究が依存するような議論中心の仕事において、本当に有用な協働者となる時期を予測しようとする人々にとって重要な意味を持つ。

ベンチマークごとの飽和予測

すべての構成要素が同じペースで進歩しているわけではない。現在のトレンドを外挿すると、研究者たちは LMCA が約 1 年後には飽和し始めると大まかに見積もっている。一方で DTBench はすでに上限に近づいており、評価されたモデルの 1 つである Fable 5 は DTBench の問題の 98% に正解している。ACCoRD は不確定要素であり、研究チームはこのベンチマークがいつ飽和するかについて本当に確信が持てないと述べている。というのも、素の推論能力が向上しても、一貫性のエラーは残り続ける可能性があるからだ。

CRI の意義と共同開発体制

これらが単なるランキング以上の意味を持つのはなぜか。Conceptual Reasoning Index を構築している人々は、概念的推論を、特に AI リスクに関する仕事におけるボトルネックとなるスキルだと見なしているからだ。そこでは、過去の結果のデータセットに基づいて学習することができない、ガバナンス、アラインメント、破滅的な協調失敗についての推論が求められる。経験的テストではなく議論に大きく依存するリスク軽減の仕事が多いからこそ、AI モデルの概念的推論を改善することが、高度な AI リスクを低減するうえで重要だと考えられている。

本プロジェクトは、Anthropic と、概念研究者である Emery Cooper および Caspar Oesterheld の協力によって構築された。彼らは、LMCA と DTBench の構成要素を支えるデータセット設計と専門家評価の両方に貢献している。このような組織的な支援とドメイン固有の専門家によるインプットの組み合わせは、数学、コーディング、一般知識といった、正誤を自動的にチェックしやすい分野に焦点を当てた従来型の AI ベンチマークと CRI を分かつ特徴の一部となっている。

ライブスコアと手法に関するノートは conceptualreasoning.ai で公開されており、基盤となる LMCA データセットへのアクセスは申請フォームを通じて提供されている。この構造は、チームがベンチマークを閉じた内部指標として扱うのではなく、外部研究者がテストし、批判することを望んでいることを示唆している。

FAQ

Conceptual Reasoning Index(CRI)とは何ですか?

CRI は、LMCA、ACCoRD、DTBench の 3 つのベンチマークを統合し、AI モデルの概念的推論能力を測定して、0〜100 の単一スコアを算出する指標です。

LMCA データセットはどのようなタイプの推論を評価しますか?

LMCA は、哲学、意思決定理論、AI リスクに関連する概念的議論の評価においてモデルをテストし、モデルの評価と専門家による人間の評価を比較します。

ACCoRD はどのようにして AI モデルの論理的一貫性をテストしますか?

ACCoRD は、モデルが報告する信念や選好が、基本的な確率規則などの論理的一貫性制約を満たしているかどうかを測定しており、CRI では 567 件の検証済み制約が用いられています。

現在の AI モデルは CRI でどの程度の性能を示していますか?

現在のトップモデルである Opus 5 は、CRI で 100 点中およそ 73.6 点を記録しており、評価されたモデル全体のスコアは 2024 年末以降おおむね線形に向上していて、その成長が鈍化している兆候はまだ見られません。

{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”Conceptual Reasoning Index(CRI)とは何ですか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”CRI は、LMCA、ACCoRD、DTBench の 3 つのベンチマークを統合し、AI モデルの概念的推論能力を測定して、0〜100 の単一スコアを算出する指標です。”}},{“@type”:”Question”,”name”:”LMCA データセットはどのようなタイプの推論を評価しますか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”LMCA は、哲学、意思決定理論、AI リスクに関連する概念的議論の評価においてモデルをテストし、モデルの評価と専門家による人間の評価を比較します。”}},{“@type”:”Question”,”name”:”ACCoRD はどのようにして AI モデルの論理的一貫性をテストしますか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”ACCoRD は、モデルが報告する信念や選好が、基本的な確率規則などの論理的一貫性制約を満たしているかどうかを測定しており、CRI では 567 件の検証済み制約が用いられています。”}},{“@type”:”Question”,”name”:”現在の AI モデルは CRI でどの程度の性能を示していますか?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”現在のトップモデルである Opus 5 は、CRI で 100 点中およそ 73.6 点を記録しており、評価されたモデル全体のスコアは 2024 年末以降おおむね線形に向上していて、その成長が鈍化している兆候はまだ見られません。”}}]}

本記事は人工知能の支援を受けて作成され、編集チームによるレビューを経ています。

RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST