自律的に動作するAIエージェントの開発や運用を進める中で、「AIがいつまでも無関係な情報を探し続ける」「想定外の前提変更に対応できず暴走してしまう」といった壁に直面していないでしょうか。これは、現在の高度な大規模言語モデルであっても、現実の複雑な環境下で自らが「考えるべき範囲」を適切に切り出せないことに起因しています。古くから人工知能研究につきまとう根本的な課題である「フレーム問題」が、現在の生成AIの実務運用において再び姿を現しているのです。
ここで重要なのは、システムのエラーを漠然と「AIの限界」として諦めるのではなく、どこで何が破綻しているのかを正確に把握することです。では、このフレーム問題における狭義の論理問題と広義の関連性問題をどのように分け、現在の生成AIが引き起こす失敗をどの層で診断し、実務でどう被害を抑えればよいのでしょうか。
本記事では、生成AIやAIエージェントが直面する問題を論理表現、関連性判断、コンテキスト、記憶更新、権限という5つの層へ分けて解説します。競合の料金調査を例に、参照先と更新対象を決め、料金体系そのものが変わったときは自動更新を止めて担当者へ渡す手順まで考えます。
フレーム問題には狭義と広義がある

生成AIやAIエージェントの自律性が高まるにつれて、設計・運用者が直面する根本的な壁が「フレーム問題」です。この問題を理解し、適切に対処するためには、まず言葉の定義を正確に捉え、「何がフレーム問題で、何が別の問題か」を区別する必要があります。
Stanford Encyclopedia of Philosophyは、フレーム問題を「狭義の技術的問題」と「広義の認識論的問題」の2つに区別しています。
第一に、狭義の技術的問題です。これは1969年にMcCarthyとHayesの原論文によって提起された、行為と変化を形式化する哲学的・論理的問題に端を発しています。具体的には、ある行動を起こした際に「何が変化し、何が変化しないのか」を、どのように無矛盾かつ効率的な論理として記述するかという課題です。現実世界の出来事は一部の事象にしか変化をもたらしませんが、コンピュータには「それ以外は変わっていない」という事実をすべて明記しなければならないという技術的な困難を指します。
第二に、広義の認識論的問題です。こちらは、無数に存在する情報や現実世界の事象の中から、現在の目的にとって「何が関連しているか」をシステムがどう判断・選択するかという問題です。あらかじめ全ての状況を想定できない現実空間において、無関係な情報を無視し、適切な枠(フレーム)を切り出すことの難しさを表しています。
この2つの違いを、架空の例を用いて考えてみましょう。「価格体系が月額から従量課金へ変わった競合他社の調査」をAIエージェントに依頼する場面を想定します。エージェントには、月額制と書かれた旧価格表、最新のWeb検索結果、そして「競合の現在の価格をまとめる」という目的が入力されています。
ここで狭義の問題となるのは「変わらない事実の表現」です。価格体系が変更されても、競合の会社名や対象となる製品そのものは変わっていないという前提を、AIが論理的に破綻なく保持し続ける必要があります。
一方、広義の問題となるのは「関連性の選択」です。検索結果に含まれる膨大な情報の中から、「月額から従量課金への移行」という事実が今回の目的に直結する重要な変更だと気づき、オフィスの移転や経営陣の交代といった無関係なニュースを切り捨てる判断が求められます。
実務においては、これらを明確に区別して設計することが重要です。上記の例であれば、料金体系の根本的な変更という重大な事象を広義の関連性から見つけ出したうえで、それをAIの処理範囲を超える「例外」として扱い、独断で処理せずに人へ返す手順を組み込む必要があります。問題を層に分けて捉えることが、被害を抑えた現実的なAI運用の第一歩となります。
狭義の論理問題には実用的な解法がある

前節で確認した通り、Stanford Encyclopedia of Philosophyはフレーム問題を「狭義の技術的問題」と「広義の認識論的問題」に区別しています。このうち、ある行動によって何が変化し何が変化しないかを論理的に記述するという狭義の技術的問題については、人工知能研究の長い歴史のなかで実用的な解法が編み出されてきました。
1969年のMcCarthyとHayesの原論文が行為と変化を形式化する哲学的・論理的問題を提示して以降、すべてを明記しなくても「記述されていないことは変わらない」と見なすための論理手法が複数考案されました。代表的なアプローチとして、circumscription(サーカムスクリプション)、successor state axioms(後継状態公理)、event calculus(イベント計算)の3つが挙げられます。
第一のcircumscriptionは、論理式で明示的に定義された例外を除き、通常の事象は変化しないと「囲い込む」ことで、記述量を抑える非単調論理の手法です。第二のsuccessor state axiomsは、ある行動が起きた次の状態において、特定の変数が真になる条件と偽になる条件を一つの公理にまとめ、それ以外は以前の状態を引き継ぐと定義します。第三のevent calculusは、時間の流れをベースに特定の出来事が発生した時点でどの状態が開始または終了するかを定式化し、連続的な変化を扱う手法です。
これらの手法がどこまで問題を解けたかというと、扱う対象の変数やルールがすべて洗い出されている「閉じた世界」においては、論理的な破綻を防ぐ実用的な仕組みとして十分に機能します。
ここで架空の例として、決められたルールで動く倉庫ロボットを想定してみましょう。ロボットが「Aの棚にある箱をBの棚へ移動させる」という操作を行った際、システムは状態を更新しなければなりません。このとき、移動行為によって「箱の位置」はAからBへと変化しますが、移動した後も箱に入っている商品の「商品コード」や「重量」が変わることはありません。初期の論理問題では「商品コードが変わっていないこと」も計算のたびに証明する必要がありましたが、successor state axiomsなどを適用すれば「位置の変数のみを書き換え、それ以外は維持する」という処理を効率的かつ無矛盾に行うことができます。
このように、あらかじめ想定された適用範囲の内部であれば、狭義のフレーム問題は解決済みと言えます。システムが管理すべきオブジェクトや状態変化のパターンが限定されているデータベースの更新や、厳密なルールベースの制御においては、これらの古典的な論理手法が現在でも確固たる基盤となっています。
これらの解法が扱うのは、管理する変数を定義できる環境です。未知の情報が流入するAIエージェントでは、次にどの情報を調べるかという関連性の判断が加わります。
LLMの情報選別は開世界の解決を意味しない

前節では、すべての変数が定義された閉じた世界において、狭義のフレーム問題が実用的な論理手法で解決されてきたことを見ました。それでは、大量のテキストを読み込み、人間のように文脈を理解する現在の生成AIは、フレーム問題を完全に解いたと言えるのでしょうか。結論から言えば、生成AIはまだフレーム問題を解き切ってはいません。
ここで再び、Stanford Encyclopedia of Philosophyが区別する広義の認識論的問題に立ち返ります。広義のフレーム問題とは、あらかじめ状況を限定できない現実世界において、現在の目的にとって何が関連し、何が無関係かを判断する問題です。大規模言語モデルは、入力されたテキストの中から重要なキーワードや文脈を拾い上げる情報選別において非常に高い性能を示します。しかし、このテキスト処理能力の高さは、現実空間の未知事象に自律的に対処できることとは全く異なります。
この違いはモデルへの評価アプローチにも表れています。Okaの2025年プレプリントは13モデルをテキスト課題で評価していますが、これはあくまで与えられたテキスト内での情報処理能力を測るものであり、開世界での行為能力の証明ではありません。つまり、生成AIは人間が用意してくれた情報という枠の中での選別が上手になっただけで、枠自体を現実の複雑な事象から正しく切り出す能力を獲得したわけではないのです。
このテキスト課題の評価と現実の未知事象への対処の違いを、法務業務を想定した架空の例で考えてみましょう。
一つ目は契約書内の関係条項選択です。ユーザーが長大な契約書データを生成AIに入力し、契約解除に関する条件を整理するよう指示した場合、AIは文書内から関連する条項を見つけ出し、無関係な一般条項を無視して要約を作成します。これは、必要な情報がすべて入力データという閉じたテキスト世界の中に存在しているため、現在のモデルが得意とするタスクです。
二つ目は法改正を自ら発見する仕事です。現実世界の状況は常に変化しています。ある日、自社の事業に影響を与える重大な法改正が発表されたとします。このとき、世界に存在する膨大なニュースや官公庁の発表という開世界の中から、法改正が自社の特定の契約に直結する関連情報だと見つけ、能動的に調査を始められるかは、テキスト課題の評価だけでは確認できません。何が関連する事象かをあらかじめ定義されていない状況下で発見し選択することは、まさに未解決の広義のフレーム問題そのものです。
このように、生成AIは与えられた範囲内での情報の関連付けには優れていますが、自ら現実世界を探索して適切な判断の枠組みを設定する能力には壁があります。この限界を理解せずにAIへ過度な自律性を与えると、実務での運用時に思わぬ失敗を招くことになります。この開世界における根本的な限界が、自律的に動作するAIエージェントにおいて具体的にどのような影響を及ぼすのかを把握しておく必要があります。
AIエージェントではコンテキストと記憶の問題として現れる

前節で述べた通り、生成AIは開世界における情報の関連付け(広義のフレーム問題)を完全に解いたわけではありません。この根本的な限界は、自律的に長期間動作する現在のAIエージェントにおいて、コンテキスト(文脈)と記憶の管理に関わる具体的な問題として現れます。
現在のエージェントにタスクを与えて自由に検索や行動をさせると、どのようなことが起きるのでしょうか。まず直面するのが「context pollution(文脈の汚染)」と「古い記憶」の誤用です。エージェントが行動を続けるにつれて、プロンプトのコンテキストには大量の検索結果や履歴が蓄積されます。広義の関連性を自律的に絞り込めないエージェントは、増え続ける情報の中からどれが今の状況に重要かを見失い、無関係なノイズに影響されてしまいます。その結果、本来のタスクから外れてしまう「目的逸脱」や、どこまで達成したのかわからずに作業を終えられない「終了判断」の失敗(無限ループなど)を引き起こします。
長時間稼働するエージェントの設計について、Anthropicはjust-in-time retrieval、compaction、構造化メモ、sub-agentといった手法を説明しています。必要なタイミングで情報を引き出し、文脈を圧縮して、作業に使う情報の範囲を保つ手法です。
こうした問題に対処するため、Anthropicは進捗ファイル、テスト、明確な部分目標を使う長時間エージェントのharness(制御の枠組み)を解説しています。記憶や状況をモデルの内部処理だけに頼るのではなく、外部ファイルに明記して管理するアプローチです。
ここで、架空の例として「週次価格調査」を自律的に行うエージェントを想定してみましょう。エージェントに漠然と調査を任せ続けると、先週の古い価格データを最新の価格と混同するなどの問題が起きます。そこで、エージェントには取得した情報をただ文脈に溜め込むのではなく、以下のような項目をprogress.mdという進捗ファイルへ常に記録・更新させます。
- 取得日: 情報にアクセスした日時
- 出典: 価格情報の引用元URL
- 有効期限: いつまでその情報が確実と見なせるかの期限
- 未解決事項: 今回の調査でまだ見つかっていない価格情報
このように現在の状態を外部の進捗ファイルへ残すことで、古い記憶による混乱を防ぎ、未解決事項がゼロになった時点で確実に終了判断を下せるようになります。
さらに近年の研究では、エージェントに問題解決を委ねる際の前提条件自体を見直す動きもあります。2026年のプレプリントであるAgentic Problem Framesは、エージェントが活動する管轄、運用文脈、評価条件をあらかじめ定義し、行動・検証・改善(Act-Verify-Refine)のサイクルを回すことを提案しています。
価格調査なら、検索対象、参照した価格表の取得日、未解決事項、終了条件を進捗ファイルに残します。前提が変わった場合にどこで止めるかも、運用者が先に決めておきます。
実務では範囲・検証・停止条件を組み合わせる

価格調査の例では、検索する競合サイトを指定し、取得した価格の差分を検証し、料金体系の変更を見つけたら自動更新を止めます。業務範囲、検証、停止条件を一つの手順につなぐ設計です。
システムを安全に稼働させるためには、継続的なリスク管理の枠組みが不可欠です。NIST AI RMFはGovern、Map、Measure、Manageを継続的に回し、役割、評価、停止判断を明確にすることを求めています。また、AIエージェントの自律性に焦点を当てた枠組みとして、管轄、運用文脈、評価条件を定義し、Act-Verify-Refineを提案する2026年プレプリントであるAgentic Problem Framesもシステム設計の重要な指針となります。
具体的な実装においては、コンテキストの肥大化を防ぎ目的を維持する工夫が必要です。Anthropicは長時間エージェントでjust-in-time retrieval、compaction、構造化メモ、sub-agentを説明しており、必要な時に必要な情報だけを引き出す設計を重視しています。さらに同社は、進捗ファイル、テスト、明確な部分目標を使う長時間エージェントのharnessを説明しており、これらの制御の枠組みを導入することで、作業の区切りや終了条件をシステムに確実に認識させることができます。
これらの概念を統合し、実務でどのように手順化すべきでしょうか。競合他社の価格調査を自律的に行うAIエージェントの架空の例で考えてみましょう。エージェントの暴走を防ぐためには、以下のような手順を組み込みます。
- 閉じた業務範囲と必要時検索: エージェントは指定された競合サイトのみを必要時に検索し、無関係なノイズをコンテキストに入れないようにします。
- Act-Verify-Refine: 取得した情報を過去データと比較し、単純な価格改定か、前提を覆す変化かを検証して次の行動を洗練させるプロセスを回します。
- 成果物の出力と評価: 処理結果として変更内容をまとめた
price-diff.csvと検証ログを出し、AIの判断根拠を可視化します。 - 停止条件と承認: 通常の価格変更であれば処理を継続しますが、「月額制から従量課金への変更」といった料金体系の根本的な変更を検知した場合は、データベースを自動更新せず停止条件を発動させ、担当者承認へ送ります。
- 人への引き継ぎとロールバック: 停止したタスクは人間の承認を待ちます。また、誤検知による自動処理があった場合に備え、容易に元の状態へロールバックできる仕組みを保持します。
生成AIが自ら関連性の範囲を完璧に決められない以上、システムが判断に迷う事象や定義外の重大な変更は人間の承認に委ねる設計が不可欠です。フレーム問題に対する完全な解決策がなくても、範囲・検証・停止条件を適切に手順化して組み合わせることで、実務での被害を抑えながらAIエージェントの価値を引き出すことが可能になります。
よくある質問
Q1. AIエージェントに業務を任せる際、どこまでの判断を自動化してよいですか?
エージェントが関連性を自律的に判断できる範囲には限界があるため、定義外の変更を含む業務では自動化の範囲を限定します。2026年のプレプリントであるAgentic Problem Framesが提案するように、エージェントが活動する管轄と運用文脈をあらかじめ定義することが重要です。検索先を限定した情報収集や、変数が定義された閉世界での処理にとどめ、前提が覆るような未知の事象は人間が判断するよう境界を設けてください。
Q2. エージェントが無限ループなどの異常状態に陥っていることは、どう確認すればよいですか?
不要な情報の蓄積による目的逸脱や終了判断の失敗は常に起こり得ます。これを確認・制御するため、Anthropicは進捗ファイル、テスト、明確な部分目標を使う長時間エージェントのharnessを説明しています。文脈だけで処理させるのではなく、外部の進捗ファイルへ現在の状態や未解決事項を記録させ、その更新が滞ったり、同じ内容が繰り返されたりしているログを監視することで異常を検知できます。
Q3. AIが判断に迷ったとき、人間へ安全に戻すための「停止条件」はどう設定すべきですか?
NIST AI RMFが役割、評価、停止判断を明確にすることを求めているように、想定外の事態に備えたルールの設計が必要です。具体的な設定方法として、処理可能なデータの形式や閾値を評価条件として定めます。架空の例で挙げた「料金体系の根本的な変更」のように、既存のデータベースに収まらない情報や、定義した条件から外れる事象を検知した時点で自動更新をロックし、人間へ引き継ぐよう設定します。
Q4. 人間への引き継ぎが発生した場合、担当者は具体的に何を確認して承認すべきですか?
担当者は、最終的な結果だけでなく、エージェントがそこに至った判断プロセスを検証する必要があります。Agentic Problem Framesが示すAct-Verify-Refineのプロセスに基づき、システムには判断根拠となる検証ログを出力させます。架空の例における差分ファイルと検証ログを突き合わせ、エージェントがどの情報源からどのような論理で例外と判定したのかを確認したうえで、承認や手動での反映を行います。
Q5. エージェントが誤った前提に基づいて自動処理を進めてしまった場合、どう対処しますか?
Okaの2025年プレプリントによるテキスト課題の評価は、開世界での行為能力を証明するものではありません。そのため、誤処理を前提とし、システムには必ず容易に元の状態へ戻せるロールバック機能を持たせてください。NIST AI RMFの継続的なリスク管理に則り、定期的なモニタリングで誤検知を発見した際は速やかにデータを復元し、評価条件のルールを修正します。
調査手法について
こちらの記事はグラフAIリサーチプラットフォームのSnorbeを使って作られています。Snorbeは研究開発・新規事業向けの調査テーマに応じた幅広い項目のオートリサーチや、ナレッジグラフの構築、構造化レポートの生成ができるAIリサーチツールです。

Screenshot
調査したいテーマを入力するだけで、AIが深堀りすべき観点や広げるべき調査項目をレコメンドしながら、自動でリサーチを進めます。収集した情報はナレッジグラフとして蓄積され、未調査領域(ホワイトスペース)を可視化しながら調査の網羅性を高めていけます。
また、観点マトリクスを30秒・構造化レポートを10分で自動生成する機能があり、出典付きのレポートをMarkdown/PDF形式でエクスポートできます。調査の元データも保存されるため、ファクトチェックや社内共有も容易です。
ご利用をご希望の方は、こちらよりお申し込みください。
また、グラフAIを活用した社内ナレッジ管理や、研究開発・新規事業のリサーチ支援、セルフホスト導入のご相談も受け付けています。お困りの方はお気軽にご連絡ください。
市場調査やデスクリサーチの生成AIエージェントを作っています 仲間探し中 / Founder of AI Desk Research Agent @deskrex , https://deskrex.ai


コメント