# 30日の実証：投資会社はエージェントAIをどう検証すべきか。

AIの概念実証（PoC）の多くは、デモと本番の間のどこかで止まります。本稿は、GenbaのExperience Seatの進め方を週ごとに追います。構築前に何を固定し、荒れた入力に何を示させ、最終週をどう締めるのか。

公開日: 2026-08-08

## 要旨

- 実証は**一つの高負荷ワークフロー**に絞り、受け入れ責任者・評価基準・中止条件を構築前に合意します。
- トライアルは**完全に合成されたファミリーオフィス環境**で走ります。書き込みも承認も含めた一連のループが、実在しない場所で完結します。
- シートには**作り置きのケイパビリティは一つもありません**。責任者がTōryōに指示し、会社の最初の一つを自ら作り上げます。
- 判断は**合意済みの評価基準に対する再現可能な検証ラン**で下します。エクスポートは、どちらの結論でも御社のものです。

## 前提 :: パイロットの多くは停滞する。実証は判断のために設計する。

オーストラリア政府の調査では、AIプロジェクトの約80%が本番・実運用に到達しません。資本市場を対象としたIOSCOの調査も、この業界で同じ構図を示しています。稼働中のユースケースを持つ企業のうち、本番に到達したのは半数未満でした。共通する失敗の原因はモデルの品質ではありません。パイロットが判断を生むように設計されていなかったことです。合意された基準がなく、定められた終わりがなく、結論を引き取る人がいませんでした。

GenbaのExperience Seatは、その逆の構造を取ります。30日間、説明責任を持つ責任者一人、意味のあるワークフロー一つ、構築前に確定した成功条件、そして期日どおりのGo / No-Go。以下がその計画です。

## 1〜5日目 · 範囲設定 :: ワークフローは一つ。基準が先。

汎用アシスタントを試してはいけません。会社がすでに「何時間かかるか」で語れる、高負荷なワークフローを一つ選びます。決算説明会のトランスクリプトを投資テーゼのパラメータと照合し、メモのドラフトへ統合する業務は代表的な選択肢です。非構造化の入力、中間にある判断、最後に責任者が署名する文書。実証に必要な形が揃っています。

### ワークフロー

境界の明確な目的を一つ。入力があり、途中に判断があり、最後に誰かが署名する成果物がある業務です。プロンプト一つで済むなら何も証明できず、六つのシステムが要るならまだ証明できません。

### 受け入れ責任者

結果を受け入れるか却下するかの権限を持つ、記名の一人。委員会ではありません。構築前に評価基準に合意し、最後に検証ランを判定します。

### 評価基準

合格となる成果物の条件を明文化します。誤りなく抽出されるべきデータ項目、ワークフローに要すべき時間、そして生成されたすべての記述が検証可能な出典まで遡れるという原則です。

### 中止条件

品質・速度・コストのしきい値を定め、届かない実証を早期に、明確に終了させます。終了した実証は一つの結果です。判断できない実証こそが本当の失敗です。

## 6〜10日目 · 環境 :: 合成されたファミリーオフィスを、端から端まで。

Experienceはクライアント名義の専用シングルテナントで動作します。その中にあるのは、完全に合成されたマルチファミリーオフィス環境です。会社様式のテンプレートと過去レポートを備えた文書管理、ポートフォリオと保有状況、関係先、連絡履歴、カレンダー。実証には稼働している会社が要るので、そのように振る舞います。そして、そのいずれも実在しません。

セキュリティの議論が短く済むのはこのためです。読み取り専用の範囲を交渉する必要もありません。御社の本番システムは、そもそも接続されないからです。書き込み、承認、その帰結は合成環境の内側で完全に実行されるため、**本番書き込みゼロ**は方針上の約束ではなく、アーキテクチャの性質です。AIエージェントが認証情報を保持する瞬間は一度もありません。すべての操作は[統制された実行境界](/ja/insights/daimon-execution-boundary/)であるDaimonを通過し、受領記録とともに戻ります。御社自身の資料で試したい場合は、公開資料またはサニタイズ済み文書を同じガバナンスの下で持ち込めます。

## 11〜20日目 · 構築 :: 責任者が、会社の最初のケイパビリティを作り上げる。

シートには作り置きのケイパビリティは一つもありません。それこそが狙いです。会社の最初のケイパビリティは、その会社自身のものであるべきです。自社のテンプレート、自社のトーン、自社のしきい値で形づくられたもの。そして責任者は、それが作られていく過程そのものを体験すべきです。評価の対象は、まさにその体験だからです。

1. **目的を指示する** — 責任者が[Tōryō](/ja/insights/toryo-chief-of-staff-architecture/)に自然な言葉で指示します。「投資テーゼのパラメータに基づく四半期決算統合ワークフローを構築して」。
2. **計画をレビューする** — 計画は作業ページとして届きます。レビューでき、編集でき、責任者の承認を経てから作業が始まります。
3. **アクションとアクセスを承認する** — Tōryōが専門エージェントを編成していくのに合わせて、アクションとアクセスの要求が決裁カードとして届きます。社内チャットにも承認ページにも現れ、一つの決裁が両方を閉じます。未承認のまま進むものはありません。
4. **進行を見守る** — 進捗は短い更新として届き、タスク、担当、阻害要因、証跡など、動いているプロジェクトの状態へ直接リンクします。
5. **ドラフトを磨く** — 成果物のドラフトがレビューに届きます。構成とトーンは、環境内のテンプレートと過去事例から取ります。責任者はコメントし、方向を正し、受け入れます。
6. **会社が学んだことを確認する** — 完成したケイパビリティと、途中で得られた知見は、[Kyōzō](/ja/insights/kyozo-institutional-canon/)が管理する会社のカノンに、候補として上がります。記名レビューを経ずに再利用可能な真実になるものはありません。

## 21〜25日目 · 検証 :: 再現可能なラン、意地の悪い入力、完全な証跡。

一度だけ動いたデモは逸話にすぎません。ケイパビリティは合意済みの評価基準を繰り返し実行します。崩れた表、矛盾するトランスクリプト、欠落した期間といった、意図的に汚した入力も含めてです。解決できないものをどう検知し、どう報告するか。判定の焦点はそこにあります。規制下の会社が実際に依存するのは、そのエスカレーション挙動だからです。

すべてのランは完全な記録を残します。システムは何を依頼され、どのコンテキストを使い、何を実行し、誰が何を承認し、成果物の各記述はどこから来たのか。これは規制当局がAIを用いた投資サービスに求めつつある証跡そのものです。ESMAは、MiFID IIの行為規制・組織規制がAI利用時にも変わらず適用されることを明言しています。EU AI法の人的監督条項が求める監督・中断・自動化バイアスへの注意も、決裁カードの構造がそのまま強制するものです。

> 実証が生むのは、判断と、その判断を支える証拠です。どちらの結論でも、会社はこの一か月分だけ前へ進んでいます。

## 26〜30日目 · 判断 :: 証拠に基づいて続けるか、明確に止めるか。

受け入れ責任者が、5日目に合意した評価基準に対して検証ランを判定します。動かしていない、同じ基準です。

**継続（Go）**：Genba Oneへ進みます。同じオペレーティング・コアとガバナンス、契約条件も変えずに、合成環境だけが御社の実システムへの承認済み接続に置き換わります。Experienceで作り上げたケイパビリティはそのまま引き継がれます。影響の大きい操作は引き続きワークフローごとに段階的に許可されます。書き込みの前に読み取りの実績を、委任の前に承認済みアクションの実績を。

**中止（No-Go）**：成果物、ケイパビリティ、完全な記録をオープンな形式でエクスポートし、環境は削除されます。残存する依存はなく、無駄になる投資もなく、判断の理由は証拠ファイルが誰にでも説明します。

## 参考文献

1. [Guidance for AI proof of concept to scale](https://www.digital.gov.au/policy/ai/AI-POC-to-scale/overview) — オーストラリア政府デジタル変革庁。AIプロジェクトの約80%が本番に到達しない件について
2. [Artificial Intelligence in Capital Markets: Use Cases, Risks, and Challenges](https://www.iosco.org/library/pubdocs/pdf/IOSCOPD788.pdf) — IOSCO CR/01/2025。市場参加者184社の導入・本番化率
3. [Architecting a successful generative AI proof of concept](https://docs.aws.amazon.com/prescriptive-guidance/latest/gen-ai-lifecycle-operational-excellence/dev-architecting.html) — AWS Prescriptive Guidance。成功条件、中止条件、合成データの活用について
4. [Define your success criteria](https://platform.claude.com/docs/en/test-and-evaluate/develop-tests) — Anthropic。構築前の測定可能な基準と評価設計について
5. [Public statement on AI in investment services](https://www.esma.europa.eu/press-news/esma-news/esma-provides-guidance-firms-using-artificial-intelligence-investment-services) — ESMA。AI利用時にもMiFID II上の義務が変わらず適用されることについて
6. [Regulation (EU) 2024/1689 第14条 — 人的監督](https://eur-lex.europa.eu/eli/reg/2024/1689/oj) — 高リスクAIシステムに対する監督・中断・自動化バイアスへの要求
7. [エージェント実務のための統制された実行境界](/ja/insights/daimon-execution-boundary/) — Genba Labs Insights
8. [Tōryō（棟梁）：あらゆる義務を、一つの実務知性で](/ja/insights/toryo-chief-of-staff-architecture/) — Genba Labs Insights

## 質問と回答

### 投資会社はAIエージェントの概念実証（PoC）をどう進めるべきですか？

構築を始める前に、一つの高負荷ワークフローに範囲を絞り、成功条件を確定します。記名の受け入れ責任者、評価基準（ルーブリック）、明示的な中止条件の三点です。その上で、計画・承認・ドラフト・修正という完全なループを、実害の及ばない環境で実行します。Genbaはこれを30日間のExperience Seatとして構成します。責任者一人、合成されたファミリーオフィス環境、そして期日を定めたGo / No-Go判断です。

### Genba Experienceは概念実証の安全性をどう確保しますか？

環境そのものが合成されています。トライアル環境はクライアント名義の専用シングルテナントで、文書、ポートフォリオ、関係先、連絡履歴といった現実的なファミリーオフィスのシステムとデータを備えますが、そのいずれも実在しません。御社の実システムはそもそも接続されないため、「本番書き込みゼロ」は約束ではなく設計上の性質です。AIエージェントが認証情報を保持することも一切ありません。

### AI概念実証の成功条件はどう定めるべきですか？

構築前に三点を固定します。第一に、可否を判断する権限を持つ記名の受け入れ責任者。第二に、合格となる成果物の条件を明文化した評価基準。生成されたすべての記述が検証可能な出典まで遡れること、という条件を含みます。第三に、品質・速度・コストが基準に届かない場合に実証を明確に終了させる中止条件です。実証は一度きりのデモではなく、この基準に対して繰り返し実行されます。

### 継続しないと判断した場合、会社には何が残りますか？

実証が生んだすべてが残ります。完成した成果物、それを生み出すために構築されたケイパビリティ、そして作業の全過程の記録が、オープンな形式でエクスポートされます。その後、環境は削除されます。証拠を残して明確に止めることも、Experienceが設計上想定している結末です。ベンダーに縛られる要素は何も残りません。

### ベンダーのデモや、だらだらと続くパイロットとは何が違いますか？

デモはベンダーが用意したケイパビリティを見せるものですが、Experienceには何も用意されていません。責任者がTōryōに指示し、目的、計画、承認、ドラフト、修正という全工程を経て、会社の最初のケイパビリティを自ら作り上げます。30日目に評価されるのは、初日に合意した基準に対する、御社自身の稼働資産とその証跡です。実証は、どちらの方向であれ判断が下せるように設計されています。

### 概念実証が成功したら、その後はどうなりますか？

Genba Oneへ継続します。同じオペレーティング・コア、同じガバナンス、契約条件も変えずに、合成された環境だけが御社の実システムへの承認済み接続に置き換わります。Experienceで作り上げたケイパビリティはそのまま引き継がれ、影響の大きい操作は引き続きワークフローごとに段階的に許可されます。既定で自律化されるものはありません。
