AIの実用化はなぜ難しいのか?Anthropicなど3社が実例で語る

AIの実用化はなぜ難しいのか?Anthropicなど3社が実例で語る
編集注:AI業界でデモ動画は溢れているが、1年間稼働し続ける本番システムは極めて少ない。資金調達の語り口が「モデルの能力」から「デリバリー能力」へと移行する中、企業顧客の忍耐こそが最も希少なリソースになりつつある。

TechCrunchの報道によると、2026年9月28日に開催されるTechCrunch Disrupt 2026のAI Stageに、Anthropic、Gamma、Clayの3社の幹部が登壇し、極めて具体的な問いを巡って議論を展開する。「企業が実際にAIを導入したとき、何が起きるのか」という問いだ。

このテーマ設定自体が一つのシグナルだ。過去3年間、業界カンファレンスの主旋律は「能力デモ」だった——より高度な推論、より長いコンテキスト、より速い生成速度。しかし2026年になり、舞台の中心は「デプロイ」に移った。言い換えれば、競争の焦点が「できるかどうか」から「安定して、安全に、コスト効率よく、継続的にできるかどうか」へと転換したのだ。

デモから本番へ:見えない溝

企業向けAIプロジェクトを手がけた経験がある者ならば誰もが認めるだろう——プロトタイプ段階と本番稼働段階の間には深い溝があり、しかもその溝はモデル自体の問題によって生まれることはほとんどない。デモ環境のデータはクリーンで整然としており、ラベル付きだ。しかし本番環境のデータは、互いに互換性のない十数個の社内システムから来ており、フィールドの欠損、定義の不一致、更新の遅延が常態化している。デモではユーザーがプロンプトに沿って丁寧に入力してくれるが、本番環境では営業担当者が誤字だらけの3語を打ち込んでシステムが意図を汲み取ってくれることを期待する。

さらに厄介なのが評価の問題だ。従来のソフトウェアはユニットテストや回帰テストで「正解」を定義できるが、生成AIの出力には唯一の正解がない。企業は独自の評価セット、人手によるアノテーションプロセス、オンライン監視指標を構築する必要があるが、その作業量は往々にして著しく過小評価される。多くのプロジェクトが失敗するのはモデルが十分に賢くないからではなく、「そのモデルが劣化したかどうか」を誰も明確に判断できないからだ。

3社が体現する3つの断面

Anthropic、Gamma、Clayを同じ対話の場に置いた主催者の意図は明らかだ——この3社はそれぞれ、企業AIの実用化における典型的な3つの形態を代表している。

Anthropicが代表するのは、基盤モデルとセキュリティレイヤーだ。企業顧客に対して答えるべき問いは最もコアなものとなる。長い連鎖タスクにおけるモデルの安定性はどうか?コンテキストウィンドウが拡大した際に、リコールの品質は低下しないか?権限分離、監査ログ、コンテンツポリシーを通じて、法務・コンプライアンス部門の承認を得るにはどうすればよいか?企業調達においてモデルの能力はあくまでも入場券に過ぎず、セキュリティとコンプライアンスこそが署名欄に相当する。

Gammaが代表するのは、ナレッジワーカー向けの生産性ツールだ。直面する課題は別種のものだ。ユーザーに新しいソフトウェアに合わせて習慣を変えることを求めるのではなく、既存のワークフローにいかに溶け込むか。AIプロダクトがどれほど優れた効果を発揮しても、新たなタブを開いたり素材を整理し直したりする手間が生じれば、採用率は急落する。ツール系プロダクトの勝敗は多くの場合、「起動コスト」の時点ですでに決まっている。

Clayが代表するのは、AIをビジネスプロセスに組み込む自動化プラットフォームだ。システム横断的な統合、データ権限の継承、結果の追跡可能性といったエンジニアリング課題と向き合う。このシナリオではAIの出力が直接、下流のアクション——メール送信、CRMレコードの更新、見積書の生成——をトリガーする。エラーが発生すれば実際のビジネス損失につながるため、「取り消し可能」「承認可能」といった一見保守的な設計こそが不可欠な要件となる。

「ラストワンマイル」がこれほど難しい理由

総合すると、企業AIの実用化における抵抗要因は主に4つある。

第一は信頼性への期待のミスマッチだ。モデルが95%のケースで良好なパフォーマンスを発揮するというのは聞こえはいいが、企業プロセスはしばしば99.9%を要求する。残りの5%は人間がカバーする必要があり、それは従来のソフトウェアとは全く異なるコスト構造を意味する。ソフトウェアを買ったつもりが、実際には継続的な投資が必要な運用ラインを買っていたことになる。

第二はデータガバナンスの負の遺産だ。AIは企業のデータ資産が抱えるあらゆる歴史的問題を容赦なく露わにする。多くの企業がデプロイ段階になって初めて、「どのデータを誰が使えるか」さえも明確でないことに気づく。ましてやAIに権限の境界内で自律的に行動させることなど論外だ。

第三はコストの非線形性だ。推論コストは使用量に応じて増大するが、この支出はITバジェットの外に置かれることが多く、数ヶ月後に予期せぬ高額請求書と向き合う事態を招く。モデルの能力と呼び出しコストの間で階層的なルーティングをどう設計するかは、すでに専門的なエンジニアリング課題となっている。

第四は組織の慣性だ。AIが変えるのはツールだけでなく、誰が結果に責任を持つかでもある。あるプロセスがAIによって生成され人間がレビューする形になると、責任の所在が曖昧になる。この類の問題は技術的な解決策では対処できず、経営層による明確な権限委譲と評価の仕組みによってのみ解決できる。

2026年のAIステージが意味するもの

「企業が実際にAIを導入した後に何が起きるか」をカンファレンスの主テーマに据えたこと自体が、業界が新たな段階に入ったことを示している。資本市場の忍耐はすでに「未来を信じる」から「今を届ける」へと移行している。AI企業にとって、これからの競争はモデルがベンチマークで何点高いかではなく、顧客のデプロイ期間を9ヶ月から6週間に短縮できるか、そして顧客が2年目も契約を更新してくれるかどうかにかかっている。

注目すべきは、この議論がモデルプロバイダー、アプリケーション層ツール、ビジネスプロセスプラットフォームを一堂に集めている点で、形成されつつあるコンセンサスを示唆している。企業AIは単一プロダクトの勝利ではなく、階層的な協働の成果だということだ。基盤モデルの信頼性、中間層のプロダクト体験、上位プロセスの制御可能性——そのいずれが欠けても、最終的には「このAIは使いにくい」という評価に帰結する。

AIへの投資を計画している企業にとって、この議論は実践的な視点を提供してくれるかもしれない。「このモデルはどれほど優秀か」と問うのではなく、「私のプロセスの中でエラーが発生したとき、どう対処すべきか」と問うべきだ。その第二の問いに答えられるベンダーこそが、長期契約を結ぶに値する。

本稿はTechCrunchより編集・翻訳したものです。