AIモデルが生物学データを渇望、OpenAIが資金投入して自ら製造へ

AIモデルが生物学データを渇望、OpenAIが資金投入して自ら製造へ

編集者注:大規模言語モデルがテキストの世界で急速に進化を続ける一方、生物学分野のAIはより根本的な問題に直面している——学習に十分なデータが存在しないのだ。MIT Technology Reviewの報道によると、OpenAIは資金を投じ、自らそのデータを製造しようとしている。

生物AIに立ちはだえる見えない天井

過去2年間、AIはタンパク質構造予測、分子生成、創薬スクリーニングなどの領域で次々と成果を上げてきた。しかし業界では、モデルの性能を制約しているのはアルゴリズムではなくデータであるという認識が広まりつつある。インターネット上のテキストデータは数兆トークン規模に上るが、生物学分野の高品質データは実験室のノート、企業内部システム、規制当局への申請書類に散在しており、規模は限られ、フォーマットは統一されておらず、入手の難易度も極めて高い。

さらに問題なのは、生物データの中でもとりわけ価値の高い部分が、最も公開されていない部分でもあるという点だ。臨床試験の失敗結果、医薬品の安全性データ、製造工程のパラメータといった情報は、商業上の機密として厳重に管理されているか、「失敗は発表するに値しない」という慣行からパブリックドメインに出ることなく埋もれている。その結果、AIモデルは少数の成功事例を繰り返し学習する一方、大多数の失敗事例については何も知らないという状況が生まれている。

破綻企業に眠る「データの金鉱」

臨床試験政策アナリストのRuxandra Tesloは、かつて独創的なアイデアを提唱した。失敗したバイオテクノロジー企業からデータを探すというものだ。彼女の論理はこうだ——バイオテクノロジー企業が破綻すると、その資産は清算・競売にかけられ、入札者は詳細な規制当局への申請書類、製造戦略、安全性データにアクセスできる機会が生じる。これらの情報は、通常の事業期間中はコアな営業秘密として厳重に管理されているものだ。

「破産手続きへの参加・入札を通じて、詳細な規制申請書類、製造戦略、安全性データ——通常は営業秘密として隠されているこれらの情報——を入手できる可能性がある。」

この提案が注目を集めるのは、長年見過ごされてきた事実を指摘しているからだ——失敗のデータにも価値があり、AI学習という観点ではむしろより高い価値を持つ場合がある。成功した分子しか見たことのないモデルは、何が危険かを学べない。大量の失敗事例を学習に組み込んで初めて、生体システムの複雑性を真に理解できるようになる。

OpenAIが自ら資金を出す理由

MIT Technology Reviewの報道によると、OpenAIは資金を投入して新たな生物学データセットの生産を推進しようとしている。この動きが示唆するのは、公開データはもはや十分ではないという現実だ。学術界が論文を発表するのを待ち、製薬企業が内部記録を公開するのを待つよりも、データの収集・生成に直接資金を提供し、「データ生産」を調達可能なサービスとして確立する方が合理的だという判断だ。

これはOpenAIがこれまで数学、コード、マルチモーダルなどの分野で取ってきた戦略と一貫している——インターネット上の既存コーパスが枯渇すると、最先端の研究機関は特定分野向けにデータをカスタム生成するようになる。生物学の文脈では、これはウェットラボへの資金提供、専有データセットの購入、研究機関との連携による新たなアノテーション体系の構築を意味する。コストは高いが、一定規模に達すれば後発組が容易に模倣できない参入障壁となりうる。

データの堀と営業秘密のせめぎ合い

しかし、「破綻企業からデータを買う」という道は平坦ではない。規制当局への申請書類や製造記録は患者のプライバシー、知的財産権、商業競争に関わることが多く、清算競売におけるデータの譲渡は法的紛争を引き起こす可能性がある。また、データを入手できたとしても、標準化・匿名化・コンプライアンスの確保は依然として大きな課題だ。AI企業にとって現実的な選択肢は、実験室・病院・製薬企業と連携を構築し、データの生産と共有に直接資金提供することかもしれない。

一方、バイオテクノロジー業界内部でも議論が続いている——AI企業にデータを提供することは、資金と効率を得る取引なのか、それとも将来の競合相手を育てることになるのか?この緊張関係が、生物データ市場の開放度を長期にわたって左右することになるだろう。

データを制する者が、生物AIを制する

より広い視点から見れば、OpenAIのこの資金投入は業界全体の転換を映し出している——AI競争は「モデルの優劣を競う」段階から「データの優劣を競う」段階へと移行しつつある。汎用テキスト分野ではデータの恩恵が頭打ちになりつつある一方、生物学・材料科学・医療などの垂直分野では、高品質で独占的なデータパイプラインをいち早く確立した者が真の競争優位を築ける可能性がある。

これはまた、今後数年で「AI企業が資金を出して実験を行う」という光景が増えることも意味している——論文を発表するためではなく、モデルを学習させるためだ。バイオテクノロジー業界が数十年かけて蓄積してきた「ダークデータ」は、いま再評価されようとしているのかもしれない。

本記事はMIT Technology Reviewより編訳