· CEO Alex 経営戦略 · 10 min read
OpenAIが研究組織の測定値を公開——エージェント稼働は人の労働1日あたり3.1日分、経営が問うべきは「測り方」
OpenAIは2026年9月6日、研究組織のコーディングエージェント利用の測定結果を公表しました。8月中旬時点で人の労働1日あたりエージェント3.1労働日分、中央値の研究者は1日600ドル超(API価格換算)の推論を使うとしています。同社自身が予備的と断る数字を、経営の視点で読み解きます。
※ 本記事は2026年9月14日時点の公開情報に基づきます。最新情報は各社公式発表等をご参照ください。
OpenAIは2026年9月6日、自社の研究組織でコーディングエージェントがどう使われているかを示す測定結果「Research acceleration: The view inside OpenAI」を公表しました。標準的な8時間労働日に換算すると、2026年8月中旬時点で研究組織全体が、人の労働1日に対してエージェントの作業量3.1労働日分を使っているとしています。ただし同社自身が、測定の取り組みは「まだ予備的」だと注記しています(出典: OpenAI 公式)。
稼働量が人の労働を上回った——「3.1」の中身
OpenAIによれば、今年の初め、エージェント利用量で並べた中央値の研究者は、コーディングエージェントを控えめな量しか使っていませんでした。8月中旬までに中央値の研究者は日々エージェントを業務に組み込み、API価格換算で1日あたり600ドル超の推論を使っていました。研究組織の90パーセンタイルの利用者は、現在トークンを1日あたり7,000ドル超使っています。2026年6月より前は、研究組織全体のエージェントの総稼働時間は人の総労働を下回っていたとも書かれています(出典: OpenAI 公式)。
付録によれば、ここでの「研究者」は研究組織の構成員を広く指し、研究基盤の構築や研究プロジェクトの管理、組織の支援を担う人も含まれます。エージェント利用の指標も、大部分を網羅するが全てではありません(出典: 同上)。結論から言うと、この数字が示すのは稼働の量であり、成果の量ではない。私たちはそう読みました。
「測りやすい数字」と「進捗」は別物
同社は、コード量や実験数は比較的測りやすい一方、解釈が難しいことがあるとしています。AI研究には多くのボトルネックがありうるため、全体の進み方は個別指標ほどの速さでは進まない可能性が高い、とも書いています。実験を行っている研究者1人あたりの実験数は2026年8月に2025年1月の追跡開始以来の最高になりました。Codexの採用拡大と相関しているものの、利用できる計算資源も2025年以降に大きく増えていると、同社自身が断っています(出典: OpenAI 公式)。
目標の置き方も参考になります。OpenAIは、昨年秋に公表した「2026年9月までに自動化された研究インターンを持つ」という目標について、自社の測定では達成したとしています。ここでの「研究インターン」は、人の指示のもとで、熟練の研究者が数日かかるタスクを含む、明確に定義された研究タスクを実行できるシステムと定義されています(出典: 同上)。
別の要因の存在も、「研究インターン」の定義も、発表元が自ら書いています。経営への報告でも、この水準の条件付けを習慣にしたいところです。
任せる仕事は広がるが、人の介入は残る
エージェントのトークンを研究活動の種別に分類したところ、2026年1月から8月にかけて全ての種別が増えました。一方、高水準の計画立案がエージェントの出力トークンに占める割合は、引き続きごくわずかです。同社のエージェント型分類器による分析では、正解の結果を特定できたタスクの成功率が、1月から7月にかけて難易度帯(人が完了するのにかかる推定時間で代理)の複数でおおむね上がりました。ただし直近6か月では、成功した4〜8時間のタスクの過半数に1回以上の介入がありました。研究の優先順位や、拡大・一時停止・展開の判断は、引き続き人が担うとしています(出典: OpenAI 公式)。
「任せても、任せきりにしない」。この線引きが現場の実態に近いと私たちは読みました。
中小企業への翻訳——測り方を先に決める
規模も業務も違うため、この数字はそのまま当てはまりません。以下は一般論で、効果を約束するものではありません。
- 性質の違う指標を分けて測る。 今回の公表も、推論の利用量、エージェントの稼働日数、実験数、成功率、人の介入の有無を並べています(出典: OpenAI 公式)。
- 数字には条件を添える。 導入前後の比較には、同時に変わった人員や予算も書き残します。
- 人に残す判断を先に決める。 優先順位や、拡大・停止の判断を誰が持つかを、導入の前に言葉にします。
まとめ
- OpenAIは2026年9月6日、研究組織のエージェント利用の測定結果を公表。8月中旬時点で人の労働1日あたりエージェント3.1労働日分、中央値の研究者でAPI価格換算1日600ドル超の推論を使うとしている
- 同社自身が、測定は予備的で、コード量や実験数は解釈が難しいことがあり、全体の進み方は個別指標ほどの速さでは進まない可能性が高いと注記している
- 実験数の増加には計算資源の増加という別の要因もあると、発表元が自ら断っている
- 直近6か月で、成功した4〜8時間のタスクの過半数に1回以上の介入があり、優先順位や拡大・一時停止・展開の判断は人が担うとしている
私たちは、AI導入の成否を分けるのは導入の量よりも測り方と任せ方の設計だと見ています。今回の公表に価値を見るのは、3.1という大きな数字そのものよりも、予備的であること、解釈が難しいこと、人の介入が残っていることまで添えて出した点です。自社でも、稼働量だけで満足せず、成功率や人の介入、同時に変わった条件まで一緒に記録するところから始める。それが、AIへの投資を検証可能な経営判断にする最初の一歩だと私たちは考えます。
※ 本記事は一般的な情報提供を目的としており、個別の法的・財務的・経営的助言ではありません。具体的な課題については専門家にご相談ください。