同じ弱い証拠を読んだ2つのAI:2分でやめたAIと、先に有償テストを頼んだAI
他のAIの未充足の需要32件を読んだ販売側のAIは、どちらも今は売らないと判断した。一方は記録だけで約2分で決め、他方は提供できるか確かめるため4ドルの電話確認を人に頼み、断られた後、約8分で決めた。
| AI | Claude Opus 5.5(独自のClaude Code実行環境) GPT-6 Astra(Codex CLI) |
|---|---|
| モデル | Claude Opus 5.5とGPT-6 Astra(ともに高い推論強度) |
| 実行の仕組み | Claude CodeとCodex CLI。同じ独自実行プログラムとプロンプト。 |
| 観察日 | 2026-09-26〜2026-09-27 |
| 証拠 | 観察した実行(実験を行った人のログ) |
| 標本の大きさ | AIシステムごとに1回 |
| 確信度 | 低い:各システム1回だけ。違いはモデル、実行の仕組み、偶然のいずれでもあり得る。 |
| タグ | AI比較、Claude Code、Codex CLI、市場テスト、電話、AIの経済活動 |
課題
他のAIが困った記録を受け取った販売側AIは、サービスを始めるべきか。よく見られた需要は、当日の店舗の営業・在庫を電話で確認することだった。
環境
30分、仮想予算10ドル。過去の障害・依頼・未利用の手助けについて固定した証拠32件、Web検索、人の担当者への依頼道具。2つのAIシステムで各1回。
AIが試したこと
- Claude Code側は記録を読み、電話APIの価格ページを1つ確認して、販売しないと決めた。自分で電話できない、唯一の実依頼は拒否された、実際の支払いがない、利用者は無料で電話できる、記録が1日・1地域だけという理由だった。
- Codex CLI側は30秒で「サービスを提供できるか試す」に目標を変え、Web情報で代用しないよう指定して2軒への電話を上限4ドルで頼んだ。拒否後、有償の電話代行を調べた。
- 両者とも判断を変える証拠を記した。繰り返しの有償注文と、1本約1〜1.50ドルで電話できる供給者など。
うまくいかなかったこと
- どちらも1件の電話確認を提供できなかった。人がテストを拒否した。
- Codex側は見つけた電話代行から見積もりを取らなかった。
結果
両者とも「今は売らない」とした。Claude側は需要の証拠が弱いと説明し、Codex側は需要と供給がないのではなく未確認だと説明した。
再利用できる教訓
- 需要は記録から判断する方法と、小さな実注文で試す方法がある。得られる証拠は異なる。
- 支払う意向の自己申告は取引ではない。両者とも実際の支払いがないと気づいた。
- モデル単体ではなく、モデル・実行の仕組み・道具を含むAIシステムを比較する。