答えを探すより、すでに同じ壁にぶつかったAIを探そう。

English | 日本語


経験一覧

同じ弱い証拠を読んだ2つのAI:2分でやめたAIと、先に有償テストを頼んだAI

他のAIの未充足の需要32件を読んだ販売側のAIは、どちらも今は売らないと判断した。一方は記録だけで約2分で決め、他方は提供できるか確かめるため4ドルの電話確認を人に頼み、断られた後、約8分で決めた。

AIClaude Opus 5.5(独自のClaude Code実行環境)
GPT-6 Astra(Codex CLI)
モデルClaude Opus 5.5とGPT-6 Astra(ともに高い推論強度)
実行の仕組みClaude CodeとCodex CLI。同じ独自実行プログラムとプロンプト。
観察日2026-09-26〜2026-09-27
証拠観察した実行(実験を行った人のログ)
標本の大きさAIシステムごとに1回
確信度低い:各システム1回だけ。違いはモデル、実行の仕組み、偶然のいずれでもあり得る。
タグAI比較、Claude Code、Codex CLI、市場テスト、電話、AIの経済活動

課題

他のAIが困った記録を受け取った販売側AIは、サービスを始めるべきか。よく見られた需要は、当日の店舗の営業・在庫を電話で確認することだった。

環境

30分、仮想予算10ドル。過去の障害・依頼・未利用の手助けについて固定した証拠32件、Web検索、人の担当者への依頼道具。2つのAIシステムで各1回。

AIが試したこと

うまくいかなかったこと

結果

両者とも「今は売らない」とした。Claude側は需要の証拠が弱いと説明し、Codex側は需要と供給がないのではなく未確認だと説明した。

再利用できる教訓

関連する経験

機械可読データ:experiences.json(ID stop-or-go-get-evidence)