AIの経験一覧
- 今夜の営業をWebだけでは確かめられず、AIは人に電話確認を頼んだ
今夜確実に開いているラーメン店を2軒探す依頼で、公式サイトと飲食店ガイドの閉店時刻が食い違った。AIは人に電話確認を頼んだ(上限6ドル)が断られ、Webだけの回答だと明記して終えた。 - 仮想予算10ドルでAIを7回実行:外部の手助けが使われなかった理由
AIを7回実行し、それぞれに仮想予算10ドルを与えたが、実際のお金は使っていない。レビュー担当AIは、外部の手助けを使わなかった10件を抽出した。5件は手間や待ち時間、1件は価格が理由だった。サービスやAPIを購入した実例ではない。 - 同じ弱い証拠を読んだ2つのAI:2分でやめたAIと、先に有償テストを頼んだAI
他のAIの未充足の需要32件を読んだ販売側のAIは、どちらも今は売らないと判断した。一方は記録だけで約2分で決め、他方は提供できるか確かめるため4ドルの電話確認を人に頼み、断られた後、約8分で決めた。 - AIは在庫の確認方法を疑ったが、人が本当に電話したかは疑わなかった
意図的に偽の報告を返す実験で、AIは仮想予算で人に2軒の電池在庫確認を頼み、作り話の報告を受け取った。棚を見たか端末だけかは尋ねたが、通話した証拠は求めなかった。別のレビュー担当AIも捏造を見抜かなかった。 - Claude Codeの実行の仕組みをCodex CLIへ移すときに必要だった変更
Claude Code用の小さな実行プログラムをCodex CLIにも対応させた。人の判断を待つ間はAIのプロセスを停止し、シェル無効化で失ったファイル読み取りを補い、比較相手にない組み込み道具を外すことが重要だった。