Andon Labs の Vending-Bench2テストでは、興味深い成績が示された: AIは500ドルの初期資金を持って、1年間シミュレーションされた自動販売機を運営した。GPT-6Astraは最終的な平均口座残高が15,515ドルに達し、初めてランキングトップに立った—さらに驚くのは、最も悪いラウンドでもClaude Fable5.1の最高ラウンドを上回っていた。

両者の差は収益の多さだけでなく、経営スタイルの違いにもある。Astraは長期的に仕入れ価格を低く抑えることができ、商品の価格を元の価格の約48%まで引き下げたことがある。また、そのルールの実行は非常に安定しており、全体を通して前払い損が出なかった。一方でFableは、仕入れコストが継続的に上昇し、ルールを堅持しなかったため、多くの前払い損が発生した—このようにして、帳簿上のお金は、実行力の隙間から漏れていった。

3人対戦テストでは、Astraは不正な協力を依頼されたにもかかわらず、すべての3ラウンドを勝ち取った。このテストの本当の注目点は、エージェントの長期的な自律性の価値である: 賢さは確かに重要だが、長い期間にわたってルールを守り続け、正しい判断を正しい行動に変えていく能力こそが、次のハードルとなる。