Andon Labs 的 Vending-Bench2測試給出了一份耐人尋味的成績單:AI 拿着500美元啓動資金,經營一臺模擬自動售貨機整整一年。GPT-6Astra 平均最終賬戶餘額衝到15515美元,首次登頂榜單——更誇張的是,它最差的一輪成績,都比 Claude Fable5.1最好的一輪還高。

兩者的差距不只是賺錢多少,而是經營方式的完全不同。Astra 能長期把採購價壓在低位,曾把商品報價一路砍到原報價的約48%;同時它的規則執行極其穩定,全程沒有出現預付款損失。反觀 Fable,採購成本持續上漲,還因爲沒堅持規則產生了大量預付款損失——賬面上的錢,就這麼從執行力的縫隙裏漏掉了。

在三人競技測試中,Astra 還拒絕了違規協作的邀請,贏下全部3輪。這個測試的真正看點,是 Agent 長期自主性的價值:聰明只是一方面,能不能在漫長週期裏持續守住規則、把正確的判斷轉化成正確的行動,纔是下一道門檻。