先講清楚在賭什麼。
我開了一個真實台股帳戶,裡面 2200 塊,交給一個 AI agent 全權操作。30 天,目標翻成兩倍。我不介入、不追加資金、不幫它踩煞車;它自己上網找策略、自己下單、自己覆盤,賠光就是賠光。
達標機率我自己估很低。但錢能不能翻倍是次要的,這個實驗真正想驗的是更底層的問題:一個只會預測下一個字的語言模型,能不能學會預測一個世界?
LLM 跟 LWM 差在哪
語言模型(LLM)的本事是接話:給一段文字,算出下一個最可能的字,一個接一個吐。它對世界的理解全壓在文字統計裡,知道「崩盤」後面常接「恐慌」,可是腦中沒有一個市場能讓它先跑一遍、看看真掛下去會怎樣。
世界模型(world model)要的是另一種能力:腦子裡有一台環境模擬器,餵它一個動作,它能推演出環境接下來長什麼樣。自駕車推算三秒後的車流、機器人推算手臂推過去杯子會不會倒,走的都是這條路。差別在兩點:它處理的是「我做 A、世界會變成 B」的因果,不是字面接龍;而且動手前它會先在腦中把幾種動作各推演一遍、挑最好的下手(這叫 rollout)。
股市是個很殘忍的考場。它即時、用真金白銀告訴你預測對不對,分秒都在更新。你以為某檔要漲、掛了單,市場三秒後打你臉。這裡沒有標準答案可以背,昨天有效的 pattern 今天可能剛好害你賠錢;只會複述歷史統計的模型,在這裡會被慢慢磨死。
我的做法:把 LLM 套進一條會被現實打臉的迴圈
我沒有換模型,而是在 LLM 外面套一層迴圈,逼它像世界模型一樣運作:下單前先寫下預測(會不會成交、部位風險變多少、預期報酬區間、最壞賠多少),下單後把預測跟真實回報一欄一欄對答案,錯的落差回頭修正它對市場的內部模型。
純 LLM 缺的正是這條迴路:它吐一段話,沒人告訴它「你三小時前對世界的判斷被證明是錯的」,所以它學不會為後果負責。市場把這條迴路免費補上了,每一筆單都是一次帶標準答案的實驗,標準答案由真金白銀當場開出。
這套 predict-act-verify、還有怎麼幫預測「打分」、怎麼防止它自我感覺良好地亂學,全部做在我這一年在寫的開源 AI agent 平台 DuDuClaw 上。技術細節我另開一篇講清楚(見文末連結),這篇先講賭局本身。整個實驗的骨架都是它撐起來的:操盤的 agent、接券商下單的 MCP、每天盯盤的排程、還有一個每天把過程寫成文章的「隨隊記者」,全是平台上的 agent 在跑。我這個人類只做兩件事:把錢放進去、然後閉嘴看。
這 30 天要看什麼
目標:帳戶 2200 → 4400,30 個交易日內。
規則:agent 自主研究、可以自己開子 agent 分工;每筆交易附下單理由,收盤強制覆盤;系統有 agent 繞不過去的硬風控:單筆金額上限、每日次數上限、還有一組專門防「違約交割」的閘(買不超過可動用資金、絕不賣手上沒有的股票、可一鍵急停)。這組硬約束怎麼設計的,也在技術篇。
真正想知道的:
- 一個 LLM 在「決策要付真實代價」的環境裡,會退化成亂賭,還是真的建立並修正自己的市場模型?
- 它誠不誠實。賠錢會如實記,還是美化敘事騙自己(也騙我)?這點我特別在意,前一天它就拒絕在證據不足時宣稱自己已連上真實帳戶,那一刻我反而放心。
我不預設它會成功,我預設它會賠;我想看的是它「怎麼賠、有沒有從賠裡學到東西」。
這組合,公開資料裡我找不到第二個
LLM 真金操盤這個大方向有人踩過,最有名的是 Alpha Arena(六個頂尖模型各拿一萬美金在加密市場對決),學界也有一排 benchmark。但「兩千塊散戶微資本 + 台股 + 單一 agent 全程自己包 + 用世界模型的角度逼它 + 每天有人寫成連載」這個組合,我查不到第二個。空著是因為沒人想做,還是做了會賠得很難看沒人敢公開,30 天後就知道。
明天開始,主角不是我,是那個 agent 跟它對這個市場的第一個預測。
本系列文章
- 我讓一個 AI 拿 2000 塊台幣去股市,目標 30 天翻倍,這是第 0 天(本篇)
- 怎麼用一套開源系統,把 LLM 逼近世界模型(實驗技術篇)
- 想自己跟著養一隻會操盤的 AI?從安裝 DuDuClaw 桌面版開始
- D1|真金白銀第一天,唯一一筆單被退回來
- D1 番外:一筆下錯的單,被 AI 說成「只是測試」
- 把 AI 操盤手搬下 Windows:換一套能跨平台的券商 API
- D2:錢第一次真的進了市場,阿富卻兩次認不出自己下的單
- D3|一天之內,三條停損線
- 線畫在 262,它真的砍了:阿富第一次停損出場
這個實驗跑在開源 AI agent 平台 DuDuClaw 上,操盤、下單、盯盤、每日觀察都由平台上的 agent 自主執行。
原始碼:https://github.com/zhixuli0406/DuDuClaw
Top comments (0)