NeoTrade:把真實交易反饋轉化為可驗證的自我改進
如果一個 AI 能夠全天候盯盤、分析新聞、自動下單,它能否發現:自己正在熟練執行的方法,已經開始失效?
一條曾經領先的信息,如今可能早已被價格消化;一個過去有效的信號,可能因為更多參與者的加入而失去優勢。Agent 仍然按時分析、嚴格執行,但市場已經變了。
這時,持續運行積累下來的經驗,能否幫助它識別問題、調整方法?再進一步,它能否改進自己尋找問題、驗證方法的能力,讓下一次學習變得更有效?
這些正是 NeoTrade 在持續探索的問題。
市場持續製造新問題,真實交易提供外部反饋,而 NeoTrade 要建立的,是把這些反饋轉化為可驗證自我改進的機制。
這項探索指向遞歸式自我改進(即 Recursive Self-Improvement,簡稱 RSI):讓 Agent 在完成任務的過程中,逐步改善自己的工作方式,以及產生下一次改進的能力。
理解這個方向,可以先從今天的 AI 如何工作說起。許多 AI 產品的核心是大語言模型,它通過訓練獲得語言、知識和推理能力,也能結合當前輸入處理新問題。但模型可能生成看似合理卻不準確的答案;在通常的使用方式下,一次成功或失敗,也不會自動更新它的模型參數,變成持久的新能力。
Agent 則是在模型之外,增加工具、記憶和行動流程,讓系統能夠圍繞目標連續工作。例如,獲取市場信息、形成判斷、調用交易接口,再檢查執行結果。組織這些能力的外層運行系統,就是本文所說的 harness。模型提供基礎能力,harness 決定這些能力如何被用於具體任務,以及經驗如何被保留、檢驗和再次使用。
NeoTrade 正在探索的技術方向,是在 Agent 的 harness 層實現遞歸式自我改進,這是一項需要通過實驗逐步驗證的研究目標。
交易為這項探索提供了具體的任務,也提供了嚴苛的檢驗。
設想一個根據新聞變化參與預測市場的 Agent。它曾經依靠某類信息源發現機會:新聞出現,市場尚未充分反應,Agent 完成分析並執行交易。
一段時間之後,情況發生了變化。更多參與者開始關注同一個信息源,價格反應更快,原有的交易窗口縮短。Agent 仍然按時獲取新聞、完成分析、發出訂單,但過去有效的方法已經失去了部分價值。
問題可能出在信息到達的時間、判斷所需的步驟,也可能出在成交成本。單純提高執行頻率,並不能確定解決其中任何一個問題。
Agent 需要重新檢查自己的工作方式:信息是否已經過時?不同報導是否只是轉述同一個來源?價格是否已經反映了這些信息?分析帶來的預期優勢,能否覆蓋手續費、滑點和推理成本?
這些問題解釋了 NeoTrade 為什麼關心自我改進。
市場中的參與者會學習,策略會被複製,流動性會遷移,機會也會隨競爭而改變。Andrew Lo 的適應性市場假說,就將競爭、適應和參與者變化作為理解市場效率的重要因素。它提供了一個有用的視角:策略的有效性依賴環境,歷史表現需要放回其發生的條件中理解。適應性市場假說
因此,一個長期運行的交易 Agent,既要執行已經驗證過的方法,也要識別這些方法何時開始失效,並調整自己的信息來源、判斷和執行方式。
"混沌是階梯"可以作為理解這一過程的比喻:市場中的信息噪聲、動態博弈和環境變化,會暴露系統的能力邊界。信息失效可以推動來源核驗,判斷偏差可以推動概率校準,執行損耗可以推動流程優化。
但這種轉化有一個前提:Agent 能夠區分信號與噪聲,並驗證變化是否有效。隨機性不會自動產生知識,波動也不意味著收益;只有經過檢驗的經驗,才可能成為後續改進的基礎。
這種適應能力,是 NeoTrade 探索 RSI 的起點。
這裡需要澄清"遞歸"的含義。根據最近的盈虧調整參數,或者在記憶中增加一條經驗,都可能是有用的學習,但還不足以證明 RSI。
遞歸式自我改進要求系統進一步改善自己尋找改進的方法。例如,Agent 發現自己的復盤總是把上漲行情誤認為策略有效,於是改進對照方法;又發現自己總會重複測試已經失敗的方案,於是改進實驗記憶與候選方案篩選。新的研究方法隨後參與下一輪改進,使系統更有機會找到有效變化。
Agent 改進的不僅是任務表現,也包括產生下一次改進的能力。
這件事對 AI 的意義,超出了交易本身。
部署到真實環境中的 Agent,會遇到訓練數據未能充分覆蓋的任務、不斷變化的工具,以及不同用戶的工作習慣。如果每一次環境變化都需要開發者逐項發現問題、重新設計流程,系統的適應速度就會受到人工維護能力的限制。
RSI 這個概念提供了一種值得探索的思路:讓系統參與觀察自己的失效、提出假設、設計實驗和保留有效改進。經過驗證的經驗可以進入下一輪工作,逐漸減少重複犯錯和重複研究的成本。
至於這種能力與更通用的智能之間的關係,NeoTrade 把它當作一個值得探索的開放問題,能否在新環境中發現自身不足、並改進學習方法本身,被一些研究視為衡量是否實現 AGI 的維度之一(Levels of AGI)。
這項探索已經有一些研究基礎。圍繞 harness 層的自我改進,現有思路大致可以歸為三類:
•通過反思和記憶改善行為。 Agent 將任務反饋整理為經驗,在後續任務中重新使用。Reflexion 展示了無需更新模型權重、通過語言反饋和記憶改善決策的方式。這是持續學習的重要基礎,但單純積累經驗還不等於遞歸改進。Reflexion
•自動優化工作流與上下文組織。 系統嘗試調整任務分解、工具調用和 Agent 之間的信息傳遞。ADAS 探索自動設計 Agent 結構;Recursive Harness Self-Improvement(下稱 RHI)則根據歷史版本的比較反饋,迭代描述 Agent 運行方式的 harness,並在包括量化金融在內的合成研究任務中進行評估。ADAS、RHI
•修改自身代碼,並搜索更好的版本。 SICA 和 Darwin Gödel Machine 讓 Agent 修改自己的工具或運行代碼,再用任務表現檢驗候選版本。DGM 進一步保留多個版本和演化分支,讓後續改進能夠從不同路徑繼續探索。SICA、DGM
這些路線說明,即使底層模型保持不變,系統也可能通過改變工作方式提升表現。
NeoTrade 希望在這些研究基礎上,進一步建立面向真實交易的持續改進機制。研究任務中的表現提升,要轉化為長期運行的交易能力,還需要面對不斷變化的市場、真實執行成本和用戶授權邊界。
NeoTrade 選擇市場作為探索環境,看重的是市場能夠為這些改進提供外部約束。
在交易中,判斷會進入真實的行動鏈條。Agent 對事件的預測最終能與結果對照;訂單是否成交、成交價格如何、等待了多久,都有記錄;策略在不同環境下的表現,也可以持續觀察。
這些後果不會因為 Agent 寫出了一篇更有說服力的復盤,就隨之改變。
這讓交易成為一種有約束力的檢驗。系統需要同時處理信息、概率、時間、成本和有限資源。一個邏輯完整的分析,如果總在機會消失之後完成,其實際價值仍然有限;一個方向正確的判斷,如果執行成本吞噬了優勢,也需要被重新審視。
真實交易由此能夠暴露僅靠文本評價不容易發現的問題:判斷與行動之間,究竟在哪一步丟失了價值?
不過,外部反饋並不等於清晰答案。
Agent 預測某事件有 70% 的概率發生,最終事件沒有發生,不能僅憑這一次結果判定預測錯誤。同樣,一筆盈利也可能來自運氣、行情或額外承擔的風險。交易數據具有低信噪比,歷史研究還容易受到幸存者偏差和過擬合影響;這些也是金融強化學習研究明確指出的困難。FinRL-Meta
好在預測市場的交易,恰好提供了一條比盈虧更快的證據通道。Agent 的每一次決策都以明確的概率形式給出,這讓"預測質量"可以用嚴格適當評分規則(proper scoring rules,如 Brier 分數)和校準曲線來度量:單次"70% 未發生"無法判定對錯,但如果一百次標注為 70% 的預測中只有四成發生,偏差就有了明確的統計證據。幾十到上百次概率預測就能形成有意義的校準評估,而等待盈虧曲線達到統計顯著,往往需要長得多的樣本。Proper Scoring Rules
NeoTrade 不承諾獲利,也不保證任何策略或 Agent 能夠持續盈利。更完善的學習機制、更準確的判斷和更嚴格的執行,仍然可能伴隨交易虧損。RSI 的研究目標是讓改進能夠被驗證,而"改進得到驗證"也只意味著它在特定條件和評價範圍內獲得了證據,不代表未來收益得到保證。
因此,NeoTrade 要解決的關鍵問題,是如何把結果整理成能夠支持改進判斷的證據。
這要求系統保留決策時的信息與時間戳、採用的配置和 skill(策略能力包)版本、決策摘要、訂單及成交記錄,並將它們與後續結果關聯起來。只有這樣,復盤才有機會區分:問題來自信息質量、概率判斷、執行流程,還是原有方法的適用條件已經改變。
評估的次序也隨之確定:校準與判斷質量的證據來得最快,執行與成本次之;PnL(盈虧)是重要的最終結果,但它最慢、噪聲最大,無法獨自解釋全部過程。
NeoTrade 正在嘗試把這套能力建立在 harness 層。具體而言,harness 負責組織記憶、上下文、工具、配置、執行與評估。即使使用同一個底層模型,不同的工作流程也可能帶來明顯不同的表現。
NeoTrade 的探索主要從幾個可迭代的組件開始:
•記憶: 將決策證據、結果和失敗條件組織成可檢索的經驗,並保留來源、時間與適用範圍。Agent 需要學會什麼時候調用經驗,也需要識別什麼時候舊經驗已經不再適用。
•代理配置(運行配置): 在授權範圍內調整信息源選擇、上下文組織、分析步驟和工具調用方式。例如,減少低價值信息的重複處理,把更多研究資源用於真正影響判斷的證據。
•技能: 對策略方法及其適用條件進行版本化迭代。一個技能可以逐步補充信息核驗、機會識別、執行檢查和失效判斷,並通過比較決定是否保留新版本。
這些組件提供了改進的入口。要進一步接近 RSI,系統還需要能夠改進它使用這些入口的方法:如何定位問題、如何提出候選變化、如何選擇實驗,以及如何判斷證據是否足夠。
NeoTrade 正在探索的方向還包括:
•錯誤歸因: 從決策與執行記錄中提出可檢驗的原因假設,識別問題可能出在信息、判斷還是執行環節,並持續改善歸因方法。
•工具生成與代碼修改: 針對反復出現的能力缺口,生成或修訂數據處理、核驗與計算工具,經測試驗證後納入工作流程。
•研究資源調度: 在既定預算內,學習何時深入分析、調用更多工具或結束研究,並把評估資源分配給更值得驗證的候選改進。
仍以新聞交易為例。代理可能發現,多篇看似獨立的報導實際來自同一個原始來源,而自己曾將它們當作相互支持的證據。它可以提出一個 harness 修改:在分析前增加來源追溯與去重。
接下來,系統需要驗證這項變化。它是否減少了重複計數?是否改善了概率判斷?增加的檢查時間會不會錯過執行窗口?效果是否只存在於用於發現問題的歷史樣本中?
這些檢驗不必從真金白銀開始:NeoTrade 的第一站是模擬市場環境的影子運行------與現行版本消費同一份即時行情、並行給出決策而不動用資金,通過獨立驗收後,才進入實盤。
如果改進有效,這個代理才值得保留。進一步地,實驗還可能幫助代理改進自己的複盤方法:以後遇到"多來源支持"的判斷時,主動檢查這些來源是否獨立。一次局部修復由此可能形成可重用的研究能力。
"可驗證"是這套機制的核心。
NeoTrade 希望每一次候選改進都有明確的問題、可追溯的變更和可比較的結果。研究中需要保留舊版本作為對照,在未參與調優的後續數據與市場環境中檢驗變化,並同時觀察預測質量(以 Brier 分數、校準曲線等適當評分規則度量)、執行可靠性、成本和風險。
所有嘗試,包括失敗版本,也應進入實驗記錄。否則,系統只展示篩選後的成功結果,就容易把偶然表現誤認為進步。
回測過擬合研究表明,在同一批數據上反復嘗試大量方案,會顯著增加發現虛假優勢的可能性。回測過擬合研究
改進循環本身就是一台候選方案的生成機器。低頻風格的實盤樣本天然稀少------一個高選擇性的代理每週可能只交易幾次------而候選 harness 版本的生成幾乎沒有成本。在小樣本上從大量候選中挑選贏家,正是上述虛假優勢機制的現場重演。
因此,驗證流程需要內置幾條對自己的約束:實驗預註冊,假設、驗收指標與樣本窗口在實驗開始前固定,事後不得更換記分方式;限制同時在測的候選數量,並對多重比較做出校正;用統計功效更高的校準類指標承擔日常篩選,讓盈虧承擔最終驗收而不是每輪評比;評估資源向少數高價值候選集中,而不是廣撒網。
與此同時,可修改的研究與執行方法,需要與用戶授權邊界區分開。代理可以提出更好的工作方式,但資金權限、可交易範圍、風險上限,以及用於判斷候選版本是否通過的獨立驗收約束,不能由它為了獲得更高分數而自行放寬。
授權邊界之外,自我改進還必須直面一個更隱蔽的對手:針對學習循環本身的攻擊。一個會把經驗寫回記憶、會修訂自己技能與工具的系統,等於把提示注入(prompt injection)的影響從一次對話延長到了未來的每一輪改進------被污染的一條"經驗",會以正常知識的面目參與後續決策。這不是假設的風險:研究者已經展示過,對開源交易代理框架的記憶注入可以誘導真實的鏈上轉帳,且注入內容能夠跨會話持續存在;也發生過自動化交易代理被注入指令、造成六位數美元損失的真實事件。Real AI Agents with Fake Memories、AIXBT 事件
因此,學習循環需要自己的防線,而不能只依賴交易環節的風控:外部內容永遠作為待分析的數據、而不是待執行的指令進入系統;經驗在寫入記憶之前經過來源標記、過濾與審計------記憶寫入本身被當作攻擊面對待;改進候選的提出與驗收相互隔離,避免同一段可能被污染的上下文既提出修改、又批准修改;實驗與經驗記錄保持只增不改,使任何異常行為都能回溯到污染源頭。催促立即行動、要求放寬風控、自稱系統通知的"經驗"內容,屬於最高優先級的紅旗。
這使自我改進成為一項有邊界、有記錄、防投毒、可以拒絕或回滾的工程過程。
NeoTrade 希望推進的創新,集中在把學習、驗證和實際運行連接起來。
這一方向的獨到之處,體現在幾個相互關聯的問題上:
•持續變化中的有效性: 不只檢查一個版本是否優於舊版本,還要識別這種優勢何時開始失效,以及系統能否重新適應。適用條件和失效證據,需要與改進一起被保存。
•包含真實成本的改進: 將預測、成交、延遲、手續費、滑點和推理開銷納入同一套評估。增加分析步驟可能提高準確性,也可能讓交易錯過時機;改進需要接受完整執行鏈條的檢驗。
•有授權邊界的自我修改: 將可演化的研究與執行方法,同獨立風控、驗收機制和學習循環的注入防護結合,讓代理能夠嘗試新方法,同時保持權限可審計、變更可撤回、經驗可溯源。
•面向具體用戶的長期適應: 在本地運行和用戶掌控數據的設計下,探索適合不同市場範圍、研究預算和風險要求的 harness。通用經驗如何遷移、個體經驗何時有效,都需要被驗證。
這些組合帶來了值得研究的新問題,也構成 NeoTrade 希望形成的工程與產品貢獻。它們的價值需要由實際運行和對照實驗建立。
隨著這項探索推進,NeoTrade 需要回答一個具體問題:在相同模型、資源預算和風險約束下,一個能夠改進自身 harness 的代理,能否更可靠地適應新的市場環境?
更有分量的遞歸證據,則要小心度量。"找到有效改進的成本隨時間下降"聽上去是自然的標準,但它帶著兩個混淆:早期改進多是低垂的果實,越往後天然越貴,成本上升並不能證偽遞歸;反過來,成本下降也可能只是市場恰好進入了更容易的階段。
市場會繼續變化。對手會學習,舊機會會消失,新的問題總會出現。
NeoTrade 希望建立的能力,是讓代理在這些變化中積累可檢驗的經驗,修正自己的方法,並讓經過驗證的改進參與下一輪學習。











