NeoTrade:リアルな取引フィードバックを検証可能な自己改善に変換する
もしAIが24時間市場を監視し、ニュースを分析し、自動で注文を出すことができるなら、それは自分が熟練して実行している方法がすでに無効になり始めていることを発見できるのでしょうか?
かつて先行していた情報は、今や価格に消化されているかもしれません。過去に有効だったシグナルは、より多くの参加者の加入によってその優位性を失う可能性があります。エージェントは依然として定期的に分析し、厳格に実行しますが、市場はすでに変わっています。
この時、継続的に運用して蓄積された経験は、問題を特定し、方法を調整するのに役立つのでしょうか?さらに進んで、問題を見つけ、方法を検証する能力を改善し、次回の学習をより効果的にすることができるのでしょうか?
これらはすべて、NeoTradeが継続的に探求している問題です。
市場は常に新しい問題を生み出し、実際の取引は外部からのフィードバックを提供します。そして、NeoTradeが構築しようとしているのは、これらのフィードバックを検証可能な自己改善のメカニズムに変換することです。
この探求は、再帰的自己改善(Recursive Self-Improvement、略してRSI)を指し示しています:エージェントがタスクを完了する過程で、自らの作業方法を徐々に改善し、次回の改善を生み出す能力を向上させることです。
この方向性を理解するためには、まず今日のAIがどのように機能しているかから始めることができます。多くのAI製品の核心は大規模言語モデルであり、これは訓練を通じて言語、知識、推論能力を獲得し、現在の入力を組み合わせて新しい問題を処理することができます。しかし、モデルは一見合理的でありながら不正確な回答を生成する可能性があります。通常の使用方法では、一度の成功や失敗が自動的にモデルパラメータを更新することはなく、持続的な新しい能力にはなりません。
エージェントはモデルの外で、ツール、記憶、行動プロセスを追加し、システムが目標に向かって継続的に作業できるようにします。たとえば、市場情報を取得し、判断を形成し、取引インターフェースを呼び出し、実行結果を確認します。これらの能力を組織する外部の運用システムが、この記事で言うハーネスです。モデルは基本的な能力を提供し、ハーネスはこれらの能力が具体的なタスクにどのように使用されるか、また経験がどのように保持、検証、再利用されるかを決定します。
NeoTradeが探求している技術的方向性は、エージェントのハーネス層で再帰的自己改善を実現することであり、これは実験を通じて徐々に検証される必要がある研究目標です。
取引はこの探求に具体的なタスクを提供し、厳しい検証を行います。
ニュースの変化に基づいて市場を予測するエージェントを想像してみてください。彼はかつて特定の情報源に依存して機会を発見しました:ニュースが出現し、市場がまだ十分に反応していないとき、エージェントは分析を完了し、取引を実行しました。
しばらくすると、状況は変わりました。より多くの参加者が同じ情報源に注目し、価格の反応がより迅速になり、元の取引ウィンドウが短縮されました。エージェントは依然として定期的にニュースを取得し、分析を完了し、注文を出しますが、過去に有効だった方法は部分的に価値を失っています。
問題は、情報が到達する時間、判断に必要なステップ、または取引コストにあるかもしれません。単に実行頻度を上げるだけでは、これらの問題のいずれかを解決することはできません。
エージェントは自らの作業方法を再確認する必要があります:情報はすでに時代遅れですか?異なる報道は同じ情報源を単に繰り返しているだけですか?価格はこれらの情報をすでに反映していますか?分析から得られる期待される優位性は、手数料、スリッページ、推論コストをカバーできますか?
これらの問題は、NeoTradeが自己改善に関心を持つ理由を説明しています。
市場の参加者は学び、戦略は模倣され、流動性は移動し、機会は競争によって変わります。アンドリュー・ローの適応的市場仮説は、競争、適応、参加者の変化を市場効率を理解する重要な要素として位置づけています。これは有用な視点を提供します:戦略の有効性は環境に依存し、歴史的なパフォーマンスはその発生条件に戻って理解する必要があります。適応的市場仮説
したがって、長期間運用される取引エージェントは、すでに検証された方法を実行するだけでなく、これらの方法がいつ無効になり始めるかを特定し、自らの情報源、判断、実行方法を調整する必要があります。
「混沌は階段である」という比喩は、このプロセスを理解するためのものとして使えます:市場の情報ノイズ、動的なゲーム、環境の変化は、システムの能力の限界を露呈させます。情報の無効化は情報源の検証を促し、判断の偏差は確率の調整を促し、実行の損失はプロセスの最適化を促します。
しかし、この変換には前提があります:エージェントが信号とノイズを区別でき、変化が有効であるかどうかを検証できることです。ランダム性は自動的に知識を生み出すことはなく、変動も利益を意味しません。検証された経験だけが、後続の改善の基盤となる可能性があります。
この適応能力は、NeoTradeがRSIを探求する出発点です。
ここで「再帰」の意味を明確にする必要があります。最近の損益調整パラメータに基づいて、または記憶に経験を追加することは有用な学習かもしれませんが、RSIを証明するには不十分です。
再帰的自己改善は、システムが改善方法を見つける能力をさらに向上させることを要求します。たとえば、エージェントは自分の振り返りが常に上昇トレンドを戦略の有効性と誤解していることに気づき、対照方法を改善します。また、失敗した方案を繰り返しテストすることに気づき、実験の記憶と候補方案の選別を改善します。新しい研究方法は次の改善に参加し、システムが有効な変化を見つける機会を増やします。
エージェントが改善するのはタスクのパフォーマンスだけでなく、次回の改善を生み出す能力も含まれます。
このことはAIにとって、取引そのものを超えた意味を持ちます。
実際の環境に展開されたエージェントは、訓練データが十分にカバーしていないタスク、絶えず変化するツール、異なるユーザーの作業習慣に直面します。環境の変化ごとに開発者が問題を一つずつ発見し、プロセスを再設計する必要がある場合、システムの適応速度は人工的なメンテナンス能力に制約されます。
RSIという概念は、システムが自らの無効化を観察し、仮説を立て、実験を設計し、有効な改善を保持することを促す探求に値する思考を提供します。検証された経験は次の作業に入ることができ、繰り返しの誤りや研究のコストを徐々に減少させることができます。
この能力とより一般的な知性との関係について、NeoTradeはそれを探求すべきオープンな問題と見なしています。新しい環境で自らの不足を発見し、学習方法自体を改善できるかどうかは、いくつかの研究によってAGIの実現を測る次元の一つと見なされています(AGIのレベル)。
この探求にはすでにいくつかの研究基盤があります。ハーネス層における自己改善に関する既存の考え方は、大きく分けて三つのカテゴリーに分類できます:
•反省と記憶を通じて行動を改善する。 エージェントはタスクのフィードバックを経験として整理し、次のタスクで再利用します。Reflexionは、モデルの重みを更新せずに、言語フィードバックと記憶を通じて意思決定を改善する方法を示しました。これは継続的な学習の重要な基盤ですが、単に経験を蓄積することは再帰的改善とは等しくありません。Reflexion
•作業フローと文脈の自動最適化。 システムはタスクの分解、ツールの呼び出し、エージェント間の情報伝達を調整しようとします。ADASはエージェント構造の自動設計を探求し、Recursive Harness Self-Improvement(以下RHI)は、歴史的なバージョンの比較フィードバックに基づいてエージェントの運用方法を記述するハーネスを反復し、量的金融を含む合成研究タスクで評価を行います。ADAS、RHI
•自身のコードを修正し、より良いバージョンを探す。 SICAとDarwin Gödel Machineは、エージェントが自分のツールや実行コードを修正し、タスクのパフォーマンスで候補バージョンを検証します。DGMはさらに複数のバージョンと進化の枝を保持し、後続の改善が異なる経路から探求を続けることを可能にします。SICA、DGM
これらのルートは、基盤モデルが変わらなくても、システムが作業方法を変更することでパフォーマンスを向上させる可能性があることを示しています。
NeoTradeは、これらの研究基盤の上に、実際の取引に向けた継続的改善メカニズムをさらに構築することを望んでいます。研究タスクでのパフォーマンス向上は、長期的な取引能力に転換される必要があり、絶えず変化する市場、実際の実行コスト、ユーザーの権限の境界に直面する必要があります。
NeoTradeは市場を探求環境として選択し、これらの改善に外部の制約を提供できる市場の特性を重視しています。
取引において、判断は実際の行動チェーンに入ります。エージェントのイベント予測は最終的に結果と照らし合わせることができます。注文が成立したか、成立価格はどうだったか、どれくらい待ったかはすべて記録されています。異なる環境下での戦略のパフォーマンスも継続的に観察できます。
これらの結果は、エージェントがより説得力のある振り返りを作成したからといって、すぐに変わることはありません。
これにより、取引は拘束力のある検証となります。システムは情報、確率、時間、コスト、限られたリソースを同時に処理する必要があります。論理的に完全な分析が、常に機会が消失した後に完了する場合、その実際の価値は依然として限られています。方向が正しい判断が、実行コストによって優位性を飲み込まれる場合も、再評価が必要です。
実際の取引は、テキスト評価だけでは容易に発見できない問題を露呈させることができます:判断と行動の間で、どのステップで価値が失われたのでしょうか?
しかし、外部のフィードバックは明確な答えを意味するわけではありません。
エージェントがあるイベントが70%の確率で発生すると予測し、最終的にそのイベントが発生しなかった場合、この一回の結果だけで予測が間違っていると判断することはできません。同様に、一つの利益も運や市場の動き、追加のリスクから来る可能性があります。取引データは低い信号対ノイズ比を持ち、歴史的研究は生存者バイアスや過剰適合の影響を受けやすいです。これらは金融強化学習研究が明確に指摘している困難でもあります。FinRL-Meta
幸いにも、予測市場の取引は、利益と損失よりも早い証拠の通路を提供します。エージェントの各決定は明確な確率形式で示され、これにより「予測の質」を厳密な適切なスコアリングルール(proper scoring rules、例えばBrierスコア)やキャリブレーション曲線で測定できます:単一の「70%未発生」は正誤を判定できませんが、100回の70%とラベル付けされた予測の中で40%しか発生しなかった場合、偏差には明確な統計的証拠があります。数十から数百回の確率予測が有意義なキャリブレーション評価を形成でき、利益と損失の曲線が統計的に有意になるまでには、しばしばはるかに多くのサンプルが必要です。Proper Scoring Rules
NeoTradeは利益を保証せず、いかなる戦略やエージェントが持続的に利益を上げることを保証するものではありません。より洗練された学習メカニズム、より正確な判断、より厳格な実行が、取引の損失を伴う可能性があります。RSIの研究目標は、改善が検証可能であることを目指しており、「改善が検証される」ということは、特定の条件と評価範囲内で証拠を得たことを意味するだけであり、未来の利益が保証されることを意味するものではありません。
したがって、NeoTradeが解決すべき重要な問題は、結果を改善判断を支える証拠として整理する方法です。
これには、システムが意思決定時の情報とタイムスタンプ、使用された設定やスキル(戦略能力パッケージ)バージョン、意思決定の要約、注文および成立記録を保持し、それらを後続の結果に関連付けることが求められます。そうすることで、振り返りは次のように区別できる機会を得ます:問題は情報の質、確率判断、実行プロセスに起因するのか、それとも元の方法の適用条件が変わったのか。
評価の順序もそれに応じて決まります:キャリブレーションと判断の質に関する証拠は最も早く得られ、実行とコストが次に続きます;PnL(利益と損失)は重要な最終結果ですが、最も遅く、ノイズが最大であり、すべてのプロセスを独自に説明することはできません。
NeoTradeはこの能力をハーネス層に構築しようとしています。具体的には、ハーネスは記憶、文脈、ツール、設定、実行、評価を組織する役割を担います。同じ基盤モデルを使用しても、異なる作業フローが明らかに異なるパフォーマンスをもたらす可能性があります。
NeoTradeの探求は、いくつかの反復可能なコンポーネントから始まります:
•記憶: 意思決定の証拠、結果、失敗条件を検索可能な経験として整理し、出所、時間、適用範囲を保持します。エージェントは経験を呼び出すタイミングを学ぶ必要があり、古い経験がもはや適用できない時期を特定する必要があります。
•エージェント設定(実行設定): 権限の範囲内で情報源の選択、文脈の整理、分析ステップ、ツールの呼び出し方法を調整します。例えば、低価値情報の重複処理を減らし、実際に判断に影響を与える証拠により多くの研究リソースを投入します。
•スキル: 戦略方法とその適用条件をバージョン化して反復します。1つのスキルは、情報の検証、機会の特定、実行のチェック、失敗の判断を段階的に補完し、比較によって新しいバージョンを保持するかどうかを決定します。
これらのコンポーネントは改善の入口を提供します。RSIにさらに近づくために、システムはこれらの入口を使用する方法を改善する必要があります:問題を特定する方法、候補の変更を提案する方法、実験を選択する方法、証拠が十分かどうかを判断する方法です。
NeoTradeが探求している方向性には以下も含まれます:
•誤帰属: 意思決定と実行の記録から検証可能な原因仮説を提起し、問題が情報、判断、または実行のどこにあるかを特定し、帰属方法を継続的に改善します。
•ツール生成とコード修正: 繰り返し発生する能力のギャップに対処するため、データ処理、検証、計算ツールを生成または修正し、テスト検証後にワークフローに組み込みます。
•研究リソースのスケジューリング: 定められた予算内で、いつ詳細分析を行い、より多くのツールを呼び出し、研究を終了するかを学び、評価リソースをより検証に値する候補改善に配分します。
ニュース取引の例を引き続き考えます。エージェントは、多くの独立した報道が実際には同じ元の情報源から来ていることを発見し、それらを相互に支持する証拠として扱っていたかもしれません。エージェントは、分析前に情報源の追跡と重複排除を追加するハーネスの変更を提案できます。
次に、システムはこの変更を検証する必要があります。それは重複カウントを減らしましたか?確率判断を改善しましたか?追加されたチェック時間は実行ウィンドウを逃すことになりますか?効果は問題を発見するために使用された過去のサンプルにのみ存在しますか?
これらの検証は真金から始める必要はありません:NeoTradeの最初のステップは、模擬市場環境の影の運用です------現行バージョンが同じリアルタイムの市場データを消費し、資金を動かさずに並行して意思決定を行い、独立した受け入れを経てから実際の取引に入ります。
改善が有効であれば、このエージェントは保持する価値があります。さらに、実験はエージェントが自分の振り返り方法を改善するのを助ける可能性があります:今後「多元的な支持」の判断に遭遇した際、これらの情報源が独立しているかどうかを積極的にチェックします。部分的な修正が再利用可能な研究能力を形成する可能性があります。
「検証可能性」はこのメカニズムの核心です。
NeoTradeは、候補改善ごとに明確な問題、追跡可能な変更、比較可能な結果があることを望んでいます。研究では、旧バージョンを対照として保持し、調整に参加していない後続データと市場環境で変更を検証し、同時に予測の質(Brierスコア、キャリブレーション曲線などの適切な評価基準で測定)、実行の信頼性、コスト、リスクを観察します。
すべての試み、失敗したバージョンも含めて、実験記録に入れるべきです。そうでなければ、システムは選別された成功結果のみを表示し、偶然のパフォーマンスを進歩と誤認しやすくなります。
バックテストの過剰適合研究は、同じデータセットで多数の提案を繰り返し試みることが、虚偽の優位性を発見する可能性を著しく高めることを示しています。バックテストの過剰適合研究
改善サイクル自体は候補案の生成機械です。低頻度スタイルの実取引サンプルは自然に希少です------選択的なエージェントは週に数回しか取引しない可能性があります------候補ハーネスバージョンの生成にはほとんどコストがかかりません。小さなサンプルで大量の候補から勝者を選ぶことは、上記の虚偽の優位性メカニズムの現場再演です。
したがって、検証プロセスには自らの制約を内蔵する必要があります:実験の事前登録、仮説、受け入れ指標、サンプルウィンドウは実験開始前に固定され、事後にスコアリング方法を変更してはならない;同時にテストされる候補の数を制限し、多重比較に対して補正を行う;統計的な有効性の高いキャリブレーション指標を日常的な選別に使用し、利益と損失が最終的な受け入れを担うようにし、各ラウンドの評価ではなく;評価リソースを少数の高価値候補に集中させ、広く撒くのではなく。
同時に、修正可能な研究と実行方法は、ユーザーの権限の境界と区別する必要があります。エージェントはより良い作業方法を提案できますが、資金の権限、取引可能範囲、リスク上限、および候補バージョンが通過するかどうかを判断するための独立した受け入れ制約は、より高いスコアを得るために自ら緩和することはできません。
権限の境界を超えて、自我改善はより隠れた敵に直面しなければなりません:学習サイクル自体への攻撃。経験を記憶に書き戻し、自分のスキルやツールを修正するシステムは、プロンプトインジェクションの影響を一度の対話から将来のすべての改善に延長します------汚染された「経験」は、正常な知識の形で後続の意思決定に参加します。これは仮定のリスクではありません:研究者は、オープンソースの取引エージェントフレームワークへの記憶注入が実際のオンチェーン転送を誘導できることを示しており、注入された内容はセッションを超えて持続することができます;自動化取引エージェントが指示を注入され、6桁のドル損失を引き起こした実際の事件も発生しています。Real AI Agents with Fake Memories、AIXBT事件
したがって、学習サイクルは自らの防線を必要とし、取引段階のリスク管理にのみ依存することはできません:外部の内容は常に分析待ちのデータとして、実行待ちの指示としてシステムに入ります;経験は記憶に書き込まれる前に情報源のマーク、フィルタリング、監査を経て------記憶の書き込み自体が攻撃として扱われます;改善候補の提案と受け入れは相互に隔離され、同じ汚染される可能性のある文脈が修正を提案し、同時に修正を承認することを避けます;実験と経験の記録は増加のみを保持し、変更を加えず、異常な行動が汚染の源に遡ることができるようにします。即時行動を促す、リスク管理の緩和を要求する、自称システム通知の「経験」内容は、最高優先度の警告です。
これにより、自我改善は境界があり、記録があり、毒の投与を防ぎ、拒否またはロールバックできるエンジニアリングプロセスとなります。
NeoTradeが推進したい革新は、学習、検証、実際の運用を結びつけることに集中しています。
この方向性の独自性は、いくつかの相互に関連する問題に現れています:
•継続的な変化における有効性: ただ1つのバージョンが旧バージョンより優れているかどうかを確認するだけでなく、その優位性がいつ失効するか、システムが再適応できるかを特定する必要があります。適用条件と失効証拠は、改善と共に保存される必要があります。
•実際のコストを含む改善: 予測、取引、遅延、手数料、スリッページ、推論コストを同一の評価に組み込みます。分析ステップを増やすことは精度を向上させる可能性がありますが、取引のタイミングを逃す可能性もあります;改善は完全な実行チェーンの検証を受け入れる必要があります。
•権限の境界を持つ自己修正: 進化可能な研究と実行方法を、独立したリスク管理、受け入れメカニズム、学習サイクルの注入防護と組み合わせ、エージェントが新しい方法を試みることができるようにしつつ、権限を監査可能に、変更を撤回可能に、経験を追跡可能に保ちます。
•具体的なユーザーに向けた長期的適応: ローカルで実行し、ユーザーがデータを管理する設計の下で、異なる市場範囲、研究予算、リスク要件に適したハーネスを探求します。一般的な経験がどのように移行するか、個別の経験がいつ有効であるかは、検証される必要があります。
これらの組み合わせは、研究に値する新しい問題をもたらし、NeoTradeが形成したいエンジニアリングと製品の貢献を構成します。それらの価値は、実際の運用と対照実験によって確立される必要があります。
この探求が進むにつれて、NeoTradeは具体的な質問に答える必要があります:同じモデル、リソース予算、リスク制約の下で、自身のハーネスを改善できるエージェントは、新しい市場環境により信頼性を持って適応できるでしょうか?
より重みのある再帰的証拠は、慎重に測定する必要があります。「有効な改善のコストは時間とともに低下する」と聞こえますが、それは2つの混乱を伴います:初期の改善は多くが低い果実であり、後に行くほど自然に高価になり、コストの上昇は再帰を否定するものではありません;逆に、コストの低下も市場がちょうどより容易な段階に入っただけかもしれません。
市場は変わり続けます。競争相手は学び、古い機会は消え、新しい問題が常に現れます。
NeoTradeが確立したい能力は、エージェントがこれらの変化の中で検証可能な経験を蓄積し、自らの方法を修正し、検証された改善を次の学習に参加させることです。











