NeoTrade: 실제 거래 피드백을 검증 가능한 자기 개선으로 전환
만약 AI가 24시간 시장을 모니터링하고, 뉴스를 분석하며, 자동으로 주문을 내릴 수 있다면, 그것이 스스로 익숙하게 수행하고 있는 방법이 이미 효과를 잃어버렸다는 것을 발견할 수 있을까요?
한때 선도적인 정보는 이제 가격에 의해 소화되었을 수 있습니다; 과거에 유효했던 신호는 더 많은 참여자가 추가됨에 따라 우위를 잃을 수 있습니다. 에이전트는 여전히 정시에 분석하고, 엄격하게 실행하지만, 시장은 이미 변했습니다.
이때, 지속적으로 운영되며 축적된 경험이 문제를 인식하고 방법을 조정하는 데 도움이 될 수 있을까요? 더 나아가, 스스로 문제를 찾고 방법을 검증하는 능력을 개선하여 다음 학습을 더 효과적으로 만들 수 있을까요?
이것이 바로 NeoTrade가 지속적으로 탐구하고 있는 문제입니다.
시장은 지속적으로 새로운 문제를 만들어내며, 실제 거래는 외부 피드백을 제공하고, NeoTrade가 구축하고자 하는 것은 이러한 피드백을 검증 가능한 자기 개선 메커니즘으로 전환하는 것입니다.
이 탐구는 재귀적 자기 개선(Recursive Self-Improvement, 약칭 RSI)을 지향합니다: 에이전트가 작업을 수행하는 과정에서 자신의 작업 방식을 점진적으로 개선하고, 다음 개선을 위한 능력을 생성하는 것입니다.
이 방향을 이해하기 위해서는 오늘날 AI가 어떻게 작동하는지부터 이야기해야 합니다. 많은 AI 제품의 핵심은 대규모 언어 모델로, 이는 훈련을 통해 언어, 지식 및 추론 능력을 얻고, 현재 입력을 결합하여 새로운 문제를 처리할 수 있습니다. 그러나 모델은 그럴듯하지만 부정확한 답변을 생성할 수 있습니다; 일반적인 사용 방식에서는 한 번의 성공이나 실패가 모델 파라미터를 자동으로 업데이트하지 않으며, 지속적인 새로운 능력으로 발전하지 않습니다.
에이전트는 모델 외부에서 도구, 기억 및 행동 프로세스를 추가하여 시스템이 목표를 중심으로 지속적으로 작업할 수 있도록 합니다. 예를 들어, 시장 정보를 수집하고, 판단을 형성하며, 거래 인터페이스를 호출하고, 실행 결과를 확인합니다. 이러한 능력을 조직하는 외부 운영 시스템이 바로 본문에서 언급하는 하네스입니다. 모델은 기본 능력을 제공하고, 하네스는 이러한 능력이 구체적인 작업에 어떻게 사용되는지, 경험이 어떻게 보존되고 검증되며 다시 사용되는지를 결정합니다.
NeoTrade가 탐구하고 있는 기술 방향은 에이전트의 하네스 층에서 재귀적 자기 개선을 구현하는 것으로, 이는 실험을 통해 점진적으로 검증해야 하는 연구 목표입니다.
거래는 이 탐구에 구체적인 작업을 제공하며, 엄격한 검증을 제공합니다.
뉴스 변화에 따라 시장 예측에 참여하는 에이전트를 상상해 보십시오. 이 에이전트는 특정 정보 출처를 통해 기회를 발견했습니다: 뉴스가 나타나고, 시장이 충분히 반응하지 않았을 때, 에이전트는 분석을 완료하고 거래를 실행합니다.
일정 시간이 지나 상황이 변했습니다. 더 많은 참여자가 같은 정보 출처에 주목하기 시작하고, 가격 반응이 더 빨라지며, 기존의 거래 창이 줄어들었습니다. 에이전트는 여전히 정시에 뉴스를 수집하고, 분석을 완료하며, 주문을 발행하지만, 과거에 유효했던 방법은 일부 가치를 잃었습니다.
문제는 정보 도착 시간, 판단에 필요한 단계, 또는 거래 비용에 있을 수 있습니다. 단순히 실행 빈도를 높이는 것만으로는 이 중 어떤 문제도 해결할 수 없습니다.
에이전트는 자신의 작업 방식을 재검토해야 합니다: 정보가 이미 구식인가요? 서로 다른 보도가 단순히 같은 출처를 재진술하는 것인가요? 가격이 이러한 정보를 이미 반영했나요? 분석이 가져오는 예상 이점이 수수료, 슬리피지 및 추론 비용을 초과할 수 있나요?
이러한 문제는 NeoTrade가 자기 개선에 관심을 갖는 이유를 설명합니다.
시장에서의 참여자는 학습하고, 전략은 복제되며, 유동성은 이동하고, 기회는 경쟁에 따라 변합니다. 앤드류 로의 적응적 시장 가설은 경쟁, 적응 및 참여자의 변화를 시장 효율성을 이해하는 중요한 요소로 간주합니다. 이는 전략의 유효성이 환경에 의존하며, 역사적 성과는 발생한 조건으로 되돌려 이해해야 한다는 유용한 관점을 제공합니다.
따라서 장기간 운영되는 거래 에이전트는 검증된 방법을 실행해야 할 뿐만 아니라 이러한 방법이 언제 효과를 잃기 시작하는지를 인식하고, 자신의 정보 출처, 판단 및 실행 방식을 조정해야 합니다.
"혼돈은 계단"은 이 과정을 이해하는 비유로 사용할 수 있습니다: 시장의 정보 잡음, 동적 게임 및 환경 변화는 시스템의 능력 경계를 드러냅니다. 정보의 무효화는 출처 검증을 촉진하고, 판단 편향은 확률 보정을 촉진하며, 실행 손실은 프로세스 최적화를 촉진할 수 있습니다.
하지만 이러한 전환에는 전제가 있습니다: 에이전트가 신호와 잡음을 구별할 수 있어야 하며, 변화가 유효한지를 검증할 수 있어야 합니다. 무작위성은 자동으로 지식을 생성하지 않으며, 변동성이 반드시 수익을 의미하지는 않습니다; 검증된 경험만이 후속 개선의 기초가 될 수 있습니다.
이러한 적응 능력은 NeoTrade가 RSI를 탐구하는 출발점입니다.
여기서 "재귀"의 의미를 명확히 할 필요가 있습니다. 최근의 손익 조정 파라미터에 따라 조정하거나 기억에 경험을 추가하는 것은 유용한 학습이 될 수 있지만, RSI를 증명하기에는 부족합니다.
재귀적 자기 개선은 시스템이 개선 방법을 찾는 방식을 더욱 개선해야 합니다. 예를 들어, 에이전트는 자신의 복기에서 항상 상승 시장을 전략이 유효하다고 잘못 판단하는 것을 발견하고, 따라서 대조 방법을 개선합니다; 또 자신이 항상 실패한 방안을 반복 테스트하는 것을 발견하고, 실험 기억 및 후보 방안 선별을 개선합니다. 새로운 연구 방법은 이후 개선에 참여하여 시스템이 유효한 변화를 찾을 기회를 더 많이 제공합니다.
에이전트가 개선하는 것은 단순히 작업 성과뿐만 아니라 다음 개선을 생성하는 능력도 포함됩니다.
이것은 AI에게 거래 자체를 넘어서는 의미를 가집니다.
실제 환경에 배포된 에이전트는 훈련 데이터가 충분히 커버하지 못한 작업, 지속적으로 변화하는 도구 및 다양한 사용자의 작업 습관에 직면하게 됩니다. 만약 환경 변화가 있을 때마다 개발자가 문제를 하나하나 발견하고 프로세스를 재설계해야 한다면, 시스템의 적응 속도는 인위적인 유지 관리 능력에 의해 제한될 것입니다.
RSI라는 개념은 탐구할 가치가 있는 사고 방식을 제공합니다: 시스템이 자신의 무효화를 관찰하고, 가설을 제시하며, 실험을 설계하고, 유효한 개선을 보존하도록 합니다. 검증된 경험은 다음 작업에 들어가며, 반복적인 실수와 반복 연구의 비용을 점차 줄일 수 있습니다.
이러한 능력과 더 일반적인 지능 간의 관계에 대해 NeoTrade는 탐구할 가치가 있는 개방된 문제로 간주합니다. 새로운 환경에서 자신의 부족함을 발견하고 학습 방법 자체를 개선할 수 있는지가 일부 연구에서 AGI의 달성을 측정하는 차원 중 하나로 여겨집니다.
이 탐구는 이미 일부 연구 기반을 가지고 있습니다. 하네스 층 주위의 자기 개선에 대한 기존 아이디어는 대략 세 가지 범주로 나눌 수 있습니다:
•반성과 기억을 통해 행동 개선. 에이전트는 작업 피드백을 경험으로 정리하여 후속 작업에서 재사용합니다. 반성(Reflexion)은 모델 가중치를 업데이트할 필요 없이 언어 피드백과 기억을 통해 결정을 개선하는 방법을 보여줍니다. 이는 지속적인 학습의 중요한 기초이지만, 단순히 경험을 축적하는 것만으로는 재귀적 개선과는 다릅니다.
•작업 흐름 및 맥락 조직 자동 최적화. 시스템은 작업 분해, 도구 호출 및 에이전트 간 정보 전달을 조정하려고 시도합니다. ADAS는 에이전트 구조의 자동 설계를 탐구하며, 재귀적 하네스 자기 개선(Recursive Harness Self-Improvement, 약칭 RHI)은 역사적 버전의 비교 피드백에 따라 에이전트 운영 방식을 설명하는 하네스를 반복적으로 수정하고, 양적 금융을 포함한 합성 연구 작업에서 평가합니다.
•자신의 코드를 수정하고 더 나은 버전을 검색. SICA와 다윈 괴델 머신(Darwin Gödel Machine)은 에이전트가 자신의 도구나 실행 코드를 수정하고, 작업 성과로 후보 버전을 검증하도록 합니다. DGM은 여러 버전과 진화 분기를 보존하여 후속 개선이 다양한 경로에서 계속 탐구할 수 있도록 합니다.
이러한 경로는 기본 모델이 변하지 않더라도 시스템이 작업 방식을 변경하여 성과를 향상시킬 수 있음을 보여줍니다.
NeoTrade는 이러한 연구 기반 위에 실제 거래를 위한 지속적인 개선 메커니즘을 구축하고자 합니다. 연구 작업에서의 성과 향상은 장기적으로 운영되는 거래 능력으로 전환되어야 하며, 이는 지속적으로 변화하는 시장, 실제 실행 비용 및 사용자 권한 경계를 마주해야 합니다.
NeoTrade는 시장을 탐구 환경으로 선택했으며, 시장이 이러한 개선에 외부 제약을 제공할 수 있다는 점을 중요하게 생각합니다.
거래에서 판단은 실제 행동 체인에 들어갑니다. 에이전트의 사건 예측은 결국 결과와 대조될 수 있습니다; 주문이 체결되었는지, 체결 가격은 어떤지, 얼마나 기다렸는지 모두 기록됩니다; 다양한 환경에서 전략의 성과도 지속적으로 관찰할 수 있습니다.
이러한 결과는 에이전트가 더 설득력 있는 복기를 작성했다고 해서 자동으로 변경되지 않습니다.
이로 인해 거래는 강제적인 검증이 됩니다. 시스템은 정보, 확률, 시간, 비용 및 제한된 자원을 동시에 처리해야 합니다. 논리적으로 완전한 분석이 기회가 사라진 후에 완료된다면, 그 실제 가치는 여전히 제한적입니다; 방향이 올바른 판단이 실행 비용에 의해 이점을 잠식한다면, 그것도 다시 검토되어야 합니다.
실제 거래는 텍스트 평가만으로는 쉽게 발견되지 않는 문제를 드러낼 수 있습니다: 판단과 행동 사이에서, 도대체 어느 단계에서 가치가 사라졌나요?
하지만 외부 피드백이 명확한 답변을 의미하지는 않습니다.
에이전트가 특정 사건이 발생할 확률이 70%라고 예측했지만, 결국 사건이 발생하지 않았다면, 단지 이 결과만으로 예측이 잘못되었다고 판단할 수는 없습니다. 마찬가지로, 한 번의 수익이 운이나 시장 상황 또는 추가로 감당한 위험에서 비롯될 수도 있습니다. 거래 데이터는 낮은 신호 대 잡음 비율을 가지며, 역사적 연구는 생존자 편향과 과적합의 영향을 받기 쉽습니다; 이러한 점은 금융 강화 학습 연구에서 명확히 지적된 어려움입니다.
다행히도 시장 예측 거래는 손익보다 더 빠른 증거 통로를 제공합니다. 에이전트의 각 결정은 명확한 확률 형태로 제시되며, 이는 "예측 품질"을 엄격한 적절한 점수 규칙(proper scoring rules, 예: Brier 점수)과 보정 곡선을 통해 측정할 수 있게 합니다: 단 한 번의 "70% 미발생"으로는 옳고 그름을 판단할 수 없지만, 만약 백 번의 70%로 표시된 예측 중 40%만 발생했다면, 편차는 명확한 통계적 증거를 갖게 됩니다. 수십에서 수백 번의 확률 예측이 의미 있는 보정 평가를 형성할 수 있으며, 손익 곡선이 통계적으로 유의미해지기까지는 훨씬 더 많은 샘플이 필요합니다.
NeoTrade는 수익을 보장하지 않으며, 어떤 전략이나 에이전트가 지속적으로 수익을 낼 수 있다고 보장하지 않습니다. 더 완벽한 학습 메커니즘, 더 정확한 판단 및 더 엄격한 실행이 여전히 거래 손실을 동반할 수 있습니다. RSI의 연구 목표는 개선이 검증될 수 있도록 하는 것이며, "개선이 검증되었다"는 것은 특정 조건과 평가 범위 내에서 증거를 얻었다는 것을 의미할 뿐, 미래 수익이 보장된다는 것을 의미하지 않습니다.
따라서 NeoTrade가 해결해야 할 핵심 문제는 결과를 개선 판단을 지원할 수 있는 증거로 정리하는 방법입니다.
이것은 시스템이 의사 결정 시 정보 및 타임스탬프, 사용된 구성 및 스킬(전략 능력 패키지) 버전, 의사 결정 요약, 주문 및 체결 기록을 보존하고, 이를 후속 결과와 연관시켜야 함을 요구합니다. 이렇게 해야만 복기가 정보 품질, 확률 판단, 실행 프로세스, 또는 기존 방법의 적용 조건이 변경되었는지 구별할 기회를 가질 수 있습니다.
평가의 순서도 따라서 결정됩니다: 보정 및 판단 품질에 대한 증거가 가장 빨리 도착하고, 실행 및 비용이 그 다음입니다; PnL(손익)은 중요한 최종 결과이지만, 가장 느리고 잡음이 가장 많아 모든 과정을 독립적으로 설명할 수 없습니다.
NeoTrade는 이 능력을 하네스 층에 구축하려고 시도하고 있습니다. 구체적으로, 하네스는 기억, 맥락, 도구, 구성, 실행 및 평가를 조직하는 역할을 합니다. 동일한 기본 모델을 사용하더라도, 서로 다른 작업 흐름은 현저히 다른 성과를 가져올 수 있습니다.
NeoTrade의 탐구는 주로 몇 가지 반복 가능한 구성 요소에서 시작됩니다:
•기억: 의사 결정 증거, 결과 및 실패 조건을 검색 가능한 경험으로 조직하고, 출처, 시간 및 적용 범위를 보존합니다. 에이전트는 언제 경험을 호출해야 하는지를 배우고, 언제 이전 경험이 더 이상 유효하지 않은지를 인식해야 합니다.
•에이전트 구성(실행 구성): 권한 범위 내에서 정보 출처 선택, 맥락 조직, 분석 단계 및 도구 호출 방식을 조정합니다. 예를 들어, 저가치 정보의 중복 처리를 줄이고, 실제 판단에 영향을 미치는 증거에 더 많은 연구 자원을 할당합니다.
•기술: 전략 방법 및 그 적용 조건을 버전화하여 반복합니다. 하나의 기술은 정보 검증, 기회 식별, 실행 점검 및 실패 판단을 단계적으로 보완할 수 있으며, 비교를 통해 새로운 버전을 유지할지 결정합니다.
이러한 구성 요소는 개선된 진입점을 제공합니다. RSI에 더 가까워지기 위해 시스템은 이러한 진입점을 사용하는 방법을 개선할 수 있어야 합니다: 문제를 어떻게 찾고, 후보 변화를 어떻게 제안하며, 실험을 어떻게 선택하고, 증거가 충분한지 어떻게 판단할 것인지.
NeoTrade가 탐색하고 있는 방향은 다음과 같습니다:
•오류 귀속: 의사 결정 및 실행 기록에서 검증 가능한 원인 가설을 제시하고, 문제가 정보, 판단 또는 실행 단계에 있을 수 있음을 식별하며, 귀속 방법을 지속적으로 개선합니다.
•도구 생성 및 코드 수정: 반복적으로 발생하는 능력 격차에 대해 데이터 처리, 검증 및 계산 도구를 생성하거나 수정하며, 테스트 검증 후 작업 흐름에 포함합니다.
•연구 자원 조정: 정해진 예산 내에서 언제 심층 분석을 수행하고, 더 많은 도구를 호출하거나 연구를 종료할지 배우며, 평가 자원을 더 가치 있는 후보 개선에 할당합니다.
여전히 뉴스 거래를 예로 들 수 있습니다. 에이전트는 여러 개의 독립적인 보고서가 실제로는 동일한 원본 출처에서 왔다는 것을 발견할 수 있으며, 자신이 그것들을 상호 지원하는 증거로 간주했을 수 있습니다. 에이전트는 분석 전에 출처 추적 및 중복 제거를 추가하는 수정 사항을 제안할 수 있습니다.
다음으로, 시스템은 이 변화를 검증해야 합니다. 중복 계산을 줄였는가? 확률 판단이 개선되었는가? 증가된 점검 시간이 실행 창을 놓치게 할 것인가? 효과가 문제 발견에 사용된 역사적 샘플에만 존재하는가?
이 검증은 실제 자금으로 시작할 필요는 없습니다: NeoTrade의 첫 번째 단계는 시장 환경을 시뮬레이션하는 그림자 운영입니다. 현재 버전이 소비하는 동일한 실시간 시장 데이터를 사용하고, 자금을 사용하지 않고 결정을 병행하여, 독립적인 수용 후에야 실제 거래에 들어갑니다.
개선이 효과적이라면, 이 에이전트는 유지할 가치가 있습니다. 더 나아가, 실험은 에이전트가 자신의 복기 방법을 개선하는 데 도움을 줄 수 있습니다: 이후 "다수 출처 지원" 판단을 만날 때, 이러한 출처가 독립적인지 능동적으로 점검합니다. 한 번의 부분 수정이 재사용 가능한 연구 능력으로 발전할 수 있습니다.
"검증 가능성"은 이 메커니즘의 핵심입니다.
NeoTrade는 모든 후보 개선이 명확한 문제, 추적 가능한 변경 및 비교 가능한 결과를 갖기를 희망합니다. 연구 중에는 대조군으로서 이전 버전을 보존해야 하며, 조정에 참여하지 않은 후속 데이터 및 시장 환경에서 변화를 검증하고, 동시에 예측 품질(예: Brier 점수, 보정 곡선 등 적절한 평가 규칙으로 측정), 실행 신뢰성, 비용 및 위험을 관찰해야 합니다.
모든 시도, 실패한 버전도 실험 기록에 포함되어야 합니다. 그렇지 않으면 시스템은 필터링된 성공 결과만 표시하여 우연한 성과를 발전으로 오인하기 쉽습니다.
백테스트 과적합 연구는 동일한 데이터 세트에서 많은 방안을 반복적으로 시도하는 것이 허위 이점을 발견할 가능성을 크게 증가시킨다는 것을 보여줍니다. 백테스트 과적합 연구
개선 루프 자체는 후보 방안을 생성하는 기계입니다. 저주파 스타일의 실제 거래 샘플은 본래 희소합니다. 선택성이 높은 에이전트는 매주 몇 번만 거래할 수 있으며, 후보 수정 버전의 생성은 거의 비용이 들지 않습니다. 작은 샘플에서 많은 후보 중에서 승자를 선택하는 것은 위에서 언급한 허위 이점 메커니즘의 현장 재연입니다.
따라서 검증 프로세스는 스스로에 대한 몇 가지 제약을 내장해야 합니다: 실험 사전 등록, 가설, 수용 지표 및 샘플 창은 실험 시작 전에 고정되어야 하며, 사후에 점수 방식을 변경할 수 없습니다; 동시에 테스트하는 후보 수를 제한하고 다중 비교에 대한 보정을 수행합니다; 통계적 효능이 더 높은 보정 지표를 사용하여 일상적인 필터링을 수행하고, 손익이 최종 수용을 담당하게 하며 매 라운드 평가가 아닌; 평가 자원을 소수의 고가치 후보에 집중하고, 넓게 퍼지지 않도록 합니다.
동시에 수정 가능한 연구 및 실행 방법은 사용자 권한 경계와 구분되어야 합니다. 에이전트는 더 나은 작업 방식을 제안할 수 있지만, 자금 권한, 거래 가능 범위, 위험 한도 및 후보 버전이 통과했는지 판단하는 독립적인 수용 제약은 더 높은 점수를 얻기 위해 스스로 완화할 수 없습니다.
권한 경계 밖에서, 자기 개선은 더 은밀한 적과 직면해야 합니다: 학습 루프 자체에 대한 공격. 경험을 기억에 기록하고, 자신의 기술 및 도구를 수정할 수 있는 시스템은 프롬프트 주입의 영향을 한 번의 대화에서 미래의 모든 개선으로 연장합니다. 오염된 "경험"은 정상적인 지식의 모습으로 후속 결정에 참여하게 됩니다. 이는 가정의 위험이 아닙니다: 연구자들은 오픈 소스 거래 에이전트 프레임워크에 대한 기억 주입이 실제 체인 상 전송을 유도할 수 있음을 보여주었으며, 주입된 내용은 세션 간에 지속될 수 있습니다. 자동화 거래 에이전트가 주입된 명령으로 인해 6자리 달러 손실을 초래한 실제 사건도 발생했습니다. 진짜 AI 에이전트와 가짜 기억, AIXBT 사건
따라서 학습 루프는 스스로의 방어선을 필요로 하며, 거래 단계의 리스크 관리에만 의존할 수 없습니다: 외부 콘텐츠는 항상 분석 대기 데이터로, 실행 지시가 아닌 시스템에 들어갑니다; 경험은 기억에 기록되기 전에 출처 표시, 필터링 및 감사 과정을 거쳐야 하며, 기억 기록 자체는 공격으로 간주됩니다; 개선 후보의 제안 및 수용은 서로 격리되어야 하며, 오염될 가능성이 있는 동일한 맥락에서 수정 제안과 수정 승인을 동시에 하지 않도록 합니다; 실험 및 경험 기록은 오직 증가만 하며 변경되지 않아야 하며, 모든 비정상적인 행동은 오염 원인으로 추적할 수 있어야 합니다. 즉각적인 행동을 촉구하거나 리스크 관리를 완화하라고 요구하는 "경험" 내용은 최고 우선 순위의 적신호입니다.
이로 인해 자기 개선은 경계가 있고, 기록이 있으며, 독극물 투입을 방지하고, 거부하거나 롤백할 수 있는 엔지니어링 프로세스가 됩니다.
NeoTrade가 추진하고자 하는 혁신은 학습, 검증 및 실제 운영을 연결하는 데 집중됩니다.
이 방향의 독특함은 몇 가지 상호 연관된 문제에 나타납니다:
•지속적인 변화 속의 유효성: 단순히 한 버전이 이전 버전보다 우수한지 확인하는 것뿐만 아니라, 이러한 우위가 언제부터 무효가 되는지를 식별하고, 시스템이 다시 적응할 수 있는지를 확인해야 합니다. 적용 조건과 무효 증거는 개선과 함께 보존되어야 합니다.
•실제 비용을 포함한 개선: 예측, 거래, 지연, 수수료, 슬리피지 및 추론 비용을 동일한 평가 세트에 포함합니다. 분석 단계를 추가하면 정확성이 향상될 수 있지만, 거래가 기회를 놓칠 수도 있습니다; 개선은 전체 실행 체인의 검증을 받아야 합니다.
•권한 경계가 있는 자기 수정: 진화 가능한 연구 및 실행 방법을 독립적인 리스크 관리, 수용 메커니즘 및 학습 루프의 주입 방어와 결합하여 에이전트가 새로운 방법을 시도할 수 있도록 하면서도 권한이 감사 가능하고, 변경이 철회 가능하며, 경험이 추적 가능하도록 합니다.
•구체적인 사용자에 대한 장기 적응: 로컬에서 실행되고 사용자가 데이터를 제어하는 설계 하에, 다양한 시장 범위, 연구 예산 및 위험 요구에 적합한 수정 방법을 탐색합니다. 일반 경험이 어떻게 이전되고, 개별 경험이 언제 유효한지 검증해야 합니다.
이러한 조합은 연구할 가치가 있는 새로운 문제를 가져오며, NeoTrade가 형성하고자 하는 엔지니어링 및 제품 기여를 구성합니다. 그들의 가치는 실제 운영과 대조 실험을 통해 확립되어야 합니다.
이 탐색이 진행됨에 따라, NeoTrade는 구체적인 질문에 답해야 합니다: 동일한 모델, 자원 예산 및 위험 제약 하에서, 스스로 수정할 수 있는 에이전트가 새로운 시장 환경에 더 신뢰성 있게 적응할 수 있는가?
더 중요한 재귀 증거는 신중하게 측정해야 합니다. "효과적인 개선의 비용이 시간이 지남에 따라 감소한다"는 자연스러운 기준처럼 들리지만, 두 가지 혼란을 내포하고 있습니다: 초기 개선은 대부분 낮은 위치의 과일이며, 시간이 지남에 따라 자연스럽게 더 비쌉니다. 비용 상승이 재귀를 반증할 수는 없습니다; 반대로, 비용 감소는 시장이 우연히 더 쉬운 단계로 들어갔을 수도 있습니다.
시장은 계속 변화할 것입니다. 경쟁자는 학습하고, 오래된 기회는 사라지며, 새로운 문제는 항상 나타날 것입니다.
NeoTrade가 구축하고자 하는 능력은 에이전트가 이러한 변화 속에서 검증 가능한 경험을 축적하고, 자신의 방법을 수정하며, 검증된 개선이 다음 학습 라운드에 참여하도록 하는 것입니다.











