BTC $79,504.66 -0.58%
ETH $2,493.63 -0.37%
BNB $745.53 -1.60%
XRP $1.41 -1.30%
SOL $105.29 -1.42%
TRX $0.3353 +0.10%
DOGE $0.0903 +0.57%
ADA $0.2209 -0.02%
BCH $257.95 -0.66%
LINK $13.23 +7.29%
HYPE $88.16 -1.26%
AAVE $135.02 -0.64%
SUI $0.8258 +2.87%
XLM $0.1948 +4.36%
ZEC $1,195.76 +1.73%
BTC $79,504.66 -0.58%
ETH $2,493.63 -0.37%
BNB $745.53 -1.60%
XRP $1.41 -1.30%
SOL $105.29 -1.42%
TRX $0.3353 +0.10%
DOGE $0.0903 +0.57%
ADA $0.2209 -0.02%
BCH $257.95 -0.66%
LINK $13.23 +7.29%
HYPE $88.16 -1.26%
AAVE $135.02 -0.64%
SUI $0.8258 +2.87%
XLM $0.1948 +4.36%
ZEC $1,195.76 +1.73%

NeoTrade: Превращение реальной обратной связи по сделкам в проверяемое самоусовершенствование

Ключевые тезисы
Summary: Когда рынок изменится, сможет ли AI научиться улучшать себя?
Когда рынок изменится, сможет ли AI научиться улучшать себя?

Если ИИ может круглосуточно следить за рынком, анализировать новости и автоматически размещать заказы, сможет ли он обнаружить, что методы, которые он успешно использует, начинают терять свою эффективность?

Информация, которая когда-то была передовой, сегодня может быть уже усвоена ценами; сигнал, который ранее был эффективным, может потерять свое преимущество из-за увеличения числа участников. Агент продолжает вовремя анализировать и строго выполнять, но рынок уже изменился.

В этот момент накопленный опыт может помочь ему выявить проблемы и скорректировать методы. Более того, сможет ли он улучшить свои способности к выявлению проблем и проверке методов, чтобы сделать следующее обучение более эффективным?

Эти вопросы являются теми, которые NeoTrade продолжает исследовать.

Рынок постоянно создает новые проблемы, реальные сделки предоставляют внешнюю обратную связь, а NeoTrade стремится создать механизм, который преобразует эту обратную связь в проверяемое самоулучшение.

Это исследование направлено на рекурсивное самоулучшение (то есть Recursive Self-Improvement, сокращенно RSI): позволить Агенту постепенно улучшать свои методы работы и способность генерировать следующие улучшения в процессе выполнения задач.

Понимание этого направления можно начать с того, как сегодня работает ИИ. Многие ИИ-продукты основаны на больших языковых моделях, которые получают языковые, знания и аналитические способности через обучение, а также могут обрабатывать новые проблемы, комбинируя текущие входные данные. Однако модель может генерировать ответы, которые кажутся разумными, но не точными; при обычном использовании одна успешная или неудачная попытка не обновляет автоматически параметры модели, превращая их в постоянные новые способности.

Агент, в отличие от модели, добавляет инструменты, память и процессы действий, позволяя системе непрерывно работать вокруг цели. Например, получение рыночной информации, формирование суждений, вызов торговых интерфейсов и проверка результатов исполнения. Внешняя система, организующая эти способности, называется harness. Модель предоставляет базовые способности, а harness определяет, как эти способности используются для конкретных задач и как опыт сохраняется, проверяется и повторно используется.

Техническое направление, которое исследует NeoTrade, заключается в реализации рекурсивного самоулучшения на уровне harness Агента, что является исследовательской целью, требующей поэтапной проверки через эксперименты.

Торговля предоставляет конкретные задачи для этого исследования и жесткие проверки.

Представьте себе Агента, который участвует в прогнозировании рынка на основе изменений в новостях. Он когда-то полагался на определенные источники информации для выявления возможностей: новости появляются, рынок еще не отреагировал должным образом, Агент завершает анализ и выполняет сделку.

Через некоторое время ситуация меняется. Все больше участников начинают обращать внимание на один и тот же источник информации, реакция цен становится быстрее, а окно для торговли сокращается. Агент по-прежнему вовремя получает новости, завершает анализ и размещает заказы, но ранее эффективные методы теряют часть своей ценности.

Проблема может заключаться во времени поступления информации, необходимых шагах для оценки, или в стоимости сделок. Простое увеличение частоты исполнения не решает ни одну из этих проблем.

Агенту необходимо пересмотреть свои методы работы: информация устарела? Разные сообщения просто пересказывают один и тот же источник? Цены уже отразили эту информацию? Ожидаемое преимущество от анализа может покрыть комиссии, проскальзывание и затраты на анализ?

Эти вопросы объясняют, почему NeoTrade интересуется самоулучшением.

Участники рынка учатся, стратегии копируются, ликвидность перемещается, а возможности меняются с ростом конкуренции. Гипотеза адаптивных рынков Эндрю Ло рассматривает конкуренцию, адаптацию и изменения участников как важные факторы для понимания рыночной эффективности. Она предлагает полезную перспективу: эффективность стратегии зависит от окружения, а исторические результаты должны пониматься в контексте условий, в которых они произошли. Гипотеза адаптивных рынков

Таким образом, долгосрочно работающий торговый Агент должен как выполнять проверенные методы, так и выявлять, когда эти методы начинают терять свою эффективность, и корректировать свои источники информации, суждения и методы исполнения.

"Хаос — это лестница" может служить метафорой для понимания этого процесса: информационный шум на рынке, динамические игры и изменения окружения выявляют границы возможностей системы. Устаревшая информация может побудить проверку источников, отклонения в суждениях могут побудить к калибровке вероятностей, а потери при исполнении могут побудить к оптимизации процессов.

Но для этого преобразования существует одно условие: Агент должен уметь различать сигналы и шум и проверять, являются ли изменения действительными. Случайность не приводит автоматически к знаниям, а волатильность не означает прибыли; только проверенный опыт может стать основой для последующих улучшений.

Эта способность к адаптации является отправной точкой для исследования RSI в NeoTrade.

Здесь необходимо прояснить значение "рекурсии". Корректировка параметров на основе недавних прибылей и убытков или добавление опыта в память могут быть полезными для обучения, но этого недостаточно для доказательства RSI.

Рекурсивное самоулучшение требует от системы дальнейшего улучшения методов поиска улучшений. Например, Агент обнаруживает, что его анализ всегда ошибочно считает растущий рынок эффективной стратегией, и поэтому улучшает методы сравнения; он также замечает, что постоянно повторяет тестирование уже провалившихся решений, и поэтому улучшает память о экспериментах и отбор кандидатов. Новые исследовательские методы затем участвуют в следующем раунде улучшений, давая системе больше шансов найти эффективные изменения.

Агент улучшает не только выполнение задач, но и способность генерировать следующие улучшения.

Это имеет значение для ИИ, выходящее за рамки самой торговли.

Агент, развернутый в реальной среде, сталкивается с задачами, которые недостаточно охвачены обучающими данными, постоянно меняющимися инструментами и различными рабочими привычками пользователей. Если каждое изменение в окружении требует от разработчиков выявления проблем и повторного проектирования процессов, скорость адаптации системы будет ограничена возможностями ручного обслуживания.

Концепция RSI предлагает подход, который стоит исследовать: позволить системе участвовать в наблюдении за своими сбоями, выдвигать гипотезы, разрабатывать эксперименты и сохранять эффективные улучшения. Проверенный опыт может перейти в следующий рабочий цикл, постепенно уменьшая затраты на повторные ошибки и повторные исследования.

Что касается связи этой способности с более общей интеллектуальной способностью, NeoTrade рассматривает это как открытый вопрос для исследования. Способность выявлять свои недостатки в новых условиях и улучшать сам метод обучения рассматривается некоторыми исследователями как один из измерений, позволяющих оценить, достигнут ли уровень AGI (Уровни AGI).

Это исследование уже имеет некоторые исследовательские основы. Существующие идеи вокруг уровня harness можно условно разделить на три категории:

Улучшение поведения через рефлексию и память. Агент организует обратную связь по задачам в опыт, который затем повторно используется в последующих задачах. Reflexion демонстрирует способ улучшения решений через языковую обратную связь и память без необходимости обновления весов модели. Это важная основа для непрерывного обучения, но простое накопление опыта еще не означает рекурсивного улучшения. Reflexion

Автоматическая оптимизация рабочих процессов и организации контекста. Система пытается скорректировать разбиение задач, вызов инструментов и передачу информации между Агентами. ADAS исследует автоматическое проектирование структуры Агентов; Recursive Harness Self-Improvement (сокращенно RHI) итеративно описывает работу harness на основе обратной связи от исторических версий и проводит оценку в синтетических исследовательских задачах, включая количественные финансы. ADAS, RHI

Модификация собственного кода и поиск лучших версий. SICA и Darwin Gödel Machine позволяют Агенту изменять свои инструменты или исполняемый код, а затем проверять кандидаты на основе производительности задач. DGM дополнительно сохраняет несколько версий и эволюционных веток, позволяя последующим улучшениям продолжать исследование из разных направлений. SICA, DGM

Эти направления показывают, что даже если базовая модель остается неизменной, система может улучшить производительность, изменив методы работы.

NeoTrade надеется на основе этих исследовательских основ создать механизм постоянного улучшения, ориентированный на реальные сделки. Улучшение производительности в исследовательских задачах должно быть преобразовано в долгосрочные торговые способности, что также требует учета постоянно меняющегося рынка, реальных затрат на исполнение и границ полномочий пользователей.

NeoTrade выбирает рынок в качестве среды для исследования, поскольку он может предоставить внешние ограничения для этих улучшений.

В торговле суждения становятся частью реальной цепочки действий. Прогнозы Агента о событиях в конечном итоге могут быть сопоставлены с результатами; заказы фиксируются, фиксируются цены сделок и время ожидания; производительность стратегий в различных условиях также может быть постоянно наблюдаема.

Эти последствия не изменятся только потому, что Агент написал более убедительный анализ.

Это делает торговлю обязательной проверкой. Система должна одновременно обрабатывать информацию, вероятности, время, затраты и ограниченные ресурсы. Логически завершенный анализ, если он всегда выполняется после исчезновения возможностей, все равно будет иметь ограниченную практическую ценность; правильное суждение, если затраты на исполнение поглощают преимущества, также требует пересмотра.

Таким образом, реальные сделки могут выявить проблемы, которые трудно обнаружить только на основе текстовой оценки: на каком этапе между суждением и действием была потеряна ценность?

Тем не менее, внешняя обратная связь не равна ясным ответам.

Если Агент прогнозирует, что вероятность наступления определенного события составляет 70%, а событие не происходит, это не означает, что прогноз был ошибочным только на основании этого результата. Точно так же прибыль может быть следствием удачи, рыночной ситуации или дополнительных рисков. Торговые данные имеют низкое соотношение сигнал/шум, а исторические исследования могут быть подвержены смещению выживших и переобучению; это также трудности, четко указанные в исследованиях финансового усиленного обучения. FinRL-Meta

К счастью, торговля на прогнозных рынках предоставляет более быстрый канал доказательства, чем прибыль и убытки. Каждое решение Агента представляется в явной вероятностной форме, что позволяет оценить "качество прогнозов" с помощью строгих правил оценки (proper scoring rules, таких как Brier score) и калибровочных кривых: одно "70% не произошло" не может определить правильность, но если из ста прогнозов, отмеченных как 70%, только 40% сбываются, это дает четкие статистические доказательства. Десятки или сотни прогнозов вероятностей могут сформировать значимую оценку калибровки, в то время как ожидание, когда кривая прибыли и убытков достигнет статистической значимости, часто требует гораздо большего объема выборки. Proper Scoring Rules

NeoTrade не обещает прибыли и не гарантирует, что какая-либо стратегия или Агент смогут постоянно приносить прибыль. Более совершенные механизмы обучения, более точные суждения и более строгие исполнения все еще могут сопровождаться убытками в торговле. Цель исследования RSI заключается в том, чтобы улучшения могли быть проверены, а "улучшения, получившие проверку", означают лишь то, что они получили доказательства в определенных условиях и рамках оценки, не гарантируя будущую прибыль.

Таким образом, ключевой вопрос, который NeoTrade стремится решить, заключается в том, как организовать результаты в доказательства, поддерживающие улучшение суждений.

Это требует от системы сохранения информации и временных меток, используемых при принятии решений, конфигураций и версий skill (пакетов стратегических способностей), резюме решений, заказов и записей о сделках, а также связывания их с последующими результатами. Только так анализ может различить: проблема заключается в качестве информации, вероятностном суждении, процессе исполнения или изменении условий применения существующих методов.

Таким образом, порядок оценки также определяется: доказательства калибровки и качества суждений приходят быстрее всего, затем идут исполнение и затраты; PnL (прибыль и убыток) является важным конечным результатом, но он самый медленный и шумный, и не может объяснить весь процесс в одиночку.

NeoTrade пытается построить этот набор возможностей на уровне harness. Конкретно, harness отвечает за организацию памяти, контекста, инструментов, конфигураций, исполнения и оценки. Даже используя одну и ту же базовую модель, различные рабочие процессы могут привести к значительно различающимся результатам.

Исследование NeoTrade в основном начинается с нескольких итеративных компонентов:

Память: Организация доказательств решений, результатов и условий неудачи в доступный опыт, с сохранением источников, времени и области применения. Агент должен научиться, когда использовать опыт, а также распознавать, когда старый опыт больше не применим.

Конфигурация агента (Рабочая конфигурация): Настройка выбора источников информации, организации контекста, шагов анализа и способов вызова инструментов в пределах разрешенных границ. Например, уменьшение повторной обработки информации с низкой ценностью, использование большего количества исследовательских ресурсов для действительно влияющих на суждения доказательств.

Навык: Версионирование и итерация стратегических методов и условий их применения. Один навык может постепенно дополнять проверку информации, идентификацию возможностей, проверку выполнения и оценку неудач, и через сравнение решать, следует ли сохранить новую версию.

Эти компоненты предоставляют улучшенные входные точки. Чтобы приблизиться к RSI, системе также необходимо улучшить методы использования этих входных точек: как выявлять проблемы, как предлагать кандидатные изменения, как выбирать эксперименты и как оценивать, достаточно ли доказательств.

Направления, которые исследует NeoTrade, также включают:

Ошибочная атрибуция: Формулирование проверяемых гипотез о причинах на основе записей решений и выполнения, выявление проблем, которые могут возникнуть на этапе информации, суждения или выполнения, и постоянное улучшение методов атрибуции.

Генерация инструментов и модификация кода: Генерация или пересмотр инструментов обработки данных, проверки и вычислений для повторяющихся недостатков, которые после тестирования включаются в рабочий процесс.

Планирование исследовательских ресурсов: В рамках установленного бюджета изучение, когда углубляться в анализ, использовать больше инструментов или завершать исследование, и распределение ресурсов оценки на более ценные кандидатные улучшения.

Все еще на примере новостной торговли. Агент может обнаружить, что несколько, казалось бы, независимых отчетов на самом деле исходят из одного и того же первоисточника, в то время как он сам считал их взаимоподдерживающими доказательствами. Он может предложить модификацию harness: добавить отслеживание источников и удаление дубликатов перед анализом.

Далее система должна проверить это изменение. Уменьшило ли оно повторный подсчет? Улучшило ли оно оценку вероятности? Не пропустит ли увеличенное время проверки окно выполнения? Существует ли эффект только в исторических образцах, использованных для выявления проблем?

Эти проверки не обязательно начинать с реальных денег: первой остановкой NeoTrade является теневое выполнение, имитирующее рыночную среду — потребление той же реальной информации в реальном времени, параллельное принятие решений без использования средств, и только после независимой проверки переход к реальной торговле.

Если улучшение эффективно, этот Агент стоит сохранить. Более того, эксперимент может помочь Агенту улучшить свои методы анализа: в будущем, сталкиваясь с суждениями "поддерживаемыми несколькими источниками", активно проверять, являются ли эти источники независимыми. Одно локальное исправление может привести к формированию повторно используемой исследовательской способности.

"Проверяемость" является ядром этой системы.

NeoTrade надеется, что каждое кандидатное улучшение будет иметь четкую проблему, прослеживаемые изменения и сопоставимые результаты. В исследовании необходимо сохранять старые версии в качестве контроля, проверять изменения на данных и рыночной среде, которые не участвовали в настройке, и одновременно наблюдать за качеством прогнозов (измеряемым с помощью подходящих оценочных правил, таких как Brier score, калибровочные кривые), надежностью выполнения, затратами и рисками.

Все попытки, включая неудачные версии, также должны быть включены в записи экспериментов. В противном случае система будет показывать только отфильтрованные успешные результаты, что может привести к ошибочному восприятию случайных успехов как прогресса.

Исследования по переобучению на исторических данных показывают, что многократные попытки большого количества схем на одной и той же выборке данных значительно увеличивают вероятность обнаружения ложных преимуществ. Исследования по переобучению

Цикл улучшений сам по себе является машиной для генерации кандидатных схем. Образцы реальной торговли с низкой частотой естественно редки — высокоселективный Агент может торговать всего несколько раз в неделю — в то время как создание кандидатных версий harness почти не требует затрат. Выбор победителей из большого количества кандидатов на малом образце является повторением механизма ложных преимуществ.

Поэтому процесс верификации должен включать несколько собственных ограничений: предварительная регистрация эксперимента, фиксирование гипотез, критериев приемки и выборки до начала эксперимента, без изменения способа оценки после; ограничение количества одновременно тестируемых кандидатов и корректировка для множественных сравнений; использование статистически более мощных калибровочных показателей для повседневного отбора, позволяя прибыли и убыткам нести окончательную ответственность за приемку, а не каждую оценку; оценка ресурсов, сосредоточенная на нескольких высокоценных кандидатах, а не на широком охвате.

В то же время изменяемые методы исследования и выполнения должны быть отделены от границ полномочий пользователя. Агент может предложить лучшие способы работы, но полномочия на финансирование, диапазон торговли, пределы риска и независимые ограничения для оценки, прошел ли кандидатная версия, не могут быть ослаблены им для получения более высоких оценок.

За пределами границ полномочий самоусовершенствование также должно столкнуться с более скрытым противником: атаками на сам цикл обучения. Система, которая может записывать опыт в память и пересматривать свои навыки и инструменты, фактически продлевает влияние инъекций подсказок (prompt injection) с одного диалога на каждую последующую итерацию улучшений — загрязненный "опыт" будет участвовать в последующих решениях под видом нормальных знаний. Это не гипотетический риск: исследователи уже продемонстрировали, что инъекция памяти в открытые торговые агентские фреймворки может привести к реальным транзакциям на блокчейне, и инъецируемый контент может сохраняться между сессиями; также имели место реальные события, когда автоматизированные торговые агенты получали инъекции команд, что приводило к потерям в шесть цифр. Real AI Agents with Fake Memories, событие AIXBT

Поэтому цикл обучения нуждается в своей защите, а не может полагаться только на контроль рисков в торговле: внешние данные всегда должны входить в систему как данные для анализа, а не как команды для выполнения; опыт должен проходить маркировку источника, фильтрацию и аудит перед записью в память — запись памяти сама по себе рассматривается как потенциальная атака; предложение и прием кандидатных улучшений должны быть изолированы друг от друга, чтобы избежать ситуации, когда один и тот же потенциально загрязненный контекст предлагает и утверждает изменения; записи экспериментов и опыта должны оставаться неизменными, чтобы любое аномальное поведение можно было отследить до источника загрязнения. Настоятельные призывы к немедленным действиям, требования ослабить контроль рисков и содержание "опыта", утверждающее, что это уведомление системы, являются флагами самого высокого приоритета.

Это делает самоусовершенствование процессом с границами, записями, защитой от загрязнения, который можно отклонить или откатить.

Инновации, которые NeoTrade надеется продвигать, сосредоточены на соединении обучения, верификации и реального выполнения.

Уникальность этого направления проявляется в нескольких взаимосвязанных вопросах:

Эффективность в условиях постоянных изменений: Не только проверка, является ли одна версия лучше старой, но и выявление, когда это преимущество начинает терять свою силу, и может ли система адаптироваться заново. Условия применения и доказательства неэффективности должны сохраняться вместе с улучшениями.

Улучшения с учетом реальных затрат: Включение прогнозов, сделок, задержек, комиссий, проскальзываний и затрат на размышления в одну и ту же оценку. Увеличение шагов анализа может повысить точность, но также может привести к упущению возможностей для торговли; улучшения должны принимать проверку всей цепочки выполнения.

Самоизменение с границами полномочий: Сочетание эволюционирующих методов исследования и выполнения с независимым контролем рисков, механизмами приемки и защитой от инъекций в цикле обучения, позволяя Агенту пробовать новые методы, сохраняя при этом возможность аудита полномочий, отмены изменений и отслеживания опыта.

Долгосрочная адаптация к конкретным пользователям: Исследование harness, подходящих для различных рыночных диапазонов, исследовательских бюджетов и требований к риску, в условиях локального выполнения и контроля данных пользователем. Как универсальный опыт может быть перенесен, когда индивидуальный опыт эффективен, все это требует проверки.

Эти комбинации порождают новые вопросы, которые стоит исследовать, и составляют инженерный и продуктовый вклад, который NeoTrade надеется сформировать. Их ценность должна быть установлена на основе реального выполнения и контрольных экспериментов.

По мере продвижения этого исследования NeoTrade необходимо ответить на конкретный вопрос: может ли Агент, способный улучшить свой harness, более надежно адаптироваться к новым рыночным условиям при одинаковых моделях, ресурсных бюджетах и ограничениях по риску?

Более значительные рекурсивные доказательства требуют осторожного измерения. "Стоимость нахождения эффективных улучшений снижается со временем" звучит как естественный стандарт, но она несет в себе два смущения: ранние улучшения часто являются низко висящими плодами, чем дальше, тем они естественно дороже, и рост затрат не может опровергнуть рекурсию; наоборот, снижение затрат также может быть просто результатом того, что рынок вошел в более легкую фазу.

Рынок будет продолжать меняться. Противники будут учиться, старые возможности исчезнут, новые проблемы всегда будут появляться.

Способность, которую NeoTrade надеется установить, заключается в том, чтобы позволить Агенту накапливать проверяемый опыт в этих изменениях, корректировать свои методы и позволять проверенным улучшениям участвовать в следующем цикле обучения.

Join ChainCatcher Official
Telegram Feed: @chaincatcher
X (Twitter): @ChainCatcher_
warnning Предупреждение о рисках
app_icon
ChainCatcher Building the Web3 world with innovations.