BTC $79,422.50 -0.61%
ETH $2,490.76 -0.38%
BNB $744.08 -1.76%
XRP $1.40 -1.38%
SOL $104.91 -1.40%
TRX $0.3362 +0.37%
DOGE $0.0896 -0.22%
ADA $0.2196 -0.63%
BCH $256.20 -1.72%
LINK $13.18 +7.39%
HYPE $87.82 -0.45%
AAVE $133.66 -1.27%
SUI $0.8137 +1.73%
XLM $0.1913 +2.57%
ZEC $1,196.48 +2.41%
BTC $79,422.50 -0.61%
ETH $2,490.76 -0.38%
BNB $744.08 -1.76%
XRP $1.40 -1.38%
SOL $104.91 -1.40%
TRX $0.3362 +0.37%
DOGE $0.0896 -0.22%
ADA $0.2196 -0.63%
BCH $256.20 -1.72%
LINK $13.18 +7.39%
HYPE $87.82 -0.45%
AAVE $133.66 -1.27%
SUI $0.8137 +1.73%
XLM $0.1913 +2.57%
ZEC $1,196.48 +2.41%

NeoTrade:把真实交易反馈转化为可验证的自我改进

核心观点
Summary: 当市场变了,AI 能学会改进自己吗?
行业速递
2026-09-07 18:38:59
当市场变了,AI 能学会改进自己吗?

如果一个 AI 能够全天候盯盘、分析新闻、自动下单,它能否发现:自己正在熟练执行的方法,已经开始失效?

一条曾经领先的信息,如今可能早已被价格消化;一个过去有效的信号,可能因为更多参与者的加入而失去优势。Agent 仍然按时分析、严格=执行,但市场已经变了。

这时,持续运行积累下来的经验,能否帮助它识别问题、调整方法?再进一步,它能否改进自己寻找问题、验证方法的能力,让下一次学习变得更有效?

这些正是 NeoTrade 在持续探索的问题。

市场持续制造新问题,真实交易提供外部反馈,而 NeoTrade 要建立的,是把这些反馈转化为可验证自我改进的机制。

这项探索指向递归式自我改进(即 Recursive Self-Improvement,简称 RSI):让 Agent 在完成任务的过程中,逐步改善自己的工作方式,以及产生下一次改进的能力。

理解这个方向,可以先从今天的 AI 如何工作说起。许多 AI 产品的核心是大语言模型,它通过训练获得语言、知识和推理能力,也能结合当前输入处理新问题。但模型可能生成看似合理却不准确的答案;在通常的使用方式下,一次成功或失败,也不会自动更新它的模型参数,变成持久的新能力。

Agent 则是在模型之外,增加工具、记忆和行动流程,让系统能够围绕目标连续工作。例如,获取市场信息、形成判断、调用交易接口,再检查执行结果。组织这些能力的外层运行系统,就是本文所说的 harness。模型提供基础能力,harness 决定这些能力如何被用于具体任务,以及经验如何被保留、检验和再次使用。

NeoTrade 正在探索的技术方向,是在 Agent harness 层实现递归式自我改进,这是一项需要通过实验逐步验证的研究目标。

交易为这项探索提供了具体的任务,也提供了严苛的检验。

设想一个根据新闻变化参与预测市场的 Agent。它曾经依靠某类信息源发现机会:新闻出现,市场尚未充分反应,Agent 完成分析并执行交易。

一段时间之后,情况发生了变化。更多参与者开始关注同一个信息源,价格反应更快,原有的交易窗口缩短。Agent 仍然按时获取新闻、完成分析、发出订单,但过去有效的方法已经失去了部分价值。

问题可能出在信息到达的时间、判断所需的步骤,也可能出在成交成本。单纯提高执行频率,并不能确定解决其中任何一个问题。

Agent 需要重新检查自己的工作方式:信息是否已经过时?不同报道是否只是转述同一个来源?价格是否已经反映了这些信息?分析带来的预期优势,能否覆盖手续费、滑点和推理成本?

这些问题解释了 NeoTrade 为什么关心自我改进。

市场中的参与者会学习,策略会被复制,流动性会迁移,机会也会随竞争而改变。Andrew Lo 的适应性市场假说,就将竞争、适应和参与者变化作为理解市场效率的重要因素。它提供了一个有用的视角:策略的有效性依赖环境,历史表现需要放回其发生的条件中理解。适应性市场假说

因此,一个长期运行的交易 Agent,既要执行已经验证过的方法,也要识别这些方法何时开始失效,并调整自己的信息来源、判断和执行方式。

"混沌是阶梯"可以作为理解这一过程的比喻:市场中的信息噪声、动态博弈和环境变化,会暴露系统的能力边界。信息失效可以推动来源核验,判断偏差可以推动概率校准,执行损耗可以推动流程优化。

但这种转化有一个前提:Agent 能够区分信号与噪声,并验证变化是否有效。随机性不会自动产生知识,波动也不意味着收益;只有经过检验的经验,才可能成为后续改进的基础。

这种适应能力,是 NeoTrade 探索 RSI 的起点。

这里需要澄清"递归"的含义。根据最近的盈亏调整参数,或者在记忆中增加一条经验,都可能是有用的学习,但还不足以证明 RSI

递归式自我改进要求系统进一步改善自己寻找改进的方法。例如,Agent 发现自己的复盘总是把上涨行情误认为策略有效,于是改进对照方法;又发现自己总会重复测试已经失败的方案,于是改进实验记忆与候选方案筛选。新的研究方法随后参与下一轮改进,使系统更有机会找到有效变化。

 

Agent 改进的不仅是任务表现,也包括产生下一次改进的能力。

这件事对 AI 的意义,超出了交易本身。

部署到真实环境中的 Agent,会遇到训练数据未能充分覆盖的任务、不断变化的工具,以及不同用户的工作习惯。如果每一次环境变化都需要开发者逐项发现问题、重新设计流程,系统的适应速度就会受到人工维护能力的限制。

RSI 这个概念提供了一种值得探索的思路:让系统参与观察自己的失效、提出假设、设计实验和保留有效改进。经过验证的经验可以进入下一轮工作,逐渐减少重复犯错和重复研究的成本。

至于这种能力与更通用的智能之间的关系,NeoTrade 把它当作一个值得探索的开放问题,能否在新环境中发现自身不足、并改进学习方法本身,被一些研究视为衡量 是否实现 AGI 的维度之一(Levels of AGI)。

这项探索已经有一些研究基础。围绕 harness 层的自我改进,现有思路大致可以归为三类:

通过反思和记忆改善行为。 Agent 将任务反馈整理为经验,在后续任务中重新使用。Reflexion 展示了无需更新模型权重、通过语言反馈和记忆改善决策的方式。这是持续学习的重要基础,但单纯积累经验还不等于递归改进。Reflexion

自动优化工作流与上下文组织。 系统尝试调整任务分解、工具调用和 Agent 之间的信息传递。ADAS 探索自动设计 Agent 结构;Recursive Harness Self-Improvement(下称 RHI)则根据历史版本的比较反馈,迭代描述 Agent 运行方式的 harness,并在包括量化金融在内的合成研究任务中进行评估。ADASRHI

修改自身代码,并搜索更好的版本。 SICA Darwin Gödel Machine Agent 修改自己的工具或运行代码,再用任务表现检验候选版本。DGM 进一步保留多个版本和演化分支,让后续改进能够从不同路径继续探索。SICADGM

这些路线说明,即使底层模型保持不变,系统也可能通过改变工作方式提升表现。

NeoTrade 希望在这些研究基础上,进一步建立面向真实交易的持续改进机制。研究任务中的表现提升,要转化为长期运行的交易能力,还需要面对不断变化的市场、真实执行成本和用户授权边界。

NeoTrade 选择市场作为探索环境,看重的是市场能够为这些改进提供外部约束。

在交易中,判断会进入真实的行动链条。Agent 对事件的预测最终能与结果对照;订单是否成交、成交价格如何、等待了多久,都有记录;策略在不同环境下的表现,也可以持续观察。

这些后果不会因为 Agent 写出了一篇更有说服力的复盘,就随之改变。

这让交易成为一种有约束力的检验。系统需要同时处理信息、概率、时间、成本和有限资源。一个逻辑完整的分析,如果总在机会消失之后完成,其实际价值仍然有限;一个方向正确的判断,如果执行成本吞噬了优势,也需要被重新审视。

真实交易由此能够暴露仅靠文本评价不容易发现的问题:判断与行动之间,究竟在哪一步丢失了价值?

不过,外部反馈并不等于清晰答案。

Agent 预测某事件有 70% 的概率发生,最终事件没有发生,不能仅凭这一次结果判定预测错误。同样,一笔盈利也可能来自运气、行情或额外承担的风险。交易数据具有低信噪比,历史研究还容易受到幸存者偏差和过拟合影响;这些也是金融强化学习研究明确指出的困难。FinRL-Meta

好在预测市场的交易,恰好提供了一条比盈亏更快的证据通道。Agent 的每一次决策都以明确的概率形式给出,这让"预测质量"可以用严格适当评分规则(proper scoring rules,如 Brier 分数)和校准曲线来度量:单次"70% 未发生"无法判定对错,但如果一百次标注为 70% 的预测中只有四成发生,偏差就有了明确的统计证据。几十到上百次概率预测就能形成有意义的校准评估,而等待盈亏曲线达到统计显著,往往需要长得多的样本。Proper Scoring Rules

NeoTrade 不承诺获利,也不保证任何策略或 Agent 能够持续盈利。 更完善的学习机制、更准确的判断和更严格的执行,仍然可能伴随交易亏损。RSI 的研究目标是让改进能够被验证,而"改进得到验证"也只意味着它在特定条件和评价范围内获得了证据,不代表未来收益得到保证。

因此,NeoTrade 要解决的关键问题,是如何把结果整理成能够支持改进判断的证据。

这要求系统保留决策时的信息与时间戳、采用的配置和 skill(策略能力包)版本、决策摘要、订单及成交记录,并将它们与后续结果关联起来。只有这样,复盘才有机会区分:问题来自信息质量、概率判断、执行流程,还是原有方法的适用条件已经改变。

评估的次序也随之确定:校准与判断质量的证据来得最快,执行与成本次之;PnL(盈亏)是重要的最终结果,但它最慢、噪声最大,无法独自解释全部过程。

NeoTrade 正在尝试把这套能力建立在 harness 层。具体而言,harness 负责组织记忆、上下文、工具、配置、执行与评估。即使使用同一个底层模型,不同的工作流程也可能带来明显不同的表现。

NeoTrade 的探索主要从几个可迭代的组件开始:

记忆: 将决策证据、结果和失败条件组织成可检索的经验,并保留来源、时间与适用范围。Agent 需要学会什么时候调用经验,也需要识别什么时候旧经验已经不再适用。

Agent config(运行配置): 在授权范围内调整信息源选择、上下文组织、分析步骤和工具调用方式。例如,减少低价值信息的重复处理,把更多研究资源用于真正影响判断的证据。

Skill 对策略方法及其适用条件进行版本化迭代。一个 skill 可以逐步补充信息核验、机会识别、执行检查和失效判断,并通过比较决定是否保留新版本。

这些组件提供了改进的入口。要进一步接近 RSI,系统还需要能够改进它使用这些入口的方法:如何定位问题、如何提出候选变化、如何选择实验,以及如何判断证据是否足够。

NeoTrade 正在探索的方向还包括:

错误归因: 从决策与执行记录中提出可检验的原因假设,识别问题可能出在信息、判断还是执行环节,并持续改善归因方法。

工具生成与代码修改: 针对反复出现的能力缺口,生成或修订数据处理、核验与计算工具,经测试验证后纳入工作流程。

研究资源调度: 在既定预算内,学习何时深入分析、调用更多工具或结束研究,并把评估资源分配给更值得验证的候选改进。

仍以新闻交易为例。Agent 可能发现,多篇看似独立的报道实际来自同一个原始来源,而自己曾将它们当作相互支持的证据。它可以提出一个 harness 修改:在分析前增加来源追溯与去重。

接下来,系统需要验证这项变化。它是否减少了重复计数?是否改善了概率判断?增加的检查时间会不会错过执行窗口?效果是否只存在于用于发现问题的历史样本中?

这些检验不必从真金白银开始:NeoTrade 的第一站是模拟市场环境的影子运行——与现行版本消费同一份实时行情、并行给出决策而不动用资金,通过独立验收后,才进入实盘。

如果改进有效,这个 Agent 才值得保留。进一步地,实验还可能帮助 Agent 改进自己的复盘方法:以后遇到"多来源支持"的判断时,主动检查这些来源是否独立。一次局部修复由此可能形成可复用的研究能力。

"可验证"是这套机制的核心。

NeoTrade 希望每一次候选改进都有明确的问题、可追溯的变更和可比较的结果。研究中需要保留旧版本作为对照,在未参与调优的后续数据与市场环境中检验变化,并同时观察预测质量(以 Brier 分数、校准曲线等适当评分规则度量)、执行可靠性、成本和风险。

所有尝试,包括失败版本,也应进入实验记录。否则,系统只展示筛选后的成功结果,就容易把偶然表现误认为进步。

回测过拟合研究表明,在同一批数据上反复尝试大量方案,会显著增加发现虚假优势的可能性。回测过拟合研究

改进循环本身就是一台候选方案的生成机器。低频风格的实盘样本天然稀少——一个高选择性的 Agent 每周可能只交易几次——而候选 harness 版本的生成几乎没有成本。在小样本上从大量候选中挑选赢家,正是上述虚假优势机制的现场重演。

因此,验证流程需要内置几条对自己的约束:实验预注册,假设、验收指标与样本窗口在实验开始前固定,事后不得更换记分方式;限制同时在测的候选数量,并对多重比较做出校正;用统计功效更高的校准类指标承担日常筛选,让盈亏承担最终验收而不是每轮评比;评估资源向少数高价值候选集中,而不是广撒网。

与此同时,可修改的研究与执行方法,需要与用户授权边界区分开。Agent 可以提出更好的工作方式,但资金权限、可交易范围、风险上限,以及用于判断候选版本是否通过的独立验收约束,不能由它为了获得更高分数而自行放宽。

授权边界之外,自我改进还必须直面一个更隐蔽的对手:针对学习循环本身的攻击。一个会把经验写回记忆、会修订自己 skill 与工具的系统,等于把提示注入(prompt injection)的影响从一次对话延长到了未来的每一轮改进——被污染的一条"经验",会以正常知识的面目参与后续决策。这不是假设的风险:研究者已经展示过,对开源交易 Agent 框架的记忆注入可以诱导真实的链上转账,且注入内容能够跨会话持续存在;也发生过自动化交易 Agent 被注入指令、造成六位数美元损失的真实事件。Real AI Agents with Fake MemoriesAIXBT 事件

因此,学习循环需要自己的防线,而不能只依赖交易环节的风控:外部内容永远作为待分析的数据、而不是待执行的指令进入系统;经验在写入记忆之前经过来源标记、过滤与审计——记忆写入本身被当作攻击面对待;改进候选的提出与验收相互隔离,避免同一段可能被污染的上下文既提出修改、又批准修改;实验与经验记录保持只增不改,使任何异常行为都能回溯到污染源头。催促立即行动、要求放宽风控、自称系统通知的"经验"内容,属于最高优先级的红旗。

这使自我改进成为一项有边界、有记录、防投毒、可以拒绝或回滚的工程过程。

 

NeoTrade 希望推进的创新,集中在把学习、验证和实际运行连接起来。

这一方向的独到之处,体现在几个相互关联的问题上:

持续变化中的有效性: 不只检查一个版本是否优于旧版本,还要识别这种优势何时开始失效,以及系统能否重新适应。适用条件和失效证据,需要与改进一起被保存。

包含真实成本的改进: 将预测、成交、延迟、手续费、滑点和推理开销纳入同一套评估。增加分析步骤可能提高准确性,也可能让交易错过时机;改进需要接受完整执行链条的检验。

有授权边界的自我修改: 将可演化的研究与执行方法,同独立风控、验收机制和学习循环的注入防护结合,让 Agent 能够尝试新方法,同时保持权限可审计、变更可撤回、经验可溯源。

面向具体用户的长期适应: 在本地运行和用户掌控数据的设计下,探索适合不同市场范围、研究预算和风险要求的 harness。通用经验如何迁移、个体经验何时有效,都需要被验证。

这些组合带来了值得研究的新问题,也构成 NeoTrade 希望形成的工程与产品贡献。它们的价值需要由实际运行和对照实验建立。

随着这项探索推进,NeoTrade 需要回答一个具体问题:在相同模型、资源预算和风险约束下,一个能够改进自身 harness Agent,能否更可靠地适应新的市场环境?

更有分量的递归证据,则要小心度量。"找到有效改进的成本随时间下降"听上去是自然的标准,但它带着两个混淆:早期改进多是低垂的果实,越往后天然越贵,成本上升并不能证伪递归;反过来,成本下降也可能只是市场恰好进入了更容易的阶段。

市场会继续变化。对手会学习,旧机会会消失,新的问题总会出现。

NeoTrade 希望建立的能力,是让 Agent 在这些变化中积累可检验的经验,修正自己的方法,并让经过验证的改进参与下一轮学习。

欢迎加入 ChainCatcher 官方社群
Telegram 订阅: @chaincatcher
X (Twitter): @ChainCatcher_
warnning 风险提示
app_icon
ChainCatcher 与创新者共建Web3世界